MarkTechPost

GPT-6 Astra vs GPT-6.1 Sol vs Gemini 4 Argon vs Claude Fable 5.1 : quel modèle de pointe pour quel usage

Astra domine l'usage de l'ordinateur, Argon domine le travail juridique et financier, et Sol gagne sur le prix pour les agents de codage. L'article GPT-6 Astra vs GPT-6.1 Sol vs Gemini 4 Argon vs Claude Fable 5.1 : quel…

Anthropic, OpenAI et Google DeepMind ont livré 4 modèles de classe frontière en 30 jours. Claude Fable 5.1 est arrivé le 1er septembre. GPT-6 Astra a suivi le 3 septembre. GPT-6.1 Sol et Gemini 4 Argon ont débarqué dans les derniers jours de septembre.

Nous avons couvert chaque lancement séparément. Cet article les met côte à côte. Les scores des benchmarks se chevauchent davantage que ce que suggèrent les annonces de lancement. Les prix, les règles d'accès et le coût par tâche ne le font pas.

Un changement structure la gamme. OpenAI a annulé GPT-6.1 Astra le 28 septembre après l'échec de ses tests internes de périmètre et d'autorisation. GPT-6 Astra reste pour l'instant le modèle phare d'OpenAI.

Caractéristiques, tarifs et accès

Astra et Fable 5.1 partagent le même prix catalogue de 10 $ en entrée et 50 $ en sortie. Sol et Argon sont affichés au cinquième de ce prix. Le prix d'Argon est promotionnel et double ensuite.

FonctionnalitéGPT-6 AstraGPT-6.1 SolGemini 4 ArgonClaude Fable 5.1
DéveloppeurOpenAIOpenAIGoogle DeepMindAnthropic
Date de sortie3 sept. 202629 sept. 2026Annoncé le 30 sept. 20261er septembre 2026
AccèsOpenAI API, ChatGPT, CodexOpenAI API, ChatGPT Work, CodexProgramme Fairwind uniquementClaude API, Bedrock, Google Cloud, Microsoft Foundry
Entrée / sortie (par 1M)$10 / $50$2 / $102 $ / 10 $ en introduction, puis 4 $ / 20 $$10 / $50
Entrée en cache (par 1M)$1.00$0.100,10 $ en introduction$0.25
Tarification des longs promptsAu-dessus de 272K : 20 $ / 75 $Au-dessus de 272K : entrée 2x, sortie 1,5xNon divulguéForfait jusqu'à 1M
Fenêtre de contexte1,05M1,05MNon divulgué1M
Sortie maximale par réponse128K128K1M128K
Contrôle du raisonnement5 niveaux d'effort, de bas à max5 niveaux d'effort, de bas à maxNon divulguéNiveaux d'effort incluant low, medium, high
Poids ouvertsNonNonNonNon

Sources : Couverture d'OpenAI GPT-6.1 Sol, Couverture de Gemini 4 Argon, Tarification long contexte de GPT-6 Astra, Spécifications de Claude Fable 5.1. Prix publics standard de premier parti, palier de contexte court.

La ligne des entrées en cache compte le plus pour les agents. Les agents renvoient les prompts système, les schémas d'outils et l'historique à chaque étape. La lecture de cache d'Astra à 1,00 $ est 4x celle de Fable 5.1 et 10x celle de Sol.

Le plafond de sortie de 1M d'Argon est la seule exception structurelle. Les 3 autres s'arrêtent à 128K tokens par réponse.

Benchmarks : là où chaque modèle excelle

Aucun modèle ne rafle tout. Argon domine les lignes du travail cognitif et du codage à long horizon. Astra domine l'ingénierie logicielle de pointe et l'utilisation de l'ordinateur. Opus 5.5, absent de cette sélection, domine Terminal-Bench 4.0.

BenchmarkCe qu'il testeGemini 4 ArgonGPT-6 AstraClaude Fable 5.1
DeepSWE v1.1Ingénierie logicielle à long horizon77.9%74.1%67.4%
Vals IndexTravail en finance, programmation, droit et fiscalité68.9%63.1%65.8%
FrontierSWE v2Ingénierie logicielle de pointe55.0%65.5%56.3%
Terminal-Bench 4.0Travail agentique dans un terminal57.4%58.2%57.9%
CWE-bench v1Correction de vulnérabilités68% (ex æquo)68% (ex æquo)58%
OSWorld-2.0Utilisation de l'ordinateur69.2%72.6%Absent du tableau de Google

Source : la comparaison publiée par Google DeepMind, telle que rapportée dans notre couverture de Gemini 4 Argon. Chiffres communiqués par le fournisseur.

GPT-6.1 Sol n'apparaît pas dans le tableau de Google. Les chiffres d'OpenAI eux-mêmes le placent proche d'Astra :

  • DeepSWE v1.1 : Sol égale Astra pour environ un cinquième du coût.
  • Ensemble hors ligne OSWorld 2.0 : Sol se situe à 2.1 points d'Astra pour environ un septième du coût par tâche.
  • AutomationBench 1.0.6 : Sol obtient 2.2 points de plus que Claude Opus 5.5 à effort moyen.
  • Terminal-Bench Science 0.1 : Astra reste en tête à 68.1 %. OpenAI recommande Astra pour la recherche la plus difficile.

Les signaux indépendants indiquent le contraire en matière d'intelligence brute. Sur l' Artificial Analysis Intelligence Index, Astra obtient 61. Fable 5.1 obtient 5 points de plus. Sur son index d'agents de codage, Fable 5.1 dans Claude Code obtient 70 contre 67 pour Astra. Artificial Analysis rapporte également qu'Argon égale Astra sur l'Intelligence Index.

Sur ARC-AGI-2, Astra obtient 95 % et Fable 5.1 obtient 90 %.

Coût par tâche : même prix catalogue, facture différente

Artificial Analysis évalue Claude Fable 5.1 à 9.18 $ par tâche, contre 4.72 $ pour GPT-6 Astra. Cela représente environ 1.9x, à prix catalogues identiques.

L'écart provient du volume de tokens, pas des tarifs. Le coût par tâche multiplie le prix par les tokens dépensés. À tarifs égaux, l'écart implique que Fable 5.1 a dépensé plus de tokens par tâche lors de cette exécution. Anthropic note également que son nouveau tokenizer produit environ 30 % de tokens en plus pour le même texte.

Les deux modèles moins chers changent davantage la donne :

  • Gemini 4 Argon : Artificial Analysis rapporte qu'Argon égale l'Intelligence Index d'Astra à 60 % du coût par tâche d'Astra, en utilisant les prix de lancement.
  • GPT-6.1 Sol : Sur Terminal-Bench Science, OpenAI rapporte 5.47 $ par tâche pour Sol contre 23.80 $ pour Astra.

Le caching peut inverser le classement pour les agents. Les chiffres par tâche ci-dessus ne modélisent pas une forte réutilisation du cache. Un agent de longue durée relit le même contexte à chaque étape. Voici le calcul pour un contexte en cache de 200K tokens, avant les tokens de sortie :

ModèleTarif en cache (par 1M)Par étapePar 100 étapes
GPT-6 Astra$1.00$0.20$20.00
Claude Fable 5.1$0.25$0.05$5.00
GPT-6.1 Sol$0.10$0.02$2.00
Gemini 4 Argon (lancement)$0.10$0.02$2.00

Calcul illustratif à partir des tarifs de cache des listes. Le contexte de 200K d'Astra reste sous son seuil de long prompt de 272K.

Dans les boucles gourmandes en cache, Fable 5.1 lit le contexte au quart du tarif d'Astra. Mesurez les deux sur vos propres traces avant de trancher sur les gros titres par tâche.

Quel modèle pour quel travail

Choisissez selon la charge de travail, pas selon le classement. GPT-6.1 Sol est le choix par défaut pour la plupart des équipes. Les 3 autres justifient leur prix sur des travaux plus étroits.

TravailChoixPourquoiSecond choix
Agents de codage à haut volume, bots CI, revue de PRGPT-6.1 SolÉgale Astra sur DeepSWE v1.1 à 2 $ / 10 $ et 0,10 $ en cacheGemini 4 Argon, une fois public
Ingénierie ouverte la plus difficileGPT-6 AstraDomine FrontierSWE v2 à 65,5 %Claude Fable 5.1
Utilisation de l'ordinateur et agents de navigateurGPT-6 AstraDomine OSWorld-2.0 à 72,6 %GPT-6.1 Sol, à 2,1 points
Longues sessions de codage dans un harnaisClaude Fable 5.1Meilleur score (70) de l'indice des agents de codage d'Artificial Analysis dans Claude Code ; 0,25 $ pour les lectures de cacheGPT-6 Astra (67)
Science fondamentale et rechercheGPT-6 AstraEn tête du Terminal-Bench Science à 68,1 %GPT-6.1 Sol à 5,47 $ par tâche
Automatisation juridique, financière et commercialeGemini 4 ArgonEn tête du Vals Index (68,9 %), de l'AutomationBench (51,3 %) et du Harvey Legal (19,6 %)GPT-6.1 Sol ; Claude Fable 5.1
Très longues sorties uniques : grandes refactorisations, rapports completsGemini 4 ArgonSeul modèle avec 1M de tokens de sortie par réponseN'importe lequel des 3 autres, réparti sur plusieurs tours
Détection et correction de vulnérabilitésGemini 4 Argon ou GPT-6 AstraÀ égalité à 68 % sur CWE-bench v1Claude Fable 5.1 (58 %)
Budget le plus serré à qualité frontierGPT-6.1 SolPrix public le plus bas ; Argon ne l'égale qu'au sein de FairwindGemini 4 Argon

L'accès décide de 2 de ces lignes. Argon n'est aujourd'hui disponible qu'aux défenseurs cyber de Fairwind. La capacité offensive-sécurité complète d'Astra se trouve derrière le programme Daybreak d'OpenAI ; la version publique refuse les tâches cyber offensives avancées. Anthropic conditionne son jumeau sans restrictions, Claude Mythos 5.1, à des programmes d'accès de confiance.

Ce qu'il faut vérifier avant de changer

La plupart des chiffres ici sont communiqués par les fournisseurs, et ceux-ci divergent à la marge. OpenAI annonce Astra à 57,9 % sur le Terminal-Bench 4.0. Le tableau comparatif de Google indique 58,2 %.

  • Les garde-fous affectent les scores de Fable 5.1: Anthropic a exécuté ses benchmarks avec les garde-fous de production activés. Les tâches cyber et de biologie signalées sont redirigées vers d'autres modèles Claude, ce qui a probablement abaissé les résultats OSWorld et AutomationBench.
  • La tarification d'Argon est temporaire: 2 $ / 10 $ est un tarif de lancement. Il passera à 4 $ / 20 $ plus tard, sans date de fin annoncée.
  • La fenêtre de contexte d'Argon n'est pas divulguée: Google a publié le plafond de sortie de 1M mais pas la limite d'entrée.
  • Les coûts par tâche sont un instantané: Les chiffres de 9.18 $ et 4.72 $ proviennent de la run Astra de début septembre d'Artificial Analysis. Les paramètres d'effort les font beaucoup varier.
  • Anthropic propose une option moins chère: Notre couverture d'Argon cite des rapports indiquant que Claude Opus 5.5 surpasse Fable 5.1 sur les benchmarks agentiques clés à un prix d'API inférieur. Il mène également Terminal-Bench 4.0 à 66.4 %.

Points clés à retenir

  • GPT-6.1 Sol égale Astra sur DeepSWE v1.1 pour un cinquième du prix.
  • GPT-6 Astra mène sur FrontierSWE v2 (65.5 %) et OSWorld-2.0 (72.6 %).
  • Gemini 4 Argon domine DeepSWE, Vals Index et AutomationBench, mais uniquement au sein de Fairwind.
  • Fable 5.1 coûte 9,18 $ par tâche contre 4,72 $ pour Astra, à prix catalogue égal.
  • Pour les agents fortement dépendants du cache, la lecture de cache de Fable 5.1 à 0,25 $ est 4x moins chère que celle d'Astra à 1,00 $.

FAQ

  • Lequel est le moins cher ? GPT-6.1 Sol, à 2 $ en entrée, 10 $ en sortie et 0,10 $ en cache par 1M de tokens. Argon égale ce tarif uniquement au prix de lancement, au sein de Fairwind.
  • Lequel est le meilleur pour le code ? Sol pour le volume. Astra pour les tâches les plus difficiles. Fable 5.1 arrive en tête de l'index d'agents de code d'Artificial Analysis dans Claude Code.
  • Puis-je utiliser Gemini 4 Argon dès aujourd'hui ? Uniquement via le programme Fairwind de Google destiné aux défenseurs en cybersécurité.

L'article GPT-6 Astra vs GPT-6.1 Sol vs Gemini 4 Argon vs Claude Fable 5.1 : quel modèle de pointe pour quel travail est apparu en premier sur MarkTechPost.

Source originale

MarkTechPost

À propos du contenu

La publication originale et les droits appartiennent à la source.

Traduction automatique · Consultez l’original