Anthropic, OpenAI et Google DeepMind ont livré 4 modèles de classe frontière en 30 jours. Claude Fable 5.1 est arrivé le 1er septembre. GPT-6 Astra a suivi le 3 septembre. GPT-6.1 Sol et Gemini 4 Argon ont débarqué dans les derniers jours de septembre.
Nous avons couvert chaque lancement séparément. Cet article les met côte à côte. Les scores des benchmarks se chevauchent davantage que ce que suggèrent les annonces de lancement. Les prix, les règles d'accès et le coût par tâche ne le font pas.
Un changement structure la gamme. OpenAI a annulé GPT-6.1 Astra le 28 septembre après l'échec de ses tests internes de périmètre et d'autorisation. GPT-6 Astra reste pour l'instant le modèle phare d'OpenAI.
Caractéristiques, tarifs et accès
Astra et Fable 5.1 partagent le même prix catalogue de 10 $ en entrée et 50 $ en sortie. Sol et Argon sont affichés au cinquième de ce prix. Le prix d'Argon est promotionnel et double ensuite.
| Fonctionnalité | GPT-6 Astra | GPT-6.1 Sol | Gemini 4 Argon | Claude Fable 5.1 |
|---|---|---|---|---|
| Développeur | OpenAI | OpenAI | Google DeepMind | Anthropic |
| Date de sortie | 3 sept. 2026 | 29 sept. 2026 | Annoncé le 30 sept. 2026 | 1er septembre 2026 |
| Accès | OpenAI API, ChatGPT, Codex | OpenAI API, ChatGPT Work, Codex | Programme Fairwind uniquement | Claude API, Bedrock, Google Cloud, Microsoft Foundry |
| Entrée / sortie (par 1M) | $10 / $50 | $2 / $10 | 2 $ / 10 $ en introduction, puis 4 $ / 20 $ | $10 / $50 |
| Entrée en cache (par 1M) | $1.00 | $0.10 | 0,10 $ en introduction | $0.25 |
| Tarification des longs prompts | Au-dessus de 272K : 20 $ / 75 $ | Au-dessus de 272K : entrée 2x, sortie 1,5x | Non divulgué | Forfait jusqu'à 1M |
| Fenêtre de contexte | 1,05M | 1,05M | Non divulgué | 1M |
| Sortie maximale par réponse | 128K | 128K | 1M | 128K |
| Contrôle du raisonnement | 5 niveaux d'effort, de bas à max | 5 niveaux d'effort, de bas à max | Non divulgué | Niveaux d'effort incluant low, medium, high |
| Poids ouverts | Non | Non | Non | Non |
Sources : Couverture d'OpenAI GPT-6.1 Sol, Couverture de Gemini 4 Argon, Tarification long contexte de GPT-6 Astra, Spécifications de Claude Fable 5.1. Prix publics standard de premier parti, palier de contexte court.
La ligne des entrées en cache compte le plus pour les agents. Les agents renvoient les prompts système, les schémas d'outils et l'historique à chaque étape. La lecture de cache d'Astra à 1,00 $ est 4x celle de Fable 5.1 et 10x celle de Sol.
Le plafond de sortie de 1M d'Argon est la seule exception structurelle. Les 3 autres s'arrêtent à 128K tokens par réponse.
Benchmarks : là où chaque modèle excelle
Aucun modèle ne rafle tout. Argon domine les lignes du travail cognitif et du codage à long horizon. Astra domine l'ingénierie logicielle de pointe et l'utilisation de l'ordinateur. Opus 5.5, absent de cette sélection, domine Terminal-Bench 4.0.
| Benchmark | Ce qu'il teste | Gemini 4 Argon | GPT-6 Astra | Claude Fable 5.1 |
|---|---|---|---|---|
| DeepSWE v1.1 | Ingénierie logicielle à long horizon | 77.9% | 74.1% | 67.4% |
| Vals Index | Travail en finance, programmation, droit et fiscalité | 68.9% | 63.1% | 65.8% |
| FrontierSWE v2 | Ingénierie logicielle de pointe | 55.0% | 65.5% | 56.3% |
| Terminal-Bench 4.0 | Travail agentique dans un terminal | 57.4% | 58.2% | 57.9% |
| CWE-bench v1 | Correction de vulnérabilités | 68% (ex æquo) | 68% (ex æquo) | 58% |
| OSWorld-2.0 | Utilisation de l'ordinateur | 69.2% | 72.6% | Absent du tableau de Google |
Source : la comparaison publiée par Google DeepMind, telle que rapportée dans notre couverture de Gemini 4 Argon. Chiffres communiqués par le fournisseur.
GPT-6.1 Sol n'apparaît pas dans le tableau de Google. Les chiffres d'OpenAI eux-mêmes le placent proche d'Astra :
- DeepSWE v1.1 : Sol égale Astra pour environ un cinquième du coût.
- Ensemble hors ligne OSWorld 2.0 : Sol se situe à 2.1 points d'Astra pour environ un septième du coût par tâche.
- AutomationBench 1.0.6 : Sol obtient 2.2 points de plus que Claude Opus 5.5 à effort moyen.
- Terminal-Bench Science 0.1 : Astra reste en tête à 68.1 %. OpenAI recommande Astra pour la recherche la plus difficile.
Les signaux indépendants indiquent le contraire en matière d'intelligence brute. Sur l' Artificial Analysis Intelligence Index, Astra obtient 61. Fable 5.1 obtient 5 points de plus. Sur son index d'agents de codage, Fable 5.1 dans Claude Code obtient 70 contre 67 pour Astra. Artificial Analysis rapporte également qu'Argon égale Astra sur l'Intelligence Index.
Sur ARC-AGI-2, Astra obtient 95 % et Fable 5.1 obtient 90 %.
Coût par tâche : même prix catalogue, facture différente
Artificial Analysis évalue Claude Fable 5.1 à 9.18 $ par tâche, contre 4.72 $ pour GPT-6 Astra. Cela représente environ 1.9x, à prix catalogues identiques.
L'écart provient du volume de tokens, pas des tarifs. Le coût par tâche multiplie le prix par les tokens dépensés. À tarifs égaux, l'écart implique que Fable 5.1 a dépensé plus de tokens par tâche lors de cette exécution. Anthropic note également que son nouveau tokenizer produit environ 30 % de tokens en plus pour le même texte.
Les deux modèles moins chers changent davantage la donne :
- Gemini 4 Argon : Artificial Analysis rapporte qu'Argon égale l'Intelligence Index d'Astra à 60 % du coût par tâche d'Astra, en utilisant les prix de lancement.
- GPT-6.1 Sol : Sur Terminal-Bench Science, OpenAI rapporte 5.47 $ par tâche pour Sol contre 23.80 $ pour Astra.
Le caching peut inverser le classement pour les agents. Les chiffres par tâche ci-dessus ne modélisent pas une forte réutilisation du cache. Un agent de longue durée relit le même contexte à chaque étape. Voici le calcul pour un contexte en cache de 200K tokens, avant les tokens de sortie :
| Modèle | Tarif en cache (par 1M) | Par étape | Par 100 étapes |
|---|---|---|---|
| GPT-6 Astra | $1.00 | $0.20 | $20.00 |
| Claude Fable 5.1 | $0.25 | $0.05 | $5.00 |
| GPT-6.1 Sol | $0.10 | $0.02 | $2.00 |
| Gemini 4 Argon (lancement) | $0.10 | $0.02 | $2.00 |
Calcul illustratif à partir des tarifs de cache des listes. Le contexte de 200K d'Astra reste sous son seuil de long prompt de 272K.
Dans les boucles gourmandes en cache, Fable 5.1 lit le contexte au quart du tarif d'Astra. Mesurez les deux sur vos propres traces avant de trancher sur les gros titres par tâche.
Quel modèle pour quel travail
Choisissez selon la charge de travail, pas selon le classement. GPT-6.1 Sol est le choix par défaut pour la plupart des équipes. Les 3 autres justifient leur prix sur des travaux plus étroits.
| Travail | Choix | Pourquoi | Second choix |
|---|---|---|---|
| Agents de codage à haut volume, bots CI, revue de PR | GPT-6.1 Sol | Égale Astra sur DeepSWE v1.1 à 2 $ / 10 $ et 0,10 $ en cache | Gemini 4 Argon, une fois public |
| Ingénierie ouverte la plus difficile | GPT-6 Astra | Domine FrontierSWE v2 à 65,5 % | Claude Fable 5.1 |
| Utilisation de l'ordinateur et agents de navigateur | GPT-6 Astra | Domine OSWorld-2.0 à 72,6 % | GPT-6.1 Sol, à 2,1 points |
| Longues sessions de codage dans un harnais | Claude Fable 5.1 | Meilleur score (70) de l'indice des agents de codage d'Artificial Analysis dans Claude Code ; 0,25 $ pour les lectures de cache | GPT-6 Astra (67) |
| Science fondamentale et recherche | GPT-6 Astra | En tête du Terminal-Bench Science à 68,1 % | GPT-6.1 Sol à 5,47 $ par tâche |
| Automatisation juridique, financière et commerciale | Gemini 4 Argon | En tête du Vals Index (68,9 %), de l'AutomationBench (51,3 %) et du Harvey Legal (19,6 %) | GPT-6.1 Sol ; Claude Fable 5.1 |
| Très longues sorties uniques : grandes refactorisations, rapports complets | Gemini 4 Argon | Seul modèle avec 1M de tokens de sortie par réponse | N'importe lequel des 3 autres, réparti sur plusieurs tours |
| Détection et correction de vulnérabilités | Gemini 4 Argon ou GPT-6 Astra | À égalité à 68 % sur CWE-bench v1 | Claude Fable 5.1 (58 %) |
| Budget le plus serré à qualité frontier | GPT-6.1 Sol | Prix public le plus bas ; Argon ne l'égale qu'au sein de Fairwind | Gemini 4 Argon |
L'accès décide de 2 de ces lignes. Argon n'est aujourd'hui disponible qu'aux défenseurs cyber de Fairwind. La capacité offensive-sécurité complète d'Astra se trouve derrière le programme Daybreak d'OpenAI ; la version publique refuse les tâches cyber offensives avancées. Anthropic conditionne son jumeau sans restrictions, Claude Mythos 5.1, à des programmes d'accès de confiance.
Ce qu'il faut vérifier avant de changer
La plupart des chiffres ici sont communiqués par les fournisseurs, et ceux-ci divergent à la marge. OpenAI annonce Astra à 57,9 % sur le Terminal-Bench 4.0. Le tableau comparatif de Google indique 58,2 %.
- Les garde-fous affectent les scores de Fable 5.1: Anthropic a exécuté ses benchmarks avec les garde-fous de production activés. Les tâches cyber et de biologie signalées sont redirigées vers d'autres modèles Claude, ce qui a probablement abaissé les résultats OSWorld et AutomationBench.
- La tarification d'Argon est temporaire: 2 $ / 10 $ est un tarif de lancement. Il passera à 4 $ / 20 $ plus tard, sans date de fin annoncée.
- La fenêtre de contexte d'Argon n'est pas divulguée: Google a publié le plafond de sortie de 1M mais pas la limite d'entrée.
- Les coûts par tâche sont un instantané: Les chiffres de 9.18 $ et 4.72 $ proviennent de la run Astra de début septembre d'Artificial Analysis. Les paramètres d'effort les font beaucoup varier.
- Anthropic propose une option moins chère: Notre couverture d'Argon cite des rapports indiquant que Claude Opus 5.5 surpasse Fable 5.1 sur les benchmarks agentiques clés à un prix d'API inférieur. Il mène également Terminal-Bench 4.0 à 66.4 %.
Points clés à retenir
- GPT-6.1 Sol égale Astra sur DeepSWE v1.1 pour un cinquième du prix.
- GPT-6 Astra mène sur FrontierSWE v2 (65.5 %) et OSWorld-2.0 (72.6 %).
- Gemini 4 Argon domine DeepSWE, Vals Index et AutomationBench, mais uniquement au sein de Fairwind.
- Fable 5.1 coûte 9,18 $ par tâche contre 4,72 $ pour Astra, à prix catalogue égal.
- Pour les agents fortement dépendants du cache, la lecture de cache de Fable 5.1 à 0,25 $ est 4x moins chère que celle d'Astra à 1,00 $.
FAQ
- Lequel est le moins cher ? GPT-6.1 Sol, à 2 $ en entrée, 10 $ en sortie et 0,10 $ en cache par 1M de tokens. Argon égale ce tarif uniquement au prix de lancement, au sein de Fairwind.
- Lequel est le meilleur pour le code ? Sol pour le volume. Astra pour les tâches les plus difficiles. Fable 5.1 arrive en tête de l'index d'agents de code d'Artificial Analysis dans Claude Code.
- Puis-je utiliser Gemini 4 Argon dès aujourd'hui ? Uniquement via le programme Fairwind de Google destiné aux défenseurs en cybersécurité.
L'article GPT-6 Astra vs GPT-6.1 Sol vs Gemini 4 Argon vs Claude Fable 5.1 : quel modèle de pointe pour quel travail est apparu en premier sur MarkTechPost.