Anthropic、OpenAI、Google DeepMindの3社が、30日以内に4つのフロンティアクラスのモデルをリリースしました。 Claude Fable 5.1 は9月1日に登場しました。 GPT-6 Astra は9月3日に続きました。 GPT-6.1 Sol と Gemini 4 Argon は9月の最後の数日に登場しました。
私たちはそれぞれのローンチを個別に取り上げました。本稿ではこれらを並べて比較します。ベンチマークスコアはローンチ記事が示唆する以上に重なり合っています。しかし、価格、アクセスルール、タスクあたりのコストはそうではありません。
このラインナップを特徴づける一つの変化があります。OpenAIは、内部のスコープおよび認可テストに失敗したため、9月28日に GPT-6.1 Astra 9月28日、内部のスコープおよび認可テストに合格しなかったためです。当面はGPT-6 AstraがOpenAIの最上位モデルのままです。
仕様、価格、アクセス
AstraとFable 5.1は、同じく入力10ドル、出力50ドルという公式価格を共有しています。SolとArgonはその5分の1の価格です。Argonの価格は導入価格であり、後で2倍になります。
| 項目 | GPT-6 Astra | GPT-6.1 Sol | Gemini 4 Argon | Claude Fable 5.1 |
|---|---|---|---|---|
| 開発元 | OpenAI | OpenAI | Google DeepMind | Anthropic |
| リリース日 | 2026年9月3日 | 2026年9月29日 | 2026年9月30日発表 | 2026年9月1日 |
| アクセス | OpenAI API、ChatGPT、Codex | OpenAI API、ChatGPT Work、Codex | Fairwindプログラム限定 | Claude API、Bedrock、Google Cloud、Microsoft Foundry |
| 入力 / 出力(1Mあたり) | $10 / $50 | $2 / $10 | 導入価格は $2 / $10、その後 $4 / $20 | $10 / $50 |
| キャッシュ入力(1Mあたり) | $1.00 | $0.10 | 導入価格 $0.10 | $0.25 |
| 長プロンプト料金 | 272K超: $20 / $75 | 272K超: 入力2倍、出力1.5倍 | 非公開 | 1Mまで一律 |
| コンテキストウィンドウ | 1.05M | 1.05M | 非公開 | 1M |
| 1レスポンスあたりの最大出力 | 128K | 128K | 1M | 128K |
| 推論制御 | lowからmaxまでの5段階のeffortレベル | lowからmaxまでの5段階のeffortレベル | 非公開 | low、medium、highなどを含むeffortレベル |
| オープンウェイト | いいえ | いいえ | いいえ | いいえ |
出典: OpenAI GPT-6.1 Solの解説, Gemini 4 Argonの解説, GPT-6 Astraの長コンテキスト料金, Claude Fable 5.1の仕様。いずれも一次提供元の標準リスト価格、短コンテキスト階層です。
キャッシュ入力の行はエージェントにとって最も重要です。エージェントは毎ステップでシステムプロンプト、ツールスキーマ、履歴を再送信します。Astraの$1.00のキャッシュ読み取りは、Fable 5.1の4倍、Solの10倍です。
Argonの1Mという出力上限だけが構造上の外れ値です。他の3モデルは1回の応答につき128Kトークンで頭打ちになります。
ベンチマーク:各モデルがリードする分野
どのモデルもすべてを制覇してはいません。Argonはナレッジワークと長期コーディングの行で首位です。Astraはフロンティアのソフトウェアエンジニアリングとコンピュータ操作で首位です。このラインナップには含まれていないOpus 5.5が、Terminal-Bench 4.0で首位です。
| ベンチマーク | テスト内容 | Gemini 4 Argon | GPT-6 Astra | Claude Fable 5.1 |
|---|---|---|---|---|
| DeepSWE v1.1 | 長期視点のソフトウェアエンジニアリング | 77.9% | 74.1% | 67.4% |
| Vals Index | 金融、コーディング、法務、税務業務 | 68.9% | 63.1% | 65.8% |
| FrontierSWE v2 | フロンティア系ソフトウェアエンジニアリング | 55.0% | 65.5% | 56.3% |
| Terminal-Bench 4.0 | ターミナルでのエージェント型作業 | 57.4% | 58.2% | 57.9% |
| CWE-bench v1 | 脆弱性の修正対応 | 68% (同点) | 68% (同点) | 58% |
| OSWorld-2.0 | コンピュータ操作 | 69.2% | 72.6% | Googleの表には未掲載 |
出典: Google DeepMindが公開した比較。当社の報道による Gemini 4 Argonの関連記事。ベンダー公表値。
GPT-6.1 SolはGoogleの表には掲載されていない。 OpenAI自身の数値では、Astraに近い水準とされる:
- DeepSWE v1.1: SolはAstraと同等の性能を、約5分の1のコストで達成している。
- OSWorld 2.0 オフラインセット: SolはAstraとの差が2.1ポイント以内で、タスクあたりのコストは約7分の1である。
- AutomationBench 1.0.6: Solはmedium effort設定でClaude Opus 5.5を2.2ポイント上回った。
- Terminal-Bench Science 0.1: Astraは依然として68.1%で首位です。OpenAIは最も困難な研究にはAstraを推奨しています。
独立系のシグナルは、生の知性については逆の方向を示しています。 「 Artificial Analysis Intelligence Index」では、Astraは61を獲得。Fable 5.1は5ポイント上回っています。同社のコーディングエージェント指数では、Claude Code上のFable 5.1が70で、Astraの67を上回ります。Artificial Analysisはさらに、ArgonがIntelligence IndexでAstraに匹敵すると報告しています。
ARC-AGI-2では、Astraは95%、Fable 5.1は90%を獲得しています。
タスクあたりコスト: 同一の定価、異なる請求額
Artificial AnalysisはClaude Fable 5.1をタスクあたり$9.18とし、GPT-6 Astraは$4.72としています。同一の定価でありながら、約1.9倍の差です。
この差は単価ではなくトークン量によるものです。タスクあたりコストは価格に消費トークン数を掛けたものです。単価が同じである以上、この差はFable 5.1がその実行でタスクあたりより多くのトークンを消費したことを意味します。Anthropicはまた、新しいトークナイザーが同じテキストに対して約30%多くのトークンを生成すると述べています。
この2つのより安価なモデルが、状況をさらに変えます。
- Gemini 4 Argon: Artificial Analysisは、導入価格を用いて、ArgonがタスクあたりコストでAstraの60%でIntelligence IndexにおいてAstraに匹敵すると報告しています。
- GPT-6.1 Sol: Terminal-Bench Scienceにおいて、OpenAIはSolをタスクあたり$5.47、Astraを$23.80と報告しています。
キャッシュはエージェントにとってのランキングを逆転させることがあります。 上記のタスクあたりの数値には、大量のキャッシュ再利用は考慮されていません。長時間動作するエージェントは、毎ステップで同じコンテキストを再読み込みします。200Kトークンのキャッシュ済みコンテキストについて、出力トークンを除く計算は以下の通りです:
| モデル | キャッシュレート(1Mあたり) | 1ステップあたり | 100ステップあたり |
|---|---|---|---|
| GPT-6 Astra | $1.00 | $0.20 | $20.00 |
| Claude Fable 5.1 | $0.25 | $0.05 | $5.00 |
| GPT-6.1 Sol | $0.10 | $0.02 | $2.00 |
| Gemini 4 Argon(発表時) | $0.10 | $0.02 | $2.00 |
公表されているキャッシュレートに基づく試算。Astraの200Kコンテキストは、272Kの長文プロンプト閾値を下回ったままです。
キャッシュ多用型のループでは、Fable 5.1はAstraの4分の1のレートでコンテキストを読み込みます。タスクあたりの見出しだけで選ぶ前に、ご自身のトレースで両者を計測してください。
どの仕事にどのモデルを
リーダーボードの順位ではなく、ワークロードに基づいて選びましょう。GPT-6.1 Solはほとんどのチームにとってのデフォルトです。残りの3モデルは、より狭い仕事においてその価格に見合う価値を発揮します。
| 仕事 | 選択 | 理由 | 次点 |
|---|---|---|---|
| 大量処理のコーディングエージェント、CIボット、PRレビュー | GPT-6.1 Sol | DeepSWE v1.1でAstraに匹敵し、$2 / $10、キャッシュ時$0.10 | Gemini 4 Argon(公開後) |
| 最も難しいオープンエンドなエンジニアリング | GPT-6 Astra | FrontierSWE v2で65.5%の首位 | Claude Fable 5.1 |
| コンピュータ利用およびブラウザエージェント | GPT-6 Astra | OSWorld-2.0で72.6%の首位 | GPT-6.1 Sol(2.1ポイント差) |
| ハーネス内での長時間コーディングセッション | Claude Fable 5.1 | Claude CodeにおけるArtificial Analysisのコーディングエージェントスコア最高値(70)、キャッシュ読み取りは$0.25 | GPT-6 Astra(67) |
| ハードサイエンスおよび研究 | GPT-6 Astra | Terminal-Bench Scienceで68.1%の首位 | GPT-6.1 Sol(タスクあたり5.47ドル) |
| 法務・金融・ビジネス自動化 | Gemini 4 Argon | Vals Index(68.9%)、AutomationBench(51.3%)、Harvey Legal(19.6%)で首位 | GPT-6.1 Sol、Claude Fable 5.1 |
| 非常に長い単一出力:大規模リファクタリング、完全なレポート | Gemini 4 Argon | 1レスポンスあたり1M出力トークンに対応する唯一のモデル | 他の3モデルのいずれか(複数ターンに分割) |
| 脆弱性の発見とパッチ適用 | Gemini 4 ArgonまたはGPT-6 Astra | CWE-bench v1で68%で同率首位 | Claude Fable 5.1(58%) |
| フロンティア品質で最も厳しい予算 | GPT-6.1 Sol | 公開価格で最安。ArgonはFairwind内でのみこれに一致 | Gemini 4 Argon |
アクセスがこの表の2行を決定します。 Argonは現時点でFairwindのサイバー防御者のみが利用可能です。Astraの完全な攻撃的セキュリティ機能はOpenAIのDaybreakプログラムの背後にあり、公開版は高度な攻撃的サイバータスクを拒否します。Anthropicは無制限の双子モデルであるClaude Mythos 5.1を信頼されたアクセスプログラムの背後に置いています。
乗り換え前に確認すべきこと
ここにある数値のほとんどはベンダー報告によるものであり、ベンダー間で細部に相違があります。OpenAIはTerminal-Bench 4.0でAstraを57.9%と報告しています。Googleの比較表では58.2%と記載されています。
- セーフガードがFable 5.1のスコアに影響: Anthropicは本番セーフガードを有効にした状態でベンチマークを実施しました。フラグの立ったサイバーおよび生物学タスクは他のClaudeモデルに振り分けられ、これがOSWorldとAutomationBenchの結果を下げた可能性があります。
- Argonの価格は一時的なもの: 2ドル/10ドルは導入価格です。後日4ドル/20ドルに変更されますが、期日は公表されていません。
- Argonのコンテキストウィンドウは未公表: Googleは1M出力トークンの上限を公表しましたが、入力上限は公表していません。
- タスクあたりのコストはスナップショット: 9.18ドルおよび4.72ドルという数値は、Artificial Analysisの9月上旬のAstra実行によるものです。努力設定によって大きく変動します。
- Anthropicにはより安価な選択肢がある: Argonの取材では、Claude Opus 5.5が主要なエージェント系ベンチマークでFable 5.1をより低いAPI価格で上回ったという報道を引用しています。また、Terminal-Bench 4.0でも66.4%で首位です。
要点
- GPT-6.1 Solは、5分の1の価格でDeepSWE v1.1においてAstraに匹敵します。
- GPT-6 AstraはFrontierSWE v2(65.5%)とOSWorld-2.0(72.6%)で首位です。
- Gemini 4 ArgonはDeepSWE、Vals Index、AutomationBenchで首位に立つが、それはFairwind内に限られる。
- Fable 5.1は1タスクあたり9.18ドルで、同じ定価のAstraは4.72ドル。
- キャッシュヘビーなエージェントにとって、Fable 5.1の0.25ドルのキャッシュ読み取りは、Astraの1.00ドルを4分の1に抑える。
FAQ
- 最も安いのはどれ? GPT-6.1 Solは、1Mトークンあたり入力2ドル、出力10ドル、キャッシュ済み0.10ドル。Argonがこれに並ぶのは導入価格の期間中で、かつFairwind内のみ。
- コーディングに最適なのはどれ? 量ならSol。最难のタスクならAstra。Fable 5.1はClaude CodeにおいてArtificial Analysisのコーディングエージェントインデックスで首位。
- 今日Gemini 4 Argonを使うことはできる? サイバー防御者向けのGoogleのFairwind Programを通じてのみ。
本記事 GPT-6 Astra vs GPT-6.1 Sol vs Gemini 4 Argon vs Claude Fable 5.1: どのフロンティアモデルがどの仕事に適するか の初出は MarkTechPost.