MarkTechPost

GPT-6 Astra vs GPT-6.1 Sol vs Gemini 4 Argon vs Claude Fable 5.1: どのフロンティアモデルがどの仕事に合うか

Astraはコンピュータ利用で首位、Argonは法務・金融業務で首位、そしてコーディングエージェントではSolが価格で優位です。本記事「GPT-6 Astra vs GPT-6.1 Sol vs Gemini 4 Argon vs Claude Fable 5.1: どのフロンティアモデルがどの仕事に合うか」は当初MarkTechPostに掲載されました。

Anthropic、OpenAI、Google DeepMindの3社が、30日以内に4つのフロンティアクラスのモデルをリリースしました。 Claude Fable 5.1 は9月1日に登場しました。 GPT-6 Astra は9月3日に続きました。 GPT-6.1 Sol と Gemini 4 Argon は9月の最後の数日に登場しました。

私たちはそれぞれのローンチを個別に取り上げました。本稿ではこれらを並べて比較します。ベンチマークスコアはローンチ記事が示唆する以上に重なり合っています。しかし、価格、アクセスルール、タスクあたりのコストはそうではありません。

このラインナップを特徴づける一つの変化があります。OpenAIは、内部のスコープおよび認可テストに失敗したため、9月28日に GPT-6.1 Astra 9月28日、内部のスコープおよび認可テストに合格しなかったためです。当面はGPT-6 AstraがOpenAIの最上位モデルのままです。

仕様、価格、アクセス

AstraとFable 5.1は、同じく入力10ドル、出力50ドルという公式価格を共有しています。SolとArgonはその5分の1の価格です。Argonの価格は導入価格であり、後で2倍になります。

項目GPT-6 AstraGPT-6.1 SolGemini 4 ArgonClaude Fable 5.1
開発元OpenAIOpenAIGoogle DeepMindAnthropic
リリース日2026年9月3日2026年9月29日2026年9月30日発表2026年9月1日
アクセスOpenAI API、ChatGPT、CodexOpenAI API、ChatGPT Work、CodexFairwindプログラム限定Claude API、Bedrock、Google Cloud、Microsoft Foundry
入力 / 出力(1Mあたり)$10 / $50$2 / $10導入価格は $2 / $10、その後 $4 / $20$10 / $50
キャッシュ入力(1Mあたり)$1.00$0.10導入価格 $0.10$0.25
長プロンプト料金272K超: $20 / $75272K超: 入力2倍、出力1.5倍非公開1Mまで一律
コンテキストウィンドウ1.05M1.05M非公開1M
1レスポンスあたりの最大出力128K128K1M128K
推論制御lowからmaxまでの5段階のeffortレベルlowからmaxまでの5段階のeffortレベル非公開low、medium、highなどを含むeffortレベル
オープンウェイトいいえいいえいいえいいえ

出典: OpenAI GPT-6.1 Solの解説, Gemini 4 Argonの解説, GPT-6 Astraの長コンテキスト料金, Claude Fable 5.1の仕様。いずれも一次提供元の標準リスト価格、短コンテキスト階層です。

キャッシュ入力の行はエージェントにとって最も重要です。エージェントは毎ステップでシステムプロンプト、ツールスキーマ、履歴を再送信します。Astraの$1.00のキャッシュ読み取りは、Fable 5.1の4倍、Solの10倍です。

Argonの1Mという出力上限だけが構造上の外れ値です。他の3モデルは1回の応答につき128Kトークンで頭打ちになります。

ベンチマーク:各モデルがリードする分野

どのモデルもすべてを制覇してはいません。Argonはナレッジワークと長期コーディングの行で首位です。Astraはフロンティアのソフトウェアエンジニアリングとコンピュータ操作で首位です。このラインナップには含まれていないOpus 5.5が、Terminal-Bench 4.0で首位です。

ベンチマークテスト内容Gemini 4 ArgonGPT-6 AstraClaude Fable 5.1
DeepSWE v1.1長期視点のソフトウェアエンジニアリング77.9%74.1%67.4%
Vals Index金融、コーディング、法務、税務業務68.9%63.1%65.8%
FrontierSWE v2フロンティア系ソフトウェアエンジニアリング55.0%65.5%56.3%
Terminal-Bench 4.0ターミナルでのエージェント型作業57.4%58.2%57.9%
CWE-bench v1脆弱性の修正対応68% (同点)68% (同点)58%
OSWorld-2.0コンピュータ操作69.2%72.6%Googleの表には未掲載

出典: Google DeepMindが公開した比較。当社の報道による Gemini 4 Argonの関連記事。ベンダー公表値。

GPT-6.1 SolはGoogleの表には掲載されていない。 OpenAI自身の数値では、Astraに近い水準とされる:

  • DeepSWE v1.1: SolはAstraと同等の性能を、約5分の1のコストで達成している。
  • OSWorld 2.0 オフラインセット: SolはAstraとの差が2.1ポイント以内で、タスクあたりのコストは約7分の1である。
  • AutomationBench 1.0.6: Solはmedium effort設定でClaude Opus 5.5を2.2ポイント上回った。
  • Terminal-Bench Science 0.1: Astraは依然として68.1%で首位です。OpenAIは最も困難な研究にはAstraを推奨しています。

独立系のシグナルは、生の知性については逆の方向を示しています。 「 Artificial Analysis Intelligence Index」では、Astraは61を獲得。Fable 5.1は5ポイント上回っています。同社のコーディングエージェント指数では、Claude Code上のFable 5.1が70で、Astraの67を上回ります。Artificial Analysisはさらに、ArgonがIntelligence IndexでAstraに匹敵すると報告しています。

ARC-AGI-2では、Astraは95%、Fable 5.1は90%を獲得しています。

タスクあたりコスト: 同一の定価、異なる請求額

Artificial AnalysisはClaude Fable 5.1をタスクあたり$9.18とし、GPT-6 Astraは$4.72としています。同一の定価でありながら、約1.9倍の差です。

この差は単価ではなくトークン量によるものです。タスクあたりコストは価格に消費トークン数を掛けたものです。単価が同じである以上、この差はFable 5.1がその実行でタスクあたりより多くのトークンを消費したことを意味します。Anthropicはまた、新しいトークナイザーが同じテキストに対して約30%多くのトークンを生成すると述べています。

この2つのより安価なモデルが、状況をさらに変えます。

  • Gemini 4 Argon: Artificial Analysisは、導入価格を用いて、ArgonがタスクあたりコストでAstraの60%でIntelligence IndexにおいてAstraに匹敵すると報告しています。
  • GPT-6.1 Sol: Terminal-Bench Scienceにおいて、OpenAIはSolをタスクあたり$5.47、Astraを$23.80と報告しています。

キャッシュはエージェントにとってのランキングを逆転させることがあります。 上記のタスクあたりの数値には、大量のキャッシュ再利用は考慮されていません。長時間動作するエージェントは、毎ステップで同じコンテキストを再読み込みします。200Kトークンのキャッシュ済みコンテキストについて、出力トークンを除く計算は以下の通りです:

モデルキャッシュレート(1Mあたり)1ステップあたり100ステップあたり
GPT-6 Astra$1.00$0.20$20.00
Claude Fable 5.1$0.25$0.05$5.00
GPT-6.1 Sol$0.10$0.02$2.00
Gemini 4 Argon(発表時)$0.10$0.02$2.00

公表されているキャッシュレートに基づく試算。Astraの200Kコンテキストは、272Kの長文プロンプト閾値を下回ったままです。

キャッシュ多用型のループでは、Fable 5.1はAstraの4分の1のレートでコンテキストを読み込みます。タスクあたりの見出しだけで選ぶ前に、ご自身のトレースで両者を計測してください。

どの仕事にどのモデルを

リーダーボードの順位ではなく、ワークロードに基づいて選びましょう。GPT-6.1 Solはほとんどのチームにとってのデフォルトです。残りの3モデルは、より狭い仕事においてその価格に見合う価値を発揮します。

仕事選択理由次点
大量処理のコーディングエージェント、CIボット、PRレビューGPT-6.1 SolDeepSWE v1.1でAstraに匹敵し、$2 / $10、キャッシュ時$0.10Gemini 4 Argon(公開後)
最も難しいオープンエンドなエンジニアリングGPT-6 AstraFrontierSWE v2で65.5%の首位Claude Fable 5.1
コンピュータ利用およびブラウザエージェントGPT-6 AstraOSWorld-2.0で72.6%の首位GPT-6.1 Sol(2.1ポイント差)
ハーネス内での長時間コーディングセッションClaude Fable 5.1Claude CodeにおけるArtificial Analysisのコーディングエージェントスコア最高値(70)、キャッシュ読み取りは$0.25GPT-6 Astra(67)
ハードサイエンスおよび研究GPT-6 AstraTerminal-Bench Scienceで68.1%の首位GPT-6.1 Sol(タスクあたり5.47ドル)
法務・金融・ビジネス自動化Gemini 4 ArgonVals Index(68.9%)、AutomationBench(51.3%)、Harvey Legal(19.6%)で首位GPT-6.1 Sol、Claude Fable 5.1
非常に長い単一出力:大規模リファクタリング、完全なレポートGemini 4 Argon1レスポンスあたり1M出力トークンに対応する唯一のモデル他の3モデルのいずれか(複数ターンに分割)
脆弱性の発見とパッチ適用Gemini 4 ArgonまたはGPT-6 AstraCWE-bench v1で68%で同率首位Claude Fable 5.1(58%)
フロンティア品質で最も厳しい予算GPT-6.1 Sol公開価格で最安。ArgonはFairwind内でのみこれに一致Gemini 4 Argon

アクセスがこの表の2行を決定します。 Argonは現時点でFairwindのサイバー防御者のみが利用可能です。Astraの完全な攻撃的セキュリティ機能はOpenAIのDaybreakプログラムの背後にあり、公開版は高度な攻撃的サイバータスクを拒否します。Anthropicは無制限の双子モデルであるClaude Mythos 5.1を信頼されたアクセスプログラムの背後に置いています。

乗り換え前に確認すべきこと

ここにある数値のほとんどはベンダー報告によるものであり、ベンダー間で細部に相違があります。OpenAIはTerminal-Bench 4.0でAstraを57.9%と報告しています。Googleの比較表では58.2%と記載されています。

  • セーフガードがFable 5.1のスコアに影響: Anthropicは本番セーフガードを有効にした状態でベンチマークを実施しました。フラグの立ったサイバーおよび生物学タスクは他のClaudeモデルに振り分けられ、これがOSWorldとAutomationBenchの結果を下げた可能性があります。
  • Argonの価格は一時的なもの: 2ドル/10ドルは導入価格です。後日4ドル/20ドルに変更されますが、期日は公表されていません。
  • Argonのコンテキストウィンドウは未公表: Googleは1M出力トークンの上限を公表しましたが、入力上限は公表していません。
  • タスクあたりのコストはスナップショット: 9.18ドルおよび4.72ドルという数値は、Artificial Analysisの9月上旬のAstra実行によるものです。努力設定によって大きく変動します。
  • Anthropicにはより安価な選択肢がある: Argonの取材では、Claude Opus 5.5が主要なエージェント系ベンチマークでFable 5.1をより低いAPI価格で上回ったという報道を引用しています。また、Terminal-Bench 4.0でも66.4%で首位です。

要点

  • GPT-6.1 Solは、5分の1の価格でDeepSWE v1.1においてAstraに匹敵します。
  • GPT-6 AstraはFrontierSWE v2(65.5%)とOSWorld-2.0(72.6%)で首位です。
  • Gemini 4 ArgonはDeepSWE、Vals Index、AutomationBenchで首位に立つが、それはFairwind内に限られる。
  • Fable 5.1は1タスクあたり9.18ドルで、同じ定価のAstraは4.72ドル。
  • キャッシュヘビーなエージェントにとって、Fable 5.1の0.25ドルのキャッシュ読み取りは、Astraの1.00ドルを4分の1に抑える。

FAQ

  • 最も安いのはどれ? GPT-6.1 Solは、1Mトークンあたり入力2ドル、出力10ドル、キャッシュ済み0.10ドル。Argonがこれに並ぶのは導入価格の期間中で、かつFairwind内のみ。
  • コーディングに最適なのはどれ? 量ならSol。最难のタスクならAstra。Fable 5.1はClaude CodeにおいてArtificial Analysisのコーディングエージェントインデックスで首位。
  • 今日Gemini 4 Argonを使うことはできる? サイバー防御者向けのGoogleのFairwind Programを通じてのみ。

本記事 GPT-6 Astra vs GPT-6.1 Sol vs Gemini 4 Argon vs Claude Fable 5.1: どのフロンティアモデルがどの仕事に適するか の初出は MarkTechPost.

原文の出典

MarkTechPost

内容について

原文の公開と権利は出典元に帰属します。

機械翻訳 · 原文をご参照ください