Anthropic、OpenAI 和 Google DeepMind 在30天内发布了4个前沿级模型。 Claude Fable 5.1 于9月1日发布。 GPT-6 Astra 于9月3日随后发布。 GPT-6.1 Sol 和 Gemini 4 Argon 则在9月的最后几天上市。
我们对每次发布都进行了单独报道。本文将它们放在一起比较。基准测试分数的重叠程度超出了发布文章所暗示的范围,而价格、访问规则和每项任务的成本则不然。
一个变化决定了这一阵容的格局。OpenAI 于9月28日取消了 GPT-6.1 Astra 于9月28日,因其未能通过内部范围和授权测试。目前 GPT-6 Astra 仍是 OpenAI 的顶级模型。
规格、定价与访问
Astra 和 Fable 5.1 共享相同的每百万输入10美元和每百万输出50美元的标价。Sol 和 Argon 的标价为其五分之一。Argon 的价格是介绍性的,之后会翻倍。
| 特性 | GPT-6 Astra | GPT-6.1 Sol | Gemini 4 Argon | Claude Fable 5.1 |
|---|---|---|---|---|
| 开发者 | OpenAI | OpenAI | Google DeepMind | Anthropic |
| 发布时间 | 2026年9月3日 | 2026年9月29日 | 宣布于2026年9月30日 | 2026年9月1日 |
| 访问方式 | OpenAI API、ChatGPT、Codex | OpenAI API、ChatGPT Work、Codex | 仅限 Fairwind Program | Claude API、Bedrock、Google Cloud、Microsoft Foundry |
| 输入 / 输出(每 1M) | $10 / $50 | $2 / $10 | introductory $2 / $10,之后为 $4 / $20 | $10 / $50 |
| 缓存输入(每 1M) | $1.00 | $0.10 | introductory $0.10 | $0.25 |
| 长提示词定价 | 超过272K:$20 / $75 | 超过272K:输入2倍,输出1.5倍 | 未披露 | 至1M保持不变 |
| 上下文窗口 | 1.05M | 1.05M | 未披露 | 1M |
| 每次响应最大输出 | 128K | 128K | 1M | 128K |
| 推理控制 | 5个努力程度等级,从低到最高 | 5个努力程度等级,从低到最高 | 未披露 | 努力程度等级包括低、中、高 |
| 开放权重 | 否 | 否 | 否 | 否 |
来源: OpenAI GPT-6.1 Sol 报道, Gemini 4 Argon 报道, GPT-6 Astra 长上下文定价, Claude Fable 5.1 规格。标准第一方目录价格,短上下文档位。
缓存输入这一行对智能体最为重要。智能体在每一步都会重新发送系统提示词、工具架构和历史记录。Astra 的1.00美元缓存读取价格是 Fable 5.1 的4倍,是 Sol 的10倍。
Argon 的 1M 输出上限是唯一在结构上与众不同的地方。其他 3 个模型在每次回复中最多输出 128K 个 token。
基准测试:各模型的领先领域
没有模型能全面领先。Argon 在知识工作和长时程编程项目中领先。Astra 在前沿软件工程和计算机使用方面领先。不在此列的 Opus 5.5 则在 Terminal-Bench 4.0 上领先。
| 基准测试 | 测试内容 | Gemini 4 Argon | GPT-6 Astra | Claude Fable 5.1 |
|---|---|---|---|---|
| DeepSWE v1.1 | 长程软件工程 | 77.9% | 74.1% | 67.4% |
| Vals Index | 金融、编程、法律和税务工作 | 68.9% | 63.1% | 65.8% |
| FrontierSWE v2 | 前沿软件工程 | 55.0% | 65.5% | 56.3% |
| Terminal-Bench 4.0 | 终端中的智能体工作 | 57.4% | 58.2% | 57.9% |
| CWE-bench v1 | 漏洞修复 | 68% (平局) | 68% (平局) | 58% |
| OSWorld-2.0 | 计算机使用 | 69.2% | 72.6% | 不在Google的表格中 |
来源: Google DeepMind发布的对比,正如我们的报道所述: Gemini 4 Argon报道。为厂商自报数据。
GPT-6.1 Sol 不在Google的表格中。 OpenAI自己的数据显示其接近Astra:
- DeepSWE v1.1: Sol以大约五分之一的成本与Astra持平。
- OSWorld 2.0 离线集: Sol与Astra相差2.1分以内,而每任务成本约为其七分之一。
- AutomationBench 1.0.6: Sol在中等算力下比Claude Opus 5.5高出2.2分。
- Terminal-Bench Science 0.1: Astra 仍以 68.1% 领先。OpenAI 推荐在最困难的研究中使用 Astra。
在原始智力方面,独立信号指向了另一方向。 在 Artificial Analysis 智能指数上,Astra 得分为 61。Fable 5.1 得分高出 5 分。在其编程智能体指数上,Claude Code 中的 Fable 5.1 得分为 70,而 Astra 为 67。Artificial Analysis 还报告称,Argon 在智能指数上与 Astra 相当。
在 ARC-AGI-2 上,Astra 得分为 95%,Fable 5.1 得分为 90%。
每任务成本:相同的标价,不同的账单
Artificial Analysis 估计 Claude Fable 5.1 每个任务成本为 9.18 美元,而 GPT-6 Astra 为 4.72 美元。在标价相同的情况下,这大约是 1.9 倍。
差距来自 token 数量,而非费率。每任务成本等于价格乘以所消耗的 token 数。在费率相同的情况下,该差距意味着 Fable 5.1 在该次运行中每个任务消耗了更多 token。Anthropic 还指出,其较新的分词器对相同文本产生的 token 数量大约多 30%。
两款更便宜的模型进一步改变了局面:
- Gemini 4 Argon: Artificial Analysis 报告称,按入门价格计算,Argon 在智能指数上与 Astra 相当,而每任务成本仅为 Astra 的 60%。
- GPT-6.1 Sol: 在 Terminal-Bench Science 上,OpenAI 报告 Sol 每个任务成本为 5.47 美元,而 Astra 为 23.80 美元。
缓存可以逆转智能体的排名。 上方的每任务数据并未模拟大量缓存复用。一个长时间运行的智能体在每一步都会重复读取相同的上下文。以下是一个 200K token 缓存上下文的算术,在输出 token 之前:
| 模型 | 缓存费率(每 1M) | 每步 | 每 100 步 |
|---|---|---|---|
| GPT-6 Astra | $1.00 | $0.20 | $20.00 |
| Claude Fable 5.1 | $0.25 | $0.05 | $5.00 |
| GPT-6.1 Sol | $0.10 | $0.02 | $2.00 |
| Gemini 4 Argon(发布版) | $0.10 | $0.02 | $2.00 |
基于标价缓存费率的示例计算。Astra 的 200K 上下文仍低于其 272K 长提示阈值。
在缓存密集的循环中,Fable 5.1 读取上下文的费率是 Astra 的四分之一。在做选择前,请在你自己的轨迹上按每任务标题对比测试两者。
哪个模型适合哪个任务
按工作负载选择,而不是按排行榜排名。GPT-6.1 Sol 是大多数团队的默认选择。另外 3 个模型在更窄的任务上才配得上其价格。
| 任务 | 选择 | 原因 | 次选 |
|---|---|---|---|
| 高吞吐量编码智能体、CI 机器人、PR 审查 | GPT-6.1 Sol | 以 $2 / $10 和 $0.10 缓存价格在 DeepSWE v1.1 上与 Astra 持平 | Gemini 4 Argon(公开后) |
| 最难开放式工程任务 | GPT-6 Astra | 以 65.5% 领先 FrontierSWE v2 | Claude Fable 5.1 |
| 计算机使用和浏览器智能体 | GPT-6 Astra | 以 72.6% 领先 OSWorld-2.0 | GPT-6.1 Sol,相差 2.1 分以内 |
| 框架内的长编码会话 | Claude Fable 5.1 | 在 Claude Code 中获得 Artificial Analysis 编码智能体最高分(70);缓存读取价格为 0.25美元 | GPT-6 Astra (67) |
| 硬科学与研究 | GPT-6 Astra | 以68.1%领先Terminal-Bench Science | GPT-6.1 Sol,每任务5.47美元 |
| 法律、金融与商业自动化 | Gemini 4 Argon | 以68.9%领先Vals Index、以51.3%领先AutomationBench、以19.6%领先Harvey Legal | GPT-6.1 Sol;Claude Fable 5.1 |
| 超长单一输出:大型重构、完整报告 | Gemini 4 Argon | 唯一每次响应支持1M输出token的模型 | 其他3个模型中的任意一个,分多轮完成 |
| 漏洞发现与修补 | Gemini 4 Argon或GPT-6 Astra | 在CWE-bench v1上以68%并列 | Claude Fable 5.1 (58%) |
| 前沿质量下预算最紧凑 | GPT-6.1 Sol | 公开价格最低;Argon仅在Fairwind内部与之持平 | Gemini 4 Argon |
访问权限决定了其中2行的选择。 Argon目前仅向Fairwind的网络防御人员开放。Astra的完整进攻性安全能力隐藏在OpenAI的Daybreak计划之后;公开版本拒绝执行高级进攻性网络任务。Anthropic将其无限制的孪生模型Claude Mythos 5.1置于受信任访问计划之后。
切换前需要检查的事项
这里的大多数数字是厂商报告的,厂商之间在边缘数值上存在分歧。OpenAI报告Astra在Terminal-Bench 4.0上为57.9%。Google的对比表列出的是58.2%。
- 安全防护影响Fable 5.1的得分:Anthropic是在开启生产安全防护的情况下运行其基准测试的。被标记的网络和生物任务会转交给其他Claude模型,这可能降低了OSWorld和AutomationBench的结果。
- Argon的定价是临时性的:2美元 / 10美元是 introductory(介绍价)。之后将调整为4美元 / 20美元,未公布截止日期。
- Argon的上下文窗口未公开:Google公布了1M的输出上限,但未公布输入上限。
- 每任务成本只是一个快照: 9.18美元和4.72美元的数字来自Artificial Analysis九月初的Astra运行测试。努力程度设置会显著影响这些数字。
- Anthropic 有更便宜的选择: 我们关于Argon的报道援引消息称,Claude Opus 5.5在关键智能体基准测试中以更低的API价格击败了Fable 5.1。它还在Terminal-Bench 4.0上以66.4%领先。
要点
- GPT-6.1 Sol在DeepSWE v1.1上与Astra持平,价格仅为五分之一。
- GPT-6 Astra在FrontierSWE v2(65.5%)和OSWorld-2.0(72.6%)上领先。
- Gemini 4 Argon 在 DeepSWE、Vals Index 和 AutomationBench 上领先,但仅在 Fairwind 内部。
- Fable 5.1 每个任务花费 9.18 美元,而 Astra 为 4.72 美元,这是在相同标价下的对比。
- 对于缓存密集型 agent,Fable 5.1 的 0.25 美元缓存读取价格比 Astra 的 1.00 美元低 4 倍。
常见问题
- 哪个最便宜? GPT-6.1 Sol,每 1M tokens 输入 2 美元、输出 10 美元、缓存 0.10 美元。Argon 只有在 Fairwind 内部的介绍性定价下才能与之匹配。
- 哪个最适合编程? 大批量任务选 Sol。最困难的任务选 Astra。Fable 5.1 在 Artificial Analysis 的 Claude Code 编程 agent 指数中位居榜首。
- 我今天能使用 Gemini 4 Argon 吗? 只能通过面向网络防御者的 Google Fairwind Program 使用。
本文 GPT-6 Astra vs GPT-6.1 Sol vs Gemini 4 Argon vs Claude Fable 5.1:哪款前沿模型适合哪类工作 首发于 MarkTechPost.