MarkTechPost

GPT-6 Astra vs GPT-6.1 Sol vs Gemini 4 Argon vs Claude Fable 5.1:哪种前沿模型适合哪种工作

Astra 在计算机使用方面领先,Argon 在法律和金融工作方面领先,而 Sol 在编码智能体的价格上胜出。文章《GPT-6 Astra vs GPT-6.1 Sol vs Gemini 4 Argon vs Claude Fable 5.1:哪种前沿模型适合哪种工作》最先发表于 MarkTechPost 。

Anthropic、OpenAI 和 Google DeepMind 在30天内发布了4个前沿级模型。 Claude Fable 5.1 于9月1日发布。 GPT-6 Astra 于9月3日随后发布。 GPT-6.1 Sol 和 Gemini 4 Argon 则在9月的最后几天上市。

我们对每次发布都进行了单独报道。本文将它们放在一起比较。基准测试分数的重叠程度超出了发布文章所暗示的范围,而价格、访问规则和每项任务的成本则不然。

一个变化决定了这一阵容的格局。OpenAI 于9月28日取消了 GPT-6.1 Astra 于9月28日,因其未能通过内部范围和授权测试。目前 GPT-6 Astra 仍是 OpenAI 的顶级模型。

规格、定价与访问

Astra 和 Fable 5.1 共享相同的每百万输入10美元和每百万输出50美元的标价。Sol 和 Argon 的标价为其五分之一。Argon 的价格是介绍性的,之后会翻倍。

特性GPT-6 AstraGPT-6.1 SolGemini 4 ArgonClaude Fable 5.1
开发者OpenAIOpenAIGoogle DeepMindAnthropic
发布时间2026年9月3日2026年9月29日宣布于2026年9月30日2026年9月1日
访问方式OpenAI API、ChatGPT、CodexOpenAI API、ChatGPT Work、Codex仅限 Fairwind ProgramClaude API、Bedrock、Google Cloud、Microsoft Foundry
输入 / 输出(每 1M)$10 / $50$2 / $10introductory $2 / $10,之后为 $4 / $20$10 / $50
缓存输入(每 1M)$1.00$0.10introductory $0.10$0.25
长提示词定价超过272K:$20 / $75超过272K:输入2倍,输出1.5倍未披露至1M保持不变
上下文窗口1.05M1.05M未披露1M
每次响应最大输出128K128K1M128K
推理控制5个努力程度等级,从低到最高5个努力程度等级,从低到最高未披露努力程度等级包括低、中、高
开放权重否否否否

来源: OpenAI GPT-6.1 Sol 报道, Gemini 4 Argon 报道, GPT-6 Astra 长上下文定价, Claude Fable 5.1 规格。标准第一方目录价格,短上下文档位。

缓存输入这一行对智能体最为重要。智能体在每一步都会重新发送系统提示词、工具架构和历史记录。Astra 的1.00美元缓存读取价格是 Fable 5.1 的4倍,是 Sol 的10倍。

Argon 的 1M 输出上限是唯一在结构上与众不同的地方。其他 3 个模型在每次回复中最多输出 128K 个 token。

基准测试:各模型的领先领域

没有模型能全面领先。Argon 在知识工作和长时程编程项目中领先。Astra 在前沿软件工程和计算机使用方面领先。不在此列的 Opus 5.5 则在 Terminal-Bench 4.0 上领先。

基准测试测试内容Gemini 4 ArgonGPT-6 AstraClaude Fable 5.1
DeepSWE v1.1长程软件工程77.9%74.1%67.4%
Vals Index金融、编程、法律和税务工作68.9%63.1%65.8%
FrontierSWE v2前沿软件工程55.0%65.5%56.3%
Terminal-Bench 4.0终端中的智能体工作57.4%58.2%57.9%
CWE-bench v1漏洞修复68% (平局)68% (平局)58%
OSWorld-2.0计算机使用69.2%72.6%不在Google的表格中

来源: Google DeepMind发布的对比,正如我们的报道所述: Gemini 4 Argon报道。为厂商自报数据。

GPT-6.1 Sol 不在Google的表格中。 OpenAI自己的数据显示其接近Astra:

  • DeepSWE v1.1: Sol以大约五分之一的成本与Astra持平。
  • OSWorld 2.0 离线集: Sol与Astra相差2.1分以内,而每任务成本约为其七分之一。
  • AutomationBench 1.0.6: Sol在中等算力下比Claude Opus 5.5高出2.2分。
  • Terminal-Bench Science 0.1: Astra 仍以 68.1% 领先。OpenAI 推荐在最困难的研究中使用 Astra。

在原始智力方面,独立信号指向了另一方向。 在 Artificial Analysis 智能指数上,Astra 得分为 61。Fable 5.1 得分高出 5 分。在其编程智能体指数上,Claude Code 中的 Fable 5.1 得分为 70,而 Astra 为 67。Artificial Analysis 还报告称,Argon 在智能指数上与 Astra 相当。

在 ARC-AGI-2 上,Astra 得分为 95%,Fable 5.1 得分为 90%。

每任务成本:相同的标价,不同的账单

Artificial Analysis 估计 Claude Fable 5.1 每个任务成本为 9.18 美元,而 GPT-6 Astra 为 4.72 美元。在标价相同的情况下,这大约是 1.9 倍。

差距来自 token 数量,而非费率。每任务成本等于价格乘以所消耗的 token 数。在费率相同的情况下,该差距意味着 Fable 5.1 在该次运行中每个任务消耗了更多 token。Anthropic 还指出,其较新的分词器对相同文本产生的 token 数量大约多 30%。

两款更便宜的模型进一步改变了局面:

  • Gemini 4 Argon: Artificial Analysis 报告称,按入门价格计算,Argon 在智能指数上与 Astra 相当,而每任务成本仅为 Astra 的 60%。
  • GPT-6.1 Sol: 在 Terminal-Bench Science 上,OpenAI 报告 Sol 每个任务成本为 5.47 美元,而 Astra 为 23.80 美元。

缓存可以逆转智能体的排名。 上方的每任务数据并未模拟大量缓存复用。一个长时间运行的智能体在每一步都会重复读取相同的上下文。以下是一个 200K token 缓存上下文的算术,在输出 token 之前:

模型缓存费率(每 1M)每步每 100 步
GPT-6 Astra$1.00$0.20$20.00
Claude Fable 5.1$0.25$0.05$5.00
GPT-6.1 Sol$0.10$0.02$2.00
Gemini 4 Argon(发布版)$0.10$0.02$2.00

基于标价缓存费率的示例计算。Astra 的 200K 上下文仍低于其 272K 长提示阈值。

在缓存密集的循环中,Fable 5.1 读取上下文的费率是 Astra 的四分之一。在做选择前,请在你自己的轨迹上按每任务标题对比测试两者。

哪个模型适合哪个任务

按工作负载选择,而不是按排行榜排名。GPT-6.1 Sol 是大多数团队的默认选择。另外 3 个模型在更窄的任务上才配得上其价格。

任务选择原因次选
高吞吐量编码智能体、CI 机器人、PR 审查GPT-6.1 Sol以 $2 / $10 和 $0.10 缓存价格在 DeepSWE v1.1 上与 Astra 持平Gemini 4 Argon(公开后)
最难开放式工程任务GPT-6 Astra以 65.5% 领先 FrontierSWE v2Claude Fable 5.1
计算机使用和浏览器智能体GPT-6 Astra以 72.6% 领先 OSWorld-2.0GPT-6.1 Sol,相差 2.1 分以内
框架内的长编码会话Claude Fable 5.1在 Claude Code 中获得 Artificial Analysis 编码智能体最高分(70);缓存读取价格为 0.25美元GPT-6 Astra (67)
硬科学与研究GPT-6 Astra以68.1%领先Terminal-Bench ScienceGPT-6.1 Sol,每任务5.47美元
法律、金融与商业自动化Gemini 4 Argon以68.9%领先Vals Index、以51.3%领先AutomationBench、以19.6%领先Harvey LegalGPT-6.1 Sol;Claude Fable 5.1
超长单一输出:大型重构、完整报告Gemini 4 Argon唯一每次响应支持1M输出token的模型其他3个模型中的任意一个,分多轮完成
漏洞发现与修补Gemini 4 Argon或GPT-6 Astra在CWE-bench v1上以68%并列Claude Fable 5.1 (58%)
前沿质量下预算最紧凑GPT-6.1 Sol公开价格最低;Argon仅在Fairwind内部与之持平Gemini 4 Argon

访问权限决定了其中2行的选择。 Argon目前仅向Fairwind的网络防御人员开放。Astra的完整进攻性安全能力隐藏在OpenAI的Daybreak计划之后;公开版本拒绝执行高级进攻性网络任务。Anthropic将其无限制的孪生模型Claude Mythos 5.1置于受信任访问计划之后。

切换前需要检查的事项

这里的大多数数字是厂商报告的,厂商之间在边缘数值上存在分歧。OpenAI报告Astra在Terminal-Bench 4.0上为57.9%。Google的对比表列出的是58.2%。

  • 安全防护影响Fable 5.1的得分:Anthropic是在开启生产安全防护的情况下运行其基准测试的。被标记的网络和生物任务会转交给其他Claude模型,这可能降低了OSWorld和AutomationBench的结果。
  • Argon的定价是临时性的:2美元 / 10美元是 introductory(介绍价)。之后将调整为4美元 / 20美元,未公布截止日期。
  • Argon的上下文窗口未公开:Google公布了1M的输出上限,但未公布输入上限。
  • 每任务成本只是一个快照: 9.18美元和4.72美元的数字来自Artificial Analysis九月初的Astra运行测试。努力程度设置会显著影响这些数字。
  • Anthropic 有更便宜的选择: 我们关于Argon的报道援引消息称,Claude Opus 5.5在关键智能体基准测试中以更低的API价格击败了Fable 5.1。它还在Terminal-Bench 4.0上以66.4%领先。

要点

  • GPT-6.1 Sol在DeepSWE v1.1上与Astra持平,价格仅为五分之一。
  • GPT-6 Astra在FrontierSWE v2(65.5%)和OSWorld-2.0(72.6%)上领先。
  • Gemini 4 Argon 在 DeepSWE、Vals Index 和 AutomationBench 上领先,但仅在 Fairwind 内部。
  • Fable 5.1 每个任务花费 9.18 美元,而 Astra 为 4.72 美元,这是在相同标价下的对比。
  • 对于缓存密集型 agent,Fable 5.1 的 0.25 美元缓存读取价格比 Astra 的 1.00 美元低 4 倍。

常见问题

  • 哪个最便宜? GPT-6.1 Sol,每 1M tokens 输入 2 美元、输出 10 美元、缓存 0.10 美元。Argon 只有在 Fairwind 内部的介绍性定价下才能与之匹配。
  • 哪个最适合编程? 大批量任务选 Sol。最困难的任务选 Astra。Fable 5.1 在 Artificial Analysis 的 Claude Code 编程 agent 指数中位居榜首。
  • 我今天能使用 Gemini 4 Argon 吗? 只能通过面向网络防御者的 Google Fairwind Program 使用。

本文 GPT-6 Astra vs GPT-6.1 Sol vs Gemini 4 Argon vs Claude Fable 5.1:哪款前沿模型适合哪类工作 首发于 MarkTechPost.

原始出处

MarkTechPost

内容说明

原始发布及相关权利归来源方。

机器翻译 · 请以原文为准