Artificial Analysis Articles更新于

Anthropic 发布了 Claude Haiku 5.5

Anthropic 发布了 Claude Haiku 5.5,在 Artificial Analysis Intelligence Index 上得分为 43,较上一款 Haiku 发布一年后提升了 26 分 查看模型页面 Haiku 5.5 是首款具备 Anthropic 努力设置和自适应思考的 Haiku 模型,Anthropic 还引入了分级定价。 Haiku 5.5 比其前代更便宜——对

配图来源 · Artificial Analysis Articles

Anthropic 发布了 Claude Haiku 5.5,在 Artificial Analysis Intelligence Index 上得分为 43,较上一款 Haiku 发布一年后提升了 26 分

查看模型页面

Haiku 5.5 是首款具备 Anthropic 努力设置和自适应思考的 Haiku 模型,Anthropic 还引入了分级定价。

Haiku 5.5 比其前代更便宜——对于最多 100k token 的提示词,每 1M 输入/输出 token 的价格为 0.10/0.50 美元(与 GPT-6 Luna 相同,为上一款 Haiku 模型的 10%)。然而,超过 100k 后价格会上涨 5 倍,达到 0.50/2.50 美元。该网站尚未反映分级定价,因此 Haiku 5.5 的临时成本数据不包含这一阶梯涨价。我们正在开发相关支持,并将很快跟进 Cost per Task 报道。

要点:

➤ 领先的小型模型性能: 在 max 努力下,Haiku 5.5 略微领先于 GLM-5.3 Flash(42)、Gemini 3.8 Flash(41)和 GPT-6 Luna(38)等模型。其得分与 2.8T 参数的开源权重模型 Kimi K3(44)相当,比 Claude Sonnet 5.5(max,56)低 13 分

➤ 与 GPT-6 Luna 相比 token 用量较高: Haiku 5.5(max)在每项 Intelligence Index 任务上使用约 162k 输出 token,约为 GPT-6 Luna(max,约 50k)的 3 倍。从 xhigh 升到 max 会增加 2 分,token 用量增加约 1.8 倍。在相似智能水平下,它也比 GPT-6 Luna 使用更多 token:Haiku 5.5(high)以每项任务约 55k token 得 38 分,而 Luna(max)以约 50k token 得 38 分,且在更低努力设置下差距进一步扩大

➤ 在智能体知识工作方面能力出色: 在 AA-Briefcase——我们用于真实知识工作任务的内部评测上,Haiku 5.5(max)达到 1578 Elo,领先于 Kimi K3 和 GLM-5.3 等模型,并与 Muse Spark 1.3(max)相当

➤ 终端使用方面的改进: 在 Terminal-Bench 4.0 上它得分为 33%,而 Haiku 4.5 为 0%。这与 GLM-5.3 Flash 持平,领先于 Gemini 3.8 Flash(20%)和 GPT-6 Luna(13%)

➤ 事实知识较低,但幻觉相对较少: 作为一款较小级别的模型,Haiku 5.5 的事实知识低于其同系列模型,这在意料之中。AA-Omniscience 准确率为 36%,而 Gemini 3.8 Flash 为 55%,GPT-6 Luna 为 44%,但这部分归因于它更愿意承认自己不知道——其幻觉率更低,为 40%,而另两者分别为 55% 和 77%

➤ AutomationBench-AA 结果可能被低估: Haiku 5.5 得分为 35%,而 GPT-6 Luna、Gemini 3.8 Flash 和 GLM-5.3 Flash 为 53–60%。在发布前测试中,一个安全拒绝问题导致模型过度拒绝。Anthropic 正在解决此问题——我们将在修复后重新运行此评测,并预计该分数会上升

其他模型细节:

➤ 上下文窗口: 1 百万 token,而 Claude 4.5 Haiku 为 200k

➤ 定价: 最多 100k token 时每 1M 输入/输出 token 为 0.10/0.50 美元,超过 100k 后为 0.50/2.50 美元。缓存读取 0.01 美元(超过 100k 为 0.05 美元),5 分钟缓存写入 0.125 美元(超过 100k 为 0.625 美元)

➤ 多模态: 支持文本和图像输入,文本输出

Claude Haiku 5.5(max)在每项 Intelligence Index 任务上使用约 162k 输出 token,多于 Opus 5.5(max),约为 GPT-6 Luna(max)的 3 倍。在各努力设置下,Haiku 5.5 要达到与 GPT-6 Luna 相似的 Intelligence Index 分数需使用更多输出 token

Claude Haiku 5.5(max)在 AA-Briefcase——我们的内部前沿知识工作评测上达到 1578 Elo,处于 GPT-6 Astra(max)和 Claude Fable 5.1(high)的置信区间内

Claude Haiku 5.5 在各努力设置下 Artificial Analysis Intelligence Index 各项评测的完整细分数据

原始出处

Artificial Analysis Articles

内容说明

原始发布及相关权利归来源方。

机器翻译 · 请以原文为准