推出 Claude Haiku 5.5:我们发布过的最便宜、最快且能力最强的小模型。
Claude Haiku 5.5 专为高吞吐量、成本敏感的任务而设计。它能可靠地处理快速且重复的工作负载(如摘要、压缩、数据库查询和分类请求)。它与 Opus 5.5 和 Sonnet 5.5 搭配,可作为编码工作中的子代理使用。此外,由于它也是我们迄今最快的模型,因此特别适合对速度敏感的任务,如实时客户支持和浏览器使用。¹
Haiku 5.5 的价格远低于 Haiku 4.5。平均而言,其运行成本现在降低了约 75%。²
随着本次发布,我们还将提升整个模型系列的价值。我们将 Claude Sonnet 5.5 的缓存读取价格减半,这意味着 Sonnet 5.5 在大多数代理式工作上的运行成本降低约 20%。我们还将为 Claude Max 和 Team 订阅者推出新的每月 API 额度,旨在支持用户构建运行在 Claude Platform 上的新代理和应用程序。
性能
以下是 Claude Haiku 5.5 在一系列基准测试中的表现:
| Haiku 5.5 | Haiku 4.5 | GPT-6 Luna | Sonnet 5.5仅供参考 | |
|---|---|---|---|---|
| 知识工作GDPval-AA v2.1 | 1620 | 735 | 1437 | 1840 |
| 知识工作AA-Briefcase v1.1 | 1578 | 614 | 1336 | 1824 |
| 计算机使用OSWorld 2.1 | 72.4%离线子集 | 15.7%离线子集 | 48.9%离线子集 | 83.9%离线子集 |
| 多学科推理Humanity’s Last Exam | 45.9%无工具 | 10.2%无工具 | — | 56.9%无工具 |
| 57.4%有工具 | 18.7%有工具 | — | 64.5%有工具 | |
| 代理式编码Terminal-Bench 4.0 | 39.2% | 0.0% | 16.4% | 70.6% |
| 代理式编码FrontierCode 1.1 (Main) | 46.4% | — | 42.4% | 52.1%Xhigh |
| 视觉推理Chartography | 46.4%无工具 | 6.4%无工具 | 29.1%无工具 | 61.6%无工具 |
有关我们如何运行评估的详细信息,请参阅 Haiku 5.5 系统卡.
Haiku 5.5 是我们首款配备可调节力度设置的 Haiku 级模型。这意味着,与我们其他模型一样,用户可以决定是优化成本还是优化智能。下面的图表显示了 Haiku 5.5 在每个力度设置下在三个基准测试上的表现:
OSWorld 2.1 衡量智能体操作真实计算机来完成长时间、多步骤任务的能力。
Artificial Analysis 的 GDPval-AA v2.1 在 44 个职业的真实世界专业工作上对智能体进行评估。
Humanity's Last Exam(HLE)是一项对专家级学术知识和推理能力的测试。
在早期测试中,我们的客户报告的结果与上图所示的性能和成本改进一致。以下是他们关于这款新模型的反馈:
引言公司Asana作者Aaron Vinh,资深软件工程师“Claude Haiku 5.5 给我们留下了非常深刻的印象,尤其是它的速度。我们通过面向 AI Teammates(我们的 AI 智能体产品)的评估套件对其进行了测试,涵盖分类缺陷、搭建项目以及搜索大型作品组合以发现高风险或逾期工作等用例。与我们目前使用的模型相比,我们看到任务完成的延迟降低了超过 30%,每个智能体回合的推理速度最高提升至 2.5 倍。体验明显更加流畅迅捷。”
定价
下表显示了 Claude Haiku 5.5 的定价与我们其他模型的对比。Haiku 5.5 在提示词不超过 100,000 token 的任务中尤其划算,这类任务约占我们上一代 Haiku 模型请求量的 90%。
| 每 1 百万 token 价格 | Haiku 5.5 提示词不超过 / 超过 100k | Haiku 4.5 | Sonnet 5.5 |
|---|---|---|---|
| 缓存读取 | $0.01 / $0.05 | $0.10 | $0.10 |
| 缓存写入 | $0.125 / $0.625 | $1.25 | $2.50 |
| 输入 token | $0.10 / $0.50 | $1.00 | $2.00 |
| 输出 token | $0.50 / $2.50 | $5.00 | $10.00 |
安全
对齐。 Claude Haiku 5.5 在我们几乎所有的对齐评估中相较 Haiku 4.5 都有重大改进。特别是,我们发现行为失准的情况大幅减少,配合滥用的意愿也更低。该模型的 系统卡 更详细地描述了我们的评估过程和结果。
安全保障措施。 与其能力相一致,Haiku 5.5的网络安全保障措施比Haiku 4.5的更为严格,但比我们近期对其他模型所采用的保障措施稍宽松一些。在网络安全方面,与我们对Sonnet 5.5的保障措施相比,这些措施允许更广泛的防御性任务,但仍会阻止渗透测试及其他更可能被攻击者使用的技术。
Haiku 5.5的生物安全保障措施与Sonnet 5、Sonnet 5.5和Opus 5相同。这些措施允许研究性生物学问题,但会限制我们认为可能造成危害的请求。从事更广泛生物和网络安全活动的组织可以申请我们的 生命科学验证计划 和 网络安全验证计划.
可用性
Claude Haiku 5.5现已在所有平台上可用,包括Amazon Web Services、Google Cloud和Microsoft Azure。在Claude Platform上,开发者可以通过以下方式开始使用: claude-haiku-5-5.
详情请参阅我们的 迁移指南 。
进一步更新
除了我们为 Claude Haiku 5.5 推出的新定价之外,我们还将进一步提升我们模型和产品的价值。
首先,从今天起,我们将 降低 Claude Sonnet 5.5 缓存读取的价格. 缓存读取费用现在降低50%:每百万tokens为0.10美元,而非0.20美元。由于缓存读取占模型token消耗的很大一部分,这使得Sonnet 5.5在大多数agentic任务上的成本降低约20%。
例如,以下是此次降价对 Sonnet 5.5 在 Terminal-Bench 4.0 上相对成本表现的意义:
Terminal-Bench 4.0 衡量模型在命令行界面中完成复杂的多步骤专业任务的能力。
这张图表展示了 Haiku 5.5 与我们更大规模模型之间的一项重要区别。对于 Terminal-Bench 4.0 所测量的复杂代理式编码任务,Sonnet 5.5 和 Opus 5.5 仍然是更好的选择。相比之下,Haiku 5.5 更适合范围更窄的任务——这类任务在以前版本的 Claude 上可能成本过高——例如压缩、摘要或子代理工作。
第二,本周我们将推出 一项新的每月 API 额度,面向所有 Max 和 Team 订阅者提供,可在 Claude Platform 上使用Max 5x 用户每月将获得 100 美元的额度,Max 20x 用户将获得 200 美元,Team 订阅用户将获得最高 500 美元,由其团队成员共享。这些额度旨在让我们的用户能够尝试构建调用我们 API 的工具、应用和智能体。它们可用于我们的任何模型。欲了解更多信息, 请参阅我们的帮助中心文章.
对于开发者,我们还 更新我们的 Claude Python 和 TypeScript SDK,以增加对计算机使用和浏览器使用的支持。 处于测试阶段。Haiku 5.5 特别适合这些任务,因为它兼具速度、能力和价格优势。你可以阅读更多相关内容。 在我们Claude平台文档中.
脚注
1 Claude Haiku 5.5 是我们在各模型标准速度下迄今最快的模型,尽管在 Fast Mode 下其运行速度不及我们的 Opus 模型。
2 对于不超过 100,000 tokens 的请求,Claude Haiku 5.5 的定价比 Claude Haiku 4.5 低 90%;对于超过 100,000 tokens 的请求,则低 50%。在 Haiku 4.5 上,90% 的请求属于前一类。这一计算还考虑了 Haiku 4.5 与 Haiku 5.5 在完成给定工作量时所用 token 数量上的变化:Haiku 5.5 采用了更新的分词器(与 Sonnet 5.5 和 Opus 5.5 的类似),这意味着它每项任务会使用略多的 tokens。
