Anthropic 已发布 Claude Haiku 5.5,这是其迄今最便宜、最快的小型模型。 它面向摘要、压缩、分类和子代理任务等高吞吐量工作。它保留了 1M token 上下文窗口和最多 128K 输出 token。定价为每百万输入 token 起价 0.10 美元,每百万输出 token 0.50 美元。这低了 90%, Claude Haiku 4.5 适用于不超过 100K token 的提示词。
它可部署吗? 可以,作为托管的 API。Haiku 5.5 已在 Claude API、Amazon Bedrock、Google Cloud、Microsoft Foundry 和 AWS 上的 Claude Platform 上 全面可用 可通过 Claude API、Amazon Bedrock、Google Cloud、Microsoft Foundry 和 AWS 上的 Claude Platform 使用。
Anthropic 发布了什么
Haiku 5.5 是首个具有可调节努力程度设置的 Haiku 级模型。 自适应思考 默认开启,且 effort 参数 默认值为 medium.
它接受文本和图像输入,输出文本,知识截止日期为 2026 年 6 月。批量作业在测试阶段支持最多 300K 输出 token。
有两点关键事项需要注意。非默认的 temperature, top_p 或 top_k 值会返回 400 错误。新分词器对同一文本计算的 token 数量也比 Haiku 4.5 多出约 30%。 迁移指南 对两者均有说明。
定价:2级结构
定价以 100K 提示词 token 为分界。在 100K 以内,输入费用为每百万 0.10 美元,输出费用为每百万 0.50 美元。缓存读取费用为 0.01 美元,5 分钟缓存写入费用为 0.125 美元。超过 100K,费率升至输入 0.50 美元、输出 2.50 美元。
Haiku 4.5 的收费为输入 1 美元、输出 5 美元。Anthropic 表示,Haiku 4.5 约 90% 的请求保持在 100K token 以内。在调整分词器差异后,Anthropic 估计 Haiku 5.5 平均运行成本低约 75%。 批量处理 还可再减 50%。
GPT-6 Luna 列出了相同的短上下文费率。其更高档位仅在输入超过 272K token 时才适用,费率为 0.20 美元和 0.75 美元。对于 150K token 的提示词,Luna 的标价更低。
基准测试
以下所有数字均为 Anthropic 报告的数据 (见 系统卡):
- OSWorld 2.1(离线子集): 72.4%,而 GPT-6 Luna 为 48.9%,Haiku 4.5 为 15.7%。
- Terminal-Bench 4.0: 39.2%,而 Luna 为 16.4%,Haiku 4.5 为 0.0%。
- FrontierCode 1.1(Main): 46.4%,而 Luna 为 42.4%。
- Humanity’s Last Exam: 无工具时为 45.9%,使用工具时为 57.4%。
- GDPval-AA v2.1: 1620,而 Luna 为 1437,Haiku 4.5 为 735。
Sonnet 5.5 在每一行中仍然领先,包括在 Terminal-Bench 4.0 上的 70.6%。Anthropic 自己也推荐在复杂智能体编码中使用 Sonnet 5.5 和 Opus 5.5。
最佳用例
有三类工作负载最适合 Haiku 5.5:
- 第一是在 Opus 5.5 或 Sonnet 5.5 之下担任子智能体工作。在 Rogo,一个 Haiku 5.5 子智能体提取 10-K 营收数据行,同时更大的模型制作演示文稿。
- 第二个是高容量文档问答和摘要。AlphaSense 在一个每周处理约8M次调用的功能上进行了测试。
- 第三是对速度敏感的工作,如实时客户支持和 浏览器使用.
Haiku 5.5 与其最接近的竞争对手对比
| 特性 | Claude Haiku 5.5 | GPT-6 Luna | Gemini 3.5 Flash-Lite |
|---|---|---|---|
| 输入 / 输出(每1M) | $0.10 / $0.50 | $0.10 / $0.50 | $0.30 / $2.50 |
| 长提示词定价 | 100K以上为0.50美元 / 2.50美元 | 272K以上为0.20美元 / 0.75美元 | 固定费率 |
| 缓存读取(每1M) | $0.01 | $0.01 | 0.03美元 + 存储费 |
| 上下文窗口 | 1M tokens | 1,050,000 tokens | 1,048,576 tokens |
| 最大输出 | 128K tokens | 128,000 tokens | 65,536 tokens |
| 输入 | 文本、图像 | 文本、图像 | 文本、图像、视频、音频、PDF |
| 推理控制 | 自适应思考 + 努力程度(默认 medium) | reasoning.effort none 到 max(默认 medium) | 支持思考 |
| 计算机使用 | SDK 支持(beta) | 支持(Responses API) | 支持(Preview) |
| 批量折扣 | 50% | 50%(Batch 和 Flex) | 50% |
| 知识截止日期 | 2026年6月 | 2026年5月18日 | 未列于模型页面 |
| 在哪里运行 | Claude API、Bedrock、Google Cloud、Microsoft Foundry、AWS 上的 Claude Platform | OpenAI API | Gemini API |
来源: Anthropic 文档, Anthropic 公告, OpenAI 模型页面, OpenAI 定价, Google 模型页面, Google 定价. 标准档列表价格,核实于2026年10月7日。
交互式解读
关键要点
- 100K token以内的提示词,每1M token输入0.10美元、输出0.50美元。
- 1M上下文,128K输出,带有努力程度设置(默认
medium). - 在 OSWorld 2.1 上达到 72.4%,而 Haiku 4.5 为 15.7%(Anthropic 报告的数据)。
- 与 GPT-6 Luna 相同的短上下文定价;超过 100K 令牌时 Luna 更便宜。
- 定位于 Opus 5.5 和 Sonnet 5.5 之下的子代理,而非编码主力。
查看 技术细节。 所有功劳归于该项目的研究者。此外,欢迎在 Twitter 上关注我们,别忘了加入我们的 150k+ML SubReddit 并订阅 我们的新闻通讯。等等!你用 Telegram 吗? 现在你也可以在 Telegram 上加入我们了。
该文章 Anthropic 发布 Claude Haiku 5.5:一款拥有 1M 上下文、每百万输入 token 定价为 0.10 美元的小型模型 首发于 MarkTechPost.