@AnthropicAI 开发的 Claude Haiku 5.5 现已进入竞技场。请前往 Agent Arena 进行测试,分数即将公布!
在 Agent Arena 中,我们通过全球用户社区中的数百万个真实世界、长期范围的智能体任务来评估模型性能。模型可以访问网络搜索、文件系统和终端工具,以完成复杂的工作流程。排行榜则依据因果追踪方法,根据模型与平均模型的成果差异来衡量其性能。
Claude Haiku 5.5 也可在 Code Arena 中使用:WebDev、Text、Document 和 Vision。

