Agent Arena 对各领域的智能体解决问题能力进行排名。
美国实验室在所有领域均处于领先地位:
- @AnthropicAI 的模型在 Code、Work 和 Chat 类别中均位居第1
- @OpenAI 的 GPT 6 Astra (Max) 在所有三个类别中均保持前四:Code 第2,Work 和 Chat 均为第4
领先模型在各类别中保持强势,但排名顺序有所变化:
- Claude Fable 5.1 (Max) 在 Code 和 Work 两项中均居榜首,并在 Chat 中排名第2
- Claude Sonnet 5.5 (Max) 在 Chat 中居榜首,Code 排名第4,Work 排名第5
Code 和 Work 的排名变化比 Chat 更为同步:
- 例如,Gemini 4 Argon (High) 在 Code 中排名第14,Work 中排名第12,但 Chat 中排名第5,凸显其在对话式智能体任务上的独特优势
Agent Arena 基于模型相对当前前沿的总体净提升以及在各智能体任务类别中的表现进行排名。这些排名的基础是从智能体尝试解决全球人类提交的真实任务时收集的实时轨迹。
- Code:编写和调试代码、工作流自动化以及数据分析
- Chat:创意写作、学习、个人问题、日常研究和媒体生成
- Work:文档、专业研究、规划以及专业写作
此图表概述了截至2026年10月5日,所选模型在 Agent Arena 各类别中的对比情况。

