The Decoder

研究表明,AI代理团队浪费了大量标记,而实际的质量提升却几乎无法衡量

评测公司Vals AI在Vibe Code Bench上测试了GPT-6 Sol与Claude Opus 5.5的单智能体与团队模式,发现团队成本为单体的1.8至5.1倍,四次对比中仅一次有统计显著提升。Anthropic自身数据显示超过十个智能体后质量趋于停滞,OpenAI研究员Brown也称多智能体主要买来速度而非质量,且效果高度依赖任务类型。

Matthias Bastian
配图来源 · The Decoder

研究表明,AI代理团队浪费了大量标记,而实际的质量提升却几乎无法衡量

Matthias Bastian Matthias Bastian 查看 Matthias Bastian 的 LinkedIn 个人资料 2026年10月11日 Image description

研究表明,AI 代理团队的结果几乎与单个代理没有差异。

Evals公司Vals AI在“Vibe Code Bench”平台上,对GPT-6 Sol和Claude Opus 5.5进行了测试,测试内容包括单独运行和团队协作两种情况,以及两种推理水平:中等和最高推理强度。这些团队的成本是单个智能体的1.8倍到5.1倍。

在四项比较中,只有一项显示出统计上显著的改进:GPT-6 Sol在中等推理能力方面表现更好,团队得分高出7.3分。在最高推理能力方面,团队设置对 Sol 和 Opus 都没有带来5.5分的实际优势。结果表明,在大多数情况下,代理团队的额外成本并不值得,尤其是当模型已经处于全计算状态时。

Vals AI的基准测试显示了每个应用程序的成本与Vibe Code Bench上的得分之间的关系。箭头指向每个模型中的单一代理与其团队,表示相同的推理努力。团队成本更高,但得分提升甚微。| 图片:Vals AI
在将更多智能体加入Opus 5.5测试项目之后,Anthropic的性能提升幅度有所缩小。规模较大的团队能更快达到特定性能水平,但从10个智能体增加到100个智能体后,24小时内的得分提升仅轻微而已。在单独的ProgramBench测试中,速度提升与更高的令牌使用量相关。

Opus 5.5 任务 1 代理 10 个代理 30 个代理 100 个代理
知识库 0.53 0.70 0.71 0.74
精益定理证明 0.39 0.66 0.66 0.68

Fable 5.1在超过十个智能体的Lean定理证明任务中获得了更显著的性能提升,但在所有测试中仍低于Opus 5.5。在知识库任务中,当智能体数量从30个增加到100个时,Fable的得分实际上略有下降。

更多代理购买速度,但不会获得更好的输出

OpenAI 研究人员诺姆·布朗在 Dwarkesh Podcast 中证实,多智能体系统主要追求速度,而非更高的质量。4 个智能体可以 twice 更快地完成任务,但成本也相应增加两倍。当智能体数量达到 16 个时,这一趋势依然成立,但效率略有下降。

效果很大程度上取决于任务类型。网络研究和数学工作可以很好地并行处理,但写小说则不行,他说。向小说中投入10,000个智能体,就跟投入10,000个人去处理它一样毫无意义。布朗指出,将智能体数量扩大到非常巨大的规模仍然尚未被充分探索,因为成本实在太高。

OpenAI 开发者 Eric Provencher 最近警告说,正是出于这个原因,不应使用 智能体群。他认为这很可能是浪费钱,因为智能体之间的协调会失效。他将其称为“协调税”。

AI新闻——无炒作,由人类整理

订阅 THE DECODER,即可享受无广告阅读体验、每周人工智能通讯、每年六次的独家“AI Radar”前沿报告、完整的存档权限,以及评论区访问权。

继续阅读以了解完整情况。
订阅以获得无炒作的报道。

  • 完全访问 THE DECODER 上的所有文章
  • 无广告
  • 参与评论和社区讨论
  • 每周通过邮件发送的人工智能新闻汇总
  • 每年 6 次: “AI Radar” —— 深入探讨最重要的 AI 主题
  • 每日人工智能新闻,随时更新
  • 我们的完整十年档案
  • 由拥有10年以上AI经验的团队负责
订阅 The Decoder
原始出处

The Decoder

内容说明

原始发布及相关权利归来源方。

机器翻译 · 请以原文为准