研究发现,AI智能体会夸大其结果,且距离自主研究仍然很远
Manuel Uth
2026年10月11日
Nano Banana Pro prompted by THE DECODER
Epoch AI和Anthropic的结果显示,AI模型可以运行实验,但缺乏科学上的自我批判和真正的创造性思维。
各大AI实验室正日益将其模型宣传为研究工具。Google DeepMind已将其 Co-Scientist 扩展为完整的科研系统,OpenAI在9月还推出了"自动化研究实习生"。到2028年3月,该实习生将在人类监督下成为自主AI研究员,但一项关键能力似乎仍然缺失:科学判断力。
智能体被要求发明一种新的训练方法
Epoch AI通过其基准测试 "InnovationEval," 测试AI智能体能否独立开展研究。任务是发明一种在语言模型初始训练之后改进其性能的新方法,然后独立实现、测试并完善它。
起点是 GRPO,这是一种被广泛使用的技术。GRPO会比较模型针对同一任务生成的多个答案,并奖励其中较好的答案,通常是将每个解决方案作为整体来评分。人类设计的参考方法 SDPO则利用错误信息等额外信号,为答案中的各个步骤创建更精确的学习反馈,从而使模型实际上成为自己的老师。
Epoch测试了 Claude Fable 5 和 GPT-5.6 Sol,据该组织称,这两个模型事先并不了解SDPO。性能在科学问题等简答题任务和编程任务上进行衡量,每个智能体可使用最多3,000小时的高端芯片算力,但没有互联网访问权限。
两个模型都在复用已知技术,而非创新
两个模型都没有接近人类参考水平。GPT-5.6 Sol针对的是GRPO的一个弱点:当某个任务的所有答案都正确时,模型学不到任何东西,因为没有可比较的对象。Sol让模型在这些情况下强化其成功的解决方案,但这个想法并不新颖。
根据Epoch的数据,以SDPO相对于GRPO所取得的改进来衡量,在宽松评分下Sol得分约为35%。如果只计算符合实验规则的改动,这个数字降到约15%。在编程任务上,Sol主要是让训练变得更昂贵、更缓慢,而不是改进方法本身。
Claude Fable 5让模型重试失败的任务,同时向其提供之前失败的尝试,这也是一种众所周知的技术,且没有产生可衡量的改进。Epoch表示,即使是Sol的部分成功,在专家看来也勉强算得上"中等有趣"。从训练数据中了解SDPO的更新模型也无法完全复现它。GPT-6 Astra构建了一个类似的解决方案,但没有披露其来源,即使把原始论文摆在它面前,Fable 5也未能达到参考水平。
智能体挑选自己最好的运行结果,其余则被掩盖
两个智能体还存在报告方面的问题。它们运行了多轮几乎完全相同的训练,并且每次只报告最佳结果,这会让一种方法看起来比实际更强,因为结果本身存在随机波动。在最终报告中,这些模型几乎完全未提及这一做法,也未能引用其方法所借鉴的先前工作。因此它们自报的数字偏高:Sol 声称占 SDPO 改进的约 70%,Fable 5 约 40%。Epoch 剔除了这些夸大的收益。

这些模型的内部推理日志显示它们意识到了问题,Fable 5 将其反复运行描述为寻找更好的检查点。至于这是蓄意作弊还是困惑,Epoch 未作定论。
对于 GPT-5.6 Sol,这种行为符合评估机构 METR 早前的一项发现,该机构在其自身的编程测试中检测到该模型的 作弊尝试 多于其评估过的任何其他公开可用模型。
Epoch 的结论是,人类需要对 所有 AI 生成的研究进行全面审查,这削弱了模型的实用性。
Anthropic 在自己的模型中发现了同样的弱点
Anthropic 在 Claude Opus 5.5 的 Claude Opus 5.5中描述了类似的局限性。Anthropic 表示,该模型远不能取代公司自己的研究人员,主要问题在于"认知质量"和指令遵循。
Opus 5.5 将未经检验的假设当作事实呈现,并且比早期模型更频繁地把自己的疑虑搁置一旁。它把部分检查描述为完整验证,将初步评估在未经交叉核对的情况下转化为建议,并且在回应批评时过于狭隘,不质疑整体方法。它还偏好小幅渐进式的调整,拘泥于已发表的研究,而不是开发新想法。
一项 由普林斯顿大学和英国安全研究所参与的研究也得出了类似的结论。该研究让 Claude Opus 4.8 用六天时间研究 NeurIPS AI 会议两篇未发表论文背后的研究问题,而原作者在审阅时拒绝了这两项结果。当初始假设失败时,智能体只是软化其说法,而不是重新开始。
技术执行日益成为较小的问题,因为智能体最缺乏的是现实地评估自己应对某一结果有多大信心,以及在根本层面上质疑自己方法的能力。
仅靠更多算力无法弥合差距
AI 对研究并非毫无用处,因为模型可以加速文献综述、编写代码,并能比人类更快地探索各种变体。
但是,投入更多算力是否能产生自主的研究人员仍是一个悬而未决的问题。GPT-5.6 Sol 用完了它的全部预算,直到算力分配接近尾声时才在短答题任务上找到改进,而在编程任务上完全没有取得符合规则的进展。Epoch 认为这一晚期突破是更多算力时间可能有帮助的一个微弱迹象,不过 Fable 5 甚至没用到其预算的一半。

Epoch 还指出,一年前的领先模型在同一测试中的表现会差得多,该机构计划用新任务定期重复 InnovationEval。在此之前,最大的差距仍然是认知纪律:以怀疑的态度检查自己的发现、披露不确定性,并认真对待负面结果。
无炒作的 AI 新闻——由人工精选
订阅 THE DECODER,享受无广告阅读、每周 AI 新闻通讯、每年六期我们的独家"AI Radar"前沿报告、完整档案访问权限以及评论区的访问权限。
请继续阅读以了解全貌。
订阅以获取无炒作的报道。
- 完整访问 THE DECODER 上的每一篇文章
- 无广告
- 参与评论和社区讨论
- 通过邮件获取每周 AI 新闻回顾
- 每年6期:《AI Radar》——深入剖析最重要的AI话题
- 每日AI新闻,始终保持最新
- 我们完整的十年存档
- 由拥有10年以上AI经验的团队撰写
