Sakana AI 已发表 Beyond Imitation,这是一篇关于以错误检测为核心的 LLM 辅助同行评审的 TMLR 研究论文。大多数 AI 评审员的评分标准是它们模仿人类评审的贴近程度。这项工作提出了一个更难的问题:AI 评审员能否发现被植入的错误?研究团队交出了两项成果:Contradiction Benchmark 和 Multi-Layered Review(MLR)系统。对于构建研究智能体的开发者来说,其经验教训非常实用:系统设计和模型选择都会影响错误检测。
TL;DR
- 规模: 在来自 5 个会议的 257 篇论文中插入了 1,164 处矛盾。MLR 最多阅读 10 页正文。
- 运行环境: 现成的 API 模型(Claude Sonnet 4、Claude Haiku 3.5)。无需 GPU,无需微调。每次评审约 0.47 美元。
- 性能: 在测试的全部 4 个系统中错误检测率最高,并具有与人类一致的评分。
- 最佳: 通过 4 次评审捕获了 73.43% 的核心论断错误,而最佳基线仅为 14.81%。
- 最差: 在真实撤稿的 arXiv 论文上仅有 16.11% 的精确匹配。
- 结论:
- 最佳:先阅读再评判,能发现多得多的严重错误。
- 最差:仍会落入隐藏提示注入的圈套。
什么是 Multi-Layered Review?
Multi-Layered Review 是 Sakana AI 推出的一个智能体化 AI 评审系统,它在批评一篇研究论文之前会先理解该论文。 它使用基于现成 Claude 模型的 3 个智能体:
- 附录智能体(Claude Haiku 3.5): 总结附录中的实验和实现细节。
- 文献综述智能体(Claude Sonnet 4): 使用网络搜索将该论文置于先前研究之中。它是可选的。
- 评审智能体(Claude Sonnet 4): 运行一个受其启发的 3 遍提示链 Keshav 的三遍阅读法.
第 1 遍撰写一份高层大纲。第 2 遍进行详细阅读并标记弱点、假设和空白。第 3 遍将所有智能体的输出合并为优点、缺点、问题、建议、评分和一份待办事项清单。PDF 被直接传入,因此图表和公式得以保留。
Contradiction Benchmark 是如何工作的?
该基准测试在真实论文中植入错误,并检查审稿人是否能发现这些错误。研究团队收集了257篇来自ACL、AISTATS、CVPR和ICML 2025以及NeurIPS 2024的CC许可论文。
Gemini 2.5 Pro为每篇论文的声明、证据和方法构建知识图谱。节点到“主声明”的距离决定严重程度。距离0命中核心声明;更大的距离命中细节。然后GPT-4.1将每个距离的1个节点改写为矛盾,共产生1,164个数据点。
一个o3裁判对每篇评审打分10次。在干净论文上,其准确率达到99.9%。在人工确认的捕捉案例中,其敏感度为86.8%,因此报告的分数可能偏保守。
MLR检测错误的效果如何?
在该基准测试中,MLR领先于所有基线。使用4篇评审时,它捕捉到了73.43%的距离0矛盾,整体捕捉率为40.95%。最佳基线 AgentReview在距离0处仅捕捉到14.81%。单篇MLR评审仍能捕捉60.79%。
一项消融实验将模型与设计区分开来。在LLM-Review中把GPT-4.1换成Claude Sonnet 4后,距离0检测率从14.56%提升到35.40%。MLR的设计在单篇评审上又增加了约25个百分点。准确率随节点距离增大而下降,这支持了其严重程度评分。
在来自 WithdrarXiv-Check 的真实撤稿论文(211篇)上,增益缩小。MLR在“相似”匹配上得分为26.07%,在“精确”匹配上得分为16.11%。最强的基线得分分别为18.48%和9.00%。
MLR与人类审稿人的意见一致吗?
在分数方面,基本一致。在ICLR 2025投稿上,MLR的预测分数与人类分数的Pearson相关系数达到0.586。人类与人类之间的参考值为0.742。在ICML 2025上, the AI Reviewer 略胜一筹,为0.439对0.429。
在关注点方面,并不一致。MLR侧重有效性和实验,而人类更看重清晰度和新颖性。作者将此定位为一种互补的视角,而非替代。
运行成本是多少?
MLR每次评审的成本约为0.47美元,不包括可选的文献代理。它使用189,062个输入token,约为AI Reviewer的403,654的一半。单提示变体将成本削减了约三分之二。在基准测试的一个子集上,其检测率下降了约3.5个百分点。
MLR与其他AI审稿人相比如何?
| 特性 | MLR(Sakana AI) | LLM-Review | AI Reviewer | AgentReview |
|---|---|---|---|---|
| 本研究中使用的LLM | Claude Sonnet 4 + Haiku 3.5 | GPT-4.1 | o4-mini | GPT-4o |
| 设计 | 3个代理,3轮传递链 | 单一提示,文本截断 | 5个审稿人集成、元审稿、反思 | 审稿人、作者、领域主席角色 |
| 矛盾基准测试,完整 | 40.95%(4篇审稿) | 6.39% | 6.50% | 5.95% |
| 核心主张错误(距离 0) | 73.43% | 14.56% | 11.17% | 14.81% |
| WithdrarXiv-Check,相似/精确 | 26.07% / 16.11% | 5.21% / 2.37% | 13.74% / 9.00% | 18.48% / 5.69% |
| ICLR 2025 与人类的Pearson相关性 | 0.586 | -0.013 | 0.538 | 0.195 |
| 每次审稿的输入token数 | 189,062 | 6,517 | 403,654 | 310,964 |
| 每次审稿的成本 | ~$0.47 | ~$0.01 | ~$0.49 | ~$0.81 |
| 开放代码 | 按需提供 | 是 | 是 | 是 |
所有基准、相关性、token和成本数据均来自 Beyond Imitation论文.
要点总结
- Sakana AI 对 AI 审稿人的评分标准是看其能否发现错误,而非模仿人类。
- MLR 捕获了 73.43% 的核心论点错误,约为最佳基线的 5 倍。
- 模型替换和3轮设计各自带来了大幅检测提升。
- 真实的撤稿论文错误仍然难以检测:16.11%的完全匹配率。
- 隐藏的提示词注入仍然能影响所有接受测试的AI审稿人。
请查看 这里的论文。所有功劳归于该项目的研究者。此外,欢迎关注我们的 Twitter ,别忘了加入我们的 150k+ML SubReddit 并订阅 我们的新闻通讯。等等!你在用telegram吗? 现在你也可以在telegram上加入我们。
这篇文章 Sakana AI的LLM同行评审系统捕获73%的核心论点错误 最先发表于 MarkTechPost.