MarkTechPost更新于

Sakana AI 的 LLM 同行评审系统捕获 73% 的核心论断错误

Sakana AI在TMLR论文中提出基于Claude的MLR审稿系统和含1,164处矛盾的基准,检出73.43%核心论断错误,远超基线14.81%,每篇约$0.47;但在真实撤稿论文上精确匹配率仅16.11%。

Sakana AI 已发表 Beyond Imitation,这是一篇关于以错误检测为核心的 LLM 辅助同行评审的 TMLR 研究论文。大多数 AI 评审员的评分标准是它们模仿人类评审的贴近程度。这项工作提出了一个更难的问题:AI 评审员能否发现被植入的错误?研究团队交出了两项成果:Contradiction Benchmark 和 Multi-Layered Review(MLR)系统。对于构建研究智能体的开发者来说,其经验教训非常实用:系统设计和模型选择都会影响错误检测。

TL;DR

  • 规模: 在来自 5 个会议的 257 篇论文中插入了 1,164 处矛盾。MLR 最多阅读 10 页正文。
  • 运行环境: 现成的 API 模型(Claude Sonnet 4、Claude Haiku 3.5)。无需 GPU,无需微调。每次评审约 0.47 美元。
  • 性能: 在测试的全部 4 个系统中错误检测率最高,并具有与人类一致的评分。
  • 最佳: 通过 4 次评审捕获了 73.43% 的核心论断错误,而最佳基线仅为 14.81%。
  • 最差: 在真实撤稿的 arXiv 论文上仅有 16.11% 的精确匹配。
  • 结论:
    • 最佳:先阅读再评判,能发现多得多的严重错误。
    • 最差:仍会落入隐藏提示注入的圈套。

什么是 Multi-Layered Review?

Multi-Layered Review 是 Sakana AI 推出的一个智能体化 AI 评审系统,它在批评一篇研究论文之前会先理解该论文。 它使用基于现成 Claude 模型的 3 个智能体:

  • 附录智能体(Claude Haiku 3.5): 总结附录中的实验和实现细节。
  • 文献综述智能体(Claude Sonnet 4): 使用网络搜索将该论文置于先前研究之中。它是可选的。
  • 评审智能体(Claude Sonnet 4): 运行一个受其启发的 3 遍提示链 Keshav 的三遍阅读法.

第 1 遍撰写一份高层大纲。第 2 遍进行详细阅读并标记弱点、假设和空白。第 3 遍将所有智能体的输出合并为优点、缺点、问题、建议、评分和一份待办事项清单。PDF 被直接传入,因此图表和公式得以保留。

Contradiction Benchmark 是如何工作的?

该基准测试在真实论文中植入错误,并检查审稿人是否能发现这些错误。研究团队收集了257篇来自ACL、AISTATS、CVPR和ICML 2025以及NeurIPS 2024的CC许可论文。

Gemini 2.5 Pro为每篇论文的声明、证据和方法构建知识图谱。节点到“主声明”的距离决定严重程度。距离0命中核心声明;更大的距离命中细节。然后GPT-4.1将每个距离的1个节点改写为矛盾,共产生1,164个数据点。

一个o3裁判对每篇评审打分10次。在干净论文上,其准确率达到99.9%。在人工确认的捕捉案例中,其敏感度为86.8%,因此报告的分数可能偏保守。

MLR检测错误的效果如何?

在该基准测试中,MLR领先于所有基线。使用4篇评审时,它捕捉到了73.43%的距离0矛盾,整体捕捉率为40.95%。最佳基线 AgentReview在距离0处仅捕捉到14.81%。单篇MLR评审仍能捕捉60.79%。

一项消融实验将模型与设计区分开来。在LLM-Review中把GPT-4.1换成Claude Sonnet 4后,距离0检测率从14.56%提升到35.40%。MLR的设计在单篇评审上又增加了约25个百分点。准确率随节点距离增大而下降,这支持了其严重程度评分。

在来自 WithdrarXiv-Check 的真实撤稿论文(211篇)上,增益缩小。MLR在“相似”匹配上得分为26.07%,在“精确”匹配上得分为16.11%。最强的基线得分分别为18.48%和9.00%。

MLR与人类审稿人的意见一致吗?

在分数方面,基本一致。在ICLR 2025投稿上,MLR的预测分数与人类分数的Pearson相关系数达到0.586。人类与人类之间的参考值为0.742。在ICML 2025上, the AI Reviewer 略胜一筹,为0.439对0.429。

在关注点方面,并不一致。MLR侧重有效性和实验,而人类更看重清晰度和新颖性。作者将此定位为一种互补的视角,而非替代。

运行成本是多少?

MLR每次评审的成本约为0.47美元,不包括可选的文献代理。它使用189,062个输入token,约为AI Reviewer的403,654的一半。单提示变体将成本削减了约三分之二。在基准测试的一个子集上,其检测率下降了约3.5个百分点。

MLR与其他AI审稿人相比如何?

特性MLR(Sakana AI)LLM-ReviewAI ReviewerAgentReview
本研究中使用的LLMClaude Sonnet 4 + Haiku 3.5GPT-4.1o4-miniGPT-4o
设计3个代理,3轮传递链单一提示,文本截断5个审稿人集成、元审稿、反思审稿人、作者、领域主席角色
矛盾基准测试,完整40.95%(4篇审稿)6.39%6.50%5.95%
核心主张错误(距离 0)73.43%14.56%11.17%14.81%
WithdrarXiv-Check,相似/精确26.07% / 16.11%5.21% / 2.37%13.74% / 9.00%18.48% / 5.69%
ICLR 2025 与人类的Pearson相关性0.586-0.0130.5380.195
每次审稿的输入token数189,0626,517403,654310,964
每次审稿的成本~$0.47~$0.01~$0.49~$0.81
开放代码按需提供是是是

所有基准、相关性、token和成本数据均来自 Beyond Imitation论文.

要点总结

  • Sakana AI 对 AI 审稿人的评分标准是看其能否发现错误,而非模仿人类。
  • MLR 捕获了 73.43% 的核心论点错误,约为最佳基线的 5 倍。
  • 模型替换和3轮设计各自带来了大幅检测提升。
  • 真实的撤稿论文错误仍然难以检测:16.11%的完全匹配率。
  • 隐藏的提示词注入仍然能影响所有接受测试的AI审稿人。


请查看 这里的论文。所有功劳归于该项目的研究者。此外,欢迎关注我们的 Twitter ,别忘了加入我们的 150k+ML SubReddit 并订阅 我们的新闻通讯。等等!你在用telegram吗? 现在你也可以在telegram上加入我们。

这篇文章 Sakana AI的LLM同行评审系统捕获73%的核心论点错误 最先发表于 MarkTechPost.

原始出处

MarkTechPost

内容说明

原始发布及相关权利归来源方。

机器翻译 · 请以原文为准