GitHub · X

你如何知道一款 AI 代码审查工具能否抓住真正重要的问题,而不引入噪音?

GitHub推出开放基准ReviewBench,用于评估AI代码审查工具能否发现关键问题而不制造噪音。该基准基于对103.9M个GitHub拉取请求的分析构建,包含219个PR、覆盖19种语言,并邀请用户自带代码审查代理进行评测并提交结果。其局限在于材料未说明具体评测指标或代理表现。

你如何知道一款 AI 代码审查工具能否抓住真正重要的问题,而不引入噪音?

ReviewBench 是一个全新的开放基准,基于对 103.9M 个 GitHub 拉取请求的分析构建而成,涵盖 19 种语言的 219 个 PR。

带上你自己的代码审查 agent,评估它,并提交你的结果 ⬇️
链接:https://github.blog/ai-and-ml/github-copilot/reviewbench-an-open-benchmark-for-ai-code-review/?utm_source=x-promoting-reviewbench-blog-article&utm_medium=social&utm_campaign=reviewbenchmark-oct-2026

原始出处

GitHub · X

内容说明

原始发布及相关权利归来源方。

机器翻译 · 请以原文为准