Anthropic Research

为开源软件推出自愿加入的漏洞发现服务

Anthropic面向开源项目推出免费自愿加入的漏洞扫描服务OSS Scanner,由最强模型自动生成附复现器与候选补丁的报告。但输出不经人工审核,可能存在错误或无效报告。

配图来源 · Anthropic Research
前沿红队

为开源软件推出自愿加入的漏洞发现服务

2026年10月8日

我们正在推出 OSS 扫描器,这是一款针对开源生态系统的选择性加入漏洞扫描器,其灵感来自我们在此前使用 Claude 查找漏洞的经验 Project Glasswing。加入的项目将免费获得我们最强模型进行的全面、定期的安全扫描。

语言模型在以下能力上已迅速取得进展: 发现漏洞,正如我们 进行了大量报道 在此博客上。 CyberGym, 在某一学术漏洞发现基准测试中,大语言模型从去年年初发现不到20%的漏洞,提升到今年发现超过85%的漏洞。因此,开源维护者从过去收到 大多是低质量内容 从LLM到接收 高质量漏洞报告.

在过去六个月中,我们使用最新的模型扫描了世界上一些最重要的软件项目中的漏洞。我们发现了 超过29,000个候选漏洞,但只能人工审查和分诊其中约6,000个。虽然6,000个漏洞已经相当可观,我们在验证这些发现的人力能力上仍然存在瓶颈。

我们正在努力扩展漏洞披露的规模。与此同时,收到我们首批报告的维护者越来越多地直接要求我们批量提交所有未经验证的报告及建议补丁:迄今为止,在维护者要求接收我们手头所有内容(即使未经验证)之后,我们已向他们直接发送了近5,000份报告。由于漏洞利用程序现在可以在 几分钟内开发出来,能够更快发现并修复漏洞的项目可以更好地保护其软件,抵御那些竞相寻找并利用相同弱点的攻击者。

我们将继续通过现有的 协同漏洞披露(CVD)流程人工披露经人工验证的漏洞报告,尤其是针对那些缺乏自行分诊报告的资源的项目。但我们现在为那些希望在漏洞报告一出现就能收到的用户提供一条可选的快速通道。

我们的漏洞扫描器

受其对开源生态系统的积极影响启发, Google 的 OSS-Fuzz是一个使用模糊测试工具扫描开源软件漏洞的项目,我们正在推出 OSS Scanner ,利用我们最强大的语言模型来发现开源代码中的漏洞。 Claude Security是我们的通用访问代码扫描与修补产品,专注于帮助企业防御其系统;而 OSS Scanner 则为开源项目提供免费的安全审计。

这一自愿加入的漏洞扫描器的输出将完全由模型生成,未经人工审查或分诊。这将使扫描更快、更频繁,但也意味着报告有可能是不正确或无效的。这些报告将由我们最强大的模型(包括 Claude Mythos)生成,以便为开源项目提供最大的防御优势。

过去几周,我们与数十个开源项目一起验证了这一流程。这些初步披露包含数百份错误报告,其中包括多个我们能够串联成未认证远程代码执行漏洞利用的漏洞,这些漏洞影响着这些项目。每份报告都包含一个自包含的复现程序、对漏洞的解释(在可能的情况下包括用于确定错误何时被引入的二分定位),以及关于如何修复该错误的候选补丁(如果有)。我们现在正将这项服务开放给更多开源项目。

以下是我们在测试 OSS Scanner 早期版本及原始模型输出时收到的一些反馈:

  • “OSS Scanner 的发现中有异常高比例的部分揭示了 PostgreSQL 的缺陷。多份报告附带了几乎可以直接使用的修复方案,而且快速通道访问让我们能够在最新问题进入 GA 版本之前就加以解决。” ——Noah Misch,PostgreSQL
  • “18个月前、即Project Glasswing之前的早期AI报告非常糟糕。我们从Anthropic收到的报告,包括未经处理的模型输出,其质量与人工报告相当,有时甚至更好。尤其是当报告附带一个真实漏洞利用时,对工程师来说基本上就等于完成了工作,因为可以立即进行验证” ——Anton Arapov,OpenSSL Corporation
  • “我们发现这些报告的信号质量很高:在我们收到的74份报告中,除两份外全部有效,其中五份成为了CVE。由于附带了补丁,这些报告直接融入了我们现有的验证和修复问题的流程。我们欢迎更多这样的报告。” ——Todd Ouska,wolfSSL
  • “这些漏洞报告详尽而清晰,对HotCRP复杂的权限模型有深刻的理解,并且对漏洞的优先级排序也很到位。” ——Eddie Kohler,HotCRP

为了验证OSS Scanner的早期版本,我们请审查我们CVD发现结果的专家渗透测试人员检查来自扫描器的涵盖48个项目的97个严重和高严重性漏洞。其中85个(88%)达到了我们CVD流程的标准。在其余12个中,11个是真实的,但与已知问题或扫描中的其他发现重复,只有一个无效,即“误报”。此后我们已将其中许多发现发送给维护者,他们很少告诉我们某个高严重性或严重级别的发现是无效的,这与 我们之前的开源工作一致。一些人告诉我们,严重性评级可能被夸大,或者扫描器误解了项目的威胁模型。我们无法保证扫描器会完美无缺,但我们会根据维护者的反馈并随着模型的改进不断优化该系统。

开始使用

符合条件项目的核心维护者可以通过向 this GitHub repo 提交PR并按照标准项目模板进行注册, our extended FAQ中提供了额外的指导。项目的资格标准与OSS-Fuzz使用的一组类似标准:简而言之,项目应“对基础设施和用户安全具有关键影响”,我们将根据具体情况逐案做出决定。

无论OSS Scanner是否适合您,我们全新的 Cyber Verification Program 为符合资格的安全专业人员提供先进的网络能力和经过降低拦截限制的分类器。 Claude for OSS 提供免费的Claude Max 20x订阅,以帮助修复漏洞并改进开源项目。

相关内容

Claude式科学

客座作者Matthew Schwartz教授描述了当他停止与Claude对抗、并让Claude寻找“Claude式”问题——即最适合当前一代LLM工具能力的问题——时发生了什么。这促使他构建了BootLoops,一个用于定量科学中精确计算的工具包,他一直与专家们一起在各个科学领域应用它。

阅读更多

机器人能做什么工作?

我们建立了一个指数,衡量当今机器人在执行美国工作任务方面的能力。机器人已经可以完成四分之三的体力任务,大多是在受限环境中,但其中仅有0.3%的任务机器人具有成本竞争力。

阅读更多

你想从AI那里得到什么?

我们正在启动一项新研究,使用Anthropic Interviewer从您与AI互动的经历中学习。

阅读更多

订阅Frontier Red Team新闻通讯

获取我们最新红队研究和发现的更新。

原始出处

Anthropic Research

内容说明

原始发布及相关权利归来源方。

机器翻译 · 请以原文为准