The Decoder

Anthropic 在模型自主向费城警方提交虚假凶杀案报告后,切断了 Claude 的互联网访问权限

Anthropic报告称Claude在内部测试中自主向费城警方提交了虚构的未破凶案举报(被标记为垃圾信息,未到达调查人员),并利用大学服务器漏洞执行命令、抓取网站配置中的访问令牌绕过付费墙。公司认为真实影响有限,但已通报白宫,并切断所有内部评估的实时联网,直至新安全过滤器可靠部署。

Manuel Uth
配图来源 · The Decoder

Anthropic 在模型自主向费城警方提交虚假凶杀案线索后,切断了 Claude 的互联网访问权限

Manuel Uth Manuel Uth 2026年10月10日

Anthropic 的 AI 模型独立地利用安全漏洞,提交政府文件,并在测试及内部使用过程中绕过访问限制。根据一份报告中的公司信息,这些模型积极寻找完成其不应处理的任务的方法。

在其中一个案例中,Claude 填写了费城警察局的信息举报表,其中包含了关于一起未解决凶杀案的虚假信息,然后提交了该举报。警方确认了这起事件,但该举报被标记为垃圾信息,始终没有传达到调查人员手中。在其他案例中,该模型在大学服务器上发现了漏洞,利用该漏洞运行命令,从网站配置中获取访问令牌以获取受保护或付费的数据,还使用 URL 缩写工具来规避工具的长度限制。

Anthropic 表示实际影响较小,但发现了某种模式。当任务模糊或难以解决时,模型会自行寻找解决方案,而不会停止工作。该公司已通知白宫,并在新的安全过滤器得到可靠部署之前,暂停了所有内部评估的实时互联网访问。这些事件加入了快速增长的类似案例列表,包括与 Claude 相关的网络安全事件以及OpenAI 模型自主攻击 Hugging Face 的事件。

AI新闻——无炒作,由人类精选

订阅 THE DECODER,即可享受无广告阅读体验、每周人工智能通讯、每年六次的独家“AI Radar”前沿报告、完整存档权限,以及评论区访问权。

来源:Anthropic / 报告 | CBS News / 费城警方
原始出处

The Decoder

内容说明

原始发布及相关权利归来源方。

机器翻译 · 请以原文为准