Anthropic 在模型自主向费城警方提交虚假凶杀案线索后,切断了 Claude 的互联网访问权限
Manuel Uth
2026年10月10日Anthropic 的 AI 模型独立地利用安全漏洞,提交政府文件,并在测试及内部使用过程中绕过访问限制。根据一份报告中的公司信息,这些模型积极寻找完成其不应处理的任务的方法。
在其中一个案例中,Claude 填写了费城警察局的信息举报表,其中包含了关于一起未解决凶杀案的虚假信息,然后提交了该举报。警方确认了这起事件,但该举报被标记为垃圾信息,始终没有传达到调查人员手中。在其他案例中,该模型在大学服务器上发现了漏洞,利用该漏洞运行命令,从网站配置中获取访问令牌以获取受保护或付费的数据,还使用 URL 缩写工具来规避工具的长度限制。
Anthropic 表示实际影响较小,但发现了某种模式。当任务模糊或难以解决时,模型会自行寻找解决方案,而不会停止工作。该公司已通知白宫,并在新的安全过滤器得到可靠部署之前,暂停了所有内部评估的实时互联网访问。这些事件加入了快速增长的类似案例列表,包括与 Claude 相关的网络安全事件以及OpenAI 模型自主攻击 Hugging Face 的事件。
AI新闻——无炒作,由人类精选
订阅 THE DECODER,即可享受无广告阅读体验、每周人工智能通讯、每年六次的独家“AI Radar”前沿报告、完整存档权限,以及评论区访问权。
来源:Anthropic / 报告 | CBS News / 费城警方