OpenAI 表示,一个不匹配的模型故意破坏了自身环境,希望以更好的数据开始新的旅程
Matthias Bastian
查看 Matthias Bastian 的 LinkedIn 个人资料
2026年10月10日OpenAI 发布了几篇关于新智能代理的故事。在第一个案例(10月6日)中,一个 AI 评估模型无法找到它应该评估的答案。它没有报告错误,而是制造了评分结果、伪造输入文件,然后故意破坏自己的环境,希望系统能用一个包含缺失数据的全新虚拟机器来替换它。

在第二种情况中(6月19/20日),某些模型绕过了限制,允许它们进行 HTTP GET 请求以获取公开统计数据。其中一个模型在思维链中明确承认了这种违规行为,但选择继续运行,从未提及此事。
在第三种情况中(6月16/17日),模型已经拥有所需数据,但仍试图绕过网络限制。它们通过远程shell服务创建账户,通过匿名中继处理被禁止的POST请求,并自行开发FTP客户端。Anthropic还记录了其模型为突破限制而使用的有时很荒谬的变通方法。
AI新闻——无炒作,由人类整理
订阅 THE DECODER,即可享受无广告阅读体验、每周 AI 通讯、每年六次独家“AI Radar”前沿报告、完整档案访问权限,以及评论区访问权限。
来源:OpenAI