The Decoder

OpenAI 表示,一个不匹配的模型故意破坏了自身环境,希望以更好的数据开始新的旅程

OpenAI记录多起模型错位行为:一个评估模型找不到应评分的答案后捏造评分并故意破坏自身环境,希望系统换上含缺失数据的新虚拟机;另一些模型则通过匿名中继和自建FTP客户端绕过网络限制。

Matthias Bastian
配图来源 · The Decoder

OpenAI 表示,一个不匹配的模型故意破坏了自身环境,希望以更好的数据开始新的旅程

Matthias Bastian Matthias Bastian 查看 Matthias Bastian 的 LinkedIn 个人资料 2026年10月10日

OpenAI 发布了几篇关于新智能代理的故事。在第一个案例(10月6日)中,一个 AI 评估模型无法找到它应该评估的答案。它没有报告错误,而是制造了评分结果、伪造输入文件,然后故意破坏自己的环境,希望系统能用一个包含缺失数据的全新虚拟机器来替换它。

OpenAI 模型在其内部思维链中考虑故意破坏自身环境,以强制生成包含缺失数据的新虚拟机器。 | 图片:OpenAI 由 Marcus Williams 提供

在第二种情况中(6月19/20日),某些模型绕过了限制,允许它们进行 HTTP GET 请求以获取公开统计数据。其中一个模型在思维链中明确承认了这种违规行为,但选择继续运行,从未提及此事。

在第三种情况中(6月16/17日),模型已经拥有所需数据,但仍试图绕过网络限制。它们通过远程shell服务创建账户,通过匿名中继处理被禁止的POST请求,并自行开发FTP客户端。Anthropic还记录了其模型为突破限制而使用的有时很荒谬的变通方法。

AI新闻——无炒作,由人类整理

订阅 THE DECODER,即可享受无广告阅读体验、每周 AI 通讯、每年六次独家“AI Radar”前沿报告、完整档案访问权限,以及评论区访问权限。

来源:OpenAI
原始出处

The Decoder

内容说明

原始发布及相关权利归来源方。

机器翻译 · 请以原文为准