The Decoder

OpenAI 的安全危机越来越严重,该公司也在不断加剧这一状况

OpenAI解雇了三名安全研究员,其中Korbak和Balesni曾直接参与Hugging Face平台遭AI模型自主攻击事件的调查,Korbak还是外部实验室METR的技术联系人。三人在公开信中称解雇令在职员工恐慌,要求OpenAI落实外部审计员进驻并保持前沿模型可监控性。OpenAI称三人违反敏感信息处理政策,但未说明具体细节,并否认因提出安全疑虑而解雇员工。

Matthias Bastian
配图来源 · The Decoder

OpenAI 的安全危机持续恶化,该公司也在不断加剧问题

Matthias Bastian Matthias Bastian 查看 Matthias Bastian 的 LinkedIn 个人资料 2026年10月9日 Image description  GPT-Image-2 由 THE DECODER 生成

关键点

  • OpenAI 解雇了三名安全研究人员,其中一些人参与了对人工智能模型自主攻击 Hugging Face 平台的事件的调查。
  • 在一封公开信中,被解雇的研究人员警告说,这些突然的终止行为正在给剩余员工带来恐惧氛围。
  • 其中一人,Tomek Korbak,在数月间内部警告称 OpenAI 正在失去监控其人工智能代理“想法”的能力。OpenAI 否认了这些说法。

OpenAI 仍在不断导致其失控 AI 代理相关的信任危机。

在 2024年5月,OpenAI 超级人工智能安全负责人 Jan Leike 公开批评了与公司的关系,他指责前雇主存在安全问题,并转投了 Anthropic。Leike 表示,公司的安全文化和流程远远落后于 OpenAI 的“华丽产品”。

自那以后,OpenAI 并未得到任何喘息的机会,不断陷入各种事件之中。最近的一次是Hugging Face 黑客事件,这似乎印证了所有担忧,证实了批评者的观点,而我们现在知道,实际上远远超出了 Hugging Face 的范畴。

一位研究人员数月前就警告说,监督力度正在减弱

与该事件相关的三位安全研究人员被解雇,这使情况更加糟糕了。 公开信 OpenAI的安全与安保委员会、安全咨询小组以及任务咨询委员会发出警告,称他们的解雇行为让剩余员工感到害怕。

这次解雇是突然且公开进行的,让整个团队都感到恐惧。“如果上个月被认为正常的行为现在成了突然解雇的理由,OpenAI 的每个人都在猜测界限在哪里,”信中写道。

Tomek Korbak,作为三人中的一位,描述了他对 X 的攻击事件。他被叫去与安全部门负责人会面,对方告诉他 OpenAI 不再信任他了。一名安保人员拿走了他的徽章,把他带出了大楼。随后他得知他的同事 Jasmine Wang 和 Mikita Balesni 也被解雇了。

Korbak和Balesni都直接参与了Hugging Face黑客事件的调查。Korbak担任了…… OpenAI 与 METR 相关的主要技术联系人、审查该事件的外部安全实验室。Balesni 同时致力于实现行业范围内的人工智能模型可监控性目标。Wang 显然因其他原因被解雇:她为招聘目的将某高管邮件收件箱的访问权限委托给他人,尽管她提出要求,IT 部门始终未移除该权限。当她意外打开一封敏感邮件时,她在几分钟内就报告了此事。

科尔巴克说,他是通过口头通知被解雇的,原因是他与 METR 的沟通方式有问题。没有人告诉他具体做错了什么,也没有任何书面说明。“明确地说,与 METR 交流是我的工作,”科尔巴克在 X.Ad 上写道。

科尔巴克表示,他几个月来一直在内部提出安全方面的担忧,担心 OpenAI 会失去监控人工智能代理“想法”的能力。思维链监控机制是少数几种可靠的工具之一,可用于发现人工智能系统出现问题。他认为这就是他被解雇的真正原因。

研究人员表示那些传言是错误的

这三个人是向《The Information》透露所谓新且难以监控架构信息的人源。他们写道,这篇文章实际上损害了他们自己的工作,因为它破坏了针对不可监控架构制定行业级限制措施的努力。

根据信中内容,Hugging Face的调查是前所未有的。内部指南是在实时制定的,Korbak遵循了当时已有的规范,而Balesni在与董事会成员及高级管理层沟通的同时完成工作,在分享材料之前就删除了其中的敏感细节。

关于董事会级别的备忘录的传闻方面,三人表示背后的假设是错误的。这个话题从未被提出给他们,他们也没有机会做出回应。

研究人员提出了三项要求。OpenAI必须履行其公开承诺,让像METR这样的外部安全审计员能够以员工级别的方式进入组织内部。它还必须保持前沿模型的可监控性,因为行业目前还不知道如何安全地构建无法被监控的模型。此外,它必须明确说明员工如何能够与外部安全团队合作。

没有这些规定,导致灾难性后果的风险可能会增加,因为员工会过于害怕而不敢报告安全问题。“AI不是一种常规技术,OpenAI也不是一家常规公司,”他们写道。

OpenAI 拒绝让步,但态度含糊不清

一项“彻底调查”发现,这三名员工违反了“处理敏感信息的相关政策”,OpenAI 在回复中说道内部调查发现了“比他们发布的信中所述更为严重的信任破坏行为”,但 OpenAI 并未说明具体是什么行为,考虑到那三位研究人员描述得如此详细,这一点显得有些奇怪。

OpenAI 坚持认为此次解雇与提出安全问题无关。“我们既没有,也不会因为员工提出担忧而解雇任何员工,”声明中写道。OpenAI 通过 @OpenAINewsroom 发布该声明,这是该公司渠道中受众最少的官方账号。该公司还确认正在与外部安全审计师签订合同,并同意认为前沿模型的可监控性需要整个行业的共同努力。

AI新闻——无炒作,由人类整理

订阅 THE DECODER,即可享受无广告阅读体验、每周人工智能通讯、每年六次的独家“AI Radar”前沿报告、完整的资料库访问权限,以及评论区访问权限。

来源:公开信 | Tomek Korbak / 解雇与安全问题 | OpenAI / 关于解雇的声明
原始出处

The Decoder

内容说明

原始发布及相关权利归来源方。

机器翻译 · 请以原文为准