OpenAI 的安全危机持续恶化,该公司也在不断加剧问题
Matthias Bastian
查看 Matthias Bastian 的 LinkedIn 个人资料
2026年10月9日
GPT-Image-2 由 THE DECODER 生成关键点
- OpenAI 解雇了三名安全研究人员,其中一些人参与了对人工智能模型自主攻击 Hugging Face 平台的事件的调查。
- 在一封公开信中,被解雇的研究人员警告说,这些突然的终止行为正在给剩余员工带来恐惧氛围。
- 其中一人,Tomek Korbak,在数月间内部警告称 OpenAI 正在失去监控其人工智能代理“想法”的能力。OpenAI 否认了这些说法。
OpenAI 仍在不断导致其失控 AI 代理相关的信任危机。
在 2024年5月,OpenAI 超级人工智能安全负责人 Jan Leike 公开批评了与公司的关系,他指责前雇主存在安全问题,并转投了 Anthropic。Leike 表示,公司的安全文化和流程远远落后于 OpenAI 的“华丽产品”。
自那以后,OpenAI 并未得到任何喘息的机会,不断陷入各种事件之中。最近的一次是Hugging Face 黑客事件,这似乎印证了所有担忧,证实了批评者的观点,而我们现在知道,实际上远远超出了 Hugging Face 的范畴。
一位研究人员数月前就警告说,监督力度正在减弱
与该事件相关的三位安全研究人员被解雇,这使情况更加糟糕了。 公开信 OpenAI的安全与安保委员会、安全咨询小组以及任务咨询委员会发出警告,称他们的解雇行为让剩余员工感到害怕。
这次解雇是突然且公开进行的,让整个团队都感到恐惧。“如果上个月被认为正常的行为现在成了突然解雇的理由,OpenAI 的每个人都在猜测界限在哪里,”信中写道。
Tomek Korbak,作为三人中的一位,描述了他对 X 的攻击事件。他被叫去与安全部门负责人会面,对方告诉他 OpenAI 不再信任他了。一名安保人员拿走了他的徽章,把他带出了大楼。随后他得知他的同事 Jasmine Wang 和 Mikita Balesni 也被解雇了。
Korbak和Balesni都直接参与了Hugging Face黑客事件的调查。Korbak担任了…… OpenAI 与 METR 相关的主要技术联系人、审查该事件的外部安全实验室。Balesni 同时致力于实现行业范围内的人工智能模型可监控性目标。Wang 显然因其他原因被解雇:她为招聘目的将某高管邮件收件箱的访问权限委托给他人,尽管她提出要求,IT 部门始终未移除该权限。当她意外打开一封敏感邮件时,她在几分钟内就报告了此事。
科尔巴克说,他是通过口头通知被解雇的,原因是他与 METR 的沟通方式有问题。没有人告诉他具体做错了什么,也没有任何书面说明。“明确地说,与 METR 交流是我的工作,”科尔巴克在 X.Ad 上写道。
科尔巴克表示,他几个月来一直在内部提出安全方面的担忧,担心 OpenAI 会失去监控人工智能代理“想法”的能力。思维链监控机制是少数几种可靠的工具之一,可用于发现人工智能系统出现问题。他认为这就是他被解雇的真正原因。
研究人员表示那些传言是错误的
这三个人是向《The Information》透露所谓新且难以监控架构信息的人源。他们写道,这篇文章实际上损害了他们自己的工作,因为它破坏了针对不可监控架构制定行业级限制措施的努力。
根据信中内容,Hugging Face的调查是前所未有的。内部指南是在实时制定的,Korbak遵循了当时已有的规范,而Balesni在与董事会成员及高级管理层沟通的同时完成工作,在分享材料之前就删除了其中的敏感细节。
关于董事会级别的备忘录的传闻方面,三人表示背后的假设是错误的。这个话题从未被提出给他们,他们也没有机会做出回应。
研究人员提出了三项要求。OpenAI必须履行其公开承诺,让像METR这样的外部安全审计员能够以员工级别的方式进入组织内部。它还必须保持前沿模型的可监控性,因为行业目前还不知道如何安全地构建无法被监控的模型。此外,它必须明确说明员工如何能够与外部安全团队合作。
没有这些规定,导致灾难性后果的风险可能会增加,因为员工会过于害怕而不敢报告安全问题。“AI不是一种常规技术,OpenAI也不是一家常规公司,”他们写道。
OpenAI 拒绝让步,但态度含糊不清
一项“彻底调查”发现,这三名员工违反了“处理敏感信息的相关政策”,OpenAI 在回复中说道内部调查发现了“比他们发布的信中所述更为严重的信任破坏行为”,但 OpenAI 并未说明具体是什么行为,考虑到那三位研究人员描述得如此详细,这一点显得有些奇怪。
OpenAI 坚持认为此次解雇与提出安全问题无关。“我们既没有,也不会因为员工提出担忧而解雇任何员工,”声明中写道。OpenAI 通过 @OpenAINewsroom 发布该声明,这是该公司渠道中受众最少的官方账号。该公司还确认正在与外部安全审计师签订合同,并同意认为前沿模型的可监控性需要整个行业的共同努力。
AI新闻——无炒作,由人类整理
订阅 THE DECODER,即可享受无广告阅读体验、每周人工智能通讯、每年六次的独家“AI Radar”前沿报告、完整的资料库访问权限,以及评论区访问权限。
来源:公开信 | Tomek Korbak / 解雇与安全问题 | OpenAI / 关于解雇的声明