OpenAI의 안전 위기 상황은 점점 악화되고 있으며, 회사는 상황을 더욱 악화시키고 있습니다
마티아스 바스티안
마티아스 바스티안의 링크드인 프로필을 보기
Oct 9, 2026
GPT-Image-2가 THE DECODER에 의해 생성됨주요 내용
- OpenAI는 세 명의 안전 연구원을 해고했으며, 그 중 일부는 AI 모델이 Hugging Face 플랫폼을 자율적으로 공격하는 사건을 조사하는 데 도움을 주었습니다.
- 공개 서한에서 해고된 연구원들은 갑작스러운 해고가 남아있는 직원들 사이에 공포의 분위기를 조성하고 있다고 경고했다.
- 그 중 한 명인 토메크 코르바크는 몇 달 동안 내부적으로 OpenAI가 자사의 AI 에이전트가 “생각하는 것”을 감시하는 능력을 잃고 있다고 경고했습니다. OpenAI는 이러한 주장을 부정합니다.
OpenAI는 자체 불량 AI 에이전트로 인한 신뢰 위기를 계속해서 발생시키고 있습니다.
2024년 5월에 OpenAI의 슈퍼 AI 안전 책임자인 Jan Leike는 공개적으로 이전 고용주를 비판하고 Anthropic으로 이직함으로써 회사와의 관계를 망쳤습니다. Leike는 안전 문화와 프로세스가 OpenAI의 “매력적인 제품”보다 뒤처지고 있다고 말했습니다.
그 이후로 OpenAI는 결코 평탄한 상황을 맞이하지 못했으며, 한 사건에서 다른 사건으로 이어지는 상황이 계속되고 있습니다. 최근의 사례로는 Hugging Face 해킹 사건이 있습니다. 이 사건은 모든 우려를 확인시켜 주는 것 같았습니다, 비판자들의 주장을 뒷받침해 주었습니다, 그리고 이제 우리는 알고 있듯이 Hugging Face를 넘어서는 수준까지 진행되었습니다.
한 연구원이 몇 달 동안 주의가 소홀해질 것이라고 경고했습니다
이 사건과 관련된 세 명의 안전 연구원의 해고로 상황이 더욱 악화되었습니다. OpenAI의 안전 및 보안 위원회, 안전 자문 그룹, 임무 자문 위원회에 보내는 공개 서한에서 이 세 명은 자신들의 해고가 남아 있는 직원들을 두렵게 만든다고 경고했습니다.
해고는 갑작스럽고 공개적으로 이루어졌으며, 팀 전체에 두려움을 불러일으켰습니다. “지난 달에는 정상적인 것으로 여겨졌던 행동이 이제 갑작스러운 해고의 근거가 된다면, OpenAI의 모든 사람들은 경계선이 어디인지 알 수 없게 됩니다.”라고 편지에는 쓰여 있습니다.
Tomek Korbak는 세 명 중 한 명으로, X에서의 해고에 대해 설명했습니다. 그는 안전부서 책임자와의 회의에 소집되었고, OpenAI가 더 이상 그를 신뢰하지 않는다고 들었습니다. 보안 요원이 그의 배지를 가져가며 건물 밖으로 데려갔습니다. 그 후 그는 동료인 Jasmine Wang과 Mikita Balesni도 해고되었다는 사실을 알게 되었습니다.
코르바크와 발레스니는 모두 Hugging Face 해킹 조사에 직접 관여했습니다. 코르바크는 OpenAI의 METR을 위한 주요 기술 담당자로서, 이 사건을 조사한 외부 안전 연구소를 담당했습니다. 발레스니는 산업 전체에서 AI 모델 감시 가능성에 대한 약속과 관련하여 병행으로 일했습니다. 왕은 다른 이유로 해고된 것으로 보입니다: 그녀는 채용 목적으로 임원의 이메일 인박스 접근 권한을 위임했으며, 그녀가 요청했음에도 IT 부서가 그 권한을 제거하지 않았습니다. 그녀가 실수로 민감한 이메일을 열어버렸을 때, 그녀는 몇 분 안에 그것을 보고했습니다.
코르바크는 METR과의 소통 방식 때문에 해고당했다고 말합니다. 자신이 무엇을 잘못했는지에 대해서는 아무도 말해주지 않았으며, 문서로도 기록되지 않았습니다. “명확히 말하자면, METR과 대화하는 것은 제 업무였습니다.” 코르바크는 X.Ad에 이렇게 썼습니다.
코르바크는 몇 달 동안 내부적으로 안전 문제에 대한 우려를 제기해왔다고 말했습니다. 그는 OpenAI가 AI 에이전트가 "생각하는 것"을 감시하는 능력을 잃고 있다고 걱정했습니다. 이 사고 과정을 추적할 수 있는 기능은 AI 시스템이 잘못된 행동을 하는 것을 포착하는 몇 안되는 신뢰할 수 있는 도구 중 하나입니다라고 그는 말했습니다. 그는 이것이 자신이 해고된 진짜 이유라고 믿습니다.
연구자들은 그 소문이 잘못된 것이라고 말합니다
세 사람이 새로운, 감시가 어려운 아키텍처에 관한 정보가 The Information에 유출된 원인이라고 합니다. 그들은 기사가 자신들의 업무에 해를 끼쳤다고 말합니다. 왜냐하면 비감시형 아키텍처에 대한 산업 전체의 규제를 설정하려는 노력을 저해하기 때문입니다.
그 편지에 따르면, Hugging Face의 조사는 전례 없는 것이었다. 내부 지침은 실시간으로 작성되었으며, 코르바크는 당시 존재했던 규범을 준수했고, 발레스니는 이사회 멤버와 고위 경영진과 공유하기 전에 자료에서 민감한 정보를 삭제했다.
이사회 수준의 메모에 관한 소문에 대해, 세 사람은 그 기반이 잘못되었다고 말했습니다. 이 주제는 그들과 아무런 논의도 되지 않았으며, 그들은 반응할 기회도 없었습니다.
연구자들은 세 가지 요구사항을 제시합니다. OpenAI는 METR과 같은 외부 안전 감사자들을 조직 내 직원 수준의 접근 권한으로 포함시키는 공개적 약속을 준수해야 합니다. 또한 최첨단 모델의 감시 가능성을 유지해야 합니다는, 현재 업계가 감시할 수 없는 모델을 안전하게 구축하는 방법을 아직 알지 못하기 때문입니다. 그리고 직원들이 외부 안전 그룹과 어떻게 협력할 수 있는지 명확히 규정해야 합니다.
그러한 규칙이 없다면 재앙적인 결과의 위험이 증가할 수 있습니다. 직원들이 안전 문제를 신고하는 것을 너무 두려워하기 때문입니다. “AI는 정상적인 기술이 아니며, OpenAI도 정상적인 회사가 아닙니다”라고 그들은 썼습니다.
OpenAI는 반박했지만 구체적인 내용은 밝히지 않았습니다.
“철저한 조사” 결과, 세 명의 직원이 “민감 정보 처리에 관한 명확한 정책을 위반했다”는 것이 밝혀졌습니다. OpenAI는 응답에서 이렇게 말했습니다. 내부 조사 결과 “그들이 발표한 서류에 명시된 것보다 훨씬 심각한 신뢰 침해가 있었다”는 것이 드러났지만, OpenAI는 그 침해가 구체적으로 무엇인지 밝히지 않았습니다. 세 연구원이 자신의 진술에서 매우 구체적으로 설명했음에도 불구하고 이는 이상한 일입니다.
OpenAI는 해고가 안전 문제 제기와는 아무런 관련이 없다고 주장합니다. “우리는 안전 문제를 제기한 직원을 해고한 적이 없으며, 앞으로도 그러지 않을 것입니다”라고 성명서에 명시되어 있습니다. OpenAI는 회사의 채널 중 가장 팬이 적은 공식 계정인 @OpenAINewsroom을 통해 이 성명을 발표했습니다. 또한 회사는 외부 안전 감사관과의 계약 작업을 진행하고 있으며, 프론티어 모델의 모니터링 가능성에 대한 산업 전체의 노력이 필요하다고 인정했습니다.
AI 뉴스 – 과장 없이, 인간이 선별한 내용
THE DECODER에 가입하여 광고 없는 읽기, 주간 AI 뉴스레터, 매년 6회 발행되는 독점적인 "AI Radar" 전선 보고서, 전체 아카이브 접근 권한, 그리고 우리의 코멘트 섹션에 대한 접근 권리를 얻으세요.
출처: 공개 서한 | Tomek Korbak / 해고 및 안전 문제 | OpenAI / 해고에 관한 성명