La crisis de seguridad de OpenAI sigue empeorando y la empresa sigue empeorando la situación
Matthias Bastian
Ver el perfil de LinkedIn de Matthias Bastian
Oct 9, 2026
GPT-Image-2 generado por THE DECODERPuntos clave
- OpenAI despidió a tres investigadores de seguridad, algunos de los cuales ayudaron a investigar un incidente en el que los modelos de IA atacaron de forma autónoma la plataforma Hugging Face.
- En una carta abierta, los investigadores despedidos advierten que las terminaciones abruptas están creando un clima de miedo entre los empleados restantes.
- Uno de ellos, Tomek Korbak, había advertido internamente durante meses que OpenAI estaba perdiendo la capacidad de monitorear lo que sus agentes de IA “piensan”. OpenAI niega las afirmaciones.
OpenAI sigue fracasando en resolver la crisis de confianza relacionada con sus agentes de IA deshonestos.
De vuelta en Mayo de 2024, Jefe de seguridad de la IA super de OpenAI Jan Leike destruyó su relación con la empresa cuando criticó públicamente a su antiguo empleador y se fue a trabajar para Anthropic. Según Leike, la cultura y los procesos de seguridad estaban quedando atrás en comparación con los “productos brillantes” de OpenAI.
Desde entonces, OpenAI no ha tenido un día bueno, pasando de un incidente a otro. El último fue el ataque de Hugging Face, que parecía confirmar todos los temores, validar los temores de los críticos, y, como ahora sabemos, lo que ocurrió fue mucho más allá de Hugging Face.
Un investigador advirtió durante meses que la supervisión estaba disminuyendo
La destitución de tres investigadores de seguridad relacionados con el incidente ha empeorado las cosas. En una carta abierta dirigida al Comité de Seguridad y Seguridad de OpenAI, al Grupo de Asesoría en Seguridad y al Consejo de Asesoría de Misión, los tres advierten que su destitución asusta a los empleados que permanecen.
Las destituciones fueron abruptas y públicas, y generaron miedo en todo el equipo. “Si la conducta que se consideraba normal el mes pasado ahora constituye motivo para destituciones repentinas, todos en OpenAI se quedan sin saber dónde termina la línea”, dice la carta.
Tomek Korbak, uno de los tres, describió su expulsión de X. Fue llamado a una reunión con el jefe del departamento de seguridad, donde le dijeron que OpenAI ya no confiaba en él. Un oficial de seguridad tomó su tarjeta y lo sacó del edificio. Luego se enteró de que sus colegas, Jasmine Wang y Mikita Balesni, también habían sido despedidos.
Korbak y Balesni estuvieron directamente involucrados en la investigación del hackeo de Hugging Face. Korbak actuó como el contacto técnico principal de OpenAI para METR, el laboratorio externo de seguridad que examinó el incidente. Balesni trabajó paralelamente en los compromisos a nivel industrial para la monitorización de modelos de IA. Wang, al parecer, fue despedida por otra razón: había delegado el acceso al buzón de correo electrónico de un ejecutivo para fines de reclutamiento, y TI nunca lo eliminó, a pesar de su solicitud. Cuando abrió accidentalmente un correo sensible, lo reportó en pocos minutos.
Korbak dice que le dijeron verbalmente que fue despedido por la forma en que se comunicaba con METR. Nadie le dijo exactamente qué había hecho mal, y nada se escribió. “Para ser claros, hablar con METR era mi trabajo”, escribe Korbak en X.Ad
Korbak dice que había expresado preocupaciones de seguridad internamente durante meses, temiendo que OpenAI estuviera perdiendo la capacidad de monitorear lo que los agentes de IA “piensan”. La capacidad de monitoreo del proceso de pensamiento es uno de los pocos herramientas fiables para detectar que los sistemas de IA se comportan mal. Cree que esa fue la verdadera razón por la que fue despedido.
Los investigadores dicen que los rumores son falsos
Los tres niegan ser la fuente de una filtración a The Information sobre arquitecturas supuestamente nuevas y menos supervisables. El artículo, en realidad, perjudicó su propio trabajo, escriben, porque socavó los esfuerzos en curso para establecer restricciones en toda la industria para las arquitecturas no supervisables.
La investigación de Hugging Face fue sin precedentes, según dice la carta. Las directrices internas se estaban redactando en tiempo real; Korbak seguía las normas establecidas en ese momento, y Balesni realizaba su trabajo con los miembros del consejo y el liderazgo senior al corriente, eliminando detalles sensibles de los materiales antes de compartirlos.
En cuanto a los rumores sobre un memorando a nivel de junta directiva, los tres afirman que la suposición subyacente es incorrecta. El tema nunca fue planteado con ellos, y nunca tuvieron la oportunidad de responder.
Los investigadores exigen tres cosas. OpenAI debe cumplir con sus compromisos públicos de incorporar auditorías de seguridad externas como METR con acceso a nivel de empleado dentro de la organización. También debe preservar la monitorabilidad de los modelos emergentes, ya que la industria aún no sabe cómo construir de manera segura modelos que no pueden ser monitoreados. Además, debe definir claramente cómo los empleados pueden trabajar con grupos de seguridad externos.
Sin esas reglas, el riesgo de un resultado catastrófico podría aumentar, ya que los empleados tendrán demasiado miedo para señalar problemas de seguridad. “La IA no es una tecnología normal, y OpenAI no es una empresa normal”, escriben.
OpenAI se niega pero mantiene la ambigüedad
Un “investigación exhaustiva” reveló que los tres empleados violaron “políticas claras sobre el manejo de información sensible”, OpenAI dicho en una respuesta. La investigación interna reveló “una brecha significativa de confianza que supera lo que se detalla en la carta que publicaron”, pero OpenAI no indica qué fue exactamente esa brecha, lo cual parece extraño teniendo en cuenta cuán específicas fueron las explicaciones de los tres investigadores.
OpenAI insiste en que los despidos no tienen nada que ver con la generación de preocupaciones de seguridad. “No hemos y no despediremos a ningún de nuestros empleados por plantear preocupaciones”, dice la declaración. OpenAI publicó su comunicado a través de @OpenAINewsroom, la cuenta oficial con el público más pequeño entre los canales de la empresa. La compañía también confirmó que está trabajando en contratos con auditores externos de seguridad y acordó que la monitoreabilidad del modelo frontier requiere un compromiso a nivel industrial.
Noticias sobre IA Sin El Eufómeno – Seleccionadas por Humanos
Suscríbase a THE DECODER para leer sin anuncios, un boletín semanal sobre IA, nuestro informe exclusivo “AI Radar” seis veces al año, acceso completo al archivo y acceso a nuestra sección de comentarios.
Fuente: Carta abierta | Tomek Korbak / despidos y preocupaciones de seguridad | OpenAI / declaración sobre los despidos