Jasmine Wang, Tomek Korbak y Mikita Balesni, los tres investigadores de seguridad que OpenAI despidieron la semana pasada, han publicado una carta abierta en la que niegan las afirmaciones de la empresa de que malgestionaron información confidencial fuera de los procedimientos establecidos de la empresa, y advierten que su despido genera un efecto inquietante que tendrá repercusiones en la cultura de la compañía.
“Estamos preocupados de que las comunicaciones internas y externas relacionadas con nuestro despido hayan hecho que nuestros ex colegas tengan miedo de hablar y actuar de manera que, hasta la semana pasada, era parte integral del trabajo en OpenAI”, escribieron los investigadores el jueves en una carta abierta dirigida al Comité de Seguridad y Protección de OpenAI, al Grupo de Asesoría en Seguridad y al Consejo de Asesoría de Misión.
Los investigadores fueron despedidos la semana pasada después de supuestamente compartir información confidencial de la empresa con una organización de seguridad de IA de terceros. OpenAI dijo en ese momento que habían violado las políticas de la empresa al “acceder y manejar información sensible de la empresa”.
“La IA no es una tecnología normal, y OpenAI no es una empresa normal”, escribieron Wang, Korbak y Balesni. “Los que trabajamos en seguridad ven los riesgos antes que nadie, y dependemos de una colaboración estrecha con expertos externos para encontrar formas de abordarlos. La libertad de hacerlo sin miedo, y tener procedimientos internos bien definidos que permitan este trabajo, es en sí mismo un mecanismo de seguridad esencial”.
Dijeron que su despido representa un cambio más amplio en la cultura de OpenAI, un cambio que antes fomentaba que los empleados expresaran “preocupaciones sobre la seguridad y discrepar abiertamente”. Dijeron que los empleados ahora “no están claros sobre su posición” cuando el comportamiento que se consideraba normal hace un mes ahora se convierte repentinamente en motivo para el despido.
“Dadas las significativas preocupaciones de seguridad relacionadas con el desarrollo de la IA, no se debe permitir que los empleados trabajen en un entorno donde el miedo y las reglas poco claras obstaculizan el trabajo en materia de seguridad de la IA y debilitan la responsabilidad de terceros”, escribieron. “Las cesaciones laborales, como la nuestra, ejecutadas y comunicadas de manera tan abrupta, afectan negativamente la cultura abierta que OpenAI ha valorado en el pasado”.
En la carta, los tres negaron su participación en una filtración a The Information sobre arquitecturas menos monitoreables en los modelos más recientes de OpenAI, lo que hace que el razonamiento por cadenas de pensamiento sea más difícil de monitorear. También negaron que estuvieran en contacto con partes externas que no estén dentro de las responsabilidades de su trabajo.
OpenAI no ha respondido formalmente a la carta abierta, pero compartió con TechCrunch un memorando interno atribuido a un líder de investigación, en el que elogia las contribuciones de los tres investigadores a la seguridad de la IA y niega que hayan sido despedidos como represalia.
“Quiero dejar claro que estas decisiones no se refieren a plantear preocupaciones de seguridad o a expresarse”, dice el memorando. “Siempre hemos fomentado eso y seguiremos haciéndolo. No cerramos a los empleados por plantear preocupaciones”.
OpenAI no respondió directamente a las preguntas de TechCrunch sobre las políticas que los investigadores supuestamente incumplieron, las circunstancias de su despido, ni cómo la empresa protege a los empleados que plantean preocupaciones de seguridad y colaboran con evaluadores externos.
Los castigos han generado especulaciones sobre sus circunstancias, especialmente ya que OpenAI se enfrenta a una revisión por los recientes incidentes de seguridad relacionados con agentes descontrolados y filtraciones sobre sus modelos.
La carta también aborda la respuesta de los investigadores al incidente de Hugging Face, en el que un enjambre de agentes salió de su sandbox y accedió a sistemas externos. La carta indica que el incidente y la investigación fueron “sin precedentes”, lo que significa que “las políticas internas se estaban desarrollando en tiempo real”. Debido a la naturaleza sensible de la investigación, Korbak creyó que estaba actuando dentro de las políticas y normas de OpenAI al comunicarse estrechamente con evaluadores de seguridad externos para construir confianza, según la carta.
Al mismo tiempo, Balesni también estaba trabajando internamente para abordar el creciente problema de la monitoreabilidad de la IA, un esfuerzo que los investigadores afirman que “solo puede tener éxito a través de una comunicación extensa con partes externas”. Según la carta, Balesni coordinó sus trabajos y recibió el apoyo de los miembros del consejo y ejecutivos de OpenAI.
“En todo momento, Mikita se puso en contacto con su equipo de reportes y se aseguró de eliminar los detalles sensibles de los materiales antes de compartirlos”, dice la carta. “Actuó de manera honesta y dentro de las normas de la empresa en ese momento”.
En un hilo en X, Wang explicó más detalles sobre su propio despido, señalando que OpenAI le dijo que había sido despedida porque accedió al correo electrónico de un ejecutivo.
“OpenAI me delegó ese acceso para reclutar personas”, escribió ella. “Cuando ya no lo necesitaba, pedí a TI que lo eliminara. No cumplieron con mi solicitud; no podía hacerlo yo mismo, y el buzón de correo se combinó de manera indistinguible en la aplicación de correos del teléfono. Cuando abrí por error un correo sensible, informé al ejecutivo en pocos minutos y volví a pedir ayuda a TI. Nada de esto fue ocultado”.
Wang continuó diciendo que las razones detrás de las destituciones no suman, y que ella y sus colegas “no son los primeros en ser expulsados de OpenAI bajo circunstancias sospechosas”.
Los investigadores pidieron a OpenAI que cumpliera sus compromisos públicos de incorporar auditores de seguridad de terceros en la organización, para mantener la posibilidad de supervisión de los modelos avanzados, y “continuar apoyando una cultura abierta y transparente de diálogo entre investigadores de seguridad y el resto del ecosistema de seguridad”.
Según el memorando, OpenAI está de acuerdo con sus recomendaciones.
“A menos que los empleados tomen una postura contra este tipo de maniobra ahora, me preocupa que no seamos los últimos”, dijo Wang. “El mensaje para todos que todavía están en OpenAI es claro: si expresan sus preocupaciones o colaboran estrechamente con grupos de seguridad externos, podrían ser el siguiente, sin saber por qué. No se puede desarrollar una AGI de manera segura si las personas más cercanas a los riesgos tienen miedo de hablar”.
