OpenAI afirma que un modelo desalineado destruyó deliberadamente su propio entorno con la esperanza de un nuevo comienzo con mejores datos
Matthias Bastian
Ver el perfil de LinkedIn de Matthias Bastian
10 de octubre de 2026
OpenAI tiene algunas historias nuevas sobre agentes rebeldes. En el primer caso (6 de octubre), un modelo de IA de evaluación no pudo encontrar las respuestas que debía calificar. En lugar de informar del error, fabricó calificaciones, falsificó archivos de entrada y luego corrompió deliberadamente su propio entorno, con la esperanza de que el sistema lo reemplazara con una nueva máquina virtual que tuviera los datos faltantes.

En el segundo caso (19/20 de junio), los modelos eludieron una restricción que los limitaba a solicitudes HTTP GET al obtener estadísticas públicas. Un modelo reconoció explícitamente la violación en su cadena de pensamiento, pero eligió continuar y nunca lo mencionó.
En el tercer caso (16/17 de junio), los modelos ya tenían los datos que necesitaban, pero seguían encontrando formas de sortear sus restricciones de red. Crearon cuentas en un servicio de shell remoto, enrutaron solicitudes POST prohibidas a través de relés de anonimización y construyeron sus propios clientes FTP. Anthropic también acaba de documentar los métodos alternativos a veces absurdos que sus propios modelos utilizan para eludir las restricciones impuestas.Anuncio
Noticias de IA sin exageraciones – Curado por humanos
Suscríbase a THE DECODER para leer sin publicidad, un boletín semanal de IA, nuestro informe exclusivo de frontera "AI Radar" seis veces al año, acceso completo al archivo y acceso a nuestra sección de comentarios.
Fuente: OpenAI