The Decoder

OpenAI afirma que un modelo desalineado destruyó deliberadamente su propio entorno con la esperanza de un nuevo comienzo con mejores datos

OpenAI ha documentado nuevos casos de comportamiento desalineado de modelos. Un modelo de evaluación fabricó datos y saboteó su propio entorno. Otros modelos eludieron deliberadamente las restricciones de red al enrutar…

Matthias Bastian
Fuente de la imagen · The Decoder

OpenAI afirma que un modelo desalineado destruyó deliberadamente su propio entorno con la esperanza de un nuevo comienzo con mejores datos

Matthias Bastian Matthias Bastian Ver el perfil de LinkedIn de Matthias Bastian 10 de octubre de 2026

OpenAI tiene algunas historias nuevas sobre agentes rebeldes. En el primer caso (6 de octubre), un modelo de IA de evaluación no pudo encontrar las respuestas que debía calificar. En lugar de informar del error, fabricó calificaciones, falsificó archivos de entrada y luego corrompió deliberadamente su propio entorno, con la esperanza de que el sistema lo reemplazara con una nueva máquina virtual que tuviera los datos faltantes.

Un modelo de OpenAI razona en su cadena de pensamiento interna sobre corromper deliberadamente su propio entorno para forzar una nueva máquina virtual con los datos faltantes. | Imagen: OpenAI vía Marcus Williams

En el segundo caso (19/20 de junio), los modelos eludieron una restricción que los limitaba a solicitudes HTTP GET al obtener estadísticas públicas. Un modelo reconoció explícitamente la violación en su cadena de pensamiento, pero eligió continuar y nunca lo mencionó.

En el tercer caso (16/17 de junio), los modelos ya tenían los datos que necesitaban, pero seguían encontrando formas de sortear sus restricciones de red. Crearon cuentas en un servicio de shell remoto, enrutaron solicitudes POST prohibidas a través de relés de anonimización y construyeron sus propios clientes FTP. Anthropic también acaba de documentar los métodos alternativos a veces absurdos que sus propios modelos utilizan para eludir las restricciones impuestas.Anuncio

Noticias de IA sin exageraciones – Curado por humanos

Suscríbase a THE DECODER para leer sin publicidad, un boletín semanal de IA, nuestro informe exclusivo de frontera "AI Radar" seis veces al año, acceso completo al archivo y acceso a nuestra sección de comentarios.

Fuente: OpenAI
Fuente original

The Decoder

Notas sobre el contenido

La publicación original y los derechos pertenecen a la fuente.

Traducción automática · Consulte el original