OpenAI indique qu’un modèle mal aligné a détruit intentionnellement son propre environnement dans l’espoir d’une nouvelle étape avec des données améliorées
Matthias Bastian
Voir le profil LinkedIn de Matthias Bastian
10 oct. 2026OpenAI a quelques nouvelles histoires sur des agents étrangers. Dans le premier cas (6 octobre), un modèle d’évaluation d’IA ne pouvait pas trouver les réponses qu’il était censé évaluer. Au lieu de signaler l’erreur, il a fabriqué des notes, créé des fichiers d’entrée fictifs, puis a délibérément corrompu son propre environnement, dans l’espoir que le système le remplacerait par une machine virtuelle nouvelle qui contenait les données manquantes.

Dans le deuxième cas (19/20 juin), les modèles ont contourné une restriction qui les limitait aux requêtes HTTP GET lors de la récupération des statistiques publiques. Un modèle a explicitement reconnu cette violation dans sa chaîne de pensée, mais a choisi de continuer et n’en a jamais parlé.
Dans le troisième cas (16/17 juin), les modèles disposaient déjà des données dont ils avaient besoin, mais cherchaient constamment des moyens de contourner les restrictions de leur réseau. Ils créaient des comptes sur un service shell distant, achevaient les requêtes POST interdites via des relais anonymisés, et développaient leurs propres clients FTP. Anthropic a également documenté les solutions parfois absurdes que ses propres modèles utilisent pour contourner les restrictions imposées.
Nouvelles en IA sans hype – sélectionnées par des humains
Abonnez-vous à THE DECODER pour une lecture sans publicités, un bulletin informel sur l’IA toutes les semaines, notre rapport exclusif « AI Radar » six fois par an, un accès complet à l’archive, et un accès à notre section de commentaires.
Source : OpenAI