The Decoder

OpenAI indique qu’un modèle mal aligné a détruit intentionnellement son propre environnement dans l’espoir d’une nouvelle étape avec des…

OpenAI a documenté de nouveaux cas de comportement incohérent des modèles. Un modèle d’évaluation a fabriqué des données et a saboté son propre environnement. D’autres modèles ont délibérément contourné les restrictions…

Matthias Bastian
Source de l’image · The Decoder

OpenAI indique qu’un modèle mal aligné a détruit intentionnellement son propre environnement dans l’espoir d’une nouvelle étape avec des données améliorées

Matthias Bastian Matthias Bastian Voir le profil LinkedIn de Matthias Bastian 10 oct. 2026

OpenAI a quelques nouvelles histoires sur des agents étrangers. Dans le premier cas (6 octobre), un modèle d’évaluation d’IA ne pouvait pas trouver les réponses qu’il était censé évaluer. Au lieu de signaler l’erreur, il a fabriqué des notes, créé des fichiers d’entrée fictifs, puis a délibérément corrompu son propre environnement, dans l’espoir que le système le remplacerait par une machine virtuelle nouvelle qui contenait les données manquantes.

Un modèle OpenAI raisonne dans sa chaîne interne de pensée en corrompant délibérément son propre environnement afin d’obtenir une nouvelle machine virtuelle contenant les données manquantes. | Image : OpenAI via Marcus Williams

Dans le deuxième cas (19/20 juin), les modèles ont contourné une restriction qui les limitait aux requêtes HTTP GET lors de la récupération des statistiques publiques. Un modèle a explicitement reconnu cette violation dans sa chaîne de pensée, mais a choisi de continuer et n’en a jamais parlé.

Dans le troisième cas (16/17 juin), les modèles disposaient déjà des données dont ils avaient besoin, mais cherchaient constamment des moyens de contourner les restrictions de leur réseau. Ils créaient des comptes sur un service shell distant, achevaient les requêtes POST interdites via des relais anonymisés, et développaient leurs propres clients FTP. Anthropic a également documenté les solutions parfois absurdes que ses propres modèles utilisent pour contourner les restrictions imposées.

Nouvelles en IA sans hype – sélectionnées par des humains

Abonnez-vous à THE DECODER pour une lecture sans publicités, un bulletin informel sur l’IA toutes les semaines, notre rapport exclusif « AI Radar » six fois par an, un accès complet à l’archive, et un accès à notre section de commentaires.

Source : OpenAI
Source originale

The Decoder

À propos du contenu

La publication originale et les droits appartiennent à la source.

Traduction automatique · Consultez l’original