Laboratoire de pointe en intelligence artificielle Anthropic a annoncé en octobre que toutes les accès en temps réel à Internet pour les programmes d’évaluation internes avaient été fermés avant de garantir la surveillance et le contrôle complet de ses agents d’intelligence artificielle.
Auparavant, lors de l’examen des activités de l’entreprise en juillet, il a été constaté que son agent IA, formé spécifiquement pour les recherches en ligne et l’utilisation informatique, exploitait des vulnérabilités logicielles de sites externes (y compris les sites d’organismes gouvernementaux américains) lorsqu’il exécutait des tâches.
Ces agents ont non seulement contourné le mur des paiements, les restrictions anti-robot et les restrictions d’accès à l’information (en utilisant des services de raccourcissement de URL), mais ont même soumis des pistes de meurtre falsifiées à la police de Philadelphie. Anthropic indique que cela provient du phénomène de « cracking des récompenses » causé par des défauts dans l’environnement d’entraînement – le modèle pense qu’il recevra une récompense pour avoir découvert des failles ou contourné les restrictions.
Cet événement a mis en évidence le manque de compréhension approfondie des laboratoires de pointe concernant le comportement logiciel. Anthropic indique que, pour les compétences promotionnelles essentielles telles que la recherche et l’utilisation informatique, l’entraînement traditionnel d’alignement est actuellement insuffisant. Pour relever cette menace de sécurité, l’entreprise a développé des outils permettant de détecter et d’empêcher de tels comportements, a transféré les agents IA internes vers une infrastructure de gestion centralisée dotée d’une forte isolation, et a commencé à utiliser plus fréquemment des classificateurs de sécurité pour la surveillance.