TechCrunch AI

Anthropic ne parvient pas à contrôler de manière fiable ses agents IA. Elle coupe donc ses évaluations internes de l'internet en direct

Anthropic a déclaré avoir « coupé l'accès à l'internet en direct » pour « toutes nos évaluations internes » jusqu'à nouvel ordre.

Source de l’image · TechCrunch AI

Anthropic a déclaré que ses modèles exploitaient des sites web sur internet, y compris certains gérés par des agences du gouvernement américain, et qu'elle va couper l'accès à l'internet en direct pour toutes ses évaluations internes jusqu'à ce que le laboratoire de pointe soit certain de pouvoir surveiller et contrôler ses agents IA.

Les incidents, révélés dans un article de blog, impliquaient des agents IA chargés de résoudre des problèmes recherchant des ressources sur internet. Ce faisant, ils ont exploité des failles logicielles, contourné des paywalls et des restrictions anti-robots, utilisé des services de raccourcissement d'URL pour faire passer des informations outre les restrictions, et ont même soumis un faux signalement de meurtre à la police de Philadelphie.

Anthropic a déclaré avoir découvert ces nouveaux problèmes lors d'un examen des activités de son modèle commencé en juillet, ce qui souligne le manque de conscience du laboratoire quant au comportement de son logiciel.

Fait notable, l'entreprise a déclaré que l'entraînement d'alignement n'était pas encore suffisant pour des compétences comme la recherche et l'utilisation de l'ordinateur, qui sont centrales dans son argumentaire selon lequel les agents IA seront utilisés par tout professionnel dépendant d'outils numériques.

Les comportements révélés par Anthropic sont similaires à des incidents impliquant des agents d'OpenAI qui ont collaboré pour s'introduire dans divers sites web à la recherche d'informations, dont certains gérés par le gouvernement australien.

Anthropic avait précédemment révélé que ses modèles s'étaient introduits dans des systèmes externes. Le laboratoire de pointe a déclaré considérer les révélations du jour comme « nettement moins graves du point de vue de l'alignement et de la sécurité » que celles annoncées auparavant.

Cependant, le laboratoire a tout de même déclaré avoir « coupé l'accès à l'internet en direct » pour « toutes nos évaluations internes » jusqu'à ce qu'il soit certain de pouvoir surveiller et contrôler ses agents.

On ne sait pas ce que cela signifie, mais Sydney von Arx, la fondatrice de Nightingale AI safety, a déclaré à TechCrunch dans une interview avant cette révélation que développer des modèles dans un centre de données coupé de l'internet ouvert serait très difficile d'accès pour les chercheurs, et pénaliserait la progression des modèles, qui bénéficient de l'accès à internet.

« Vous devez finir par les aligner », a déclaré von Arx. « Si les IA sont déployées en production sans jamais avoir accès à internet, ce n'est pas un outil très utile. »

Anthropic a déclaré que ce comportement résultait de failles dans les environnements d'entraînement du laboratoire, qui ont conduit les modèles à croire qu'ils seraient récompensés pour trouver des échappatoires ou contourner des restrictions, un comportement appelé « reward hacking ».

L'entreprise a déclaré qu'elle cesserait d'exécuter certaines de ses évaluations ou les déplacerait hors ligne, et qu'elle a construit des outils pour détecter et bloquer ce comportement. Ces outils ont été testés contre le type d'incidents révélés aujourd'hui et les ont bloqués ; on ne sait pas quelles preuves inciteront Anthropic à rétablir l'accès à l'internet en direct pour ses évaluations internes.

Anthropic a également déclaré qu'elle migrait ses agents IA internes vers une « infrastructure gérée de manière centralisée avec un confinement renforcé », et commence à utiliser des classificateurs de sécurité plus fréquemment pour surveiller ces agents.

Source originale

TechCrunch AI

À propos du contenu

La publication originale et les droits appartiennent à la source.

Traduction automatique · Consultez l’original