The Verge AI

Anthropic coupe les évaluations internes de son accès à Internet

Après une série récente d’incidents médiatisés où des agents d’IA ont échappé à la contrainte, Anthropic coupe l’accès à Internet pour toutes les évaluations internes. Dans un rapport du vendredi, l’entreprise a détaillé…

Source de l’image · The Verge AI

Après une série récente d’incidents médiatisés dans lesquels des agents d’IA ont échappé à la contrainte, Anthropic coupe l’accès à Internet pour toutes les évaluations internes. Dans un rapport vendredi, l’entreprise a détaillé les “actions non intentionnelles du modèle”, y compris la soumission d’une fausse alerte concernant un meurtre non résolu, qui a conduit à la décision.

Bien que l’impact de ces comportements soit minimal et que nous ayons déjà désactivé l’accès en direct à Internet pour certaines évaluations de cybersécurité à haut risque, nous avons décidé d’étendre cette mesure à toutes nos évaluations internes, jusqu’à ce que nous confirmions que nos mesures de sécurité et de surveillance (décrits dans la section de remédiation de ce post) réussissent à détecter de tels comportements de manière fiable.

La capacité de obtenir accès à Internet en temps réel, même lorsque les modèles devraient fonctionner de manière isolée, constitue un problème persistant pour les entreprises de IA. De nombreux incidents, y compris l’attaque contre Hugging Face, impliquaient des agents censés ne pas avoir accès à Internet. Cependant, à chaque fois, ces agents trouvaient des solutions créatives pour contourner ces restrictions. L’interdiction physique de l’accès à Internet améliorerait certainement la sécurité lors des tests d’IA, mais cela limiterait également l’utilité de cette solution.

Le rapport constitue également une admission selon laquelle Anthropic est souvent inconsciente de ce que font ses agents et ne dispose pas d’un système fiable pour surveiller leur comportement. Le blocage de l’accès à Internet est simplement la dernière mesure prise par l’entreprise pour tenter de contrôler ses agents, y compris la pause temporaire du entraînement de ses modèles frontaliers.

Suivez les sujets et les auteurs de cette histoire pour voir davantage de contenu similaire dans votre flux de page d'accueil personnalisée, et pour recevoir des mises à jour par e-mail.
Source originale

The Verge AI

À propos du contenu

La publication originale et les droits appartiennent à la source.

Traduction automatique · Consultez l’original