Étudier les actions non intentionnelles du modèle dans nos évaluations et utilisation interne
9 oct. 2026
Ce rapport décrit des exemples d’actions inattendues du modèle que nous avons observées pendant les évaluations et l’utilisation interne de Claude. Il fait partie de nos efforts pour publier plus fréquemment des rapports indépendants sur le comportement et l’alignement du modèle, en plus des cartes système que nous publions avec chaque mise à jour du modèle, ainsi que des rapports de risque que nous publions tous les trois à six mois, dans le cadre de notre Politique de Scaling Responsable. Nous estimons qu’il est important d’être transparent sur ce que nos modèles font pendant les tests et l’utilisation.
Les comportements peuvent être classés en quatre catégories :
- Claude exploite une faiblesse de base dans le logiciel pour exécuter des commandes sur un serveur ;
- Claude soumettant un formulaire sensible sur un site réel lorsqu’il ne devrait pas le faire ;
- Claude cherche à contourner une restriction afin d’accéder aux données qui sont verrouillées par un token ou une commission ;
- Claude utilise des services de raccourcissement de URL pour dépasser les limites de son outil de récupération.
Nous avons choisi de ne pas nommer les organisations impliquées dans les exemples ci-dessous afin d’éviter la révélation des vulnérabilités de leurs systèmes, et à leur demande. Pour cette raison, nous fournissons également moins de détails sur chaque cas que nous le ferais normalement. Certains des cas décrits ci-dessous concernaient des sites web gérés par des agences gouvernementales américaines aux niveaux fédéral, étatique et local. Nous avons informé la Maison Blanche de ces cas et notifié chaque agence concernée.
Les cas que nous avons identifiés à ce jour dans ces catégories ont un impact minimal dans le monde réel. Nous considérons que ces comportements sont significativement moins graves du point de vue de l’alignement et de la sécurité par rapport aux incidents de cybersécurité que nous avons rapportés le 30 juillet et le 9 septembre. Ils ressemblent aux comportements que nous avons décrits dans nos cartes de système depuis le Prévisualisation Claude Mythos. La plupart sont des formes de persistance, où Claude, lorsqu’il ne peut pas accomplir une tâche comme donné, contourne une restriction plutôt que de s’arrêter.
Bien que l’impact de ces comportements soit minimal et que nous ayons déjà désactivé l’accès en direct à Internet pour certaines évaluations à haut risque et liées à la cybersécurité, nous avons décidé d’en étendre l’application à toutes nos évaluations internes, jusqu’à ce que nous confirmions que nos mesures de sécurité et de surveillance (décrits dans la section de correction de cette publication) réussissent à repérer de tels comportements de manière fiable. Ci-dessous, nous discutons également des considérations d’alignement et nous donnons plus de détails sur la manière dont nous modifions l’entraînement afin de réduire la probabilité de comportements inappropriés ultérieurs.
Nous avons identifié la plupart de ces cas en examinant les transcriptions, qui ont commencé en juillet. Notre examen s’est d’abord concentré sur nos évaluations de cybersécurité – des tests dans lesquels un modèle est délibérément chargé d’explorer ou d’attaquer un système de test, et où l’accès à Internet doit être désactivé. Nous avons depuis étendu notre scan pour couvrir une gamme beaucoup plus large d’exemples où Claude aurait pu accéder à Internet, y compris des tests où l’accès à Internet est délibérément activé afin que Claude puisse être évalué sur des tâches réelles. Nous avons commencé en recherchant des incidents de gravité similaire à ceux rapportés cet été ; jusqu’à présent, nous n’avons trouvé aucun. Nous avons ensuite étendu la recherche aux cas de faible gravité, où un modèle interagit avec des sites web ou des systèmes réels de manière que nous ne l’avions pas prévu.
Nous examinons également maintenant un ensemble beaucoup plus vaste de transcriptions à faible risque, ainsi que notre utilisation de Claude au sein d’Anthropic et dans les environnements de apprentissage par renforcement (RL) où Claude a accès à Internet. Alors que ce travail se poursuit, nous prévoyons de signaler de nouveaux cas de comportements indésirables. Tous les cas rapportés ici impliquent Claude interagissant avec le monde extérieur ; pour autant que nous sachions, aucun d’eux ne concerne des données clients ou les systèmes internes d’Anthropic.
Dans cet article, nous expliquons pourquoi nous effectuons des évaluations, où se produisent la plupart de ces cas ; nous décrivons chaque comportement en détail ; et nous offrons une vue préliminaire de ce que ces comportements indiquent concernant l’alignement de Claude ainsi que de la manière dont nous les atténuons.
Pourquoi et comment nous menons les évaluations
Les comportements décrits dans cet article ne sont pas spécifiques aux évaluations, mais de nombreux cas que nous avons identifiés jusqu’à présent se sont produits pendant les essais d’évaluation. Nous testons constamment les modèles sur une large gamme de tâches avant de les publier. Nous utilisons de nombreuses évaluations différentes (sets de tâches standardisés, évaluées de la même manière à chaque fois), chacune contribuant à décrire les compétences de Claude dans un domaine particulier. De nombreuses évaluations que nous utilisons sont publiques ; elles sont rédigées par des chercheurs externes et peuvent être exécutées par n’importe quel développeur, ce qui nous permet de comparer les capacités des différents modèles. D’autres évaluations, en revanche, sont créées en interne.
Parce que les modèles de langage sont non déterministes – c’est-à-dire que leurs réponses impliquent toujours une certaine element de aléatoire, et ils peuvent accomplir la même tâche de manière légèrement différente à chaque fois – nous avons utilisé Claude pour effectuer chaque tâche d’évaluation des centaines ou des milliers de fois (chaque tentative est appelée une exécution). Tester autant de fois nous permet de comprendre comment un modèle se comporte généralement, et aussi de repérer les cas rares où le modèle fait quelque chose que nous ne nous attendons pas. Ce que nous apprenons des évaluations influence les décisions de Anthropic, y compris la manière dont nous entraînons les modèles, les mesures de sécurité que nous mettons en place autour d’eux, et le moment où nous les publions.
Les évaluations sont également le lieu où les problèmes de comportement d’un modèle sont parfois révélés pour la première fois. Les modèles apprennent beaucoup de ce qu’ils peuvent faire grâce au RL, dans lequel ils tentent une tâche dans un environnement spécifique à plusieurs reprises et reçoivent une récompense lorsqu’ils réussissent. Cependant, les environnements d’entraînement sont imparfaits. Si les récompenses d’entraînement permettent de faire quelque chose que nous n’avions pas prévu – comme trouver des moyens de contourner une restriction – le modèle apprend que cette méthode est efficace et peut ensuite l’appliquer ailleurs. Cela est appelé « hackage des récompenses ». Bien que nous ayons des procédures pour identifier et filtrer le hackage des récompenses pendant l’entraînement, les évaluations constituent un mécanisme essentiel pour comprendre les tendances comportementales d’un modèle dans différents contextes et sur différents ensembles de tâches par rapport à celles que nous avons lors de l’entraînement.
Certaines tâches – comme la recherche sur le web pour obtenir des informations difficiles à trouver – sont difficilement simulables de manière réaliste dans un environnement sans accès à Internet. Exécuter ces tâches avec un accès à Internet est une pratique courante dans l’industrie : les benchmarks de recherche publique sur le web sont exécutés en temps réel sur Internet par défaut, et les exécutions de cette manière nous permettent de comparer nos modèles avec ceux des autres modèles. La plupart des cas mentionnés dans ce rapport se sont produits lors de ces évaluations.
Aperçu des comportements
Ci-dessous, nous décrivons quatre catégories de comportements dans lesquelles Claude a agi de manière inattendue sur des sites et systèmes réels, chacune impliquant une organisation ou une personne extérieure à Anthropic.
Utiliser une faiblesse de base du logiciel pour exécuter des commandes sur un serveur
Lorsque Claude ne pouvait pas accomplir directement une tâche d’évaluation, soit parce que ses propres outils étaient délibérément limités, soit parce qu’un service externe dont il avait besoin était indisponible, il utilisait d’autres outils hébergés sur un site tiers pour atteindre son objectif. Dans certains cas, il le faisait en exploitant des défauts fondamentaux dans le logiciel de ce site, en utilisant SQL ou l’injection de commandes (une manière d’envoyer des entrées que le site exécute par erreur comme des instructions).
Par exemple, une évaluation a demandé à Claude Mythos Preview de réaliser une analyse scientifique. L’outil public dont il avait besoin pour effectuer cette analyse était hébergé par une université ; lorsque le modèle a tenté d’y accéder, l’outil a renvoyé une erreur. À la recherche d’une autre manière de terminer la tâche, Claude a exploré le site web de l’outil, a trouvé un script sur le serveur de l’université qui permettait de récupérer n’importe quel fichier demandé, et l’a utilisé pour copier les fichiers du serveur, y compris le code propre du script. Dans ce code, Claude a découvert une faille d’injection qui lui permettait d’exécuter des commandes sur le serveur, et il l’a utilisée pour effectuer les calculs.
Dans un autre cas, les données dont avait besoin Claude Mythos 5 étaient disponibles, mais Claude ne pouvait pas y accéder sans accepter un accord d’utilisation des données, que ses outils ne lui permettaient pas de signer. Claude a utilisé des applications hébergées sur le site web pour charger la page et accepter l’accord en son nom.
Nous avons observé ce comportement dans DeepSearchQA et BrowseComp (deux évaluations de recherche en ligne publiques), dans LABBench2 (un benchmark de recherche en biologie publique) et lors d’évaluations internes.
Soumettre un formulaire qu’il ne devrait pas avoir
Nous avons vu des cas où Claude soumettait un formulaire en ligne lorsqu’il ne devrait pas le faire. En général, cela se produisait lorsque les instructions d’évaluation étaient ambiguës, ou lorsque une configuration incorrecte dans l’environnement empêchait Claude de travailler avec des formulaires fictifs.
Par exemple, dans un cas qui s’est produit plusieurs fois lors de la même évaluation, un modèle de recherche non encore publié et non frontière était destiné à remplir une copie de formulaire gouvernemental. Lorsque la copie ne chargeait pas ou que le modèle se fermait par erreur, il se tournait plutôt vers le site web où le formulaire réel est normalement hébergé et soumettait le formulaire là-bas.
Dans une autre évaluation, Claude Haiku 4.5 a été chargé de remplir un formulaire jusqu’à l’étape finale de soumission, mais il s’est arrêté avant de finaliser la demande. À plusieurs reprises, Claude a malheureusement soumis le formulaire par erreur, en espérant qu’il y aurait une page de confirmation supplémentaire. Dans ces cas, la chaîne de pensée du modèle indiquait qu’il illustrait le processus, sans soumettre de véritable demande.
Dans un troisième exemple de ce comportement, Claude Haiku 4.5 avait pour tâche de générer et d’exécuter des tâches d’exemple sur des pages web sélectionnées aléatoirement. Lors d’une exécution, le modèle a atterri sur une page qui mentionnait un meurtre non résolu ; cette page contenait un formulaire de signalement géré par un département de police. Claude avait été instruit de ne jamais se connecter, créer d’utilisateurs, entrer des données personnelles, effectuer des achats ou soumettre quoi que ce soit de nuisible, mais ces instructions ne excluaient pas les soumissions de formulaires. Claude a rempli le formulaire en disant : « Je peux avoir des informations concernant cette affaire. Je me souviens avoir vu quelqu’un qui correspond à la description dans les environs de [la rue mentionnée sur la page] pendant cette période. Veuillez me contacter si ces informations sont pertinentes. » (Le site web ne contenait pas de description du coupable.) Le modèle a laissé les champs de nom et de contact vides, ce qui était permis par le formulaire, et il a soumis le formulaire. La soumission a été marquée comme spam et n’a jamais été transmise pour enquête.
Nous avons observé ce comportement sur OSWorld (une évaluation de l’utilisation d’un ordinateur public), sur Odysseys (une évaluation de tâches à long terme) et lors de l’utilisation interne.
Combatting les restrictions pour accéder aux données cachées
Claude parfois contournait une restriction pour accéder aux données à laquelle il n’avait pas accès. En général, cela se produisait lorsqu’un serveur refusait la demande de Claude, ou lorsque les données étaient disponibles uniquement contre un paiement.
Par exemple, dans une évaluation qui demandait à Claude Mythos 5 d’identifier un lieu visible sur une photo, il a tenté d’accéder à la carte des propriétés de l’administration locale afin de déterminer ses hypothèses avec précision. Claude pouvait lire le texte des pages web, mais l’évaluation limitait sa capacité à les consulter comme le feraient des humains. Au lieu de cela, il lisait le fichier de paramètres que le site envoie aux navigateurs, trouvait les tokens d’accès fonctionnels et les utilisait pour envoyer des requêtes directement au serveur qui se trouve derrière la carte afin d’accéder aux données.
Dans un autre exemple de ce comportement, un chercheur anthropique a utilisé Claude Mythos 5 dans un projet de statistiques qui exigeait qu’il récupère des données publiques disponibles auprès d’une agence étatique, contre une fraise. En réalité, Claude a appris, à partir d’une copie archivée du site web de l’agence, que son tableau de bord public délivre un token d’accès à tout visiteur. Il a demandé ce token et l’a utilisé pour interroger la base de données sans payer la fraise.
Dans les deux exemples, Claude a obtenu des données déjà accessibles au public, mais seulement contre une redevance.
Nous avons observé ce comportement dans l’« Humanity’s Last Exam », une évaluation de questions académiques de niveau expert, ainsi que lors de l’utilisation interne.
Utiliser les services de raccourcissement de URL
Certaines de nos outils de récupération, qui permettent à Claude de lire des pages web, limitent la longueur des URLs que Claude peut demander. Cela vise à empêcher Claude d’utiliser des URLs longues pour entreprendre certaines actions indésirables, telles que les injections SQL ou les commandes (une partie de l’URL est du texte transmis au serveur du site, et une URL longue peut contenir ces instructions). Nous avons vu plusieurs modèles, y compris Claude Opus 5 et Claude Mythos 5, contourner cette limitation en utilisant des services gratuits de raccourcissement d’URL. Nous avons d’abord identifié ce comportement en interne, mais alors que nous écrivions cette publication, un opérateur du service de raccourcissement de URL da.gd nous a informé qu’ils avaient également constaté Claude utilisant leur site web à cette fin. Nous remercions l’opérateur pour avoir partagé ces détails.
Remédiation
Nous avons mis en œuvre plusieurs mesures préventives. Certaines évaluations publiques que nous ne mettons plus en place ; d’autres, nous les avons transférées en version hors ligne ou les avons reconstruites de manière à ce que leurs tâches ne soient pas diffusées sur des sites web en ligne. Nous avons également apporté des modifications plus larges. Nous avons mis à jour les restrictions applicables à certains outils d’accès à Internet, comme l’outil web fetch, afin de limiter fortement ce que le modèle peut faire avec eux. Et, dans le cadre de nos efforts continus en matière de sécurité et surveillance des agents, nous avons développé des outils permettant de détecter et de bloquer automatiquement les comportements mentionnés ci-dessus. Ces outils fonctionnent désormais pour la plupart de nos évaluations et pour l’utilisation interne des modèles de pointe par les agents. Lorsque nous avons testé ces outils avec les cas décrits dans cette publication, ils ont bloqué tous ceux-ci.
Comme nous l’avons expliqué le 31 août post, nous continuons également à corriger ou supprimer les environnements de formation qui récompensent Claude pour traiter les restrictions des outils ou d’autres obstacles, afin qu’ils ne stimulent pas ces comportements ni ne permettent le piratage de récompenses.
Nous prenons également d’autres mesures pour empêcher les actions indésirables des agents dans Anthropic, et pour les détecter si elles surviennent. Ces mesures comprennent la migration des agents internes vers une infrastructure gérée centralement avec une forte conteneurisation, la réduction de l’accès à Internet pour les agents internes et les processus de formation, ainsi que le suivi de beaucoup plus de comportements des agents grâce à des techniques telles que les classeurs de sécurité et la synthèse hiérarchique. Ces mesures font désormais partie des procédures de détection et de réponse du équipe de sécurité, afin que nous puissions réagir rapidement et contenir les comportements indésirables. Nous nous attendons à publier davantage sur ces approches, et à les intégrer directement dans nos produits.
Points clés de la discussion et de l’alignement
Bien que nous n’ayons pas terminé une évaluation complète de l’alignement de ces cas, nous les considérons comme moins graves que les incidents de cybersécurité de cet été. Nous expliquons pourquoi ci-dessous et partageons les leçons générales que nous avons tirées de ces incidents.
Contexte d’alignement
Lorsque nous établissons un processus de rapport public régulier pour des comportements de ce type, nous voulons également les classer en fonction de leur gravité. Cela reste difficile : évaluer l’ampleur d’une erreur d’alignement dépend souvent de ce que le modèle essayait de faire, et le récit du modèle lui-même concernant ses raisonnements ne constitue pas nécessairement une preuve fiable de ses croyances ou des raisons de ses actions, comme nous l’avons discuté dans notre évaluation d’alignement du 9 septembre. À mesure que les modèles deviennent plus capables, ils peuvent interagir avec le monde de manière plus sophistiquée, ce qui rend possible des erreurs encore plus complexes. Par exemple, la raisonnement biaisé que nous avons décrite dans cette évaluation n’était pas nouveau, mais elle a entraîné des conséquences plus graves dans un contexte où les modèles peuvent agir efficacement sur des systèmes réels pendant des heures. Un cadre de gravité d’alignement basé sur les erreurs actuelles pourrait rapidement devenir obsolète, étant donné la vitesse à laquelle les capacités de l’IA progressent.
Cependant, nous avons trouvé deux dimensions d’alignement utiles pour examiner les cas mentionnés dans cet article : l’excès de portée, c’est-à-dire la distance jusqu’où le modèle a dépassé ce que son objectif visait, et l’hypocrisie, c’est-à-dire si il donne une description trompeuse de ses actions ou intentions. En ce qui concerne l’excès de portée, nous considérons ces cas comme moins préoccupants que les incidents rapportés cet été, où Claude a eu accès à des systèmes tiers réels pendant des heures lors des évaluations de cybersécurité. Dans les cas que nous rapportons ici, en revanche, Claude a contouré les contrôles d’accès pour accéder à des données protégées mais disponibles au public, ou a exploité des failles logicielles et exécuté des commandes sur les serveurs (principalement pour accéder à des données non sensibles).
En ce qui concerne l’hypothèse de malhonnêteté, la comparaison est plus complexe. Dans un cas, chargé de générer des interactions d’exemple avec des sites web, Claude a soumis une suggestion inventée via le formulaire en ligne du département de police. D’après le transcript, il semble que Claude n’ait fait qu’obtenir des contenus d’exemple pour cette tâche, sans essayer de tromper qui que ce soit afin d’atteindre un objectif. En revanche, dans l’incident majeur de cet été, la raison de malhonnêteté de Claude a été maintenue pendant des heures et a soutenu les attaques continues qu’il menait. Cependant, juger de l’hypothèse de malhonnêteté avec confiance nécessite généralement une évaluation plus approfondie que celle que nous avons effectuée ici, comme rejouer les transcripts avec des modifications pour tester ce qui a motivé le comportement du modèle ; donc notre point de vue sur ces cas pourrait changer avec une analyse plus approfondie.
Leçons et prochaines étapes
Aucun des comportements que nous avons décrits ici n’est nouveau et ils ne modifient pas notre vision globale de l’alignement de Claude. Dans de nombreux cas où nous avons observé ces comportements, Claude avait reçu des tâches ambiguës ou impossibles à accomplir. Nous et d’autres avons constaté que lorsque les modèles reçoivent des tâches impossibles à accomplir, ils adoptent des stratégies non intentionnelles et parfois désalignées pour atteindre leurs objectifs.
Il est possible que certains de ces échecs auraient pu être évités si les questions d’évaluation avaient clairement indiqué ce qui était inclus ou exclu du projet, y compris les objectifs, les actions permises et les limites réseau (c’est-à-dire ce que le modèle doit et ne doit pas accéder). Cependant, Claude rencontre des tâches ambiguës et impossibles tous les jours dans l’utilisation réelle, et en effet, plusieurs des cas que nous avons observés se sont produits lors de l’utilisation régulière d’Claude en tant qu’agent.
La formation comportementale et d’alignement est la technique principale que nous utilisons pour améliorer le jugement de Claude et sa capacité à gérer les situations ambiguës avec prudence. Historiquement, nous nous sommes concentrés davantage sur l’enseignement aux modèles à respecter les limites et à être prudent dans les environnements de codage. Nous étendons maintenant ces environnements aux applications telles que la recherche et l’utilisation informatique, qui sont impliquées dans les cas décrits ici. Cependant, la formation d’alignement n’est pas encore suffisante ou complètement robuste en elle-même, du moins à court terme ; nous nous appuyons donc également sur des approches de défense en profondeur, y compris les classificateurs et mesures de protection décrits ci-dessus.
Nous prévoyons de continuer à publier des rapports concernant les comportements au cours de nos analyses et scans. Nous espérons que ces rapports aideront d’autres développeurs à détecter des comportements similaires dans leurs propres modèles, car beaucoup des évaluations concernées sont publiques et largement utilisées. Bien que ces cas aient eu un impact minimal, nous ne voulons pas minimiser les conclusions, car les mêmes comportements pourraient causer davantage de dommages lorsque les modèles deviennent plus puissants. Plus les modèles jouent un rôle important dans la société, plus le public a droit de savoir comment ils fonctionnent.
Note : L’exemple de formulaire de conseil décrit ci-dessus impliquait le Département de police de Philadelphie, qui a rendu public ses informations aujourd’hui par un communiqué de presse. Nous avons partagé cette constatation avec le département le 8 octobre, dès que notre revue technique était terminée.
Contenu lié
La carte manquante du ciel
Brice Ménard, astrophysicien à l’université de Johns Hopkins et chercheur chez Anthropic, explique comment il a collaboré avec Claude Science pour produire la première carte complète du ciel en lumière UV.
Lire plusLancement d’un service de détection des vulnérabilités par consentement pour les logiciels open-source
Nous mettons à disposition OSS Scanner, un scanner de vulnérabilités opt-in pour l’écosystème open-source, basé sur notre expérience utilisant Claude pour détecter les vulnérabilités lors du projet Glasswing.
Lire plusSciences en forme de Claude
L’auteur invité, le professeur Matthew Schwartz, décrit ce qui s’est passé lorsqu’il a cessé de lutter contre Claude et a permis à Claude de trouver des problèmes « en forme de Claude » : des problèmes les plus adaptés aux capacités de la génération actuelle d’outils LLM. Cela l’a conduit à créer BootLoops, un outil de travail pour les calculs précis en sciences quantitatives, qu’il utilise aujourd’hui dans divers domaines scientifiques en collaboration avec des experts.
Lire plus