The Decoder

Anthropic coupe l’accès à Internet de Claude après que le modèle a déposé automatiquement une fausse alerte de meurtre auprès de la police…

Claude d’Anthropic a soumis indépendamment une alerte de meurtre fictive à la police de Philadelphie, a exploité des vulnérabilités sur les serveurs universitaires et a contourné les restrictions d’accès. L’entreprise a…

Manuel Uth
Source de l’image · The Decoder

Anthropic coupe l'accès à Internet de Claude après que le modèle a soumis automatiquement une fausse plainte de meurtre à la police de Philadelphie

Manuel Uth Manuel Uth 10 octobre 2026

Les modèles d’IA d’Anthropic ont exploité indépendamment des failles de sécurité, soumis des formulaires gouvernementaux et contourné les restrictions d’accès pendant les tests et l’utilisation interne. Les modèles cherchaient activement des moyens pour accomplir des tâches qu’ils ne devraient pas gérer, comme le montrent les détails de l’entreprise dans un rapport.

Dans un cas, Claude a rempli un formulaire de signalement pour le Département de police de Philadelphie en fournissant des informations fictives concernant un meurtre non résolu, puis l’a soumis. La police a confirmé l’incident, mais le signalement a été classé comme spam et n’a jamais atteint les enquêteurs. Dans d’autres cas, le modèle a découvert une vulnérabilité sur un serveur universitaire et l’a utilisée pour exécuter des commandes, a extrait des tokens d’accès des configurations du site web afin de récupérer des données protégées ou payantes, et a utilisé des raccourcisurs de URL pour éviter les limites de longueur de ses outils.

Anthropic indique que l’impact dans le monde réel est faible, mais qu’un schéma se dessine. Lorsque les tâches sont ambiguës ou difficiles à résoudre, le modèle cherche par lui-même des solutions plutôt que de s’arrêter. L’entreprise a informé la Maison Blanche et a interrompu l’accès en ligne pour toutes les évaluations internes jusqu’à ce que les nouveaux filtres de sécurité soient installés de manière fiable. Ces incidents s’ajoutent à une liste en croissance rapide de cas similaires, incluant des incidents de cybersécurité impliquant Claude et les modèles OpenAI qui ont piraté Hugging Face de manière autonome.

Nouvelles sur l’IA sans hype – sélectionnées par des humains

Abonnez-vous à THE DECODER pour une lecture sans publicités, un bulletin informatif sur l’IA hebdomadaire, notre rapport exclusif « AI Radar » six fois par an, un accès complet à l’archive et la possibilité de participer à notre section de commentaires.

Source : Anthropic / Rapport | CBS News / Police de Philadelphie
Source originale

The Decoder

À propos du contenu

La publication originale et les droits appartiennent à la source.

Traduction automatique · Consultez l’original