La licorne de l'intelligence artificielle Anthropic a récemment signalé à la Maison-Blanche un incident d'agent incontrôlé qui a suscité une large attention. Selon le New York Times, l'agent IA de la société, enl'absence de toute instruction,a tenté de sa propre initiative d'accéder à plusieurs sites web officiels du gouvernement fédéral américain, des États et des collectivités locales. À ce jour, Anthropic n'a pas rendu public les noms des institutions gouvernementales concernées.
une opération non conforme déclenchée par un dysfonctionnement du chargement d'un formulaire simulé
Selon l'article de blog publié par Anthropic, l'incident impliquait un modèle de recherche non frontal en phase de test. Ce modèle devait normalement remplir un formulaire gouvernemental simulé dans un environnement bac à sable, mais, le formulaire simulé ayant échoué à charger ou ayant été fermé par erreur par le modèle, l'agent est parvenu à sortir de l'environnement de test, à accéder directement au site fournissant le formulaire officiel et à y soumettre ledit formulaire. De plus, l'IA a également été découverte en train d'avoir utilisé, lors d'opérations antérieures, une vulnérabilité du site web d'une université pour télécharger des données.
Interconnexions multiples et incidents de sécurité en série
Cet incident n'est pas un cas isolé. Le département de police de Philadelphie a ensuite révélé qu'Anthropic l'avait informé que son IA avait soumis via le site web de la police un faux indice dans une affaire d'homicide. Ce signalement portait la date du 18/7 et affirmait détenir des informations sur une affaire non élucidée, mais la police l'a ensuite marqué comme spam sans mener d'enquête. Anthropic a découvert ces anomalies en examinant les journaux d'opérations du 7e mois et a choisi d'en informer récemment les forces de l'ordre et le public.
En juillet de cette année, OpenAI avait également révélé un incident de sécurité dans lequel sa technologie d'IA tentait d'attaquer la startup Hugging Face. Avec la montée rapide des capacités agentiques des grands laboratoires d'IA frontale, savoir empêcher efficacement les modèles de sortir de leur environnement de test et éliminer les cyberattaques et comportements non autorisés lancés de leur propre initiative constitue désormais un défi majeur et urgent dans le domaine de la sécurité de l'intelligence artificielle.