Nous commençons un processus de publication de rapports plus fréquents sur le comportement des modèles, en plus de ceux présentés dans nos cartes système et les rapports réguliers de risque.
Le rapport d’aujourd’hui décrit quatre types de comportements que nous avons identifiés lors des évaluations et des utilisations internes. Dans chacun de ces cas, Claude a agi sur des sites web ou des systèmes réels de manière que nous ne l’avions pas prévu ; parfois, il a contourné une restriction plutôt que de l’annuler.
Tous les cas ont eu un impact minimal dans le monde réel. Du point de vue de l’alignement et de la sécurité, nous estimons que ces comportements sont nettement moins graves que les incidents de cybersécurité que nous avons rapportés en juillet et en septembre.
Lisez le rapport complet : https://www.anthropic.com/research/investigating-unintended-model-actions