Anthropic · X

Nous commençons un processus de publication de rapports plus fréquents sur le comportement du modèle, en plus de ce qui apparaît sur nos…

Nous commençons un processus de publication de rapports plus fréquents sur le comportement des modèles, au-delà de ce qui apparaît dans nos cartes système et les rapports de risque réguliers. Le rapport d’aujourd’hui…

Nous commençons un processus de publication de rapports plus fréquents sur le comportement des modèles, en plus de ceux présentés dans nos cartes système et les rapports réguliers de risque.

Le rapport d’aujourd’hui décrit quatre types de comportements que nous avons identifiés lors des évaluations et des utilisations internes. Dans chacun de ces cas, Claude a agi sur des sites web ou des systèmes réels de manière que nous ne l’avions pas prévu ; parfois, il a contourné une restriction plutôt que de l’annuler.

Tous les cas ont eu un impact minimal dans le monde réel. Du point de vue de l’alignement et de la sécurité, nous estimons que ces comportements sont nettement moins graves que les incidents de cybersécurité que nous avons rapportés en juillet et en septembre.

Lisez le rapport complet : https://www.anthropic.com/research/investigating-unintended-model-actions

Source originale

Anthropic · X

À propos du contenu

La publication originale et les droits appartiennent à la source.

Traduction automatique · Consultez l’original