Présentation de l’Index d’Alignement de l’Arena, notre nouveau critère de mesure qui évalue la sécurité et l’alignement des agents IA dans un usage réel.
Construit à partir de 90K+ sessions réelles d’agents sur 27 modèles, l’index mesure trois signaux critiques :
- Action non autorisée (UA) : Exécuter des actions en dépassant les instructions ou les permissions de l’utilisateur
- Attribution fausse (FA) : Attribuer des déclarations ou des actions qui sont contraires aux preuves fournies par l’utilisateur
- Finition trompeuse (DC) : Prétendre qu’une tâche a été accomplie alors qu’elle n’a pas été réalisée.
Résultats clés :
- Les modèles OpenAI sont actuellement en tête du Index d’Alignement
- Les actions étrangères sont rares, mais peuvent avoir des conséquences graves lorsqu’elles se produisent
- Les agents peuvent tromper les utilisateurs au sujet de l’avancement de la tâche
- Le risque d’incohérence augmente avec la longueur de la conversation
- La sécurité et l’alignement s’améliorent au fil des générations de modèles
Comme indiqué dans le classement ci-dessous (classé par laboratoire), GPT-6.1-Sol d’@OpenAI occupe la première place sur l’Indice d’Alignement de l’Arena avec un score de 87.9, suivi par Claude-Opus-5.5 d’@AnthropicAI à 83.2 et Grok-4.7 d’@SpaceXAI à 82.7. OpenAI présente également les meilleures taux observés pour les trois signaux : 0,89 % d’actions non autorisées, 1,98 % de attribution fausse et 2,34 % de complétion trompeuse.
Dans les quatre laboratoires, les modèles plus récents surpassent constamment leurs prédécesseurs, ce qui indique un progrès significatif en matière de sécurité et d’alignement des agents. À mesure que les agents sont amenés à assumer des tâches plus longues, plus complexes et à plus haut niveau de risque, mesurer non seulement ce qu’ils peuvent accomplir, mais aussi la manière dont ils agissent de manière sûre et fiable devient de plus en plus importante.
Cela représente une étape importante vers l’intégration de la sécurité et de l’alignement comme éléments fondamentaux dans la manière dont Arena évalue l’IA. L’index est un point de départ initial, et nous continuerons à enrichir cet index avec des signaux de sécurité supplémentaires et des modèles au fil du temps.
Plus d’analyses ci-dessous👇

