Arena · X

Presentamos el Arena Alignment Index, nuestro nuevo índice de referencia que mide la seguridad y la alineación de los agentes de IA en uso…

Presentamos el Arena Alignment Index, nuestro nuevo benchmark que mide la seguridad y la alineación de los agentes de IA en uso real. Construido a partir de más de 90K+ sesiones de agentes en el mundo real para 27…

Fuente de la imagen · Arena · X

Presentamos el Arena Alignment Index, nuestro nuevo índice de referencia que mide la seguridad y la alineación de los agentes de IA en uso real.

Construido a partir de más de 90K sesiones de agentes en el mundo real entre 27 modelos, el índice mide tres señales críticas:
- Acción no autorizada (UA): Realizar acciones que van más allá de las instrucciones o permisos del usuario
- Atribución falsa (FA): Atribuir declaraciones o acciones que contradicen las pruebas proporcionadas por el usuario
- Completación engañosa (DC): Afirmar que una tarea se completó cuando en realidad no lo fue.

Hallazgos clave:
- Los modelos de OpenAI lideran actualmente el Índice de Alineación
- Las acciones no autorizadas son raras, pero pueden tener consecuencias graves cuando ocurran
- Los agentes pueden engañar a los usuarios sobre el progreso del trabajo
- El riesgo de desalineación aumenta con la longitud de la conversación
- La seguridad y la alineación están mejorando entre las diferentes generaciones de modelos

Como se muestra en el tablero de líderes a continuación (ordenado por laboratorio), GPT-6.1-Sol de @OpenAI lidera el Índice de Alineación de la Arena con un puntaje de 87.9, seguido por Claude-Opus-5.5 de @AnthropicAI con 83.2 y Grok-4.7 de @SpaceXAI con 82.7. OpenAI también tiene las mejores tasas observadas en los tres señales: 0.89% de Acción No Autorizada, 1.98% de Atribución Falsa y 2.34% de Completación Engañosa.

En los cuatro laboratorios, los modelos más nuevos siempre superan a sus predecesores, lo que indica un progreso significativo en la seguridad y alineación de los agentes. A medida que los agentes asumen tareas más largas, complejas y de mayor riesgo, es cada vez más importante medir no solo lo que pueden lograr, sino también cómo actúan de manera segura y confiable.

Esto representa un paso importante hacia el hecho de que la seguridad y el alineamiento se conviertan en una parte fundamental de la forma en que Arena evalúa la inteligencia artificial. El índice es un punto de partida inicial, y continuaremos expandiendo el índice con señales adicionales de seguridad y modelos a lo largo del tiempo.

Más análisis abajo👇

Fuente original

Arena · X

Notas sobre el contenido

La publicación original y los derechos pertenecen a la fuente.

Traducción automática · Consulte el original