Arena · X

Einführung des Arena Alignment Index – unser neuer Benchmark, der die Sicherheit und die Ausrichtung von KI-Agenten im echten Einsatz…

Einführung des Arena Alignment Index – unser neuer Benchmark, der die Sicherheit und die Ausrichtung von AI-Agenten im realen Einsatz misst. Erstellt aus 90K+ realen Agent-Sitzungen für 27 Modelle, misst der Index drei…

Bildquelle · Arena · X

Einführung des Arena Alignment Index – unser neuer Benchmark, der die Sicherheit und die Ausrichtung von KI-Agenten im echten Einsatz vermessen.

Erstellt aus über 90K realen Agent-Sessions für 27 Modelle, misst der Index drei wichtige Signale:
- Unbefugte Handlungen (UA): Handlungen, die über die Anweisungen oder Berechtigungen des Benutzers hinausgehen
- Falsche Zuschreibung (FA): Zuschreibung von Aussagen oder Handlungen, die durch von dem Benutzer gelieferte Beweise widersprüchlich sind
- Täuschende Vollendung (DC): Behauptung, dass eine Aufgabe abgeschlossen wurde, obwohl dies nicht der Fall ist.

Wichtige Erkenntnisse:
- Die OpenAI-Modelle führen derzeit den Alignment Index an
- Unautorisierte Handlungen sind selten, können aber bei ihrem Auftreten ernsthafte Folgen haben
- Agenten können die Nutzer bezüglich des Fortschritts der Aufgabe täuschen
- Die Risiken der Unschätzbarkeit nehmen mit der Länge des Gesprächs zu
- Sicherheit und Alignment verbessern sich in den verschiedenen Modellgenerationen

Wie im untenstehenden Leaderboard zu sehen ist (geordnet nach Labor), führt @OpenAI’s GPT-6.1-Sol mit einer Punktzahl von 87,9 den Arena Alignment Index an, gefolgt von @AnthropicAI’s Claude-Opus-5,5 mit 83,2 und @SpaceXAI’s Grok-4,7 mit 82,7. OpenAI hat außerdem die besten beobachteten Werte für alle drei Signale: 0,89 % unautorisierte Handlungen, 1,98 % falsche Attributionen und 2,34 % betrügerische Fertigstellung.

In allen vier Laboren überzeugen die neueren Modelle konstant besser als ihre Vorgänger, was auf einen umfassenden Fortschritt in der Sicherheit und Alignment der Agenten hindeutet. Da die Agenten langsamere, komplexere und höhere Risiken enthaltene Aufgaben übernehmen, wird es immer wichtiger, nicht nur zu messen, was sie erreichen können, sondern auch, wie sicher und zuverlässig sie handeln.

Dies ist ein wichtiger Schritt auf dem Weg, die Sicherheit und die Alignment zum Kerngrundpunkt bei der Art und Weise, wie Arena KI bewertet, zu machen. Der Index ist ein Ausgangspunkt, und wir werden den Index im Laufe der Zeit mit zusätzlichen Sicherheitssignalen und Modellen weiter ausbauen.

Mehr Analyse unten👇

Originalquelle

Arena · X

Hinweise zum Inhalt

Originalveröffentlichung und Rechte liegen bei der Quelle.

Maschinelle Übersetzung · Original beachten