Die Agent Arena bewertet die Fähigkeit von Agenten, Probleme in verschiedenen Bereichen zu lösen.
US-Labore führen in allen Bereichen an:
- Die Modelle von @AnthropicAI belegen die #1-Position in Code, Arbeit und Chat
- Der GPT 6 Astra (Max) von @OpenAI bleibt in den vier Top-Plätzen in allen drei Kategorien: #2 in Code und #4 in Arbeit und Chat
Die führenden Modelle bleiben in allen Kategorien stark, aber ihre Reihenfolge ändert sich:
- Der Claude Fable 5.1 (Max) führt sowohl in Code als auch in Work und belegt den 2. Platz in Chat
- Der Claude Sonnet 5.5 (Max) führt in Chat und belegt den 4. Platz in Code sowie den 5. Platz in Work
Die Ränge in Code und Arbeit bewegen sich enger zusammen als in Chat:
- Gemini 4 Argon (Hoch), beispielsweise erreicht es #14 in Code und #12 in Arbeit, aber #5 in Chat, was eine deutliche Stärke in Gesprächsagentenaufgaben zeigt
Die Agent Arena bewertet Modelle nach der Gesamteffizienz gegenüber der aktuellen Grenze sowie nach der Leistung in bestimmten Kategorien von agentischen Aufgaben. Diese Bewertungen basieren auf aktiven Daten, die von Agenten gesammelt werden, die realistische Aufgaben, die von Menschen auf der ganzen Welt eingereicht wurden, lösen.
- Code: Programmierung und Fehlerbehebung von Code, Workflow-Automatisierung und Datenanalyse
- Chat: kreatives Schreiben, Lernen, persönliche Fragen, alltägliche Forschung und Medienproduktion
- Arbeit: Dokumente, professionelle Forschung, Planung und professionelles Schreiben
Dieses Visual zeigt, wie die ausgewählten Modelle in den Kategorien von Agent Arena am 5. Oktober 2026 verglichen werden.

