The Decoder

KI-Agenten-Teams verschwenden massenhaft Tokens für kaum messbare Qualitätsverbesserungen, zeigt Forschung

Teams aus KI-Agenten schneiden kaum besser ab als einzelne Agenten, kosten aber bis zu 5,1x mehr, so Vals AI. Nur einer von vier Tests mit GPT-6 Sol und Claude Opus 5.5 zeigte einen messbaren Zuwachs. Anthropics eigene…

Matthias Bastian
Bildquelle · The Decoder

KI-Agenten-Teams verschwenden massenhaft Tokens für kaum messbare Qualitätsverbesserungen, zeigt Forschung

Matthias Bastian Matthias Bastian LinkedIn-Profil von Matthias Bastian ansehen 11. Oktober 2026 Image description

KI-Agenten-Teams liefern kaum bessere Ergebnisse als einzelne Agenten, so eine Studie.

Das Evaluierungsunternehmen Vals AI testete GPT-6 Sol und Claude Opus 5.5 auf dem "Vibe Code Bench", jeweils einzeln und als Teams, auf zwei Reasoning-Stufen: mittlerem und maximalem Reasoning-Aufwand. Die Teams kosteten zwischen dem 1,8-fachen und dem 5,1-fachen einzelner Agenten.

Von vier Vergleichen zwischen Teams und einzelnen Agenten zeigte nur einer eine statistisch signifikante Verbesserung: GPT-6 Sol bei mittlerem Reasoning, wo das Team 7,3 Punkte mehr erzielte. Bei maximalem Reasoning brachte das Team-Setup weder Sol noch Opus 5.5 einen echten Vorteil. Die Ergebnisse deuten darauf hin, dass sich die Mehrkosten von Agenten-Teams in den meisten Fällen nicht lohnen, besonders wenn Modelle bereits mit voller Rechenleistung laufen.

Vals AIs Benchmark zeigt die Kosten pro App gegenüber dem Score auf dem Vibe Code Bench. Pfeile führen vom jeweiligen Single-Agenten eines Modells zu dessen Team bei gleichem Reasoning-Aufwand. Teams kosten deutlich mehr, verbessern die Scores aber kaum. | Bild: Vals AI[
Anthropic sah die Qualitätszuwächse schrumpfen, als es in zwei eigenen Tests mit Opus 5.5mehr Agenten hinzufügte. Größere Teams erreichten ein bestimmtes Leistungsniveau schneller, aber der Sprung von zehn auf 100 Agenten erhöhte die Scores nach 24 Stunden nur leicht. In separaten ProgramBench-Tests gingen Geschwindigkeitsgewinne mit höherem Tokenverbrauch einher.

Aufgabe mit Opus 5.5 1 Agent 10 Agenten 30 Agenten 100 Agenten
Wissensdatenbank 0.53 0.70 0.71 0.74
Lean Theorem Proving 0.39 0.66 0.66 0.68

Fable 5.1 zeigte bei der Lean-Theorembeweis-Aufgabe über zehn Agenten hinaus stärkere Qualitätszuwächse, lag aber in allen Tests weiterhin unter Opus 5.5. Bei der Wissensdatenbank-Aufgabe sank Fables Score beim Skalieren von 30 auf 100 Agenten sogar leicht ab.

Mehr Agenten bringen Geschwindigkeit, aber keine besseren Ergebnisse

Der OpenAI-Forscher Noam Brown bestätigte im Dwarkesh Podcast, dass Multi-Agenten-Systeme vor allem Geschwindigkeit bringen, nicht bessere Qualität. Vier Agenten lösten Aufgaben doppelt so schnell, kosteten aber auch doppelt so viel. Bei 16 Agenten blieb das Muster bestehen, wurde aber etwas weniger effizient.

Der Effekt hängt stark von der Aufgabe ab. Webrecherche und Mathematik lassen sich gut parallelisieren, das Schreiben eines Romans nicht, sagte er. 10,000 Agenten auf einen Roman anzusetzen wäre genauso sinnlos wie 10,000 Menschen darauf anzusetzen. Brown räumte ein, dass die Skalierung auf sehr große Agentenzahlen weitgehend unerforscht bleibt, weil die Kosten einfach zu hoch sind.

Der OpenAI-Entwickler Eric Provencher warnte kürzlich aus genau diesem Grund vor dem Einsatz von Agenten-Schwärmen . Wahrscheinlich sei das verschwendetes Geld, argumentierte er, weil die Koordination zwischen Agenten zusammenbreche. Er nannte es die Koordinationssteuer.

KI-News ohne Hype – kuratiert von Menschen

Abonniere THE DECODER für werbefreies Lesen, einen wöchentlichen KI-Newsletter, unseren exklusiven "AI Radar" Frontier-Report sechs Mal im Jahr, vollen Archivzugang und Zugang zu unserem Kommentarbereich.

Lesen Sie weiter für das vollständige Bild.
Abonnieren Sie für Berichterstattung ohne Hype.

  • Voller Zugriff auf jeden Artikel auf THE DECODER
  • Keine Werbung
  • An den Kommentaren und Community-Diskussionen teilnehmen
  • Ein wöchentlicher KI-News-Rückblick per Mail
  • 6x/Jahr: "AI Radar" — Deep Dives zu den wichtigsten KI-Themen
  • Tägliche KI-News, immer auf dem neuesten Stand
  • Unser vollständiges zehnjähriges Archiv
  • Abgedeckt von einem Team mit über 10 Jahren Erfahrung in KI
The Decoder abonnieren
Originalquelle

The Decoder

Hinweise zum Inhalt

Originalveröffentlichung und Rechte liegen bei der Quelle.

Maschinelle Übersetzung · Original beachten