KI-Agenten-Teams verschwenden massenhaft Tokens für kaum messbare Qualitätsverbesserungen, zeigt Forschung
Matthias Bastian
LinkedIn-Profil von Matthias Bastian ansehen
11. Oktober 2026
KI-Agenten-Teams liefern kaum bessere Ergebnisse als einzelne Agenten, so eine Studie.
Das Evaluierungsunternehmen Vals AI testete GPT-6 Sol und Claude Opus 5.5 auf dem "Vibe Code Bench", jeweils einzeln und als Teams, auf zwei Reasoning-Stufen: mittlerem und maximalem Reasoning-Aufwand. Die Teams kosteten zwischen dem 1,8-fachen und dem 5,1-fachen einzelner Agenten.
Von vier Vergleichen zwischen Teams und einzelnen Agenten zeigte nur einer eine statistisch signifikante Verbesserung: GPT-6 Sol bei mittlerem Reasoning, wo das Team 7,3 Punkte mehr erzielte. Bei maximalem Reasoning brachte das Team-Setup weder Sol noch Opus 5.5 einen echten Vorteil. Die Ergebnisse deuten darauf hin, dass sich die Mehrkosten von Agenten-Teams in den meisten Fällen nicht lohnen, besonders wenn Modelle bereits mit voller Rechenleistung laufen.

| Aufgabe mit Opus 5.5 | 1 Agent | 10 Agenten | 30 Agenten | 100 Agenten |
|---|---|---|---|---|
| Wissensdatenbank | 0.53 | 0.70 | 0.71 | 0.74 |
| Lean Theorem Proving | 0.39 | 0.66 | 0.66 | 0.68 |
Fable 5.1 zeigte bei der Lean-Theorembeweis-Aufgabe über zehn Agenten hinaus stärkere Qualitätszuwächse, lag aber in allen Tests weiterhin unter Opus 5.5. Bei der Wissensdatenbank-Aufgabe sank Fables Score beim Skalieren von 30 auf 100 Agenten sogar leicht ab.
Mehr Agenten bringen Geschwindigkeit, aber keine besseren Ergebnisse
Der OpenAI-Forscher Noam Brown bestätigte im Dwarkesh Podcast, dass Multi-Agenten-Systeme vor allem Geschwindigkeit bringen, nicht bessere Qualität. Vier Agenten lösten Aufgaben doppelt so schnell, kosteten aber auch doppelt so viel. Bei 16 Agenten blieb das Muster bestehen, wurde aber etwas weniger effizient.
Der Effekt hängt stark von der Aufgabe ab. Webrecherche und Mathematik lassen sich gut parallelisieren, das Schreiben eines Romans nicht, sagte er. 10,000 Agenten auf einen Roman anzusetzen wäre genauso sinnlos wie 10,000 Menschen darauf anzusetzen. Brown räumte ein, dass die Skalierung auf sehr große Agentenzahlen weitgehend unerforscht bleibt, weil die Kosten einfach zu hoch sind.
Der OpenAI-Entwickler Eric Provencher warnte kürzlich aus genau diesem Grund vor dem Einsatz von Agenten-Schwärmen . Wahrscheinlich sei das verschwendetes Geld, argumentierte er, weil die Koordination zwischen Agenten zusammenbreche. Er nannte es die Koordinationssteuer.
KI-News ohne Hype – kuratiert von Menschen
Abonniere THE DECODER für werbefreies Lesen, einen wöchentlichen KI-Newsletter, unseren exklusiven "AI Radar" Frontier-Report sechs Mal im Jahr, vollen Archivzugang und Zugang zu unserem Kommentarbereich.
Lesen Sie weiter für das vollständige Bild.
Abonnieren Sie für Berichterstattung ohne Hype.
- Voller Zugriff auf jeden Artikel auf THE DECODER
- Keine Werbung
- An den Kommentaren und Community-Diskussionen teilnehmen
- Ein wöchentlicher KI-News-Rückblick per Mail
- 6x/Jahr: "AI Radar" — Deep Dives zu den wichtigsten KI-Themen
- Tägliche KI-News, immer auf dem neuesten Stand
- Unser vollständiges zehnjähriges Archiv
- Abgedeckt von einem Team mit über 10 Jahren Erfahrung in KI
