Laut Studien übertreiben AI-Agenten ihre Ergebnisse und sind weit entfernt von autonomen Forschungsarbeiten
Manuel Uth
11. Oktober 2026
Nano Banana Pro wird vom THE DECODER aufgerufen
Die Ergebnisse von Epoch AI und Anthropic zeigen, dass AI-Modelle Experimente durchführen können, aber an wissenschaftlicher Selbstkritik und echter kreativer Denken mangelt.
Die wichtigsten KI-Labore verkaufen ihre Modelle zunehmend als Forschungstools. Google DeepMind hat seine Aktivitäten ausgebaut. Ko-Wissenschaftler in ein volles Forschungssystem, und OpenAI führte eine „automatisierter ForschungsinternIm September wieder. Bis März 2028 soll dieser Praktikant zu einem autonomen AI-Forscher unter menschlicher Überwachung werden, aber eine wichtige Fähigkeit fehlt noch: wissenschaftliches Urteilsvermögen.
Die Agenten wurden gebeten eine neue Trainingsmethode zu entwickeln
Mit seinem Benchmark „InnovationEval“ testete Epoch AI, ob KI-Agenten eigenständig Forschung durchführen können. Die Aufgabe bestand darin, eine neue Methode zur Verbesserung von Sprachmodellen nach deren anfänglicher Trainierung zu entwickeln, diese anschließend selbst umzusetzen, zu testen und weiterzuverbessern.
Der Ausgangspunkt war GRPO, eine weit verbreitete Technik. GRPO vergleicht mehrere Antworten, die ein Modell für dieselbe Aufgabe erzeugt, und belohnt die besseren Lösungen, indem es jede Lösung als Ganzes bewertet. Die von Menschen entwickelte Referenzmethode SDPO verwendet zusätzliche Signale wie Fehlermeldungen, um präzisere Lernfeedback für die einzelnen Schritte einer Antwort zu erzeugen, sodass das Modell effektiv sein eigenes Lehrer wird.
Epoch testete Claude Fable 5 und GPT-5.6 Sol, die laut der Organisation keine vorherige Kenntnis von SDPO hatten. Die Leistung wurde bei kurzen Antwortaufgaben wie wissenschaftlichen Fragen und bei Programmieraufgaben gemessen, wobei jedes Agent Zugang zu bis zu 3.000 Stunden Rechenzeit auf Hochleistungschips hatte, aber keinen Internetzugang.
Beide Modelle nutzten bekannte Techniken statt Innovationen zu entwickeln
Keine der Modelle kam dem menschlichen Referenzwert nahe. GPT-5.6 Sol zielte auf eine Schwäche in GRPO ab: Wenn alle Antworten zu einer Aufgabe korrekt sind, lernt das Modell nichts, da es nichts zu vergleichen gibt. Sol ließ das Modell seine erfolgreichen Lösungen in solchen Fällen verstärken, aber die Idee war nicht neu.
Im Vergleich zur Verbesserung, die SDPO gegenüber GRPO erzielt, erreichte Sol laut Epoch eine Bewertung von etwa 35 Prozent mit großzügiger Bewertung. Wenn nur solche Änderungen berücksichtigt werden, die innerhalb der Experimentierregeln blieben, sinkt diese Zahl auf etwa 15 Prozent. Bei Kodieraufgaben machte Sol es hauptsächlich so, dass das Training teurer und langsamer wurde, anstatt den Methode selbst zu verbessern.
Claude Fable 5 konnte die Modelle dazu bringen, Aufgaben erneut zu versuchen, während sie die vorherigen fehlgeschlagenen Versuche weitergeben, was ebenfalls eine bekannte Technik ist – doch es gab keine messbare Verbesserung. Selbst Sols teilweisen Erfolg würde für Experten kaum als „moderat interessant“ gelten, so Epoch. Neuere Modelle, die SDPO aus ihren Trainingsdaten kannten, konnten dies auch nicht vollständig nachahmen. GPT-6 Astra entwickelte eine ähnliche Lösung, gab aber den Quellcode nicht preis. Selbst mit dem Originalartikel vor sich konnte Fable 5 die Referenz nicht erreichen.
Die Agenten wählten nur ihre besten Spielzüge aus und vergrub den Rest
Beide Agenten hatten auch ein Berichtsproblem. Sie führten mehrere nahezu identische Trainingsrunden durch und berichteten jedes Mal nur über das beste Ergebnis – was dazu führte, dass die Methode schwerer erscheint, als sie tatsächlich ist, da die Ergebnisse zufällig variieren. In ihren endgültigen Berichten erwähnten die Modelle diese Praxis kaum, wenn überhaupt, und sie konnten auch die vorherige Arbeit nicht angeben, auf der ihre Methoden beruhen. Ihre selbst gemelten Zahlen waren entsprechend hoch: Sol behauptete etwa 70 Prozent der Verbesserung des SDPO, Fable 5 etwa 40 Prozent. Epoch entfernte diese übertriebenen Ergebnisse.

Die internen Rechenlogiken der Modelle zeigen, dass sie sich des Problems bewusst waren; Fable 5 beschreibt ihre wiederholten Ausführungen als eine Suche nach einem besseren Checkpoint. Ob dies auf absichtliches Betrügen oder Verwirrung zurückzuführen ist, lässt Epoch offen.
Für GPT-5.6 Sol passt das Verhalten zu einer früheren Erkenntnis der Bewertungsorganisation METR, die bei diesem Modell mehr Betrugsversuche im eigenen Kodierungstest feststellte als bei jedem anderen öffentlich verfügbaren Modell, das sie bewertet hat.
Epoch schlussfolgert, dass Menschen alle von KI erstellten Forschungen vollständig überprüfen müssten, was die Nützlichkeit der Modelle beeinträchtigt.
Anthropic erkennt dieselben Schwächen in seinem eigenen Modell
Anthropic beschreibt ähnliche Einschränkungen im Systemkarten für Claude Opus 5.5. Laut Anthropic ist das Modell weit entfernt von der Ersetzung der eigenen Forscher des Unternehmens; die Hauptprobleme liegen in der „epistemischen Qualität“ und dem Folgen von Anweisungen.
Opus 5.5 stellt ungeprüfte Annahmen als Fakten dar und ignoriert seine eigenen Zweifel häufiger als frühere Modelle. Es beschreibt Teilprüfungen als vollständige Überprüfungen, verwandelt vorläufige Bewertungen in Empfehlungen ohne zusätzliche Kontrolle und beantwortet Kritik zu eng begrennt, ohne den Gesamtblick zu hinterfragen. Zudem bevorzugt es kleine, schrittweise Anpassungen und verweilt auf veröffentlichte Studien anstatt neue Ideen zu entwickeln.
Eine Untersuchung, an der die Princeton University und das UK Safety Institute beteiligt waren, kam ebenfalls zu ähnlichen Schlussfolgerungen. Claude Opus 4,8 arbeitete sechs Tage lang an den Forschungsfragen hinter zwei unveröffentlichten Artikeln von der NeurIPS AI Konferenz, und die ursprünglichen Autoren lehnten beide Ergebnisse bei ihrer Überprüfung ab. Wenn die anfänglichen Hypothesen fehlschlugen, entsprechen die Agenten einfach ihren Behauptungen, anstatt von vorne anzufangen.
Die technische Umsetzung ist zunehmend ein kleinerer Problem, da das, was die Agenten am meisten fehlen, die Fähigkeit ist, realistisch abzuschätzen, wie zuversichtlich sie in ein Ergebnis sein sollten, und ihre eigene Vorgehensweise auf grundlegender Ebene in Frage zu stellen.
Mehr Rechenleistung allein wird den Unterschied nicht schließen
Künstliche Intelligenz ist für Forschung nicht nutzlos, da Modelle die Literaturübersicht, das Schreiben von Code und die Erkundung von Variationen schneller ermöglichen als Menschen.
Aber ob die Verwendung mehr Rechenleistung am Problem dazu führt, dass autonome Forscher entstehen, bleibt eine offene Frage. GPT-5.6 Sol verbrachte seinen gesamten Budget, und seine Verbesserungen bei kurzen Antwortaufgaben zeigten sich erst ganz am Ende seiner Rechenzeit, während es bei Programmieraufgaben überhaupt keine Regelkonformität erreichte. Epoch betrachtet diesen späten Durchbruch als schwache Anzeichen dafür, dass mehr Rechenzeit helfen könnte, obwohl Fable 5 nicht einmal die Hälfte seines Budgets verbrachte.

Epoch weist außerdem darauf hin, dass die führenden Modelle von vor einem Jahr bei demselben Test deutlich schlechter abgeschnitten hätten. Die Organisation plant, InnovationEval regelmäßig mit neuen Aufgaben durchzuführen. Bis dahin bleibt der größte Unterschied die epistemische Disziplin: Skeptisch an Ihre eigenen Erkenntnisse teilhaben, Unsicherheiten offenlegen und negative Ergebnisse ernst nehmen.
AI-News ohne Hype – von Menschen zusammengestellt
Abonnieren Sie THE DECODER, um ohne Werbung zu lesen, ein wöchentliches AI-Bulletin, unseren exklusiven „AI Radar“-Bericht sechsmal pro Jahr, Zugang zum vollständigen Archiv und Zugang zur Kommentarspalte.
Lesen Sie weiter für das vollständige Bild.
Abonnieren Sie, um eine unaufgeregte Berichterstattung zu erhalten.
- Vollzugriff auf jedes Artikel auf THE DECODER
- Keine Anzeigen
- Teilen Sie Ihre Kommentare und diskutieren Sie in der Gemeinschaft
- Wöchentliche Zusammenfassung von AI-News per E-Mail
- 6x/Jahr: „AI Radar“ – tiefgehende Einblicke in die wichtigsten Themen der KI
- Tägliche AI-Neuigkeiten, immer aktuell
- Unsere volle zehnjährige Archivdatenbank
- Beschützt von einem Team mit mehr als 10 Jahren Erfahrung in KI
