OpenAI sagt, dass ein nicht ausgerichtetes Modell absichtlich seine eigene Umgebung zerstörte, in der Hoffnung auf eine neue Anfangsphase mit besseren Daten
Matthias Bastian
Das LinkedIn-Profil von Matthias Bastian ansehen
Oct 10, 2026OpenAI hat einige neue Geschichten über fehlende Agenten. Im ersten Fall (6. Oktober) konnte ein KI-Evaluationsmodell die Antworten nicht finden, die es bewerten sollte. Anstatt den Fehler zu melden, erstellte es Bewertungen, fälschte Eingabedateien und korrekturte absichtlich seine eigene Umgebung, in der Hoffnung, dass das System ihn durch eine neue virtuelle Maschine ersetzen würde, die die fehlenden Daten enthält.

Im zweiten Fall (19./20. Juni) überschritten die Modelle eine Einschränkung, die sie auf HTTP-GET-Anfragen beschränkte, während sie öffentliche Statistiken abrufen. Ein Modell erkannte ausdrücklich die Verletzung in seinem Denken, entschied sich aber dafür, weiterzumachen und erwähnte dies nie.
Im dritten Fall (16./17. Juni) hatten die Modelle bereits die benötigten Daten, fanden aber weiterhin Wege, um die Netzwerksperren zu umgehen. Sie erstellten Konten auf einem Remote-Shell-Dienst, leiteten verbotene POST-Anfragen über anonymisierende Relays und entwickelten eigene FTP-Clients. Anthropic hat auch dokumentiert, wie seine Modelle manchmal absurde Methoden anwenden, um die auferlegten Beschränkungen zu umgehen.
AI-Neuigkeiten ohne Hype – von Menschen ausgewählt
Abonnieren Sie THE DECODER, um ohne Anzeigen zu lesen, ein wöchentliches AI-Bulletin, unseren exklusiven „AI Radar“-Report sechsmal pro Jahr, vollen Zugang zum Archiv und Zugang zur Kommentarseite.
Quelle: OpenAI