Das Kerngeheimnis der Large-Model-Szene ließ sich am Ende doch nicht schützen! Nachdem vor Kurzem berichtet wurde, dass von Opus 5.5 1,9 Millionen Zeichen an Prompts geleakt wurden, versagte die „Gravitation“ der KI-Welt erneut – OpenAIs aktives Codemodell GPT-6 Sol Codex wurde „gedoxt“, und seine Vergangenheit wurde vollständig offengelegt!

Laut der großen Enthüllung des ausländischen Leakers (@elder_plinius) gelang es ihm, den vollständigen Systemprompt samt Tool-Definitionen von GPT-6 Sol Codex mit rund 294.000 Zeichen zu extrahieren.

Ganze 1902 Zeilen an Instruktionsvorlagen, temporären Instruktionsdateien und interner Kollaborationslogik lagen damit restlos vor den Entwicklern der ganzen Welt offen.
Man muss wissen: Sol Codex ist kein veraltetes Stück Technik, sondern die Ader-Codemodell-Version der aktiven Preisleistungs-Produktlinie GPT-5.6 Sol von OpenAI!
Dieses Leak ist, als hätte man die geheime Formel von Coca-Cola öffentlich gemacht.
Was verbirgt sich also in diesen fast 300.000 Zeichen an „Himmelsgeheimnissen“? Wie hat OpenAI dieses Codemonster eigentlich abgerichtet?
Heute zerlegen wir dieses unbezahlbare interne Handbuch Satz für Satz und schauen uns an, wie das weltweit beste Prompt-Engineering wirklich aussieht!
Lebwohl vom „KI-Ton“, wie tötet OpenAI das „leere Gerede“?
Was nervt alle am meisten bei der Nutzung von ChatGPT?
Sicherlich dieser schwere „KI-Ton“: ständig „Zusammenfassend lässt sich sagen“, „Bemerkenswert ist“, „eine vertiefte Betrachtung“ …
In diesen geleakten Systeminstruktionen stellen wir erstaunt fest: OpenAI selbst hat diese Floskeln satt! Im Abschnitt zum Schreibstil hat der Hersteller GPT-6 einem äußerst strengen Anti-Floskel-Training unterzogen.
Entschlüsselung des Originaltexts der Instruktion:
Vermeide KI-Müllvokabeln (AI slop words) oder Phrasen, wie etwa in Schlussfolgerungen „das Fazit lautet (Bottom Line)“, „Bedeutung (Significance)“, „Perspektive (Perspective)“, sowie „vertiefen (delve)“, „fördern (foster)“, „nutzen (leverage)“, „bemerkenswert ist (it's worth noting)“, „wichtig ist (importantly)“ …

OpenAI geht sogar so weit, vom Modell zu verlangen:
Keine erzwungene Begeisterung: „Als Codex bist du ein neugieriger und gedanklich rigoroser Mitarbeiter … Lass dein Interesse und deine Persönlichkeit natürlich durchscheinen, ohne Schmeichelei oder aufgesetzte Heiterkeit.“
Kein leeres Gerede als Füllstoff: Beschreibe deine Absicht direkt, ohne aufzulisten, „was du nicht tun wirst“ oder „was unverändert bleibt“.
Minimale Kommunikation: Wenn du technische Konzepte diskutierst, sprich wie mit einem Kollegen. Benutze vorzugsweise vertraute Vokabeln und konkrete Beschreibungen und setze niemals voraus, dass der Nutzer fehlende Schritte selbst ergänzen kann.

Das ist eine Lektion für alle Prompt-Engineers! Wer von der KI hochwertige Inhalte will, sollte als ersten Schritt eine „negatives-Vokabel-Schwarze Liste“ anlegen und die schematischen Ausdrucksweisen des Modells zwangsweise abschneiden.
Die furchtbare „extreme Autonomie“ – Stör mich nicht, ich arbeite!
Viele halten KI für einen bloßen Chatbot nach dem Frage-Antwort-Prinzip, aber GPT-6 Sol Codex bricht mit dieser Vorstellung völlig. Es wurde zu einem hochautonomen, ja fast „autokratischen“ digitalen Supermitarbeiter geformt.
Im Kapitel über Autonomie und Persistenz verlieh OpenAI ihm erstaunliche Privilegien:
Entschlüsselung des Originaltexts der Instruktion:
Der Nutzer hasst es, wenn du anhältst, um Bestätigungen einzuholen oder um Erlaubnis zu bitten. Sobald die Beweise in der Sitzung den nächsten Schritt stützen, solltest du weiterarbeiten statt die Runde zu beenden, um dich mit dem Nutzer abzustimmen.
Zufriedene dich nicht mit teilweisen oder „gerade so brauchbaren“ Lösungen, nur um Zeit, Mühe oder Token zu sparen. Wenn die Aufgabe durchgehende Arbeit erfordert, erledige alle notwendigen Arbeiten, bis das gewünschte Ergebnis erreicht ist.
Was bedeutet das? Stößt es auf einen Bug, behebt es ihn selbst! Es kann eigenständig isolierte Workspaces anlegen, Git-Merge-Konflikte lösen und Draft-PRs erstellen – außer bei destruktiven oder irreversiblen Aktionen hält es niemals inne und fragt dich „Wie geht es weiter?“.
Es akzeptiert kein „halbgariges" Engineering. Wenn man es eine Funktion schreiben lässt, muss es alle Vorbedingungen wie Tests und Integration vollständig erledigen; erst beim letzten Schritt wie dem Klicken auf „Deployen" oder „Code mergen" reicht es das Endergebnis zur Unterschrift und Genehmigung vor.
Um zu verhindern, dass es die Nutzer unbeachtet lässt, während es im Hintergrund still arbeitet, sieht die Anweisung außerdem vor: „Wenn eine Nutzeranfrage den Aufruf von Tools erfordert, muss innerhalb von 60 Sekunden eine kurze Statusaktualisierung an den Nutzer im Kommentar-Kanal gesendet werden."
Das ist wie ein extrem zuverlässiger Senior-Programmierer: Er erhält die Anforderung, dreht sich um und tippt Code, löst kleine Probleme selbst, antwortet jede Minute auf DingTalk mit „Prüfe gerade die Logs“ und wirft dir am Ende einfach den fertigen perfekten Code hin.
Enthüllung der göttlichen Toolchain: Das „Arsenal“ des großen Sprachmodells
Als erstklassiger Code-Agent beherrscht GPT-6 Sol Codex eine enorm umfangreiche und harte Toolchain. Dieses Leck legt seine Arbeitsweise vollständig offen.
1. Verachtung für grep, alleinige Vorliebe für rg: Bei der Suche nach Text oder Dateien ist die Anweisung fest einprogrammiert: „Du musst zuerst rg oder rg --files verwenden; sie sind wesentlich schneller als Alternativen wie grep. Erst wenn es dort nichts gibt, darfst du zum zweitbesten Werkzeug greifen.“ (Anmerkung: rg ist ripgrep, ein extrem schnelles Suchwerkzeug).
2. Parallele Verarbeitung und Ausführung: Das System verlangt, dass das Modell beim Aufruf von functions.exec, wenn die Aufgaben unabhängig sind, await Promise.allSettled ([...]) für parallele Verarbeitung verwenden muss, um die Zeit_effizienz maximal auszureizen.
3. Dynamischer Skill-Tree: Das ist die begehrlichste Funktion. Das System definiert einen Mechanismus namens SKILL.md. Wenn der Nutzer etwas verlangt, kann das Modell das SKILL.md aus einem angegebenen Verzeichnis lesen (sogar über Kurzpfad-Aliase wie r0 suchen). Das ist, als würde man dem Modell unzählige „Fähigkeitenbücher“ anhängen – jederzeit heiß aktualisierbar!
4. Vollständige Übernahme von Computer und Browser: Im diesmal geleakten Modul model_messages.confirmation_policies.browser_use ist detailliert festgelegt, wie es den Browser und die Benutzeroberfläche des Computers verwendet.
Das beweist, dass GPT-6 bereits vollkommen die Fähigkeit besitzt, „vorausschauend zu kalkulieren“ und sogar den „Desktop zu übernehmen“! Es kann selbst Webseiten öffnen, auf Schaltflächen klicken, Formulare ausfüllen und sogar Screenshots machen. Doch damit es keinen „Unsinn anstellt“, hat OpenAI vier äußerst komplexe Bestätigungsmodi eingerichtet:

Ein Arbeitsablauf im „Inception“-Stil – Langzeitgedächtnis und Ruhestands-Mechanismus
Was fürchtet ein großes Sprachmodell bei einem extrem umfangreichen Codebestand am meisten? – Den Wortverlust (Kontextüberlastung). Der geleakte Code zeigt uns, wie OpenAI durch ausgeklügelte Prompts das uralte Problem des „Goldfischgedächtnisses“ von LLMs löst.
1. Gedächtniskompression und Übergabe
Wenn das Token-Budget aufgebraucht ist, stürzt das System nicht einfach ab. In den Anweisungen gibt es eine eigene token_budget.guidance_message: „Bevor du ein neues Kontextfenster startest, speichere mit dem notes-Werkzeug eine knappe Fortschrittsnotiz, enthaltend: Ziele, Entscheidungen, Fortschritt, Gelerntes, nächste Schritte sowie die Fenster-ID und Projekt-ID der relevanten Nutzeranfragen … Künftige Kontextfenster werden die aktuelle Konversation nicht automatisch enthalten.“ Wie ein Mensch beim Schichtwechsel schreibt diese KI vor Feierabend ein ausführliches Übergabedokument und ruft dann functions.new_context auf, um eine völlig neue Kontextumgebung zu starten. Das ist schlicht eine göttliche Technik für endlose Laufzeit!
2. Ruhezustand und Heartbeat-Aufweckung
Am meisten Gänsehaut verursacht die Tatsache, dass dieses Modell „dauerhaft im Hintergrund“ laufen kann. In persistent_instructions wird es angewiesen, Aufgaben aktiv zu verfolgen: „Wenn der Nutzer fragt, wie ein bestimmter Eval läuft, und dieser noch läuft, melde den aktuellen Status und überwache den Eval weiter, bis er einen Endzustand erreicht.“ Das System sendet außerdem regelmäßig versteckte <heartbeat>-XML-Tags an das Modell. Zu diesem Zeitpunkt wird das Modell „aufgeweckt“, um zu prüfen, ob die Hintergrundaufgaben abgeschlossen sind. Gibt es nichts Wichtiges, wählt das Modell DONT_NOTIFY (den Nutzer nicht stören); ist CI / CD abgestürzt, wählt das Modell NOTIFY und benachrichtigt den Nutzer sofort per Pop-up. Es wartet nicht auf deine Frage – es arbeitet im Hintergrund wirklich für dich!
Der stärkste Code-Rezensent
Für Programmierer ist das Wertvollste in diesem geleakten Dokument zweifellos die eingebaute Code-Review-Anleitung! OpenAI verrät offen, wie man eine KI hochwertige Code Reviews durchführen lässt:
Stufensystem:

2. Eiserne Review-Regeln:
Unbedeutende Code-Stilfragen ignorieren, außer sie beeinträchtigen die Lesbarkeit oder verstoßen gegen festgelegte Standards.
Jeder Vorschlag muss in einem Absatz klar erklären, „warum dies ein Problem ist“.
Niemals Code-Snippets von mehr als 3 Zeilen liefern. Bei konkreten Ersetzungsvorschlägen muss der suggestion-Block von Markdown verwendet werden, wobei die ursprüngliche Einrückung perfekt erhalten bleiben muss (Leerzeichen oder Tabs müssen exakt stimmen).
Der Ton muss sachlich sein, Schmeicheleien sind verboten (kein „Gute Arbeit“, kein „Danke für deinen Beitrag“).
Wenn man diese Logik direkt in den internen Code-Review-Bot seines Unternehmens übernimmt, schlägt sie garantiert 90 % der billigen Marketing-KI auf dem Markt!
Die Zuschauer streiten lautstark: „Angriff aus einer höheren Dimension“ oder „Kinderkram“?
Angesichts dieses fast 300.000 Zeichen umfassenden epischen Lecks ist die Entwickler-Community im Ausland förmlich explodiert. Die Stimmen sind vielfältig – ein wahres Panoptikum. Manche waren so beeindruckt, dass sie nur noch zusammenhangslos staunten:

Manche hielten es für Schaufensterdekoration: Der Netizen vechen: „Der Kollege hat das doch wohl einfach aus lokalen Dateien genommen. Was soll so ein ‚Leak‘ überhaupt bringen, zum Lachen – man findet die Spuren ohnehin im offiziell öffentlichen Codex-Repository.“
Auch ein Gott von der Spitze der Verachtungshierarchie kam zum Spott heraus: Netizen Outdated Often: „Wen interessiert das, Pliny – ich habe sogar den Meta Hatch Full-Stack ergattert, mit versteckten Reasoning Traces, direkt aus tensor tokens herausgezogen – DAS ist beeindruckend, und ich würde auch nicht auf Twitter herumlaufen und es einer Menge Leuten protzen. Kümmere dich um was Anständiges, zieh dir die bearer tokens (Autorisierungstoken), und angele dann dezent!“
Zuschauer spotten zudem: „Ein abgefangenes JSON von 294,000 Zeichen, verpackt wie die Schriftrollen vom Toten Meer. Das war nichts weiter als ein mitmproxy-Lauf. Das kann jeder selbst machen und die Prompts aus OpenAI, Gemini und Claude extrahieren – dieses Influencer-Getue braucht wirklich niemand.“
Wie auch immer die Hackerkünste beschaffen sind – für uns gewöhnliche Entwickler und KI-Fans ist das absolut ein Geschenk vom Himmel!
Diese 300.000 Zeichen sind im Wesentlichen der „ultimative Führer zur Domestizierung großer Sprachmodelle“, den OpenAIs besten Ingenieure mit unzähligen Tagen und Nächten und Hunderten Millionen Dollar an Rechenleistung durch Trial and Error feinjustiert haben.
Sind Prompts tot? Nein – System-Engineering lebt ewig!
Wie fühlst du dich nach der Lektüre dieser 1902 Zeilen umfassenden „Geheimschrift“? Früher dachten wir, Prompt-Schreiben sei Mystik: Ein „Atme tief durch“ hier, ein „Wenn du versagst, wird dir der Lohn gekürzt“ dort – und schon würde das Modell schlauer. Doch die zugrunde liegende Logik von GPT-6 Sol Codex zeigt uns: Echte industrietaugliche KI-Anwendungen beruhen keineswegs auf ein paar schmeichelhaften Formulierungen, sondern auf einem äußerst strengen System-Engineering!
Es ist modular aufgebaut (Skills werden dynamisch geladen);
Es verfügt über Speicherverwaltung (Compaction-Handbuch);
Es besitzt Ausführungsstrategien (parallele Ausführung und Wiederholungsversuche);
Es ist mit strengen Sicherheitsprotokollen ausgestattet (vier Bestätigungsmodi).
Große Sprachmodelle entwickeln sich umfassend von einer „schlauen Antwortmaschine“ zu einem „autonomen Betriebssystem mit Übernahmebefugnissen“. Und die diesmal geleakten 300.000 Wörter sind der Quellcode zu dieser neuen Ära.
https://x.com/elder_plinius/status/2102515853430542668
Referenzen:
