Als quantitativer Handelstrader erstellt Jump Trading prädiktive Modelle, die Marktdaten, Nachrichten und Ereignisse sowie eine Reihe alternativer Datenquellen nutzen, um bestmögliche Vorhersagen über Asset-Preise zu treffen. Da die Märkte komplex, verrauscht und sich stetig verändernd sind, lässt sich selten genau vorhersagen, was geschehen wird. Doch laut Lucas Baker, Head of LLM R&D bei Jump, ist es ausreichend, auch nur geringfügig besser als ein Münzwurf vorherzusagen, um in großem Maßstab eine erfolgreiche Strategie zu erzielen.
Baker leitet die agentische Forschung und Entwicklung und konzentriert sich auf den Aufbau der Agenten, Harnesses und der Infrastruktur, die es quantitativen Forschern ermöglichen, ihre Ideen in größerer Breite und Tiefe zu erkunden. Die Ergänzung von GPT‑6 Astra hat den Umfang und die Komplexität der Workflows, die an Agenten übergeben werden können, dramatisch erweitert – von täglichem Coding über fortgeschrittene quantitative Studien bis zur Validierung neuer Hypothesen.
„Mit der GPT-6-Serie, insbesondere GPT-6 Astra, hat OpenAI eine neue Stufe der Autonomie für langfristige Aufgaben erreicht, die flexible Agentenkoordination und extreme Ausdauer bei komplexen Workflows erfordern. Wo wir früher häufig menschliche Anleitung und Eingriffe benötigten, können wir uns nun vollständig darauf konzentrieren, eine sichere und gut überwachte Umgebung mit klaren Zielen zu definieren und die Agenten ihren eigenen Weg finden zu lassen.“—Lucas Baker, Head of LLM R&D, Jump Trading
Von kurzen Code-Schnipseln zu umfassenden Analysen
Im vergangenen Jahr hat sich KI von einem hilfreichen Werkzeug, das nützlich für das Schreiben von einmaligen Code-Schnipseln oder das Finden kleiner Bugs war, zu einem leistungsfähigen, vielseitigen System entwickelt, das eigenständig komplette Codebasen und Dienste entwickeln kann. Baker und sein Team stellen nun fest, dass KI am besten funktioniert, wenn sie eher wie ein Kollege behandelt wird. Forscher können ein Kernproblem, eine Arbeitsumgebung und eine Methode zur Bewertung der Qualität und Bedeutung der Ergebnisse definieren und dann einen oder mehrere Agenten in Echtzeit steuern, wohin die Analyse fokussiert oder welcher Auftrag als Nächstes ausgeführt werden soll.
Baker sagt, dass Agenten mit GPT‑6 Astra nun nicht nur in der Lage sind, sinnvolle und praktische Verbesserungen zu finden, sondern diese Erfolge auch in einem Prozess rekursiver Verbesserung zusammenzuführen und zu stapeln. Im Verlauf einer einzigen langlaufenden Aufgabe kann das System seine Erkenntnisse analysieren, sie anhand der in einem ursprünglichen Vorschlag vereinbarten Kriterien bewerten und seine Bemühungen aktiv umlenken, statt dass eine Person jede Runde der Änderungen analysieren muss. Wie er es ausdrückt: „Man kann etwas definieren, das tagelang laufen muss – es muss aus vielen Datenquellen ziehen, es muss diese subtilen Einschätzungen darüber treffen, was wichtig ist und was nicht, und es muss alles miteinander in Beziehung setzen – um eine umfassende Analyse zu erstellen, die jetzt tatsächlich funktioniert“, sagt er.
Menschliches Urteilsvermögen im Mittelpunkt halten
Jump Trading ist in jedem Zeithorizont und jeder Anlageklasse tätig. Jeder Schritt des Prozesses ist komplex, und in einer stark regulierten Branche wie der Finanzwelt können Fehler sowohl finanzielle als auch Compliance-Konsequenzen haben. Baker sagt, es sei entscheidend, sich der Risiken bewusst zu sein, die mit der Übertragung von Arbeit an KI entstehen, aber auch, dass agentische Intelligenz ebenfalls zur Verbesserung von Qualität, Sicherheit und Überwachung eingesetzt werden kann, nicht nur zum Hinzufügen von Funktionen. Ein starkes Systemdesign und klare Grenzen, klare Beschränkungen, eine Infrastruktur, die Steuerbarkeit und Beobachtbarkeit fördert, sowie eine menschliche Prüfung der Änderungen helfen dem Team von Jump Trading sicherzustellen, dass KI-gestützte Workflows bereit sind, in einer regulierten Umgebung zu skalieren.
„Wenn man eine sichere Umgebung hat, in der der Agent oder das System frei ist, jede Ausgabe zu erzeugen, die es benötigt, es aber am Ende auch einen menschlichen Prüfprozess gibt, bei dem die kritische Validierung mit menschlicher Freigabe erfolgt, dann gibt uns das Vertrauen“, sagt er. Wenn ein Agent beispielsweise ein Handelssignal erzeugt, wird es auf die gleiche Weise geprüft und bewertet wie jede andere Ausgabe auch: als Signal, das in der Regel informativ, aber potenziell falsch ist, und in eine streng geprüfte und kontrollierte Ausführungsumgebung integriert wird, die jedes andere Signal berücksichtigt.
Was kommt als Nächstes
Baker sagt, er glaube, dass wir uns auf eine Welt zubewegen, in der „Autoresearch“, also die rekursive Verbesserung messbarer Systeme durch Agenten-Forscher, so allgegenwärtig sein wird, dass sie schlicht als Teil des gewöhnlichen Workflows eines quantitativen Forschers gilt. Auch heute erfordert die am längsten laufende Arbeit von GPT‑6 Astra noch regelmäßige Abstimmungen mit der Person, die die Aufgabe definiert – nicht nur, welche Daten abgerufen werden sollen, wie lange gelaufen wird und was als wichtig gilt, sondern auch, ob die Zwischenergebnisse sinnvoll sind. Fortgeschrittene Autoresearch würde dennoch mit einem vom Menschen definierten System beginnen, einschließlich Eingaben, Umgebungsdefinition, Evaluationsmetriken, Trade-offs und allgemeinen Prioritäten, würde aber den Rest des Prozesses einer lose strukturierten „Flotte“ von Agenten überlassen, die ihrerseits von anderen Agenten koordiniert werden. Innerhalb einer gut strukturierten Forschungspipeline wären diese Agenten in der Lage, intelligente Entscheidungen darüber zu treffen, wie sie Ideen erkunden, Rechenzeit zuweisen und vielversprechende Erkenntnisse integrieren – alles beginnend mit kaum mehr als einer offenen Frage.
„Wie sieht es aus, wenn man all dies von Anfang bis Ende verbinden, eine allgemeine Frage stellen kann, auf die selbst man die Antwort nicht kennt, und ein nützliches Ergebnis zurückerhält?“, fragt er. „Wenn man ein Millennium-Problem lösen kann, kann man wahrscheinlich auch einige ziemlich interessante Fakten über Quant-Finance herausfinden.“
Jedes Jahr brachte nicht nur stetige Fortschritte bei Benchmark-Messungen, sondern auch große Sprünge in der Art von Arbeiten, die Modelle ausführen konnten. Oft waren diese Entwicklungen selbst Monate im Voraus schwer vorherzusagen: Während es 2024 noch als beeindruckend galt, wenn frühe Agenten eine einzelne Datei fehlerfrei schreiben konnten, wurde es 2025 möglich, ganze Codebasen von Grund auf zu erstellen, und 2026 Fortschritte bei offenen Forschungsfragen zu erzielen, wobei viele Agenten dynamisch Seite an Seite zusammenarbeiteten. „Was wird uns im nächsten Jahr erwarten?“, sagt er. „Das ist ein ziemlich unglaublicher Ausblick.“
