Als wir GPT‑6 Astravorstellten, zeigten wir, wie weit unsere Modelle bei der Nutzung von Computern für professionelle Arbeit gekommen sind – von der Erstellung von Dokumenten bis zum Testen von Websites. Unser nächstes Ziel ist es, Agenten fähiger und effizienter darin zu machen, spezialisierte Software zu nutzen, um komplexe Geschäftsprobleme zu lösen. Wir untersuchen, wie man Modelle trainieren kann, die Geschäftsregeln eines Unternehmens verstehen, mehrstufige Workflows ausführen und überprüfen, dass ihre Arbeit die ursprünglichen Anforderungen erfüllt.
Um diese Forschung zu beschleunigen, arbeiten wir direkt mit einer kleinen Anzahl von Softwareunternehmen zusammen, die diese Workflows am besten kennen. Gemeinsam identifizieren wir anspruchsvolle, wertschöpfende Aufgaben und machen daraus Forschungsprobleme für das Training und die Evaluierung unserer Modelle, um unsere Modelle letztlich fähiger und nützlicher in realen Geschäftsanwendungen zu machen.
Unser erster Partner ist Ironclad, ein führendes Unternehmen im Bereich KI-Vertragsmanagement. In enger Zusammenarbeit mit Ironclads Team haben wir Aufgaben entwickelt, bei denen Agenten Vereinbarungen, Genehmigungen und wiederverwendbare Vertragsklauseln konfigurieren müssen, und Fortschritte bei diesen komplexen Workflows nachgewiesen. Ironclads Fachwissen war entscheidend dafür, zu definieren, woran Erfolg gemessen wird, und echte Kundenbedürfnisse direkt in die Entwicklung von Frontier-Modellen einzubringen. Wir sind dankbar für diese Partnerschaft und freuen uns darauf zu zeigen, was wir gemeinsam erreicht haben.
GPT‑6 Astra ist unser erstes Frontier-Modell, das mit Ironclad-Aufgaben trainiert wurde. In unserer Forschungsevaluierung lag sein Durchschnittswert 32% höher als der von GPT‑5.6 Sol, während die geschätzte Zeit pro Versuch 48% niedriger war.1
Vertrags-Workflows in Trainingsaufgaben umwandeln
Betrachten wir ein Team für Legal Operations, das einen Prozess für den Softwarekauf einrichtet. Die Finanzabteilung muss möglicherweise Einkäufe über einem bestimmten Betrag genehmigen, die Sicherheitsabteilung muss möglicherweise bestimmte Anfragen prüfen, und die Rechtsabteilung muss möglicherweise nicht standardmäßige Klauseln überprüfen. Die Person, die den Prozess einrichtet, muss diese kurze Liste in ein Antragsformular, Dokumentvorlagen, Genehmigungsregeln und eine Aufzeichnung der endgültigen Vereinbarung umsetzen.
Ein KI-Agent, der dieselbe Arbeit erledigt, muss diese Anforderungen im Blick behalten, während er sich durch die Software bewegt. Beispielsweise muss er die Genehmigung durch die Finanzabteilung oberhalb des Ausgabenschwellenwerts konfigurieren und prüfen, dass Anfragen oberhalb und unterhalb desselben den richtigen Weg nehmen. Es genügt nicht, einzelne Schritte richtig auszuführen: Der fertige Prozess muss in den Situationen funktionieren, für die er konzipiert wurde.
Ironclad-Mitarbeiter und Personen, die Ironclad bei OpenAI nutzen, halfen unseren Forschern, 11 Aufgaben aus den Bereichen Recht, Vertrieb und Beschaffung zu identifizieren. Dazu gehörten Aufgaben wie die Einrichtung von Geheimhaltungsvereinbarungen, die Erstellung von Genehmigungsprozessen für die Beschaffung und die Aktualisierung einer wiederverwendbaren Vertragsklausel, sodass sie die vom Anfragenden ausgewählte Rechtsprechung widerspiegelt. Wir schätzen, dass diese Arbeit eine erfahrene Person durchschnittlich etwa 30 bis 40 Minuten pro Aufgabe kosten würde.
Wir bewerteten jede Aufgabe anhand von 8 bis 50 Kriterien, abhängig von ihrer Komplexität. So sahen wir, welche Teile ein Modell richtig gelöst hat und wo es Schwächen hatte. Ironclad stellte außerdem gehostete Softwareumgebungen ihres Produkts bereit, in denen die Modelle diese Aufgaben üben konnten. Unsere Forscher entwickelten synthetische Trainingsaufgaben2 rund um repräsentative Workflows und nutzten bestärkendes Lernen, um den Modellen durch Übung und Feedback die Verbesserung zu ermöglichen. Diese Kombination – Aufgaben, die mit Personen ausgewählt wurden, die die Arbeit kennen, detaillierte Kriterien und ein Ort zum Üben für die Modelle – stellt sicher, dass wir uns bei realen Aufgaben verbessern, die für unsere Kunden am wichtigsten sind.
Wie Astra abgeschnitten hat
Wir verglichen Astra und GPT‑5.6 Sol mit Max reasoning für Astra und High reasoning für Sol – den Einstellungen, bei denen jedes Modell die höchsten Werte erzielte. Über die 11 Forschungsaufgaben hinweg lag Astras Durchschnittswert bei 55,0%, gegenüber 41,6% bei GPT‑5.6 Sol, während die geschätzte durchschnittliche Zeit pro Versuch von 37,0 Minuten bei Sol auf 19,2 Minuten bei Astra sank.3 Ein internes Modell, das bei der Entwicklung von Astra verwendet wurde, erreichte auf diesen Aufgaben sogar 63,7%, und wir beabsichtigen, diese weiteren Fortschritte in zukünftige Modelle einzubringen.
Metrik | GPT‑5.6 Sol | GPT‑6 Astra |
Durchschnittlicher Rubrik-Score | 41.6% | 55.0% |
Geschätzte durchschnittliche Zeit pro Versuch | 37,0 Minuten | 19,2 Minuten |
Astra erfüllte mehr der Aufgabenanforderungen mit weniger simulierter Zeit pro Versuch. Die beiden folgenden Clips zeigen, wie die Modelle dieselbe Forschungsaufgabe bewältigten. Astra (erster Clip) erfüllte etwa 94% der Aufgabenkriterien in geschätzten 20 Minuten; GPT‑5.6 Sol (zweiter Clip) erfüllte etwa 85% in geschätzten 32 Minuten.
GPT‑6 Astra erfüllte etwa 94% der Aufgabenkriterien in geschätzten 20 Minuten.
GPT‑5.6 Sol erfüllte etwa 85% der Aufgabenkriterien in geschätzten 32 Minuten.
Was diese Zusammenarbeit für Ironclad bedeutet
Ironclads Rolle bei dieser Arbeit spiegelt eine Herausforderung wider, die seine Kunden gut kennen: Ein Vertragsprozess muss Ausnahmen bewältigen und gleichzeitig die Regeln wahren, von denen ein Unternehmen abhängt. Wenn ein Agent mitten in einer Aufgabe eine dieser Regeln aus den Augen verliert, schränkt das ein, was ein Softwareunternehmen ihm sicher anvertrauen kann. Dies unterstreicht, warum menschliche Aufsicht weiterhin wichtig ist, während Agenten bei komplexen Vertragsaufgaben besser werden, und warum eine vollständige Vertragsplattform unverzichtbar bleibt. Die Zusammenarbeit mit unseren Forschern gibt Ironclad die Möglichkeit, diese Probleme in die Entwicklung des zugrunde liegenden Modells einzubringen, wo wir sie gemeinsam untersuchen können.
Da die Modelle leistungsfähiger werden, hat Ironclad die Möglichkeit, sie in mehr eigenen Produkten einzusetzen. Für Rechts- und Geschäftsteams könnte das bedeuten, dass KI mehr Aufwand bei komplexen Vertragsprozessen übernimmt und dabei die Kontrollmechanismen erhalten bleiben, auf die sich diese Teams verlassen.
„Damit KI in komplexen Bereichen der Vertragsarbeit wirklich nützlich ist, muss sie mehr tun als einzelne Aktionen auszuführen. Agenten müssen den gesamten Vertragslebenszyklus verstehen, einschließlich der Frage, wie Geschäftsworkflows miteinander verbunden sind, während die Kontrollmechanismen erhalten bleiben, auf die sich Teams verlassen. Unsere Zusammenarbeit mit OpenAI bringt diese realen Herausforderungen in den Forschungsprozess ein und hilft, die Technologie voranzubringen.“
Arbeiten Sie mit uns daran, KI für komplexe professionelle Arbeit voranzubringen
Wir laden eine kleine Anzahl von Softwareunternehmen ein, direkt mit unseren Forschungs- und Engineering-Teams an wichtigen beruflichen Aufgaben zu arbeiten, die heutige Agenten noch nicht zuverlässig erledigen können. Wenn Ihr Team eine solche Aufgabe hat, möchten wir ein konkretes Beispiel sehen: was Sie vom Agenten verlangen, Belege dafür, wo er scheitert, und wie Sie ein erfolgreiches Ergebnis beurteilen würden. Partner sollten außerdem Personen einbringen können, die die Arbeit eingehend kennen, eine sichere Umgebung zum Testen sowie Daten, die sich sicher für die Forschung nutzen lassen. Dies gibt uns einen Ausgangspunkt, um das Versagen zu untersuchen und zu messen, ob sich das Modell verbessert.
Wenn das auf Ihr Team zutrifft, bewerben Sie sich, um eine Forschungszusammenarbeit zu erkunden.
