OpenAIAktualisiert

Fortschritte bei der Computernutzung mit Ironclad

Erfahren Sie, wie OpenAI und Ironclad KI-Agenten an komplexen Vertrags-Workflows trainieren und evaluieren, um die Computernutzung für professionelle Arbeit voranzubringen.

Bildquelle · OpenAI

Als wir GPT‑6 Astravorstellten, zeigten wir, wie weit unsere Modelle bei der Nutzung von Computern für professionelle Arbeit gekommen sind – vom Erstellen von Dokumenten bis zum Testen von Websites. Unser nächstes Ziel ist es, Agenten fähiger und effizienter bei der Nutzung spezialisierter Software zur Lösung komplexer Geschäftsprobleme zu machen. Wir erforschen, wie man Modelle darauf trainieren kann, die Geschäftsregeln eines Unternehmens zu verstehen, mehrstufige Workflows auszuführen und zu überprüfen, ob ihre Arbeit die ursprünglichen Anforderungen erfüllt.

Um diese Forschung zu beschleunigen, arbeiten wir direkt mit einer kleinen Anzahl von Softwareunternehmen zusammen, die diese Workflows am besten verstehen. Gemeinsam identifizieren wir anspruchsvolle, wertschöpfende Aufgaben und machen daraus Forschungsprobleme zum Trainieren und Evaluieren unserer Modelle, um unsere Modelle letztlich fähiger und nützlicher in realen Geschäftsanwendungen zu machen.

Unser erster Partner ist Ironclad, ein führendes Unternehmen im Bereich KI-Vertragswesen. In enger Zusammenarbeit mit Ironclads Team haben wir Aufgaben entwickelt, die von Agenten verlangen, Vereinbarungen, Genehmigungen und wiederverwendbare rechtliche Klauseln zu konfigurieren, und Fortschritte bei diesen komplexen Workflows nachgewiesen. Ironclads Fachwissen war entscheidend dafür, zu definieren, worin Erfolg besteht, und echte Kundenbedürfnisse direkt in die Entwicklung von Frontier-Modellen einfließen zu lassen. Wir sind dankbar für diese Partnerschaft und freuen uns darauf zu zeigen, was wir gemeinsam erreicht haben.

GPT‑6 Astra ist unser erstes Frontier-Modell, das mit Ironclad-Aufgaben trainiert wurde. In unserer Forschungsevaluation lag sein Durchschnittswert 32% höher als der von GPT‑5.6 Sol, während die geschätzte Zeit pro Versuch 48% niedriger war.1

Vertrags-Workflows in Trainingsaufgaben umwandeln

Betrachten wir ein Team für rechtliche Abläufe, das einen Prozess für den Softwarekauf einrichtet. Die Finanzabteilung muss möglicherweise Einkäufe über einem bestimmten Betrag genehmigen, die Sicherheitsabteilung muss möglicherweise bestimmte Anfragen prüfen, und die Rechtsabteilung muss möglicherweise nicht standardmäßige Bedingungen überprüfen. Die Person, die den Prozess einrichtet, muss diese kurze Liste in ein Eingabeformular, Dokumentvorlagen, Genehmigungsregeln und einen Datensatz der endgültigen Vereinbarung umsetzen.

Ein KI-Agent, der dieselbe Arbeit erledigt, muss diese Anforderungen im Blick behalten, während er sich durch die Software bewegt. Er muss beispielsweise die Genehmigung durch die Finanzabteilung oberhalb des Ausgabenschwellenwerts konfigurieren und überprüfen, dass Anfragen über und unter diesem Wert den richtigen Weg nehmen. Es genügt nicht, einzelne Schritte richtig zu machen: Der fertige Prozess muss über alle Situationen hinweg funktionieren, für die er entwickelt wurde.

Ironclad-Mitarbeitende und Personen, die Ironclad bei OpenAI nutzen, halfen unseren Forschern, 11 Aufgaben aus dem Rechts-, Handels- und Beschaffungsbereich zu identifizieren. Dazu gehörten Aufgaben wie das Einrichten von Geheimhaltungsvereinbarungen, das Erstellen von Genehmigungsprozessen für die Beschaffung und das Aktualisieren einer wiederverwendbaren Vertragsklausel, sodass sie die vom Antragsteller ausgewählte Rechtsordnung widerspiegelt. Wir schätzen, dass diese Arbeit für einen erfahrenen Nutzer im Durchschnitt etwa 30 bis 40 Minuten pro Aufgabe dauern würde.

Wir bewerteten jede Aufgabe anhand von 8 bis 50 Kriterien, abhängig von ihrer Komplexität. So konnten wir sehen, welche Teile ein Modell richtig gelöst hat und wo es Defizite hatte. Ironclad stellte außerdem gehostete Softwareumgebungen ihres Produkts bereit, in denen die Modelle diese Aufgaben üben konnten. Unsere Forscher entwickelten synthetische Trainingsaufgaben2 zu repräsentativen Workflows und nutzten bestärkendes Lernen, um den Modellen zu helfen, sich durch Übung und Feedback zu verbessern. Diese Kombination – Aufgaben, die mit Personen ausgewählt wurden, die die Arbeit kennen, detaillierte Kriterien und ein Ort zum Üben für Modelle – stellt sicher, dass wir uns bei realen Aufgaben verbessern, die für unsere Kunden am wichtigsten sind.

Wie Astra abschnitt

Wir verglichen Astra und GPT‑5.6 Sol mit Max Reasoning für Astra und High Reasoning für Sol, den Einstellungen, bei denen jedes Modell die höchsten Werte erzielte. Über die 11 Forschungsaufgaben hinweg lag Astras Durchschnittswert bei 55,0%, verglichen mit 41,6% für GPT‑5.6 Sol, während die geschätzte durchschnittliche Zeit pro Versuch von 37,0 Minuten für Sol auf 19,2 Minuten für Astra sank.3 Ein internes Modell, das bei der Entwicklung von Astra verwendet wurde, erreichte auf diesen Aufgaben sogar 63,7%, und wir beabsichtigen, diese weiteren Fortschritte in zukünftige Modelle zu bringen.

Metrik

GPT‑5.6 Sol
High Reasoning

GPT‑6 Astra
Max Reasoning

Durchschnittlicher Rubrikwert

41.6%

55.0%

Geschätzte durchschnittliche Zeit pro Versuch

37,0 Minuten

19,2 Minuten

Astra erfüllte mehr der Aufgabenanforderungen mit weniger simulierter Zeit pro Versuch. Die beiden folgenden Clips zeigen, wie die Modelle dieselbe Forschungsaufgabe bewältigten. Astra (erster Clip) erfüllte etwa 94% der Aufgabenkriterien in geschätzten 20 Minuten; GPT‑5.6 Sol (zweiter Clip) erfüllte etwa 85% in geschätzten 32 Minuten.

GPT‑6 Astra erfüllte etwa 94% der Aufgabenkriterien in geschätzten 20 Minuten.

GPT‑5.6 Sol erfüllte etwa 85% der Aufgabenkriterien in geschätzten 32 Minuten.

Was diese Zusammenarbeit für Ironclad bedeutet

Die Rolle von Ironclad bei dieser Arbeit spiegelt eine Herausforderung wider, die seine Kunden nur zu gut kennen: Ein Vertragsprozess muss Ausnahmen bewältigen und gleichzeitig die Regeln bewahren, von denen ein Unternehmen abhängt. Wenn ein Agent mitten in einer Aufgabe eine dieser Regeln aus den Augen verliert, schränkt das ein, was ein Softwareunternehmen ihm zuversichtlich anvertrauen kann. Dies unterstreicht, warum menschliche Aufsicht weiterhin wichtig bleibt, wenn Agenten bei komplexen Vertragsaufgaben besser werden, und warum eine vollständige Vertragsplattform unverzichtbar bleibt. Die Zusammenarbeit mit unseren Forschern gibt Ironclad die Möglichkeit, diese Probleme in die Entwicklung des zugrunde liegenden Modells einzubringen, wo wir sie gemeinsam untersuchen können.

Da die Modelle leistungsfähiger werden, hat Ironclad die Möglichkeit, sie in mehr eigenen Produkten einzusetzen. Für Rechts- und Geschäftsteams könnte das bedeuten, dass KI einen größeren Teil des Aufwands übernimmt, der mit komplexen Vertragsprozessen verbunden ist, während die Kontrollen erhalten bleiben, auf die sich diese Teams verlassen.

„Damit KI in komplexen Bereichen des Vertragswesens wirklich nützlich ist, muss sie mehr tun als einzelne Aktionen auszuführen. Agenten müssen den gesamten Vertragslebenszyklus verstehen, einschließlich der Art und Weise, wie Geschäftsworkflows miteinander verbunden sind, während die Kontrollen erhalten bleiben, auf die sich Teams verlassen. Unsere Zusammenarbeit mit OpenAI bringt diese realen Herausforderungen in den Forschungsprozess und hilft, die Technologie voranzubringen.“
—Sunita Verma, Chief Technology Officer, Ironclad

Arbeiten Sie mit uns daran, KI für komplexe professionelle Arbeit voranzubringen

Wir laden eine kleine Anzahl von Softwareunternehmen ein, direkt mit unseren Forschungs- und Engineering-Teams an wichtigen beruflichen Aufgaben zu arbeiten, die heutige Agenten noch nicht zuverlässig erledigen können. Wenn Ihr Team eine solche Aufgabe hat, möchten wir ein konkretes Beispiel sehen: was Sie den Agenten tun lassen wollen, Belege dafür, wo er scheitert, und wie Sie ein erfolgreiches Ergebnis beurteilen würden. Partner sollten außerdem Personen mit tiefem Fachwissen zu dieser Arbeit mitbringen können, eine sichere Umgebung für Tests sowie Daten, die sicher für die Forschung genutzt werden können. Dies gibt uns einen Ausgangspunkt, um den Fehler zu untersuchen und zu messen, ob sich das Modell verbessert.

Wenn dies auf Ihr Team zutrifft, bewerben Sie sich, um eine Forschungszusammenarbeit zu erkunden.

Originalquelle

OpenAI

Hinweise zum Inhalt

Originalveröffentlichung und Rechte liegen bei der Quelle.

Maschinelle Übersetzung · Original beachten