OpenAI SitemapMis à jour le

Faire progresser l'utilisation de l'ordinateur avec Ironclad

Découvrez comment OpenAI et Ironclad entraînent et évaluent des agents d'IA sur des flux de travail contractuels complexes afin de faire progresser l'utilisation de l'ordinateur pour le travail professionnel.

Source de l’image · OpenAI Sitemap

Lorsque nous avons présenté GPT‑6 Astra, nous avons démontré jusqu'où nos modèles sont arrivés dans l'utilisation des ordinateurs pour le travail professionnel, de la préparation de documents aux tests de sites web. Notre prochain objectif est de rendre les agents plus capables et plus efficaces dans l'utilisation de logiciels spécialisés pour résoudre des problèmes commerciaux complexes. Nous étudions comment entraîner les modèles à comprendre les règles commerciales d'une entreprise, à exécuter des flux de travail en plusieurs étapes et à vérifier que leur travail répond aux exigences initiales.

Pour accélérer cette recherche, nous collaborons directement avec un petit nombre d'éditeurs de logiciels qui comprennent le mieux ces flux de travail. Ensemble, nous identifions des tâches difficiles à forte valeur et les transformons en problèmes de recherche pour entraîner et évaluer nos modèles, rendant ainsi nos modèles plus capables et plus utiles dans des applications commerciales du monde réel.

Notre premier partenaire est Ironclad, un leader de la contractualisation par IA. En travaillant en étroite collaboration avec l'équipe d'Ironclad, nous avons développé des tâches exigeant que les agents configurent des accords, des approbations et des clauses juridiques réutilisables, et nous avons démontré des progrès sur ces flux de travail complexes. L'expertise d'Ironclad a été déterminante pour définir à quoi ressemble le succès et intégrer les besoins réels des clients directement dans le développement de modèles de pointe. Nous sommes reconnaissants de leur partenariat et ravis de partager ce que nous avons accompli ensemble.

GPT‑6 Astra est notre premier modèle de pointe entraîné sur les tâches d'Ironclad. Lors de notre évaluation de recherche, son score moyen était supérieur de 32 % à celui de GPT‑5.6 Sol, tandis que le temps estimé par tentative était inférieur de 48 %.1

Transformer les flux de travail contractuels en tâches d'entraînement

Prenons l'exemple d'une équipe d'opérations juridiques mettant en place un processus d'achat de logiciels. Les finances peuvent devoir approuver les achats supérieurs à un certain montant, la sécurité peut devoir examiner certaines demandes, et le service juridique peut devoir examiner les clauses non standard. La personne qui met en place le processus doit transformer cette courte liste en formulaire d'intake, en modèles de documents, en règles d'approbation et en un enregistrement de l'accord final.

Un agent d'IA effectuant le même travail doit garder ces exigences en vue tout au long de sa navigation dans le logiciel. Par exemple, il doit configurer l'approbation par les finances au-dessus du seuil de dépenses et vérifier que les demandes supérieures et inférieures à ce seuil suivent les bons chemins. Réussir chaque étape individuellement ne suffit pas : le processus finalisé doit fonctionner dans l'ensemble des situations pour lesquelles il a été conçu.

Des employés d'Ironclad et des personnes utilisant Ironclad chez OpenAI ont aidé nos chercheurs à identifier 11 tâches couvrant les domaines juridique, commercial et des achats. Il s'agissait notamment de tâches telles que la mise en place d'accords de non-divulgation, la création de processus d'approbation des achats et la mise à jour d'une clause juridique réutilisable afin qu'elle reflète la juridiction sélectionnée par le demandeur. Nous estimons que ce travail prendrait à un utilisateur expérimenté environ 30 à 40 minutes par tâche, en moyenne.

Nous avons évalué chaque tâche selon 8 à 50 critères, selon sa complexité. Cela nous a permis de voir quelles parties du travail le modèle a réussies et où il a échoué. Ironclad a également fourni des environnements logiciels hébergés de leur produit où les modèles pouvaient s'exercer à ces tâches. Nos chercheurs ont développé des tâches d'entraînement synthétiques2 autour de flux de travail représentatifs et ont utilisé l'apprentissage par renforcement pour aider les modèles à s'améliorer par la pratique et le retour d'information. Cette combinaison—des tâches sélectionnées avec des personnes qui connaissent le travail, des critères détaillés et un lieu d'exercice pour les modèles—garantit que nous progressons sur les tâches du monde réel les plus importantes pour nos clients.

Performances d'Astra

Nous avons comparé Astra et GPT‑5.6 Sol en utilisant le raisonnement Max pour Astra et le raisonnement High pour Sol, les paramètres pour lesquels chaque modèle a obtenu le score le plus élevé. Sur les 11 tâches de recherche, le score moyen d'Astra était de 55,0 %, contre 41,6 % pour GPT‑5.6 Sol, tandis que le temps moyen estimé par tentative est passé de 37,0 minutes pour Sol à 19,2 minutes pour Astra.3 Un modèle interne utilisé dans le développement d'Astra a obtenu un score encore plus élevé de 63,7 % sur ces tâches, et nous visons à intégrer ces gains supplémentaires dans les futurs modèles.

Métrique

GPT‑5.6 Sol
Raisonnement High

GPT‑6 Astra
Raisonnement Max

Score moyen de grille d'évaluation

41.6%

55.0%

Temps moyen estimé par tentative

37,0 minutes

19,2 minutes

Astra a satisfait à davantage d'exigences des tâches avec moins de temps simulé par tentative. Les deux clips ci-dessous montrent comment les modèles ont géré la même tâche de recherche. Astra (premier) a satisfait à environ 94 % des critères de la tâche en un temps estimé à 20 minutes ; GPT‑5.6 Sol (second) a satisfait à environ 85 % des critères en un temps estimé à 32 minutes.

GPT‑6 Astra a satisfait à environ 94 % des critères de la tâche en un temps estimé à 20 minutes.

GPT‑5.6 Sol a satisfait à environ 85 % des critères de la tâche en un temps estimé à 32 minutes.

Ce que cette collaboration signifie pour Ironclad

Le rôle d’Ironclad dans ce travail reflète un défi que ses clients connaissent bien : un processus contractuel doit gérer les exceptions tout en préservant les règles dont dépend une entreprise. Si un agent perd de vue l’une de ces règles à mi-chemin d’une tâche, cela limite ce qu’un éditeur de logiciels peut lui confier en toute confiance. Cela souligne pourquoi la supervision humaine reste importante à mesure que les agents s’améliorent dans les tâches contractuelles complexes, et pourquoi une plateforme contractuelle complète reste essentielle. Travailler avec nos chercheurs permet à Ironclad d’intégrer ces problèmes dans le développement du modèle sous-jacent, où nous pouvons les étudier ensemble.

À mesure que les modèles deviennent plus performants, Ironclad a l'opportunité de les utiliser dans davantage de ses propres produits. Pour les équipes juridiques et commerciales, cela pourrait signifier que l'IA prenne en charge une plus grande part des efforts impliqués dans les contrats complexes tout en préservant les contrôles dont ces équipes dépendent.

« Pour que l'IA soit véritablement utile dans les domaines complexes de la contractualisation, elle doit faire plus qu'accomplir des actions individuelles. Les agents doivent comprendre l'ensemble du cycle de vie contractuel, y compris la manière dont les flux de travail commerciaux s'articulent, tout en préservant les contrôles dont les équipes dépendent. Notre collaboration avec OpenAI introduit ces défis du monde réel dans le processus de recherche et contribue à faire progresser la technologie. »
—Sunita Verma, Directrice de la technologie, Ironclad

Travaillez avec nous pour faire avancer l'IA dans les tâches professionnelles complexes

Nous invitons un petit nombre d'entreprises de logiciels à travailler directement avec nos équipes de recherche et d'ingénierie sur des tâches professionnelles importantes que les agents actuels ne peuvent encore pas accomplir de manière fiable. Si votre équipe en a une, nous aimerions voir un exemple concret : ce que vous demandez à l'agent de faire, des preuves des points où il échoue, et comment vous jugeriez un résultat réussi. Les partenaires doivent également être en mesure d'amener des personnes qui connaissent profondément le travail, un environnement sécurisé pour les tests, et des données pouvant être utilisées en toute sécurité pour la recherche. Cela nous donne un point de départ pour enquêter sur l'échec et mesurer si le modèle s'améliore.

Si cela décrit votre équipe, postulez pour explorer une collaboration de recherche.

Source originale

OpenAI Sitemap

À propos du contenu

La publication originale et les droits appartiennent à la source.

Traduction automatique · Consultez l’original