Lorsque nous avons présenté GPT‑6 Astra, nous avons montré à quel point nos modèles ont progressé dans l'utilisation des ordinateurs pour le travail professionnel, de la préparation de documents aux tests de sites web. Notre prochain objectif est de rendre les agents plus capables et plus efficaces dans l'utilisation de logiciels spécialisés pour résoudre des problèmes commerciaux complexes. Nous explorons comment entraîner les modèles à comprendre les règles métier d'une entreprise, à exécuter des flux de travail en plusieurs étapes et à vérifier que leur travail répond aux exigences initiales.
Pour accélérer cette recherche, nous établissons un partenariat direct avec un petit nombre d'éditeurs de logiciels qui comprennent le mieux ces flux de travail. Ensemble, nous identifions des tâches difficiles à forte valeur et les transformons en problèmes de recherche pour entraîner et évaluer nos modèles, rendant ainsi nos modèles plus capables et plus utiles dans des applications commerciales du monde réel.
Notre premier partenaire est Ironclad, un leader de la contractualisation par IA. En collaboration étroite avec l'équipe d'Ironclad, nous avons développé des tâches exigeant que les agents configurent des accords, des approbations et des clauses juridiques réutilisables, et nous avons démontré des progrès sur ces flux de travail complexes. L'expertise d'Ironclad a été déterminante pour définir à quoi ressemble le succès et intégrer les besoins réels des clients directement dans le développement de modèles de pointe. Nous sommes reconnaissants de leur partenariat et ravis de partager ce que nous avons accompli ensemble.
GPT‑6 Astra est notre premier modèle de pointe entraîné sur des tâches Ironclad. Lors de notre évaluation de recherche, son score moyen était supérieur de 32 % à celui de GPT‑5.6 Sol, tandis que le temps estimé par tentative était inférieur de 48 %.1
Transformer les flux de travail contractuels en tâches d'entraînement
Prenons l'exemple d'une équipe d'opérations juridiques mettant en place un processus d'achat de logiciels. Le service financier peut devoir approuver les achats au-delà d'un certain montant, le service de sécurité peut devoir examiner certaines demandes, et le service juridique peut devoir réviser des clauses non standards. La personne qui met en place le processus doit transformer cette courte liste en formulaire de saisie, modèles de documents, règles d'approbation et enregistrement de l'accord final.
Un agent d'IA effectuant le même travail doit garder ces exigences en vue tout au long de sa navigation dans le logiciel. Par exemple, il doit configurer l'approbation financière au-delà du seuil de dépenses et vérifier que les demandes situées au-dessus et en dessous de ce seuil suivent les bons parcours. Réussir les étapes individuelles ne suffit pas : le processus achevé doit fonctionner dans l'ensemble des situations qu'il était conçu pour gérer.
Des employés d'Ironclad et des personnes utilisant Ironclad chez OpenAI ont aidé nos chercheurs à identifier 11 tâches couvrant le travail juridique, commercial et les achats. Il s'agissait notamment de tâches comme la mise en place d'accords de confidentialité, la création de processus d'approbation des achats et la mise à jour d'une clause juridique réutilisable afin qu'elle reflète la juridiction sélectionnée par le demandeur. Nous estimons que ce travail prendrait à un utilisateur expérimenté environ 30 à 40 minutes par tâche, en moyenne.
Nous avons évalué chaque tâche selon 8 à 50 critères, selon sa complexité. Cela nous a permis de voir quelles parties un modèle réussissait et où il échouait. Ironclad a également fourni des environnements logiciels hébergés de son produit où les modèles pouvaient s'exercer à ces tâches. Nos chercheurs ont développé des tâches d'entraînement synthétiques2 autour de flux de travail représentatifs et ont utilisé l'apprentissage par renforcement pour aider les modèles à s'améliorer grâce à la pratique et au retour d'information. Cette combinaison — des tâches sélectionnées avec des personnes qui connaissent le travail, des critères détaillés et un lieu de pratique pour les modèles — garantit que nous progressons sur les tâches du monde réel les plus importantes pour nos clients.
Performance d'Astra
Nous avons comparé Astra et GPT‑5.6 Sol en utilisant le raisonnement Max pour Astra et le raisonnement High pour Sol, les paramètres où chaque modèle obtenait son meilleur score. Sur les 11 tâches de recherche, le score moyen d'Astra était de 55.0 %, contre 41.6 % pour GPT‑5.6 Sol, tandis que le temps moyen estimé par tentative est passé de 37.0 minutes pour Sol à 19.2 minutes pour Astra.3 Un modèle interne utilisé dans le développement d'Astra a obtenu un score encore plus élevé de 63.7 % sur ces tâches, et nous visons à intégrer ces gains supplémentaires dans nos futurs modèles.
Métrique | GPT‑5.6 Sol | GPT‑6 Astra |
Score moyen de grille d'évaluation | 41.6% | 55.0% |
Temps moyen estimé par tentative | 37.0 minutes | 19.2 minutes |
Astra a satisfait à davantage d'exigences des tâches avec moins de temps simulé par tentative. Les deux extraits vidéo ci-dessous montrent comment les modèles ont traité la même tâche de recherche. Astra (premier) a satisfait à environ 94 % des critères de la tâche en 20 minutes estimées ; GPT‑5.6 Sol (second) en a satisfait environ 85 % en 32 minutes estimées.
GPT‑6 Astra a satisfait à environ 94 % des critères de la tâche en 20 minutes estimées.
GPT‑5.6 Sol a satisfait à environ 85 % des critères de la tâche en 32 minutes estimées.
Ce que cette collaboration signifie pour Ironclad
Le rôle d'Ironclad dans ce travail reflète un défi que ses clients connaissent bien : un processus contractuel doit gérer les exceptions tout en préservant les règles dont dépend une entreprise. Si un agent perd de vue l'une de ces règles à mi-chemin d'une tâche, cela limite ce qu'un éditeur de logiciel peut lui confier en toute confiance. Cela souligne pourquoi la supervision humaine reste importante à mesure que les agents s'améliorent dans les tâches contractuelles complexes, et pourquoi une plateforme contractuelle complète reste essentielle. Travailler avec nos chercheurs permet à Ironclad d'intégrer ces problèmes dans le développement du modèle sous-jacent, où nous pouvons les étudier ensemble.
À mesure que les modèles deviennent plus performants, Ironclad a l'opportunité de les utiliser dans davantage de ses propres produits. Pour les équipes juridiques et commerciales, cela pourrait signifier que l'IA prend en charge une plus grande part du travail impliqué dans les contrats complexes tout en préservant les contrôles dont ces équipes dépendent.
« Pour que l'IA soit réellement utile dans les domaines complexes de la contractualisation, elle doit faire plus qu'accomplir des actions individuelles. Les agents doivent comprendre l'ensemble du cycle de vie des contrats, y compris la manière dont les flux de travail commerciaux s'articulent, tout en préservant les contrôles dont les équipes dépendent. Notre collaboration avec OpenAI intègre ces défis du monde réel dans le processus de recherche et contribue à faire progresser la technologie. »
Travaillez avec nous pour faire progresser l'IA dans le travail professionnel complexe
Nous invitons un petit nombre d'éditeurs de logiciels à travailler directement avec nos équipes de recherche et d'ingénierie sur des tâches professionnelles importantes que les agents actuels ne parviennent pas encore à accomplir de manière fiable. Si votre équipe en a une, nous aimerions voir un exemple concret : ce que vous demandez à l'agent de faire, des preuves des points où il échoue, et la manière dont vous jugeriez un résultat réussi. Les partenaires doivent également pouvoir mobiliser des personnes qui connaissent profondément le travail, un environnement sécurisé pour les tests, et des données pouvant être utilisées en toute sécurité pour la recherche. Cela nous donne un point de départ pour étudier l'échec et mesurer si le modèle s'améliore.
Si c'est le cas de votre équipe, postulez pour explorer une collaboration de recherche.
