OpenAI更新日

Ironclad によるコンピュータ利用の前進

OpenAI と Ironclad が、複雑な契約ワークフローにおいて AI エージェントを訓練・評価し、専門業務におけるコンピュータ利用を前進させる方法についてご紹介します。

画像の出典 · OpenAI

私たちが発表したとき、 GPT‑6 Astra、ドキュメントの作成からウェブサイトのテストまで、専門業務でコンピュータを使用する際に私たちのモデルがどこまで進歩したかを実演しました。次の目標は、複雑なビジネス上の問題を解決するために専門的なソフトウェアを使用する際に、エージェントをより有能かつ効率的にすることです。私たちは、企業のビジネスルールを理解し、複数ステップのワークフローを実行し、その作業が元の要件を満たしていることを検証できるようモデルを訓練する方法を探っています。

この研究を加速させるため、こうしたワークフローを最も理解している少数のソフトウェア企業と直接提携しています。共に、困難で価値の高いタスクを特定し、それをモデルの訓練と評価のための研究課題へと転換することで、最終的に現実のビジネスアプリケーションにおいてモデルをより有能で有用なものにしていきます。

最初のパートナーは、AI 契約分野のリーダーである Ironclad です。Ironclad のチームと密接に協力し、エージェントが契約書、承認、再利用可能な法的条項を設定することを求めるタスクを開発し、これらの複雑なワークフローにおける進捗を実証しました。Ironclad の専門知識は、成功の姿を定義し、実際の顧客のニーズをフロンティアモデルの開発に直接反映させる上で非常に重要でした。彼らのパートナーシップに感謝するとともに、共に達成した成果を共有できることを嬉しく思います。

GPT‑6 Astra は、Ironclad のタスクで訓練された最初のフロンティアモデルです。私たちの研究評価において、その平均スコアは GPT‑5.6 Sol よりも 32% 高く、試行あたりの推定時間は 48% 短くなりました。1

契約ワークフローを訓練タスクに変える

ソフトウェア購入のためのプロセスを設定する法務運営チームを考えてみてください。財務部門は一定額を超える購入を承認する必要があり、セキュリティ部門は特定のリクエストを審査する必要があり、法務部門は非標準の条項を審査する必要があるかもしれません。プロセスを設定する担当者は、その短いリストをインテークフォーム、文書テンプレート、承認ルール、最終合意の記録に変換しなければなりません。

同じ作業を行う AI エージェントは、ソフトウェア内を移動しながらこれらの要件を常に意識しておく必要があります。例えば、支出しきい値を超える場合の財務承認を設定し、しきい値を超えるリクエストと超えないリクエストがそれぞれ正しい経路をたどることを確認しなければなりません。個々のステップを正しくこなすだけでは十分ではありません。完成したプロセスが、それが対象として設計された状況全体で機能しなければならないのです。

Ironclad の従業員と OpenAI で Ironclad を使用しているメンバーが、法務、商務、調達の業務にわたる 11 のタスクを特定するのに、私たちの研究者を支援しました。これには、秘密保持契約の設定、調達承認プロセスの作成、リクエスターが選択した管轄区域を反映するように再利用可能な法的条項を更新するといったタスクが含まれていました。この作業には、経験豊富なユーザーでもタスクあたり平均約 30〜40 分かかると見積もっています。

各タスクを、その複雑さに応じて 8〜50 の基準で評価しました。これにより、モデルがどの部分を正しくこなしたか、どこで不十分だったかを確認できました。Ironclad はまた、モデルがこれらのタスクを練習できる自社製品のホスト型ソフトウェア環境を提供しました。私たちの研究者は、代表的なワークフローに基づく合成訓練タスクを開発し、2 強化学習を用いて、練習とフィードバックを通じてモデルが向上できるようにしました。この組み合わせ—その仕事を知る人々と共に選定されたタスク、詳細な基準、そしてモデルが練習できる場—によって、顧客にとって最も重要な現実のタスクにおいて確実に向上を図ることができます。

Astra のパフォーマンス

Astra には Max reasoning、Sol には High reasoning を使用して、Astra と GPT‑5.6 Sol を比較しました。これらは各モデルが最高スコアを記録した設定です。11 の研究タスク全体を通じて、Astra の平均スコアは 55.0% であったのに対し、GPT‑5.6 Sol は 41.6% でした。また、試行あたりの推定平均時間は、Sol の 37.0 分から Astra の 19.2 分に短縮されました。3 Astra の開発に使用された内部モデルは、これらのタスクでさらに高い 63.7% を達成しており、私たちは今後のモデルでこのさらなる向上を実現することを目指しています。

指標

GPT‑5.6 Sol
High reasoning

GPT‑6 Astra
Max reasoning

平均ルブリックスコア

41.6%

55.0%

試行あたりの推定平均時間

37.0 分

19.2 分

Astra は、試行あたりのシミュレーション時間が短いながらも、より多くのタスク要件を満たしました。以下の 2 つのクリップは、モデルが同じ研究タスクをどのように処理したかを示しています。Astra(1番目)は推定 20 分でタスク基準の約 94% を満たし、GPT‑5.6 Sol(2番目)は推定 32 分で約 85% を満たしました。

GPT‑6 Astra は推定 20 分でタスク基準の約 94% を満たしました。

GPT‑5.6 Sol は推定 32 分でタスク基準の約 85% を満たしました。

この提携がIroncladにとって何を意味するのか

この取り組みにおけるIroncladの役割は、同社の顧客がよく知る課題を反映しています。契約プロセスは、ビジネスが依存するルールを維持しながら例外に対応できなければなりません。エージェントがタスクの途中でそのルールの一つを見失えば、ソフトウェア企業がエージェントに自信を持って任せられる範囲が制限されます。このことは、エージェントが複雑な契約タスクに長けていく中でも人間による監視が依然として重要である理由、そして総合的な契約プラットフォームが不可欠であり続ける理由を浮き彫りにしています。当社の研究者との協業により、Ironcladはこうした問題を基盤モデルの開発に持ち込み、共に研究する機会を得ることができます。

モデルがより高性能になるにつれ、Ironcladには自社製品のより多くの場面でそれらを活用する機会が生まれます。法務チームやビジネスチームにとって、これは、これらのチームが信頼するコントロールを維持しながら、複雑な契約業務に伴う作業のより多くをAIが担うことを意味する可能性があります。

「AIが契約の複雑な領域で真に有用であるためには、個々のアクションを完了する以上のことができなければなりません。エージェントは、チームが信頼するコントロールを維持しつつ、ビジネスワークフローがどのように連携しているかを含む、契約ライフサイクル全体を理解する必要があります。OpenAIとの協業により、こうした現実世界の課題を研究プロセスに取り込み、テクノロジーを前進させることができます。」
—Sunita Verma、Ironclad 最高技術責任者(CTO)

複雑な専門業務のためのAIの進化に、私たちと共に取り組みませんか

私たちは、今日のエージェントではまだ確実に完了できない重要な専門タスクについて、当社の研究チームおよびエンジニアリングチームと直接協力してくれる少数のソフトウェア企業を募集しています。御社のチームにそのようなタスクがある場合、具体的な例をお聞かせください。エージェントに何をさせようとしているのか、どこで失敗するかのエビデンス、そして成功した結果をどう判断するかです。パートナーには、その業務に精通した人材、テスト用の安全な環境、そして研究に安全に使用できるデータを提供できることも求められます。これにより、失敗の原因を調査し、モデルが改善したかを測定するための出発点が得られます。

これが御社のチームに当てはまる場合は、 研究協業の応募をご検討ください.

原文の出典

OpenAI

内容について

原文の公開と権利は出典元に帰属します。

機械翻訳 · 原文をご参照ください