OpenAI Sitemap更新日

Ironcladとともにコンピュータ利用を前進させる

OpenAIとIroncladが、プロフェッショナルワーク向けのコンピュータ利用を前進させるため、複雑な契約ワークフローについてAIエージェントの訓練と評価を行っている様子をご紹介します。

画像の出典 · OpenAI Sitemap

私たちが GPT‑6 Astraを発表した際、ドキュメントの作成からウェブサイトのテストまで、プロフェッショナルワークにおいてコンピュータを活用するモデルがどこまで進歩したかをお見せしました。次の目標は、専門的なソフトウェアを使って複雑なビジネス課題を解決する能力と効率を、エージェントにおいてさらに高めることです。私たちは、企業のビジネスルールを理解し、複数ステップのワークフローを実行し、作業が元の要件を満たしていることを検証できるようモデルを訓練する方法を模索しています。

この研究を加速させるため、こうしたワークフローを最も理解している少数のソフトウェア企業と直接提携しています。共に、困難で価値の高いタスクを特定し、それをモデルの訓練と評価のための研究課題へと変換することで、最終的に実世界のビジネスアプリケーションにおいてモデルをより有能で有用なものにしていきます。

最初のパートナーは、AI契約分野のリーダーであるIroncladです。Ironcladチームと緊密に連携し、エージェントが契約書、承認、再利用可能な法的条項を設定することを求めるタスクを開発し、これらの複雑なワークフローにおける進捗を実証しました。Ironcladの専門知識は、成功がどのようなものかを定義し、実際の顧客ニーズをフロンティアモデル開発に直接取り込む上で不可欠でした。彼らのパートナーシップに感謝するとともに、共に達成した成果を共有できることを楽しみにしています。

GPT‑6 Astraは、Ironcladタスクで訓練された最初のフロンティアモデルです。私たちの研究評価において、その平均スコアはGPT‑5.6 Solより32%高く、1回あたりの推定所要時間は48%短くなりました。1

契約ワークフローを訓練タスクに変換する

ソフトウェア購入のためのプロセスを構築する法務オペレーションチームを考えてみてください。経理は一定額を超える購入の承認が必要かもしれず、セキュリティは特定のリクエストのレビューが必要かもしれず、法務は非標準的な条項のレビューが必要かもしれません。プロセスを構築する担当者は、その簡単なリストを、受付フォーム、ドキュメントテンプレート、承認ルール、最終契約の記録へと変換しなければなりません。

同じ作業を行うAIエージェントは、ソフトウェア内を移動しながらこれらの要件を常に把握していなければなりません。たとえば、支出しきい値を超える場合の経理承認を設定し、しきい値を超えるリクエストと超えないリクエストがそれぞれ正しい経路をたどることを確認する必要があります。個々のステップを正しく実行するだけでは十分ではありません。完成したプロセスは、想定されたあらゆる状況で機能しなければなりません。

Ironcladの従業員と、OpenAIでIroncladを利用しているメンバーが、法務、商用、調達の業務にわたる11のタスクを特定するよう、私たちの研究者を支援しました。これには、秘密保持契約の設定、調達承認プロセスの作成、依頼者が選択した管轄区域を反映するように再利用可能な法的条項を更新するなどのタスクが含まれていました。この作業は、経験豊富なユーザーであれば1タスクあたり平均約30〜40分かかると見積もっています。

各タスクは、その複雑さに応じて8〜50の基準で評価しました。これにより、モデルがどの部分を正しく処理でき、どこで不足していたかを把握できました。Ironcladはまた、モデルがこれらのタスクを練習できる同社製品のホスト型ソフトウェア環境を提供しました。私たちの研究者は、代表的なワークフローに基づく合成訓練タスクを開発し、2 強化学習を用いて、練習とフィードバックを通じてモデルが改善できるようにしました。この組み合わせ——その業務を知る人々と共に選定されたタスク、詳細な基準、モデルが練習できる場——により、顧客にとって最も重要な実世界のタスクで確実に改善を行うことができます。

Astraのパフォーマンス

私たちは、AstraにMax reasoning、SolにHigh reasoningという、それぞれのモデルが最高スコアを記録した設定を用いて、AstraとGPT‑5.6 Solを比較しました。11の研究タスク全体を通じて、Astraの平均スコアは55.0%だったのに対し、GPT‑5.6 Solは41.6%でした。また、1回あたりの推定平均所要時間は、Solの37.0分からAstraでは19.2分に短縮されました。3 Astraの開発に使用された内部モデルは、これらのタスクでさらに高い63.7%を達成しており、私たちはこのさらなる向上を将来のモデルにも反映させることを目指しています。

指標

GPT‑5.6 Sol
High reasoning

GPT‑6 Astra
Max reasoning

平均ルーブリックスコア

41.6%

55.0%

1回あたりの推定平均所要時間

37.0分

19.2分

Astraは、1回あたりのシミュレーション時間を少なく抑えながら、より多くのタスク要件を満たしました。以下の2つのクリップは、両モデルが同じ研究タスクをどのように処理したかを示しています。Astra(1本目)は推定20分でタスク基準の約94%を満たし、GPT‑5.6 Sol(2本目)は推定32分で約85%を満たしました。

GPT‑6 Astra は推定20分でタスク基準の約94%を満たしました。

GPT‑5.6 Sol は推定32分でタスク基準の約85%を満たしました。

この提携がIroncladにとって何を意味するか

この取り組みにおけるIroncladの役割は、同社の顧客がよく知る課題を映し出しています。契約プロセスは、企業が依拠するルールを維持しながら例外に対応できなければなりません。エージェントがタスクの途中でそのようなルールの一つを見失えば、ソフトウェア企業が安心して任せられる作業の範囲が制限されます。これは、エージェントが複雑な契約タスクをより上手にこなすようになっても、なぜ人間による監視が依然として重要なのか、そしてなぜ完全な契約プラットフォームが引き続き不可欠なのかを物語っています。当社の研究者との協働により、Ironcladはこうした問題を基盤モデルの開発に組み込むことができ、そこで私たちは共に研究を進めることができます。

モデルがより高性能になるにつれ、Ironclad はそれを自社のより多くの製品で活用する機会を得ます。法務チームやビジネスチームにとっては、これらのチームが信頼するコントロールを維持しながら、複雑な契約業務に伴う労力のより多くをAIが担うことを意味するかもしれません。

「AIが契約の複雑な領域で真に役立つためには、個々のアクションをこなす以上のことができなければなりません。エージェントは、チームが信頼するコントロールを維持しつつ、ビジネスワークフローがどのように連携しているかを含め、契約のライフサイクル全体を理解する必要があります。OpenAI との協業により、こうした現実世界の課題を研究プロセスに取り込み、技術の前進を後押しします。」
—Ironclad 最高技術責任者(CTO) Sunita Verma

複雑な専門業務のためのAIの前進に向けて、私たちと協力しませんか

私たちは、今日のエージェントではまだ確実に完了できない重要な専門タスクについて、研究・エンジニアリングチームと直接協力していただける少数のソフトウェア企業を募集しています。該当するタスクをお持ちであれば、具体的な例をお知らせください。エージェントに何を求めているのか、どこで失敗するかの証拠、そして成功した結果をどう判断するかです。パートナーの皆様には、その業務を深く知る人材、テストのための安全な環境、そして研究に安全に使用できるデータもご用意いただけることが必要です。これにより、失敗の原因を調査し、モデルが改善したかどうかを測定する出発点が得られます。

この内容がお客様のチームに当てはまる場合は、 研究協業への応募をご検討ください.

原文の出典

OpenAI Sitemap

内容について

原文の公開と権利は出典元に帰属します。

機械翻訳 · 原文をご参照ください