OpenAI

AsanaはGPT-6.1 Solを使用したブラウザテストでモデルコストを76倍削減した。

CodexでGPT-6 Astraを使用することで、Asanaはブラウザエージェントの価格を76倍低くし、テスト時の速度を5倍向上させ、より高性能なモデルを顧客に提供できるようになりました。

画像の出典 · OpenAI

Codex内でGPT‑6 Astraを使用して実験を行う中、AsanaはGPT‑6.1 Solを利用したブラウザエージェントのワークフローを最適化し、費用は76倍低く、速度は5倍速くなった。

Asanaは、StackAI⁠(新しいウィンドウで開く)というプラットフォームを通じて、顧客がビジネスアプリケーション全体で作業を自動化するのを支援します。このプラットフォームは、買収した⁠(新しいウィンドウで開く)ものです。StackAIを利用することで、顧客はコードを書かずに、ウェブサイトを閲覧したり、フォームに情報を入力したり、情報を収集したりするワークフローを構築できます。Asanaの規模では、これらのワークフローにおける小さな非効率性が積み重なることになります。

AsanaのStackAI CTOであるフランク・ヒダルゴ博士は、ブラウザエージェントをより速く、より安価に実行できるようにすることを目指した。彼はCodexにおけるGPT‑6 Astraを指揮し、エージェントについて調査し、改善点をテストし、結果を比較した。手作業で1~2ヶ月かかった作業が、約1週間で完了したと彼は推定した。

Asanaの144回実行の研究⁠(新しいウィンドウで開く)では、GPT‑6.1 SolおよびモデルA、B、Cと呼ばれる他の3つの先進型モデルがテストされました。GPT‑6.1 Solで得られた最適化されたワークフローでは、推定モデルコストは0.47ドルであり、1回の実行に約4分かかりました。これはモデルBの元の生産設定よりも76倍安く、5倍速いです。

「これが人間とエージェントのチームが実際にどのような状態になるかです。エンジニアが方向性を決め、GPT-6 Astraが実験を実行し、その結果はCommand経由で製品化されます。これはAsanaが人間とエージェントのチームを実際に動かす方法を示しています。」
—アナブ・ボース、AsanaのCPO

GPT‑6 Astraを用いてブラウザエージェントの非効率性を特定する

迅速に動くために、ヒダルゴはCodex内のGPT‑6 Astraを利用してコードベースをマッピングし、エージェントが各モデルリクエストをどのように構築したかを説明しました。GPT‑6 Astraは、エージェントが固定された指示やツール定義をキャッシュしていることを発見しましたが、収集したページテキストやスクリーンショットの増加する履歴はキャッシュしていないため、各リクエストにおいてその履歴を全量で送信する必要がありました。

エージェントはまた、ほぼすべてのステップで古いスクリーンショットやテキストを削除しました。各編集によって履歴が変わるため、履歴だけをキャッシュしても役に立ちませんでした。そして、それらの情報を失うと、エージェントがすでに読んだページを再読み込む必要が出てくるかもしれません。

推定2ヶ月の研究が、GPT‑6 Astraによる1週間に短縮された

ヒダルゴはGPT‑6 Astraが提案した修正点をレビューし、3つをテスト用に選びました:

  • エージェントのブラウザ履歴にキャッシュ機能を拡張する

  • 保持できるテキストの量を増やす

  • 一歩ずつではなく、バッチでスクリーンショットを削除する

GPT‑6 Astraは、どの変数が重要かを確認するための迅速なテストから始まりました。コードは制御された実験のために設計されていないため、コードを再構築して、一つのフロントエンドとバックエンドが複数のワークフローを並行してサポートできるようにし、各ワークフローにはそれぞれ独自の設定が可能になりました。

Astraは全般的な調査を行った。120,000文字および480,000文字の履歴予算、6つのキャッシングとスクリーンショットポリシーが、4つのモデルそれぞれで3回ずつテストされた(下の表参照)。最も性能が良いポリシーでは、スクリーンショットが20個蓄積された後で、最新のものに切り替えられた。これにより、削除の間、以前の履歴が長期間変わらない状態を保つことができた。より大きな履歴予算と組み合わせることで、最適化されたワークフローとなった。 各設定は同じタスクを実行しました:StackAIで一部のAsana顧客が利用しているものに例えると、32冊の本それぞれに対して6つのフィールドを収集することです。

モデル

説明

価格

モデルA

2025年秋に発売される、別のフロンティアラボ製の小型で安価なモデル

GPT‑6.1 Solの半額です。

モデルB

モデルAと同じ研究室で作られた、本格的に生産に使用されたモデルが、2026年夏に発売される

GPT‑6.1 Solと同じ価格です。

モデルC

2026年秋に発売されるモデルBの更新版

GPT‑6.1 Solと同じ価格です。

GPT‑6.1 Sol

OpenAIのモデル

GPT‑6 Astraはワークフローを実行し、リクエスト、使用記録、出力内容を調査し、個別のモデルセッションも検討した。各セッションのリクエスト、データトレース、結果は、Asanaのソフトウェア配信プラットフォームであるCommand⁠(新しいウィンドウで開く)に記録されるため、チームはその後、全体的な研究結果を確認することができる。Commandから得られた成果はトラックに変換され、その後Pull Requestとなり、変更内容が本番環境に反映される。

「手作業で行うと1~2ヶ月かかるはずです。Codex版のGPT-6 Astraを使えば、約1週間で済みます。寝る前に/goalを設定し、朝になって結果を確認するだけです。」
—フランク・ヒダルゴ、PhD、AsanaのStackAI CTO

実行あたりのモデルコストを0.50ドル以下にする

モデルBについては、最適化により推定モデルコストが少なくとも36.21ドルから、実行ごとに1.24ドルに減少し、29倍の削減が達成されました。GPT‑6.1 Sol上での最適化されたワークフローは、さらに2.6倍低コストで0.47ドルになり、すべての実行でタスクを完了し、正しい答えを返しました。

3ラン目の手段。≥:ベースラインにはカップドランが含まれるため、その平均値は下限値である。

2つの右折りは、最適化されたモデルBと比較されます。モデルBは、同じ研究の第1フェーズで実施され、モデルCおよびSol 6.1は第2フェーズで実施されました(点線)。

GPT‑6.1 Sol単体で、より大きな歴史データの予算を使用し、新しいキャッシングおよびスクリーンショットポリシーにより、実行あたりのコストは$1.97から$0.47に4倍減少した。各呼び出しが約3倍安くなったのは、入力の89%がキャッシュから来ており、未キャッシュの価格の5%に相当するためである。実行時間も速くなった:Model Bの元の設定では少なくとも22.5分で、GPT‑6.1 Solの最適化されたワークフローでは約4分であった。

3回の平均値、標準偏差ウィスカー。≥:平均値には終了前の回も含まれるため、実際の値は少なくともこれほど大きい。

バーは青色テーマを使用しています。480kのより大きな予算のバーに対するキャッシング効果を確認してください。

ランマーとSDウィッカースは、元の画像から得られた近似的な再構築結果です。実際のラン値や標準偏差は利用できませんでした。

3回の平均値、標準偏差ウィスカー。≥:平均値には終了前の回も含まれるため、実際の値は少なくともこれほど大きい。

バーは青色テーマを使用しています。480kのより大きな予算のバーに対するキャッシング効果を確認してください。

ランマーとSDウィッカースは、元の画像から得られた近似的な再構築結果です。実際のラン値や標準偏差は利用できませんでした。

調査により、歴史管理がエージェントが答えを生成するかどうかに与える影響も明らかになった。GPT‑6.1 Solにブラウザ履歴を保持する余地を与えることで、答えを生成した実行回数は、より少ない履歴予算の場合の18回から、より多くの予算の場合の全18回に増加し、各回とも正しい答えが得られた。Hidalgoにとって、事業的価値とは、運営コストを持続可能に保ちながら、顧客により速く、より高性能なモデルへのアクセスを提供することである。

これらのワークロードに対して顧客に提供できるモデルを制限するためのコストがあった。エージェントをより効率的にすることで、顧客により良く、速いモデルを提供でき、かつ運営コストも低減できる。
—フランク・ヒダルゴ、PhD、AsanaのStackAI CTO

スケーリング実験と製品テスト

AsanaはStackAIのブラウザナビゲーションに関する変更を公開し、同様の実験をより簡単に繰り返すためのツールを開発しています。時間が経つにつれて、チームはこのテストをプラットフォームの評価に組み込む計画であり、顧客や内部チームがエージェントを設定する際にコスト、実行時間、回答の質を比較できるようになる予定です。

「輸送速度はもはやボトルネックではなく、人間の注意が問題となっている。すべてのエンジニアがエージェントの部隊を率いるPMである世界に近づいている。」
—フランク・ヒダルゴ、PhD、AsanaのStackAI CTO

Asanaは現在、CodexでGPT‑6 Astraを使用してリリース前の製品機能をテストしている。Astraはプラットフォームを操作し、異なる入力を行い、人間のQAレビュアーにバグを報告する。Hidalgoはこれを新しいソフトウェア開発ライフサイクルの基盤と見なし、多くのクラウドエージェントセッションで同時に機能をテストしている。

全文はAsana⁠(新しいウィンドウで開く)とStackAI⁠(新しいウィンドウで開く)のブログで利用可能です。

新しい時代の仕事に参加する

世界で100万以上の企業がOpenAIを利用して有意義な成果を達成しています。営業担当に連絡する
原文の出典

OpenAI

内容について

原文の公開と権利は出典元に帰属します。

機械翻訳 · 原文をご参照ください