Codex上のGPT-6 Astraで実験を実施したAsanaは、GPT-6.1 Sol上でブラウザエージェントのワークフローを最適化し、76分の1のコスト、5倍の速度を実現しました。
Asanaは、次のプラットフォームを通じて、顧客が業務アプリケーション間で作業を自動化できるよう支援しています StackAI(新しいウィンドウで開きます)、これは同社が 買収した(新しいウィンドウで開きます)プラットフォームです。StackAIを使えば、顧客はコードを書かずに、ウェブサイトのナビゲート、フォームの入力、情報の収集を行うワークフローを構築できます。Asanaの規模では、こうしたワークフローの小さな非効率が積み重なります。
AsanaのStackAI CTOであるFrank Hidalgo博士は、ブラウザエージェントをより高速かつ低コストで実行できるようにすることを目指しました。彼はCodex上のGPT-6 Astraに、エージェントの調査、改善のテスト、結果の比較を指示しました。手作業で1〜2か月かかると見積もられていた作業は、約1週間で完了しました。
Asanaの144回実行の調査(新しいウィンドウで開きます) では、GPT-6.1 Solと、ここではモデルA、B、Cと呼ぶ3つの最先端モデルがテストされました。GPT-6.1 Solで確立された最適化されたワークフローは、推定モデルコストが1回あたり平均0.47ドル、所要時間は約4分で、モデルBでの元の本番構成と比べて76分の1のコスト、5倍の速度でした。
「これが実際の人間とエージェントのチームの姿です。エンジニアが方向性を定め、GPT-6 Astraが実験を実行し、その結果がCommandを通じて本番環境に反映されました。これはAsanaが人間とエージェントのチームをどのように具現化しているかを示しています。」—Asana CPO Arnab Bose
GPT-6 Astraによるブラウザエージェントの非効率の特定
迅速に進めるため、HidalgoはまずCodex上のGPT-6 Astraを使ってコードベースを把握し、エージェントが各モデルリクエストをどのように構築しているかを説明させました。GPT-6 Astraは、エージェントが固定の指示とツール定義はキャッシュしているものの、収集したページテキストとスクリーンショットの増え続ける履歴はキャッシュしていないため、毎回のリクエストでその履歴が全額分再送されていることを発見しました。
エージェントはまた、ほぼすべてのステップで古いスクリーンショットを破棄し、テキストをトリミングしていました。編集のたびに履歴が変わるため、履歴だけをキャッシュしても効果はなく、これらの情報を失うと、エージェントがすでに読んだページを再訪問しなければならなくなる可能性がありました。
推定2か月の調査が、GPT-6 Astraにより1週間に
HidalgoはGPT-6 Astraの提案した修正を確認し、テストする3つを選びました:
エージェントの閲覧履歴へのキャッシュの拡張
保持できるテキスト量の増加
毎ステップではなくバッチでのスクリーンショットの削除
GPT-6 Astraは、どの変数が重要かを判断するためのクイックテストから始めました。コードが管理された実験向けに設計されていなかったため、1つのフロントエンドとバックエンドがそれぞれ異なる設定を持つ多くのワークフローを並行してサポートできるよう、コードをリファクタリングしました。
Astraは本調査を実施しました:120,000文字と480,000文字の履歴バジェット、および6つのキャッシュとスクリーンショットのポリシーを、4つのモデルそれぞれで各3回テストしました(下表参照)。最も優れた成績を収めたポリシーは、スクリーンショットを20件まで蓄積してから最新の1件のみに削るというものでした。これにより、削除の間、以前の履歴がより長い期間変更されないまま維持されました。より大きな履歴バジェットと組み合わされ、これが最適化されたワークフローとなりました。各構成は同じタスクを実行しました:公開デモカタログから32冊の書籍それぞれについて6つのフィールドを収集するというもので、一部のAsana顧客がStackAIで実行している内容を代表するものです。
モデル | 説明 | 価格 |
|---|---|---|
モデルA | 別のフロンティアラボが2025年秋にリリースした、より小型で低価格なモデル | GPT-6.1 Solの半額 |
モデルB | 元々本番環境で使用されていたモデルで、モデルAと同じ研究所出身、2026年夏にリリース | GPT‑6.1 Solと同一価格 |
モデルC | モデルBの更新版で、2026年秋にリリース | GPT‑6.1 Solと同一価格 |
GPT‑6.1 Sol | OpenAIのモデル |
GPT‑6 Astraがワークフローを実行し、リクエスト、利用記録、出力を検証し、別のモデルセッションがその作業をレビューしました。各セッションのリクエスト、データトレース、結果はすべて Command(新しいウィンドウで開きます)であるAsanaのソフトウェアデリバリープラットフォームに記録され、チームは後から研究全体を確認できました。Command上で、調査結果はチケットに変換され、その後プルリクエストとなり、変更は本番環境に反映されました。
「これを手作業で行うと1〜2か月かかっていました。CodexでGPT‑6 Astraを使うと、約1週間で完了しました。寝る前に/goalを設定し、朝に結果を確認するだけでした。」—Frank Hidalgo、PhD、AsanaのStackAI CTO
1回の実行あたりのモデルコストを0.50ドル未満に引き下げる
Model Bでは、最適化により推定モデルコストが1回あたり少なくとも36.21ドル(元の実行の一部は完了前にステップ上限に達していました)から1.24ドルに、29分の1に削減されました。GPT‑6.1 Sol上の最適化ワークフローはさらに2.6倍安い0.47ドルでした。最適化されたワークフローのすべての実行がタスクを完了し、正しい回答を返しました。
3回の実行の平均。≥:ベースラインには上限で打ち切られた実行が含まれるため、その平均は下限です。
右側の2つの折れ線は、最適化されたModel Bとの比較です。Model Bはフェーズ1で、Model CとSol 6.1は同じ研究のフェーズ2(点線)で実行されました。
GPT‑6.1 Solのみで、より大きい履歴予算を用いた場合、新しいキャッシングとスクリーンショットのポリシーにより、コストが4分の1に、1回あたり1.97ドルから0.47ドルに削減されました。各呼び出しは約3分の1のコストになりました。入力の89%が、未キャッシュ価格の5%でキャッシュから供給されたためです。実行も高速になりました。Model Bの元のセットアップでは少なくとも22.5分かかっていましたが、GPT‑6.1 Solの最適化ワークフローでは約4分でした。
3回の実行の平均、SDのひげ。≥:平均には上限で打ち切られた、または未完了の実行が含まれるため、真の値は少なくともこれ以上です。
棒グラフは青のテーマを使用しています。キャッシングの効果は、480kの大きい予算の棒と比較して読み取ってください。
実行マーカーとSDのひげは、元の画像からの概算の再構成です。個々の実行の値と標準偏差は入手できませんでした。
3回の実行の平均、SDのひげ。≥:平均には上限で打ち切られた、または未完了の実行が含まれるため、真の値は少なくともこれ以上です。
棒グラフは青のテーマを使用しています。キャッシングの効果は、480kの大きい予算の棒と比較して読み取ってください。
実行マーカーとSDのひげは、元の画像からの概算の再構成です。個々の実行の値と標準偏差は入手できませんでした。
この調査では、履歴管理がエージェントがそもそも回答を生成できるかどうかにどう影響するかも示されました。GPT‑6.1 Solにより多くの閲覧履歴を保持する余地を与えたところ、回答を生成した実行の数は、小さい履歴予算では18回中3回だったのに対し、大きい予算では18回すべてに増加し、いずれも正しい回答でした。Hidalgoにとって、そのビジネス価値は、運用コストを持続可能な水準に保ちながら、顧客により高速で高性能なモデルへのアクセスを提供することです。
「以前はコストが、こうしたワークロードで顧客に提供できるモデルを制限していました。エージェントをより効率化することで、運用コストを下げながら、顧客により良い、より高速なモデルを提供できるようになります。」—Frank Hidalgo、PhD、AsanaのStackAI CTO
実験とプロダクトテストのスケーリング
Asanaはブラウザナビゲーションに関する変更をStackAIでリリース済みであり、同様の実験を繰り返しやすくするツールを開発中です。長期的には、このテストをプラットフォームの評価に組み込み、顧客や社内チームがエージェントを設定する際に、コスト、実行時間、回答品質を比較できるようにする予定です。
「出荷速度はもはやボトルネックではなく、人間の注意力がボトルネックです。私たちは、すべてのエンジニアがエージェントの群れを率いるPMとなる世界に近づいています。」—Frank Hidalgo、PhD、AsanaのStackAI CTO
Asanaは現在、リリース前のプロダクト機能のテストにCodexのGPT‑6 Astraを使用しています。Astraはプラットフォームを操作し、さまざまな入力を試し、人間のQAレビュアー向けにバグを報告します。Hidalgoはこれを、多くのクラウドエージェントセッションが並行して機能をテストする、新しいソフトウェア開発ライフサイクルの基盤と捉えています。
研究の全文は、 Asana(新しいウィンドウで開きます) および StackAI(新しいウィンドウで開きます) ブログ。
