ヘンリー 発信 凹非寺
量子位 | 公式アカウント QbitAI
多モーダルモデルの視覚原生Harnessが登場しました!
最近、何恺明のチームは最新の論文「VISTA: A Visual Harness for Reasoning in an Interactive World」で、視覚ベースのHarnessを提案した。
VISTA。
それにより、既存のマルチモーダルモデルは環境を直接観察し、元の画像を保存することができ、推論時に随時再視聴したり、拡大して詳細を確認したりすることができ、最初から学習する必要はありません。
従来の環境を文字やコードに抽象化する方法と比べて、VISTAは原始的な視覚情報を保持している。モデルは現在の問題に応じて、過去に見た画像を文脈に再適合させ、現在の判断や推論に参加することができる。
この手法に基づくと、視覚的経験はモデルが随時呼び出し、繰り返し検査するコンテキストとなり、多モーダルモデルには、視覚記憶を囲むための生来的な足場が構築される。
評価において、VISTAとClaude Opus 5.0を使用してARC-AGI-3の公開ゲーム25本すべてを完了し、人間の動作効率スコアは100点に達した。使用されたゲーム動作は、初回プレイの人間のベースラインより57.4%少なかった。
GPT-5.6 Solに変更し、全ステージをクリアし、得点は99に達した。
さらに一歩進んで、チームはブラウザゲーム、迷路、接続問題においてこの手法を検証し、物理世界に近い「具身」タスクを次の研究方向として掲げている。
これはどうやって実現されたのか?
視覚的オリジナルの足場
ResNet、Mask R-CNNからMAEまで、視覚認識と表現学習は常に何恺明の研究の主軸であった。
今回、VISTAは新たな問題に目を向けた。モデルが継続的な相互作用の中で経験を蓄積し、保存し、利用する方法とは何か?
答えはHarnessです。
昨年11月、Anthropicは長時間のプログラミングタスクを例に挙げて、Harnessがモデルが複数のコンテキストウィンドウを超えてタスクを継続的に進めるのにどのように役立つかを紹介しました。
具体的には、Harnessはタスクリストで未完了の事項を記録し、進捗ファイルとコードで完了した作業を保存します。
そうすると、モデルが新しいコンテキストウィンドウに入った場合でも、これらの情報を読み取ることで、以前何をしたか、次に何をすべきかを理解できる。
複雑なタスクはこのように段階的に実行され、結果が確認され、異なるコンテキストウィンドウ間で作業を続行することができる。
この、文字とコードを通じてタスクの状態を保存するHarnessが、ある程度、エージェントの能力が爆発するという現象を促進したと言える。
しかし、現実の環境では、文字記憶だけでは明らかに不十分です.
実際の視覚環境に入ると、モデルは物体の位置や向きを記憶するだけでなく、動作の前後で環境にどのような変化が起こるかを理解する必要があります。
また、モデルが初めて図面を見たとき、どの詳細が後で重要になるかを必ずしも理解しているとは限りません。
同時に、これらの視覚情報を事前にテキストノートで完全に記録することは難しく、モデルが後続のタスクを実行する際に、記録された情報が十分なものであることを保証するのも困難です。
ARC-AGI-3のような基準において、既存のアイデアの一つは、まず画面を数字からなるテキストグリッドに変換し、その後モデルにプログラムを書かせて、環境規則をシミュレートし、行動計画を検証することである。
(注:ARC-AGI-3はインタラクティブな視覚推論の基準であり、事前にゲームルールや目標を提供されない。アイドルは観察と行動を通じて、自らどう進めるかを模索する必要がある)
しかし問題は、環境が複雑になるほど、物体の外観や空間関係、動きの変化を完全にテキストやコードに変換することが難しくなることです。さらに、インタラクションの歴史が長くなるにつれて、初期の画面も徐々に文脈から取り除かれたり、テキストの要約に置き換えられるようになります。
したがって、ここで、VISTAの研究問題は次のようになります:
基本モデルを追加で訓練することなく、知能アプリが推論時に過去に見た視覚情報を再確認するようにするには、どうすればよいか?
これに基づき、VISTAは環境が返す各フレームをそのままコンテキストの外に保存し、動作中のアニメーションの中間フレームも含む。モデルが必要な時になってから取り出す。
ARC-AGI-3テストでは、異なる時刻の画像を比較したり、部分を拡大して小さな四角に付けられた向きのマークを確認したりすることができます。
その中で、文字ノートはモデルの現在の理解を記録し、元の画像は再判断のための証拠として保持される。
研究では、このメカニズムを相互作用の歴史に対する明示的な注意と呼んでいる。モデルは、考えている問題に基づいて、どの視覚情報が再び文脈に戻るかを選択する。
このような選択が可能になるためには、システムは元の画面を保存し、いつでも参照や確認できるツールを提供する必要がある。
具体的な実装
モデルが過去の視覚経験を保存し、利用できるようにするために、VISTAは3つの核心コンポーネントを設計した:
視覚観察、無損視覚記憶、および能動的視覚検査。これら3つの要素はそれぞれ異なる役割を担い、モデルが画像を明確に認識すること、歴史を保存すること、そして必要に応じて再視覚することを担当する。
まずは視覚観測で、環境の画像をモデルに提供する役割を担います。
ARC-AGI-3実験において、VISTAは公式提供された64×64の画像を512×512のPNG画像に拡大する。同時に物体の色、外観、空間関係を保持し、モデルが環境を直接観察できるようにする。
次に、損失のない視覚記憶があり、モデルが見た画像を保存する役割を担っています。
各アクションを実行した後、VISTAは環境が返す全ての画面を完全に保存します。これにはアクション中のアニメーションの中間フレームも含まれ、ラウンド番号とフレーム番号に基づいてインデックスを作成します。
そうすると、モデルはどの情報を覚えておくべきかを前もって判断する必要がなくなり、視覚的経験を完全に保存しておき、後で利用することができる。
最後に、アクティブビジョン検査が行われ、モデルが必要に応じて過去の画像を再視聴するようにする役割を担います。
inspectツールを通じて、モデルは特定の歴史的ラウンドを指定し、対応する画面を表示することもできます。また、局部領域を切り取りや拡大して、その中の詳細を確認することも可能です。
ある操作が実際に何を変えたかを知りたい場合、モデルは一度に複数のフレームを呼び出し、動作前後の変化を比較することができます。
全過程は、モデルにいつでも参照できる視覚アーカイブを提供するようなものです。それは目の前の環境だけを見ることができるだけでなく、過去の観察結果も積極的に振り返ることができ、次の行動の根拠となります。
これで、この3つのコンポーネントは具体的にどのように連携して動作するのでしょうか?
VISTAの実行プロセスに従って、各ラウンドの開始時に、モデルはまず現在の画面と利用可能な動作を観察し、以前に蓄積された経験を組み合わせて、現在の環境の状態を判断し、次の行動の仮定を立てる。
既存の情報が不十分な場合、モデルはツールを呼び出し、過去の画像を確認したり、特定の領域を拡大したり、具体的なピクセル情報を読み取ったりして、さらなる証拠を探すことができる。
証拠が見つかった後、モデルは直接行動するわけではなく、この操作が何かの変化をもたらす可能性を予測する。
等の動作が完了した後、実際の結果と予測を比較し、自分の判断が正しいかどうかを確認し、それに基づいてゲームルールの理解を修正する。
このように繰り返すことで、モデルは継続的な相互作用の中で、環境を探索しながら経験を積むことができる。
もちろん、視覚ファイルだけでは不十分です。モデルが長時間の作業中も連続性を保つために、VISTAは二つのテキストノートも導入しました。
- GUIDE.md:異なるステージ間で再利用可能なルールと経験を記録する。
- WORKING.md:現在のステージの状態、進捗、および今後の計画を記録する。
上限に近づくと、モデルはまず引き継ぎの要約を整理し、次に新しいコンテキストウィンドウに入ってタスクを続行する。それ以前のテキストノート、動作履歴、視覚ファイルはすべて保持される。
ここにはまた注目すべきデザインがあります。VISTAは歴史的な画面を完全に保存していますが、すべての画像を一気にモデルの文脈に押し込むことはありません。
完全なプログラムでは、アクションを実行するたびに、フレームワークはデモンストレーション用の最後のフレームのみを表示することがデフォルトです。アクションの途中にある中間画面については、一括してビジュアルファイルに保存され、デモンストレーション用のモデルが必要な時に自動的に呼び出されます。
これにより、完全な視覚情報を保持すると同時に、多くの歴史的画像がコンテキスト領域を占めることを防ぐことができます。
より重要なのは、VISTAがこのために新しいモデルを追加で訓練しなかったことです。
環境理解、行動計画、推論は依然として既存の多モーダルモデルが行っている。Harnessはツール呼び出しを実行し、視覚履歴を保存し、モデルが必要とする際に適切な証拠を提供する役割を担っている。
言い換えれば、VISTAが変えるのはモデルそのものではなく、モデルが視覚情報を取得し、保存し、利用する方法です。
実験検証
最初に言及された実験の他に、チームはGameWorld、AI GameStore、BabyVisionの3つのベンチマークでVISTAをテストしました。これにはブラウザゲーム、迷路、接続などが含まれるタスクが含まれます。
同じGPT-5.6 Solモデルを使用した場合、公式の基本フレームワークと比べて、VISTAはGameWorldの170項目のタスクで成功率を40.0%から63.3%に向上させました。
AI GameStoreの10種類のゲームにおいて、総合得点は47.3から140.3に上昇し、その中で人間の中央値は100に規準化された。
BabyVisionで選ばれた39の迷路と接続問題において、正確率は41.0%から63.2%に向上した。最後のこのセットのタスクは静的な画像のみであったが、モデルは部分を拡大してピクセルをチェックすることで、判断を改善することができた。
これらの結果は、元の画像を保存し、モデルが必要に応じて再視聴できるようにすることで、既存のマルチモーダルモデルの能力をさらに発揮できることを示しています。
同じVISTAフレームワークをわずかな調整で、異なるゲームやパズルに使用できる。また、より多くの視覚的なタスクでの応用可能性も示されている。
結論として、この研究は将来の検証方向を、物理世界に近い「具身」タスクへと向けている。つまり、モデルが絶えず変化する環境の中で、自身の視覚経験を保存し、再検討し、利用することで次の行動を決定するということだ。
著者紹介
最後に、この研究の著者たちを紹介しましょう。
論文の3人の共同第一著者はQiushi Han、胡珂雅、Linlu Qiuであり、もう2人の著者はCathy Wuと何恺明です。
Qiushi Han(ジョシュ・ハン)は現在、MITのマーケティング・スキル研究センターの博士課程学生であり、指導教員はCathy Wuです。
胡珂雅(Keya Hu)は現在、MITの電気工学およびコンピュータ科学部の博士課程学生であり、何恺明とJacob Andreasの共同指導を受けている。
彼女は上海交通大学ACMクラスを卒業し、研究の興味は言語と視覚の交差領域に集中しています。より効率的なデータ処理と強力な一般化能力を持つインテリジェントアーキテクチャを構築したいと考えています。
Linlu Qiuは現在、MITの電気工学・コンピュータ科学部門およびコンピュータ科学・人工知能ラボの博士課程学生であり、指導教員はYoon KimとJacob Andreasです。
その研究分野には自然言語処理と機械学習が含まれ、Google ResearchおよびMeta FAIRで研究を行った。
Cathy Wuは現在、MIT土木・環境工学部のデータシステムと社会研究所の准教授であり、機械学習や強化学習を用いて交通などの複雑なシステムを改善する方法について研究しています。
彼女はMITで学士および工学の学位を取得し、その後カリフォルニア大学バークレー校で博士号を取得した。
何恺明は現在、MITの電気工学およびコンピュータ科学部門の終身准教授であり、ResNet、Mask R-CNN、MAEなどの研究に主要な著者でもある。
彼は清華大学で学士号を、香港中文大学で博士号を取得し、マイクロソフト・アジア研究所およびFAIRで勤務した後、2024年にMITに入社した。
参照リンク
[1]https://arxiv.org/pdf/2610.02200