著者丨張岂萍 幸麗娟
編集丨幸麗娟
世界モデルの競争は、「未来を生成する」ことから、「ロボットに本当に使えるか」へと移りつつある。動画はますます逼真に生成できるようになっているが、ロボットシステムに入った後、世界モデルはより具体的な問題に答えなければならない:動作実行後の状態変化を予測できるか、ポリシー学習を支援できるか、最終的に実機ロボットでタスクを完遂できるか。WorldArena は世界モデルを同じ「試験会場」に引き入れた。この評価体系は清華大学チームが海内外の複数の大学と共同で発表したもので、世界モデル分野で最も権威ある評価ランキングの一つである。WorldArena 1.0 はすでに世界モデルの評価を単純な動画生成から、データ生成、ポリシー評価、動作計画などの具身タスクへと初歩的に拡張していた。しかし全体としては依然として視覚入力、オフラインタスク、シミュレーション環境に集中していた。実機ロボットでの実行、オンライン強化学習のクローズドループ、視触覚マルチモーダル知覚、そして実際のデプロイにおけるノイズ、遅延、誤差の累積については、体系的な評価が欠けていた。これらのギャップに対応し、WorldArena 2.0 は評価体系をさらにアップグレードした。モダリティは純視覚から視触覚へ、機能はオフラインタスクからオンライン強化学習へ、プラットフォームはシミュレーション環境から実機ロボットへと拡張した。IROS はロボット分野で最も影響力のある国際トップ会議の一つであり、WorldArena 2.0 Challenge はこの盛会で実機クローズドループの競技場を設け、3つのトラックがそれぞれ動画品質、オンライン強化学習環境、実機ロボット操作に向けられた。いくつもの世界モデル流派が長く論争してきたが、異なる技術路線のモデルも、ついにこの競技場で真剣勝負を交わすことになった。明確に JEPA 路線を進む視啓未来が Track 1 優勝を獲得し、空間インテリジェンス路線の同済大学 BWM-Turbo モデルは 0.84 点差で第2位に。また同じく JEPA 路線の晨昏線科技が、 Track 2 で総合第2位となった。さらに注目すべき細部がある:3つのトラックの上位2名には、アカデミア派と産業派がそれぞれ1席ずつ占めている。世界モデルトラックの競争は、学術とエンジニアリング能力の正面衝突を迎えた。大会の位置づけ、複数機関の協力、トラック設定とランキング結果をめぐり、AI 科技評論は WorldArena 2.0 Challenge 主催者の清華チームにも取材した。彼らの回答は、この評価体系がオンラインインタラクションと実機実行に向かう際に、どのように設計し、どのように協力し、どのような境界があるのかをさらに示している。
01
WorldArena 2.0、新たな「大試験」の難しさはどこか
WorldArena 2.0 は世界モデルの評価をさらにオンラインインタラクションと実機ロボットへと推し進めた。WorldArena 1.0 は主に2種類の能力を検査していた:一つは世界モデルが生成する未来動画の品質で、15 項目の指標が視覚品質(Visual Quality)、動作品質(Motion Quality)、内容一貫性(Content Consistency)、物理遵守性(Physics Adherence)、3D 正確性(3D Accuracy)、制御性(Controllability)をカバー;もう一つはこれらの予測がロボットにとって実用性があるかを見るもので、データ生成、ポリシー評価、動作計画を含む。14 の代表的モデルの評価では、動画品質と具身タスクの性能が常に対応するとは限らないことが示された。映像がより鮮明で滑らかに生成されたとしても、モデルがデータ生成、ポリシー評価、動作計画で必ずより良い成績を収めるわけではない。WorldArena 1.0 のカバレッジも比較的限定的だった:モダリティでは視覚情報のみを扱い、機能ではデータ生成、ポリシー評価、動作計画などのオフラインタスクが中心で、プラットフォームも主にシミュレーション環境にとどまっていた。触覚フィードバック、オンラインインタラクション、そして実機ロボットでの実行性能は、この評価には含まれていなかった。WorldArena 2.0 のアップグレードは、モダリティ(Modality)、機能(Functionality)、プラットフォーム(Platform)の3つの方向に沿って展開された。モダリティでは、純視覚から視触覚へ拡張。モデルが映像と接触情報を同時に処理できるかを検証する。機能では、オフライン評価からオンライン強化学習へ拡張。世界モデルがインタラクション環境としてポリシー学習を支援できるかを検証する。プラットフォームでは、主にシミュレーション環境に依存していたところから、実機ロボット評価を含むように拡張。RoboTwin 2.0 や LIBERO などのシミュレーション環境に加え、WorldArena 2.0 はさらに実機ロボットテストを導入し、物理環境におけるモデルの実行性能も評価対象に組み入れた。WorldArena 2.0 に基づくこの評価方向に沿い、Challenge は3つのトラックを設けた:Track 1 は動画品質を評価し、Track 2 は世界モデルの強化学習環境としての能力を評価し、Track 3 は実機ロボット操作を評価する。Track 1 は既存の動画品質評価を継承・アップグレードしたものであり、Track 2 と Track 3 は 2.0 で新たに追加されたトラックである。
Track 1 には70の正式タスクが設定された。うち50は白いテーブルのID(In-Distribution、分布内)cleanシナリオ、残りの20はカラーやテクスチャ付きテーブルのOOD(Out-of-Distribution、分布外)シナリオである。すべての参加モデルが同一のデータセット群でテストされた。
このトラックでは、長時間および分布外シナリオにおける動画生成の性能が問われる。OODシナリオは、テーブルの色やテクスチャを変えることでIDシナリオとは異なる視覚条件を導入し、分布の変化に直面した際に、モデルが物体の同一性、空間トポロジー、動作の因果一致性を維持し続けられるかを観察するために用いられる。最終スコアは15項目の指標によって決定され、画質、動作品質、内容の一貫性、インタラクションの正確性、3D幾何、指示の実行などの側面を網羅する。JEPA表現類似度(JEPA Similarity)も含まれており、V-JEPAで動画の特徴を抽出し、生成動画と実際の参照動画の特徴分布が近いかどうかを比較する。Track 2 はさらに連続的なインタラクションへと進む。世界モデルは強化学習環境として機能し、その中でポリシーが動作を繰り返し実行し、新しい状態と報酬を得て、さらに更新を続ける。訓練完了後、ポリシーは RoboTwin 2.0 に戻ってタスク成功率をテストし、世界モデルが本当にオンライン方策訓練を支援できるかを検証する。これには、世界モデルが複数回のインタラクションにわたって安定性と動作の制御可能性を保ち、さらに異なる動作がもたらす状態変化を正しく反映し、モデルに有効な報酬信号を提供する信頼できる画像を生成することが求められる。一度の予測偏差も次のインタラクションに持ち込まれ、連続的なインタラクションの中で蓄積され続ける可能性がある。
Track 3 は評価を実際のロボット操作に直接置いた。主催者は同時に、純視覚と視触覚の2種類のタスクを設定した:テーブル拭き、水の注ぎ、テーブルの片付け、衣類のたたみなどの視覚駆動の操作に加え、ポテトチップスをつまむ、キュウリの皮を剥く、2穴プラグを挿すなど、接触情報を必要とするタスクも含まれる。実機になると、接触力の変化、センサノイズ、通信遅延がすべてタスク結果に直接影響する。重点は、実環境におけるモデルとポリシーの汎化頑健性、および動作の逸脱からの自己回復能力に置かれる。Track 1 から Track 3 へと、評価は「予測できるか」から「学習を支えられるか」へ、最終的に「実機ロボットでタスクを完遂できるか」へと段階的に進んでいく。02
3つのトラックの結果が発表され、各優勝チームの強みはどこにあるのか
9 月 16 日、WorldArena 2.0 Challenge の世界最終ランキングが発表された。3つのトラックは独立したランキング、独立した表彰が行われ、公式サイトに掲載された賞金額に基づくと、総賞金は7000米ドルである。▎Track 1:WorldIncept、勝因は動画の「見た目の良さ」だけではない
Track 1 の最終ランキングには81のモデルが最終スコアを獲得した。視啓未来(Visincept)の WorldIncept が72.33点で1位となった。同济大学コンピュータ科学・技術学院の空間インテリジェンスチームの BWM-Turbo は71.49点で2位となり、両者の差は0.84点だった。各項目を見ると、WorldIncept の優位性は画質だけに集中していない。最終ランキングの結果では、WorldIncept は物理遵守性(Physics Adherence)と 3D 精度(3D Accuracy)の2つの次元で1位となり;、意味整合(Semantic Alignment)の得点は90.11で、これも単項目1位だった。物理遵守性は生成過程が現実世界の運動・インタラクションの法則に合致しているかに着目し、3D精度はさらに深度、透視、空間幾何の関係を検証する。意味整合は、生成結果がタスクの要求に応じて本当に変化したかを見るものである。これらのトップ指標は、WorldIncept の背後にあるチームの蓄積とも一定の対応関係がある。WorldIncept を支える視啓未来は IDEA研究院が孵化した企業で、DINO-X シリーズの視覚モデルや DINO-XGrasp 万物把持モデルをすでに発表し、百度智能云と協力して EgoTwin データエンジンを発表した。同社は十万時間規模の Ego データとテレオペレーションデータに基づいてロボットのダイナミクスをモデリングし、汎用物体理解、空間インテリジェンス、人体/人手動作理解におけるチームの蓄積を融合させている。それに対して、同济大学の空間インテリジェンスチームは長時間生成の安定性により注力している。BWM-Turbo は DiT アーキテクチャを基盤に、初フレームガイダンス、動的メモリ、動作制御などの設計を加え、長時間生成におけるシーンの安定、動作の応答、時系列一貫性の問題に重点的に取り組んでいる。今回の最終ランキングで、BWM-Turbo は背景一貫性(Background Consistency)と JEPA表現類似度(JEPA Similarity)の2指標で1位となり、この手法のシーン安定性と表現一貫性における優位性も示された。両者の技術的方向性は異なるが、Track 1 の競争の重点はすでに明確になっている:動画生成はあくまで基礎であり、空間構造、動作の変化、長時間推論における物理的一貫性を安定して維持できるかが、差を広げる鍵になりつつある。▎Track 2:MW2、世界モデルがついに方策訓練へ本格的に参入
Track 2 は WorldArena 2.0 で新たに追加されたオンライン強化学習トラックで、世界モデルがロボットのポリシー学習環境として本当に機能するかどうかを評価する。ポリシーがまずアクションを生成し、世界モデルがそのアクション後の将来状態を予測し、それらの予測に基づいて報酬計算とポリシー更新を行い、最終的に学習後のポリシーがタスクを達成できるかを見る。このトラックは RoboTwin 環境に基づき、Adjust Bottle(ボトルの調整)というタスクを用いて行われる。このタスクはロボットにボトルの姿勢と位置を再調整することを求め、精密な姿勢制御と把持の安定性が試される。
最終ランキングでは、北京中関村学院の MW2 が 72.93 点で 1 位となり、晨昏線科技(チェンフレンライン)の TTWM が 72.40 点で 2 位、両者の差はわずか 0.53 点で、評価対象となった 47 モデルの中で 72 点を超えた唯一の 2 つの手法でもある。MW2 の背後にある北京中関村学院は、近年エンボディッドインテリジェンスとフィジカルインテリジェンスへの取り組みを続けている。続く TTWM は、世界モデルの学習により具体的な最適化手法を採用した。それは晨昏線の目標因果世界モデル GCWM の大会参加バージョンで、「アクションが将来状態をどう変えるか」のモデリングに重点を置いている。モデルは現在の状態、タスク目標、ロボットのアクションを条件として、アクション実行後の物理的相互作用と状態変化を予測する。Track 2 の連続 rollout では、チームは目標領域、空間幾何、時間を跨ぐ一貫性について集中的な最適化を行い、フレーム単位のノイズやコールドスタートのランダム化などの設計により、多回予測における誤差の累積を低減した。これらの設計は、下流のポリシーの性能にもさらに反映されている。Baseline VLA π0.5 の成功率は 55.46% だったが、GCWM を強化学習環境としてポリシー最適化を行うと、VLA モデルの成功率は 72.40% まで向上した。Track 2 は競争の重点をさらにポリシー学習へと推し進め、世界モデルが本当に下流ポリシーの性能を向上させられるかが、このトラックの核心となっている。▎Track 3:ViTacX、実機タスク総合 1 位
Track 3 は WorldArena 2.0 で新たに追加された実物ロボット評価トラックで、 AgileX 双腕ロボットと Franka Panda 単腕ロボットを対象とする。このうち Track 3.1 は視触覚操作を評価し、AgileX 上でポテトチップスの挟み取り、キュウリの皮剥き、2 孔プラグの挿し込み の 3 タスクを遂行する。Track 3.2 は純視覚操作を評価し、AgileX ではテーブル拭き、注水、机の片付け、指示による机の片付け、服のたたみ、紙箱の折りたたみ の 6 タスクを設定し、Franka もテーブル拭き、注水、机の片付けを対象とする。各タスクは実機での実行成功率で評価される。総合ランキングはタスクの難易度を考慮し、視覚と視触覚の方向ごとの重みに従って合計スコアを算出する。ロボットは規定ステップ数内で操作を完了し、その過程で安全介入を引き起こしてはならない。
総合ランキングでは、小米(シャオミ)ロボット MiRobot チームが提出した ViTacX が 76.64 点で 1 位となり、上海科技大学の OmniFlow チームが 67.37 点で 2 位につけた。ViTacX の主な優位性は純視覚サブランキングから来ている。同モデルは Track 3.2 で 85.00 点で 1 位を獲得し、テーブル拭き、注水、服のたたみ、紙箱折りの 4 項目で単項目最高点を達成し、そのうち最初の 3 項目はいずれも 100 点だった。チームの技術的背景から見ると、小米ロボットは長らくエンボディッド基盤モデル、VLA、実物ロボットの実行に注力しており、研究は視覚認識、動作生成から実機での連続実行までをカバーしている。これらの方向性は、まさに Track 3.2 が試験する視覚駆動操作と実物ロボット実行能力に対応している。Track 3.2 純視覚操作ランキングTrack 3.1 視触覚サブランキングでは、ViTacX が 66.67 点で 3 位についた。それに対し、OmniFlow は純視覚と視触覚の両サブランキングで 2 位を維持した。その背後にある上海科技大学は、ロボット操作と触覚関連の研究を長期にわたり展開しており、自動化・ロボットセンターのエンボディッド操作研究は、触覚認識、テレオペレーション、模倣学習、強化学習、多接触運動をカバーしている。Track 3.1 視触覚操作ランキング2 つのサブランキングから見ると、ViTacX の総合ランキングでの優位性は主に視覚駆動の実機操作から来ており、視触覚タスクでの成績は相対的に後位にとどまっている。03
同一の評価体系の下で、世界モデルの技術路線にはそれぞれ重点がある
公開済みの手法とランキング成績から見ると、WorldArena 2.0 は異なる世界モデルの技術路線を同一の評価体系に置いて比較しており、各手法がそれぞれ何に長けているのかも、次第にはっきりし始めている。Track 1 の上位 2 チームは、2 つの異なる技術路線を指し示している。WorldIncept の背後にある視启未来(シーフーチーライ)は鮮明に JEPAの潜在空間アプローチ、BWM-Turbo は一方で空間インテリジェンス路線。両ルートのモデルが同じ舞台で競い、WorldIncept は物理の遵守性と 3D の正確性でリードし、BWM-Turbo は背景の一貫性と JEPA 表現の類似度で第 1 位となった。Track 2 は、世界モデルが戦略訓練環境として安定して機能できるかを直接検証するものである。優勝した MW2 は北京中関村学院のもので、同チームはロボットによる物理法則の理解に着目し、その理解を行動の学習・実行と結びつけている。2 位の晨昏線科技の TTWM は、より行動の因果予測に重点を置き、対象領域、空間的な幾何学的制約、物体の時間をまたぐ一貫性、および連続 rollout における誤差の蓄積に注目している。Track 3 では、小米ロボットの MiRobot チームの ViTacX が総合第 1 位を獲得したが、純粋な視覚タスクにおけるその優位性は、視触覚操作までは完全には続かなかった。このことは、実ロボットの操作では環境を見極めるだけでなく、接触情報の処理も必要とすることを示している。マルチモーダル情報が安定して動作計画と制御の閉ループに入ることができるか、それこそがより難しい部分である。三つのトラックで首位に立ったチームはそれぞれ得意分野を持ち、異なる能力の面で独自の強みを発揮している。参加には選択の余地があるため、動画生成、方策学習、実ロボット操作のすべてで同時にトップ水準に達するモデルが現れるかどうかは、まだ検証を待つところであり、期待に値する。04
主催者との対話:世界モデルの「試験会場」はどのように構築されたのか
複数機関による大会結果の統一判定から、評価設定が単一の指標による偏りをいかに減らしているかまで、WorldArena 2.0 の評価の背後には技術的・組織的な課題が数多くあります。主催者である清華チームは取材の中で、これらの疑問についても回答しました。以下は対談の全文です(AI 科技評論が原文の意味を変えない範囲で編集したもの)。WorldArena の位置づけと評価メカニズム
▎AI科技評論:WorldArenaは今や世界モデルの主要な評価ベンチマークの一つとなっています。このような評価をどうお考えですか?また、この評価は主にどこから来ているとお考えですか?
主催:このような認可は、主に学界と産業界の共通のニーズから生まれています。ロボットが動作を実行する際に、世界モデルが予測した未来が本当に役立つかどうかを判断するための評価方法が必要とされている。。具身智能にとっては、モデルが動作指令に正確に応答できるか、予測する動きが物理法則に合致しているか、そして戦略の学習と実際の実行をサポートできるかが重要です。これらの能力は動画を見るだけでは判断しにくく、専用のテストが必要です。WorldArena 1.0 はこれらの課題を統一された基準で実行できるテストプロセスに変換し、2.0 ではオンライン強化学習と実ロボットとの相互作用をさらに加え、さらにシミュレーションから実世界への移行(Sim2Real)と閉ループフィードバックを考察する。私たちにとって、ベンチマークに長期的な価値があるかどうかは、研究者や実務者がモデルの本質的な問題を見つけ、長所と短所を説明し、それに基づいて手法を改善する手助けができるかどうかで判断されます。▎AIテックレビュー:WorldArenaには清華大学、北京大学、CMU、スタンフォード、プリンストン、香港大学、NUS、中科院自動化研究所など複数の機関が関わっていますが、主催者である清華大学チームは具体的にどのような役割を担っているのでしょうか?
主催者:清華チームは主に評価フレームワークの研究設計と開発、ならびに大会の評価およびオープンソースコミュニティの維持を担当します。このベンチマークは動画生成から実機操作までをカバーしており、大量のソフトウェア・ハードウェア、計算資源、人材の投入が必要で、一つのチームだけでは完成が難しく、複数の機関が共同で協力しなければなりません。具体的な作業には以下が含まれます。評価プロセスの構築、提出されたコードの規範的な処理、地域をまたぐリモート推論サービスと連携する、分散型評価クラスタの保守、およびチェックサム集計結果。実機トラックでは、さらにロボットプラットフォームの協力パートナーとの間でハードウェアインターフェースの適合、テスト時間帯の予約、現場での操作手配を完了する必要がある。▎AI科技評論:複数機関の連携において何か問題は生じますか?具体例を1、2個挙げていただけますか?
主催者:特に顕著な困難は2つある。一つ目は、異なる計算環境下で評価結果の再現性をどのように保証するかということです。;二つ目は、現場ごとに異なるロボット設備と人員をどのように協調させるかという課題です。例えば、同じ評価コードでも、NVIDIAやAMDなど異なるアーキテクチャのGPU上で実行した場合、下層の演算子実装や環境依存が細かく揃っていないと、結果に微妙な揺らぎが生じることがあります。そのため、複数のハードウェア環境への適応、下層設定の統一を行い、その後に集中して再検証し、プラットフォームの差異をモデル能力の差異と誤判定しないようにする必要があります。実機評価にはさらに、地域ごとの会場、設備状態、人員配置も関わり、ロボット本体ごとにタスクとデータ収集フローを設計する必要があります。リモートのモデルサービスは、現場での実行とミリ秒単位のタイミングで連携する必要があり、インターフェース仕様、物理的な初期条件、実行ログをすべて明確にしておかなければなりません。▎AI科技评论:評価の次元は非常に多いですが、どれが自動評価可能で、どれが専門家による主観採点に依存しますか?機関横断・トラック横断の採点の一貫性はどう保証しますか?
主催者:3つのトラックの自動化度は異なり、テストがオンラインインタラクションや現場でのデバイス操作を含むかどうかによって決まります。Track 1 は主に生成能力を評価し、指標は主に自動化されたフローで計算されますが、異常な出力や疑わしい提出に対する人手による審査も残されています。Track 2 は世界モデル環境における強化学習ポリシーの反復的な性能を評価し、評価フローの自動化度も比較的高いです。人手の作業は主にサービス呼び出しの接続性の確認と、各チームのインタラクティブ計算時間帯の調整です。Track 3 は実機操作を含み、現場のスタッフがデバイスのリセット、把持観察、異常処理、タスク成否の判定に関与し、参加チームとリアルタイムで接続を保ち、双方がリアルタイムにコミュニケーションしてテスト結果を確認し、それに基づいて成功率を集計します。一貫性は主に、同一トラック内で統一ルールを採用することによって保証されます。各チームの入力フォーマット、API仕様、計算予算、評価指標のバージョン、失敗判定基準はすべて統一されています。トラックが異なれば評価する能力も異なり、スコアを直接比較することはできません。私たちが重点的に保証しているのは、各トラック内部における評価条件と判定基準の一貫性です。▎AI科技评论:リーダーボードはチャレンジリーグ用と日常用に分かれていますか?日常リーダーボードの更新メカニズムは何ですか?どのくらいの頻度で更新されますか?
主催者:チャレンジリーダーボードと日常の研究リーダーボードは用途が異なり、公開範囲や更新スケジュールにも違いがあります。チャレンジリーダーボードは試合の成績と賞の決定に用いられ、明確な提出締め切り時刻、リーダーボード凍結ルール、受賞審査フローがあります。試合の公平性を確保するため、一部のテストデータは完全には公開されません。日常の研究リーダーボードは学術界に長期にわたって公開され、コードと評価プロトコルは完全にオープンソースであり、研究者はローカルで再利用でき、その後のアルゴリズム改善のための継続的な性能参照を提供します。チャレンジに2つの新トラックを追加し、モデルが本当に実行できるかを検証
▎AI科技评论:WorldArena 2.0 は 1.0 に比べて Track 2(MB-RL)と Track 3(実機 WAM)を新設しました。このアイデアはどのように生まれたのですか?なぜ特にこの2つのトラックを追加したのですか?背景にある考えは何ですか?
主催者:この2つのトラックを追加したのは、さらにインタラクションと実際の実行におけるモデルの役割を検証するためです。1.0 は主に身体性データエンジンとポリシーのオフライン評価に焦点を当てており、依然としてオープンループの、シミュレーション環境内部の静的テストが中心でした。モデルはローカルでファインチューニングされた後にテストを受け、リアルタイムのフィードバックがなく、インタラクションの過程で自己修正することもできません。2.0 では2つの側面の能力をさらに評価したいと考えています。1つ目は閉ループインタラクション能力です。ポリシーが世界モデルをインタラクション環境として、モデルが生成するダイナミックな空間の中で継続的に学習し試行錯誤できるか。2つ目は身体性汎化能力です。モデル環境で学んだスキルが、Sim2Real移行を経て、実体のロボットアームの操作に使えるか。背景にある考えは次のとおりです。動画生成が滑らかでも、モデルが信頼できる物理的フィードバックを提供できるとは限りません。シミュレーションで安定して動作しても、実機でも正常に実行できるとは限りません。そのため、オンラインインタラクションと実機デプロイを独立したトラックとして設ける必要があります。▎AI科技评论:以前、商宇先生は私たちのインタビューで、リーダーボードの「sim-to-real gap」という限界を率直に語っていました。Track 3 の実機トラックはこの問題への直接的な応答なのでしょうか?どの程度解決できますか?
主催者:実機評価は、実際のセンシング、接触条件、デバイスの実行プロセスをテストに取り入れ、シミュレーション研究の補完となります。摩擦力の変化、照明の干渉、モーター制御の遅延、剛体接触などの要因は実機タスクの結果に影響を与えます。ただし、Track 3 が現在カバーしているタスク、環境、ロボット本体には依然として限りがあり、今後も継続的に拡張・改善していきます。▎AI科技评论:今後は WorldArena 3.0 へのバージョンアップも予定していますか?どのような次元のテストを追加することを考えていますか?
主催者:2.0 を推進する過程で、さらなる研究に値するいくつかの方向性が見えてきました:より高頻度、より長時間の閉ループインタラクション、実行ミス後の自主的なエラー修正、異なる構成のロボット間での汎化・転移、そして精密組立における触覚とマルチモーダル知覚の融合。▎AI科技評論:参加は選択制ですが、あるトラックには強者が集中し、別のトラックは閑散としてしまうことで、ランキング全体の代表性が損なわれることはありませんか?
主催者:これは技術要求、研究開発コスト、ソフトウェア・ハードウェアの条件、反復に要する時間などに関係します。各トラックにはそれぞれ特色があり、異なるモデルの異なる側面での能力を反映しています。ランキングチームのプロファイル、異なる技術ルートのどちらが優れているのか?
▎AI科技評論:3つのトラックのいずれでも上位2位に産業派とアカデミア派が名を連ねています。世界モデルのイノベーションにおけるそれぞれの核心的な強みと弱みは何ですか?
主催者:今回の参加チームを見ると、大学と企業は互いに補完し合う強みを持っています。大学のチームは先端アーキテクチャや新しい目的関数を試すことに積極的で、探索が柔軟です。一方、企業のチームは高品質データの蓄積、大規模計算資源の调度(スケジューリング)、システム展開の面で蓄積が多く、エンジニアリング運用もより安定しています。これは今回の大会に対する我々の観察であり、すべてのチームを直接概括するものではありません。大会を通じて、双方が補うべき部分もより具体的になりました。アルゴリズムの革新は実際のエンジニアリングプロセスの中で安定して動作する必要があります。データと計算資源の強みがあっても、正確な物理モデリングと明確な問題定義があって初めて成果に転化できます。研究とエンジニアリング能力を結びつけることで、技術が提案されてから実際に応用されるまでの過程を短縮する助けになります。▎AI科技評論:世界モデルには現在、全体として4つの技術ルートがありますが、今回の受賞チームはJEPA、空間インテリジェンス/構造化4D、ピクセル生成ルートをほぼ網羅しています。ただ、JEPAルートを採るチームの勝率が高いようです:視启未来がTrack 1で1位、晨昏線がTrack 2で2位となりました。主催者として、この結果をどう解釈しますか?
主催者:実際のシステムにおける技術ルートは完全に分かれているわけではありません。ピクセルレベルの自己回帰生成、潜在空間に基づく表現学習(例えばJEPAの思想)、空間トポロジモデリング、明示的物理エンジンは、同一のシステム内で組み合わせて使うことができ、多くの上位チームが採用しているのはマルチモジュールアーキテクチャです。さらに、各チームはモデルのパラメータ量、事前学習データのクレンジング、アクション抽象インターフェース、制御ループの周波数などの面でも差が大きいです。今回の結果は、具身的表現学習についてさらなる研究に値する手がかりを提供しました。▎AI科技評論:これほど多くのランキング変動や大会の進化を見届けてきた中で、世界モデルは現在どの程度発展していると考えますか?最大のボトルネックはどこにありますか?
主催者:今回の大会のテスト結果から見ると、制御された特定のタスクにおいて、最先端の世界モデルはアクションの因果関係に対する応答能力を初歩的に備え、下流のポリシー学習にある程度の支援を提供できるようになっています。しかし、より長時間の複雑なインタラクションや、接触の密集した実ロボット操作においては、世界モデルには依然としてボトルネックが存在します。モデルは、アクションが加えられた後に生じる状態の瞬間的変化を十分に正確かつ持続的に記述できていません。連続予測における微小な誤差は徐々に累積・拡大します。さらに実機では、ミリ秒レベルのアクション遅延や、剛体接触による非線形の力フィードバックにも対処しなければなりません。評価方法の研究を持続的に推進
▎AI科技評論:商宇先生は前回のインタビューで「WorldArenaがモデルの新たなパス依存になることを避ける必要がある」(みんながWorldArenaで高得点を取るために、その指標やタスクに合わせに行ってしまう)と述べられました。2回のチャレンジ大会および日々のランキング更新の実践の中で、実際にこのような依存は観察されましたか?具体的にはどのような現れ方がありますか?
主催者:公開ルールに対する最適化は、ベンチマーク運営において完全に避けるのが難しい現象です。我々が注目しているのは、スコアの向上がモデルの汎用物理能力の改善を反映しているのか、それとも単に特定の指標や特定の種類のタスクへのフィッティングが良くなっただけなのか、という点です。後者の影響を減らすため、主に3つの取り組みを行いました:スコアと実際の物理タスクの成否との相関係数を継続的に追跡し、高得点でも実際の物理能力を反映しない指標を較正すること;シーンとタスクを継続的に増やし、OODテスト分布を拡大し、より多くの複雑な接触タスクを組み込むこと;独立した非公開のブラインドテストセットを保持し、重要なテスト環境を厳重に秘匿することです。▎AI科技評論:WorldArenaの次の段階に一つ目標を設定するとしたら、重点的にどんな問題を解決し、どのような役割を果たすことを望んでいますか?
主催者:次の段階では、モデルの実世界における適用範囲をより明確に評価できるようにしたいと考えています。研究者が世界モデルを手にしたとき、どの物理シーンで信頼できるのか、どんな条件・どのような状況で失敗しやすいのかを把握できるようにする、ということです。より長期的な目標は、WorldArenaがみんなの手法改善を助け、世界モデルの能力が実際のシーンにより良く汎化されるようにすることです。みなさんが集まって交流し、会議の情報を共有しやすいよう、私たちは専用のIROS 2026 参加交流グループ!グループに参加するとこれらの「特典」が解放される?
会議情報ステーション:投稿 DDL、フォーマット規定、審査進捗……重要なノードを第一時間でお届け、もう deadline を見逃す心配はなく、投稿準備も安心。
同業者的お茶会:全国津々浦々の同業者がグループに集まり、心得を語り、アイデアを交わし、人脈を築く、研究の道を共に進みます。
最先端補給ステーション:最新の研究成果や注目分野をリアルタイムで共有、会議テーマに合わせて投稿の流れを整理し、論文のインスピレーションに満タン給油。
現場応援団(会議期間中限定で開放):会場に着いても慌てる必要はありません——
ルートナビ:館内配置や講堂への行き方は、グループでいつでも質問できます;
セッション共読:人気セッションや Keynote の議論、見逃しても後からフォロー可能;
Poster 編集版:現場ポスターのエッセンスをまとめて、ワンクリックで保存し取りこぼしなし;
交流会広場:食事会、インタビュー会、交流イベント……雑談したい、共同研究したい、直接会いたい、グループで募ればOK。
? グループ参加への入り口: QRコードをスキャンしてグループに参加するか、WeChat ID:Luyoyo_2026 を追加し、備考欄に「IROS + 所属機関/学校 + 氏名 + 研究分野」を記入してください。
研究でも技術でも、情報格差は重要です。
さあ、一緒に一歩先を行きましょう!
乗って、世界の AI トップ会議のエッセンスをご覧あれ
独占的に閲覧できます:
専門家講演PPT
大会報告全文
人気論文解説
学術新星インタビュー
上のQRコードをスキャン
するか、「阅读原文」をクリックして専用ページをフォローしてください。
雷峰网(公式アカウント:雷峰网)
雷峰网
雷峰网のオリジナル記事。許可なく転載することを禁じます。詳しくは転載規定をご覧ください。