著者丨馬暁寧
編集丨岑 峰
9月27日、IROS 2026 がピッツバーグで開幕する。31年ぶりに、IROS がこの鉄鋼の街に戻ってくる。世界最大級のロボティクス学術会議の一つである今年、正式プログラムに採択された論文は 1933 本に達した。この約2,000本の論文を広げてみると、それはむしろ2026年のロボット研究の横断断面図と言える:強化学習、模倣学習から、経路計画、視覚認識、運動制御、器用な操作、さらにはヒューマノイド、触覚、大規模モデルに至るまで、ここ数年のロボティクス分野におけるほぼすべての重要な技術路線が、このマップの中に同時に現れている。しかし本当に注目に値するのは、Humanoid、VLA、World Model といった産業界やメディアの注目を集めやすいキーワードではない。1933 本の論文をマルチラベルで整理すると、Robot Learning / Embodied AI 関連の論文は約 809 本、Navigation / Planning は 564 本、Perception / Vision は 556 本、Control / Dynamics は 546 本、Manipulation は 520 本、そして Humanoid / Legged 関連は約 213 本であることが分かる。一つの論文が複数の方向にまたがる場合があるため、これらの数字を単純に合計することはできないが、それらが示しているのは一つの事実である:ロボット研究は、大規模モデルの参入によって、単一の「AI問題」へと再統合されたわけではなかった。それどころか、学習、認識、計画、制御、操作がかつてない密度で交錯している。大注目の AGI 熱狂を背景に、この約2,000本の論文はあるシグナルを発している:大規模モデルは“食い尽くして”はいなかった。それどころか、2年間のエンドツーエンドの疾走を経て、ロボット研究は三次元幾何、記号推論、基盤制御の「中間層ルネサンス」を通じて、ピクセルとトークンに覆い隠されていた物理的な魂をピッツバーグで取り戻そうとしている。」IROS 2026 で本当に問われるべきは、「大規模モデルが従来のロボティクスに取って代わりつつあるか」ではなく、ロボット研究がより複雑なシステム段階に入りつつあるのかどうかだろう。
01
AI は従来のロボティクスに取って代わるのではなく、
再び組み込まれつつある
これらの論文間の交差関係をさらに観察すれば、大規模モデルのロボット参入後に実際に起きた変化は、より明確になる。Robot Learning と Manipulation が同時に現れた論文は約 276 本、Perception と交差するものは 269 本、Navigation / Planning と交差するものは 225 本、Control / Dynamics と交差するものも 221 本ある。学習手法は、ロボットが本来持っていた技術モジュールを単純に押し退けるのではなく、むしろますます深くこれらの伝統的な問題の中に埋め込まれていっている。この変化はまず計画に現れている。ストーニーブルック大学の Jorge Mendez-Mendez は 《PDDLStreamを用いたタスク・モーションプランニングのための大規模言語モデルの体系的研究(A Systematic Study of Large Language Models for Task and Motion Planning with PDDLStream)》 において、大規模言語モデルを従来の Task and Motion Planning フレームワークに組み込んだ後のパフォーマンスを体系的にテストした。研究が示したのは「大規模モデルがプランナーを直接置き換えられる」という方向ではなく、むしろ幾何的制約、運動の実行可能性、実行ロジックには依然として従来の計画体系の関与が必要だということだった。これは非常に代表的な例だ。LLM は「カップをテーブルの反対側に運ぶ」の意味を理解できるが、ロボットが実際に実行する際には、ロボットアームが衝突しないか、関節が届くか、経路が実行可能か、そして現在の環境に変化がないかも答えなければならない。問題は「LLM は Planner を代替できるか」から、両者がどう役割分担すべきかへと変わったのだ。同様の現象は VLA の認識側にも見られる。IROS 2026 Cognitive Robotics 最優秀論文候補にノミネートされた GeoVLA: Empowering 3D 視覚・言語・アクションモデルにおける表現手法(Vision-Language-Action Models)は、天津大学、原力霊機、清華大学のチーム共同で完成されたもので、著者には原力霊機の謝斌、清華大学の石昊らが含まれる。この研究が狙ったのは、既存の VLA が二次元視覚に過度に依存する問題である:従来の VLA は RGB 画像と言語命令から直接アクションを生成するが、実在のロボットが向き合うのは三次元世界であり、物体の高さ、サイズ、カメラ視点の変化がいずれも把掴に直接影響しうる。GeoVLA は単純にモデルを拡大し続けるのではなく、深度と三次元幾何情報を明示的に加え、3D representation と視覚言語特徴をアクション生成に共同で用いた。言い換えれば、大規模モデルが強くなった後、ロボティクス最も伝統的な「空間幾何」が再び補われたのだ。制御側にも同様の現象が現れた。セントラルフロリダ大学、インド工科大学カーンプル校、バース大学、メリーランド大学パーク校のチームによる 遅い基盤モデルを用いた高速なロボットポリシーの学習(Training Fast Robot Policies with Slow Foundation Models)が研究しているのは、非常に現実的な問題である:大規模な Foundation Model はより強力な知識と汎化を提供できるが、推論速度が遅すぎて、ロボットの高周波制御ループ内で継続的に動かすには向かない。そこで研究者らは、大規模モデルを主に訓練に参加させ、実際の実行を担うより軽く、より速いロボットポリシーを学習させた。言語モデルが数百ミリ秒遅れて質問に答えても、ユーザーは通常、反応がやや遅いと感じるだけだが、ロボットが把掴、接触、あるいはバランス保持の際に数百ミリ秒遅れて動けば、タスクはすでに失敗しているかもしれない。モデルの能力とリアルタイム制御は、決して同じ問題ではない。物理世界に近い触覚研究も、同様の方向を示している。コロラド大学デンバー校の方新民らとケネソー州立大学チームが共同で完成させた DexTact:ロボットハンドによる器用的把持のための視覚・触覚基盤モデル(DexTact: A Visuo-Tactile Foundation Model for Dexterous Hand Grasping)は、視覚と触覚を同時にロボットハンドの器用な把掴問題に組み入れた。これが研究しているのはもはや「画像がロボットに物体の位置を伝える」だけでなく、「手が物体に接触した後、システムはさらに何を知覚できるか」である。ここでは、Foundation Model、触覚、器用な操作、制御が同一のシステムの中で理解されている。したがって、2026 年に本当に注目に値する変化は、ロボティクスが AI に取って代わられつつあることではない。より正確に言えば、AI がロボティクス最も伝統的な部分に深く入り込み始めると同時に、これらの伝統的な問題によって再び形作られつつあるということだ。02
VLA は「できることの証明」から「弱点補強」の段階へ
过去两年、VLA の最も核心的な問いが「統一モデルに視覚と言語を理解させ、ロボットのアクションを直接生成できるか」であったとすれば、IROS 2026 に至って研究の重点は明らかに別の方向へ移動している:モデルがすでに「できる」なら、次に解決すべきは、いかに速く、いかに安定して、また実在のロボットにより適合するようにするかである。我々の多ラベル統計では、VLA、VLM、LLM、Foundation Model 関連の論文は約 162 篇で、全論文の 8.4% を占める;そのうち明確に VLA に関わる論文は約 82 篇である。この規模はすでに独立した研究の主流を形成するに足るものである。しかし、それらが注目する問題は「モデルをもっと大きくできるか」にとどまらず、効率、三次元理解、長期メモリ、視点変化、現実環境への適応、安全性などの問題へと急速に分化している。最も直接的な例が Shallow-π:フローベースVLAのための知識蒸留である。この論文は 42dot、ソウル大学、Samsung Research によるもので、IROS 2026 Best Paper / Best Student Paper Award の候補に選ばれている。それが解決するのは、より大きな VLA の訓練方法ではなく、まさにモデルが大きすぎて推論が遅すぎるという問題であり、知識蒸留によって VLA を圧縮し、モデルを実在のロボットやエッジデバイスへの展開により適したものにしている。これは、VLA がロボットに組み込まれた後の最初の現実的制約を露呈させた:モデルは「賢い」だけでなく、十分に速くなければならないのである。もう一つの弱点は三次元空間理解である。前述の天津大学、Force Robotics(原力灵机)と清華チームの GeoVLA は、本質的に VLA にロボティクス最も伝統的な幾何学的能力を補っているのだ。視点変化はそれ自体、すでに独立した問題となっている。AnyCamVLA:視点ロバストなVision-Language-Actionモデルのためのゼロショットカメラ適応 はソウル大学と MIT のチームによるものである。それは、カメラの位置が変わった後、なぜ訓練済みの VLA が容易に失敗するのか、そしてモデル全体を再訓練せずに新しい camera viewpoint へ適応できるのかを研究している。実際の展開では、カメラの設置誤差、ロボットプラットフォームの差異、視点変化はいずれもよくあることであり、固定視点でしか動作できないポリシーは、本当の意味で汎化するのは難しい。長期タスクはさらに別のギャップを露呈させた:モデルはアクションを実行できるが、必ずしも経験を蓄積するわけではない。オープンワールドタスク実行におけるVLAベースエージェントのための長期記憶 は南京大学、早稲田大学、LimX Dynamics(逐际动力)、浙江大学などのチームにより完成されたもので、長期メモリを VLA Agent に直接接続し、システムがすでに完了した軌跡と経験を保存し、その後再び呼び出せるようにする。ここでの問題はもはや一度の把持の成否ではなく、ロボットが長い流れのタスクの中で「前段で何が起きたか」を記憶できるかである。成均館大学からの RoboBRIDGE:ポリシーとロバストな実世界ロボティックエージェントをつなぐモジュラーフレームワーク はさらに一歩進んでいる。それはより強力な VLA を再訓練しようとするのではなく、事前訓練済みポリシーの周囲に Monitor、Perceptor、Planner、Controller、Robot Interface を追加している。実行が失敗した際には Monitor が問題を発見し;環境が変化した際には Planner が再計画し;Perceptor がシーンを更新し;Controller が高レベルのポリシーを実際のアクションに変換する。この構造は、VLA の次の段階で何が起きているかを非常によく示している。研究は「より強力な action predictor を作る」ことから、その周囲に完全なシステムを構築する方法へと転換しつつある。したがって、VLA の今後の競争は scaling だけではないかもしれない。より大きな問題は system engineeringに変わりつつある:一つの VLA が知覚、メモリ、計画、制御、ハードウェアとどのように協調して動作し、最終的にアクションを出力できるモデルから、長期間動作し続けられるロボットシステムへと変わっていくかである。03
ロボットは「中間層」を再び育てつつある
VLA の第一段階が知覚、言語、アクションを一つのモデルに統合する試みであったとすれば、IROS 2026 におけるもう一つのますます明確な研究の系譜は、研究者たちが再びこのエンドツーエンドのチェーンの途中に新たな構造を積極的に導入し始めていることである。1933 篇の論文のうち、Reasoning / Memory 関連の論文は約 119 篇で、全論文の 6.2% を占める;そのうち明確に Reasoning に関わるものは 64 篇、Memory は 36 篇である。それらはすでに Agents and Memory for Robust VLA Manipulation、Constraint-Guided Reasoning for Long-Horizon Manipulation、LLM Agents Reasoning Through Robot Tasks、Representing 3D Space for Robot Reasoning といった非常に明確な Session の一群を形成している。このこと自体が問われるべきである:エンドツーエンドモデルがすでに視覚と言語から直接アクションを生成できるなら、なぜロボットには Reasoning、Memory、Planner、さらには Symbolic Constraint と明示的な 3D representation を再導入する必要があるのか。その一つの理由は、ロボットのタスクが長くなると、「現在のこのフレームで何が見えているか」だけではもはや十分でなくなるからである。TempoFit:ロングホライゾンVLA操作のためのプラグアンドプレイ型レイヤーごとの時間的KVメモリ は西交利物浦大学(Xi'an Jiaotong-Liverpool University)のチームによるものである。それはより大きな VLA を再訓練するのではなく、モデル内部の temporal KV memory を利用し、既存のポリシーが時間を跨いで履歴情報を保存・呼び出せるようにしている。しかし、ロボットが本当に記憶すべきものは「過去に何を見たか」だけでもない。東京理科大学のチームによる GaussMemory:ロングホライゾン・ロボット操作のためのタスク駆動型3Dガウシアンシーンメモリは、Memory をさらに三次元空間に据えた。一つの物体がたとえ一時的に遮蔽されていても、カメラが今この瞬間見えないからといってロボットの「世界」から消えてはならない;すでに移動された物体も、その位置を適時に更新する必要がある。したがって、ロボットにおける Memory は、言語モデルにおけるコンテキストメモリと完全に同じではない。それは実在の三次元空間と継続的に対応していなければならない。推論の問題も同様である。DualCoT-VLA:並列推論によるVision-Language-Actionモデルのための視覚言語思考連鎖 は香港科技大学(広州)と華為(Huawei)の共同チームにより完成された。それは VLA に直接アクションを出力させることで満足せず、アクション生成の前に視覚の Chain-of-Thought と言語の Chain-of-Thought を加えている:一本は空間関係を処理し、もう一本は高レベルのタスクロジックを処理する。元来エンドツーエンドモデルが省こうとしていた「高レベル―低レベル」の分業が、別の形で戻ってきたのである。Cognitive Robotics 最佳論文候補にノミネートされた VL-Nav:推論ベースの視覚言語ナビゲーションのためのニューロシンボリックアプローチは、主にニューヨーク州立大学バッファロー校のチームにより完成され、第一著者は杜燚(Du Yi)である。VL-Nav は視覚言語モデルの意味理解を明示的な空間・記号推論と結合し、複雑な環境における vision-language navigation に用いている。Symbolic 手法が再び現れたことは、ロボティクスが完全にルールベースの時代に戻ったことを意味しない。それが担うのは、大規模モデルがまだ安定して遂行するのが苦手な部分のタスクである:空間関係、実行条件、制約をより明確にすることである。Memory、Reasoning から Geometry、Planner、Symbolic Constraint に至るまで、これらの研究は表面上異なる技術を採用しているが、いずれも同じ構造的問題を解決している:高レベルの意味理解と低レベルの連続的なアクションの間には巨大な隔たりが存在するのである。したがって、IROS 2026 に現れた Reasoning、Memory、Planner、Symbolic Constraint は、「反エンドツーエンド」というよりもむしろ、ロボティクスが大規模モデルと低レベル制御の間の中間層を再び発明しつつあると言うべきである。エンドツーエンドが単純に失敗したわけでも、モジュール化が単純に復活したわけでもない。より正確な変化は:タスクが単一ステップの把持から長時間の操作へ、実験室環境からオープンワールドへと進むにつれ、ロボットシステムに再び階層が現れつつあるということである。04
Manipulation
がエンボディッドAI 最密集の戦場の一つとなる
VLA、Reasoning、World Model がより多くロボットの「どう考えるか」を代表するとすれば、Manipulation はより別の問題に近い:これらの能力が、最終的にどうやって一つの手、一つのグリッパー、あるいは一本のマニピュレータを通じて、物理世界に実際に作用するのか。Manipulation 関連の論文は約 520 篇ある;さらに Dexterous Manipulation、Tactile、In-hand Manipulation、Contact-rich Manipulation などの方向で絞り込むと、関連論文は約 225 篇である。そのうち、明確に Tactile に関わる論文は約 91 篇、明確に Dexterous Manipulation に関わるものは 52 篇である。この 225 篇の Dexterous/Tactile 関連論文のうち、約 165 篇が同時に Manipulation に関わり、79 篇が Learning に関わり、57 篇が Perception に関わり、52 篇が Control に関わる。触覚、学習、知覚、制御が、同一の操作タスクの中で絶えず交差しつつある。IROS 2026 Award Candidate VTAP Gripper:器用な手内操作のための指先センシングと視触覚アクティブパームの融合は、パデュー大学とコロンビア大学の共同チームにより完成されたもので、パデュー大学の胡智嫻(Hu Zhixian)、およびコロンビア大学の黄炳豪、李昀烛らの研究者たち。この研究は、自由度が人間の手にますます近づく擬人化ロボットハンドを追い求める路線を続けず、3本の再構成可能な柔軟な指と能動的な視覚・触覚パーム面を設計し、指先の触覚と掌面の能動的な接触によって把持およびハンド内操作を実現した。ここで最も興味深いのは、高水準の器用な操作が必ずしも極めて高い自由度を持つ擬人化構造に依存するとは限らないことである。機械構造、能動的接触、マルチモーダルセンシングの間の協調もまた、複雑な操作能力を生み出すことができる。もう1つのロボット機構設計賞の候補作は PDS Joint: ロボットハンド向けに特化したパラメトリック二重スパイラル関節で、北京理工大学の5人チームによるものである。彼らはより低レベルの関節構造から着手し、コンプライアント構造、関節剛性、固有受容感覚、学習によるキャリブレーションをロボットハンドの関節設計に共に組み込んだ。VTAPからPDS Jointまでを見ると、ハードウェア自体は依然として収束していないが、ハードウェアもまた、センシング、制御、学習と切り離すことがますます難しくなり始めている。それと同時に、触覚は「センサを1つ取り付ける」段階から「ポリシーに入り込む」段階へと進みつつある。TacVLA: ロバストなVision-Language-Action操作のための接触認識型触覚融合 はパデュー大学とイタリア工科技術研究所の共同研究であり、パデューのチームには徐政通、張志遠らの研究者が含まれる。この研究は触覚をVLAに直接送り込み、実際に接触が発生した際に、触覚情報を動作の意思決定に参与させる。遮蔽や精密な差し込み、あるいはすでに接触が確立されたシーンでは、視覚が提供する情報は急速に低下するからである。もう1つの路線は、展開段階での触覚ハードウェアへの依存を低減しようとするものである。HapticVLA: 推論時に触覚センシングを用いないVision-Language-Actionモデルによる接触豊富な操作 はスコルコヴォ科学技術大学のチームによるものである。彼らは訓練段階では触覚情報を用いてポリシーに接触の知識を学習させるが、推論段階ではリアルタイムの触覚入力への依存を強制しない。TacVLAとHapticVLAはまさに2つの異なる考え方を代表している。一方は触覚をリアルタイムでポリシーに接続し、もう一方は触覚を訓練に利用した上で、触覚の経験を可能な限りモデルの中に圧縮する。データの問題も浮上し始めている。Entertainment and Amusement Paper Awardにノミネートされた PianoFingering-1.5K: ロボットの器用さ学習のための大規模な専門家ピアノ運指データセット は中国科学技術大学のチームによるもので、著者には王若宇らが名を連ねる。彼らは専門家のピアノ運指を構造化されたデータセットに整理した。ピアノ演奏は一見特殊に見えるが、実際には非常に厳しい器用な操作タスクである。すなわち、複数の指が極めて短時間で、正確で連続的かつ強い時間的制約を持つ接触を完成させなければならない。この種の専門家レベルの動作を体系化することは、本質的にロボットの器用な操作に高品質な人間の事前知識を提供することにほかならない。ハードウェアから、触覚、そしてデータへと、いくつもの路線が最終的に同じ問題に収束する。ロボットはどのようにして真の閉ループ操作能力を形成するのか。それゆえ、器用な操作は「より良い手を作る」ことから、知覚—触覚—データ—ポリシー—制御という完全な閉ループの構築へと拡張されつつある。05
ヒューマノイドは「歩ける」から「歩きながら働ける」へと拡張
人型ロボットは過去2年間で産業界とメディアの注目度が最も高かったロボットの形態のひとつかもしれませんが、これを IROS 2026 の論文全体の地図の中に改めて置き直してみると、状況はより抑制的見えるでしょう。統計によると、Humanoid / Loco-Manipulation 関連の論文は約 89 本で、全論文の 4.6% を占めています。そのうち 46 本が Control と交差し、44 本が Learning と交差し、34 本が Manipulation に関わり、32 本が Planning に関わっています。本当に注目に値するのは、これらの論文の内部で扱われる問題が変化しつつあることです。過去数年間、人型ロボットの最重要の技術的進展は、多くが locomotion に集中していました。現在では、「移動」と「操作」を同じシステムの中に組み込む、もうひとつの流れの研究が現れ始めているのが見て取れます。典型的なのは ULTRA:自律型ヒューマノイドの全身移動・操作のための統合マルチモーダル制御。この論文はイリノイ大学アーバナ・シャンペーン校によって何夏麟IROS 2026 の Mobile Manipulation 関連最優秀論文候補に選ばれた。これは、より強力な歩行ポリシーを再トレーニングするものではなく、人型ロボットに物体への接近、把持、搬送、置くといった連続的なタスクを遂行させるものである。ここで最も注目すべきは、ロボットがついに「物を運べるようになった」ことではなく、問題の構造そのものが変化した点である。単純な locomotion では、核心的な目標は身体の安定の維持にある。しかしロボットが手に物を持つと、腕の動作が重心を変化させ、負荷が歩行に影響を与え、足裏の接触、上肢の運動、そして把持タスクが同時に満たされなければならなくなる。「歩くこと」と「操作すること」は、もはや完全に分離できなくなるのだ。SteadyTray: 残差強化学習によるヒューマノイドのトレー輸送における物体バランシング課題の学習 カリフォルニア大学サンディエゴ校のチームによるもので、筆頭著者は黄安倫(Huang Anlun)。この矛盾を非常に直感的なタスクへと拡大している:人型ロボットにトレイを持たせて歩かせ、しかもトレイの中の物体を落としてはならないというものだ。SteadyTray は既存の locomotion policy の上に residual policy を追加し、歩行が末端にもたらす擾乱を専門に処理する。DreamMimic: ワールドモデルによる視覚運動の全身移動操作の学習 上海交通大学に殷杰清華大学のチームとの協力により完成したもので、視覚とWorld Modelをwhole-body loco-manipulationに導入し、予測モデルによってロボットが長時間の視覚制御において状態への理解を維持できるよう支援する。VLAもまた同じ課題に関わり始めている。ビジョン・言語・アクションモデルのための、責任誘導型専門エキスパートによるヒューマノイドの移動操作の学習 ソウル大学のチームによる研究です。この研究は、locomotion と manipulation の動作分布が大きく異なるという問題に取り組み、specialized experts を導入して、異なる専門家に異なる制御責任を担わせています。これは改めて、「汎用」は「内部で何も分けていない」という意味ではないことを示しています。さらに極端な例が、Award Candidate です。 不完全な人間動作データからのアスレチック型ヒューマノイドのテニススキル学習。この研究は清華大学張智楷らを中心に、北京大学、上海人工知能研究所、Galbot、そしてデルフト工科大学の研究者らと共同で完成したものである。テニスでは、ロボットが高速で動くボールを観察し、軌道を予測し、身体を移動させ、ラケットを振りながら、同時にバランスを維持することが求められる。工場での搬送とはかけ離れて見えるが、露呈しているのは同じ問題である:ヒューマノイドロボットは、安定した歩行のセットを持ち、その上に単純に「両手を付け足す」だけではいけないということだ。真のwhole-body intelligenceは、脚・胴体・腕がタスクを中心に共同で動くことを要求する。したがって、IROS 2026のヒューマノイドロボット論文を単純に「Humanoidがますます流行っている」と概括してしまうと、かえって本当の変化を見逃すことになる。より正確な描写は次の通りである:研究の重心は、単なる locomotion から、whole-body loco-manipulation へと拡大しつつある。06
World Modelは注目を集めているが、まだ主流にはなっていない
過去1年間のロボティクス分野での議論の熱量だけを見ると、World Model は「すでに主戦場に全面参入した」という印象を与えやすい。しかし全論文のうち、明確に World Model に関わる論文はわずか19編で、全論文の約1%を占めるにすぎない。「熱」は「多」を意味しない。本当に注目すべきは、World Model の論文がどれだけ出ているかではなく、どのような位置に現れ始めたかである。四足動物の運動、巧緻操作、精密な挿入作業、ヒューマノイドの whole-body control、医療ロボット、そしてナビゲーション。Best Paper / Best Student Paper Award Candidate DAWN: 深度デノイジング・ワールドモデルによるノイズロバストな四足歩行パルクール 韓国技術教育大学(KOREATECH)のチームによるものです。これは四足歩行ロボットに「よりリアルな動画を想像させる」のではなく、World Model を用いてノイズを含む深度知覚をモデル化し、ロボットが実環境でパルクールを完遂できるよう支援するものです。ここでの World Model は、知覚―制御の連鎖における状態モデリングツールとして機能し始めています。巧緻操作においては、汎用身体を横断するワールドモデルを器用なマニピュレーション向けにスケーリングする 由何子浩カリフォルニア大学サンディエゴ校やMITなどの機関の研究者と共同で完成したものである。この研究は、ロボットハンドごとにまったく異なる関節や動作空間を回避し、より一般的な「動作がどのように物理世界を変えるか」という法則を学ぼうと試みている。その背景には、興味深い仮説がある。将来、異なるロボット間で真に共有できるのは、動作そのものではなく、おそらく…行動はどのように世界を変えるのか。ワールドモデルを用いた汎化可能なロボット挿入 その研究はUC San Diego、NVIDIA、ワシントン大学、南カリフォルニア大学のチームが共同で実施したものである。同研究はWorld Modelを精密な差し込みタスクに適用した。ポリシーに「この部品はどう差し込むか」を暗記させるのではなく、研究者はモデルに「自分の動作が現在の状態をどう変えるか」を学習させ、その予測を利用して制御を行うことを目指した。ヒューマノイドロボットになると、先に述べた上海交通大学の殷杰(イン・ジェ)清華チームとの DreamMimic は、さらに World Model を全身のロコ・マニピュレーション(whole-body loco-manipulation)へと進めた。そして RoDyn: ロボティックマニピュレーションのためのインタラクティブなロボット動的2.5D世界モデルの制御 は、南洋理工大学と清華大学の共同チームによるものである。RoDyn は、純粋な二次元動画予測の明白な問題、すなわち「未来の映像がもっともらしく見えることは、物理的な関係が正しいことを意味しない」という問題を解決しようとしている。深度とロボットのダイナミクス情報をさらに導入することで、予測結果をロボット制御に実際に使える状態表現に近づけている。これはまさに、ロボット分野における World Model の最も重要な矛盾を指摘している。ロボットが本当に必要としているのは、視覚的にもっともらしい未来ではなく、動作条件付きで、幾何学的・物理的に十分信頼できる未来である。つまり、今年の World Model をめぐる問いはもはや「ロボットがこう動いたら、未来はどうなるか?」だけではなく、「未来を予測できるなら、この予測によって次の一手を本当に変えられるか?」へと変わりつつある。その意味で、World Model は現時点ではむしろ、世界の予測から制御への参加へと移行しつつある技術路線であり、すでにロボット研究を支配している手法ではない。07
ロボットは「システム問題の時代」へ
これらの研究を並べて見ると、IROS 2026 で最も注目すべきは、ある特定の技術路線が「勝っている」ことではない。VLA は伝統的なプランニングと制御を置き換えておらず、World Model はまだ主流になっておらず、Humanoid もロボット研究全体の地図の一部にすぎない。本当に起きている変化は、これらの新しい手法が物理世界に入ったことで、知覚、記憶、プランニング、制御、触覚、安全性、そしてリカバリーといった問題が再び避けられないものになったということである。言語モデルがここ数年で成功を収めたのは、多くのタスクを一つのモデルに統合したことに大きく由来する。しかしロボットは違う。ロボットは「理解」するだけでなく、実際に行動しなければならず、物理世界は誤差、遅延、接触、失敗をすべて露呈させる。だからこそ、IROS 2026 はむしろ新たな問いに答えているといえる。すなわち、モデルが十分に強力になった後、これらの能力をどう組み合わせて、本当に機能するロボットシステムを再構築するのか。これはエンドツーエンドが失敗したことを意味するのでも、伝統的なモジュールが再び主導権を握ったことを意味するのでもない。より正確に言えば、ロボットは大規模モデル、プランニング、制御、ハードウェアの間の境界を再び探り始めているのだ。今後の競争は、誰のモデルがより大きく、より多くの能力を持つかという比較ではなく、誰がこれらの能力を本当に安定して組み合わせられるかにあるかもしれない。ロボットがますます賢くなると、本当に難しくなり始めるのは、いかにしてミスをさせないかである。皆さんが集まって交流し、会議の情報を交換しやすいよう、私たちは専用の IROS 2026 参加者交流グループを作りました!グループに参加すると、次の「特典」が手に入ります?
会議情報ステーション:投稿 DDL、フォーマット規定、審査の進捗……重要な節目をいち早くお届け。締め切りを逃す心配もなく、投稿準備は万全です。
同業ピアチャット:各地の同業研究者がグループに集まっており、経験を語り合い、アイデアを交わし、人脈を築けます。研究の道をともに進みましょう。
最先端補給ステーション:最新の研究成果やホットな研究方向をリアルタイムで共有。会議テーマに沿って投稿の流れを整理し、論文のひらめきに燃料を満タンにします。
現地サポートチーム:(会議期間中限定で開始):会場に着いても慌てる必要はありません——
ルートナビ:館内配置や講堂への行き方は、グループでいつでも質問できます;
セッション共読:人気の session や Keynote の議論も、逃しても後から追えます;
Poster 編集:現地ポスターのエッセンスをまとめて、ワンクリックで保存すれば見逃しません;
集まり広場:食事会、取材、交流会……おしゃべりしたい、協力したい、直接会いたいときも、グループで呼びかければ成立します。
? グループ参加入口: QRコードをスキャンしてグループに参加するか、WeChat の Luyoyo_2026 を追加し、備考欄に「ECCV + 所属機関/学校 + 氏名 + 研究方向」を記入してください。
研究でも技術でも、情報格差は重要です。
さあ、一緒に一歩先を行きましょう!
乗車して、世界のAIトップ会議のエッセンスを一緒に見て回ろう
独占的にご覧いただけます:
専門家講演のPPT
大会レポート全文
人気論文の解説
学術新星へのインタビュー
上のQRコードをスキャンするか
「阅读原文(原文を読む)」をクリックして、雷峰網(公式アカウント:雷峰網)の専区をフォローしてください。
雷峰網のオリジナル記事です。許可なく転載することを禁じます。詳細は転載に関する注意事項。