雷峰网 AI

ウー・ジャージュン(吴佳俊)IROS 2026 講演:構造化表現は答えではなく、ロボットが推論を学ぶための足場 | IROS 2026

構造化表現からデモなし学習への道。 作者丨 吴思梦 編集丨岑 峰 1枚の皿、1つの蛇口、小さな青い食洗剤の塊。ウー・ジャージュンは、このようなほとんど技術的要素のないキッチンのシーンから、IROS 2026 での講演を始めた…

構造化表現からデモなし学習への道。

    作者丨吴思梦

編集丨岑 峰

                                                                                                       

1枚の皿、1つの蛇口、小さな青い食洗剤の塊。ウー・ジャージュンは、このようなほとんど技術的要素のないキッチンのシーンから、IROS 2026 での講演を始めた。学生が食洗剤を絞り、蛇口を開け、洗いかけのまま、その場を離れた。今度は、ロボットが引き継ぐ番だ。一見すると、タスクは明快だ:皿をきれいに洗い、元に戻す。しかしロボットが本当に処理すべきなのは、「皿を洗う」という3文字ではない。まず、目の前のどれが皿なのかを知らなければならない。その皿が本当に汚れているのかどうかを知らなければならない。皿の上にあの小さな青い食洗剤の塊があるかどうかに気づかなければならない。さらに、蛇口が今すでに開いているかどうか、皿がすでに洗われたものかどうか、そして皿を持ち上げた後、テーブルの上に新たな問題が露呈していないかも知らなければならない。同じタスクでも、初期状態が変われば、答えはまったく異なりうる。皿がすでに洗われていれば、もう洗う必要はない。食洗剤がなければ、先に少し絞らなければならない。皿の下に汚れがあれば、「皿をきれいに洗う」ことはもはや皿を棚に戻すこととは等しくなくなる。人間はこれらの変化に直面しても、複雑な推論をしたとはあまり感じない。ただ一目見て、作業を続けるだけだ。しかしロボットにとっては、毎回の「一目見て続ける」の裏にひとつの問題が隠れている:ロボットは目の前の世界をいったい何として理解したのか?9月27日、IROS 2026 の開幕当日、スタンフォード大学コンピュータサイエンス学部の助理教授であるウー・ジャージュンは、RoBoWoMo ワークショップで《Building Physical Agents via Structured Representations》と題する招待講演を行った。過去数年、彼は画像から視覚の背後に隠れた世界を復元する方法を研究してきた:幾何、材質、物理的特性、そして物体間の関係である。今、これらの問題がロボットが本当に生きる物理世界に置かれると、別の問題が浮かび上がってくる。ロボットはタスクをどんな方法で記述すべきか?これらの記述は自分で学習できるのか?訓練データに一度も現れたことのない物体に直面したとき、モデルはいつ追加訓練を必要とするのか?もし計画そのものが学習できるなら、従来のプランナーはまだ必要なのか?最後には、問題はもはや「ロボットは人間のやり方を見たことがあるか」ではなくなる。デモがなく、テレオペレーションのデータもなく、さらには一度も見たことのない蛇口に直面したとき、ロボットはまだ自分で考え出せるだろうか:それはどんなふうに使われうるのか?以下は、ウー・ジャージュンが IROS 2026 で行った講演の編集版である。雷鋒網(公式アカウント:雷鋒網)・AI 科技評論は現場の英語講演に基づいて編集し、原意を変えない範囲で口語表現や技術用語を整理し直した。

▎構造化表現による物理エージェントの構築

講演者:ウー・ジャージュン、スタンフォード大学コンピュータサイエンス学部助理教授(心理学部助理教授を兼任)

01


1枚の皿が、なぜロボットを難しくさせるのか

今日お話ししたいのは、構造化表現を使って、物理世界で行動できるエージェントをどう構築するかということです。まず視覚から始めましょう。結局のところ、あなたが見ることができるのは画像だけで、画像の背後にはひとつの世界全体が立っています:幾何、材質、さまざまな物理的特性です。私たちの研究の主軸はずっと、これらをどの程度復元できるのかということでした。そして一度それらを復元できれば、この世界を再び作り出すことができます。ここ数年、もうひとつ非常に活発な分野として、デジタル空間内のエージェントがあります。それらは命令を受け取り、世界全体と相互作用します。これから自然に浮かぶのが別の問いです:物理世界には同じような構造があるのではないか?デジタル世界では、ディレクトリがあり、その中にファイルがあり、ファイルには属性があります。物理世界では、シーンがあり、シーンの中に物体があり、物体にも属性があります。では、この構造を利用して、あのエージェントたちをデジタル空間から物理空間へと連れてくることができるでしょうか。これが今日の講演のテーマです。しかし、本当にロボットを人間と同じ世界に住まわせようとすると、事は難しくなります。この世界は複雑で、動的であり、多様でもあり、大量の異なるタスクを処理しなければなりません。もちろん基盤モデルを使うべきです。それらは今どんどん強くなっており、使わないではいられないほど強力です。しかし、その使い方はいろいろありえます:追加訓練を行うか、より多くの構造を導入するか、追加の知識を接続するか、接続した後どう既存の部分と結合するか。これらはすべて未確定の選択です。さらに、ロボットに特に関係し、デジタル世界と大きく異なる点があります。デジタル世界はかなり言語によって統一されていますが、ロボット側は別の様相で、異なる分野、異なるタスクの多くは専用のシーン、専用のデータであり、ロボットごとに異なります。これらのデータは、大規模モデルの訓練に使われたあの膨大なコーパスには現れません。だから問題はこうなります:どうやってこの壁を越えるか。抽象的な話が長くなりましたので、まったく専用ではないシーンから見てみましょう。ごく普通のキッチンの光景です。このようなシーンでさえ、ロボットシステムが本当に人間と一緒に作業するには何が必要かを見てみます。学生が皿に食洗剤を絞り、蛇口を開け、それから用事ができて離れました。今度はロボットがやります。もちろん最初に意味レベルの推論をしなければなりません:この山積みの陶器の食器の中で、どれが私が洗うのを手伝うべきものか?この皿です。このステップは今日、視覚モデルで行うのは比較的容易です。次に、この皿を洗うべきだと理解する必要があります。食洗剤はすでに絞られ、蛇口はすでに開いています。だから私がやるべきことは、皿を持ち上げて、洗って、棚に置いて、蛇口を閉めることです。一見非常に明確です。しかし本当に難しいところは:どうやって異なる環境、異なる物体、異なる目標の間で一貫性を保つかです。この非常に単純なシーンの中でさえ、まったく異なるいくつかの状況が生じます。1つ目は、他人の行動に適応することです。たとえば誰かが入ってきて、皿を洗い、テーブルに戻したとします。このときあなたは、皿はすでに洗われたので、もう一度洗う必要はないと知っていなければなりません。やるべきことはただ戻すだけで、蛇口を閉める必要もありません。すでに閉まっているからです。2つ目は、初期状態のごくわずかな違いです。すべてが前と同じで、唯一の違いが皿の上に食洗剤がないことだとします。画像全体を見ると、この違いは非常に小さく、それはただの小さな青い塊で、非常に見分けにくいものです。しかしこれは「わずかな違い」と片付けられるものではありません:状態表現上の定性的な違いです。皿に食洗剤がついていなければ、洗ってはならない可能性が高く、直接洗うと大混乱になります。先に食洗剤をつけて、それから洗い、棚に載せ、残りの作業を終える必要があります。入力の違いは小さくても、状態の違いは定性的であり、行うべき動作もまったく異なります。3つ目は、絶えず更新される観測に従って動くことです。たとえばロボットが皿を持ち上げて棚に置き、それで十分です。すでにきれいで、蛇口を閉める必要もないからです。しかし皿の下に汚れが押し付けられていました。このとき、もし私の目標が本当にすべてをきれいにすることなら、テーブルを拭くべきだと気づかなければなりません。誰もそう指示したことはなく、新しい観測に従うことで理解したのです。理想的には、その皿のものも戻すべきです。しかしそのステップすらできません。ロボットの本体と習得しているスキルがそれを制限しているからです。つまり、これらすべての異なる状況に適応できる必要があります。問題は、どうやってそれを実現するかです。

02


もしロボットにも言語が必要なら

過去数年、私たちはひとつのパラダイムを模索し続けてきました。その具体的な実装は変わり続けています。基盤モデルが変わり、さまざまな可能性も変わるからです。しかし骨格はずっとこうです:一端は生入力、動画または言語。中間は基盤モデルによって組み合わせ性を持つ一組の抽象を発見させる。これらの抽象は再利用でき、再組み合わせでき、汎用的なタスクに対応できる。もう一端は制御動作で、できれば自ら発見し、自ら学習したもの。動作の学習に関しては、いわゆる自然監督から学ぶことを目指しています。つまり、プロセス全体が学習され、発見されたものであり、人間の関与は少ないほどよい。与えるのは動画の断片、デモ、あるいはいくつかの言語だけで、今やこれらの入力自体が処理できるようになっています。監督が軽いほど、汎用性は高くなります。しかしこう描くと、一連の問題が紙の上に浮かび上がります。これらの組み合わせ的な抽象はどんな姿をしているのか?どう発見されるのか?タスクを記述するあの専用言語はどこから来るのか?そもそもそれが必要ないとしたら?計画はどう解決すべきか、従来のタスクプランナーを使うのか、それともプランナーを学習するのか?そして、この世界モデル自体を、そのまま使うのか、ファインチューニングや追加訓練をするのか。これらは道沿いに異なる実装があり、私たち自身も異なるバージョンを試してきました。まずは高レベルから全体的な構造を説明します。最も初期のバージョンは2年前に作ったもので、当時の具体的な部品は今よりずっと粗雑でしたが、パラダイムはすでに明確でした。あなたが一組のデモを持っているとします。ロボットにその場で多くの異なるタスクを実行させてもよいし、プロセス全体からキーポイントを抽出できます。たとえば第1ステップでボウルをつかみ、第2ステップで蛇口の下に持っていって流し、第3ステップで棚に置く。あるいは別のものでもかまいません。動画データでもよい。要するに手元にそうしたデータがあるのです。目標は、このタスクの背後にある一連の記述を学習することです。これは一組のシンボリックな世界モデルのようなもので、大まかに2つのモジュール群があります。第1のグループは、あなたが関心を持つ属性と空間関係です。この物体は汚れているかどうか、汚いかきれいか。この2つの物体の間はどういう関係か、2次元の関係か、3次元の関係か。この種のものが判定できる必要があり、これが一組の述語です。判定はもちろん人間がルールを書くのではなく、ネットワークや基盤モデルで学習させます:汚れているかどうかであれ、ある種の空間関係であれ、任意の述語の組を判定できるようにする。第2のグループは動作です。原子動作の一組、たとえば「洗う」を持っています。各動作には前提条件と事後効果を明確にしなければなりません。洗うという動作は、先に物を手に持っていなければならず、人間が今キッチンにいなければならない。効果は、この物体に食洗剤がついていれば、きれいになるというものです。では、ロボットの手に物が握られているかどうかをどう知るか、物体がきれいか汚いかをどう知るかは、先の述語のグループに判定させます。同時に、動作を本当に実行するには、つまり関節をどう動かすかについてのポリシーも必要です。この部分も同様にニューラルネットワークで、各原子動作に1つの拡散ポリシーを対応させます。こうして、シンボルの層が組み合わせ性を定義します:前提条件がすべて満たされさえすれば、これらの原子動作は連鎖でき、より長く、より複雑なタスクへとつなげられます。そして知覚と制御はすべてニューラルネットワークが行っています。しかしある意味で、これはまさにひとつの専用言語、ドメイン固有言語(DSL)です。すると根本的な問題が立ちはだかります:最初は、これらは人間が手書きするか、PDDL などから直接持ってきたもので、DSL は固定されていました。では、それは十分汎用的なのか?なぜそれで十分なのか?もし抜け落ちているものがあったらどうするのか?だから次のステップは自然と:DSL 自体も学習可能にすることです。基盤モデルに手元のデータを見させることができます。デモ動画でも、操作記録でも、言語でもかまいません。そして「これが私たちが関心を持つタスクだ」と伝え、次にそれに出力させます:私は次の属性が重要だと考える、次の原子動作、そしてその前提条件と事後効果が重要だと考える、と。では、もし間違えたら?検証もできます。一方ではシンボリックに検証でき、他方では直接データで検証できます。たとえばシステムが、洗う前には必ず先に手に持たなければならず、さもなければ洗えないと言ったとします。ならば、自分のデータを振り返って確かめればよい:私が物を洗うたびに、本当にすべて先に掴んでいたか?手元のデモやその他のデータ、公開のものでも専有のものでも、この仕様を検証するために使えます。つまり、この言語自体も別のシステムによって提案されたものなのです。昨年、この部分を話したときはかなり乱雑でしたが、今年はもう少しましなことを願っています。良い類比でずっと明確になることに気づいたからです。その類比は皆さんのコンピュータの中にあります。コーディングエージェントに「これを作って」と貼り付けると、10ステップも8ステップも自分でやり遂げます。第1ステップでファイルを作成し、第2ステップで何らかの操作を実行し、一歩一歩進んでいきます。さまざまなステップがあるのです。よく考えると、これは私たちのやろうとしていることに非常に似ています。私たちのやることは、本質的に Cursor のようにコンピュータ上で作業するエージェントを物理空間へ持ち込むことです:まず一連の計画を考え出し、次にその一連の動作を実行すると同時に、検証の層もあって、これらの動作が正しく定義され、正しく実行されたことを確認する。基本的にはそういうことです。

03


見たことのないものに出会ったとき、モデルはどうするか

次に、いつポストトレーニングに取り組むべきかについて話します。もちろん、先ほどの類推のように、フロンティアモデルをそのまま最後まで使うのが最も手間がかかりません。しかしロボット側には避けて通れない問題があります。扱う対象は、おそらくこれまで一度も見たことがないものだということです。物理世界はデジタル世界よりはるかに分断されているからです。ある見た目の物体を見たことはあるかもしれませんが、より一般的なのは、あなたの工場にしかない、他所には存在しない生産ライン用の部品が手元にあるという状況です。私はこの部品を見たことがないのに、それが汚れているかどうか、ある効果が生じたかどうかを判断しなければなりません。このとき、公開されているフロンティアモデルをそのまま使うことは明らかにできません。なぜなら、「この部品が良品か不良品か」という定義すら知らないからです。ですから、確かにポストトレーニングを少し行う必要のある状況は存在します。ただし、既製のフロンティアモデルだけに頼らないと決めた場合の話です。ではどうするか。一点注意すべきことは、これらの効果は論理的に見えても、たとえば体に洗剤が付いていて、洗えばきれいになるというように、実装のレベルでは近似として書かれており、論理演算は最終的に多確率の形で存在するということです。つまり、チェーン全体をつなげることができます。私はこのものに洗剤が付いていると言い、洗えばきれいになるはずだと。しかし、もし「洗剤があるかどうか」の判別基準が良くなかったらどうでしょう。これは見たことのない新しい物体ですから、判別できず、出力が間違いになり、その後に続くすべてが間違いになります。そしてこのとき、私のデモンストレーションは別の事実、つまりこの物体が確かにきれいになったことを教えてくれます。こうしてラベルが得られます。すべての実行ステップが微分可能に積み上げられているので、このデモンストレーションからの実行ラベルを使って逆伝播を行い、モデルに教師信号を与えることができます。したがって、ポストトレーニングは一部の状況で実行可能です。必須ではありませんが、これらのモデルをシステム内のモジュールと見なし、そのモジュールがポストトレーニングを必要とするなら、この道は開けています。2年前の一連の結果については詳しく話しませんが、あの部品群は今や時代遅れに見え、方法を変えた後で振り返ると、当時はいたるところで拙いことをしていたと感じます。しかし、そのパラダイム自体の可能性は非常に大きく、私たちはその後、中の異なる部品をそれぞれより現代的なバージョンに置き換えていきました。ちなみに、あの研究当時のポスドクの一人は今シンガポール国立大学の教授になっており、もう一人の共同研究者は当時MITの博士課程の学生でしたが、今では教授になりました。

04


計画までも、モデルに任せ始める

次に、より最近の進展をいくつか話します。少し速めに進めます。先ほど、あのシステムのモジュールが層をなして育っていったこと、検証・知覚・制御はすでにニューラルネットワークに委ねられたことを話しました。しかし、まだ委ねられていないものが一つありました。計画です。すべてのモジュールが揃い、状態の検証もできたなら、洗うのが先か、それとも別のことを先にすべきか。この段階では依然として伝統的なもの、すなわち伝統的なタスク計画の系譜から来たものを使っていました。そしてつい最近、この部分も置き換えることに特化した研究を投稿したばかりです。だから今日、満足のいくスライドがないのです。本来なら動画があってしかるべきで、私は本当に動画を望んでいました。ですから楽観的に言えば、数日後には素敵な動画ができるはずです。今は論文中の図一枚でごまかすしかありません。この考え方はこうです。あなたは依然として一組の状態を持ち、それらはニューラルネットワークが検証します。しかし「現在の状態が与えられたとき、洗うのが先か、皿を取るのが先か、それとも何をすべきか」という判断を、もはや伝統的なプランナーに任せるのではなく、ネットワークに任せます。もう少し具体的に言うと、あの一連の述語は今や基本的に自然言語、本物の自然言語であり、自然言語と画像を一緒にプロンプトとして基盤モデルに与え、計画をさせます。しかしそれもポストトレーニングが必要です。ですからここでは、オープンウェイトのモデルを使わざるを得ません。ポストトレーニングに手を付けるからです。同時に、画像を入力の一部にするため、画像を扱えるモデルも必要です。そして結果として、一部のオープンソースモデルの視覚推論能力は依然として非常に低く、少なくとも私たちの測定では同期間のクローズドソースモデルに遠く及ばないことが分かりました。したがって、そのまま使うと、まったく筋の通らない出力をすることがよくあります。実際には、いくつかのモデルを選び、やはりポストトレーニングを行いました。こうして、プランナーそのものまでもがポストトレーニングされ、学習された存在になりました。それはこの種の記号的な自然言語を利用して計画を行え、生成される動作系列の実行可能性がはるかに高くなります。そして、この種の長時間タスクにとっては、これは必要な人間の介入が大幅に減ることを意味します。ここにはもう一つの課題があります。これらすべてがスキルライブラリを条件としており、ロボットごとにスキルライブラリが異なる可能性があることです。どんなフロンティアモデルを直接使っても、あなたのスキルライブラリの文脈を持っていません。たとえば「今すぐ蛇口でこのマグカップに水を満たしてください」と言うかもしれませんが、蛇口はそもそも開いてすらいない。その動作は実行不可能です。しかしポストトレーニング後は、プランナーがこの種の長時間操作に直面したとき、実際に実行可能な動作を提示するようになります。数日後には動画を用意しますので、今日はまず最新の結果をちらっと見ておいてください。ここまで、私たちは手元にデモンストレーションがあることを暗黙の前提としてきました。動画のデモンストレーションであれ、人間の操作であれです。次に、残りの時間で話したいのは、デモンストレーションがなかったらどうするのか、ということです。もし、まったく見たことのない新しい物体に出会ったらどうでしょう。従来のやり方は、一回デモンストレーションしてもらい、この物体とどう付き合うかを教えてもらう、というものでした。しかし、デモ動画も人間の助けも一切なしに、自分でこの物体との付き合い方のさまざまな可能性を考え出すことは可能でしょうか。たとえば目の前に一批の新しい物体があるとします。蛇口については、以前あなた方に開け方をデモンストレーションしました。しかしこの蛇口は私は一度も使ったことがない。それとどう相互作用できるかの可能性を示すサンプルを生成できるでしょうか。これも私たちが探索している研究の一つです。まず大まかに形式化しましょう。手元に静止した物体が一つだけあるとします。蛇口、あるいは箱です。これらの単視点の静止物体から分布を学習し、その分布から可能性空間をサンプリングするシステムを学べるでしょうか。蛇口を与えれば回せる形をサンプリングし、箱を与えれば開閉や、それらのさまざまな形をサンプリングする。具体的な方法は今日は皆さんの時間を尊重してざっと流します。しかし結果はこうです。このシステムを学習すれば、まったく新しいシーンに入り、さまざまな物体の上で、一つのモデルが可能な相互作用の仕方を推論できます。モニター、USBメモリ、花、何でもあります。しかも、その出力は丸暗記した答えではなく、学習した分布の中の最も素朴な事柄、つまり「この物体に他にどう取り組めるか」を使ったものです。では現実の世界ではどうか。ロボットが部屋に入ると、その知覚は非常に汚いものです。そこで私たちがさらに行ったのは、学生にiPhoneで部屋をスキャンさせることでした。iPhoneは確かに三次元スキャンができますが、精度は高くなく、スキャン結果は非常にノイズが多く、ぶよぶよの、面の塊のようなものです。この極めてノイズの多い結果を入力としてシステムに与えても、なんとゼロショット的な汎化の様相を呈することが分かります。食洗機、冷蔵庫、電子レンジに対して、それとどう付き合えるかを推論できるのです。これはロボットにとってはるかに有用です。なぜならロボットは見たことのない部屋に入ることになるからです。入力があれほど粗くても、「この特定の蛇口は見たことがないが、それとの付き合い方をさまざまに推論でき、異なる取り組み方を想像でき、それを使ってポリシーを発見できる」と言えるのです。オフィスの部屋も同じ状況で、再構成結果は同様にぶよぶよでしたが、ノートパソコンとの付き合い方を推論できました。しかしこの推論にはまだ一つ問題があります。この物体との40の相互作用の仕方を提示できるのですが、あなたは本来ある目標を達成しようとしており、その40のうちどれが本当に役立つかを知りません。そこで私たちは、このパラダイムに言語条件を付けられないか、そうすればよりうまく活用できるのではないかと考えています。たとえば静止シーンがあって、そこに「子どもがシーソーに飛び乗る」という一言を与える。動く三次元シーン、あるいは四次元シーンを生成できるでしょうか。そうすれば中には人と物体の相互作用があり、子どもが飛び乗った後の両側の動きがあります。これははるかに有用です。なぜなら、次の問いを続けて立てられるからです。ロボットはこの物体とどう相互作用すべきか。そして生成するのです。この方向にもあの方向にも生成でき、本当に問題を解決してくれる動作を選び出せます。どうやって実現するか。やはり大量の事前学習済み生成モデルに頼ります。この研究では、主に動画拡散モデルを重用しました。 この静止シーンが手にあるとします。非常に汚くても構いません。どんな状況でも、これを数千個の点などの中間表現に変換でき、さらに時間というもう一つの次元を加えられます。こうして四次元表現が得られます。しかし三次元をそのまま四次元に上げただけでは静的なままです。どうやって動かすのか。ここに一つの方法があります。静止した形状しかなく、それをよりリアルにしたい場合、人々はスコア蒸留サンプリング(SDS)という技術を使います。通常の三次元でのやり方はこうです。形状をレンダリングして異なる視点の動画を得て、それを動画拡散モデルに送り、それを使ってこの表現を時間方向に前へ更新します。同じことを四次元でも一度行えます。実践的には非常に難しく、山ほどある問題に対処し、四次元表現上でデータ構造の設計もしなければなりません。しかし概念的には、こうして動画モデルと事前学習済み拡散モデルでガイドを受け、リアルな人と物体、あるいはロボットと物体の相互作用系列を作り出すのです。結果をもう二つ挙げます。たとえばレンガが一つあって、「ロボットがレンガを持ち上げている」という一言を加えると、ロボットがレンガを持ち上げる相互作用系列が生成され、異なる言語条件のもとでこの相互作用がどんな姿になるかを見せてくれます。そこに無料のデモンストレーションを付け加え、その無料のデモからスキルを学べます。以前は、スキルを学び計画につなげるには、まず人間の操作動画やテレオペレーションのデータが必要でした。今では、人間のデモンストレーションすら不要で、自分でデモンストレーションを生成し、それからスキルを学び、学び終えたら元の訓練フレームワークに戻せます。これはロボットに必ずしも使う必要はありません。バスケットボールがリングに当たって跳ね返る、猫がクッションに飛び乗る、これらもすべて可能です。しかし私たちは確かにそれをロボットに応用しました。たとえば布が一枚あります。「人間がこの布と相互作用し、この布を広げる系列を生成せよ」と言う。左側が生成されたものです。生成されたものですから、一批の無料のデモンストレーションが手に入り、しかも布の上の点の三次元における稠密な軌跡を、時間に沿って三次元で追跡して取得できます。これらのものは一組の無料の教師目標となり、ロボットに「この物体をこのように動かしたい」と知らせます。右側は同じことを試みる実物のロボットです。想像から出発し、拡散モデルにガイドさせ、その出力を成功の目標とすることで、これを行うポリシーを学びました。もう一つの例はノートパソコンを閉じることです。最近さらに取り組んでいるのは、これを大幅に速くすることです。なぜなら、この種の方法では、拡散ユニットと付き合う限り遅く、四次元でスコア蒸留を行えばさらに遅いからです。そこで私たちはキャッシュを使い、セマンティックレンダリングも使い、一度の成功更新の割合を上げて、動画モデルをそれほど頻繁に呼び出さずに済むようにしました。これにより、より長い時間的スパンのデモンストレーション系列を生成できます。以前は一本のデモンストレーションしか生成できず、ロボットがレンガを持ち上げる、あるいはノートパソコンを閉じるといった、アトミックスキルを学ばせるものでした。今これはまだロボットではありませんが、ロボットにできない理由はなく、非常に長い時間的スパンのインターリーブされた系列を生成でき、まったく異なることを行えます。こうして得られるのは、アトミックスキルの無料のデモンストレーションだけでなく、複雑な長時間操作問題の無料のデモンストレーションであり、スキル訓練にほぼ無限のデータを提供できます。さて、ここで止めます。

05


構造は答えではなく、足場である

振り返ると、私たちがずっと話してきたのは、こうした構造化された表現をどう見つけ出すかです。時間が経つにつれ、この種のものがどんどん増えていることが分かります。今やほぼすべての部品が揃いましたが、それでもあの中間表現の層は残しています。それは今やほぼ言語の形で存在し、もちろん背後にはシーン表現が対応しており、これによってシステム全体が解釈可能になっています。

私たちはずっと、これをより汎用的にするにはどうするか、既存の物体や既存のデモンストレーションに縛られないようにするにはどうするかを考えてきました。

「構造」という言葉について、もう少し付け加えさせてください。他人が構造の話をするとき、それを別のこと、つまり構造をシステムに強制的に押し込むことと理解しがちです。そうすることは良くなく、私たちのやっていることでもありません。私たちが考えているのは、この層のインターフェースを使って、システムがより効率的に学習できるよう助けられないかということです。それは外部の足場のようなものであり、同時に人間がそれとコミュニケーションできるようにもしてくれます。根本的には、あなたはデータが豊富なモダリティ、特に動画、さらに言語、そして入手できる三次元と四次元を利用しているのです。しかし最終的にあなたが関心を向けるべきは、もう一つのこと、これらの構造化された表現がどうやって私たちに推論能力を持たせるかです。あなたはアトミックレベルの表現を持っています。洗える、置ける、これらのことができる。では次のステップは、これらのタスク間の依存関係は何か、その影響は何かです。長時間の問題を、しかも非常に汎化されたやり方で成し遂げさせるのは、まさにこれです。ご清聴ありがとうございました。

皆さんが情報交換や会議情報の共有のために集まれるよう、私たちは専用の IROS 2026 参加交流グループを立ち上げました。参加すると次の「特典」が手に入ります?

  • 会議情報ステーション:投稿 DDL、フォーマット規定、審査進捗……重要な節目をいち早くお届け。もう締め切りを見逃す心配はなく、投稿準備も安心です。

  • 同業界お茶会:全国各地の同業界の人々がグループに集まり、心得を語り、考えを交わし、人脈を積み重ねます。研究の道のりを私たちと共に歩みましょう。

  • 最先端補給ステーション:最新の研究成果やホットな研究方向をリアルタイムで共有し、会議テーマに沿って投稿の流れを整理し、論文のインスピレーションを満タンにします。

  • 現地サポーターチーム:(会議期間限定で開始):会場に着いても慌てる必要はありません——

    ルートナビゲーション:館内配置や講堂への行き方は、グループでいつでも質問できます;

    セッション共読:人気のセッションや基調講演の議論は、見逃しても後から追えます;

    ポスターまとめ:現地ポスターの精華を整理し、ワンクリックで保存して見逃しません;

    企画広場:食事会、取材会、交流会……おしゃべりも、共同研究も、オフ会も、グループで呼びかければ成立します。

? 参加グループへの入口: QRコードをスキャンしてグループに参加するか、WeChat ID「Luyoyo_2026」を追加し、備考に「ECCV + 所属/学校 + 氏名 + 研究分野」と記入してください。

研究でも技術でも、情報格差は重要です。

さあ、一緒に一歩先を行きましょう!

乗車して、世界のAIトップカンファレンスの精華をご覧ください

独占的に閲覧できます:

専門家講演PPT

大会報告全文

人気論文解説

学術新星インタビュー

上のQRコードをスキャンするか

「読み原文」をクリックして専用ページをフォローしてください。

雷峰網のオリジナル記事です。許可なく転載することを禁じます。詳細は転載に関する注意事項。

原文の出典

雷峰网 AI

内容について

原文の公開と権利は出典元に帰属します。

機械翻訳 · 原文をご参照ください