雷峰网 AI

至簡動力 冯宗宝:隙間がわずか0.5ミリメートルの実際の状況下で、ロボットがロボットを作ることを実現 | IROS 2026

具身知能が実験室から実際の工場へ、精密製造へと進む。 著者|邓哲敏 編集|齐铖湧 ロボットが工場に入り、ロボットを組み立てるために必要な部品を自ら作ることができるかと思ったことはあるか? これは冗談のように聞こえるが、実際には具身知能の最も難しい実装課題である。ロボットの関節、クランプ、精密構造部品は、CNC(コンピュータ制御)旋盤やフライス盤で一つ一つ加工されていく…

具身インテリジェンスは実験室から実際の工場へ、精密製造に向かって進んでいく。

著者|邓哲敏

編集 | 齊銗湧

                                                                                                       

ロボットが工場に入り、ロボットを作るために必要な部品を自ら製造できるかどうか、考えたことがありますか?これは冗談のように聞こえますが、実際には具身知能の最もハードな実現課題です。ロボットの関節、カップリング、精密構造部品は、すべてCNC(コンピュータ制御工作機械)の旋盤やフライス盤で一つ一つ加工されています。もしロボットがこれらの機械を自ら管理し、工件の掴み取り、供給、挿入、取り出し、配置を完遂することができれば、ロボット産業はロボット自身によって支えられることになります。ロボットが多ければ多いほど、ロボットを作る能力が高くなり、コストが低くなり、正のフィードバックループが形成されます。しかし、これを実現するのは想像以上に難しいです。ロボットを作るために必要な部品は、精度要求が最も厳しいものです。工件とカップリングの間の隙間は通常0.5ミリメートルしかなく、反射する金属表面、ほぼ無地の外形、似たような形状の部品が、ロボットの視覚、触覚、全過程の精度に挑戦します。実験室での美しいデモンストレーションも、ここでは公差、タイムラップ、良品率という三つの障害を越えなければなりません。2026年9月29日、アメリカ・ピッツバーグで開催されたロボット学のトップカンファレンスIROS 2026の場で、Tech Talkがこの課題に正面から答えました。0.5ミリメートルの隙間の下で上記の全操作を完了し、わずか600の実際のロボット軌跡で訓練を行う方法です。講演者は至簡動力強化学習の責任者、冯宗宝です。これは単なる技術デモンストレーションではなく、実験室の精度が工場の精度にどう変換されるかについての解答です。以下はIROS 2026の現場での講演を精選した内容で、現場の英語講演を基に雷峰網(公式アカウント:雷峰网)が原意を変えずに、口語表現と技術用語を再整理したものです。

▎実験室から工場へ:現実世界のCNC旋盤操作が、ロボット学習プロセスを破壊する理由

講演者:馮宗宝、至簡動力(Simplexity Robotics)強化学習責任者

01

ロボットでロボットを作る

今回の共有は、製造目標から始まります――ロボットでロボットを製造することです。CNC操作は簡単に見えますが、実際の工場で安定かつ信頼性の高いものにするには、全く異なる問題があります。これにより、実験室レベルの基準テストの成功と工場レベルの精度との間の明確なギャップが明らかになりました。今日は、そのギャップをどのように埋めるかを紹介します。至簡動力は全体的な具身インテリジェンス企業です。私たちが自社で開発した多モーダルモデルは、理解と生成を統一しています。閉ループのデータフライワームにより、これらのモデルを継続的に改善することができます。統一されたモジュール式ハードウェアプラットフォームにより、それらが実際のロボット上で動作します。SimpleClawプラットフォームは、開発者にロボットアプリケーションを構築しデプロイするためのオープンプラットフォームを提供します。ハードウェア側では、4つの製品ラインがあります。i7 Proは私たちの車輪式ロボットで、iXは車輪式人型ロボットです。また、2種類の構成のモジュール式力制御機械アームも提供しており、ここではDexter巧みな手とクランプを搭載した形態が示されています。最後に、私たちのデータ収集ゴム手は、人間のデモンストレーションを大規模に収集し、ロボットの学習にデータを提供するのに役立ちます。したがって、私たちの方法は3つの部分を結びつけています:全体的な自社開発により、ハードウェア、ソフトウェア、モデルが含まれます;データ収集ゴム手により、人間のデモンストレーションを大規模に収集することが可能になります;多モーダルモデルにより、理解と生成が統一されます。目標は、これらのデータからさらに多くを学び、精密なCNC操作におけるロボットの能力の高みを引き上げることです。今回の共有は、3つの相互補完的な方法に焦点を当てています:SimpleWAMは多モーダル観測から動作フレームを生成します;DRAM、すなわちDelta規則循環関連記憶は、固定サイズの記憶マトリックスを用いて長いタイムアウトの文脈を処理します;DPEは、候補動作に評価を行うための個別に訓練された評估器を使用し、戦略を凍結し続けます。これら3つを組み合わせることで、私たちのCNCシステムにおける動作生成、記憶、動作選択の問題をそれぞれ解決します。

02

実際の工場の課題

これは私たちが対処しなければならない工場の問題です。私たちの目標は、ロボットがロボットを作ることであり、精密CNC操作がその代表例です。なぜ難しいのか?第一に、ワークピースとカップリング間の隙間はわずか0.5ミリメートルで、位置合わせの誤差を生む余地はほとんどありません。第二に、反射する表面、微細なテクスチャ、外形が似ている部品が、視覚的な位置合わせを困難にします。第三に、ロボットは限られた作業空間内で一連の動作を実行しなければならず、重要な接触面は常に見えないことがあります。したがって、システムは作業全体を通じて精度を保たなければならず、視覚情報が不完全であってもです。これらのCNCの制約が私たちのアーキテクチャを形作りました:弱いテクスチャには十分な視覚エンコーダが必要であり、長距離の接近には頭部と腕部のカメラからの複数の視点が必要です。精密な接触には接近感知の条件化が必要です。その結果、視覚、言語、状態入力がトークンに変換されます。SimpleWAMは多モーダルバーストアンドアクションDiTを提供します。私たちは両者の間にDRAMモジュールを挿入し、現在の観測以外にも歴史的文脈を補完します。アクションDiTは候補となる動作フレームを提案し、DPEは単独で訓練された評価器を用いてこれらの候補をスコア付けし、訓練済みの動作提案器は変わらないままです。選ばれた動作フレームはその後i7 Proに送信されます。

03

具体的な対応策

SimpleWAMは、私たちの統一された世界動作モデルです。その考え方は:訓練時には豊富な未来監視から学び、推論時には直接動作を予測する。訓練段階では、ビデオDiT、3D DiT、動作DiTがタスク指示の指導のもとで、将来のビデオフレーム、3D状態、動作セグメントを共同で再構築し、モデルが視覚、空間、動作のダイナミクスを同時に学習できるようにする。推論段階では、現在の画像、現在の3D状態、言語指示のみを入力し、モデルは直接動作セグメントを出力するだけで、将来の画像や3D状態を生成する必要はない。実行前に、それぞれ特徴を抽出し、それらを自己適応的に融合する。 共有の凍結エンコーダーで、頭部と腕部のカメラから得られる密集した画像トークンを保持する。その後、クエリを個別に読み取ることで、融合前にどの視点も他の視点を抑え込むことはない。ゲート制御は各クエリと各特徴チャンネルに対して行われ、全体的な文脈と局所的な対位の手がかりをバランスさせる。最終的に、視覚的歴史と堅牢で状態条件化された動作DiTを融合し、動作フレームを予測する。右側の注意度グラフは、より強力な境界集中効果を示している。 各方法の標称実験において、融合方法は15回成功した。対照的に、Query-concayは0回、π0.5 SFTのベースラインは8回であった。長いタスクを継続的に安定して行うためには、ロボットには前のステップからのコンテキストが必要である。そのため、私たちはDRAM――Deltaルール循環連合記憶(Delta-Rule Recurrent Associative Memory)を導入し、この能力を事前訓練されたロボット戦略に付与した。 ここでは、凍結されたSimpleWAMの骨格が現在の観測から特徴を抽出します。DRAMはこれらの特徴を用いて記憶内の関連する歴史情報を読み取ります。動作DiTは読み取られた歴史情報を現在の文脈と組み合わせて、動作フレームを生成します。その後、ゲート制御のDelta規則によって記憶が更新され、次のステップに利用されます。記憶は固定サイズの関連行列であるため、タスクが長くなるとともにその占有領域は一定に保たれます。 DRAMは、骨格構造を変更せず、骨格の再訓練も行わない状態で追加することができ、長期的な記憶を既存の戦略に容易に統合できる。精密挿入の過程において、視覚だけではワークピースがカードプレートにどのような状態で接触しているかを判断するのは難しい。力とトルクが、これらの欠如した接触情報を補うことができる。 二つの側面からそれらを使用する。一つ目は、知覚条件化に近い方式でロボットの状態入力を調整し、動作DiTが次の動作を生成する際に接触要素を考慮することである。二つ目は、リアルタイムインピーダンス制御器がリアルタイムフィードバックを利用して実行をより安定にし、接触の変化に応じて動きを調整することである。これら二つを組み合わせることで、障害が直接挿入された際の復帰をサポートできる。精密CNC挿入作業において、この組み合わせ方法は100%の作業成功率を達成した。 一般的な方法は、評価器のフィードバックを使ってアクションエンジンを更新することですが、これにより戦略の変化が起こる可能性があります。DPEでは、まず行動クローンを持つアクションエンジンをトレーニングし、その後、別途トレーニングされた評価器を用いてデプロイ時の候補動作を評価します。成功した場合と失敗した場合は、評価器のみを更新し、閉ループが形成されます。その結果、アクションエンジンはロボット上で常に固定されたままです。DPEにより、タスクの成功率が向上し、実行ステップ数も減少します。

04

成果展示

最終的に、ロボット単一装置による完全自動式の双CNC工作機械の完全な作業プロセスを実現しました。今回の主なデモビデオでは、ロボットの全工程の自主運用プロセスを5倍速で示しており、複数の細分エピソードを通じて、3つの核心的な独立工程をそれぞれ紹介しています。すなわち、ワークピースの自動把握、正確な上材カードリング、加工完了後のワークの取り出しと配置です。ワークピースを把握し、カードリングに挿入して取り出し、ワークピースを配置するという点について言えば、全体のモデル訓練過程において、600本の実際のロボット動きの軌跡のみを訓練データとして使用しました。これもまた、今回の作業の核心的な価値です。つまり、具身知能を実験室での基準テスト効果から、高精度で高真実性のある工業製造シーンに実際に応用することになります。

皆が団結して交流し、会議情報を共有しやすくするために、IROS2026参加交流グループを特別に作りました!このグループに入ると、以下の「福利厚待ち」が受けられますか?

  • 会議情報ステーション:投稿のDDL、フォーマット規範、レビューの進捗……重要なポイントを即時に届け、デッドライムを逃す心配はもうありません。投稿準備がしっかりしています。

  • 同行茶話会:天南海北の同業者が皆で集まり、意見を交わし、アイデアを共有し、人脈を築きます。科学研究の道のりで、私たちは共に歩んでいきます。

  • 最前線補給ステーション:最新の研究成果、話題のトレンドをリアルタイムで同期。会議のテーマと組み合わせて、投稿の流れを明確にし、論文にインスピレーションを与える。

  • 会場後援団:(会議中のみ開放):会場に着いても慌てない——

    ルートナビゲーション:会場の分布、報告室はどこに行けばいいか、グループで随時質問してください;

    議題共読:人気セッション、Keynoteの討論は、見逃しても追えます;

    ポスター集:現場ポスターの要約編集が可能で、一押しで保存して見落としを防ぎます;

    約局広場:約食会、取材局、交流局……話したい、協力したい、対面したいなら、グループで発案すればいい。

? グループへの入り口: スキャンしてグループに参加するか、微信Luyoyo_2026を追加してください。備考欄には、ECCV + 所属機関/大学名+名前+研究分野と記入してください。

科学研究や技術開発では、情報の差が非常に重要です。

来て、一緒に一歩先を行こう!

乗り込んで、世界のAIカンファレンスの魅力をお見せしよう

独占的に視聴できる:

専門家講演PPT

大会報告全文

人気論文解説

学術の新星へのインタビュー

上のQRコードをスキャンする

または「原文を読む」をクリックして専門セクションをフォローしてください。

雷峰網のオリジナル記事は、許可なく転載することを禁じられています。詳細は転載に関する注意事項をご覧ください。

原文の出典

雷峰网 AI

内容について

原文の公開と権利は出典元に帰属します。

機械翻訳 · 原文をご参照ください