一対の器用な手でクルミを加工し、アイスクリームを作ることができる手は、Sharpaを覚え込むのに十分だ:

このホセイテクノロジーの創業チームが再び立ち上げた、具身スマート企業は、過去しばらくの間、最も顕著なラベルとして、高い自由度を持つ触覚的機敏な手である。
進行中のIROSで、Sharpaはこのプロジェクトをさらに前進させました。初代の完全自社開発の汎用人型ロボットD01が登場しました:

同時に、新世代のスマートハンドW02もあります:

そして外骨格データグローブAE01:

手、身体、データ入力口を一度に展示台に設置する。
なぜSharpaはロボットの本体を作り始める必要があったのか、さらに「操作方法を学ぶ」データエントリーまで一緒に作ったのか?
これら3つの製品を一緒に見ると、答えは実際には、現在の「具身インテリジェンス」分野でほぼ全員が議論している問題を指している。
ロボットが展示会やステージデモを抜け出し、実際の商業価値を生み出すためには、一体何が必要なのか?
IROS現場で、3種類の製品がどのようなものか
まずD01について見てみると、Sharpaによる説明では、これは一体型の触覚知覚・機敏操作ロボットである。
このロボットで最も注目すべき数値のいくつかも、巧みな操作に関連しています。腕の負荷と自重の比率はほぼ1:1、最大末端エンジニアリング機構の速度は10.5m/sを超え、通信周波数は1000Hzに達し、再定位精度は0.2mmです。球形の腕関節は1:1の人体スケール設計になっています。
「高速運動」とは、ロボットが迅速にバトン受けやツール操作などの動的タスクを完了できることを意味します:
「高負荷能力」により、動作中でも腕に十分な作業余裕が保たれます。0.2mmの再現精度により、より精密な操作へと能力を推進します。
ロボットが複雑なタスクに直面するとき、速度、力、精度は単独で存在することはほとんどありません。D01の設計の焦点もここにあります。
特に触感が特徴的です.
D01電子皮膚が全身を覆い、触覚は上半身を覆う、触覚サンプリングレートは100Hz、力感知範囲は0.1—20N、力分解能は0.2Nです。そのため、ロボットは軽いタッチ、衝突、外部の力を直接感知できます。

シャルパが「触覚」にこんなにもこだわる理由は、人型ロボットが実際に作業空間――つまり機敏な操作環境に入ることでより明らかになります:
視覚はロボットに「前に何かがある」と事前に知らせることができるが、接触が起こった後では、「どこに触れたのか、力はどれくらいだったのか、接触が変わったかどうか」をロボットが知る必要がある。
例えば、高速に落下する物体を捕まえる場合、ロボットは極短い時間の内に腕と指の状態を調整する必要があります。また、人が近くで作業している際にロボットの腕に触れた場合、ロボットはその外力がどこから来たのか、現在の軌道を変更する必要があるかどうかを判断する必要があります。これらの瞬間に起こる物理現象については、視覚だけでは完全な情報を得ることは難しいです。
人間の体は実際にこのようなことをずっと行っている。指が物を滑るのを感じると、無意識に握力を増す。腕が机の上に触れると、次の動きが変わる。身体が外力を受けると、すぐに姿勢を調整する。
大量の動作は、事前に「思考チェーン」の形で整理された指導を通じて実行する必要はない。体自体がリアルタイムのフィードバックを提供する。D01が腕と胸に電子皮膚を設置したことで、この種の「身体からのフィードバック」もロボットの認知システムに組み込まれる。
D01コアインタラクティブエリアでは触覚が完全に覆盖され、ロボットの体が制御システム内で果たす役割が変わります。単なる異常検出や事後記録から、動作調整の一部へと昇華します。

再びW02、「新世代の全触覚型超コンパクトで軽量な機敏手」を見ると、少し驚くべき変化があります:前世代のW01は22のアクティブ自由度を持っていたが、W02では21に減少している。
少し減ってしまったのは、小指の根元のCMCの自由度です。
シャルパの利用調査によると、この自由度は一般的なクローニングや手動操作でほとんど使用されず、タスクへの貢献も限定的であるため、W02では対応する構造を簡略化し、機械的な複雑さや潜在的な故障ポイントも減少した。
これもW02で最も見る価値のある点の一つです:機敏な手が能力をさらに高めていくが、自由度の数値が必ずしも上昇するわけではない。

また、W02は21のアクティブ自由度をよりコンパクトな構造に収めました。手のサイズはW01と比べて約30%小さくなり、重量もさらに軽減されました。これにより、前腕の負荷が減少し、手のサイズに合わせて設計された作業空間に入れるのが容易になりました。
より小さく、より軽いということは、以前は実行が難しかったいくつかのタスクを達成することも意味します。
例えばW02は「ゼロ握り半径」を実現しており、箸や細い糸などの小径の物体をより安定して扱うことができる。指先には高解像度の視覚触覚センサーが使用され、力感知範囲は5mN—30N、空間分解能は1mmである。手の甲の他の部分は電子皮膚で覆われており、力感知範囲は0.1—20N、空間分解能は5mmである。

つまり、W02の触覚カバレッジは「数本の指先」から全身に拡大しました。ロボットは指先、指、手のひらの接触情報を同時に得ることができ、これは小さな物体や連続した手の操作にとって特に重要です。
注目すべき点は、シャルパが「小型化」と「触覚カバレッジ」を同じ工学制約の中で考慮したことです。つまり、片手が人間の作業空間に収まるようにしながら、十分な接触感覚も保たれる必要があります。
最後にAE01です。これは「高精細外骨格触感データグローブ」で、主に正確な遠隔操作や第一視点のデータ収集に使用されます。
AE01は22個のエンコーダを通じて操作者の自然な手の動きを正確に捕捉し、そのリアルタイムなマッピングをロボットに実現することで、より自然で敏感な高精細遠隔操作を実現する。

重要なのは「フィードバック」です:人が物体を操作するとき、目には位置と形が見え、指には力や接触、滑り感が感じられます。AE01はロボットがこれらの情報を人にフィードバックさせ、操作者は触覚を通じて動作を調整できます。
同時に、人間の自然な手の動きもロボットがリアルタイムで捉えることができる。
したがって、AE01の価値は主に「人間の操作経験をロボットが利用できるデータに変換する」という段階にあります。人間の動きの軌跡、ロボット側の接触フィードバック、そして両者の間のマッピングが、同じ収集プロセスの中で行われます。
シャルパの機敏な操作全チュン、一体何が違うのか
3つの製品を具体的な技術問題の観点から見ると、SharpaのIROSでの3つの製品の面白い点は、『巧みな操作』をいくつかの孤立したハードウェア機能からさらに、一連のものへと変える試みである接触感知、閉環制御およびデータ学習構築された技術体系。
しかし、この技術体系を理解するには、「ロボットがいつ触覚が必要か」という問題から分解していくべきだ。
伝統的な視覚戦略が最も得意とするのは、接触が起こる前の段階です:物体を認識し、位置を推定し、腕の動きを計画し、そして手を伸ばすことです。問題はちょうど最後の数センチメートル、あるいは最後の数ミリメートルにあります。

例えば挿入、ねじり、整列、柔らかい物体を掴む際に、作業が成功するかどうかを決定する変数は、接触の後に隠されていることが多い:物体が偏っているか、滑るか、圧力が過大か、接触点が変化しているかである。視覚的に結果が見える部分もあるが、これらの瞬間的な物理状態を安定して観察するのは難しい。
シャルパのCraftNetモデルはこの問題の処理について非常に明確である:System 2はタスクと長期的な計画を理解する役割を担い、System 1は接触前の動作計画を担当し、System 0は接触段階に入り、触覚フィードバックと精密な動作をより高い頻度で処理する。System 0は細かい動作を実行するだけでなく、状態情報をSystem 1にフィードバックし、上層の動作が実行に失敗したり物理的な状態が変化したりした場合に再調整を行う。
これは、触覚の役割が、実際には制御回路の時間スケールを変えることであるという意味です。
接触前に、ロボットは遅いモデルで「何を、どこから近づくか」を考えることができる。接触後には、「今、スライドしているか、もう少し捏んだ方がいいか、指をどちらに動かすか」が必要になる。後者は、制御システムがより高い頻度で動作することを要求する。
そして次のステップで、問題はこうなった:ロボットはどのようにして一度の接触経験を記憶するのか?
これは、Sharpaの最新WM-Craftnet研究が、単なる「視覚+触覚の融合」よりも注目に値する点である。
以前は単に深さ図、触覚、関節状態を組み合わせて戦略に与えていたのに対し、新しい研究ではWorld Synesthesia Model、つまり時間記憶を持つ世界モデルを訓練した。
腕部の深さ、触覚、本体認識、および以前に実行された動作を含む情報を、Dreamerスタイルの循環状態空間モデルを通じて、時間とともに変化する隠状態として圧縮します。この状態は戦略の文脈として機能し、物体の現在の幾何学的状態、接触状態、および動きの状態を判断するために使用されます。
モデルが学ぶのは「今何が起こっているか」だけではなく、過去に何が起こったかを踏まえて、「なぜ今このような状態になったのか」を推測することもある。
このステップの意義は、「触覚参加制御」からさらに一層前進したことです:ロボットが接触状態に関する内部表現を形成しようと試みるようになったのです。
最初の質問に戻ります:なぜSharpaは常に触覚に「執着」し、柔軟な操作の核心位置に置かれるのでしょうか?
センサーが提供するのは原始の接触信号であり、制御システムはミリ秒から百ミリ秒レベルで反応する役割を担っています。世界モデルは、これらの瞬間的な事象を、ロボットが継続的に利用できる「物理状態」としてまとめようと試みています。
これはまさに巧みな操作であり、通常の機械アームが軌道を実行する核心とは異なる。
AE01は、データ側で最後のピースを埋めました。
伝統的な遠隔操作では、人の動きの軌跡を記録することが主ですが、接触過程における物理的経験を完全に保持することは難しいです。
AE01はエンコーダを通じて自然な手の動きを捕捉し、同時にロボット側の触覚状態を操作者にフィードバックすることで、双方向のインターフェースを形成する。つまり、人間の動作がロボットに入力され、ロボットが物体と接触した後の状態が人間の次の操作に影響を与えるのである。
こうすると、一度の人間の操作によって得られるデータは、「手がどこに移動したか」だけではなく、接触の瞬間、力の変化、スライド状態、そしてその後の修正動作も含まれる。正確な制御、触覚同期収集、校正の不要ということで、人間と機械のマッピングや多モダルデータの同期のハードルが下がる。
ですから、IROSでの新たな進展を要約すると、一言で言えば:
シャルパが解決しようと試みているのは、具身知能に関する現実的な問題です。高品質の操作データを得ることは難しく、実に価値のあるデータは、最も複雑な接触が起こる瞬間にのみ存在します。
この視点から見ると、Sharpaの機敏な操作「全体的」能力は不可欠である:本体はロボットを実際の作業空間に導く役割を担い、機敏手は人と物体との細かい接触を処理する役割を担い、データ入力は人の操作経験とロボットの物理フィードバックを保存する役割を担う。
最後に、モデルはこれらの情報を再使用して、何度もの操作を次のレベルの能力に変換する。
巧妙な操作のトッププレイヤー
手は、まず人間が様々な複雑な任務を遂行する上で最も信頼できる器官です。
同様に、ロボットと実世界が精密な物理的相互作用を起こす最も直接的な媒体でもある。
したがって、W01から始まって、Sharpaは長期にわたり高い自由度、触感、そして精密な操作を中心に展開してきたのも当然である。
年初のCESでのデモが大成功を収め、Sharpaは業界にトップクラスの洗練された操作のライブデモを披露した。
しかし、優れた手がある程度のレベルに達すると、問題は自然と体の両端に広がる。この手には、どのような物理的な支持が必要で、それによってさまざまな作業環境に適応できるのか?また、どのようなデータが必要で、ロボットが様々なタスクを応用して実行できる「商業的汎用化」を実現できるのか?
これらの問題には、高速運動下での制御精度、実際の接触知覚、人間の道具の操作、および薄い板、柔軟な物体、液体などの複雑な対象の処理能力が含まれます。また、身体、手首、指、そして触覚フィードバックが連続的なタスクの中で協調して機能することも求められます。
これらの能力をつなげることができる機会は、実際のタスクの中にのみ現れる。
今年8月末、SharpaとDQが共同で開発した暴風雪ロボットレストランが上海の吴江路に開店しました。ロボット用の専用作業台を別途設計するのではなく、DQの既存の設備、原材料、製造プロセスをそのまま利用しています。ロボットが開棚、カップリング、氷の受け取り、材料の投入、撹拌、カップの注ぎまでの55段階の連続作業を行います。
一つ一つのステップを個別に見ると、まだ「サイエンスフィクション」とは言えない。しかし問題なのは、それらが連続して起こること、そして前のステップで生じた誤差が次のステップに伝わっていくことである。
最大の難点は、改造する環境がなく、高度に関連する一連の操作を連続して行うことです。
これはちょうど、Sharpaが先に構築した技術チェーンと対応しています。
長距離タスクはモデルによって分解と状態管理が行われる。System 1が具体的な動作を担当し、接触に入るとSystem 0が触覚と力フィードバックを利用して継続的に修正を行う。世界モデルは視覚、触覚、力フィードバック、およびボディーステータスを組み合わせて、タスクが現在どこにいるか、次に何をすべきかを判断する。
そして、これはSharpaが今年2回目に敏捷操作の上限を更新したことでもある。
機能性手のハードウェアから触覚制御、そしてワールドモデルや実店舗でのタスクまで、Sharpaは機能的な操作を末端エンジニアリング能力から、一連のシステム能力へと徐々に拡大している。
その中で視覚は「何が見えるか」を解決し、触覚は「何に触れたか、どれだけの力がかかったか、滑りが起きたか」を補完する。これらは、掴む、挿入する、回す、押すなどの連続的な動作において、共に動作の調整を支える。
技術構造において、触覚は比較的独立した計算層として存在し、上層モデルを交換可能であるため、触覚機能は継続的に蓄積され、特定の世代のモデルに束縛される必要はない。その結果、ロボットが得るのは、感知と制御に継続的に参加できる接触情報のセットである。
もう一方は、データです。
シャルパの共同創設者李一帆は、量子位に対して次のように語った:「得たデータだけでは差を生み出すことはできない」。
今日の製品構成の中では、あるモデルやあるデータ収集方法と比べて、Sharpaが重視しているのは、ロボットが実際のタスクで「動作—接触—フィードバック—修正」の経験を継続的に得て、その経験を再びモデルに戻すことです。
これは、タスクから出発し、その後逆にハードウェアとモデルを定義する道筋です。
これは、自動運転の量産化と規模化の経験を積んだSharpaの創設チームが、具身知識において引き続き強調している「商業的汎用性」です。シーンやカテゴリーが変わった後でも機能し続けるか、効率の向上が調達、配備、メンテナンス、データコストを含む全ての面で実現できるかどうかです。
この角度から見ると、Sharpaの今回のIROSでの最も注目すべき変化は、「また3種類の製品を発表した」ということではないかもしれません。
以前のW01リンチーアー手が解決したのは「ロボットが物を握ったり、操作したりできるか」ということでした。D01、W02、AE01、DQが実際に導入されるにつれて、Sharpaはさらに根本的な層について追求し、探求を続けています。
異なるタスクシナリオに対応し、一般的なハードウェアと技術要件を抽出することで、実際のポジションや持続的なデリバリー、データの蓄積、および改善のための一般的な操作能力を提供します。