雷峰网 AI

Zhi Jian Dongli Feng Zongbao: In einem realen Szenario mit nur 0,5 Millimetern Abstand, die Roboter Roboter herstellen | IROS 2026

Körperbasierte Intelligenz geht vom Labor in die echten Fabriken und auf den präzisen Montag. Autor: Deng Zhemin, Redakteur: Qi Chengyong. Haben Sie schon einmal darüber nachgedacht, dass Roboter auch in die Werkstätten…

Die embodied Intelligence geht vom Labor in die echten Fabriken und auf den Bereich der präzisen Fertigung über.

Autor | Deng Zhemin

Bearbeitung | Qi Chenyong

                                                                                                       

Haben Sie schon einmal darüber nachgedacht, dass Roboter in die Werkstätten gehen könnten und selbst die Bauteile herstellen, die für die Herstellung eines Roboters benötigt werden? Das klingt wie ein Scherz, aber in Wirklichkeit ist dies das schwierigste praktische Problem der embodied Intelligence. Die Gliederungen, Kappen und präzisen Bauteile von Robots werden alle durch CNC (Computer Numerical Control) Fräsmaschinen und Messer hergestellt. Wenn Roboter selbst für diese Maschinen sorgen können, die Aufnahme, Beladung, Einführung, Entnahme und Platzierung von Werkstücken zu erledigen, dann wird die Robotik-Industrie von den Robots selbst unterstützt – je mehr Roboter, desto stärker die Fähigkeit zur Herstellung von Robots, desto niedriger der Kosten, und es entsteht ein positiver Rückkopplungskreis. Aber das zu erreichen ist viel schwieriger, als man denkt. Die Bauteile, die für die Herstellung von Robots benötigt werden, sind genau jene, bei denen die Präzision am höchsten ist: Der Abstand zwischen dem Werkstück und der Kappe beträgt oft nur 0,5 Millimeter, die reflektierende Metalloberfläche, die fast texturlose Form und die ähnlich geformten Bauteile stellen alle die visuelle, taktile und präzise Fähigkeit des Roboters in allen Schritten auf die Probe. Selbst die schönsten Demonstrationen im Labor müssen hier zuerst die drei Prüfungen von Toleranz, Taktzeit, Qualität bestehen. Am 29. September 2026 in Pittsburgh, USA, auf der weltweit führenden Konferenz für Robotik IROS 2026, antwortete ein Tech Talk direkt auf dieses Problem: Wie kann ein Roboter selbst für zwei CNC-Maschinen sorgen und alle oben genannten Operationen unter einem Abstand von 0,5 Millimeter durchführen, und das nur mit 600 echten Robotertrajektorien als Training? Der Redner ist Feng Zongbao, Leiter des Projekts zur Verstärkung des Lerns mit Minimalismus. Das ist nicht nur eine technische Demonstration, sondern auch eine Antwort darauf, wie die Präzision im Labor in die Präzision im Werkzeugbau umgewandelt werden kann. Hier ist der komplette Text der Rede von Feng Zongbao auf IROS 2026, zusammengestellt aus der englischen Rede vor Ort, und Lei Feng Network (Öffentlicher Account: Lei Feng Network) hat die mündliche Ausdrucksweise und technischen Begriffe auf der Grundlage des ursprünglichen Inhalts neu ordnet.

▎Von Labor zu Fabrik: Warum die Praxisbasierte Manipulation mit CNC-Winkeln die bestehenden Robotik-Lernprozesse unterbrechen

Redner: Feng Zongbao, Leiter des Verstärkungslernens bei Simplexity Robotics

01

Roboter für Roboter herstellen

Der diesmalige Vortrag beginnt mit einem Herausforderungsobjekt – die Herstellung von Robotern mit Robotern. Die CNC-Operation scheint einfach zu sein, aber das Sicherstellen einer stabilen und zuverlässigen Funktion in einer echten Fabrik ist eine ganz andere Aufgabe. Sie zeigt die klare Kluft zwischen dem Erfolg der Laborprüfungen und der Fabriksebenen Genauigkeit. Heute werde ich zeigen, wie wir versuchen, diese Kluft zu überbrücken. SimpleClaw ist ein Full-stack- embodied Intelligence-Unternehmen. Unsere selbst entwickelten multimodalen Modelle vereinen Verständnis und Generierung; ein geschlossener Datenwellenkreis ermöglicht uns kontinuierliche Verbesserungen dieser Modelle; eine einheitliche modulare Hardwareplattform ermöglicht deren Betrieb auf echten Robotern; die SimpleClaw-Plattform bietet Entwicklern eine offene Plattform für den Aufbau und die Bereitstellung von Robotenanwendungen. Auf der Hardwareseite haben wir vier Produktlinien. i7 Pro ist unser Rad-Robot, iX ist unser Rad-Mensch-Robot. Wir bieten auch zwei Konfigurationen von modularen Force-Controlled-Armen an, die jeweils mit Dexter-Handgelenken und Klauen ausgestattet sind. Schließlich helfen uns unsere Daten-Sammlungshandschuhe dabei, humanes Demonstrieren in großem Maßstab zu sammeln, um Daten für das Robotik-Lernen bereitzustellen. Somit verbinden unsere Methoden drei Bereiche: unser Full-stack-Erbe von Hardware, Software bis hin zu Modellen; die Daten-Sammlungshandschuhe ermöglichen das großflächige Sammeln humanen Demonstrierter; die multimodalen Modelle vereinen Verständnis und Generierung. Das Ziel ist es, aus diesen Daten mehr zu lernen und den Schwellebereich der Robotik in präzisen CNC-Operationen zu erhöhen. Der Vortrag konzentriert sich auf drei komplementäre Methoden: SimpleWAM generiert Aktionsabschnitte aus multimodalen Beobachtungen; DRAM, also Delta-Rule-Cycle-Associative-Memoria, verarbeitet lange Zeitkontexte mit einer festen Größe der Memoirenmatrix; DPE bewertet Kandidaten-Aktionen mit einem separat trainierten Evaluator und hält dabei die Strategie gefroren. Zusammen lösen diese drei Methoden jeweils die Probleme der Aktionsgenerierung, des Gedächtnisses und der Aktionsauswahl in unserem CNC-System.

02

Wahre Fabrikprobleme

Das ist das Problem der Fabrik, mit dem wir konfrontiert sind. Unser Ziel ist es, Roboter zu Roboter zu bauen – präzise CNC-Operationen sind dabei ein Beispiel dafür. Warum ist es schwierig? Erstens liegt die Lücke zwischen Werkstück und Hebelzange nur bei 0,5 Millimetern, was kaum Raum für Fehler in der Positionierung lässt. Zweitens führen reflektierende Oberflächen, schwache Texturen und ähnliche Formen dazu, dass die visuelle Positionierung schwierig wird. Drittens müssen die Roboter eine Reihe von Aktionen in einem begrenzten Arbeitsraum ausführen, wobei die entscheidenden Kontaktflächen nicht immer sichtbar sind. Deshalb muss das System während der gesamten Aufgabe Präzision bewahren, auch wenn die visuellen Informationen unvollständig sind. Diese CNC-Vorgaben formen unsere Architektur: Die schwachen Texturen erfordern einen starken visuellen Encoder; die langfristige Nähe erfordert mehrere Perspektiven durch Kameras am Kopf und am Arm; präzise Kontakte benötigen Bedingungen für Nahsinn. So werden visuelle, linguale und Statusinformationen in Tokens umgewandelt. SimpleWAM bietet ein multimodales Skelett und Action DiT. Wir fügen zwischen diesen beiden ein DRAM-Modul ein, das historischen Kontext über die aktuelle Beobachtung hinaus liefert. Action DiT schlägt Kandidaten für Aktionen vor, DPE bewertet diese Kandidaten mit einem separat trainierten Evaluator, während der trainiert gehaltene Action-Proposer unverändert bleibt. Die ausgewählten Aktionen werden anschließend an i7 Pro weitergeleitet.

03

Konkrete Lösungsansätze

SimpleWAM ist unser einheitliches Weltbewegungsmodell. Seine Philosophie ist:Beim Training lernt man aus reichhaltigen zukünftigen Overlays, und bei der Schlussfolgerung wird direkt die Handlung vorhergesagt.In der Trainingsphase führen Video DiT, 3D DiT und Action DiT unter der Anleitung von Aufgabenanweisungen gemeinsam die Rekonstruktion von zukünftigen Videoframes, 3D-Zuständen und Actionabschnitten durch, sodass das Modell gleichzeitig die Dynamik von Sehen, Raum und Handlung lernt. In der Inferenzphase geben wir nur die aktuelle Bild, den aktuellen 3D-Zustand und die Sprachanweisung ein, und das Modell gibt direkt Actionabschnitte aus, ohne weitere zukünftige Bilder oder 3D-Zustände zu erzeugen. Bevor man es ausführt, extrahieren wir separat Merkmale und führen anschließend eine adaptive Fusion dieser Merkmale durch. Ein gemeinsamer Frozen-Encoder, der die dicht besetzten Bilder von den Kopf- und Handkamera-Systemen behält; anschließend werden die Anfragen jeweils unabhängig gelesen, sodass keine Perspektive die andere unterdrückt, bevor sie fusioniert werden; das Gating wird für jede Anfrage und jeden Merkmalskanal angewandt, um den globalen Kontext und die lokale Positionierungstexte auszugleichen. Schließlich führt die Fusion der visuellen Historie und eine robuste, state-conditionierte DiT-Animation zur Vorhersage von Bewegungsabschnitten. Das Aufmerksamkeitsdiagramm auf der rechten Seite zeigt einen stärkeren Grenzfokus-Effekt. In den angegebenen Tests der verschiedenen Methoden war die Fusion-Methode 15 Mal erfolgreich, während Query-concay 0 Mal und die π0,5 SFT-Baseline 8 Mal waren. Um in einer langen Aufgabe kontinuierlich und stabil zu handeln, benötigt das Roboter-System den Kontext aus den vorherigen Schritten. Darum führen wir DRAM – Delta-Rule Recurrent Associative Memory ein, um diese Fähigkeit auf die vortrainierte Roboterstrategie zu übertragen. Hier wird das gefrorene SimpleWAM-Basismodul Merkmale aus den aktuellen Beobachtungen extrahieren; die DRAM liest zunächst mit diesen Merkmalen die relevanten historischen Daten aus dem Gedächtnis ab; der Action DiT kombiniert die abgerufenen Historiedaten mit dem aktuellen Kontext, um Aktionsabschnitte zu erzeugen; anschließend wird das Gedächtnis durch die gated Delta-Regeln aktualisiert, damit es für die nächste Schritte verwendet werden kann. Das Gedächtnis ist eine feste Größe an einer Verbindungsmatrix, daher bleibt seine Speicherkapazität bei einer längeren Aufgabe konstant. DRAM kann ohne die grundlegende Architektur zu verändern oder die Grundarchitektur neu zu trainieren hinzugefügt werden, wodurch die langfristige Membran leichter in bestehende Strategien integriert werden kann. Im Prozess der präzisen Einfügung ist es möglicherweise nur durch das Sehen nicht möglich, zu beurteilen, in welchem Zustand das Werkstück den Karussell kontaktiert. Kraft und Moment können genau die fehlenden Kontaktinformationen ergänzen. Wir verwenden sie aus zwei Aspekten: Erstens passt die Annäherung an die Wahrnehmungsbedingungen die Zustandsübermittlungen des Roboters an, sodass der DiT-Aktivierung-Prozess beim Generieren des nächsten Aktionen die Berücksichtigung der Berührungsfaktoren berücksichtigt; zweitens nutzt der Echtzeit-Impedanzregler den Echtzeit-Feedback, um die Ausführung stabiler zu machen und den Bewegungsablauf entsprechend den Veränderungen der Berührung anzupassen. Durch die Kombination beider Aspekte kann eine Wiederherstellung bei direkter Einbuchtung unter Wegfall von Hindernissen ermöglicht werden. Bei der präzisen CNC-Einbuchtungsaufgabe erreichte diese Kombinationsmethode eine 100%-ige Aufgabenerfolgsrate. Die übliche Vorgehensweise ist es, den Feedback von dem Evaluator zu verwenden, um den Actuator zu aktualisieren, doch dies kann zu einer Strategieveränderung führen. Der DPE trainiert zunächst einen Aktuator, der ein Verhalten kopiert, und bewertet anschließend die Kandidatenbewegungen mit einem separat trainierten Evaluator während der Implementierung; für erfolgreiche und fehlgeschlagene Rollouts wird nur der Evaluator aktualisiert, wodurch ein闭环 entsteht, während der Aktuator auf dem Roboter immer eingefroren bleibt. Der DPE erhöht die Erfolgsrate der Aufgabe und reduziert die Anzahl der Ausführungsschritte.

04

Ergebnispräsentation

Wir haben schließlich ein vollständiges Betriebsmodell für einen vollautomatischen CNC-Maschinenbau mit einem einzigen Roboten und einer einzigen Einheit erreicht. Der Hauptvorstellungvideo zeigt den vollständigen selbstständigen Arbeitsprozess des Roboters in fünffacher Geschwindigkeit und zeigt durch mehrere Unterabschnitte drei zentrale, unabhängige Prozesse: die selbstständige Ergreifung der Werkstücke, das präzise Einführen in den Antrieb, sowie das Entnehmen und Platzieren nach dem Bearbeitungsvorgang. Es ist erwähnenswert, dass wir während des gesamten Modelltrainingsprozesses nur 600 echte Robotenbewegungen** als Trainingsdaten verwendeten. Dies ist auch der Kernwert unserer Arbeit: die körperliche Intelligenz von den Standardtests im Labor in eine industrielle Herstellungssituation mit hoher Präzision und hoher Realität zu überführen.

Um allen eine gemeinsame Plattform für Austausch und Weitergabe von Meetinginformationen zu bieten, haben wir eine spezielle Gruppe für die Teilnahme an IROS2026 aufgebaut! Welche „Vorteile“ werden Sie in der Gruppe erhalten?

  • Konferenz-Informationen-Station: Einreichungen DDL, Formatvorgaben, Prüfungsfortschritt … Schlüsselpunkte werden sofort bereitgestellt – man muss keine Angst haben, den Deadline zu verpassen, die Vorbereitung der Einreichungen ist sicher.

  • Kollegiales Tee-Treffen: Alle Kollegen aus allen Richtungen sind im Gruppenchat – wir tauschen Erfahrungen aus, besprechen Ideen und knüpfen Kontakte. Auf dem Weg der wissenschaftlichen Forschung sind wir alle zusammen.

  • Frontlinien-Reservoir-Station: Aktuellste Forschungsergebnisse und aktuelle Schwerpunkte werden in Echtzeit synchronisiert. Sie hilft Ihnen dabei, die Struktur Ihrer Veröffentlichung klar zu gestalten und gibt Ihnen Inspiration für Ihre Arbeit.

  • Hintergrund-Team vor Ort: (ausschließlich während der Konferenz aktiv):Es ist nicht notwendig, in der Versammlungsstätte in Panik zu geraten –

    Route-Anleitung: Verteilung der Veranstaltungsorte, wie man zum Berichtssaal kommt – fragen Sie im Gruppenchat jederzeit;

    Thema gemeinsames Lesen: Populäre Sitzungen, Keynotes – wenn man sie verpasst, kann man sie immer noch nachverfolgen;

    Poster-Compilation: Zusammenfassung der wichtigsten Posters auf der Veranstaltung, einfach speichern – ohne etwas zu verpassen;

    Yueju Plaza: Essenstreffen, Interviews, Kommunikationsgruppen… Wenn man reden möchte, zusammenarbeiten möchte oder persönlich zu treffen ist, kann man sofort im Gruppenchat starten.

? Einstiegslink zur Gruppe: Scannen Sie den Code, um in die Gruppe einzutreten, oder fügen Sie Luyoyo_2026 bei, und geben Sie im Anhang an: ECCV + Einrichtung/Universität+Name+Forschungsbereich.

Bei wissenschaftlichen Forschungen/Technikarbeit ist Informationenfehler sehr wichtig.

Kommen Sie, gehen wir einen Schritt voran!

Steig ein, ich zeige dir die Highlights der weltweiten AI-Konferenzen

Exklusives Zugangslicht:

Experten-Vortrag PPT

Vollständiger Bericht der Konferenz

Interpretation der beliebten Artikel

Interview mit der neuen akademischen Stern

Scannen Sie das QR-Code oben

Oder klicken Sie auf „Originalartikel lesen“, um sich im Bereich zu followen.

Artikel von Leifeng.com – ohne Genehmigung ist die Verbreitung untersagt. Weitere Informationen finden Sie unter Hinweise zur Verbreitung.

Originalquelle

雷峰网 AI

Hinweise zum Inhalt

Originalveröffentlichung und Rechte liegen bei der Quelle.

Maschinelle Übersetzung · Original beachten