雷峰网 AI

Wu Jiajun IROS 2026 Vortrag: Strukturiertes Representieren ist keine Lösung, sondern ein Gerüst, mit dem Roboter denken lernen | IROS 2026

Von der strukturierten Repräsentation bis zum Lernen ohne Demonstration. Autor: Wu Siming; Redakteur: Cen Feng. Eine Schüssel, eine Wasserhose, ein kleiner Klumpen blauer Reinigungsmittel. Wu Jijun begann seine Rede bei…

Von der strukturierten Darstellung zur Lernweise ohne Demonstrationen.

Autor | Wu Simeng

Bearbeitung | Cen Feng

                                                                                                       

Ein Teller, eine Wasserhose und ein kleiner Stück blaues Geschirrspülerreiniger. Wu Jiajun begann seine Rede bei IROS 2026 mit einer Küchensszene, die kaum technische Kompetenz erforderte. Ein Student spritzt den Geschirrspülerreiniger aus, öffnet die Wasserhose, wäscht die Hälfte und verlässt vorübergehend den Raum. Nun übernimmt ein Roboter die Aufgabe. Auf den ersten Blick ist die Aufgabe klar: den Teller sauber machen und anschließend wieder zurücklegen. Doch was der Roboter tatsächlich erledigen muss, sind nicht nur die Worte „Teller waschen“. Es muss zuerst wissen, was vor sich eine Tasse ist; es muss erkennen, ob diese Tasse schmutzig ist; es muss aufmerksam sein, ob auf der Tasse ein kleiner blauer Reinigungsmittelstoff zu finden ist. Es muss auch wissen, ob die Wasserhose gerade geöffnet ist, ob die Tasse bereits gewaschen wurde und ob nachdem es die Tasse nimmt, wieder ein neues Problem auf dem Tisch sichtbar wird. Bei derselben Aufgabe, aber mit einem anderen Anfangszustand, kann die Antwort völlig anders sein. Die Tasse wurde bereits gewaschen, da muss nichts mehr gewaschen werden. Ohne Reinigungsmittel muss man erst etwas hineinpressen. Wenn etwas Schmutziges unter dem Teller liegt, bedeutet „den Teller sauber machen“ nicht mehr, dass man ihn auf den Regalrand stellt. Wenn Menschen mit solchen Veränderungen konfrontiert sind, denken sie oft nicht darüber nach, welche komplexen Schlussfolgerungen sie treffen könnten. Wir schauen nur einmal hin und gehen dann weiter. Für einen Roboter jedoch steckt hinter jedem „Schauen und Weitergehen“ eine Frage: Was versteht er eigentlich mit der Welt vor sich? Am 27. September, am Eröffnungsdatum von IROS 2026, hielt Prof. Dr. Jiajun Wu, Assistenzprofessor am Fachbereich für Informatik der Stanford University, auf dem RoBoWoMo-Seminar einen eingeladenen Vortrag mit dem Titel „Building Physical Agents via Structured Representations“ ab. In den letzten Jahren hat er untersucht, wie man aus Bildern eine Welt wiederherstellen kann, die hinter der Sichtbarkeit verborgen ist: Geometrie, Materialien, physikalische Eigenschaften und die Beziehungen zwischen Objekten. Nun, wenn diese Probleme in den realen physischen Welt der Roboter eingebunden werden, entstehen weitere Probleme. Wie sollte ein Roboter eine Aufgabe beschreiben? Können diese Beschreibungen selbst erlernt werden? Wann braucht ein Modell Nachtrainierung, wenn es mit Objekten zu kämpfen hat, die in den Trainingsdaten nie vorkamen? Wenn auch die Planung selbst erlernt werden kann, ist dann der traditionelle Planer noch notwendig? Schließlich geht das Problem nicht mehr darum, ob der Roboter gesehen hat, wie Menschen etwas machen. Ohne Demonstrationen, ohne Daten über Fernsteuerung – und sogar gegenüber einem Wasserhahn, den er noch nie gesehen hat – kann der Roboter dann noch selbst herausfinden: Wie könnte er verwendet werden? Hier ist die zusammengefasste Version des Vortrags von Wu Jijun auf IROS 2026. Die AI-Technologie-Kommentare von Leifeng Network (Public Account: Leifeng Network) haben den englischen Vortrag vor Ort bearbeitet und die mündliche Ausdrucksweise sowie die technischen Begriffe auf einer unveränderten Grundlage neu ordnet.

▎Erstellung physischer Agenten durch strukturierte Repräsentationen

Redner: Wu Jijun, Assistenzprofessor an der Fakultät für Informatik der Stanford University (zugleich Assistenzprofessor an der Fakultät für Psychologie)

01


Warum eine Tasse Probleme für einen Roboter darstellt

Was ich heute übermitteln möchte, ist, wie wir mit strukturierten Repräsentationen Agenten entwickeln können, die in der physischen Welt handeln können. Beginnen wir mit der visuellen Sichtweise. Letztendlich sieht man nur Bilder, aber hinter den Bildern steht eine ganze Welt: Geometrie, Materialien und verschiedene physikalische Eigenschaften. Die Hauptrichtung unserer Forschung hat immer darin bestanden, inwieweit diese Dinge wiederhergestellt werden können; und sobald man sie wiederherstellt, kann man diese Welt neu erschaffen. In den letzten Jahren gibt es auch eine sehr aktive Richtung: Agenten im digitalen Raum. Sie empfangen Anweisungen und interagieren mit der ganzen Welt. Dies lässt natürlich den Gedanken aufkommen: Gibt es eine ähnliche Struktur in der physischen Welt? In der digitalen Welt haben Sie Ordner, in denen sich Dateien befinden, und die Dateien haben ihre Eigenschaften; in der physischen Welt haben Sie Szenen, in denen sich Objekte befinden, und die Objekte haben ebenfalls ihre Eigenschaften. Können wir also diese Struktur nutzen, um diese Intelligenzsysteme aus dem digitalen Raum in den physischen Raum zu bringen? Das ist das Thema dieses Vortrags heute. Sobald man wirklich Roboter und Menschen in derselben Welt haben will, wird es schwierig. Diese Welt ist komplex, dynamisch und vielfältig – man muss eine Vielzahl von Aufgaben bewältigen. Natürlich müssen Grundmodellen verwendet werden, die heute immer mächtiger werden, so mächtig, dass es kaum vorstellbar ist, sie nicht zu nutzen. Aber die Art und Weise, wie man sie verwendet, kann sehr unterschiedlich sein: Soll eine Nachtrainierung durchgeführt werden, sollen mehr Strukturen eingeführt werden oder soll extra Wissen hinzugefügt werden und danach wie mit den bereits vorhandenen Teilen kombiniert werden. Das sind alle noch zu entscheidenden Optionen. Es gibt noch einen Punkt, der besonders mit Robotern zusammenhängt und sich stark von der digitalen Welt unterscheidet. Die digitale Welt ist in gewissem Maße durch die Sprache vereinigt; bei den Robotern hingegen ergibt sich ein anderes Bild – verschiedene Bereiche, unterschiedliche Aufgaben, oft spezifische Szenarien und Daten, die von jedem Roboter unterschiedlich sind. Diese Daten kommen nicht in die riesigen Datensammlungen, mit denen große Modelle trainiert werden. Also stellt sich die Frage: Wie kann man diese Grenze überwinden? Nach all dem abstrakten Gerede beginnen wir mit einer völlig unkonventionellen Szene, einem ganz normalen Küchenmoment. Wir schauen uns an, was erforderlich ist, damit ein Robotik-System tatsächlich mit Menschen zusammen arbeitet – selbst in einer solchen Situation. Ein Student drückt Seife auf einen Teller, öffnet die Wasserhose und muss dann weggehen. Jetzt übernimmt der Roboter die Arbeit. Natürlich muss er zuerst eine semantische Schlussfolgerung ziehen: Welcher Teil der Keramikutensilien muss ich waschen? Es ist dieser Teller. Dieser Schritt ist heute mit einem visuellen Modell relativ einfach zu realisieren. Dann muss man sich darüber klar sein, dass nur diese Schüssel gewaschen werden muss. Das Waschgel wurde bereits hineingegossen und die Wasserhose ist an. Also muss ich die Schüssel nehmen, waschen, auf den Regalständer stellen und die Wasserhose ausschalten. Es scheint ganz klar zu sein. Aber das eigentliche Schwierige liegt darin: Wie bleibt man konstant zwischen verschiedenen Umgebungen, verschiedenen Objekten und verschiedenen Zielen. Selbst in dieser bereits einfachen Situation können mehrere völlig unterschiedliche Szenarien entstehen. Das erste ist, dass man sich an die Handlungen anderer anpassen muss. Zum Beispiel kommt jemand herein, wäscht die Teller und legt sie wieder auf den Tisch. In diesem Moment sollten Sie wissen, dass die Teller bereits gewaschen wurden und nicht noch einmal gewaschen werden müssen. Was Sie tun müssen, ist, sie wieder zurückzulegen, und es ist auch nicht notwendig, die Wasserhose zu schließen, da sie bereits geschlossen ist. Die zweite Art betrifft eine sehr feine Unterschiede im Ausgangszustand. Angenommen, alles bleibt wie vorher, der einzige Unterschied ist, dass auf diesem Teller kein Seifenspüler ist. Wenn Sie sich das ganze Bild ansehen, ist dieser Unterschied sehr klein, es handelt sich nur um eine kleine Stelle blauer Substanz, die nicht leicht sichtbar ist. Aber es ist nicht so, dass man das mit einem „kleinen Unterschied“ übernehmen kann: Es handelt sich um eine qualitative Unterschiede in der Beschreibung des Zustands. Denn wenn auf dem Teller kein Waschmittel aufgetragen wurde, sollte man ihn wahrscheinlich nicht waschen – das würde alles durcheinander bringen. Man muss erst das Waschmittel auftragen, dann waschen, anschließend auf den Teller legen und danach die restlichen Aufgaben erledigen. Der Unterschied bei der Eingabe ist gering, aber der Unterschied im Zustand ist qualitative, und die Handlungen, die ausgeführt werden müssen, sind völlig unterschiedlich. Die dritte Art ist, dass man dem ständig aktualisierten Beobachtungsstand folgen muss. Zum Beispiel nimmt der Roboter den Teller und stellt ihn auf die Theke – das ist ausreichend, denn er ist bereits sauber und muss nicht das Wasserhahn schließen. Aber unter dem Teller liegt etwas Schmutziges. In diesem Moment muss man erkennen, dass, wenn mein Ziel wirklich darin besteht, alles sauber zu halten, ich den Tisch abwischen sollte. Niemand hat dir dies befohlen; du hast es verstanden, indem du den neuen Beobachtungsprozess folgst. Idealerweise solltest du auch den Teller wieder zurücklegen; aber wir können nicht einmal diesen Schritt machen, weil die eigentliche Maschine und die von ihr beherrschten Fähigkeiten dies verhindern. Du musst also anpassungsfähig sein für alle diese unterschiedlichen Situationen. Die Frage ist nur: Wie kann man das erreichen?

02


Wenn der Roboter auch eine Sprache benötigt

In den letzten Jahren haben wir versucht, ein Format zu entwickeln. Die konkrete Umsetzung hat sich ständig verändert, weil das Grundmodell sich ändert und die Möglichkeiten ebenfalls variieren. Doch der Rumpf bleibt immer derselbe: Einerseits ist es die ursprüngliche Eingabe, ein Video oder eine Sprache; in der Mitte nutzt das Grundmodell eine Gruppe von abstrakten Elementen, die kombinierbar sind; diese Abstrakten müssen wieder verwendbar und neu kombiniert werden können, um allgemeine Aufgaben zu bewältigen; andererseits sind es die kontrollierenden Aktionen, die am besten selbst entdeckt und selbst erlernt werden sollten. Was die Erlernung der Aktionen angeht, hoffen wir, von dem sogenannten natürlichen Überwachungssystem lernen zu können. Das heißt, der gesamte Prozess wird durch Lernen und Entdeckung entstehen, und je weniger Menschen daran teilnehmen, desto besser. Was Sie ihm geben könnten, ist möglicherweise nur ein Video, eine Präsentation oder einige Sprache, und diese Eingaben können bereits jetzt verarbeitet werden. Je leichter die Überwachung ist, desto besser ist die Allgemeingültigkeit. Aber wenn man das so darstellt, taucht eine Reihe von Fragen auf das Papier. Wie sehen diese kombinatorischen Abstraktionen aus? Wie werden sie entdeckt? Woher kommt die spezielle Sprache, mit der Aufgaben beschrieben werden? Wenn Sie sie gar nicht brauchen? Wie soll das Planungssystem gelöst werden – mit einem traditionellen Aufgabenplaner oder indem man einen Planer erlernt? Außerdem: Ist das Weltmodell selbst direkt verwendbar oder muss es angepasst oder nachträglich trainiert werden? Für diese Bereiche gibt es unterschiedliche Implementierungen, und wir haben auch verschiedene Versionen ausprobiert. Ich werde zunächst die grundlegende Struktur erklären. Die erste Implementierung wurde vor zwei Jahren gemacht; die konkreten Komponenten waren damals viel rauer als heute, aber das Paradigma ist bereits klar. Angenommen, Sie haben eine Reihe von Demonstrationen. Es könnte sein, dass ein Roboter an Ort und Stelle viele verschiedene Aufgaben ausführt. Man kann während des gesamten Prozesses die Schlüsselpunkte erkennen, zum Beispiel: Im ersten Schritt das Schüsselchen ergreifen, im zweiten Schritt unter die Wasserhose gehen und im dritten Schritt auf den Regalständer legen. Es könnte auch etwas anderes sein – beispielsweise Video-Daten – jedenfalls hat man diese Gruppe von Daten in der Hand. Das Ziel ist es, die Beschreibung zu erlernen, die hinter dieser Aufgabe steht. Das ist ein wenig wie eine symbolische Weltmodelle, in der insgesamt zwei Module vorkommen. Das erste Modul sind die Eigenschaften und räumlichen Beziehungen, die Sie interessieren. Ob dieses Objekt schmutzig ist oder nicht, sauber oder schmutzig; welche Beziehung besteht zwischen diesen beiden Objekten, eine zweidimensionale oder dreidimensionale Beziehung. Solche Dinge müssen erfasst werden können, das ist eine Gruppe von Predikaten. Die Erfassung darf natürlich nicht durch menschliche Regeln erfolgen, sondern muss über Netzwerke und Grundmodellen gelehrt werden: Sie sollen lernen, beliebige Gruppen von Predikaten zu erkennen, egal ob es um Schmutzigkeit oder bestimmte räumliche Beziehungen geht. Die zweite Gruppe sind Handlungen. Sie haben eine Gruppe von atomaren Handlungen, wie zum Beispiel „Waschen“. Jede Handlung muss ihre Voraussetzungen und Nachfolgeeffekte klar beschreiben. Bei dieser Handlung muss man zuerst das Objekt in der Hand halten, und man befindet sich jetzt in der Küche; die Wirkung ist, dass das Objekt sauber wird, wenn auf seinem Körper Seifenspray vorhanden ist. Wie man erkennt, ob das Roboterhandgelenk etwas hält oder ob ein Objekt sauber oder schmutzig ist, überträgt die vorherige Kategorie die Aussagen. Um eine Handlung tatsächlich auszuführen, braucht man auch eine Strategie, also wie die Gelenke Kraft erzeugen. Auch dieser Teil ist eine neuronale Netzwerk, bei jedem Atomakt gibt es eine Diffusion-Strategie. Dadurch definiert die Symbole die Kombination: Solange die Voraussetzungen erfüllt sind, können diese atomaren Aktionen miteinander verbunden werden, um längere und komplexere Aufgaben zu erstellen. Sowohl Wahrnehmung als auch Steuerung werden von neuronalen Netzen durchgeführt. In gewisser Weise ist dies jedoch eine spezielle Sprache, ein Domain-Spezifisches Sprachsystem (DSL). Daraus ergibt sich ein sehr grundlegender Problem: In den Anfängen wurden diese Dinge entweder von Menschen geschrieben oder direkt aus PDDL und ähnlichen Quellen übernommen; das DSL war bereits festgelegt. Ist es dann allgemeingültig? Warum ist das genug? Was ist, wenn etwas fehlt? Der nächste Schritt ist also natürlich: Die DSL muss selbst erlernbar sein. Man kann das Grundmodell dazu bringen, die Daten zu prüfen, es kann sich um Demonstrationsvideos, Operationen oder Sprache handeln, und dann an das Modell sagen: Dies ist die Aufgabe, die wir berücksichtigen müssen. Anschließend sollte das Modell ausgeben: Ich halte folgende Eigenschaften wichtig, sowie diese Atomereaktionen und ihre Voraussetzungen und Nachfolgeeffekte. Was ist, wenn es falsch sagt? Man kann auch überprüfen. Einerseits kann man es symbolisch überprüfen, andererseits kann man die Daten direkt verwenden, um zu überprüfen. Zum Beispiel sagt das System, dass man das Produkt vor dem Waschen unbedingt in die Hand nehmen muss, sonst wird es nicht gereinigt. Dann geh zurück und überprüfe deine eigenen Daten: Hat ich jedes Mal, wenn ich etwas wasche, wirklich zuerst in die Hand genommen? Du kannst diese Demonstrationen oder andere Daten, offen oder privat, verwenden, um diese Spezifikationen zu überprüfen. Deshalb wurde diese Sprache selbst auch von einem anderen System entwickelt. Letztes Jahr habe ich diesen Absatz ziemlich chaotisch erklärt. In diesem Jahr hoffe ich, dass es besser wird, denn ich habe festgestellt, dass eine gute Analogie viel klarer macht. Diese Analogie befindet sich in eurem eigenen Computer. Wenn du in einem Programm-Intelligence-Algorithmus einen Satz wie „Tun dies“ einfügst, wird es selbst zehn oder acht Schritte ausführen. Im ersten Schritt erstellt es eine Datei, im zweiten Schritt führt es eine bestimmte Operation aus, und so weiter. Es gibt viele verschiedene Schritte. Wenn man darüber nachdenkt, ähnelt das sehr dem, was wir tun müssen. Was wir tun, ist im Grunde das Transferieren eines intelligenten Wesens wie Cursor, das auf dem Computer arbeitet, in den physischen Raum: Zuerst muss eine Reihe von Plänen entwickelt werden, dann müssen diese Handlungen ausgeführt werden, und gleichzeitig gibt es eine Überprüfung, um sicherzustellen, dass diese Handlungen richtig definiert und richtig ausgeführt werden. Im Grunde ist das so.

03


Was man nicht kennt, was tun mit dem Modell?

Sprechen wir jetzt darüber, wann man sich hinsetzen und Nachtrainings durchführen muss. Natürlich ist es am einfachsten, wie in der vorherigen Analogie beschrieben, direkt das Frontend-Modell bis zum Ende voranzubringen. Aber bei Robotern gibt es ein Problem, das nicht überwunden werden kann: Das, mit dem man zu tun hat, ist sehr wahrscheinlich noch nie zuvor bekannt gewesen. Denn die physische Welt ist viel fragmentierter als die digitale Welt. Man hat vielleicht schon Objekte dieser Art gesehen, aber häufiger ist der Fall, dass es Teile auf einer Produktionslinie gibt, die nur in diesem Unternehmen vorhanden sind und an anderen Orten nicht. Ich habe dieses Teil noch nie gesehen. Jetzt muss ich beurteilen, ob es schmutzig ist und ob eine bestimmte Wirkung entsteht. Offensichtlich kann man hier nicht direkt das öffentliche Frontmodel verwenden, denn es weiß nicht einmal, wie „das Teil gut oder schlecht“ ist. Deshalb gibt es tatsächlich Situationen, in denen man ein wenig Nachtrainierung durchführen muss. Voraussetzung dafür ist, dass man beschließt, sich nicht nur auf die vorhandenen Frontmodelle zu verlassen. Wie wird das gemacht? Beachten Sie ein Detail: Obwohl diese Effekte logisch erscheinen – zum Beispiel hat das Objekt Seife, nach dem Waschen wird es sauber – werden sie in der Realisierung eigentlich nur annähernd beschrieben. Die logischen Operationen existieren meist in Form von Wahrscheinlichkeiten. Daher können Sie den gesamten Pfad zusammenfassen: Ich sage, dass das Objekt Seife hat, ich wasche es, dann sollte es sauber sein. Aber was ist mit dem Kriterium für „ob das Objekt Seife hat“? Wenn dieses Kriterium nicht gut ist, wie dann? Da es sich um ein völlig unbekanntes neues Objekt handelt, konnte es nicht erkannt werden, und die Ausgabe war falsch – anschließend waren alle Ergebnisse falsch. In diesem Moment zeigte mir die Demonstration eine andere Tatsache: Das Objekt war tatsächlich sauber. So bekam man einen Label. Da alle Ausführungsschritte diskret aufgebaut sind, kann man den in der Demonstration verwendeten Ausführungs-Label verwenden, um in Richtung zurückzugehen und dem Modell eine Überwachung zu geben. Somit ist das nachfolgende Training unter bestimmten Bedingungen möglich. Es ist nicht notwendig, aber wenn man diese Modelle als Module im System betrachtet und sie nach dem Nachtrainieren benötigt werden, dann ist dieser Weg möglich. Über die Ergebnisse von vor zwei Jahren werde ich nicht weiter sprechen. Das Set von Komponenten ist jetzt veraltet und nach der Änderung der Methode fühlt man sich an einigen Stellen etwas schlampig vorgegangen. Aber das Paradigma selbst hat großen Potenzial. Später haben wir die verschiedenen Komponenten jeweils durch modernere Versionen ersetzt. Übrigens ist ein Postdoc, der damals an dieser Arbeit beteiligt war, heute Professor an der Nationaluniversität von Singapore. Ein anderer Koautor war ein Doktorand am MIT und ist auch heute ein Professor.

04


Schon das Planen wird an das Modell übergeben

Nun werde ich einige nähere Fortschritte erzählen, und ich spreche schneller. Wie bereits erwähnt, entstanden die Module im System Schicht für Schicht, und Verifizierung, Wahrnehmung und Steuerung wurden alle an das neuronale Netz übergeben. Aber eines fehlt noch: die Planung. Wenn du alle Module hast und den Zustand verifiziert hast, sollte ich zuerst was Waschen oder etwas anderes tun? Dieser Schritt wurde damals mit traditionellen Methoden durchgeführt, basierend auf der Tradition des Aufgabenplаниrns. Und kürzlich haben wir gerade eine Arbeit veröffentlicht, die speziell diesen Teil auch ersetzt. Das ist auch der Grund, warum ich heute keine besonders guten Präsentationen habe. Eigentlich hätte ich ein Video haben sollen, und ich möchte wirklich ein Video. Also: Optimistisch gesagt, werden wir in ein paar Tagen ein schönes Video haben. Im Moment kann ich nur eine Abbildung aus dem Paper verwenden. Die Idee ist folgende: Sie haben immer noch eine Gruppe von Zuständen, die von einem neuronalen Netzwerk überprüft werden; aber die Frage „Welchen Schritt soll ich zuerst machen – wasche oder nehme den Teller –“ wird nicht mehr dem traditionellen Planer überlassen, sondern dem Netzwerk. Mehr konkret gesagt: Die Gruppe der Prediktionen ist jetzt im Grunde genutzt natürliche Sprache – echte natürliche Sprache. Man füttert das Grundmodell mit natürlicher Sprache und Bildern als Anweisungen, damit es Planungen durchführt. Aber es muss auch nach dem Training weiter trainiert werden. Deshalb müssen wir hier ein Open-Source-Weight-Modell verwenden, weil das Training anschließend erfolgen muss; gleichzeitig muss das Modell Bilder als Teil der Eingabe verarbeiten können. Und es zeigte sich, dass die visuelle Schlussfolgerungsfähigkeit bestimmter Open-Source-Modelle immer noch sehr schlecht ist. Zumindest sind sie bei Weitem nicht so gut wie die zeitgleich verfügbaren Closed-Source-Modelle. Wenn man sie also direkt verwendet, liefern sie oft Dinge, die völlig unlogisch sind. In der Praxis haben wir einige Modelle einfach über Nachtrainings behandelt. Auf diese Weise wurde sogar der Planer selbst durch Nachtrainings und durch das Erlernen entwickelt. Er kann diese Art von symbolischer natürlicher Sprache verwenden, um Pläne zu erstellen, und die erzeugten Handlungssequenzen haben eine viel höhere Ausführungswahrscheinlichkeit. Für solche langfristigen Aufgaben bedeutet das, dass weniger menschliche Intervention erforderlich ist. Es gibt noch eine weitere Herausforderung: Alles hängt von der Fähigkeitsdatenbank ab, und die Fähigkeitsdatenbank jedes Roboters kann unterschiedlich sein. Wenn man direkt ein bestimmtes fortschrittliches Modell verwendet, hat es keinen Kontext mit Ihrer Fähigkeitsdatenbank. Zum Beispiel würde es sagen: „Jetzt müssen Sie den Wasserhahn benutzen, um den Becher zu füllen“, aber der Wasserhahn wird überhaupt nicht geöffnet. Diese Aktion ist daher nicht ausführbar. Nach dem Training wirkt das Planer bei solchen langfristigen Operationen eher wie etwas, das tatsächlich ausgeführt werden kann. In ein paar Tagen haben wir Videos, aber fürs Erste schauen wir uns die neuesten Ergebnisse an. Bis jetzt gehen wir immer davon aus, dass wir Demonstrationen zur Hand haben – egal ob in Form von Videos oder menschlicher Handlung. Was ich im Rest der Zeit sagen möchte, ist: Was ist, wenn es keine Demonstration gibt? Wenn ich auf etwas ganz Neues stoße, das ich noch nie gesehen habe? Die alte Vorgehensweise war: Sie sollten mir eine Demonstration geben und mir zeigen, wie man mit diesem Objekt umgeht. Aber ist es möglich, dass ich ohne ein Video oder irgendeine Hilfe von jemandem alle möglichen Methoden zur Bedienung dieses Objekts selbst erfinden kann? Zum Beispiel: Vor Ihnen liegt eine Gruppe neuer Objekte. Wir haben zuvor gezeigt, wie man die Wasserhose öffnet. Aber ich habe diese Wasserhose noch nie benutzt. Können Sie einige Beispiele erstellen und mir zeigen, welche Methoden es gibt, um mit ihr zu interagieren? Das ist auch eine Aufgabe, die wir erforschen. Formulieren wir es zunächst grob. Angenommen, wir haben nur ein stillstehendes Objekt – eine Wasserhose oder eine Box. Könnte man ein System entwickeln, das aus diesen stillstehenden Objekten eine Verteilung abbildet und anschließend aus dieser Verteilung einen möglichen Raum abgräbt? Wenn man ihm eine Wasserhose gibt, erzeugt er eine drehbare Form; wenn man ihm eine Box gibt, erzeugt er Öffnen und Schließen sowie alle anderen verschiedenen Formen. Die konkrete Methode werde ich heute kurz skizzieren, um die Zeit aller Teilnehmer zu schonen. Aber das Ergebnis ist: Sobald man dieses System erlernt hat, kann man in eine völlig neue Umgebung eintreten. Auf einer Menge verschiedener Objekte kann ein Modell die möglichen Interaktionen erkennen. Bildschirme, USB-Sticks, Blumen – alles ist dabei. Und das Ergebnis ist nicht eine harte Wiederholung der Antworten, sondern die grundlegende Fähigkeit, die man erlernt hat: Wie kann ich dieses Objekt noch verwenden? Und in der realen Welt? Wenn ein Roboter einen Raum betritt, ist seine Wahrnehmung sehr chaotisch. Deshalb haben wir noch eine andere Aufgabe erledigt: Ein Student sollte das iPhone verwenden, um den Raum zu scannen. Das iPhone kann zwar 3D-Scans durchführen, aber die Genauigkeit ist nicht hoch. Was dabei herauskommt, ist sehr laut und sehr groß, wie eine Masse von Flüssigkeiten. Selbst wenn wir diese extrem lauten Ergebnisse als Eingabe in unser System geben, stellt sich heraus, dass es etwas wie Zero-Sample-Generalisierung hat: Es kann darüber abwägen, wie man mit einer Spülmaschine, einem Kühlschrank oder einem Mikrowellenherd umgehen kann. Das wäre für Roboter viel nützlicher. Da der Roboter in ein Raum geht, den man noch nie gesehen hat, wird er trotz des chaotischen Eingangs sagen: „Diese spezielle Wasserhose habe ich noch nie gesehen, aber ich kann verschiedene Methoden erkennen, wie ich mit ihr umgehen kann, ich kann verschiedene Handhabungswege vorstellen und dann eine Strategie mit diesem Ding entwickeln.“ Das Gleiche gilt für das Büro. Das Rekonstruktionsergebnis ist genauso überflüssig, aber es kann erkennen, wie man mit einem Laptop umgeht. Allerdings gibt es bei dieser Erkenntnis noch ein Problem. Es kann vierzig verschiedene Wege anbieten, um mit diesem Objekt interagieren zu können. Aber du solltest eigentlich ein bestimmtes Ziel erreichen – du weißt nicht, welcher von diesen vierzig Methoden wirklich für dich nützlich ist. Deshalb fragen wir uns auch, ob man dieser Paradigma-Struktur sprachliche Bedingungen hinzufügen könnte, damit wir sie besser kontrollieren können. Zum Beispiel: Ich habe eine stabile Szene und ich gebe eine Aussage in der Sprache: „Ein Kind springt auf dem Schaukelpferd.“ Können wir aus dieser Aussage eine bewegliche dreidimensionale oder vierdimensionale Szene erzeugen? So gibt es Interaktionen zwischen Menschen und Objekten, sowie Bewegungen auf beiden Seiten, nachdem Kinder darauf springen. Das ist viel nützlicher, denn man kann weiter fragen: Wie sollte der Roboter mit diesem Objekt interagieren? Man generiert dann, kann in diese oder jene Richtung generieren und anschließend die Handlung auswählen, die wirklich hilft, das Problem zu lösen. Wie wird das erreicht? Es ist immer noch auf eine große Anzahl von vortrainierten Generationsmodellen angewiesen. In dieser Arbeit verlassen wir uns hauptsächlich auf Video-Diffusion-Modelle. Angenommen, Sie haben dieses statische Szenario – es kann sehr chaotisch sein. Sie können es in eine mittlere Darstellung mit Tausenden von Punkten umwandeln und anschließend eine weitere Dimension hinzufügen, nämlich die Zeit. So erhalten Sie eine vierte Dimensionale Darstellung. Aber wenn man die dreidimensionale Darstellung direkt in eine vierte Dimension überführt, bleibt sie statisch – wie können Sie sie dann bewegen? Es gibt eine Lösung dafür. Wenn Sie nur eine statische Form haben und wollen, dass sie realer wird, gibt es eine Technik namens Score-Distillation-Sampling (SDS). Die übliche Vorgehensweise in dreidimensionalen Bereichen ist folgende: Man renderiert die Form, erhält Videos aus verschiedenen Blickwinkeln und sendet sie an das Video-Diffusion-Modell, um sie entlang der Zeitrichtung zu aktualisieren. Dasselbe kann auch in vierdimensionaler Form durchgeführt werden. Praktisch ist dies sehr schwierig – man muss viele Probleme lösen und eine strukturierte Datenstruktur für die vierdimensionale Repräsentation entwickeln. Aber konzeptionell geht es darum, mit dem Video-Modell und dem vortrainierten Diffusion-Modell zu arbeiten, um Interaktionssequenzen zwischen Menschen und Objekten oder zwischen Robotern und Objekten zu erstellen. Nennen wir noch zwei Beispiele. Wenn Sie beispielsweise einen Ziegel haben und eine Aussage wie „Der Roboter nimmt den Ziegel“ hinzufügen, kann das eine interaktive Sequenz des Roboters, der den Ziegel nimmt, erzeugen, sodass Sie sehen können, wie diese Interaktion aussieht unter einer anderen Sprachbedingung. Sie können auch einige kostenlose Demonstrationen hinzufügen und von diesen kostenlosen Demonstrationen lernen. Früher musstest du zunächst einen menschlichen Bedienvideos oder遥operativen Daten haben, um Fähigkeiten zu erlernen und sie in die Planung einzubeziehen; jetzt kann ich sogar keine menschliche Demonstration verwenden, sondern selbst Demonstrationen erstellen und von diesen Demonstrationen Fähigkeiten lernen. Nachdem ich sie erlernt habe, setze ich sie wieder in das ursprüngliche Trainingsrahmenwerk ein. Es muss nicht unbedingt für Roboter verwendet werden. Das Ballstoßen gegen den Schläger und das Springen des Katers auf die Polsterung können alle gemacht werden. Aber wir haben es tatsächlich auch für Roboter verwendet. Zum Beispiel gibt es ein Stück Stoff. Du sagst, eine Sequenz zu generieren, in der ein Mensch mit diesem Stück Stoff interagiert und das Stück Stoff ausbreitet. Links ist das generierte. Da es generiert ist, erhält man eine Gruppe kostenloser Demonstrationen, und man kann die dichte Trajektorie der Punkte auf der Fläche in drei Dimensionen erhalten, die im Laufe der Zeit in drei Dimensionen verfolgt wird. Diese Dinge werden zu einer Gruppe kostenloser Überwachungsziele, die dem Roboter zeigen: Ich möchte dieses Objekt so bewegen. Rechts ist das, was ein echter Roboter versucht, dasselbe zu tun. Von der Vorstellung ausgehend, lässt man das Diffusionmodell einen Leitfaden geben und betrachtet seine Ausgabe als erfolgreichen Ziel – dann lernt man eine Strategie, um dies zu tun. Noch ein Beispiel ist das Schließen des Laptops. In letzter Zeit haben wir auch etwas getan, um ihn schneller zu machen. Denn bei diesen Methoden ist es sehr langsam, wenn man mit den Diffusion-Units arbeitet, und es ist noch langsamer, bei der Vierdimensionalen Fractional Distillation. Deshalb haben wir Caching und Semantische Rendering verwendet, um den Prozentsatz einer erfolgreichen Aktualisierung zu erhöhen, sodass man nicht so oft das Video-Modell aufrufen muss. Auf diese Weise kann man Demonstrationssequenzen mit längerer Dauer erstellen. Vorher hätte ich vielleicht nur eine Demonstration erstellt, in der der Roboter Ziegeln nimmt oder das Notizbuch schließt – das war eine Demonstration zur Erlernung von atomischen Fähigkeiten. Jetzt ist es noch kein Roboter, aber es gibt keinen Grund, warum das nicht möglich wäre. Man kann sehr lange Abfolgen erzeugen, die völlig andere Aufgaben bewältigen können. Das, was man dann bekommt, ist nicht nur eine kostenlose Demonstration von atomischen Fähigkeiten, sondern eine kostenlose Demonstration von komplexen langfristigen Operationen, die fast unbegrenzte Daten für das Fähigkeitstraining liefern können. Okay, ich halte hier mit.

05


Struktur ist nicht die Antwort, sondern eine Steindecke

Wenn man zurückblickt, haben wir immer darüber gesprochen, wie man diese strukturierten Repräsentationen findet. Man wird feststellen, dass mit der Zeit immer mehr solche Dinge auftauchen. Heutzutage hat fast jedes Teil bereits seine Repräsentation, aber man behält immer noch die mittlere Repräsentation bei. Sie existiert jetzt fast in Form einer Sprache – natürlich gibt es dahinter eine Szenario-Repräsentation, was das gesamte System verständlich macht.

Wir haben auch immer darüber nachgedacht, wie man es mehr universell machen kann und wie man nicht an bestehende Objekte oder bestehende Demonstrationen gebunden wird.

Über den Begriff „Structure“ möchte ich noch etwas sagen. Wenn andere zu dir über Struktur sprechen, ist es leicht, das als etwas anderes zu verstehen: Man will die Struktur fest in das System einbauen. Das ist nicht gut und ist auch nicht das, was wir tun. Wir fragen uns, ob man diese Schnittstelle nutzen kann, um dem System effizienter zu helfen; sie ist wie eine externe Leitplanke und ermöglicht gleichzeitig eine Kommunikation zwischen Menschen und dem System. Im Grunde nutzt du die durch Daten verstärkten Modi, insbesondere Videos, aber auch Sprache sowie die dreidimensionalen und vierdimensionalen Informationen, die du erhalten kannst. Doch letztendlich geht es dir um etwas anderes: Wie ermöglichen diese strukturierten Repräsentationen uns eine reasoningfähige Fähigkeit. Du hast atomare Repräsentationen – ich werde sie waschen, ich werde sie platzieren, ich werde diese Dinge tun; dann geht es weiter darum, welche Abhängigkeiten zwischen diesen Aufgaben bestehen und welche Auswirkungen sie haben. Was Sie wirklich dazu bringt, langfristige Probleme zu lösen – und zwar auf eine sehr allgemeine Weise – ist genau das. Vielen Dank.

Um allen eine gemeinsame Plattform für Austausch und Kommunikation über Konferenzen zu bieten, haben wir eine spezielle Gruppe für die Teilnahme an IROS2026 aufgebaut! Welche „Vorteile“ werden Sie in der Gruppe erhalten?

  • Konferenz-Informationen-Portal: Einreichungen, DDL, Formatvorgaben, Prüfungsfortschritt … wichtige Informationen werden sofort bereitgestellt – keine Angst mehr vor Verpassten Deadlines, die Vorbereitung der Einreichungen ist sicher.

  • Gruppenbesprechung: Alle Kollegen aus allen Ecken sind im Gruppenchat. Wir tauschen Erfahrungen aus, besprechen Ideen und knüpfen Kontakte – auf dem Weg der wissenschaftlichen Forschung sind wir alle gemeinsam unterwegs.

  • Führende Versorgungsstation: Aktuellste Forschungsergebnisse und aktuelle Schwerpunkte werden in Echtzeit synchronisiert. Kombiniert mit dem Konferenzthema hilft es Ihnen, die Struktur Ihrer Veröffentlichung klar zu gestalten und Ihnen Inspiration für Ihren Artikel geben.

  • Stadion-Supporter-Team: (ausschließlich während der Veranstaltung aktiv):Im Saal braucht man sich nicht zu beeilen –

    Route-Anleitung: Verteilung der Veranstaltungsorte, wie man zum Reportraum kommt – fragen Sie im Gruppenchat jederzeit;

    Thema gemeinsames Lesen: Populäre Sitzungen und Keynotes können auch nachgeholt werden, wenn man sie verpasst;

    Poster-Compilation: Zusammenfassung der wichtigsten Plakate auf der Veranstaltung, einfach speichern – ohne etwas zu verpassen;

    Yueju Plaza: Essensveranstaltungen, Interviewzentren, Kommunikationszentren …… Wenn man reden, zusammenarbeiten oder persönlich treffen möchte, kann das in der Gruppe durchgeführt werden.

? Einstiegslink zur Gruppe: Scannen Sie den Code, um in die Gruppe einzutreten, oder fügen Sie Luyoyo_2026 hinzu, und geben Sie im Kommentar an: ECCV + Institution/Universität + Name + Forschungsrichtung.

Bei wissenschaftlichen Forschungen oder Technikarbeit ist Informationenklärung sehr wichtig.

Komm, machen wir einen Schritt voraus!

Steig ein, ich zeige dir die wichtigsten Konferenzen im Bereich KI auf der Welt

Exklusives Zugangssystem:

Experten-Vortrag PPT

Vollständiger Bericht der Konferenz

Interpretation der beliebten Artikel

Interview mit der akademischen Newstar

Scannen Sie das QR-Code oben

Oder klicken Sie auf „Originalartikel lesen“, um sich in der Spezialsektion zu followen.

Artikel von Leifengwang, ohne Genehmigung nicht vervielfältigt werden dürfen. Weitere Informationen finden Sie unter Anweisungen zur Verbreitung.

Originalquelle

雷峰网 AI

Hinweise zum Inhalt

Originalveröffentlichung und Rechte liegen bei der Quelle.

Maschinelle Übersetzung · Original beachten