Autor: Ma Xiaoning
Redaktion丨Cen Feng
Am 27. September wird die IROS 2026 in Pittsburgh eröffnet. Nach 31 Jahren kehrt die IROS in diese Stahlstadt zurück. Als eine der größten robotischen Fachkonferenzen der Welt sind dieses Jahr 1933 Paper in das offizielle Programm aufgenommen worden. Betrachtet man diese fast zweitausend Paper im Ganzen, erscheinen sie eher als ein Querschnitt der Robotikforschung des Jahres 2026: von Reinforcement Learning und Imitation Learning über Pfadplanung, visuelle Wahrnehmung, Bewegungssteuerung und Geschicklichkeitsmanipulation bis hin zu Humanoiden Robotern, Haptik und großen Modellen – fast alle wichtigen technologischen Entwicklungsrichtungen der Robotik der vergangenen Jahre tauchen gleichzeitig in dieser Landkarte auf. Doch die eigentlich bemerkenswerten Schlagwörter sind nicht diejenigen, die leichter die Aufmerksamkeit von Industrie und Medien auf sich ziehen, wie Humanoid, VLA oder World Model. Eine Multi-Label-Auswertung der 1933 Paper zeigt: Etwa 809 Paper sind den Bereichen Robot Learning / Embodied AI zuzuordnen, 564 Navigation / Planning, 556 Perception / Vision, 546 Control / Dynamics, 520 Manipulation, während etwa 213 Paper mit Humanoid / Legged in Verbindung stehen. Da ein Paper mehrere Richtungen gleichzeitig betreffen kann, lassen sich diese Zahlen nicht einfach addieren, aber sie zeigen eines: Die Robotikforschung ist durch den Einzug großer Modelle nicht zu einem einheitlichen „KI-Problem“ zusammengefasst worden. Im Gegenteil – Lernen, Wahrnehmung, Planung, Steuerung und Manipulation sind mit noch nie dagewesener Dichte miteinander verwoben. Vor dem Hintergrund des umjubelten AGI-Hypes senden diese fast zweitausend Paper jedoch ein Signal:Große Modelle haben nicht“auffressen”Robotik.Ganz im Gegenteil: Nach zwei Jahren rasanter End-to-End-Entwicklung erlebt die Robotikforschung durch eine „Renaissance der Mittelschicht“ aus dreidimensionaler Geometrie, symbolischer Reasoning und underlying Control den Versuch, in Pittsburgh die von Pixeln und Tokens überdeckte physische Seele wiederzufinden.“ Die wirklich lohnende Frage zu IROS 2026 ist vielleicht nicht, „ob große Modelle die traditionelle Robotik verdrängen“, sondern ob die Robotikforschung in eine komplexere Systemphase eintritt.
01
Die KI hat die traditionelle Robotik nicht ersetzt,
sondern darin, sie wieder einzufügen
Wenn man die Überschneidungen zwischen diesen Papern genauer betrachtet, wird deutlicher, was sich durch das Eintreten großer Modelle in die Robotik tatsächlich verändert hat. Etwa 276 Paper behandeln Robot Learning gemeinsam mit Manipulation, 261… 269 kreuzen sich mit Perception, 225 mit Navigation / Planning, und ebenfalls 221 mit Control / Dynamics. Lernmethoden haben die ursprünglichen technischen Module der Robotik nicht einfach verdrängt, sondern sind zunehmend tiefer in diese traditionellen Fragestellungen eingebettet. Diese Veränderung zeigt sich zunächst in der Planung. Jorge Mendez-Mendez von der Stony Brook University sagte in „A Systematic Study of Large Language Models for Task and Motion Planning with PDDLStream“ In der Studie wurde das Verhalten getestet, das entsteht, wenn große Sprachmodelle in klassische Task-and-Motion-Planning-Frameworks eingebettet werden. Die Forschung kommt nicht zu dem Schluss, dass „große Modelle den Planer direkt ersetzen können“, sondern zeigt vielmehr, dass geometrische Randbedingungen, Bewegungsdurchführbarkeit und Ausführungslogik weiterhin die Beteiligung traditioneller Planungssysteme erfordern. Dies ist sehr bezeichnend. Ein LLM kann verstehen, was „bring die Tasse auf die andere Seite des Tisches“ bedeutet, aber wenn der Roboter die Aufgabe tatsächlich ausführt, müssen dennoch Fragen beantwortet werden: ob der Roboterarm kollidiert, ob die Gelenke erreichbar sind, ob der Pfad ausführbar ist und ob sich die aktuelle Umgebung verändert hat. Die Frage verschiebt sich damit von „kann ein LLM den Planner ersetzen?“ zu der Frage, wie die Arbeitsteilung zwischen beiden aussehen sollte. Ein ähnliches Phänomen zeigt sich auch auf der Wahrnehmungsseite der VLA. Die unter die Best Paper Kandidaten von IROS 2026 im Bereich Cognitive Robotics gekommenen GeoVLA: Befähigung 3D Repräsentationen in Vision-Language-Action-Modellen, durchgeführt von einem Team der Tianjin-Universität, von Yuanli Lingji und der Tsinghua-Universität; zu den Autoren gehören von Yuanli Lingji dieXie Bin, der Tsinghua-UniversitätShi Haousw. Es richtet sich genau gegen das Problem, dass bestehende VLA-Modelle zu stark auf zweidimensionale visuelle Informationen setzen: Traditionelle VLA-Modelle erzeugen Aktionen in der Regel direkt aus RGB-Bildern und Sprachanweisungen, doch reale Roboter bewegen sich in einer dreidimensionalen Welt – Änderungen der Objekthöhe, der Größe und des Kamerablickwinkels können das Greifen direkt beeinträchtigen. GeoVLA vergrößert das Modell nicht einfach weiter, sondern führt explizit Tiefen- und dreidimensionale Geometrieinformationen ein und nutzt die 3D-Repräsentation gemeinsam mit den visuell-sprachlichen Merkmalen zur Aktionsgenerierung. Mit anderen Worten: Nachdem die großen Modelle stärker geworden sind, wird die traditionsreichste „räumliche Geometrie“ der Robotik wieder nachgereicht. Ähnliches zeigt sich auch auf der Steuerungsseite. Ein Team der University of Central Florida, des Indian Institute of Technology Kanpur, der University of Bath und der University of Maryland, College Park hat Training schneller Roboter-Richtlinien mit langsamen Foundation-Modellenbefasst sich mit einem sehr praktischen Problem: Große Foundation Models bieten stärkeres Wissen und Generalisierung, aber die Inferenzgeschwindigkeit ist zu langsam, um dauerhaft in der Hochfrequenz-Regelungsschleife eines Roboters zu laufen. Deshalb lassen die Forscher die großen Modelle stärker am Training teilhaben und lernen anschließend eine leichtere, schnellere Roboterstrategie, die für die tatsächliche Ausführung zuständig ist. Wenn ein Sprachmodell erst ein paar hundert Millisekunden später antwortet, empfinden Nutzer das meist nur als leicht verzögerte Reaktion; wenn ein Roboter beim Greifen, beim Kontakt oder beim Halten des Gleichgewichts erst ein paar hundert Millisekunden später handelt, kann die Aufgabe bereits gescheitert sein. Modellfähigkeit und Echtzeitsteuerung sind eben nie dasselbe Problem. Die haptische Forschung, die näher an der physischen Welt liegt, zeigt eine ähnliche Richtung. Von der University of Colorado DenverFang Xinmindie in Zusammenarbeit mit einem Team der Kennesaw State University erstellt wurden DexTact: Ein visuo-taktiler Foundation Model für das Greifen mit dexterer Handund bringt visuelle und taktile Wahrnehmung gleichzeitig in das Problem des Greifens mit der anthropomorphen Hand ein. Gegenstand der Forschung ist dabei nicht mehr nur die Frage, „wie das Bild dem Roboter sagt, wo sich das Objekt befindet“, sondern vielmehr, „was das System noch wahrnehmen kann, nachdem die Hand das Objekt berührt hat“. Hier werden Foundation Model, Taktik, geschickte Manipulation und Steuerung in ein und demselben System verstanden. Daher ist die wirklich bemerkenswerte Veränderung im Jahr 2026 nicht, dass die Robotik gerade durch KI ersetzt wird. Genauer gesagt beginnt die KI, in die traditionellsten Bereiche der Robotik einzudringen, während sie zugleich von diesen traditionellen Problemen selbst neu geformt wird.02
VLA geht von der Phase „Beweis, dass es funktioniert" in die Phase „Schwächen ausgleichen" über
Wenn die Kernfrage bei VLAs in den vergangenen zwei Jahren noch darin bestand, „ob ein einheitliches Modell visuelle und sprachliche Informationen verstehen und direkt Roboteraktionen generieren kann“, dann hat sich der Forschungsschwerpunkt bis zur IROS 2026 klar in eine andere Richtung verlagert: Da die Modelle es nun können, besteht die nächste Aufgabe darin, sie schneller, stabiler und besser für echte Roboter geeignet zu machen. In unserer Multi-Label-Statistik gibt es rund 162 Arbeiten zu VLA, VLM, LLM und Foundation Models, was 8.4 % aller Beiträge entspricht; davon befassen sich etwa 82 Arbeiten ausdrücklich mit VLA. Diese Größenordnung reicht aus, um eine eigenständige Forschungshauptlinie zu bilden. Doch die behandelten Fragen drehen sich längst nicht mehr darum, „ob das Modell noch größer werden kann“, sondern verzweigen sich rasch in Themen wie Effizienz, 3D-Verständnis, Langzeitgedächtnis, Perspektivwechsel, Anpassung an reale Umgebungen und Sicherheit. Das unmittelbarste Beispiel dafür ist Shallow-π: Wissensdestillation für Flow-basierte VLAsDieses Paper stammt von 42dot, der Seoul National University und Samsung Research und ist für den IROS 2026 Best Paper / Best Student Paper Award nominiert. Es löst nicht das Problem, wie man ein noch größeres VLA trainiert, sondern genau das Problem, dass die Modelle zu groß und die Inferenz zu langsam sind, indem es das VLA durch Wissensdestillation komprimiert und das Modell dadurch besser für den Einsatz auf realen Robotern und Edge-Geräten geeignet macht. Damit wird die erste reale Einschränkung offengelegt, der VLA in der Robotik gegenüberstehen: Das Modell muss nicht nur „schlau“, sondern auch schnell genug sein. Ein weiterer Schwachpunkt ist das räumliche Verständnis in drei Dimensionen. Das zuvor erwähnte GeoVLA der Teams der Tianjin University, Yuanli Lingji und Tsinghua本质上 füllt im Kern genau die klassischste Fähigkeit der Robotik auf: Geometrie. Sogar der Perspektivwechsel selbst ist bereits zu einem eigenständigen Problem geworden.AnyCamVLA: Zero-Shot-Kamera-Adaption für blickpunktrobuste Vision-Language-Action-Modelle Forschungsteams der Seoul National University und des MIT. Gegenstand der Untersuchung ist, warum ein bereits trainiertes VLA leicht versagt, wenn sich die Kameraposition ändert, und ob eine Anpassung an einen neuen Kamerablickwinkel möglich ist, ohne das gesamte Modell neu zu trainieren. Im realen Einsatz sind Kameramontagefehler, Unterschiede bei den Roboterplattformen und Blickwinkeländerungen sehr häufig; ein Policy, das nur unter einem festen Blickwinkel funktioniert, kann kaum wirklich generalisieren. Langzeitaufgaben legen hingegen eine andere Art von Lücke offen: Das Modell führt Aktionen aus, sammelt aber nicht unbedingt Erfahrungen.Langzeitgedächtnis für VLA-basierte Agenten bei der Aufgabenausführung in der offenen Welt Von Teams der Nanjing-Universität, der Waseda-Universität, LimX Dynamics und der Zhejiang-Universität entwickelt, wobei das Langzeitgedächtnis direkt in den VLA Agent integriert wird, damit das System bereits absolvierte Trajektorien und Erfahrungen speichern und später wieder abrufen kann. Hier geht es nicht mehr darum, ob ein einzelner Griff gelingt, sondern ob der Roboter bei langen Prozessabläufen daran erinnern kann, „was zuvor passiert ist". Von der Sungkyunkwan-Universität stammen RoboBRIDGE: Ein modulares Framework zur Übertragung von Politiken auf robuste reale Roboteragenten Es geht einen Schritt weiter. Statt ein stärkeres VLA neu zu trainieren, wurden Monitor, Perceptor, Planner, Controller und Robot Interface um die vortrainierte Strategie herum ergänzt. Wenn die Ausführung fehlschlägt, erkennt der Monitor das Problem; ändert sich die Umgebung, plant der Planner neu; der Perceptor aktualisiert das Szenario; und der Controller übersetzt die übergeordnete Strategie in konkrete Aktionen. Diese Struktur zeigt sehr gut, was sich in der nächsten Phase der VLAs ereignet. Die Forschung beginnt, sich von „einen stärkeren Action Predictor bauen“ dahingehend zu verlagern, wie man um ihn herum ein vollständiges System aufbaut. Der nächste Wettbewerb bei VLAs könnte daher nicht nur um Skalierung gehen. Die größere Frage wird zunehmend Systemtechnik:Wie ein VLA mit Wahrnehmung, Gedächtnis, Planung, Steuerung und Hardware zusammenarbeitet und sich schließlich von einem Modell, das Aktionen ausgeben kann, zu einem Robotersystem entwickelt, das über lange Zeit laufen kann.03
Roboter bekommen die „mittlere Schicht“ neu
Wenn die erste Phase der VLA darin bestand, Wahrnehmung, Sprache und Aktion in einem Modell zu vereinen, dann ist ein weiterer, immer klarer erkennbarer Forschungsfaden der IROS 2026 Folgender: Forscher beginnen wieder aktiv, neue Strukturen in die Mitte dieser End-to-End-Pipeline einzufügen. Von den 1933 Paper sind rund 119 Paper zu Reasoning / Memory, was 6.2 % aller Paper ausmacht; davon befassen sich 64 explizit mit Reasoning und 36 mit Memory. Daraus haben sich bereits einige sehr klar definierte Sessions gebildet, darunter Agents and Memory for Robust VLA Manipulation, Constraint-Guided Reasoning for Long-Horizon Manipulation, LLM Agents Reasoning Through Robot Tasks und Representing 3D Space for Robot Reasoning. Das allein wirft eine Frage auf: Wenn End-to-End-Modelle bereits direkt aus visuellen und sprachlichen Eingaben Aktionen generieren können, warum benötigen Roboter dann Reasoning, Memory und Planner, oder führen sogar wieder Symbolic Constraints und eine explizite 3D-Repräsentation ein? Ein Grund dafür ist, dass sobald Roboteraufgaben länger werden, die Frage „was wird im aktuellen Frame gesehen“ nicht mehr ausreicht.TempoFit: Plug-And-Play Layer-Wise Temporal KV Memory für Long-Horizon VLA-Manipulation Vom Team der Xi’an Jiaotong-Liverpool-Universität stammt dieser Ansatz: Statt ein noch größeres VLA neu zu trainieren, nutzt er das temporal KV memory innerhalb des Modells, damit eine bestehende Politik historische Informationen über die Zeit hinweg speichern und abrufen kann. Was ein Roboter aber wirklich behalten muss, ist ebenfalls nicht nur, „was er in der Vergangenheit gesehen hat“. Vom Team der Tokyo University of Science GaussMemory: Task-Driven 3D Gaussian Scene Memory für Long-Horizon Robotic Manipulation, um das Gedächtnis (Memory) weiter in den dreidimensionalen Raum einzubetten. Ein Objekt darf nicht einfach aus der „Welt“ des Roboters verschwinden, nur weil die Kamera es in diesem Moment nicht sieht, wenn es vorübergehend verdeckt ist; ein bereits verschobenes Objekt muss außerdem zeitnah seine Position aktualisieren. Daher ist das Memory in Robotern nicht völlig identisch mit dem Kontextgedächtnis in Sprachmodellen. Es muss kontinuierlich dem realen dreidimensionalen Raum entsprechen. Dasselbe gilt für das Inferenzproblem.DualCoT-VLA: Visual-Linguistic Chain of Thought durch paralleles Reasoning für Vision-Language-Action-Modelle Diese Arbeit wurde gemeinsam von der Hong Kong University of Science and Technology (Guangzhou) und einem Huawei-Team verwirklicht. Sie begnügte sich nicht damit, das VLA direkt Aktionen ausgeben zu lassen, sondern fügte vor der Aktionsgenerierung einen visuellen Chain-of-Thought und einen sprachlichen Chain-of-Thought ein: einer verarbeitet räumliche Beziehungen, der andere die übergeordnete Aufgabenlogik. Die „High-Level–Low-Level“-Aufteilung, die das End-to-End-Modell ursprünglich einzusparen versuchte, kehrte damit in anderer Form zurück. Als Kandidat für den Best Paper Award im Bereich Cognitive Robotics nominierte VL-Nav: Ein neuro-symbolischer Ansatz für reasoning-basierte Vision-Language-Navigationwurde hauptsächlich von einem Team der University at Buffalo (State University of New York) erstellt; Erstautor istDu Yi. VL-Nav kombiniert die semantische Verständniskapazität von Vision-Language-Modellen mit expliziter räumlicher und symbolischer Schlussfolgerung für Vision-Language-Navigation in komplexen Umgebungen. Das Wiederaufkommen symbolischer Methoden bedeutet nicht, dass die Robotik in ein rein regelbasiertes Zeitalter zurückfällt. Sie übernimmt denjenigen Teil der Aufgaben, den große Modelle derzeit noch nicht stabil beherrschen: Räumliche Beziehungen, Ausführungsbedingungen und Constraints deutlicher zu machen. Von Memory und Reasoning bis hin zu Geometry, Planner und Symbolic Constraint nutzen diese Arbeiten oberflächlich betrachtet unterschiedliche Techniken, lösen aber alle dasselbe strukturelle Problem: Zwischen dem semantischen Verständnis auf hoher Ebene und den kontinuierlichen Aktionen auf niedriger Ebene besteht eine enorme Distanz. Die auf der IROS 2026 präsentierten Arbeiten zu Reasoning, Memory, Planner und Symbolic Constraint sind daher weniger ein „Anti-End-to-End“-Trend, sondern zeigen vielmehr, dass die Robotik gerade dabei ist, dieZwischenschichtzwischen großen Modellen und der Regelung auf niedriger Ebene neu zu erfinden. End-to-End ist nicht einfach gescheitert, und Modularisierung hat auch nicht einfach zurückgefunden. Die genauere Beschreibung der Veränderung lautet: Da Aufgaben vom einstufigen Greifen hin zu langfristiger Manipulation und von Laborumgebungen hin zur offenen Welt fortschreiten, entstehen in Robotersystemen erneut Hierarchien.04
Manipulation
wird zu einem der dichtesten Schlachtfelder der Embodied Intelligence
Wenn VLA, Reasoning und World Model eher die Frage repräsentieren, wie Roboter „denken“, dann geht es bei Manipulation eher um eine andere Frage: Wie wirken diese Fähigkeiten letztlich durch eine Hand, einen Greifer oder einen Roboterarm tatsächlich auf die physische Welt. Es gibt etwa 520 Arbeiten zum Thema Manipulation; nach weiterer Filterung der Richtungen Dexterous Manipulation, Tactile, In-hand Manipulation und Contact-rich Manipulation sind es etwa 225 relevante Arbeiten. Davon befassen sich etwa 91 Arbeiten ausdrücklich mit Tactile und 52 ausdrücklich mit Dexterous Manipulation. Unter diesen 225 Dexterous-/Tactile-bezogenen Arbeiten betreffen etwa 165 zugleich Manipulation, 79 Learning, 57 Perception und 52 Control. Taktiles Empfinden, Lernen, Wahrnehmung und Regelung laufen in ein und denselben Manipulationsaufgaben zunehmend zusammen. IROS 2026 Award Candidate VTAP-Greifer: Synergie von Fingerspitzen-Sensorik und einer visuo-taktilen aktiven Handfläche für geschickte Manipulation in der Hand (Dexterous In-Hand Manipulation), entstanden in Zusammenarbeit zwischen Teams der Purdue University und der Columbia University, darunterZhixian Huvon der Purdue University sowie von der Columbia UniversityHuang Binghao, Li Yunzhuund weitere Forschende. Statt weiter einen anthropomorphen Greifer zu verfolgen, dessen Freiheitsgrade immer näher an der Menschenhand liegen, entwarf das Team drei rekonfigurierbare weiche Finger sowie eine aktive visuell-taktile Handfläche und realisiert Greifen und In-Hand-Manipulation durch Fingerspitzen-Tastempfindung und aktiven Kontakt der Handfläche. Das Interessanteste daran: Hochentwickelte Geschicklichkeit hängt nicht zwangsläufig von einer anthropomorphen Struktur mit sehr hohen Freiheitsgraden ab. Auch das Zusammenspiel von mechanischer Struktur, aktivem Kontakt und multimodaler Wahrnehmung kann komplexe Manipulationsfähigkeit hervorbringen. Ein weiterer Kandidat für den Robot Mechanism Design Award PDS Joint: Ein parametrisches Doppel Spiral-Gelenk, maßgeschneidert für Geschicklichkeitshändestammt von einem fünfköpfigen Team der Beijing Institute of Technology. Die Forschenden greifen auf einer grundlegenderen Ebene der Gelenkstruktur an und bringen nachgiebige Strukturen, Gelenksteifigkeit, Propriozeption und lernbasierte Kalibrierung gemeinsam in das Gelenkdesign der Geschicklichkeits-Hand ein. Von VTAP bis zum PDS Joint zeigt sich: Die Hardware selbst ist noch lange nicht konvergiert, aber sie lässt sich zugleich immer schwerer von Wahrnehmung, Regelung und Lernen trennen. Gleichzeitig bewegt sich die Taktilität von „einen Sensor anbauen“ hin zum „Eingehen in die Policy“.TacVLA: Kontaktsensibles taktiles Fusing für robuste Vision-Language-Action-Manipulation wurde in Kooperation der Purdue University mit dem italienischen Technologieinstitut IIT realisiert; das Purdue-Team umfasst unter anderemXu Zhengtong, Zhang Zhiyuanund weitere Forschende. Es führt Taktilität direkt in das VLA ein und lässt taktile Informationen bei tatsächlichen Kontakten in die Aktionsentscheidung einfließen. Denn in Szenarien mit Okklusion, feinem Einfügen oder bereits bestehendem Kontakt nimmt der Informationsgehalt der visuellen Wahrnehmung schnell ab. Ein anderer Ansatz versucht, die Abhängigkeit der Deployments von taktiler Hardware zu verringern.HapticVLA: Manipulation mit intensivem Kontakt mittels Vision-Language-Action-Modell ohne taktile Wahrnehmung zur Inferenzzeit stammt von einem Team des Skoltech (Skolkovo-Institut für Wissenschaft und Technologie). Die Forschenden nutzen taktile Informationen in der Trainingsphase, damit die Policy Kontaktwissen lernt, bestehen in der Inferenzphase aber nicht mehr zwingend auf Echtzeit-taktilen Eingaben. TacVLA und HapticVLA stehen stellvertretend für zwei verschiedene Denkansätze: Bei dem einen wird Taktilität in Echtzeit in die Policy eingespeist, bei dem anderen wird Taktilität für das Training genutzt und die taktile Erfahrung so weit wie möglich in das Modell komprimiert. Auch das Datenproblem tritt nun zutage. Der für den Entertainment and Amusement Paper Award nominierte Beitrag PianoFingering-1.5K: Ein umfangreicher, von Experten erstellter Datensatz für Klavierfingersätze zum robotischen Lernen mit Geschicklichkeit stammt von einem Team der University of Science and Technology of China; Autor ist unter anderemWang Ruoyuund weitere. Die Forschenden haben Experten-Fingersätze für Klavier in einen strukturierten Datensatz überführt. Klavierspiel erscheint zwar besonders, ist in Wirklichkeit aber eine außerordentlich anspruchsvolle Geschicklichkeitsaufgabe: Mehrere Finger müssen in kürzester Zeit präzise, kontinuierliche Kontakte mit starken zeitlichen Constraints ausführen. Solche Expertenbewegungen zu systematisieren bedeutet im Kern, hochwertige menschliche Vorwissen-Vorgaben für die Geschicklichkeit von Robotern bereitzustellen. Von Hardware über Taktilität bis zu den Daten münden mehrere Linien letztlich in dieselbe Frage: Wie bilden Roboter eine echte geschlossene Regelungsschleife der Manipulation aus? Die Geschicklichkeitsmanipulation weitet sich damit von „eine bessere Hand bauen“ zum Aufbau einer vollständigen geschlossenen Schleife ausWahrnehmung – Taktilität – Daten – Policy – Regelungaus.05
Humanoid: Erweiterung von „gehen können“ zu „beim Gehen arbeiten“
Humanoide Roboter dürften eine der Roboterformen mit der größten Aufmerksamkeit aus Industrie und Medien der letzten zwei Jahre gewesen sein, doch wenn man sie in das Gesamtbild aller Paper von IROS 2026 zurückeinordnet, erscheint die Situation deutlich zurückhaltender. Laut den Statistiken gibt es etwa 89 Paper zu Humanoid / Loco-Manipulation, was 4,6 % aller Paper entspricht. Davon überschneiden sich 46 mit Control, 44 mit Learning, 34 befassen sich mit Manipulation und 32 mit Planning. Bemerkenswert ist vor allem, dass sich die inneren Fragestellungen dieser Paper verändern. In den letzten Jahren konzentrierten sich die wichtigsten technischen Fortschritte bei humanoiden Robotern stark auf locomotion; nun ist zu beobachten, dass eine weitere Gruppe von Arbeiten beginnt, „Fortbewegung“ und „Manipulation“ in dasselbe System zu integrieren. Ein typisches Beispiel ist ULTRA: Einheitliche multimodale Steuerung für autonome Ganzkörper-Loko-Manipulation humanoider Roboter. Dieser Aufsatz wurde von der University of Illinois Urbana-ChampaignHe Xialin等人, gemeinsam mit Forschern der Shanghai Jiao Tong University und der Tsinghua-Universität, fertiggestellt und in die engere Wahl für den Best Paper im Bereich Mobile Manipulation der IROS 2026 aufgenommen. Dabei wird nicht erneut eine stärkere Gehpolitik trainiert, sondern ein humanoider Roboterkontinuierliche Aufgaben wie das Annähern an Objekte, Aufnehmen, Transportieren und Ablegen bewältigt. Das Bemerkenswerteste hieran ist nicht, dass der Roboter nun endlich „Dinge tragen kann“, sondern dass sich die Problemstruktur verändert hat. Bei reiner Lokomotion besteht das Kernziel darin, die Körperstabilität zu erhalten; sobald der Roboter ein Objekt in der Hand hält, verändern die Armbewegungen den Schwerpunkt, die Last beeinflusst den Gang, und Fußkontakt, Oberkörperbewegung und Greifaufgabe müssen gleichzeitig erfüllt werden. „Gehen“ und „Manipulieren“ lassen sich nicht mehr vollständig trennen.SteadyTray: Erlernen von Objekt-Balancierungsaufgaben beim Transport von Tabletts durch Humanoide mittels residualem Reinforcement Learning Vom Team der University of California, San Diego, mit folgendem Erstautor:Huang Anlun"." Es vergrößert diesen Widerspruch zu einer sehr anschaulichen Aufgabe: einen humanoiden Roboter mit einem Tablett laufen lassen, wobei die Gegenstände auf dem Tablett nicht herunterfallen dürfen. SteadyTray fügt einer bestehenden Locomotion-Policy eine Residual-Policy hinzu, die speziell die durch den Gang verursachten Störungen am Endeffektor behandelt.DreamMimic: Visuomotorische Ganzkörper-Loco-Manipulation mittels Weltmodell lernen dann übernimmt es die Shanghai Jiao Tong UniversitätYin JieIn Zusammenarbeit mit einem Team der Tsinghua-Universität wurden visuelle Wahrnehmung und World Model in whole-body loco-manipulation eingeführt, wobei ein Prädiktionsmodell dem Roboter hilft, während der langandauernden visuellen Steuerung das Verständnis des Zustands aufrechtzuerhalten. Auch VLAs beginnen sich demselben Problem zu widmen.Erlernen humanoider Loco-Manipulation mit verantwortungsinduzierten spezialisierten Experten für Vision-Language-Action-Modelle Vom Team der Seoul National University. Diese Arbeit widmet sich dem Problem, dass sich die Aktionsverteilungen von Locomotion und Manipulation stark unterscheiden, und führt specialized experts ein, sodass unterschiedliche Experten unterschiedliche Kontrollverantwortungen übernehmen. Dies zeigt erneut, dass „generisch“ nicht bedeutet, „intern nichts zu unterscheiden“. Ein noch extremeres Beispiel ist Award Candidate Athletische Humanoid-Tennisfähigkeiten aus unvollständigen menschlichen Bewegungsdaten lernen。Diese Arbeit wurde von der Tsinghua-UniversitätZhang Zhikaiund Kollegen federführend und in Zusammenarbeit mit Forschenden der Peking-Universität, des Shanghai Artificial Intelligence Laboratory, Galbot und der Technischen Universität Delft abgeschlossen wurde. Tennis zu spielen erfordert, dass ein Roboter einen sich schnell bewegenden Ball beobachtet, die Flugbahn vorhersagt, den Körper bewegt, den Schläger schwingt und dabei das Gleichgewicht hält. Das wirkt weit entfernt vom Transport in Fabriken, legt aber dasselbe Problem offen: Humanoide Roboter dürfen nicht nur über einen stabilen Gang verfügen und dann einfach „zwei Hände hinzubekommen“. Echte whole-body intelligence verlangt, dass Beine, Rumpf und Arme sich gemeinschaftlich um die Aufgabe herum bewegen. Daher würde es an der echten Veränderung vorbeiführen, die Humanoid-Forschungsarbeiten der IROS 2026 einfach als „Humanoids werden immer populärer“ zusammenzufassen. Die genauere Beschreibung lautet:Der Forschungsschwerpunkt verlagert sich von reiner locomotion hin zu whole-body loco-manipulation.06
World Models sind angesagt, aber noch nicht zum Mainstream geworden
Wenn man nur die Diskussionsdichte im Robotikbereich der letzten zwölf Monate betrachtet, vermittelt World Model leicht den Eindruck, es sei „bereits vollständig ins Hauptkampfgeschehen eingetreten“. Doch unter allen Papern erwähnen nur 19 Paper explizit World Models, was etwa 1 % aller Paper ausmacht. „Heiß“ ist nicht gleich „viele“. Das eigentlich Bemerkenswerte ist nicht, wie viele Paper zu World Models bereits existieren, sondern an welcher Stelle sie zu erscheinen beginnen: bei der Fortbewegung von Vierbeinern, der Geschicklichkeitsmanipulation, der Präzisionssteckmontage, dem whole-body control von humanoiden Robotern, der Medizintechnik-Robotik und der Navigation. Best Paper / Best Student Paper Award Candidate DAWN: Rauschrobuster Vierbein-Parkour mittels tiefenentrauschender Weltmodelle Das Team stammt von der Korea University of Technology and Education. Statt den Vierbeiner-Roboter „realistischere“ Videos „imaginieren“ zu lassen, nutzt es ein World Model, um verrauschte Tiefenwahrnehmung zu modellieren und dem Roboter zu helfen, Parkour in einer realen Umgebung zu bewältigen. Hier beginnt das World Model bereits, ein Werkzeug zur Zustandsmodellierung in der Wahrnehmungs-Kontroll-Kette zu werden. Beim geschickten Greifen (Dexterous Manipulation)Skalierung von Cross-Embodiment-Weltmodellen für Geschickte Manipulation vonHe Zihaoan der Spitze und zusammen mit Forschern der University of California, San Diego, des MIT und anderer Einrichtungen abgeschlossen. Der Versuch besteht darin, die völlig unterschiedlichen Gelenk- und Aktionsräume verschiedener Roboterhände zu umgehen und allgemeinere Gesetzmäßigkeiten darüber zu lernen, wie Handlungen die physische Welt verändern. Dahinter steht eine sehr interessante Annahme: Was verschiedene Roboter in Zukunft wirklich teilen können, sind vielleicht nicht die Handlungen selbst, sondernWie die Handlung die Welt verändern wird。Generalisierbares robotisches Einfügen mit Weltmodellen Dies wurde von Teams der UC San Diego, NVIDIA, der University of Washington und der University of Southern California gemeinsam durchgeführt. Dabei wird das World Model in präzise Steckaufgaben eingebracht. Statt die Politik auswendig lernen zu lassen, „wie dieses Bauteil eingesteckt wird“, sollen die Forscher das Modell lernen lassen, „wie meine Handlungen den aktuellen Zustand verändern“, und diese Vorhersage anschließend zur Steuerung nutzen. Beim humanoiden Roboter – das zuvor erwähnte Team der Shanghai Jiao Tong UniversityYin JieUnd das DreamMimic-Team der Tsinghua-Universität bringt das World Model außerdem in whole-body loco-manipulation. Während RoDyn: Zähmung eines interaktiven robotisch-dynamischen 2.5D-Weltmodells für Robotermanipulation „...wurde hingegen von einem Team der Nanyang Technological University in Zusammenarbeit mit der Tsinghua-Universität erstellt. RoDyn versucht, ein offensichtliches Problem der rein zweidimensionalen Videovorhersage zu lösen: Dass zukünftige Bilder plausibel aussehen, bedeutet nicht, dass die physikalischen Beziehungen korrekt sind. Es führt zusätzlich Tiefen- und Roboterdynamik-Informationen ein, sodass die Vorhersageergebnisse näher an einer Zustandsdarstellung liegen, die tatsächlich für die Robotersteuerung verwendet werden kann. Dies weist genau auf den wichtigsten Widerspruch von World Models im Robotikbereich hin. Was Roboter wirklich benötigen, ist nicht ein visuell plausibles Zukunftsbild, sondern"Eine unter Handlungsbedingungen geometrisch und physikalisch hinreichend glaubwürdige Zukunft。 Daher lautet die Frage des World Model in diesem Jahr nicht mehr nur: „Wenn der Roboter so handelt, wie wird die Zukunft aussehen?“, sondern sie beginnt zu werden: „Da ich die Zukunft vorhersagen kann, kann diese Vorhersage wirklich ändern, wie ich als Nächstes handle?“ In diesem Sinne ist das World Model derzeit eher wie etwas, das sich gerade ausDie Welt vorhersagenin RichtungBeteiligung an der Kontrolle„…eine Übergangstechnologie, nicht die Methode, die bereits die Robotikforschung beherrscht."07
Robotik tritt in das „Zeitalter der Systemprobleme“ ein
Betrachtet man diese Forschungsarbeiten zusammen, so ist das Bemerkenswerteste am IROS 2026 nicht, dass eine bestimmte technische Richtung gerade „gewinnt“. VLA hat klassische Planung und Regelung nicht ersetzt, World Models sind noch nicht Mainstream geworden, und Humanoid-Robotik ist nur ein Teil der gesamten Robotik-Forschungslandschaft. Was sich wirklich verändert, ist, dass diese neuen Methoden, sobald sie in die physische Welt eintreten, die Fragen von Wahrnehmung, Gedächtnis, Planung, Regelung, Tastsinn, Sicherheit und Recovery wieder unausweichlich machen. Der Erfolg der Sprachmodelle der letzten Jahre beruhte zu großen Teilen darauf, eine Vielzahl von Aufgaben in einem einzigen Modell zu vereinen. Bei Robotern ist das anders. Sie müssen nicht nur „verstehen“, sondern auch wirklich handeln, und die physische Welt legt Fehler, Latenz, Kontakt und Versagen vollständig offen. Daher gleicht der IROS 2026 eher der Beantwortung einer neuen Frage: Wie lässt sich, wenn die Modelle bereits stark genug sind, diese Fähigkeit wieder zu einem wirklich funktionierenden Robotersystem zusammensetzen. Das bedeutet nicht, dass End-to-End gescheitert ist, und auch nicht, dass klassische Module wieder die Oberhand gewonnen haben. Genauer gesagt suchen die Robotik neue Grenzen zwischen großen Modellen, Planung, Regelung und Hardware neu. Der künftige Wettbewerb könnte nicht mehr nur darum gehen, wessen Modell größer und fähiger ist, sondern wer diese Fähigkeiten wirklich stabil kombinieren kann.Wenn Roboter immer intelligenter werden, beginnt die eigentlich schwierige Aufgabe darin, dafür zu sorgen, dass sie keine Fehler machen.Zur Erleichterung des Austauschs und der gegenseitigen Weitergabe von Konferenzinformationen haben wir eigens eine IROS 2026 Teilnehmer-Gruppe für den Austausch! Dem Group-Chat beizutreten schaltet diese „Vorteile“ für dich frei?
Konferenz-Info-Hub: Einreichungsfristen (DDL), Formatvorgaben, Review-Fortschritt … wichtige Termine werden Ihnen umgehend zugestellt, damit Sie keine Deadline mehr verpassen – Ihre Einreichungsvorbereitung sitzt sicher.
Kollegentreff: Kolleginnen und Kollegen aus allen Himmelsrichtungen sind in der Gruppe – wir tauschen Erfahrungen aus, tauschen Gedanken aus und knüpfen Kontakte. Auf dem Weg der Forschung gehen wir gemeinsam.
Frontnachschubstation: Neueste Forschungsergebnisse und aktuelle Hot-Topic-Richtungen in Echtzeit – gemeinsam mit dem Konferenzthema hilft sie dir, den Einreichungsfaden zu entwirren und deine Papierinspiration voll aufzutanken.
Vor-Ort-Support-Team: (ausschließlich während der Konferenz geöffnet):Auch am Veranstaltungsort muss man nicht nervös sein –
Routennavigation„: Verortung der Veranstaltungsorte, Anfahrt zum Vortragssaal – jederzeit in der Gruppe fragen;“
Themenbasiertes gemeinsames Lesen: Beliebte Sessions und Keynote-Diskussionen – auch wenn man sie verpasst hat, kann man sie nachverfolgen;
Poster-Kompilation: Eine Zusammenstellung der Highlights der Poster vor Ort, mit einem Klick speichern und nichts verpassen;
Treffpunkt-Plaza: Essenseinladungen, Interview-Treffen, Austausch-Treffen … Wer plaudern, zusammenarbeiten oder sich persönlich treffen möchte, startet es einfach in der Gruppe.
? Zugang zur Gruppe: Scanne den QR-Code, um der Gruppe beizutreten, oder füge WeChat Luyoyo_2026 hinzu mit dem Vermerk: ECCV + Einrichtung/Schule + Name + Forschungsrichtung.
In Forschung und Technik ist der Informationsvorsprung entscheidend.
Komm, sei gemeinsam einen Schritt schneller!
Steigen Sie ein und lassen Sie sich die Highlights der wichtigsten globalen KI-Konferenzen zeigen
Exklusiv verfügbar:
Präsentationsfolien von Experten
Vollständige Konferenzberichte
Interpretationen beliebter wissenschaftlicher Arbeiten
Interviews mit aufstrebenden Wissenschaftstalenten
Scannen Sie den QR-Code oben
oder klicken Sie auf „原文 lesen“, um dem Bereich von Leiphone (Öffentlicher Account: Leiphone) zu folgen.
Dieser Artikel stammt ursprünglich von Leiphone und darf ohne Genehmigung nicht nachgedruckt werden. Einzelheiten sieheNachdruck-Hinweise。