Auteur丨Ma Xiaoning
Éditeur丨Cen Feng
Le 27 septembre, l'IROS 2026 ouvrira à Pittsburgh. Après 31 ans, l'IROS revient dans cette cité de l'acier. L'une des plus grandes conférences académiques de robotique au monde, elle compte cette année 1933 articles admis au programme officiel. Si l'on étale ces près de deux mille articles, ils ressemblent davantage à une coupe transversale de la recherche en robotique en 2026 : de l'apprentissage par renforcement et l'apprentissage par imitation à la planification de trajectoire, la perception visuelle, le contrôle du mouvement et la manipulation dextre, puis aux robots humanoïdes, au toucher et aux grands modèles, presque toutes les grandes voies technologiques de la robotique de ces dernières années apparaissent simultanément dans cette carte. Mais ce qui mérite vraiment l'attention, ce ne sont pas les mots-clés Humanoid, VLA ou World Model, plus susceptibles d'attirer l'attention de l'industrie et des médias. Après un classement multi-étiquettes des 1933 articles, on voit qu'environ 809 articles relèvent de Robot Learning / Embodied AI, 564 de Navigation / Planning, 556 de Perception / Vision, 546 de Control / Dynamics, 520 de Manipulation, tandis que les articles liés à Humanoid / Legged sont environ 213. Comme un article peut porter sur plusieurs directions à la fois, ces chiffres ne peuvent être simplement additionnés, mais ils révèlent une chose : la recherche en robotique n'a pas été refondue en un unique « problème d'IA » du fait de l'arrivée des grands modèles. Au contraire, apprentissage, perception, planification, contrôle et manipulation s'entrelacent désormais avec une densité sans précédent. Dans le contexte de l'engouement médiatisé pour l'AGI, ces près de deux mille articles délivrent pourtant un signal :les grands modèles n'ont pas“dévoré”la robotique.Bien au contraire, après deux ans de course effrénée vers le bout en bout, la recherche en robotique tente, par une « renaissance de la couche intermédiaire » — géométrie tridimensionnelle, raisonnement symbolique et contrôle de bas niveau —, de retrouver à Pittsburgh cette âme physique masquée par les pixels et les Tokens. » La vraie question que soulève l'IROS 2026 n'est peut-être pas de savoir « si les grands modèles sont en train de remplacer la robotique traditionnelle », mais si la recherche en robotique entre dans une phase de système plus complexe.
01
L'IA n'a pas remplacé la robotique traditionnelle,
elle s'y réintègre
Si l'on observe plus avant les relations de croisement entre ces articles, ce qui s'est réellement passé après l'entrée des grands modèles dans la robotique devient plus clair. Environ 276 articles combinent Robot Learning et Manipulation, 269 croisent avec Perception, 225 avec Navigation / Planning, et 221 avec Control / Dynamics. Les méthodes d'apprentissage n'ont pas simplement écrasé les modules technologiques existants de la robotique ; au contraire, elles s'y enfoncent toujours plus profondément. Ce changement se manifeste d'abord dans la planification. Jorge Mendez-Mendez, de l'Université de Stony Brook, dans 《A Systematic Study of Large Language Models for Task and Motion Planning with PDDLStream》 (Une étude systématique des grands modèles de langage pour la planification de tâches et de mouvements avec PDDLStream) teste systématiquement les performances de grands modèles de langue une fois intégrés dans le cadre traditionnel de Task and Motion Planning. L'étude ne montre pas que « les grands modèles peuvent directement remplacer les planificateurs » ; elle indique au contraire que les contraintes géométriques, la faisabilité des mouvements et la logique d'exécution nécessitent toujours la participation des systèmes de planification traditionnels. C'est très représentatif. Un LLM peut comprendre ce que signifie « apporter la tasse de l'autre côté de la table », mais lorsqu'il s'exécute réellement, le robot doit encore répondre aux questions suivantes : le bras manipulateur risque-t-il d'entrer en collision, les articulations sont-elles atteignables, la trajectoire est-elle exécutable, et l'environnement a-t-il changé ? Le problème passe donc de « le LLM peut-il remplacer le Planner » à la question de savoir comment répartir les rôles entre les deux. Un phénomène similaire apparaît aussi du côté de la perception des VLA. Candidate au prix du meilleur article Cognitive Robotics de l'IROS 2026, GeoVLA: Empowering 3D Représentations dans les modèles vision-langage-actionréalisé par les équipes de l'Université de Tianjin, de Yuanli Lingji et de l'Université Tsinghua, compte parmi ses auteursXie Binde Yuanli Lingji,Shi Haode l'Université Tsinghua, et d'autres. Il cible précisément le problème de la dépendance excessive des VLA actuels à la vision 2D : les VLA traditionnels génèrent souvent les actions directement à partir d'images RGB et d'instructions en langue, mais les robots réels évoluent dans un monde tridimensionnel, où la hauteur des objets, leur taille et les variations d'angle de la caméra peuvent toutes affecter directement la saisie. GeoVLA ne se contente pas d'agrandir le modèle ; il ajoute explicitement des informations de profondeur et de géométrie 3D, en utilisant conjointement la 3D representation et les caractéristiques visuo-langagières pour générer les actions. Autrement dit, une fois les grands modèles devenus plus puissants, la « géométrie spatiale », tradition la plus ancienne de la robotique, a été réintégrée. Un phénomène analogue se manifeste aussi côté contrôle. Entraîner rapidement des politiques robotiques avec des modèles de fondation lentsdes équipes de l'Université de Floride centrale, de l'Indian Institute of Technology Kanpur, de l'Université de Bath et de l'Université du Maryland à College Park, étudie un problème bien concret : les grands Foundation Model peuvent apporter des connaissances et une généralisation plus fortes, mais leur vitesse d'inférence est trop lente pour fonctionner en continu dans la boucle de contrôle haute fréquence d'un robot. Les chercheurs font donc participer davantage les grands modèles à l'entraînement, puis apprennent une politique robotique plus légère et plus rapide chargée de l'exécution réelle. Un modèle de langue qui répond quelques centaines de millisecondes plus tard ne fait que paraître légèrement lent à l'utilisateur ; un robot qui agit quelques centaines de millisecondes plus tard lors d'une saisie, d'un contact ou du maintien de l'équilibre peut voir sa tâche échouer. La capacité des modèles et le contrôle temps réel n'ont jamais été le même problème. La recherche sur le toucher, plus proche du monde physique, suit une direction semblable.DexTact: A Visuo-Tactile Foundation Model for Dexterous Hand Graspingréalisé par Fang Xinminet d'autres de l'Université du Colorado à Denver en collaboration avec une équipe de la Kennesaw State University, place simultanément la vision et le toucher dans le problème de la saisie par main dextre. Ce qui est étudié ici, ce n'est plus seulement « l'image indique au robot où se trouve l'objet », mais « ce que le système peut encore percevoir après que la main a touché l'objet ». Ici, Foundation Model, toucher, manipulation dextre et contrôle sont intégrés dans un même système pour être compris ensemble. Ainsi, le changement vraiment notable en 2026 n'est pas que la robotique est en train d'être remplacée par l'IA. Plus précisément, l'IA commence à pénétrer les aspects les plus traditionnels de la robotique, tout en étant elle-même remodelée par ces problèmes traditionnels.02
La VLA passe de la « preuve de faisabilité » à la phase de « comblement des lacunes »
Si, au cours des deux dernières années, la question centrale des VLA était encore de savoir « si un modèle unifié pouvait comprendre la vision et le langage et générer directement des actions robotiques », alors à l'IROS 2026, l'accent de la recherche s'est nettement déplacé vers une autre direction : puisque les modèles en sont désormais capables, il faut désormais résoudre la question de savoir comment les rendre plus rapides, plus stables et mieux adaptés aux robots réels. Dans notre statistique multi-étiquettes, environ 162 articles liés aux VLA, VLM, LLM et modèles de fondation ont été recensés, soit 8.4 % de l'ensemble des articles ; parmi eux, environ 82 articles traitent explicitement des VLA. Cette envergure suffit à constituer un axe de recherche indépendant. Mais les questions qui y sont abordées ne se limitent plus à « savoir si les modèles peuvent encore être plus grands » : elles se sont rapidement diversifiées vers l'efficacité, la compréhension en trois dimensions, la mémoire à long terme, les changements de point de vue, l'adaptation aux environnements réels et la sécurité. L'exemple le plus direct est Shallow-π : Distillation des connaissances pour les VLAs à base de flux。Cet article provient de 42dot, de l'Université nationale de Séoul et de Samsung Research, et figure parmi les candidats au prix IROS 2026 Best Paper / Best Student Paper Award. Ce qu'il résout n'est pas la manière d'entraîner un VLA plus grand, mais précisément le problème du modèle trop grand et de l'inférence trop lente : grâce à la distillation des connaissances pour compresser le VLA, le modèle devient plus adapté au déploiement sur de vrais robots et sur des appareils en périphérie. Cela met en évidence la première contrainte réelle rencontrée par les VLA une fois intégrés aux robots : le modèle doit non seulement être « intelligent », mais aussi suffisamment rapide. Une autre faiblesse est la compréhension de l'espace en trois dimensions. GeoVLA, mentionné précédemment, développé par l'équipe de l'Université de Tianjin, de Yuanli Lingji et de Tsinghua, consiste essentiellement à doter les VLA des capacités géométriques les plus traditionnelles de la robotique. Le changement de point de vue est devenu en soi un problème indépendant.AnyCamVLA : Adaptation zéro-shot des caméras pour des modèles vision-langage-action robustes au point de vue Issu d'une équipe de l'Université nationale de Séoul et du MIT. Elle étudie pourquoi un VLA bien entraîné devient facilement défaillant lorsque la position de la caméra change, et s'il est possible de s'adapter à un nouveau point de vue de la caméra sans réentraîner tout le modèle. Dans les déploiements réels, les erreurs de montage des caméras, les différences entre plateformes robotiques et les changements de perspective sont très courants ; une politique qui ne fonctionne que sous un angle fixe peine à véritablement généraliser. Les tâches de longue durée, quant à elles, exposent un autre type de lacune : le modèle exécute des actions, mais n'accumule pas nécessairement d'expérience.Mémoire à long terme pour agents basés sur VLA dans l'exécution de tâches en monde ouvert Réalisé par des équipes de l'Université de Nankin, de l'Université Waseda, de LimX Dynamics et de l'Université du Zhejiang, entre autres, ce travail connecte directement la mémoire à long terme à un VLA Agent, permettant au système de sauvegarder les trajectoires et expériences déjà accomplies, puis de les rappeler ultérieurement. La question n'est plus ici la réussite ou non d'une seule saisie, mais la capacité du robot à se souvenir, dans des tâches aux longs processus, de « ce qui s'est passé auparavant ». Celui de l'Université Sungkyunkwan RoboBRIDGE : un cadre modulaire pour connecter les politiques à des agents robotiques robustes dans le monde réel va encore plus loin. Plutôt que de tenter de réentraîner un VLA plus puissant, il ajoute autour de la politique préentraînée un Monitor, un Perceptor, un Planner, un Controller et un Robot Interface. En cas d'échec d'exécution, le Monitor est chargé de détecter le problème ; lorsque l'environnement change, le Planner replanifie ; le Perceptor met à jour la scène ; le Controller transforme ensuite la politique de haut niveau en actions concrètes. Cette structure illustre bien ce qui est en train de se passer dans la phase suivante des VLA. La recherche passe de « construire un meilleur prédicteur d'actions » à la manière de construire un système complet autour de lui. Ainsi, la prochaine compétition des VLA pourrait ne plus être seulement le scaling. Le problème majeur devient celui de system engineering: comment un VLA travaille-t-il avec la perception, la mémoire, la planification, le contrôle et le matériel, pour finalement passer d'un modèle capable de produire des actions à un système robotique capable de fonctionner sur le long terme.03
Les robots redéveloppent une « couche intermédiaire »
Si la première phase des VLA consistait à tenter d'unifier perception, langage et action dans un seul modèle, alors une autre ligne de recherche de l'IROS 2026 devient de plus en plus claire : les chercheurs recommencent à insérer activement de nouvelles structures au milieu de cette chaîne de bout en bout. Parmi les 1933 articles, environ 119 concernent Reasoning / Memory, soit 6,2 % de l'ensemble des articles ; parmi eux, 64 portent explicitement sur le Reasoning et 36 sur la Memory. Ils forment déjà un ensemble de Sessions très claires, notamment Agents and Memory for Robust VLA Manipulation, Constraint-Guided Reasoning for Long-Horizon Manipulation, LLM Agents Reasoning Through Robot Tasks et Representing 3D Space for Robot Reasoning. Cela mérite en soi d'être interrogé : si les modèles de bout en bout peuvent déjà générer des actions directement à partir de la vision et du langage, pourquoi les robots ont-ils encore besoin de Reasoning, de Memory, de Planner, voire de la réintroduction de Symbolic Constraint et de représentation 3D explicite ? L'une des raisons est que, dès qu'une tâche robotique s'allonge, « ce qui est vu dans l'image actuelle » ne suffit plus.TempoFit : mémoire KV temporelle couche par couche, prête à l'emploi, pour la manipulation VLA à long horizon provient d'une équipe de l'Université Xi'an Jiaotong-Liverpool. Sans réentraîner un VLA plus grand, elle exploite la temporal KV memory interne au modèle, permettant aux politiques existantes de sauvegarder et de rappeler des informations historiques à travers le temps. Mais ce que le robot doit véritablement retenir ne se limite pas à « ce qu'il a vu par le passé ». Celle de l'équipe de l'Université des sciences de Tokyo, GaussMemory : mémoire de scène gaussienne 3D pilotée par la tâche pour la manipulation robotique à long horizonplace davantage la Memory dans l'espace tridimensionnel. Un objet, même temporairement occulté, ne doit pas disparaître du « monde » du robot simplement parce que la caméra ne le voit pas à cet instant ; un objet déjà déplacé doit également voir sa position mise à jour à temps. Ainsi, la Memory chez le robot n'est pas exactement identique à la mémoire contextuelle des modèles de langage. Elle doit rester en correspondance continue avec l'espace tridimensionnel réel. Il en va de même pour le raisonnement.DualCoT-VLA : chaîne de pensée visuo-langagière via un raisonnement parallèle pour les modèles vision-langage-action a été réalisé en collaboration entre l'Université des sciences et technologies de Hong Kong (Guangzhou) et Huawei. Sans se contenter de faire produire directement des actions par le VLA, il ajoute avant la génération d'actions une visual Chain-of-Thought et une language Chain-of-Thought : l'une traite les relations spatiales, l'autre la logique de tâche de haut niveau. La division « haut niveau — bas niveau » que le modèle de bout en bout cherchait à éviter revient sous une autre forme. VL-Nav : une approche neuro-symbolique pour la navigation vision-langage fondée sur le raisonnement, candidat au meilleur article en Cognitive Robotics, est principalement réalisé par une équipe de l'Université d'État de New York à Buffalo, dont la première auteure estDu Yi. VL-Nav combine la compréhension sémantique des modèles vision-langage avec un raisonnement spatial et symbolique explicite, pour la vision-language navigation en environnements complexes. La réapparition des méthodes symboliques ne signifie pas que la robotique revienne à une ère entièrement fondée sur les règles. Elles prennent en charge la part des tâches que les grands modèles ne savent pas encore accomplir de manière stable : rendre les relations spatiales, les conditions d'exécution et les contraintes plus explicites. De la Memory et du Reasoning à la Geometry, au Planner et au Symbolic Constraint, ces travaux adoptent en surface des techniques différentes, mais résolvent tous le même problème structurel : il existe une immense distance entre la compréhension sémantique de haut niveau et les actions continues de bas niveau. Ainsi, le Reasoning, la Memory, le Planner et le Symbolic Constraint apparus à l'IROS 2026 ne témoignent pas tant d'une « opposition au bout en bout » que du fait que la robotique est en train de réinventer lacouche intermédiaireentre les grands modèles et le contrôle de bas niveau. Le bout en bout n'a pas simplement échoué, et le modulaire n'a pas simplement été restauré. Le changement plus précis est le suivant : à mesure que les tâches passent de la saisie en une seule étape à la manipulation de longue durée, et de l'environnement de laboratoire au monde ouvert, des hiérarchies réapparaissent dans les systèmes robotiques.04
Manipulation
devient l'un des champs de bataille les plus denses de l'intelligence incarnée
Si VLA, Reasoning et World Model représentent davantage la manière dont le robot « pense », la Manipulation se rapproche d'une autre question : comment ces capacités agissent-elles finalement sur le monde physique, par le biais d'une main, d'une pince ou d'un bras robotique. On compte environ 520 articles liés à la Manipulation ; après un filtrage supplémentaire selon les directions telles que Dexterous Manipulation, Tactile, In-hand Manipulation et Contact-rich Manipulation, environ 225 articles sont concernés. Parmi eux, environ 91 articles portent explicitement sur le Tactile et 52 sur la Dexterous Manipulation. Parmi ces 225 articles liés à la Dexterous/Tactile, environ 165 concernent également la Manipulation, 79 le Learning, 57 la Perception et 52 le Control. Le toucher, l'apprentissage, la perception et le contrôle convergent sans cesse dans un même ensemble de tâches de manipulation. Candidate aux IROS 2026 Award, VTAP Gripper : synergie entre la perception au bout des doigts et une paume active visuo-tactile pour la manipulation dextre en maina été réalisée en collaboration par des équipes de l'Université Purdue et de l'Université Columbia, parmi lesquelles figurentZhi-Xian Hude l'Université Purdue et, de l'Université Columbia,Huang Binghao et Li Yunchu,et d'autres chercheurs. Elle n'a pas continué à poursuivre une main humanoïde dextre dont les degrés de liberté se rapprochent toujours plus de la main humaine ; elle a plutôt conçu trois doigts flexibles reconfigurables et une paume tactile à vision active, réalisant la préhension et la manipulation intra-main grâce au toucher des bouts des doigts et au contact actif de la paume. Ce qui est le plus intéressant ici, c'est que la manipulation dextre de haut niveau ne dépend pas nécessairement d'une structure humanoïde à très haut degré de liberté. La synergie entre structure mécanique, contact actif et perception multimodale peut elle aussi produire des capacités de manipulation complexes. Un autre candidat au prix de conception de mécanismes robotiques, PDS Joint : un joint paramétrique à double spirale conçu pour les mains dextres, vient d'une équipe de cinq personnes de l'Institut de technologie de Pékin. Partant d'un niveau plus fondamental, celui de la structure articulaire, ils ont intégré conjointement dans la conception des articulations de la main dextre la structure compliant, la raideur articulaire, la proprioception et l'étalonnage par apprentissage. De VTAP à PDS Joint, on peut voir que le matériel lui-même est encore loin d'avoir convergé, mais qu'il devient aussi de plus en plus difficile à dissocier de la perception, du contrôle et de l'apprentissage. Parallèlement, le toucher passe de « l'ajout d'un capteur » à « l'entrée dans la politique ».TacVLA : fusion tactile consciente du contact pour une manipulation robuste vision-langage-action a été réalisé en collaboration entre l'Université Purdue et l'Institut italien de technologie ; l'équipe de Purdue comprend notammentXu Zhengtong et Zhang Zhiyuan,entre autres chercheurs. Il envoie directement les informations tactiles dans le VLA et, au moment où un contact se produit réellement, laisse ces informations participer à la prise de décision d'action. En effet, dans des scénarios d'occlusion, d'insertion fine ou de contact déjà établi, les informations fournies par la vision diminuent rapidement. Une autre voie tente de réduire la dépendance au matériel tactile lors du déploiement.HapticVLA : manipulation riche en contacts via un modèle vision-langage-action sans perception tactile au moment de l'inférence , provenant de l'équipe de l'Institut des sciences et technologies de Skolkovo. Ils utilisent les informations tactiles pendant l'entraînement, permettant à la politique d'apprendre les connaissances de contact, mais n'exigent plus, lors de l'inférence, de dépendre d'entrées tactiles en temps réel. TacVLA et HapticVLA représentent précisément deux approches différentes : l'une connecte le toucher en temps réel à la politique, l'autre exploite le toucher pour l'entraînement, puis cherche à comprimer autant que possible l'expérience tactile dans le modèle. La question des données commence aussi à émerger. Finaliste de l'Entertainment and Amusement Paper Award, PianoFingering-1.5K : un jeu de données de doigtés de piano expert à grande échelle pour l'apprentissage robotique dextre , vient de l'équipe de l'Université des sciences et technologies de Chine ; les auteurs incluent notammentWang Ruoyu,et d'autres. Ils ont organisé le doigté pianistique d'experts en un ensemble de données structuré. Le jeu du piano semble particulier, mais constitue en réalité une tâche de manipulation dextre extrêmement exigeante : plusieurs doigts doivent réaliser, en très peu de temps, des contacts précis, continus et soumis à de fortes contraintes temporelles. Systématiser ce type de gestes experts revient essentiellement à fournir aux robots une priori humain de haute qualité pour la manipulation dextre. Du matériel, au toucher, jusqu'aux données, plusieurs voies convergent finalement vers une même question : comment les robots peuvent-ils former une véritable capacité de manipulation en boucle fermée. La manipulation dextre passe ainsi de la « fabrication d'une meilleure main » à l'établissement d'une boucle complèteperception—toucher—données—politique—contrôle.05
Le Humanoid passe de « savoir marcher » à « marcher tout en travaillant »
Les robots humanoïdes ont peut-être été l'une des formes de robotique ayant attiré le plus d'attention de l'industrie et des médias ces deux dernières années, mais si on les replace dans l'ensemble des publications d'IROS 2026, le tableau apparaît plus mesuré. Selon les statistiques, les articles liés à Humanoid / Loco-Manipulation sont au nombre d'environ 89, soit 4.6 % de l'ensemble des publications. Parmi eux, 46 recoupent Control, 44 recoupent Learning, 34 concernent Manipulation et 32 concernent Planning. Ce qui mérite vraiment l'attention, c'est que les problématiques au sein de ces publications sont en train d'évoluer. Ces dernières années, les progrès techniques les plus importants des robots humanoïdes se sont largement concentrés sur la locomotion ; on voit désormais émerger un autre ensemble de travaux qui commencent à intégrer le « déplacement » et la « manipulation » dans un même système. Un exemple représentatif est ULTRA : Contrôle multimodal unifié pour la loco-manipulation humanoïde autonome du corps entier。 Cet article a été rédigé par l'université de l'Illinois à Urbana-ChampaignHe Xialinet al., avec des chercheurs de l'Université Jiao Tong de Shanghai et de l'Université Tsinghua, et a été présélectionnée pour le prix de la meilleure article dans la catégorie Mobile Manipulation à l'IROS 2026. Il ne s'agit pas d'entraîner une politique de locomotion plus performante, mais de faire accomplir à un robot humanoïde des tâches continues comme s'approcher d'un objet, le saisir, le transporter et le poser. Ce qui mérite le plus d'attention ici, ce n'est pas que le robot sait enfin « transporter des objets », mais que la structure du problème a changé. Dans la simple locomotion, l'objectif principal est de maintenir la stabilité du corps ; dès que le robot tient un objet en main, les mouvements des bras modifient le centre de gravité, la charge influe sur la démarche, et les contacts des pieds, les mouvements des membres supérieurs ainsi que la tâche de préhension doivent être satisfaits simultanément. « Marcher » et « manipuler » ne peuvent plus être entièrement séparés.SteadyTray : Apprentissage des tâches d'équilibrage d'objets dans le transport de plateaux par robots humanoïdes via l'apprentissage par renforcement résiduel De l'équipe de l'Université de Californie à San Diego, dont la première auteure estHuang Anlun。Elle amplifie cette contradiction sous forme d'une tâche très intuitive : faire marcher un robot humanoïde en tenant un plateau, sans que les objets sur le plateau ne tombent. SteadyTray ajoute une residual policy à une politique de locomotion existante, dédiée au traitement des perturbations que la démarche fait subir à l'extrémité.DreamMimic : Apprentissage de la loco-manipulation visuomotrice du corps entier via un modèle du monde tandis que l'Université Jiao Tong de ShanghaiYin JieRéalisé en collaboration avec l'équipe de l'Université Tsinghua, ce travail introduit la vision et les World Models dans la loco-manipulation whole-body, en utilisant des modèles prédictifs pour aider les robots à maintenir leur compréhension de l'état lors de contrôles visuels de longue durée. Les VLA commencent également à aborder le même problème.Apprentissage de la loco-manipulation humanoïde avec des experts spécialisés induits par la responsabilité pour les modèles vision-langage-action Issu de l'équipe de l'Université nationale de Séoul. Ce travail aborde le problème de la grande différence entre les distributions d'actions de locomotion et de manipulation en introduisant des specialized experts, permettant à différents experts d'assumer différentes responsabilités de contrôle. Cela montre une fois de plus que « généraliste » ne signifie pas « aucune spécialisation interne ». Un autre exemple plus extrême est celui de Award Candidate. Apprentissage de compétences tennistiques humanoïdes athlétiques à partir de données de mouvement humain imparfaites. Ce travail a été mené par l'Université TsinghuaZhang Zhikaiet al. en tête, et réalisé en collaboration avec des chercheurs de l'Université de Pékin, du Shanghai AI Laboratory, de Galbot et de l'Université de technologie de Delft. Jouer au tennis exige que le robot observe une balle en mouvement rapide, prédise sa trajectoire, déplace son corps, balance la raquette, tout en maintenant son équilibre. Cela semble bien loin du transport en usine, mais cela expose le même problème : un robot humanoïde ne peut pas se contenter d'avoir une démarche stable, puis d'y ajouter simplement « deux mains ». La véritable whole-body intelligence exige que les jambes, le torse et les bras se coordonnent autour de la tâche. Par conséquent, résumer simplement les articles sur les robots humanoïdes de l'IROS 2026 par « les Humanoids sont de plus en plus à la mode » ferait passer à côté du vrai changement. Une description plus juste serait :l'axe de recherche s'étend de la simple locomotion vers la whole-body loco-manipulation.06
Les World Models sont en vogue, mais ne sont pas encore devenus主流
Si l'on ne regarde que l'intensité des discussions autour de la robotique de l'année écoulée, les World Models donnent facilement l'impression d'être « déjà pleinement entrés dans le combat principal ». Mais parmi tous les articles, seuls 19 mentionnent explicitement les World Models, soit environ 1% de l'ensemble des articles. « À la mode » ne signifie pas « nombreux ». Ce qui mérite vraiment l'attention, ce n'est pas le nombre d'articles sur les World Models, mais les domaines où ils commencent à apparaître : locomotion quadrupède, manipulation dextre, insertion de précision, whole-body control humanoïde, robots médicaux et navigation. Best Paper / Best Student Paper Award Candidate DAWN : Parkour quadrupède robuste au bruit grâce à des modèles du monde de débruitage de profondeur de l'équipe de l'Université de technologie de Corée (Korea University of Technology and Education). Il ne s'agit pas de laisser le quadrupède « imaginer » des vidéos plus réalistes, mais d'utiliser un World Model pour modéliser la perception de profondeur bruitée, aidant le robot à accomplir du parkour en environnement réel. Ici, le World Model commence à devenir un outil de modélisation d'état dans la chaîne perception-contrôle. En manipulation dextre,Mise à l'échelle de modèles du monde multi-embodiments pour la manipulation dextre est dirigé parHe Zihaoet réalisé en collaboration avec des chercheurs de l'Université de Californie à San Diego, du MIT et d'autres institutions. Il tente de contourner les espaces d'articulations et d'actions totalement différents entre les diverses mains robotiques, pour apprendre des lois plus générales sur « comment les actions modifient le monde physique ». Derrière cela se cache une hypothèse très intéressante : ce que les différents robots pourront véritablement partager à l'avenir, ce ne sont peut-être pas les actions elles-mêmes, maiscomment les actions modifient le monde。Insertion robotique généralisable avec des modèles du monde est quant à lui réalisé conjointement par les équipes de UC San Diego, NVIDIA, de l'Université de Washington et de l'Université de Californie du Sud. Il introduit le World Model dans des tâches d'insertion de précision. Plutôt que de faire mémoriser à la politique « comment insérer ce type de pièce », les chercheurs souhaitent que le modèle apprenne « comment mes actions modifient l'état actuel », puis utilise ces prédictions pour accomplir le contrôle. Chez les humanoïdes, l'équipe de l'Université Jiao Tong de Shanghai déjà mentionnée, avecYin Jieet le DreamMimic de l'équipe de Tsinghua a fait entrer le World Model dans le loco-manipulation whole-body. Alors que RoDyn : apprivoiser un modèle de monde 2.5D interactif dynamique de type robot pour la manipulation robotique a été réalisé en collaboration entre l'Université Nanyang Technologique et l'équipe de l'Université Tsinghua. RoDyn tente de résoudre un problème évident de la prédiction vidéo purement 2D : le fait que les images futures semblent plausibles ne signifie pas que les relations physiques sont correctes. Il introduit en outre des informations de profondeur et de dynamique du robot, rapprochant ainsi les résultats de prédiction d'une véritable représentation d'état utilisable pour le contrôle robotique. Cela met précisément en lumière la contradiction la plus cruciale du World Model dans le domaine de la robotique. Ce dont les robots ont réellement besoin, ce n'est pas d'un futur visuellement plausible, mais d'unfutur conditionné par les actions et suffisamment crédible sur le plan géométrique et physique. Ainsi, la question du World Model cette année n'est plus seulement : « si le robot fait cela, à quoi ressemblera le futur ? » mais commence à devenir : « puisque je peux prédire le futur, cette prédiction peut-elle réellement changer ma prochaine action ? » En ce sens, le World Model ressemble aujourd'hui davantage à une voie technologique en train de passer deprédiction du mondeàparticipation au contrôle, plutôt qu'à une méthode qui domine déjà la recherche en robotique.07
La robotique entre dans « l'ère des problèmes systémiques »
En considérant ces recherches ensemble, ce qui est le plus remarquable à l'IROS 2026, ce n'est pas qu'une voie technologique particulière soit en train de « gagner ». Le VLA n'a pas remplacé la planification et le contrôle traditionnels, le World Model n'est pas encore devenu dominant, et le Humanoid n'est qu'une partie de l'ensemble du paysage de la recherche en robotique. Le véritable changement qui se produit, c'est qu'une fois ces nouvelles méthodes entrées dans le monde physique, les problèmes de perception, de mémoire, de planification, de contrôle, de toucher, de sécurité et de récupération redeviennent incontournables. Le succès des modèles de langage ces dernières années provient en grande partie de l'unification d'un grand nombre de tâches dans un seul modèle. Mais les robots sont différents. Ils doivent non seulement « comprendre », mais aussi agir réellement, et le monde physique expose entièrement les erreurs, les latences, les contacts et les échecs. Ainsi, l'IROS 2026 revient plutôt à répondre à une nouvelle question : une fois que les modèles sont suffisamment puissants, comment recomposer ces capacités en un véritable système robotique fonctionnel. Cela ne signifie pas que l'approche de bout en bout a échoué, ni que les modules traditionnels ont repris le dessus. Plus précisément, la robotique est en train de rechercher à nouveau les frontières entre grands modèles, planification, contrôle et matériel. La compétition future ne consistera peut-être plus seulement à comparer qui a le modèle le plus grand et le plus capable, mais qui pourra réellement combiner ces capacités de manière stable.À mesure que les robots deviennent de plus en plus intelligents, la véritable difficulté devient : comment les empêcher de faire des erreurs.Pour faciliter les échanges entre tous et le partage des informations sur la conférence, nous avons spécialement créé un 2026 groupe d'échanges IROS! En rejoignant le groupe, vous débloquerez ces « avantages » ?
Station d'informations sur la conférence : DDL de soumission, normes de format, avancement des évaluations… les étapes clés vous sont transmises en temps réel, ne craignez plus de manquer un deadline, la préparation de votre soumission est bien assurée.
Causerie entre pairs : des collègues des quatre coins sont dans le groupe, pour échanger des expériences, confronter des idées et tisser un réseau, nous sommes vos compagnons sur le chemin de la recherche.
Poste de ravitaillement de pointe : les dernières recherches et les sujets d'actualité synchronisés en temps réel, combinés aux thèmes de la conférence pour clarifier votre démarche de soumission et faire le plein d'inspiration pour votre article.
Équipe de soutien sur place : (exclusif pendant la conférence) :Une fois sur le site, pas de panique —
Navigation d'itinéraires: répartition des lieux, comment trouver les salles de conférence, posez vos questions à tout moment dans le groupe ;
Lecture commune des sujets: sessions populaires et Keynote en discussion, rattrapez même si vous les avez manqués ;
Compilation des Posters: l'essentiel des affiches sur place compilé, à collectionner en un clic pour ne rien manquer ;
Place des rencontres: dîners, interviews, échanges… pour discuter, collaborer ou se rencontrer, lancez tout dans le groupe.
? Portail d'accès au groupe : Scannez le code QR pour rejoindre le groupe ou ajoutez le WeChat Luyoyo_2026, avec la mention : ECCV + organisme/école + nom + domaine.
Dans la recherche comme dans la technique, l'écart d'information compte.
Allez, prenons une longueur d'avance ensemble !
Montez à bord, laissez-vous guider à travers l'essentiel des grands sommets mondiaux de l'IA
Accès exclusif à :
Présentations PowerPoint d'experts
Textes intégraux des rapports des conférences
Analyses des articles les plus populaires
Entretiens avec les étoiles montantes de la recherche
Scannez le QR code ci-dessus
ou cliquez sur « Lire l'article original » pour suivre la rubrique de 雷峰网 (compte officiel : 雷峰网).
Articles originaux de 雷峰网, reproduction interdite sans autorisation. Voir les détails dans lesConditions de republication。