Auteur丨Ma Xiaoning
Rédacteur丨Cen Feng
Le 30 septembre, heure locale, la conférence principale IROS 2026 s'est achevée à Pittsburgh, aux États-Unis, et les principales récompenses de cette édition ont été officiellement dévoilées le dernier jour. AI科技评论 a appris sur place que le Best Paper Award de cette année a finalement été décerné à une recherche sur la « mémoire à long terme » des robots. Yumin Lee, Hyoseok Ju et Giseop Kim ont remporté le prix du meilleur article grâce à « LT-Mem: Volatility-Aware Spatio-Temporal Memory for Lifelong Scene Understanding ». Le Best Student Paper Award est revenu à Pei-An Hsieh, Fengjun Yang, Nikolai Matni et M. Ani Hsieh. Leur recherche porte sur la manière dont plusieurs drones quadrirotors volant en formation à très courte distance gèrent les complexes perturbations aérodynamiques qu'ils exercent les uns sur les autres. Deux autres prix très remarqués concernent les robots humanoïdes. Un travail apprend à un robot humanoïde les mouvements de tennis de joueurs réels, tandis qu'un autre apprend à un robot humanoïde à porter un plateau en maintenant les objets stables pendant la marche bipède. Si l'on considère ensemble les articles primés de cette année et les Best Paper Finalist, des directions telles que la mémoire à long terme, les VLA, les modèles du monde, la compréhension de scènes 4D, la manipulation visuo-tactile, le contrôle du vol, les robots humanoïdes, les robots mous et les robots de biofabrication figurent toutes dans la liste. Plutôt que de simplement discuter des « nouveaux mouvements appris » par les robots, un certain nombre de travaux primés cette année abordent une question plus concrète. Lorsque les robots entrent réellement dans des environnements réels, comment faire en sorte que ces capacités fonctionnent de manière continue et stable ?
01
Le meilleur article consacré à la « mémoire à long terme » des robots
Si un robot vit pendant un an au même endroit, que doit-il retenir ? C'est l'une des questions centrales qui sous-tend le meilleur article de l'IROS cette année. L'article primé de Yumin Lee, Hyoseok Ju et Giseop Kim s'intitule « LT-Mem: Volatility-Aware Spatio-Temporal Memory for Lifelong Scene Understanding ». Pour la plupart des systèmes robotiques actuels, « comprendre une scène » revient surtout à comprendre la scène de l'instant présent. Un robot entre dans un bureau, voit des tables, des chaises, une imprimante, et peut construire une représentation de la scène ; le lendemain, la chaise a été déplacée, et il peut mettre à jour sa carte à partir de nouvelles observations. Le problème naît là. Si de nouveaux états recouvrent sans cesse les anciens, le robot sait « comment c'est maintenant » mais perd progressivement « comment c'était avant ». LT-Mem nomme ce phénomène temporal amnesia, c'est-à-dire l'oubli temporel. Pour un robot réellement destiné à fonctionner sur le long terme, l'historique peut justement être très important. Un mur ne bouge presque jamais, une chaise de bureau est occasionnellement déplacée, le sac à dos d'une personne peut apparaître à des endroits différents chaque jour, et une place de parking peut présenter une certaine régularité d'occupation périodique. Le robot a non seulement besoin de connaître ces éléments, mais aussi de savoir ce qui change, à quelle fréquence cela change, et comment cela a changé par le passé. LT-Mem n'a donc pas simplement continué à agrandir le modèle, mais a conçu une architecture de mémoire à long terme hiérarchisée, comprenant trois niveaux : Live Memory, Delta Memory et Meta Memory. Live Memory conserve l'état actuel du monde, Delta Memory enregistre les changements survenus dans la scène, et Meta Memory synthétise davantage de régularités à partir de l'historique à long terme. Dans ce système, un concept particulièrement important est la Volatility, c'est-à-dire la volatilité. Le robot juge, d'après la fréquence historique des changements d'un objet, s'il s'agit d'un composant environnemental relativement stable ou d'un objet changeant fréquemment, et décide en conséquence comment organiser sa mémoire. Ainsi, la question à laquelle le robot est confronté n'est plus seulement « où est la chaise verte », mais peut devenir « où cette chaise verte est-elle apparue par le passé », « quand cette place de parking est-elle la plus susceptible de se libérer » ou « la position de cet objet est-elle suffisamment stable pour servir de référence à la navigation à long terme ». C'est là une différence importante entre la lifelong scene understanding et la compréhension de scène ordinaire. Le robot n'est plus face à une photo figée, mais face à un monde doté d'une histoire. Au final, LT-Mem s'est imposé parmi les 10 Best Paper Finalist de cette année. Dans une certaine mesure, ce résultat reflète également un problème de plus en plus concret auquel la recherche en robotique est confrontée. Si les robots doivent vraiment fonctionner en continu pendant des mois, voire des années, comment doivent-ils comprendre le temps ?02
Du « vol en rase-mottes » au tennis et au port de plateau
Si le Best Paper porte sur un temps qui se mesure en mois, voire en années, le Best Student Paper de cette année étudie, lui, une question qui se joue en millisecondes. « Flatness-Preserving Residual Learning for Real-Time Tight Quadrotor Formation Flight », de Pei-An Hsieh, Fengjun Yang, Nikolai Matni et M. Ani Hsieh, a reçu l'IROS 2026 Best Student Paper Award. Le vol en formation de plusieurs drones n'est pas un problème nouveau ; la vraie difficulté, c'est de savoir quoi faire lorsqu'ils volent très près les uns des autres. Le flux d'air descendant produit par un quadrirotor affecte les appareils voisins. Lorsque la distance entre les drones se réduit encore, ces complexes perturbations aérodynamiques deviennent rapidement non négligeables. Les chercheurs ont donc introduit le physics-informed residual dynamics learning, permettant au modèle appris de compenser les effets aérodynamiques que les modèles dynamiques traditionnels décrivent difficilement avec précision, tout en préservant la differential flatness du système, afin de continuer à exploiter des méthodes efficaces de planification de trajectoire et de contrôle. Cet article a également figuré parmi les Best Paper Finalist et a finalement reçu le Best Student Paper Award. Mais les robots les plus faciles à comprendre pour le grand public sur l'estrade des prix cette année sont sans doute les deux autres, car l'un jouait au tennis et l'autre portait un plateau. « Learning Athletic Humanoid Tennis Skills from Imperfect Human Motion Data », de Zhang Zhikai, Haofei Lu, Yunrui Lian, Ziqing Chen, Yun Liu, Chenghuai Lin, Han Xue, Zeng Zicheng, Zekun Qi, Shaolin Zheng, Qing Luan, Jingbo Wang, Junliang Xing, Wang He, Li Yi et d'autres, a reçu le Best Entertainment and Amusement Paper Award. Pour un robot humanoïde, le tennis est une tâche motrice de tout le corps particulièrement exigeante. Il ne s'agit pas seulement de faire balancer un bras robotique avec une raquette : le robot doit également observer la balle qui arrive, déplacer son corps, ajuster son centre de gravité, contrôler le moment de la frappe, tout en coordonnant jambes, torse et bras. Une question clé de ce travail figure déjà dans le titre : Imperfect Human Motion Data. Les données de mouvement humain réelles ne sont pas toujours complètes, standardisées et précises, et s'il fallait recueillir à chaque fois une grande quantité de données de capture de mouvement de haute qualité pour apprendre une nouvelle compétence sportive, les données elles-mêmes deviendraient un goulot d'étranglement majeur pour l'extension des compétences des robots humanoïdes. Ce travail tente de faire extraire et combiner par le robot des compétences motrices à partir de données de mouvement humain imparfaites, pour finalement réaliser la tâche du tennis sur un robot humanoïde. L'autre article primé est moins « spectaculaire » : le robot se contente de marcher en portant un plateau. « SteadyTray: Learning Object Balancing Tasks in Humanoid Tray Transport Via Residual Reinforcement Learning », de Anlun Huang, Zhenyu Wu, Soofiyan Atar, Yuheng Zhi et Michael C. Yip, a reçu le Best Paper Award on Mobile Manipulation. Mais « savoir marcher » et « marcher en portant quelque chose » sont en réalité des problèmes totalement différents. Lorsqu'un robot bipède marche, les balancements et les chocs du corps sont inévitables, et si les objets sur le plateau ne sont pas fixés, ces perturbations se transmettent directement aux objets. Que le robot ne tombe pas lui-même ne signifie pas que la tasse ne tombera pas. L'approche de SteadyTray ne consiste pas à réentraîner un grand modèle prenant tout en charge, mais à séparer la locomotion et la stabilisation de la charge. Une politique de membres inférieurs existante se charge de la marche, tandis qu'une residual policy supplémentaire apprend à utiliser les mouvements du haut du corps pour compenser les perturbations subies par le plateau. Ce qu'il représente, c'est aussi une évolution manifeste des robots humanoïdes ces dernières années. La recherche passe de la simple locomotion au loco-manipulation : le robot doit non seulement déplacer son propre corps, mais aussi accomplir des tâches pendant le déplacement.03
Navigation, habillage, agriculture, travail sous-marin,
les robots entrent dans un monde plus concret
Si la mémoire à long terme, les robots humanoïdes et les drones représentent les directions les plus marquantes des lauréats de cette année, les autres prix spéciaux, eux, montrent combien de environnements réels différents les robots commencent à investir. « VL-Nav: A Neuro-Symbolic Approach for Reasoning-Based Vision-Language Navigation » de Yi Du, Taimeng Fu, Zhipeng Zhao, Shaoshu Su, Zitong Zhan, Qiwei Du, Zhuoqun Chen, Bowen Li et Chen Wang a reçu le Best Paper Award on Cognitive Robotics. Ce travail pointe vers la Vision-Language Navigation, très importante ces dernières années. La navigation robotique passe progressivement du traditionnel « se déplacer du point A au point B » à une compréhension de l'environnement, des objets et des relations spatiales à partir de descriptions en langage, avant d'agir. VL-Nav emprunte une voie neuro-symbolique, cherchant à combiner la puissante capacité de perception des réseaux de neurones avec un raisonnement symbolique structuré. Un autre article primé a même redessiné un objet que nous utilisons chaque jour : la fermeture éclair. « Design, Modeling, and Performance of a Robotic Zipper for Self-Donning Clothing » d'Amanda Weckerly, Wooseok Kim, Megan Coram, Ellen Li, Sophie Lin, Gabriel Unger, Isabella Szabo, Allison M. Okamura et Cynthia Sung a reçu le Best Paper Award on Robot Mechanisms and Design. Ce qui est intéressant, c'est que les chercheurs ne se contentent pas de rendre les robots plus complexes, mais redessinent au contraire le monde physique lui-même, afin que les vêtements se prêtent mieux à l'habillage automatique. C'est là un aspect très différent de la robotique par rapport à la recherche en IA pure : résoudre un problème ne nécessite pas forcément un modèle plus grand ; parfois, une meilleure conception mécanique est la réponse. Du côté des robots agricoles, « SSL-Semantic-NBV: A Self-Supervised Learning-Based NBV for Target-Aware 3D Reconstruction in Agricultural Robotics » de Jianchao Ci, Katarina Smolenova, Xin Wang, Axel Streit, Eldert J. van Henten et Gert Kootstra a reçu le Best Paper Award on Agri-Robotics. Ce travail s'intéresse au problème du Next-Best-View dans la reconstruction 3D en milieu agricole. Le robot ne doit pas continuer à prendre des images au hasard, mais juger où se déplacer ensuite pour obtenir les nouvelles informations les plus précieuses sur la cible. Du côté des robots sous-marins, « Contact-Aided Factor-Graph Localization for Underwater Sampling » de Michele Grimaldi, Yosaku Maeda, Hitoshi Kakami, Ignacio Carlucho, Yvan R. Petillot et Tomoya Inoue a reçu le Best Paper Award on Safety, Security, and Rescue Robotics. Dans un environnement sous-marin où le GPS et les informations visuelles stables sont limités, les chercheurs tentent d'exploiter les contacts entre le robot et l'environnement pour faciliter la localisation. Pour un robot réel, « ce qui a été touché » peut lui-même devenir une information de perception. En outre, « Acoustic-Aware Texture Optimization for Ultrasound-Based Capsule Pose Estimation » de Yizhao Qian, Yuzhuo Wang, Chenxi Liu, Jiayuan Luo, Wenwei Gao, 袁奕萱, 孟庆虎 et Li Liu a reçu le Best Application Paper Award. Du côté des robots industriels, « Picking Bins Empty: A Hierarchical Hybrid Approach with Online Self-Learning of Grasp Points for Reliable Industrial Bin-Picking » de Florian Töper, Samarth Kishor Yelvande, Jan Niklas Ewertz, Rudolph Triebel et Peter Ohlhausen a reçu le Best Paper Award for Industrial Robotics Research for Applications. Son titre est particulièrement direct : Picking Bins Empty, c'est-à-dire vider complètement les caisses. Ce qu'un robot industriel doit réellement prouver n'a jamais été seulement « j'ai réussi une prise », mais sa capacité à continuer de saisir face aux occlusions, à l'empilement, aux changements de pose et aux nouveaux états créés par opération après opération, jusqu'à ce que la caisse soit véritablement vidée.04
10 articles candidats au titre de meilleur article,
que récompense la recherche en robotique ?
Seul LT-Mem a finalement décroché le Best Paper, mais les 10 articles parvenus à la phase finale en disent peut-être plus long sur ce que l'IROS 2026 observe. Outre LT-Mem et le travail sur les essaims de quadrirotors qui a finalement remporté le Best Student Paper, la recherche Shallow-π de Boseong Jeon, Yunho Choi et Taehan Kim porte sur la distillation des connaissances des VLA à base de flux. « VTAP Gripper: Synergizing Fingertip Sensing and a Visuo-Tactile Active Palm for Dexterous In-Hand Manipulation » de Yuhao Zhou, Sheeraz Athar, 胡智娴, 黄秉豪, 李昀烛, Juan Wachs et Yu She combine le fingertip sensing et le visuo-tactile active palm, en direction de manipulations en main plus complexes et dextres. « Streaming Gaussian Encoding for 4D Panoptic Occupancy Tracking » de Maximilian Luz, Thomas Nürnberg, Yakov Miron et Abhinav Valada pousse la représentation gaussienne vers la compréhension de scènes 4D dynamiques. « DAWN: Noise-Robust Quadruped Parkour Via Depth-Denoising World Models » de Yohan Choi, Min-Jun Kim, Jin-Sung Kim, Yong-Jae Kim et Youn-Hee Han, quant à lui, applique les Depth-Denoising World Models au parkour des quadrupèdes. Les autres articles candidats portent respectivement sur la reconstruction 3D de surfaces en verre, la fusion multimodale EEG-EMG, les robots mous magnétiques et l'implantation de tissus en biom fabrication assistée par robot. Par exemple, « Enhancing Glass Surface Reconstruction Via Depth Prior for Robot Navigation » de Jiamin Zheng, Jingwen Yu, Guangcheng Chen et Hong Zhang s'attaque frontalement au problème des surfaces en verre, toujours très épineux en vision robotique. « Autonomous Multimodal Locomotion Control of a Magnetic Strip Soft Robot » de Bin Wang, Shengming Luo, Jiansheng Du, Yuanbiao Ma, Xuanyu An et Qianqian Wang déplace le sujet d'étude vers des robots mous magnétiques, dont la structure et le mode de locomotion sont entièrement différents. « Toward Autonomous Biofabricated Tissue Implantation: A Non-Contact Robotic Manipulation System for Soft and Fragile Modules » de SeungTaek Hong, Jaewon Byun, Daekeun Kim, Jinah Jang et Keehoon Kim pousse encore plus loin le robot dans la manipulation de tissus biom fabriqués, mous et fragiles. Ce qui est le plus intéressant dans cette liste, c'est précisément qu'aucune voie technologique ne domine tous les problèmes de la robotique. VLA, World Model, Memory, Gaussian, Visuo-Tactile et Residual Learning apparaissent simultanément, et de nombreux travaux continuent de traiter sérieusement l'aérodynamique, le contact, les structures mécaniques, les matériaux souples et le contrôle temps réel. En robotique, un modèle plus grand ne résout pas automatiquement tous les problèmes.05
Quand les robots entrent vraiment dans le monde réel
Au-delà des prix d'articles, l'IROS 2026 a également décerné une série de prix individuels. 王志东, de l'Université Chiba de technologie au Japon, a reçu l'IROS Distinguished Service Award ; le comité a justifié cette distinction par sa contribution de longue date à l'organisation de la conférence IROS. Roberto Martin-Martin de l'UT Austin et Roberto Calandra de la TU Dresden ont reçu le Toshio Fukuda Young Professional Award. Les motifs du premier portent sur le learning-based manipulation, le contact-rich control et les systèmes robotiques à interaction physique ; le second a été récompensé pour le sample-efficient robot learning ainsi que pour ses contributions telles que l'introduction de la perception tactile avancée dans l'intelligence robotique. Ralph Hollis a reçu l'Emeritus Keynote Award for Research Achievement ; le comité a notamment salué ses contributions de longue date à la recherche robotique ainsi que la formation de plusieurs générations de chercheurs en robotique. En outre, Alper Yegenoglu et Ariyan Bighashdel ont reçu l'Outstanding Associate Editor Award, et Dingsheng Luo et Long Zeng l'Outstanding Reviewer Award. Si l'on envisage ensemble ces prix individuels et les prix d'articles, le palmarès de l'IROS cette année n'est pas la victoire concentrée d'un modèle ou d'une direction particulière. LT-Mem commence à traiter la mémoire à long terme des robots, DAWN applique les modèles du monde à la locomotion des quadrupèdes, le VTAP Gripper fait progresser la fusion de la vision et du toucher, et les humanoïdes commencent à relever des tâches complexes comme le tennis ou le port de plateaux. Dans le même temps, les robots entrent dans les champs, les usines et les environnements sous-marins, et commencent aussi à affronter des objets réels plus complexes comme le verre, les vêtements et les tissus mous. Ces travaux empruntent des voies technologiques différentes, mais pointent tous vers un même changement : la recherche en robotique passe de « l'acquisition d'une capacité » à « l'utilisation continue de cette capacité dans le monde réel ». Si l'on cherche un fil conducteur dans les résultats de l'IROS 2026, ce n'est peut-être pas le simple « engouement continu pour l'intelligence incarnée ». Quand les robots se dirigent vraiment vers le monde réel, il leur faut non seulement un modèle plus grand, mais aussi la mémoire du passé, la compréhension du changement, la perception du contact, tout en contrôlant leur corps de manière stable sous les contraintes dynamiques réelles. De la marche, au tennis et au port de plateaux, jusqu'à la capacité de comprendre durablement un monde en perpétuel changement, les robots passent de la démonstration d'une capacité à devenir un système plus complet.Pour faciliter les échanges de groupe et le partage d'informations sur la conférence, nous avons créé un groupe dédié IROS 2026 d'échanges entre participants! En rejoignant le groupe, vous débloquerez ces « avantages » ?
Poste d'informations sur la conférence : DDL des soumissions, normes de format, avancement de l'évaluation… les étapes clés vous parviennent en première main ; plus besoin de craindre de manquer une deadline, la préparation de votre soumission est entre de bonnes mains.
Salon de discussion entre pairs : des collègues de tous horizons sont dans le groupe, pour échanger sur les expériences, faire naître des idées et tisser un réseau ; sur le chemin de la recherche, nous avançons ensemble.
Poste de pointe : derniers résultats de recherche et orientations d'actualité synchronisés en temps réel, avec le thème de la conférence pour clarifier votre logique de soumission et faire le plein d'inspiration pour votre article.
Équipe de soutien sur place : (actif exclusivement pendant la conférence) :Sur place, pas de panique —
Guidage d'itinéraire: plan des locaux, comment rejoindre les salles de conférence, posez vos questions à tout moment dans le groupe ;
Lecture commune des sessions: sessions à la mode et Keynotes en discussion, rattrapable même si vous les avez manquées ;
Recueil des posters: l'essentiel des posters sur place compilé, à collectionner en un clic sans rien manquer ;
Place des rendez-vous: repas, interviews, échanges… pour bavarder, collaborer ou se rencontrer, il suffit de lancer l'idée dans le groupe.
? Portail d'accès au groupe : Scannez le code pour rejoindre le groupe ou ajoutez le WeChat Luyoyo_2026, avec la mention : ECCV + organisme/école + nom + domaine.
En recherche comme en technologie, l'écart d'information compte beaucoup.
Venez, prenons une longueur d'avance ensemble !
Embarquez, et découvrez avec nous l'essentiel des grandes conférences mondiales sur l'IA
Accès exclusif à :
PPT de conférences d'experts
Texte intégral des rapports du congrès
Analyse des articles à la mode
Entretien avec une étoile montante du monde académique
Scannez le QR code ci-dessus
ou cliquez sur « Lire l'article original » pour suivre la zone dédiée de Leiphone (compte officiel : 雷峰网).
Article original de Leiphone, reproduction interdite sans autorisation. Voir les détails dans lesConditions de republication。