Autor | Ma Xiaoning
Edición | Cen Feng
En la fecha local del 30 de septiembre, la conferencia principal de IROS 2026 se cerró en Pittsburgh, Estados Unidos, y los principales premios del evento se anunciaron oficialmente el último día. Según informaron los medios especializados en tecnología AI, el Premio a Mejor Trabajo Académica de este año fue otorgado a un estudio sobre la “memoria a largo plazo” de robots. Yumin Lee, Hyoseok Ju y Giseop Kim ganaron el premio por su trabajo titulado “LT-Mem: Spatio-temporal Memory sensible a la volatilidad para el entendimiento de escenas a lo largo de toda la vida”. El Premio a Mejor Trabajo Académica de estudiantes fue para Pei-An Hsieh, Fengjun Yang, Nikolai Matni y M. Ani Hsieh recibió premios. Ellos investigaron cómo lidiar con las complejas interferencias de flujo de aire cuando varios drones quadcopter vuelan en formación muy cercana entre sí. Otras dos premiaciones destacadas pertenecen a los robots humanoides. Un proyecto consiste en que los robots humanoides aprendan las acciones del tenis real, y otro consiste en que los robots humanoides sostengan un bandeja mientras caminan sobre dos patas, manteniendo estable el objeto en la bandeja. Si se comparan los artículos ganadores de este año con los finalistas del Best Paper, se observa que se incluyen en la lista áreas como la memoria a largo plazo, VLA, el modelo mundial, la comprensión de escenarios 4D, la operación visual-táctil, el control de vuelo, los robots humanoides, los robots soft y los robots de fabricación biológica. En comparación con el simple análisis de qué nuevas capacidades han aprendido los robots, algunos trabajos ganadores de este año comienzan a abordar un problema más realista. Una vez que los robots entran realmente en entornos reales, ¿cómo se puede garantizar que estas capacidades funcionen de manera continua y estable?
01
El mejor artículo proporciona al robot una “memoria a largo plazo”
Si un robot vive en el mismo lugar durante un año, ¿qué debería recordar? Esta es una pregunta central detrás del artículo ganador en IROS de este año. El artículo premiado por Yumin Lee, Hyoseok Ju y Giseop Kim se titula “LT-Mem: Volatility-Aware Spatio-Temporal Memory for Lifelong Scene Understanding”. Para la mayoría de los sistemas de robots de hoy, “comprender una escena” se refiere más bien a comprender la escena en este momento. El robot entró en la oficina y vio la mesa, las sillas y la impresora. Podía crear un conjunto de escenas para representarlo. Al día siguiente, las sillas fueron movidas, y él podía actualizar su mapa basándose en observaciones nuevas. De esta manera surgía un problema. Si el nuevo estado cubre continuamente el antiguo, aunque el robot sabe cómo está ahora, pierde gradualmente qué era antes. LT-Mem llama a este fenómeno amnésia temporal, es decir, la olvidez temporal. Para los robots que operan de forma realmente prolongada, la historia podría ser precisamente muy importante. Una pared casi no se mueve, una silla de oficina a veces se traslada, la mochila de una persona puede aparecer en diferentes lugares cada día, y un espacio de estacionamiento puede tener una regularidad periódica de ocupación. Los robots no solo necesitan reconocer estas cosas, sino también saber qué cambia, con qué frecuencia lo hace y cómo era antes. Por lo tanto, LT-Mem no simplemente continúa expandiendo el modelo, sino que diseña una estructura de memoria a largo plazo estratificada, que incluye tres niveles: Live Memory, Delta Memory y Meta Memory. Live Memory guarda el estado del mundo actual, Delta Memory registra los cambios que han ocurrido en la escena, y Meta Memory analiza aún más las regularidades de la historia a largo plazo. En este sistema, un concepto especialmente importante es Volatility, que se refiere a la volatilidad. El robot determina, según la frecuencia con la que han cambiado los diferentes objetos en la historia, si se trata de una parte del entorno relativamente estable o de un objeto que cambia frecuentemente, y basándose en esto decide cómo organizar su memoria. Así, los problemas que enfrenta el robot ya no son simplemente “¿dónde está la silla verde?”, sino que pueden convertirse en: “¿dónde aparecía esta silla verde en el pasado?”, “¿cuándo es más probable que un lugar de estacionamiento quede vacío?”, “¿es la posición de este objeto lo suficientemente estable para servir como referencia para una navegación a largo plazo?”. Esta también es una diferencia importante entre la comprensión de escenas a lo largo de toda la vida y la comprensión de escenas comunes. Lo que el robot enfrenta ya no es una foto estática, sino un mundo con historia. Finalmente, LT-Mem se llevó el premio entre las 10 obras de papel finalistas del Best Paper este año. En cierto modo, este resultado también refleja un problema cada vez más real con el que se enfrentan las investigaciones sobre robots. Si los robots realmente tuvieran que trabajar continuamente durante meses o incluso años en el futuro, ¿cómo deberían entender el tiempo?02
De “volar pegado” a jugar tenis y sostener bandejas
Si las discusiones del Best Paper se refieren a periodos que se miden en meses o incluso años, entonces el estudio del Best Student Paper de este año trata sobre un problema que ocurre entre milisegundos. El artículo “Flatness-Preserving Residual Learning for Real-Time Tight Quadrotor Formation Flight” de Pei-An Hsieh, Fengjun Yang, Nikolai Matni y M. Ani Hsieh ganó el premio Best Student Paper de IROS 2026. La operación de una formación de drones no es un problema nuevo, pero lo realmente difícil es qué hacer cuando vuelan muy cerca unos de otros. El flujo de aire de descarga generado por el cuatro rotor afecta a los vehículos cercanos. Cuando la distancia entre las drones se reduce aún más, estos interferencias aerodinámicas complejas se vuelven rápidamente insuperables. Por lo tanto, los investigadores introducen el aprendizaje de dinámica residual informado por física, permitiendo que el modelo de aprendizaje compense los efectos aerodinámicos difíciles de describir con precisión por los modelos tradicionales de dinámica, mientras se conserva la planicidad diferencial del sistema, para seguir utilizando métodos eficientes de planificación y control de trayectoria. Este artículo también se clasificó como finalista en Best Paper, y finalmente ganó el premio Best Student Paper. Pero los robots que son más fáciles de entender para los lectores comunes en la plataforma de premiación este año podrían ser otros dos, ya que uno juega tenis y el otro lleva un carrito. “Aprendizaje de habilidades de tenis atléticas humanoides a partir de datos de movimiento humano imperfectos” por Zhang Zhikai, Haofei Lu, Yunrui Lian, Ziqing Chen, Yun Liu, Chenghuai Lin, Han Xue, Zeng Zi Cheng, Zekun Qi, Shaolin Zheng, Qing Luan, Jingbo Wang, Junliang Xing, Li Yi, etc., ganó el Premio de Papel para Entretenimiento y Diversión. El tenis es una tarea de movimiento corporal completo bastante exigente para las robots humanoides. No basta con que el brazo mecánico gire un poco sobre la raqueta; el robot también necesita observar la pelota, mover el cuerpo, ajustar el centro de gravedad y controlar el momento del golpe, al mismo tiempo que coordina las piernas, el tronco y los brazos. Un problema clave en este trabajo ya está indicado en el título: Datos de movimiento humano imperfectos. Los datos de movimiento humano en la realidad no son siempre completos, estandarizados ni precisos. Si para aprender cada habilidad deportiva se requiere recopilar nuevamente una gran cantidad de datos de captura de movimiento de alta calidad, entonces los datos mismos se convertirán en un obstáculo importante para ampliar las habilidades de los robots humanoides. Este trabajo intenta permitir que los robots extraigan y combinen habilidades motrices a partir de datos de movimientos humanos que no son perfectos, y finalmente implementar tareas de tenis en robots humanoides. Otro artículo premiado no es tan “impresionante”; el robot simplemente camina con una bandeja en las manos. El artículo “SteadyTray: Learning Object Balancing Tasks in Humanoid Tray Transport Via Residual Reinforcement Learning” de Anlun Huang, Zhenyu Wu, Soofiyan Atar, Yuheng Zhi y Michael C. Yip ganó el Premio a Mejor Artículo en Manipulación Móvil. Pero “andar” y “andar con algo en la mano” son, en realidad, problemas completamente diferentes. Cuando los robots de dos patas caminan, es inevitable que se produzcan movimientos y impactos del cuerpo. Si el objeto en la bandeja no está fijado, estos perturbaciones se transmitirán directamente al objeto. El hecho de que el robot no caiga no significa que la taza no pueda caer. La idea de SteadyTray no es entrenar un gran modelo que resuelva todos los problemas, sino separar la locomoción de la estabilización del carga. La estrategia existente para las extremidades inferiores se encarga de caminar, mientras que la política residual adicional aprende cómo utilizar los movimientos del torso superior para compensar las perturbaciones causadas por la bandeja. Lo que representa también es un cambio evidente en los robots humanoides en los últimos años. La investigación está pasando de la simple locomoción a la loco-manipulación; los robots no solo deben mover su propio cuerpo, sino también completar tareas durante el movimiento.03
Navegación, vestimenta, agricultura, trabajo bajo el agua,
La robot entrará en un mundo más específico
Si bien la memoria a largo plazo, las robots humanoides y los drones representan algunas de las direcciones más destacadas en los premios de este año, los demás premios especiales muestran cuántas diferentes entornos reales están entrando los robots. El artículo “VL-Nav: A Neuro-Symbolic Approach for Reasoning-Based Vision-Language Navigation” de Yi Du, Taimeng Fu, Zhipeng Zhao, Shaoshu Su, Zitong Zhan, Qiwei Du, Zhuoqun Chen, Bowen Li y Chen Wang recibió el Premio a la Mejor Publicación en Robótica Cognitiva. Este trabajo se refiere a la navegación Visión-Lenguaje, que es muy importante en los últimos años. La navegación de robots está pasando de la tradicional “moverse desde el punto A hasta el punto B” a entender el entorno, los objetos y las relaciones espaciales a través de descripciones en lenguaje, y luego actuar basándose en ellas. VL-Nav sigue un camino neuro-simbólico, intentando combinar la poderosa capacidad de percepción de las redes neuronales con el razonamiento simbólico estructurado. Otro artículo premiado incluso rediseñó algo que usamos todos los días, es decir, la cremallera. El artículo “Design, Modeling, and Performance of a Robotic Zipper for Self-Donning Clothing” de Amanda Weckerly, Wooseok Kim, Megan Coram, Ellen Li, Sophie Lin, Gabriel Unger, Isabella Szabo, Allison M. Okamura y Cynthia Sung recibió el Premio Mejor Artículo en Mecanismos y Diseño de Robots. Lo interesante es que los investigadores no se limitaron a hacer que los robots fueran más complejos, sino que, por el contrario, rediseñaron el mundo físico para que la ropa sea más adecuada para el uso automático. Esta es también una faceta muy diferente de la robótica y la investigación en inteligencia artificial pura. Para resolver un problema, no siempre es necesario utilizar modelos más grandes; a veces, un mejor diseño mecánico es la solución. En el área de robots agrícolas, el artículo “SSL-Semantic-NBV: A Self-Supervised Learning-Based NBV for Target-Aware 3D Reconstruction in Agricultural Robotics” de Jianchao Ci, Katarina Smolenova, Xin Wang, Axel Streit, Eldert J. van Henten y Gert Kootstra ganó el Premio Best Paper en Agri-Robotics. Este trabajo se centra en el problema de Next-Best-View en la reconstrucción tridimensional de escenarios agrícolas. Los robots no continúan filmar sin sentido, sino que deben decidir a dónde moverse al siguiente paso para obtener la información más valiosa sobre el objetivo. En el ámbito de los robots submarinos, el artículo “Contact-Aided Factor-Graph Localization for Underwater Sampling” de Michele Grimaldi, Yosaku Maeda, Hitoshi Kakami, Ignacio Carlucho, Yvan R. Petillot y Tomoya Inoue ganó el Premio Best Paper en Materia de Robótica de Seguridad, Seguridad y Rescate. En un entorno subacuático donde tanto el GPS como la información visual estable se ven limitados, los investigadores intentan utilizar el contacto entre los robots y el entorno para ayudar en la localización. Para los robots reales, “lo que se toca” también puede ser información percibida. Además, el artículo “Optimización de textura con conocimiento acústico para la estimación de la postura de cápsulas basada en ultrasonidos”, de Yizhao Qian, Yuzhuo Wang, Chenxi Liu, Jiayuan Luo, Wenwei Gao, Yuan Yixuan, Meng Qinghu y Li Liu, recibió el Premio de Artículo de Aplicación Mejor. En el campo de las robótica industrial, el artículo “Picking Bins Empty: A Hierarchical Hybrid Approach with Online Self-Learning of Grasp Points for Reliable Industrial Bin-Picking” de Florian Töper, Samarth Kishor Yelvande, Jan Niklas Ewertz, Rudolph Triebel y Peter Ohlhausen recibió el Premio Mejor Artículo en Investigación de Robótica Industrial para Aplicaciones. El título del artículo es especialmente claro: “Picking Bins Empty”, que significa vaciar los contenedores. Lo que los robots industriales realmente necesitan demostrar nunca es solo “logré agarrar una vez”, sino si pueden enfrentar obstáculos, acumulación, cambios en la postura y los nuevos estados generados tras cada operación, para seguir agarrando hasta que la caja se vacíe completamente.04
10 candidatos para las mejores tesis,
¿Qué está recompensando la investigación en robots?
Solo LT-Mem logró ganar el Best Paper, pero los 10 artículos que pasaron a la fase final podrían explicar mejor qué está en foco IROS 2026. Además de LT-Mem y el trabajo sobre formaciones quadricopteras que ganó el Best Student Paper, están también los estudios Shallow-π de Boseong Jeon, Yunho Choi y Taehan Kim, que tratan sobre el distilado de conocimientos VLA basado en flujo. “VTAP Gripper: Synergizing Fingertip Sensing and a Visuo-Tactile Active Palm for Dexterous In-Hand Manipulation” de Yuhao Zhou, Sheeraz Athar, Hu Zhixian, Huang Binghao, Li Yunchu, Juan Wachs y Yu She combina la detección mediante el dedo del pie con la palma activa visuo-táctil, abriendo camino a operaciones más complejas con manos ágiles. El artículo “Streaming Gaussian Encoding for 4D Panoptic Occupancy Tracking” de Maximilian Luz, Thomas Nürnberg, Yakov Miron y Abhinav Valada promueve la representación gaussiana en la comprensión dinámica de escenarios 4D. El trabajo “DAWN: Noise-Robust Quadruped Parkour Via Depth-Denoising World Models” de Yohan Choi, Min-Jun Kim, Jin-Sung Kim, Yong-Jae Kim y Youn-Hee Han utiliza el Depth-Denoising World Model en el parkour de robots cuatro patas. Otras publicaciones candidatas abordan, respectivamente, la reconstrucción tridimensional de superficies de vidrio, la fusión multimodal entre EEG y EMG, los robots de suavidad magnética, y el implante de organizaciones de fabricación biológica asistida por robótica. Por ejemplo, el artículo “Enhancing Glass Surface Reconstruction Via Depth Prior for Robot Navigation” de Jiamin Zheng, Jingwen Yu, Guangcheng Chen y Hong Zhang, aborda directamente el problemático tema de las superficies de vidrio en la visión robótica. El artículo “Control de locomoción multimodal autónoma de un robot suave con tira magnética”, por Bin Wang, Shengming Luo, Jiansheng Du, Yuanbiao Ma, Xuanyu An y Qianqian Wang, dirige el estudio hacia robots suaves magnéticos cuya estructura y método de movimiento son completamente diferentes. “Toward Autonomous Biofabricated Tissue Implantation: A Non-Contact Robotic Manipulation System for Soft and Fragile Modules” de SeungTaek Hong, Jaewon Byun, Daekeun Kim, Jinah Jang y Keehoon Kim, lleva aún más los robots a escenarios de operación de tejidos biofabricados flexibles y frágiles. Lo interesante de esta lista es que no existe una única línea tecnológica que domine todos los problemas relacionados con los robots. VLA, World Model, Memory, Gaussian, Visuo-Tactile y Residual Learning aparecen al mismo tiempo, y una gran cantidad de trabajo sigue abordando seriamente la aerodinámica, el contacto, las estructuras mecánicas, los materiales flexibles y el control en tiempo real. En el campo de los robots, un modelo más grande no puede resolver automáticamente todos los problemas.05
Cuando el robot realmente entra en el mundo real
Además del premio del trabajo, IROS 2026 también anunció una serie de premios individuales. Wang Zhidong, de la Universidad Industrial de Chiba en Japón, recibió el IROS Distinguished Service Award, y la razón del premio fue reconocer su contribución prolongada en la organización de la conferencia IROS. Roberto Martin-Martin de UT Austin y Roberto Calandra de TU Dresden recibieron el Toshio Fukuda Young Professional Award. La razón de la premia del primero se centra en la manipulación basada en el aprendizaje, el control rico de contacto y los sistemas de robot interactivos físicamente, mientras que el segundo ganó por su aprendizaje de robot eficiente con muestras, así como por su contribución a la introducción de la percepción táctil avanzada en la inteligencia de los robots. Ralph Hollis recibió el Emperors Keynote Award for Research Achievement, y se mencionó especialmente su contribución a largo plazo en la investigación de robots, así como su papel en la formación de varias generaciones de investigadores en robótica. Además, Alper Yegenoglu y Ariyan Bighashdel recibieron el Premio al Editor Asociado Excepcional, mientras que Dingsheng Luo y Long Zeng obtuvieron el Premio al Revisor Excepcional. Si se consideran estos premios individuales y los premios por artículos, la lista de ganadores del IROS este año no representa una victoria concentrada en un único modelo o en una dirección específica. LT-Mem comienza a procesar la memoria a largo plazo del robot, DAWN utiliza el modelo mundial para el movimiento de los robots cuatro patas, el VTAP Gripper promueve la integración entre visión y tacto, y los robots humanoides comienzan a enfrentarse a tareas complejas como el tenis y la colocación de bandejas. Al mismo tiempo, los robots entran en campos agrícolas, fábricas y entornos subacuáticos, y también deben lidiar con objetos reales más complejos como vidrios, ropa y tejidos blandos. Las rutas técnicas utilizadas en estos trabajos no son las mismas, pero todos apuntan a un cambio: la investigación en robots está pasando de “obtener una capacidad” a “usar continuamente esa capacidad en el mundo real”. Si buscamos una pista común en los resultados premiados del IROS 2026, quizás no sea simplemente “la inteligencia con cuerpo sigue ganando popularidad”. Cuando el robot realmente se acerca al mundo real, lo que necesita no es solo un modelo más grande, sino también recordar el pasado, comprender los cambios, percibir el contacto, y mantener el control estable de su propio cuerpo bajo restricciones dinámicas reales. Desde poder caminar, hasta poder jugar tenis o sostener un plato, y luego ser capaz de entender a largo plazo un mundo en constante cambio, el robot está pasando de mostrar una habilidad a convertirse en un sistema más completo.Para que todos puedan comunicarse entre sí y compartir información sobre las reuniones, hemos creado especialmente el IROS 2026 Grupo de comunicación para la participación¡Entrar en el grupo desbloqueará estos «beneficios»?
Estación de información de reuniones: envíos de DDL, normas de formato, progreso de revisión… los puntos clave se notifican en el momento adecuado, así no hay más riesgo de perder el plazo estipulado, la preparación del envío está completamente asegurada.
Reunión de té entre colegas: todos los colegas de todo el mundo están en el grupo. Hablan de sus experiencias, discuten ideas y construyen contactos. Estamos juntos en el camino de la investigación científica.
Estación de suministro de vanguardia: los últimos resultados de investigación y las áreas en auge se sincronizan en tiempo real. En combinación con el tema de la conferencia, te ayuda a organizar mejor tus artículos y proporciona inspiración para tu tesis.
Comité de apoyo en el lugar: (abierto exclusivamente durante la reunión):No hay que preocuparse al llegar al lugar—
Navegación de rutas: Distribución de los recintos, cómo llegar al salón de informes, pide ayuda en el grupo en cualquier momento;
Leer en conjunto sobre temas: sesiones populares y discusiones de Keynote; se puede seguir aunque se pierda.
Compilación de pósters: Recopilación de los mejores pósters en vivo, guardar con una sola tecla sin omitir nada;
Plaza Yüju: Salas de comida, oficinas de entrevistas, salas de intercambio… Si quieres charlar, cooperar o conocerse en persona, basta iniciar una reunión en el grupo.
? Puerta de entrada al grupo: Escanee el código para unirse al grupo o agrega a WeChat Luyoyo_2026, con una nota: ECCV + institución/universidad + nombre + área de estudio.
En investigación científica/tecnología, la diferencia de información es muy importante.
Vamos, darle un paso adelante!
Sube al coche, te mostraré las mejores conferencias de IA del mundo
Acceso exclusivo:
PPT para la presentación de un experto
Informe completo de la conferencia
Interpretación de artículos científicos populares
Entrevista con la estrella académica
Escanee el código QR de arriba
O haga clic en «Leer el texto original» para seguir la sección de Leifengwang (publicación: Leifengwang).
Artículo original de Leifengwang, no se permite la reproducción sin autorización. Para más detalles, consulte las instrucciones para la reproducción.