雷峰网 AI

Tras estudiar 1933 artículos de IROS, hemos visto seis nuevos cambios en la robótica

Los grandes modelos no se han "comido" la robótica. Autor丨Ma Xiaoning Editor丨Cen Feng El 27 de septiembre se inaugurará IROS 2026 en Pittsburgh. Tras 31 años de ausencia, IROS regresa a esta ciudad del acero. Como una de…

Los grandes modelos no se han 'comido' la robótica.

    Autor: Ma Xiaoning

Edición: Cén Fēng

                                                                                                       

El 27 de septiembre, IROS 2026 abrirá en Pittsburgh. Después de 31 años, IROS regresa a esta ciudad del acero. Como una de las conferencias académicas de robótica más grandes del mundo, este año llegaron al programa oficial 1933 artículos. Si se despliegan estos casi dos mil artículos, se ve más bien como una sección transversal de la investigación robótica de 2026: desde el aprendizaje por refuerzo y el aprendizaje por imitación, hasta la planificación de rutas, la percepción visual, el control de movimiento y la manipulación diestra, pasando por robots humanoides, háptica y grandes modelos, casi todas las líneas tecnológicas importantes del campo de la robótica de los últimos años aparecen simultáneamente en este mapa. Pero lo realmente digno de atención no son las palabras clave que más fácilmente captan la atención de la industria y los medios, como Humanoid, VLA o World Model. Tras un análisis multietiqueta de los 1933 artículos, se puede ver que hay unos 809 artículos relacionados con Robot Learning / Embodied AI, 564 sobre Navigation / Planning, 556 sobre Perception / Vision, 546 sobre Control / Dynamics, 520 sobre Manipulation, y unos 213 relacionados con Humanoid / Legged. Dado que un artículo puede abarcar varias direcciones a la vez, estas cifras no pueden simplemente sumarse, pero revelan una cosa: la investigación en robótica no ha sido reabsorbida en un único «problema de IA» por la entrada de los grandes modelos. Por el contrario, el aprendizaje, la percepción, la planificación, el control y la manipulación se están entrelazando con una densidad sin precedentes. En el contexto del frenesí por la AGI que acapara todas las miradas, estos casi dos mil artículos emiten una señal:Los modelos de gran escala no“Devorar”Robótica.Muy por el contrario, tras dos años de carrera desenfrenada hacia los modelos de extremo a extremo, la investigación en robótica está intentando recuperar en Pittsburgh esa alma física oculta tras los píxeles y los tokens mediante un 'renacimiento de la capa intermedia' que abarca la geometría tridimensional, el razonamiento simbólico y el control de bajo nivel." Lo que realmente merece preguntarse sobre IROS 2026 quizás no sea si "los grandes modelos están reemplazando a la robótica tradicional", sino si la investigación en robótica está entrando en una etapa de sistemas más compleja.

01


  La IA no ha reemplazado a la robótica tradicional,

sino que se vuelve a incrustar

Si se observa más a fondo las relaciones cruzadas entre estos artículos, los cambios reales que han ocurrido tras la llegada de los grandes modelos a la robótica se vuelven más claros. Hay unos 276 artículos en los que Robot Learning aparece junto con Manipulation, 269 que se cruzan con Perception, 225 con Navigation / Planning, y también 221 con Control / Dynamics. Los métodos de aprendizaje no han simplemente comprimido los módulos técnicos originales de la robótica, sino que se han ido incrustando cada vez más profundamente en estos problemas tradicionales. Este cambio se manifiesta primero en la planificación. Jorge Mendez-Mendez, de la Universidad de Stony Brook, en «A Systematic Study of Large Language Models for Task and Motion Planning with PDDLStream» (Un estudio sistemático de grandes modelos de lenguaje para la planificación de tareas y movimiento con PDDLStream) en él se probó el desempeño de incrustar grandes modelos de lenguaje en los marcos tradicionales de Task and Motion Planning. La investigación no apunta a que "los grandes modelos puedan reemplazar directamente al planificador", sino que muestra que las restricciones geométricas, la factibilidad del movimiento y la lógica de ejecución todavía requieren la participación de los sistemas de planificación tradicionales. Esto es muy representativo. Un LLM puede entender qué significa "llevar la taza al otro lado de la mesa", pero cuando el robot realmente lo ejecuta, todavía debe responder si el brazo mecánico colisionará, si las articulaciones son alcanzables, si la trayectoria puede ejecutarse y si el entorno actual ha cambiado. La pregunta pasa entonces de "si el LLM puede reemplazar al Planner" a cómo deben repartirse las tareas entre ambos. Un fenómeno similar aparece también en el extremo de la percepción de los VLA. Entre los candidatos al premio al mejor artículo de IROS 2026 en Cognitive Robotics se encuentra un GeoVLA: Potenciando 3D Representaciones en Modelos de Visión-Lenguaje-Acción, realizado por un equipo de la Universidad de Tianjin, Yuanli Lingji y la Universidad de Tsinghua; entre los autores se encuentra el de Yuanli LingjiXie Bin, de la Universidad de TsinghuaShi Haoetc. Ataca precisamente el problema de que los VLA existentes dependen en exceso de la visión 2D: los VLA tradicionales suelen generar acciones directamente a partir de imágenes RGB e instrucciones de lenguaje, pero los robots reales se enfrentan a un mundo tridimensional, donde la altura de los objetos, su tamaño y los cambios en el ángulo de la cámara pueden afectar directamente la manipulación. GeoVLA no se limitó a seguir ampliando el modelo, sino que incorporó explícitamente información de profundidad y geometría 3D, utilizando la representación 3D junto con las características visuales y lingüísticas para la generación de acciones. Dicho de otro modo, después de que los grandes modelos se hicieran más potentes, la tradicional 'geometría espacial' de la robótica ha vuelto a ser recuperada. En el lado del control también se observa un fenómeno similar. Del equipo procedente de la Universidad de Florida Central, el Instituto Indio de Tecnología de Kanpur, la Universidad de Bath y la Universidad de Maryland en College Park Entrenamiento rápido de políticas de robots con modelos fundacionales lentos, estudia un problema muy real: los grandes Foundation Model pueden ofrecer más conocimiento y mayor generalización, pero su velocidad de inferencia es demasiado lenta, lo que no los hace aptos para funcionar de manera continua en el bucle de control de alta frecuencia de un robot. Por ello, los investigadores hacen que los grandes modelos participen más en el entrenamiento y luego aprenden una política de robot más ligera y rápida encargada de la ejecución real. Cuando un modelo de lenguaje tarda unos cientos de milisegundos en responder una pregunta, el usuario normalmente solo percibe que reacciona un poco más despacio; cuando un robot tarda unos cientos de milisegundos en actuar al agarrar, hacer contacto o mantener el equilibrio, la tarea ya puede haber fallado. La capacidad del modelo y el control en tiempo real nunca han sido el mismo problema. La investigación táctil, más cercana al mundo físico, también muestra una dirección similar. De la Universidad de Colorado DenverFang Xinmincompletado junto con el equipo de la Universidad Estatal de Kennesaw y otros DexTact: un modelo fundacional visuotáctil para el agarre con mano diestra..., introduciendo simultáneamente la visión y el tacto en el problema de la prensión con manos robóticas. Lo que investiga ya no es simplemente "la imagen le dice al robot dónde está el objeto", sino "qué más puede percibir el sistema después de que la mano toca el objeto". Aquí, los Foundation Model, el tacto, la manipulación diestra y el control se comprenden dentro de un mismo sistema. Por lo tanto, el cambio realmente digno de atención en 2026 no es que la robótica esté siendo reemplazada por la IA. Dicho con más precisión, es que la IA empieza a adentrarse en los aspectos más tradicionales de la robótica y, al mismo tiempo, está siendo remodelada por esos problemas tradicionales.

02


Los VLA pasan de la fase de "demostrar que pueden hacerlo" a la etapa de "subsanar puntos débiles"

Si en los últimos dos años la pregunta central de los VLA seguía siendo «es posible que un modelo unificado entienda la visión, el lenguaje y genere directamente acciones robóticas», para el IROS 2026 el foco de investigación se ha desplazado claramente en otra dirección: ya que los modelos pueden hacerlo, lo que hay que resolver ahora es cómo hacerlos más rápidos, más estables y más adecuados para robots reales. En nuestro conteo multi-etiqueta, hay alrededor de 162 artículos relacionados con VLA, VLM, LLM y Foundation Model, lo que representa el 8.4% de todos los artículos; de ellos, unos 82 artículos tratan explícitamente de VLA. Esta escala ya es suficiente para formar una línea de investigación independiente. Pero los problemas que abordan ya no se detienen en «¿puede el modelo ser aún más grande?», sino que se diversifican rápidamente hacia la eficiencia, la comprensión tridimensional, la memoria a largo plazo, los cambios de punto de vista, la adaptación a entornos reales y la seguridad. El ejemplo más directo es Shallow-π: Destilación de conocimiento para VLAs basados en flujos. Este artículo proviene de 42dot, la Universidad Nacional de Seúl y Samsung Research, y ha sido seleccionado como candidato al IROS 2026 Best Paper / Best Student Paper Award. No resuelve cómo entrenar un VLA más grande, sino precisamente el problema de que el modelo es demasiado grande y la inferencia demasiado lenta; mediante destilación de conocimiento comprime el VLA para que el modelo sea más adecuado para robots reales y dispositivos de borde. Esto revela la primera restricción real del VLA al entrar en la robótica: el modelo no solo debe ser «inteligente», sino también suficientemente rápido. Otra debilidad es la comprensión espacial tridimensional. El mencionado GeoVLA de los equipos de la Universidad de Tianjin, Force Dimension (原力灵机) y Tsinghua es esencialmente una forma de dotar al VLA de la capacidad geométrica más tradicional de la robótica. El cambio de punto de vista se ha convertido incluso en un problema independiente.AnyCamVLA: Adaptación de cámara zero-shot para modelos de visión-lenguaje-acción robustos al punto de vista provienen de un equipo de la Universidad Nacional de Seúl y el MIT. Investiga por qué un VLA ya entrenado tiende a fallar cuando cambia la posición de la cámara, y si es posible adaptarse a un nuevo camera viewpoint sin reentrenar todo el modelo. En el despliegue real, los errores de instalación de la cámara, las diferencias entre plataformas robóticas y los cambios de punto de vista son muy comunes; una política que solo funciona con un punto de vista fijo difícilmente puede generalizar de verdad. Las tareas de larga duración exponen otro tipo de carencia: los modelos ejecutan acciones, pero no necesariamente acumulan experiencia.Memoria a largo plazo para agentes basados en VLA en la ejecución de tareas en mundo abierto fue realizado por equipos de la Universidad de Nankín, la Universidad de Waseda, LimX Dynamics y la Universidad de Zhejiang, entre otros; conecta la memoria a largo plazo directamente al agente VLA, permitiendo al sistema guardar trayectorias y experiencias ya completadas y volver a invocarlas más tarde. Aquí la pregunta ya no es si una captura individual tiene éxito, sino si el robot puede recordar «lo que ocurrió antes» en tareas de flujo largo. De la Universidad Sungkyunkwan proviene RoboBRIDGE: Un marco modular para conectar políticas con agentes robóticos robustos en el mundo real , que va un paso más allá. No intenta reentrenar un VLA más potente, sino que añade alrededor de la política preentrenada un Monitor, Perceptor, Planner, Controller y Robot Interface. Cuando la ejecución falla, el Monitor detecta el problema; cuando el entorno cambia, el Planner vuelve a planificar; el Perceptor actualiza la escena; y el Controller convierte la política de alto nivel en acciones reales. Esta estructura ilustra bien lo que está ocurriendo en la siguiente etapa de los VLA. La investigación pasa de «construir un predictor de acciones más fuerte» a cómo construir un sistema completo alrededor de él. Por tanto, la competencia de los VLA quizá ya no sea solo scaling. La cuestión más grande se está convirtiendo en system engineering: cómo un VLA trabaja junto con la percepción, la memoria, la planificación, el control y el hardware, y cómo pasa finalmente de ser un modelo capaz de emitir acciones a un sistema robótico capaz de funcionar a largo plazo.

03


Los robots están volviendo a desarrollar una «capa intermedia»

Si la primera fase del VLA fue intentar unificar percepción, lenguaje y acción en un solo modelo, otra línea de investigación cada vez más clara en el IROS 2026 es que los investigadores vuelven a incorporar activamente nuevas estructuras en medio de esa cadena de extremo a extremo. De los 1933 artículos, unos 119 están relacionados con Reasoning / Memory, lo que representa el 6.2% de todos los artículos; de ellos, 64 tratan explícitamente de Reasoning y 36 de Memory. Ya han formado sesiones muy definidas, incluyendo Agents and Memory for Robust VLA Manipulation, Constraint-Guided Reasoning for Long-Horizon Manipulation, LLM Agents Reasoning Through Robot Tasks y Representing 3D Space for Robot Reasoning. Esto, en sí mismo, merece una pregunta: si los modelos de extremo a extremo ya pueden generar acciones directamente a partir de la visión y el lenguaje, ¿por qué los robots aún necesitan Reasoning, Memory, Planner, e incluso reintroducir Symbolic Constraint y representaciones 3D explícitas? Una de las razones es que, cuando las tareas robóticas se alargan, «lo que se ve en el fotograma actual» ya no basta.TempoFit: Memoria temporal KV por capas plug-and-play para manipulación VLA de largo horizonte provienen de un equipo de la Universidad Xi'an Jiaotong-Liverpool. No reentrenan un VLA más grande, sino que aprovechan la temporal KV memory interna del modelo para que las políticas existentes guarden y invoquen información histórica a través del tiempo. Pero lo que el robot realmente necesita recordar tampoco es solo «lo que vio en el pasado». El equipo de la Universidad de Ciencia de Tokio presenta GaussMemory: Memoria de escena 3D con gaussianos dirigida por tareas para manipulación robótica de largo horizonte, que lleva la memoria al espacio tridimensional. Un objeto, aunque esté temporalmente ocluido, no puede desaparecer del «mundo» del robot solo porque la cámara no lo vea en ese momento; un objeto que ya fue movido también necesita actualizar su posición a tiempo. Por tanto, la memoria en los robots no es exactamente igual que la memoria de contexto en los modelos de lenguaje: debe corresponderse continuamente con el espacio tridimensional real. Lo mismo ocurre con el razonamiento.DualCoT-VLA: Cadena de pensamiento visual-lingüística mediante razonamiento paralelo para modelos de visión-lenguaje-acción fue desarrollado en colaboración entre la Universidad de Ciencia y Tecnología de Hong Kong (Guangzhou) y Huawei. No se conforma con que el VLA emita directamente acciones, sino que añade antes de la generación de la acción una Chain-of-Thought visual y una Chain-of-Thought lingüística: una procesa las relaciones espaciales y la otra la lógica de la tarea de alto nivel. La división «alto nivel—bajo nivel» que los modelos de extremo a extremo intentaban eliminar regresa de otra forma. VL-Nav: Un enfoque neurosimbólico para navegación visión-lenguaje basada en razonamiento, candidata al mejor artículo de Cognitive Robotics, fue realizada principalmente por un equipo de la Universidad Estatal de Nueva York en Búfalo, conDu Yi (杜燚)como primer autor. VL-Nav combina la comprensión semántica de los modelos de visión y lenguaje con el razonamiento espacial y simbólico explícito, aplicándolo a la vision-language navigation en entornos complejos. La reaparición de los métodos simbólicos no significa que la robótica vuelva a una era basada completamente en reglas. Lo que asumen es esa parte de las tareas que los grandes modelos aún no son capaces de completar de forma estable: hacer más explícitas las relaciones espaciales, las condiciones de ejecución y las restricciones. Desde Memory y Reasoning hasta Geometry, Planner y Symbolic Constraint, estos trabajos, aunque superficialmente emplean tecnologías distintas, resuelven el mismo problema estructural: existe una enorme distancia entre la comprensión semántica de alto nivel y las acciones continuas de bajo nivel. Por tanto, el Reasoning, Memory, Planner y Symbolic Constraint que aparecen en el IROS 2026 no son tanto un «anti extremo a extremo», sino que la robótica está reinventando lacapa intermediaentre los grandes modelos y el control de bajo nivel. El enfoque de extremo a extremo no fracasó de forma simple, ni el modularismo resucitó sin más. El cambio más preciso es: a medida que las tareas pasan de la captura de un solo paso a la manipulación de larga duración, y de los entornos de laboratorio al mundo abierto, los sistemas robóticos están volviendo a desarrollar jerarquías.

04


Manipulation 

se convierte en uno de los campos de batalla más densos de la inteligencia encarnada

Si el VLA, el Reasoning y el World Model representan más bien «cómo piensa» el robot, la manipulación se aproxima a otra pregunta: cómo estas capacidades actúan finalmente en el mundo físico a través de una mano, una pinza o un brazo robótico. Hay alrededor de 520 artículos relacionados con Manipulation; tras filtrar además por direcciones como Dexterous Manipulation, Tactile, In-hand Manipulation y Contact-rich Manipulation, quedan unos 225 artículos pertinentes. De ellos, unos 91 artículos tratan explícitamente de Tactile y 52 de Dexterous Manipulation. De estos 225 artículos relacionados con Dexterous/Tactile, unos 165 implican además Manipulation, 79 Learning, 57 Perception y 52 Control. El tacto, el aprendizaje, la percepción y el control convergen constantemente en el mismo conjunto de tareas de manipulación. El candidato al premio del IROS 2026 VTAP Gripper: Sinergia entre la percepción de las puntas de los dedos y una palma activa visuotáctil para la manipulación diestra en la mano, fue realizado en colaboración por equipos de la Universidad de Purdue y la Universidad de Columbia, entre los que se encuentraHu Zhixian (胡智娴)de Purdue, así como de ColumbiaHuang Binghao, Li Yunzhuy otros investigadores. No siguió persiguiendo una mano diestra antropomórfica con grados de libertad cada vez más cercanos a los de la mano humana, sino que diseñó tres dedos flexibles reconfigurables y una superficie palmar visotáctil activa, completando la prensión y la manipulación dentro de la mano mediante el tacto en las puntas de los dedos y el contacto activo con la superficie palmar. Lo más interesante aquí es que la manipulación diestra de alto nivel no necesariamente depende de una estructura antropomórfica con grados de libertad muy elevados. La sinergia entre la estructura mecánica, el contacto activo y la percepción multimodal también puede generar capacidades de manipulación complejas. Otro candidato al premio de diseño de mecanismos de robótica PDS Joint: una articulación paramétrica de doble espiral diseñada específicamente para manos diestras, de un equipo de cinco personas de la Universidad de Tecnología de Pekín. Partieron de la estructura de la articulación a un nivel más fundamental, e integraron conjuntamente las estructuras complacientes, la rigidez articular, la propiocepción y la calibración mediante aprendizaje en el diseño de articulaciones de manos diestras. Desde VTAP hasta PDS Joint, se puede ver que el hardware en sí todavía está lejos de haber convergido, pero el hardware también empieza a ser cada vez más difícil de separar de la percepción, el control y el aprendizaje. Al mismo tiempo, el sentido táctil está pasando de «instalar un sensor» a «entrar en la política».TacVLA: fusión táctil consciente del contacto para una manipulación robusta visión-lenguaje-acción fue realizado en colaboración entre la Universidad de Purdue y el Instituto Italiano de Tecnología, y el equipo de Purdue incluye aXu Zhengtong, Zhang Zhiyuanentre otros investigadores. Envía directamente la información táctil al VLA, de modo que, cuando se produce un contacto real, la información táctil participa en la toma de decisiones de acción, porque en escenarios de oclusión, de inserción fina o de contacto ya establecido, la información proporcionada por la visión decae rápidamente. Otra línea intenta reducir la dependencia del hardware táctil durante la fase de despliegue.HapticVLA: manipulación con contacto rico mediante un modelo visión-lenguaje-acción sin percepción táctil en el tiempo de inferencia proviene de un equipo del Instituto de Ciencia y Tecnología de Skolkovo. Utilizan información táctil durante la fase de entrenamiento para que la política aprenda conocimiento sobre el contacto, pero en la fase de inferencia ya no dependen forzosamente de entradas táctiles en tiempo real. TacVLA y HapticVLA representan precisamente dos enfoques diferentes: uno conecta el tacto en tiempo real con la política, y el otro aprovecha el tacto en el entrenamiento para comprimir después, en la medida de lo posible, la experiencia táctil dentro del modelo. Los problemas de datos también empiezan a emerger. El finalista del Entertainment and Amusement Paper Award PianoFingering-1.5K: un conjunto de datos experto de digitación de piano a gran escala para el aprendizaje de robots diestros proviene de un equipo de la Universidad de Ciencia y Tecnología de China, cuyos autores incluyen aWang Ruoyuentre otros. Organizaron la digitación pianística de expertos en un conjunto de datos estructurado. La interpretación pianística parece algo especial, pero en realidad es una tarea de manipulación diestra sumamente exigente: varios dedos deben realizar contactos precisos, continuos y con fuertes restricciones temporales en intervalos de tiempo muy breves. Sistematizar este tipo de movimientos de nivel experto consiste, en esencia, en proporcionar a la manipulación diestra robótica prioros humanos de alta calidad. Desde el hardware, el tacto hasta los datos, varias líneas convergen finalmente en la misma pregunta: cómo los robots pueden formar una verdadera capacidad de manipulación en lazo cerrado. La manipulación diestra está, por tanto, dejando de ser «construir una mejor mano» para expandirse hacia el establecimiento de unlazo cerrado completo de percepción—tacto—datos—política—control.

05


Humanoid se expande de «saber caminar» hacia «trabajar mientras camina»

Los robots humanoides han sido una de las formas de robot con mayor atención de la industria y los medios en los últimos dos años, pero al volver a colocarlos en el panorama completo de artículos del IROS 2026, el cuadro se muestra más moderado. Según las estadísticas, hay alrededor de 89 artículos relacionados con Humanoid / Loco-Manipulation, lo que representa el 4.6% de todos los artículos. Entre ellos, 46 se cruzan con Control, 44 con Learning, 34 involucran Manipulation y 32 involucran Planning. Lo realmente digno de mención es que los problemas internos de estos artículos están cambiando. En los últimos años, los avances tecnológicos más importantes de los robots humanoides se concentraron en gran medida en la locomotion; ahora ya se puede ver que otro grupo de trabajos comienza a integrar la "movilidad" y la "manipulación" en un mismo sistema. Un ejemplo típico es ULTRA: Control Multimodal Unificado para Loco-Manipulación de Cuerpo Completo Autónomo en Humanoides. Este artículo fue elaborado por la Universidad de Illinois en Urbana-ChampaignHe Xialinet al., en colaboración con investigadores de la Universidad Jiao Tong de Shanghái y de la Universidad Tsinghua, lo completaron y entró en la candidatura a mejor artículo relacionada con Mobile Manipulation en el IROS 2026. No se trata de volver a entrenar una política de locomoción más fuerte, sino de lograr que un robot humanoide complete tareas continuas como acercarse a un objeto, tomarlo, transportarlo y soltarlo. Lo más destacable aquí no es que el robot por fin «sepa transportar cosas», sino que la estructura del problema ha cambiado. En la locomoción pura, el objetivo central es mantener la estabilidad del cuerpo; una vez que el robot sostiene un objeto en las manos, los movimientos de los brazos alteran el centro de gravedad, la carga afecta la marcha, y el contacto de las plantas de los pies, el movimiento de la extremidad superior y la tarea de agarre deben satisfacerse simultáneamente. «Caminar» y «manipular» ya no pueden separarse por completo.SteadyTray: Aprendizaje de tareas de equilibrio de objetos en el transporte de bandejas humanoide mediante aprendizaje por refuerzo residual Del equipo de la Universidad de California en San Diego, conHuang Anlun。Lo lleva al extremo con una tarea muy intuitiva: hacer que un robot humanoide camine sosteniendo una bandeja sin que los objetos de la bandeja se caigan. SteadyTray añade una residual policy a una locomotion policy existente, encargándose específicamente de las perturbaciones que la marcha provoca en el extremo final.DreamMimic: Aprendizaje visuomotor de loco-manipulación corporal completa mediante modelo del mundo mientras que la Universidad Jiao Tong de ShangháiYin JieCompletado en colaboración con el equipo de la Universidad de Tsinghua, introduce la visión y los World Models en el whole-body loco-manipulation, utilizando modelos predictivos para ayudar a los robots a mantener la comprensión del estado durante el control visual prolongado. Los VLA también están comenzando a abordar el mismo problema.Aprendizaje de loco-manipulación humanoide con expertos especializados inducidos por responsabilidad para modelos de visión-lenguaje-acción Del equipo de la Universidad Nacional de Seúl. Este trabajo aborda el problema de que las distribuciones de acciones de locomotion y manipulation difieren enormemente, e introduce specialized experts, permitiendo que distintos expertos asuman distintas responsabilidades de control. Esto demuestra una vez más que "general" no significa "no diferenciar nada internamente". Otro ejemplo más extremo es Award Candidate Aprendiendo habilidades de tenis humanoide atlético a partir de datos imperfectos de movimiento humano。Este trabajo fue realizado por la Universidad TsinghuaZhang Zhikaiy colaboradores, junto con investigadores de la Universidad de Pekín, el Shanghai Artificial Intelligence Laboratory, Galbot y la Universidad Tecnológica de Delft. Jugar al tenis exige que el robot observe una pelota que se mueve a alta velocidad, prediga su trayectoria, mueva el cuerpo y golpee con la raqueta, manteniendo al mismo tiempo el equilibrio. Aunque parece muy lejano al transporte en fábricas, expone el mismo problema: un robot humanoide no puede tener simplemente una marcha estable y luego, de manera sencilla, "añadir dos manos". La verdadera inteligencia de cuerpo completo (whole-body intelligence) exige que piernas, torso y brazos se muevan de manera coordinada en torno a la tarea. Por lo tanto, resumir simplificadamente los artículos sobre robots humanoides del IROS 2026 como "los Humanoid son cada vez más populares" hace pasar por alto el verdadero cambio. Una descripción más precisa es:El centro de la investigación se está ampliando desde la pura locomotion hacia la whole-body loco-manipulation.

06


Los world models están de moda, pero todavía no se han vuelto mainstream

Si solo se observa el nivel de discusión en el ámbito de la robótica durante el último año, World Model da fácilmente la impresión de que "ya ha entrado de lleno al campo de batalla principal". Pero entre todos los artículos, solo 19 mencionan explícitamente World Model, lo que representa aproximadamente el 1% del total de artículos. "Popular" no equivale a "numeroso". Lo verdaderamente digno de atención no es cuántos artículos sobre World Model ya existen, sino en qué posiciones comienza a aparecer: locomoción cuúadrupeda, manipulación diestra, inserción de precisión, whole-body control humanoide, robots médicos y navegación. Candidato al Best Paper / Best Student Paper Award DAWN: Parkour cuadrúpedo robusto al ruido mediante modelos de mundo con eliminación de ruido en profundidad Del equipo de la Universidad de Tecnología Educativa de Corea. En lugar de hacer que un robot cuúadrúpedo "imagine" videos más realistas, utiliza el World Model para modelar la percepción de profundidad con ruido, ayudando al robot a completar parkour en entornos reales. Aquí el World Model ya ha comenzado a convertirse en una herramienta de modelado de estados dentro de la cadena percepción-control. En la manipulación diestra,Ampliación de modelos del mundo de encarnación cruzada para la manipulación diestra porHe ZihaoFue dirigido por ellos y completado en colaboración con investigadores de la Universidad de California en San Diego, el MIT y otras instituciones. Intenta sortear las diferencias completamente distintas entre los espacios de articulaciones y movimientos de diferentes manos robóticas, para aprender leyes más generales sobre «cómo las acciones cambian el mundo físico». Detrás de esto hay una hipótesis muy interesante: lo que en el futuro los diferentes robots puedan realmente compartir quizá no sean las acciones en sí, sinocómo la acción cambiará el mundo。Inserción robótica generalizable con modelos del mundo fue realizado en conjunto por equipos de UC San Diego, NVIDIA, la Universidad de Washington y la Universidad del Sur de California. Coloca al World Model en tareas de inserción de precisión. En lugar de que la política memorice "cómo insertar este tipo de pieza", los investigadores buscan que el modelo aprenda "cómo mis acciones cambiarán el estado actual", y luego utilice esa predicción para completar el control. Llegando a los robots humanoides, la ya mencionada Universidad Jiao Tong de ShangháiYin JieJunto con DreamMimic del equipo de Tsinghua, llevó los World Models al loco-manipulation de cuerpo entero. Y RoDyn: Domando un modelo de mundo 2.5D interactivo dinámico de robot para manipulación robótica fue realizado en colaboración por equipos de la Universidad Tecnológica de Nanyang y la Universidad de Tsinghua. RoDyn intenta resolver un problema evidente de la predicción puramente bidimensional de video: que la imagen futura se vea plausible no significa que las relaciones físicas sean correctas. Introduce además información de profundidad y de la dinámica del robot, acercando el resultado de la predicción a una representación de estado realmente utilizable para el control robótico. Esto señala precisamente la contradicción más crítica de los World Models en el ámbito de la robótica. Lo que un robot realmente necesita no es un futuro visualmente plausible, sinoun futuro condicionado por las acciones, y suficientemente fiable en términos geométricos y físicos. Así, la cuestión de los World Models este año ya no es solo: «si el robot hace esto, ¿cómo será el futuro?», sino que empieza a convertirse en: «ya que puedo predecir el futuro, ¿puede esta predicción cambiar realmente mi próximo paso?». En este sentido, el World Model es hoy más bien una línea tecnológica en transición desdepredecir el mundohaciaparticipar en el control, y no un método que ya domine la investigación robótica.

07


La robótica entra en la «era de los problemas de sistema»

Al ver estas investigaciones en conjunto, lo más destacable de IROS 2026 no es que alguna línea tecnológica esté «ganando». VLA no ha reemplazado la planificación y el control tradicionales, el World Model aún no se ha convertido en corriente dominante, y Humanoid es solo una parte del panorama general de la investigación en robótica. El verdadero cambio que está ocurriendo es que, tras entrar estos nuevos métodos en el mundo físico, problemas como percepción, memoria, planificación, control, tacto, seguridad y recuperación vuelven a ser inevitables. El éxito de los modelos de lenguaje en los últimos años proviene en gran medida de unificar una gran cantidad de tareas en un solo modelo. Pero los robots son diferentes. No solo tienen que «comprender», sino también actuar de verdad, y el mundo físico expone por completo los errores, la latencia, el contacto y los fallos. Por eso, IROS 2026 responde más bien a una nueva pregunta: cuando los modelos ya son suficientemente potentes, cómo volver a ensamblar esas capacidades en un sistema robótico que funcione realmente. Esto no significa que el enfoque de extremo a extremo haya fracasado, ni que los módulos tradicionales recuperen el dominio. Dicho con más precisión, la robótica está rebuscando de nuevo las fronteras entre los grandes modelos, la planificación, el control y el hardware. La competencia futura quizá ya no consista solo en ver quién tiene el modelo más grande y con más capacidades, sino en quién consigue combinar esas capacidades de manera realmente estable.Cuando los robots son cada vez más inteligentes, lo verdaderamente difícil empieza a ser: cómo evitar que se equivoquen.

Para que todos podamos comunicarnos e intercambiar información sobre la conferencia, hemos creado un 2026 grupo de intercambio de asistentes a IROS¡Al entrar al grupo desbloquearás estos «beneficios»?

  • Estación de inteligencia sobre la conferencia: DDL de envío, normas de formato, avances de revisión... Los hitos clave te llegan al instante, para no perder nunca un deadline y preparar el envío con total tranquilidad.

  • Tertulia de colegas: colegas de todos los rincones están en el grupo, para compartir experiencias, contrastar ideas y crear contactos; en el camino de la investigación no estás solo.

  • Estación de suministro de fronteras: últimos resultados de investigación y temas de actualidad sincronizados en tiempo real, que te ayudan a aclarar la línea de envío en relación con los temas de la conferencia y a llenar de inspiración tu artículo.

  • Equipo de apoyo in situ: (disponible exclusivamente durante la conferencia):Si ya estás en el recinto, no te preocupes:

    Navegación de rutas: distribución del recinto y cómo llegar a las salas de conferencias, pregunta cuando quieras en el grupo;

    Lectura conjunta de sesiones: debates sobre sesiones populares y Keynotes, si te las pierdes también puedes recuperarlas;

    Recopilación de posters: lo esencial de los posters in situ, guárdalo de un clic sin perder nada;

    Plaza de encuentros: cenas, entrevistas, intercambios... si quieres charlar, colaborar o conocerte en persona, basta con proponerlo en el grupo.

? Puerta de acceso al grupo: Escanea el código para entrar o añade el WeChat Luyoyo_2026, con la nota: ECCV + institución/universidad + nombre + área.

En la investigación y la tecnología, la diferencia de información es muy importante.

¡Ven, demos un paso adelante juntos!

Súbete a bordo y te llevamos a ver lo más destacado de las principales conferencias mundiales de IA

Acceso exclusivo para disfrutar de:

Presentaciones PPT de expertos

Textos completos de los informes de las conferencias

Análisis de los artículos más populares

Entrevistas con nuevas estrellas académicas

Escanea el código QR de arriba

o haz clic en «Leer el original» para seguir la sección de Leiphone (cuenta oficial: 雷峰网).

Artículos originales de Leiphone; queda prohibida su reproducción sin autorización. Para más detalles, consultaAviso de reproducción。

Fuente original

雷峰网 AI

Notas sobre el contenido

La publicación original y los derechos pertenecen a la fuente.

Traducción automática · Consulte el original