雷峰网 AI

JEPA e inteligencia espacial se enfrentan cara a cara: el WorldArena 2.0 Challenge pone a prueba «si puede ser realmente utilizado por…

La ruta JEPA gana la primera manga: Shiqi Weilai primera en el Track 1, Chenhunxian segunda en el Track 2. Autoras丨Zhang Qiping Xing Lijuan Editora丨Xing Lijuan La competencia de los modelos de mundo está pasando de…

La ruta JEPA gana la primera manga: Shiqi Weilai primera en el Track 1, Chenhunxian segunda en el Track 2.

    Autoras丨Zhang Qiping Xing Lijuan

Editora丨Xing Lijuan

                                                                                                       

La competencia de los modelos de mundo está pasando de «generar el futuro» a «si puede ser realmente utilizado por robots».Los videos pueden generarse cada vez más realistas, pero al entrar en sistemas robóticos, los modelos de mundo deben responder preguntas más concretas: si pueden predecir los cambios de estado tras la ejecución de una acción, si pueden respaldar el entrenamiento de políticas y, finalmente, si pueden completar tareas en robots reales. WorldArena puso a los modelos de mundo en el mismo «aula de examen». Este sistema de evaluación fue lanzado por el equipo de la Universidad de Tsinghua en colaboración con varias universidades nacionales y extranjeras, y es una de las listas de evaluación más autorizadas en el campo de los modelos de mundo. WorldArena 1.0 ya había extendido inicialmente la evaluación de modelos de mundo más allá de la simple generación de video, hacia tareas encarnadas como generación de datos, evaluación de políticas y planificación de acciones. Pero en general todavía se centraba principalmente en entradas visuales, tareas fuera de línea y entornos de simulación. La ejecución en robots reales, el bucle cerrado de aprendizaje por refuerzo en línea, la percepción multimodal visotáctil, así como el ruido, la latencia y la acumulación de errores en despliegues reales, carecían de una evaluación sistemática.Para cubrir estos vacíos, WorldArena 2.0 actualizó aún más el sistema de evaluación.Las modalidades se expandieron de puramente visual a visotáctil, las funciones de tareas fuera de línea a aprendizaje por refuerzo en línea, y las plataformas de entornos de simulación a robots reales. IROS, como una de las conferencias internacionales de mayor influencia en el campo de la robótica, acogió el WorldArena 2.0 Challenge, que montó en este gran evento una arena de bucle cerrado con robots reales, con tres pistas orientadas respectivamente a la calidad de video, el entorno de aprendizaje por refuerzo en línea y la manipulación de robots reales. Tras tanto debate entre las grandes escuelas de modelos de mundo, los modelos de diferentes rutas tecnológicas finalmente pudieron competir de verdad en esta arena.Shiqi Weilai, que sigue claramente la ruta JEPA,ganó el campeonato del Track 1,la ruta de inteligencia espacialmientras que el modelo BWM-Turbo de la Universidad Tongji quedó en segundo lugar con una diferencia de 0.84 puntos; además, otra empresa también de la ruta JEPA, Chenhunxian Technology,obtuvo el segundo lugar en la puntuación total del Track 2. Otro detalle digno de mención es que, entre los dos primeros de cada una de las tres pistas, hay un representante tanto del mundo académico como de la industria. La competencia en la pista de modelos de mundo ha llegado a un choque frontal entre la capacidad académica y la ingenieril. En torno al posicionamiento del evento, la colaboración multiinstitucional, la configuración de las pistas y los resultados de la clasificación, AI 科技评论 también entrevistó al equipo organizador de Tsinghua del WorldArena 2.0 Challenge. Sus respuestas ilustran además cómo se diseñó y se colaboró en esta evaluación al orientarse hacia la interacción en línea y la ejecución en robots reales, y cuáles son sus límites.

01

WorldArena 2.0,¿dónde está la dificultad de la nueva ronda del «gran examen»?

WorldArena 2.0 llevó la evaluación de modelos de mundo un paso más allá, hacia la interacción en línea y los robots reales.WorldArena 1.0 examinaba principalmente dos tipos de capacidades: una era la calidad de los videos futuros generados por el modelo de mundo, con 15 métricas que cubrían calidad visual (Visual Quality), calidad de movimiento (Motion Quality), consistencia de contenido (Content Consistency), adherencia física (Physics Adherence), precisión 3D (3D Accuracy) y controlabilidad (Controllability); la otra evaluaba si estas predicciones eran realmente útiles para los robots, incluyendo la generación de datos, la evaluación de políticas y la planificación de acciones. La evaluación de 14 modelos representativos mostró que la calidad del video y el desempeño en tareas encarnadas no siempre se corresponden. Que las imágenes se generen más nítidas y fluidas no significa que el modelo se desempeñe necesariamente mejor en generación de datos, evaluación de políticas y planificación de acciones. El alcance de WorldArena 1.0 también era relativamente limitado:en cuanto a modalidades solo procesaba información visual, en cuanto a funciones se centraba en tareas fuera de línea como generación de datos, evaluación de políticas y planificación de acciones, y en cuanto a plataformas se limitaba principalmente a entornos de simulación. La retroalimentación táctil, la interacción en línea y el desempeño de ejecución en robots reales no entraban en esta evaluación.La actualización de WorldArena 2.0 se desarrolló a lo largo demodalidad (Modality), funcionalidad (Functionality) y plataforma (Platform),tres direcciones.En modalidad, se expandió de puramente visual a visotáctil.Se evalúa si el modelo puede procesar simultáneamente información de imagen y de contacto.En funcionalidad, se expandió de la evaluación fuera de línea al aprendizaje por refuerzo en línea.Se evalúa si el modelo de mundo puede funcionar como entorno interactivo para respaldar el entrenamiento de políticas.En plataforma, se expandió de depender principalmente de entornos de simulación a incluir la evaluación con robots reales.Además de entornos de simulación como RoboTwin 2.0 y LIBERO, WorldArena 2.0 incorporó aún más pruebas con robots reales, integrando en la evaluación el desempeño de ejecución de los modelos en entornos físicos. Sobre estas direcciones de evaluación basadas en WorldArena 2.0, el Challenge estableció tres pistas:el Track 1 evalúa la calidad del video, el Track 2 evalúa la capacidad del modelo de mundo como entorno de aprendizaje por refuerzo, y el Track 3 evalúa la manipulación de robots reales.
El Track 1 continúa y actualiza la evaluación original de calidad de video, mientras que el Track 2 y el Track 3 son pistas nuevas de la versión 2.0.

El Track 1 estableció 70 tareas oficiales. De ellas, 50 son escenarios clean de ID (In-Distribution, dentro de la distribución) con escritorio blanco, y otras 20 son escenarios OOD (Out-of-Distribution, fuera de la distribución) con escritorios de colores o con texturas. Todos los modelos participantes fueron evaluados sobre el mismo conjunto de datos.

Esta pista evalúa el rendimiento de generación de video en escenarios de largo plazo y fuera de la distribución. Los escenarios OOD, al cambiar el color y la textura del escritorio, introducen condiciones visuales distintas a las de los escenarios ID, para observar si el modelo, ante cambios de distribución, puede seguir manteniendo la identidad de los objetos, la topología espacial y la consistencia causal de las acciones. La puntuación final se determina conjuntamente por 15 métricas que cubren la calidad de la imagen, la calidad del movimiento, la consistencia del contenido, la precisión de la interacción, la geometría 3D y la ejecución de instrucciones, entre otros aspectos. También se incluyó la similitud de representación JEPA (JEPA Similarity), que mediante V-JEPA extrae características del video y compara si la distribución de características del video generado se aproxima a la del video de referencia real.El Track 2 avanza aún más hacia la interacción continua.El modelo de mundo debe funcionar como entorno de aprendizaje por refuerzo, en el que la política ejecuta acciones repetidamente, obtiene nuevos estados y recompensas, y continúa actualizándose. Tras el entrenamiento, la política debe volver a RoboTwin 2.0 para evaluar la tasa de éxito en las tareas, comprobando si el modelo de mundo realmente permite elentrenamiento on-policy.

Esto exige que el modelo de mundo mantenga la estabilidad y el control de las acciones a lo largo de múltiples rondas de interacción, que refleje correctamente los cambios de estado producidos por las distintas acciones y que genere imágenes fiables que ofrezcan señales de recompensa efectivas para el modelo. Una sola desviación de predicción puede arrastrarse a la siguiente ronda de interacción y acumularse continuamente en la interacción continua.

El Track 3, por su parte, lleva la evaluación directamente a la manipulación con robots reales. La organización estableció a la vez dos tipos de tareas: puramente visuales y visotáctiles: incluye operaciones guiadas visualmente como limpiar la mesa, verter agua, despejar el escritorio o doblar ropa, así como tareas que requieren información de contacto, como sujetar papas fritas, pelar un pepino o enchufar un enchufe de dos clavijas. En el robot real, los cambios de fuerza de contacto, el ruido de los sensores y la latencia de comunicación afectan directamente al resultado de la tarea. El foco está en la robustez de generalización de los modelos y las políticas en entornos reales y en su capacidad de autorrecuperación tras desviaciones de las acciones.Del Track 1 al Track 3, la evaluación avanza gradualmente desde «poder predecir», hasta «poder sostener el aprendizaje», y finalmente hasta «poder completar la tarea en un robot real».

02

Se destapan las tres pistas:¿en qué destaca cada equipo campeón?

El 16 de septiembre se reveló la lista final global del WorldArena 2.0 Challenge. Las tres pistas se clasificaron y premiaron de forma independiente; según los importes de los premios publicados en el sitio web oficial,el premio total es de 7000 dólares.

▎Track 1: WorldIncept, no gana solo porque el video se vea «bonito».

En la lista final del Track 1, 81 modelos obtuvieron puntuación definitiva.WorldIncept, de Visincept (视启未来), quedó primero con 72.33 puntos; BWM-Turbo, del equipo de inteligencia espacial de la Facultad de Ciencias y Tecnologías de la Computación de la Universidad Tongji, quedó segundo con 71.49 puntos, con una diferencia de 0.84 puntos entre ambos. Por desglose, la ventaja de WorldIncept no se concentra solo en la calidad de la imagen. Según los resultados de la lista final,WorldIncept ocupó el primer lugar en las dimensiones de adherencia física (Physics Adherence) y 3D 3D (3D Accuracy);; su puntuación en alineación semántica (Semantic Alignment) fue de 90.11, también primera en esa categoría.La adherencia física evalúa si el proceso de generación sigue las leyes reales de movimiento e interacción del mundo; la precisión 3D examina además la profundidad, la perspectiva y las relaciones geométricas espaciales; y la alineación semántica comprueba si el resultado generado cambió verdaderamente conforme a lo exigido por la tarea. Estos indicadores líderes guardan cierta correspondencia con la experiencia del equipo detrás de WorldIncept. Visincept, la empresa detrás de WorldIncept, fue incubada por el IDEA Research Institute, ha lanzado la serie de modelos visuales DINO-X y el modelo de agarre universal DINO-XGrasp, y ha colaborado con Baidu Smart Cloud para lanzar el motor de datos EgoTwin. Se apoya en datos Ego a escala de cien mil horas y en datos de teleoperación para el modelado de la dinámica de robots, integrando la experiencia del equipo en comprensión de objetos generales, inteligencia espacial y comprensión del movimiento de cuerpos/manos humanas. En comparación, el equipo de inteligencia espacial de la Universidad Tongji se centra más en la estabilidad de la generación de larga duración. BWM-Turbo añade sobre una arquitectura DiT diseños como guía del primer fotograma, memoria dinámica y control de acciones, atendiendo especialmente a la estabilidad de la escena, la respuesta a las acciones y la consistencia temporal en la generación de larga duración. En esta lista final, BWM-Turbo ocupó el primer lugar en las métricas de consistencia del fondo (Background Consistency) y similitud de representación JEPA (JEPA Similarity), lo que también refleja las ventajas de este esquema en estabilidad de escena y consistencia de representación. Los dos enfoques técnicos son distintos, pero el foco de la competición del Track 1 ya es claro: la generación de video es solo la base,y la capacidad de mantener de forma estable la coherencia física en la estructura espacial, los cambios de acción y la inferencia de largo plazo comienza a ser la clave que marca la diferencia.

▎Track 2: MW2, los modelos de mundo empiezan a entrar de verdad en el entrenamiento de políticas

Track 2 es la nueva pista de aprendizaje por refuerzo en línea añadida en WorldArena 2.0, que evalúasi un modelo del mundo puede servir realmente como entorno para entrenar políticas de robots. La política genera primero acciones, el modelo del mundo predice los estados futuros tras la acción, luego se calcula la recompensa y se actualiza la política a partir de esas predicciones, y finalmente se comprueba si la política entrenada logra completar la tarea.

La pista se basa en el entorno RoboTwin y utiliza la tarea Adjust Bottle (ajustar la botella). Esta tarea exige que el robot reajuste la postura y la posición de la botella, poniendo a prueba el control fino de la pose y la estabilidad del agarre.

En la tabla final,el MW2 de la Academia de Zhongguancun de Pekín ocupó el primer puesto con 72.93 puntos, el TTWM de la empresa Chenhunxian (Línea Crepuscular) quedó segundo con 72.40 puntos, con una diferencia de apenas 0.53 puntos, y son los únicos 2 de los 47 modelos evaluados que superaron los 72 puntos. La Academia de Zhongguancun de Pekín, detrás del MW2, ha venido desplegando de forma sostenida en los últimos años la inteligencia encarnada y la inteligencia física. El TTWM, que le sigue de cerca, adoptó un esquema de optimización más concreto en el entrenamiento del modelo del mundo. Esla versión participante del modelo del mundo causal de objetivos GCWM de Chenhunxian, centrado en modelar «cómo las acciones cambian el estado futuro». El modelo, condicionado al estado actual, al objetivo de la tarea y a la acción del robot, predice las interacciones físicas y los cambios de estado tras ejecutar la acción. En los rollouts continuos de Track 2, el equipo también realizó optimizaciones específicas en torno a la región objetivo, la geometría espacial y la coherencia a través del tiempo, y redujo la acumulación de errores en predicciones de múltiples rondas mediante diseños como el ruido a nivel de fotograma y la aleatorización de arranque en frío. Estos diseños se reflejan además en el rendimiento de la política aguas abajo. El VLA de referencia π0.5 logró una tasa de éxito del 55.46%; tras optimizar la política usando GCWM como entorno de aprendizaje por refuerzo, la tasa de éxito del modelo VLA subió al 72.40%. Track 2 desplaza aún más el foco de la competición hacia el aprendizaje de políticas: si el modelo del mundo puede realmente mejorar el rendimiento de la política aguas abajo se convierte en el núcleo de esta pista.

▎Track 3: ViTacX, primer puesto global en tareas con robot real

Track 3 es la nueva pista de evaluación con robots reales añadida en WorldArena 2.0, que cubre el robot bimanual AgileX y el robot de un solo brazo Franka Panda. En ella, Track 3.1 evalúa la operación visuotáctil y completa en el AgileXsujetar patatas fritas, pelar un pepino y enchufar un enchufe de dos clavijas : 3 tareas; Track 3.2 evalúa la operación puramente visual, con el AgileX configurandolimpiar la mesa, verter agua, despejar la mesa, despejar la mesa según instrucciones, doblar ropa y plegar cajas de cartón : 6 tareas, y el Franka también cubre limpiar la mesa, verter agua y despejar la mesa.

Cada tarea se evalúa según la tasa de éxito en ejecución con robot real; la tabla general combina la dificultad de las tareas y suma los puntos según los pesos de las direcciones visual y visuotáctil. El robot debe completar la operación dentro del número de pasos establecido y sin desencadenar ninguna intervención de seguridad durante el proceso.

En la tabla general,el ViTacX presentado por el equipo MiRobot de Xiaomi ocupó el primer puesto con 76.64 puntos, y el equipo OmniFlow de la Universidad de Ciencia y Tecnología de Shanghái quedó segundo con 67.37 puntos. La principal ventaja de ViTacX proviene de la subtabla puramente visual. En Track 3.2 logró el primer puesto con 85.00 puntos, obteniendo la máxima puntuación individual en 4 tareas: limpiar la mesa, verter agua, doblar ropa y plegar cajas de cartón, de las cuales las tres primeras alcanzaron los 100 puntos. Por antecedentes técnicos del equipo, Xiaomi Robotics lleva tiempo centrada en modelos fundacionales encarnados, VLA y ejecución con robots reales, con investigación que abarca desde la percepción visual y la generación de acciones hasta la ejecución continua en robots reales. Estas direcciones coinciden justamente con la operación guiada por visión y la capacidad de ejecución con robot real que examina Track 3.2.Tabla de operación puramente visual de Track 3.2En cambio, en la subtabla visuotáctil de Track 3.1, ViTacX quedó tercero con 66.67 puntos. En comparación, OmniFlow mantuvo el segundo puesto tanto en la subtabla puramente visual como en la visuotáctil. La Universidad de Ciencia y Tecnología de Shanghái, detrás de este equipo, lleva tiempo desarrollando investigación en manipulación robótica y háptica; el centro de automatización y robótica aborda la operación encarnada cubriendo la percepción táctil, la teleoperación, el aprendizaje por imitación, el aprendizaje por refuerzo y el movimiento multicontacto.Tabla de operación visuotáctil de Track 3.1Desde la perspectiva de ambas subtablas, la ventaja de ViTacX en la tabla general proviene principalmente de la operación con robot real guiada por visión, mientras que su rendimiento en tareas visuotáctiles quedó relativamente rezagado.

03

Bajo el mismo conjunto de evaluación,cada línea tecnológica de modelos del mundo tiene sus propios enfoques

Según las propuestas ya publicadas y los resultados en las tablas, WorldArena 2.0 puso las distintas líneas tecnológicas de modelos del mundo a comparar dentro del mismo sistema de evaluación, y comienza a quedar más claro en qué destaca cada propuesta. Los dos primeros de Track 1 apuntan a dos líneas tecnológicas distintas. WorldIncept, detrás del cual está Shiqi Weilai (Visión que Inicia el Futuro), apuesta abiertamente por el enfoque de espacio latente JEPA, mientras que BWM-Turbo sigueel enfoque de inteligencia espacial. Los modelos de ambas rutas compiten en el mismo escenario: WorldIncept lidera en cumplimiento físico y precisión 3D, mientras que BWM-Turbo ocupa el primer lugar en consistencia del fondo y similitud de representación JEPA. La Track 2 pone a prueba directamente si un modelo mundial puede servir de forma estable como entorno de entrenamiento de políticas. El campeón MW2 proviene del Instituto Zhongguancun de Beijing; el equipo se enfoca en la comprensión de las leyes físicas por parte de los robots y en integrar esa comprensión con el aprendizaje y la ejecución de acciones. El segundo lugar, TTWM de Chenhunxian Technology (晨昏线科技), se centra más en la predicción causal de acciones, atendiendo a las regiones objetivo, las restricciones geométricas espaciales, la consistencia de los objetos a lo largo del tiempo y la acumulación de errores en rollouts continuos. En la Track 3, ViTacX del equipo MiRobot de Xiaomi obtuvo el primer puesto general, pero su ventaja en tareas puramente visuales no se extendió por completo a la manipulación visotáctil. Esto demuestra que la manipulación robótica real no solo requiere ver claramente el entorno, sino también procesar la información de contacto.si la información multimodal puede entrar de manera estable en el bucle cerrado de planificación y control de accioneses la parte más difícil. Los equipos líderes de las tres pistas tienen cada uno sus fortalezas, mostrando ventajas únicas en distintos niveles de capacidad. Dado que la participación es selectiva, queda por verificar si algún modelo puede alcanzar un nivel líder simultáneamente en generación de video, entrenamiento de políticas y manipulación robótica real, algo que también merece expectativa。

04

Diálogo con los organizadores:¿Cómo se construyó el “campo de examen” de los modelos mundiales?

Desde el juicio unificado de los resultados de la competición entre múltiples instituciones hasta cómo la configuración de evaluación reduce los sesgos de una métrica única, detrás de la evaluación de WorldArena 2.0 hay numerosas cuestiones técnicas y organizativas. El equipo organizador de la Universidad de Tsinghua respondió a estas preguntas en una entrevista. A continuación se presenta la transcripción del diálogo, con ediciones realizadas por AI 科技评论 que no alteran el sentido original.

La posición de WorldArena y su mecanismo de evaluación

▎AI 科技评论: WorldArena se ha convertido hoy en uno de los benchmarks de evaluación centrales para los modelos mundiales. ¿Qué opinan de este reconocimiento? ¿Y de dónde creen que proviene principalmente?

Organizadores:Este reconocimiento proviene principalmente de una necesidad común del ámbito académico y de la industria:necesitan un método de evaluación para determinar si el futuro predicho por un modelo mundial puede realmente ayudar a un robot a ejecutar acciones. Para la inteligencia corporalizada, hay que ver si el modelo responde con precisión a las instrucciones de acción, si el movimiento predicho se ajusta a las leyes de la física y si puede apoyar el aprendizaje de políticas y la ejecución real. Estas capacidades son difíciles de juzgar solo viendo videos y requieren pruebas específicas. WorldArena 1.0 convirtió estas cuestiones en procesos de prueba ejecutables bajo un estándar unificado, y la 2.0 añadió aprendizaje por refuerzo en línea e interacción con robots reales, para examinar ademásla transferencia de simulación a realidad (Sim2Real) y la retroalimentación en bucle cerrado. Para nosotros, el valor a largo plazo de un benchmark depende de si puede ayudar a investigadores y profesionales a identificar los problemas esenciales de los modelos, explicar sus ventajas y deficiencias, y mejorar los métodos en consecuencia.

▎AI 科技评论: WorldArena involucra a múltiples instituciones como Tsinghua, la Universidad de Pekín, CMU, Stanford, Princeton, la Universidad de Hong Kong, NUS y el Instituto de Automatización de la Academia China de Ciencias. Como equipo organizador, ¿qué papel desempeña exactamente Tsinghua?

Organizadores: El equipo de Tsinghua se encarga principalmente del diseño investigador y el desarrollo del marco de evaluación, así como de la evaluación de la competición y el mantenimiento de la comunidad de código abierto.Este benchmark abarca desde la generación de video hasta la manipulación en robots reales, y requiere invertir grandes cantidades de recursos de software y hardware, de cómputo y humanos; es muy difícil que un solo equipo lo complete, por lo que debe haber colaboración entre múltiples instituciones. El trabajo concreto incluyeconstruir el flujo de evaluación、normalizar el procesamiento del código enviado、conectar servicios de inferencia remota entre regiones、mantener el clúster de evaluación distribuido, además deverificar y consolidar los resultados. La pista de robots reales también requiere completar con los socios de las plataformas robóticas la adaptación de las interfaces de hardware, la reserva de periodos de prueba y la organización de las operaciones in situ.

▎AI 科技评论: ¿Han encontrado algún problema en la coordinación entre múltiples instituciones? ¿Podrían dar uno o dos ejemplos concretos?

Organizadores:Hay dos dificultades destacadas:primero, cómo garantizar que los resultados de evaluación sean reproducibles en distintos entornos de cómputo;y segundo, cómo coordinar los diferentes equipos robóticos y el personal en cada sede.Por ejemplo, si el mismo código de evaluación se ejecuta en tarjetas gráficas de diferentes arquitecturas como NVIDIA y AMD, y la implementación de los operadores subyacentes y las dependencias del entorno no están alineadas con detalle, los resultados pueden presentar fluctuaciones sutiles. Por ello es necesario adaptarse a múltiples entornos de hardware, unificar la configuración de bajo nivel y luego realizar una revisión centralizada, para evitar confundir las diferencias de plataforma con diferencias de capacidad del modelo. La evaluación en robots reales también implica instalaciones en distintas regiones, estados de los equipos y organización del personal, y requiere diseñar tareas y procesos de recolección de datos según cada robot. Además, el servicio remoto de modelos debe coordinarse en tiempo real con la ejecución en sitio, con una sincronización a nivel de milisegundos, y el protocolo de interfaz, las condiciones físicas iniciales y los registros de ejecución deben documentarse con claridad.

▎AI科技评论:Las dimensiones de evaluación son muchísimas. ¿Cuáles pueden evaluarse automáticamente y cuáles dependen de la puntuación subjetiva de expertos? ¿Cómo se garantiza la coherencia de las puntuaciones entre instituciones y entre distintas categorías?

Organizador:El grado de automatización de las tres categorías es distinto, y depende de si la prueba implica interacción en línea y operación de equipos en el sitio.La Track 1 evalúa principalmente la capacidad de generacióny sus métricas se calculan principalmente mediante procesos automatizados, aunque se conserva una revisión manual de las salidas anómalas y de los envíos sospechosos.La Track 2 examina el desempeño iterativo de las políticas de aprendizaje por refuerzo en entornos de modelos del mundoy su proceso de evaluación también es bastante automatizado. El trabajo manual consiste principalmente en verificar la conectividad de las llamadas al servicio y coordinar los períodos de cómputo interactivo de cada equipo.La Track 3 involucra la operación de robots realesy requiere que el personal en sitio participe en el reinicio de equipos, la observación de las tomas, el manejo de anomalías y la determinación del éxito o fracaso de las tareas, manteniendo una conexión en tiempo real con los equipos participantes; ambas partes confirman los resultados de la prueba mediante comunicación en tiempo real y, sobre esa base, se calculan las tasas de éxito. La coherencia se garantiza principalmente mediante el uso de reglas unificadas dentro de cada categoría. El formato de entrada, las especificaciones de la API, el presupuesto de cómputo, la versión de las métricas de evaluación y los criterios de determinación de fallo son idénticos para todos los equipos. Las distintas categorías evalúan capacidades diferentes y sus puntuaciones no son directamente comparables; lo que nos importa esgarantizar que las condiciones de evaluación y los criterios de decisión sean consistentes dentro de cada categoría。

▎AI科技评论:¿El ranking se divide en un ranking de la competición y un ranking diario? ¿Cuál es el mecanismo de actualización del ranking diario? ¿Cada cuánto se actualiza?

Organizador:El ranking de la competición y el ranking diario de investigación tienen propósitos distintos, y su alcance público y calendario de actualización también difieren.El ranking de la competición se utiliza para determinar los resultados y premios del concursoy cuenta con plazos de envío claros, reglas de cierre del ranking y un proceso de auditoría de los ganadores. Para garantizar la equidad de la competición, parte de los datos de prueba no se publican por completo. El ranking diario de investigación está abierto a largo plazo a la comunidad académica; el código y los protocolos de evaluación son completamente de código abierto, los investigadores pueden reutilizarlos localmente y sirven como referencia continua de rendimiento para futuras mejoras de algoritmos.

La competición añade dos nuevas categorías para evaluar si los modelos pueden realmente ejecutar

▎AI科技评论:WorldArena 2.0 añade respecto a 1.0 la Track 2 (MB-RL) y la Track 3 (WAM en robot real). ¿Cómo surgió esta idea? ¿Por qué precisamente se añadieron estas dos categorías? ¿Qué consideraciones hay detrás?

Organizador:Estas dos categorías se añadieron paraverificar aún más el papel del modelo en la interacción y en la ejecución real. La versión 1.0 se centraba principalmente en el motor de datos embebidos y la evaluación fuera de línea de políticas, y seguía basándose sobre todo en pruebas estáticas de bucle abierto dentro de entornos de simulación. Los modelos se probaban tras un ajuste fino local, sin retroalimentación en tiempo real ni capacidad de autocorrección durante la interacción. La versión 2.0 busca examinar dos capacidades adicionales. Una es la capacidad deinteracción en bucle cerrado: si la política puede usar el modelo del mundo como entorno de interacción, aprendiendo y ensayando de manera continua en el espacio dinámico generado por el modelo. La otra es la capacidad degeneralización embebida: si las habilidades aprendidas en el entorno del modelo, tras una transferencia Sim2Real, pueden aplicarse a la operación de un brazo robótico físico. La consideración de fondo es la siguiente: que la generación de video sea coherente no significa que el modelo pueda ofrecer retroalimentación física confiable; y que funcione de manera estable en simulación no significa que siga ejecutándose correctamente en un robot real. Por ello, es necesario establecer por separado la interacción en línea y el despliegue en robots reales como categorías.

▎AI科技评论:En una entrevista previa con nosotros, el profesor Shang Yu reconoció abiertamente la limitación del "sim-to-real gap" del ranking. ¿La Track 3 de robots reales responde directamente a este problema? ¿En qué medida puede resolverlo?

Organizador:La evaluación en robots reales incorpora a las pruebas la sensorización real, las condiciones de contacto y el proceso de ejecución del equipo, proporcionando un complemento a la investigación en simulación. Factores como las variaciones de fricción, las interferencias de iluminación, los retrasos del control de motores y el contacto entre cuerpos rígidos afectan los resultados de las tareas en robots reales. Sin embargo, las tareas, entornos y robots cubiertos actualmente por la Track 3 siguen siendo limitados, y se seguirán expandiendo y mejorando en el futuro.

▎AI科技评论:¿Habrá iteraciones hasta llegar a WorldArena 3.0? ¿Qué dimensiones de prueba se consideraría añadir?

Organizador:En el proceso de desarrollo de la versión 2.0 ya hemos identificado varias direcciones que merecen seguir investigándose: pruebas de mayor frecuencia y de mayor duración,interacción de circuito cerrado, tras errores de ejecución, laautocorrección, entre robots de diferentes configuraciones latransferencia de generalización, y en el ensamblaje de precisión lafusión de percepción táctil y multimodal。

▎AI科技评论: La participación es opcional, ¿podría ocurrir que en cierta pista se acumulen los más fuertes mientras otra pista queda desierta, debilitando así la representatividad general del ranking?

Organizadores:Esto está relacionado con los requisitos técnicos, los costos de I+D, las condiciones de software y hardware, y el tiempo de iteración. Cada pista tiene sus propias características y refleja las capacidades de diferentes modelos en distintos niveles.

Perfil de los equipos del ranking: ¿qué ruta tecnológica es superior?

▎AI科技评论:En las tres pistas, los dos primeros puestos incluyen tanto a representantes de la industria como del mundo académico. ¿Cuáles son las principales ventajas y debilidades respectivas en la innovación en modelos del mundo?

Los organizadores:Observando a los equipos participantes de esta edición, las universidades y las empresas tienen ventajas complementarias. Los equipos universitarios están más dispuestos a probararquitecturas de vanguardia y nuevas funciones objetivo, con una exploración más flexible; los equipos empresariales tienen mayor acumulación enreservas de datos de alta calidad, programación de cómputo a gran escala y despliegue de sistemas, y suoperación de ingenieríatambién es más estable. Esta es nuestra observación sobre esta edición del evento, y no debería generalizarse directamente a todos los equipos. La competencia también hizo más concretas las áreas que ambas partes necesitan reforzar. La innovación algorítmica aún debe funcionar de manera estable en flujos de trabajo de ingeniería reales; quienes tienen ventajas en datos y potencia de cómputo también necesitan un modelado físico preciso y una definición clara del problema para convertirlos en resultados. Combinar la investigación con las capacidades de ingeniería ayuda a acortar el proceso que va desde la propuesta de un método hasta su aplicación práctica.

▎AI科技评论:Actualmente los modelos del mundo tienen en conjunto cuatro rutas tecnológicas; los equipos premiados de esta edición cubrieron básicamente JEPA, inteligencia espacial/4D estructurado y la ruta de generación a nivel de píxeles, pero los equipos que siguen la ruta JEPA parecen haber tenido más probabilidades de ganar: 视启未来 obtuvo el primer lugar en el Track 1 y 晨昏线 quedó segundo en el Track 2. Como organizadores, ¿cómo interpretan estos resultados?

Los organizadores:En los sistemas reales, las rutas tecnológicas no están completamente separadas. La generación autorregresiva a nivel de píxeles, el aprendizaje de representaciones en espacio latente, como la idea de JEPA, así como el modelado de topología espacial y los motores físicos explícitos, pueden combinarse dentro de un mismo sistema, y no pocos equipos destacados adoptan precisamente arquitecturas de múltiples módulos. Además, los equipos difieren mucho en el número de parámetros del modelo, la limpieza de los datos de preentrenamiento, las interfaces de abstracción de acciones y la frecuencia del bucle de control. Estos resultados aportan pistas que valen la pena seguir investigando en el aprendizaje de representaciones para sistemas corpóreos.

▎AI科技评论:Tras presenciar tantos cambios de clasificaciones y la evolución del evento, ¿cómo consideran que está hoy el desarrollo de los modelos del mundo? ¿Cuál es el mayor cuello de botella?

Los organizadores:Según los resultados de las pruebas de esta edición, en tareas específicas y controladas, los modelos del mundo líderes ya poseen de manera preliminar la capacidad de responder a las relaciones causales de las acciones, y pueden ofrecer cierta ayuda para el aprendizaje de políticas posteriores. Sin embargo, en interacciones complejas de mayor duración, así como en la manipulación real de robots con contacto intenso, los modelos del mundo todavía presentan cuellos de botella.El modelo aún no puede caracterizar con suficiente precisión y de forma sostenida las transiciones de estado causadas tras aplicar una acción. Los pequeños errores en la predicción continua se acumulan y amplifican gradualmente; y en un robot real, además hay que lidiar con retrasos de acción a nivel de milisegundos y con la retroalimentación no lineal de fuerzas propia del contacto entre cuerpos rígidos.

Impulso continuo de la investigación en métodos de evaluación

▎AI科技评论:El profesor 商宇 mencionó en nuestra entrevista anterior que “hay que evitar que WorldArena se convierta en una nueva dependencia de camino para los modelos” (es decir, que todos, para obtener puntuaciones altas en WorldArena, acaben acomodándose a sus métricas y tareas). En estas dos ediciones del desafío y en las actualizaciones cotidianas de la clasificación, ¿han observado realmente este tipo de dependencia? ¿Qué manifestaciones concretas tiene?

Los organizadores:La optimización frente a reglas públicas es un fenómeno difícil de evitar por completo en la operación de un benchmark. Lo que nos interesa es saber si el aumento de las puntuaciones refleja realmente una mejora de la capacidad física general del modelo o simplemente un mejor ajuste a una métrica o a un tipo de tarea concreta. Para reducir la influencia de lo segundo, hemos realizado principalmente tres líneas de trabajo:seguimiento continuo del coeficiente de correlación entre las puntuaciones y el éxito o fracaso en tareas físicas reales, para calibrar métricas que otorgan puntuaciones altas pero no reflejan la capacidad física real;ampliación continua de escenarios y tareas, expandiendo la distribución de pruebas OOD e incorporando más tareas de contacto complejas;conservación de un conjunto de pruebas ciegas independiente y cerrado, manteniendo estrictamente confidenciales las etapas clave de evaluación.

▎AI科技评论:Si tuvieran que fijar un objetivo para la próxima etapa de WorldArena, ¿qué problema desearían que resuelva con prioridad y qué papel debería desempeñar?

Los organizadores:En la próxima etapa, esperamos evaluar con mayor claridad el alcance de aplicabilidad de los modelos en el mundo real: cuando un investigador obtiene un modelo del mundo, debería poder saber en qué escenarios físicos es fiable y en qué condiciones y situaciones tiende a fallar. A más largo plazo, el objetivo esque WorldArena ayude a todos a mejorar sus métodos, para que las capacidades de los modelos del mundo se generalicen mejor a escenarios reales。

Para facilitar que todos se agrupen para intercambiar y compartir información de congresos, creamos específicamente un IROS 2026 Grupo de intercambio para participantes¡Al unirte al grupo desbloquearás estos «beneficios»?

  • Estación de información de congresos: fechas límite de envío, normas de formato, avance de la revisión... Los puntos clave se te notifican en el momento, para que ya no vuelvas a perder un deadline y puedas preparar tu envío con total tranquilidad.

  • Charla entre colegas: colegas de todos los rincones están en el grupo, compartiendo experiencias, intercambiando ideas y creando contactos; en el camino de la investigación, avanzamos juntos.

  • Puesto avanzado de suministros: los últimos resultados de investigación y las direcciones de vanguardia sincronizadas en tiempo real, combinados con la temática de la conferencia para ayudarte a aclarar el camino para el envío de tu artículo y llenar de combustible tu inspiración científica.

  • Equipo de apoyo en el sitio: (disponible exclusivamente durante la conferencia):Al llegar al lugar del evento tampoco hace falta entrar en pánico:

    Navegación de rutas: distribución de las sedes, cómo llegar a la sala de conferencias, pregunten en el grupo en cualquier momento;

    Lectura conjunta del tema: sesiones populares y paneles de Keynote; si los pierdes, siempre puedes retomarlos;

    Compilación de pósters: recopilación de lo mejor de los pósters del evento; guárdalo de un clic sin perder nada;

    Plaza de encuentros: cenas, entrevistas, intercambios... para charlar, colaborar o conocerse en persona, basta con proponerlo en el grupo.

? Puerta de acceso al grupo: Escanea el código para unirte o añade el WeChat Luyoyo_2026 con la nota: IROS + institución/escuela + nombre + área.

En la investigación y la tecnología, la diferencia de información es muy importante.

¡Ven, avanza un paso más rápido que los demás!

Súbete y descubre lo mejor de las principales conferencias mundiales de IA

Acceso exclusivo a:

PPT de las charlas de expertos

Texto completo de los informes del congreso

Análisis de los artículos más populares

Entrevistas a las nuevas estrellas académicas

Escanea el código QR de arriba

o haz clic en «阅读原文» para seguir la sección.

雷峰网 (cuenta oficial: 雷峰网)

雷峰网 (Lei Feng Wang)

Artículo original de 雷峰网 (Lei Feng Wang); queda prohibida su reproducción sin autorización. Para más detalles, consultelas normas de reimpresión。

Fuente original

雷峰网 AI

Notas sobre el contenido

La publicación original y los derechos pertenecen a la fuente.

Traducción automática · Consulte el original