雷峰网 AI

JEPA et intelligence spatiale s'affrontent frontalement : le défi WorldArena 2.0 met à l'épreuve « la capacité à être réellement utilisé par…

La voie JEPA remporte une première manche : Shiqi Weilai premier du Track 1, Chenhunxian deuxième du Track 2. Auteurs丨 Zhang Qiping Xing Lijuan Édition丨 Xing Lijuan La concurrence entre modèles du monde passe de la «…

La voie JEPA remporte une première manche : Shiqi Weilai premier du Track 1, Chenhunxian deuxième du Track 2.

    Auteurs丨Zhang Qiping Xing Lijuan

Édition丨Xing Lijuan

                                                                                                       

La concurrence entre modèles du monde passe de la « génération du futur » à « la capacité à être réellement utilisé par les robots ».Les vidéos peuvent être générées de manière toujours plus réaliste, mais une fois intégrées aux systèmes robotiques, les modèles du monde doivent répondre à des questions plus concrètes : peuvent-ils prédire les changements d'état après l'exécution d'une action, peuvent-ils soutenir l'entraînement de politiques, et peuvent-ils au final accomplir des tâches sur de vrais robots. WorldArena a placé les modèles du monde dans une même « salle d'examen ». Ce système d'évaluation, lancé par l'équipe de l'Université Tsinghua en collaboration avec plusieurs universités chinoises et étrangères, figure parmi les classements d'évaluation les plus autoritaires du domaine des modèles du monde. WorldArena 1.0 avait déjà étendu l'évaluation des modèles du monde, au-delà de la simple génération vidéo, vers des tâches incarnées comme la génération de données, l'évaluation de politiques et la planification d'actions. Mais l'ensemble restait principalement concentré sur les entrées visuelles, les tâches hors ligne et les environnements de simulation. L'exécution sur de vrais robots, la boucle fermée d'apprentissage par renforcement en ligne, la perception multimodale visuo-tactile, ainsi que le bruit, la latence et l'accumulation d'erreurs dans les déploiements réels manquaient encore d'une évaluation systématique.Pour combler ces lacunes, WorldArena 2.0 a encore amélioré le système d'évaluation.Les modalités sont passées du visuel pur au visuo-tactile, les fonctions des tâches hors ligne à l'apprentissage par renforcement en ligne, et les plateformes des environnements de simulation aux vrais robots. IROS étant l'une des conférences internationales de premier plan les plus influentes en robotique, le WorldArena 2.0 Challenge a érigé lors de cet événement une arène en boucle fermée sur robots réels, avec trois pistes consacrées respectivement à la qualité vidéo, à l'environnement d'apprentissage par renforcement en ligne et à la manipulation robotique réelle. Après tant d'années de débats entre les grandes écoles de modèles du monde, les modèles issus de différentes voies technologiques s'y affrontent enfin concrètement.Shiqi Weilai, qui suit explicitement la voie JEPA,a remporté le titre du Track 1,la voie de l'intelligence spatiale,le modèle BWM-Turbo de l'Université Tongji arrive deuxième avec un écart de 0.84 point ; par ailleurs, Chenhunxian Technology, elle aussi de la voie JEPA,se classe deuxième au score total du Track 2. Autre détail notable : sur les trois pistes, les deux premières places se répartissent entre le monde académique et l'industrie. La concurrence dans le domaine des modèles du monde entre désormais dans une confrontation directe entre capacités académiques et capacités d'ingénierie. Au sujet du positionnement de la compétition, de la collaboration multi-institutions, de la configuration des pistes et des résultats du classement, AI Technology Review a également interviewé l'équipe de Tsinghua, organisatrice du WorldArena 2.0 Challenge. Leurs réponses éclairent davantage sur la manière dont ce système d'évaluation est conçu, comment il collabore, et quelles en sont les limites, dans son passage vers l'interaction en ligne et l'exécution sur robots réels.

01

WorldArena 2.0,où réside la difficulté de ce nouveau « grand examen »

WorldArena 2.0 pousse l'évaluation des modèles du monde encore plus loin, vers l'interaction en ligne et les vrais robots.WorldArena 1.0 examinait principalement deux types de capacités : d'une part, la qualité des vidéos futures générées par les modèles du monde, avec 15 métriques couvrant la qualité visuelle (Visual Quality), la qualité du mouvement (Motion Quality), la cohérence du contenu (Content Consistency), l'adhérence physique (Physics Adherence), la précision 3D (3D Accuracy) et la contrôlabilité (Controllability) ; d'autre part, l'utilité réelle de ces prédictions pour les robots, incluant la génération de données, l'évaluation de politiques et la planification d'actions. L'évaluation de 14 modèles représentatifs a montré que la qualité vidéo et les performances sur les tâches incarnées ne correspondent pas toujours. Générer des images plus nettes et plus fluides ne signifie pas que le modèle performera nécessairement mieux en génération de données, évaluation de politiques et planification d'actions. Le périmètre de WorldArena 1.0 était aussi relativement limité :en modalités, il ne traitait que l'information visuelle ; en fonctions, il se concentrait sur des tâches hors ligne comme la génération de données, l'évaluation de politiques et la planification d'actions ; et en plateformes, il restait principalement en environnement de simulation. Le retour tactile, l'interaction en ligne et les performances d'exécution sur de vrais robots ne faisaient pas partie de cette évaluation.La mise à niveau de WorldArena 2.0 s'est déployée selontrois directions : la modalité (Modality), la fonctionnalité (Functionality) et la plateforme (Platform).En modalités, passage du visuel pur au visuo-tactile.On évalue si le modèle peut traiter simultanément les images et les informations de contact.En fonctions, extension de l'évaluation hors ligne à l'apprentissage par renforcement en ligne.On évalue si le modèle du monde peut servir d'environnement interactif pour soutenir l'entraînement de politiques.En plateformes, extension au-delà des environnements de simulation pour inclure l'évaluation sur de vrais robots.Au-delà des environnements de simulation comme RoboTwin 2.0 et LIBERO, WorldArena 2.0 ajoute des tests sur de vrais robots, intégrant les performances d'exécution des modèles en environnement physique dans l'évaluation. Sur la base de ces orientations d'évaluation de WorldArena 2.0, le Challenge a mis en place trois pistes :Le Track 1 évalue la qualité vidéo, le Track 2 évalue la capacité des modèles du monde à servir d'environnement d'apprentissage par renforcement, et le Track 3 évalue la manipulation robotique réelle.
Le Track 1 prolonge et améliore l'évaluation originale de la qualité vidéo, tandis que le Track 2 et le Track 3 sont les nouvelles pistes de la version 2.0.

La Track 1 comporte 70 tâches officielles. Parmi elles, 50 sont des scénarios ID (In-Distribution, dans la distribution) clean sur bureau blanc, et les 20 autres sont des scénarios OOD (Out-of-Distribution, hors distribution) avec des bureaux colorés ou texturés. Tous les modèles participants sont testés sur le même ensemble de données.

Cette piste évalue la performance de génération vidéo dans des scénarios longues distances et hors distribution. Les scénarios OOD introduisent des conditions visuelles différentes de celles des scénarios ID en modifiant la couleur et la texture du bureau, afin d'observer si le modèle peut maintenir l'identité des objets, la topologie spatiale et la cohérence causale des actions face à des changements de distribution. Le score final est déterminé conjointement par 15 indicateurs, couvrant la qualité de l'image, la qualité du mouvement, la cohérence du contenu, la précision des interactions, la géométrie 3D et l'exécution des instructions. La similarité de représentation JEPA (JEPA Similarity) est également incluse : des caractéristiques vidéo sont extraites via V-JEPA afin de comparer si la distribution des caractéristiques de la vidéo générée est proche de celle de la vidéo de référence réelle.Track 2 passe ensuite à l'interaction continue.Un modèle du monde doit servir d'environnement d'apprentissage par renforcement, dans lequel la politique exécute des actions de manière répétée, obtient de nouveaux états et récompenses, puis poursuit sa mise à jour. Une fois l'entraînement terminé, la politique doit également revenir dans RoboTwin 2.0 pour tester le taux de réussite des tâches et vérifier si le modèle du monde soutient réellementEntraînement stratégique en ligne.

Cela exige que le modèle du monde reste stable et contrôlable dans ses actions sur plusieurs tours d'interaction, tout en reflétant correctement les changements d'état provoqués par différentes actions, et en générant des images fiables fournissant au modèle un signal de récompense efficace. Un écart de prédiction peut également être reporté au tour d'interaction suivant et s'accumuler continuellement au fil des interactions successives.

Track 3 place l'évaluation directement dans la manipulation robotique réelle.。L'organisateur a parallèlement conçu deux catégories de tâches, purement visuelles et visuo-tactiles : elles comprennent aussi bien des opérations pilotées par la vision, comme essuyer une table, verser de l'eau, nettoyer un bureau ou plier des vêtements, que des tâches nécessitant des informations de contact, comme saisir une chips, éplucher un concombre ou brancher une prise à deux broches. Sur le robot réel, les variations de force de contact, le bruit des capteurs et la latence de communication affectent directement le résultat des tâches. L'accent est mis sur l'évaluation de la robustesse de généralisation du modèle et de la politique dans un environnement réel, ainsi que de leur capacité d'auto-récupération après un écart d'action.Du Track 1 au Track 3, l'évaluation progresse graduellement de « peut-on prédire » à « peut-on soutenir l'apprentissage », puis enfin à « peut-on accomplir des tâches sur un vrai robot ».

02

Trois pistes ont été lancées par appel à projets,En quoi chaque membre de l'équipe championne excelle-t-il respectivement

Le 16 septembre, le classement final mondial du WorldArena 2.0 Challenge a été dévoilé. Les trois pistes sont classées et primées indépendamment ; selon les montants des prix publiés sur le site officiel,Le prix total s'élève à 7000 dollars.

▎Track 1 : WorldIncept, ne gagne pas seulement par la « beauté » de ses vidéos

Le classement final de Track 1 a récompensé 81 modèles avec une note finale.WorldIncept de Visincept (视启未来) se classe premier avec un score de 72.33; le BWM-Turbo de l'équipe d'intelligence spatiale de l'École des sciences et technologies informatiques de l'Université Tongji se classe deuxième avec 71.49 points, soit un écart de 0.84 point entre les deux. En examinant les sous-catégories, l'avantage de WorldIncept ne se limite pas à la qualité de l'image. Les résultats du classement final montrent queWorldIncept en matière de respect de la physique (Physics Adherence) et 3D Précision 3D (3D Accuracy);L'alignement sémantique (Semantic Alignment) obtient un score de 90.11, se classant également premier dans cette catégorie.La conformité physique évalue si le processus de génération respecte les lois réelles du mouvement et de l'interaction ; la précision 3D examine plus en détail la profondeur, la perspective et les relations géométriques spatiales ; l'alignement sémantique vérifie si le résultat généré a réellement changé conformément aux exigences de la tâche. Ces indicateurs de premier plan correspondent également, dans une certaine mesure, à l'expérience accumulée par l'équipe derrière WorldIncept. Shiqi Weilai, à l'origine de WorldIncept, a été incubée par l'Institut de recherche IDEAet a déjà lancé la série de modèles de vision DINO-X, le modèle de préhension universelle DINO-XGrasp, et a collaboré avec Baidu Smart Cloud pour lancer le moteur de données EgoTwin. Elle s'appuie sur des données Ego de l'ordre de 100,000 heures et sur des données de téléopération pour la modélisation de la dynamique des robots, tout en intégrant l'expertise de l'équipe en compréhension des objets génériques, en intelligence spatiale et en compréhension des mouvements du corps et des mains humaines. En comparaison, l'équipe d'intelligence spatiale de l'Université Tongji se concentre davantage sur la stabilité de la génération à long terme. BWM-Turbo, construit sur l'architecture DiT, intègre des éléments tels que le guidage par première image, la mémoire dynamique et le contrôle des actions, en ciblant les problèmes de stabilité des scènes, de réactivité des actions et de cohérence temporelle dans la génération à long terme. Dans ce classement final, BWM-Turbo se classe premier sur deux indicateurs, la cohérence de l'arrière-plan (Background Consistency) et la similarité de représentation JEPA (JEPA Similarity), ce qui reflète les avantages de cette approche en matière de stabilité des scènes et de cohérence des représentations. Les orientations techniques des deux approches diffèrent, mais l'axe de la compétition du Track 1 est déjà clair : la génération vidéo n'est qu'une base,la capacité à maintenir de manière stable la cohérence physique dans les structures spatiales, les changements d'actions et les déductions à long terme commence à devenir le facteur déterminant de la différenciation.

▎Track 2 : MW2, les modèles du monde commencent réellement à entrer dans l'entraînement des politiques

La Track 2 est la nouvelle piste d'apprentissage par renforcement en ligne ajoutée dans WorldArena 2.0, qui évaluesi les modèles de monde peuvent véritablement servir d'environnement pour l'entraînement de politiques robotiques. La politique génère d'abord une action, le modèle de monde prédit les états futurs résultant de l'action, puis les récompenses sont calculées et la politique mise à jour à partir de ces prédictions ; enfin, on vérifie si la politique entraînée parvient à accomplir la tâche.

La piste repose sur l'environnement RoboTwin et utilise la tâche Adjust Bottle (ajuster la bouteille). Cette tâche demande au robot de réajuster l'orientation et la position de la bouteille, ce qui teste le contrôle fin de la pose et la stabilité de la préhension.

Dans le classement final,l'Institut de Zhongguancun de Pékin avec MW2 arrive premier avec un score de 72.93, tandis que la société晨昏线科技 (Twilight Line Technology) obtient la deuxième place avec TTWM à 72.40, avec seulement 0.53 point d'écart ; ce sont également les deux seules solutions parmi les 47 modèles évalués à dépasser les 72 points. L'Institut de Zhongguancun de Pékin, à l'origine de MW2, investit ces dernières années de manière continue dans l'intelligence incarnée et l'intelligence physique. Juste derrière, TTWM a adopté une approche d'optimisation plus concrète pour l'entraînement des modèles de monde. Il s'agit dela version destinée à la compétition du modèle de monde causal à objectif GCWM de晨昏线科技, qui modélise en priorité « comment les actions modifient les états futurs ». Conditionné par l'état courant, l'objectif de la tâche et l'action du robot, le modèle prédit les interactions physiques et les changements d'état après l'exécution de l'action. Dans les rollouts continus de la Track 2, l'équipe a également réalisé des optimisations ciblées sur la zone cible, la géométrie spatiale et la cohérence temporelle, et a réduit l'accumulation d'erreurs sur plusieurs prédictions grâce à des mécanismes comme le bruit au niveau des images et la randomisation au démarrage à froid. Ces conceptions se reflètent aussi dans les performances de la politique en aval. Le VLA de référence π0.5 affiche un taux de réussite de 55.46 % ; après optimisation de la politique avec GCWM comme environnement d'apprentissage par renforcement, le taux de réussite du modèle VLA passe à 72.40 %. La Track 2 déplace encore la compétition vers l'apprentissage de politiques : la question de savoir si les modèles de monde peuvent réellement améliorer les performances des politiques en aval constitue le cœur de cette piste.

▎Track 3 : ViTacX, premier au classement général sur robot réel

La Track 3 est la nouvelle piste d'évaluation sur robot réel ajoutée dans WorldArena 2.0, couvrant le robot bimanuel AgileX et le robot mono-bras Franka Panda. Ainsi, la Track 3.1 évalue la manipulation visuo-tactile, avecla préhension de chips, l'épluchage de concombre et l'insertion d'une fiche à deux broches , soit 3 tâches sur AgileX ; la Track 3.2 évalue la manipulation purement visuelle, avecl'essuyage de table, le versement d'eau, le nettoyage du bureau, le nettoyage du bureau sur instruction, le pliage de vêtements et le pliage de boîtes en papier , soit 6 tâches sur AgileX, tandis que Franka couvre également l'essuyage de table, le versement d'eau et le nettoyage du bureau.

Chaque tâche est évaluée selon le taux de réussite d'exécution sur robot réel ; le classement général combine la difficulté des tâches et agrège les scores selon les pondérations des directions visuelle et visuo-tactile. Le robot doit accomplir la manipulation dans un nombre d'étapes imparti, sans déclencher d'intervention de sécurité au cours du processus.

Dans le classement général,ViTacX, soumis par l'équipe MiRobot de Xiaomi, arrive premier avec un score de 76.64, tandis que l'équipe OmniFlow de l'Université des sciences et technologies de Shanghai obtient la deuxième place avec 67.37 points. L'avantage principal de ViTacX vient du sous-classement purement visuel. Il se classe premier de la Track 3.2 avec 85.00 points, réalisant le meilleur score individuel sur 4 tâches : l'essuyage de table, le versement d'eau, le pliage de vêtements et le pliage de boîtes en papier, dont les trois premières à 100 points chacune. Du point de vue du profil technique de l'équipe, Xiaomi Robot se concentre depuis longtemps sur les modèles fondamentaux incarnés, les VLA et l'exécution sur robots réels, avec des recherches couvrant la perception visuelle, la génération d'actions et l'exécution continue sur robot réel. Ces directions correspondent précisément aux capacités de manipulation pilotée par la vision et d'exécution sur robot réel évaluées par la Track 3.2.Classement de manipulation purement visuelle de la Track 3.2Dans le sous-classement visuo-tactile de la Track 3.1, ViTacX arrive troisième avec 66.67 points. En comparaison, OmniFlow se maintient à la deuxième place dans les deux sous-classements, visuel pur et visuo-tactile. L'Université des sciences et technologies de Shanghai qui le soutient mène depuis longtemps des recherches sur la manipulation robotique et le tactile : les travaux du Centre d'automatisation et de robotique sur la manipulation incarnée couvrent la perception tactile, la téléopération, l'apprentissage par imitation, l'apprentissage par renforcement et le mouvement multi-contacts.Classement de manipulation visuo-tactile de la Track 3.1À la lumière des deux sous-classements, l'avantage de ViTacX au classement général provient principalement de la manipulation sur robot réel pilotée par la vision, tandis que ses performances sur les tâches visuo-tactiles restent relativement plus modestes.

03

Avec le même système d'évaluation,chaque voie technologique des modèles de monde a ses propres points forts

D'après les solutions déjà publiées et les performances au classement, WorldArena 2.0 compare différentes voies technologiques des modèles de monde au sein d'un même système d'évaluation, et l'on commence à voir plus clairement en quoi chaque approche excelle. Les deux premiers de la Track 1 pointent vers deux voies technologiques différentes. WorldIncept, porté par视启未来, assume clairement de partir L'approche de l'espace latent JEPA, tandis que la BWM-Turbo opte pourLa voie de l'intelligence spatiale。 Les modèles des deux approches se sont affrontés : WorldIncept domine en respect des lois physiques et en précision 3D, tandis que BWM-Turbo arrive en tête pour la cohérence de l'arrière-plan et la similarité de représentation JEPA. Le Track 2 teste directement si un modèle du monde peut servir de manière stable d'environnement d'entraînement pour les politiques. Le champion MW2 provient de l'Académie de Zhongguancun de Pékin ; cette équipe s'intéresse à la compréhension des lois physiques par les robots et combine cette compréhension avec l'apprentissage et l'exécution des actions. La deuxième place revient au TTWM de Chenhunxian Technology, davantage axé sur la prédiction causale des actions, avec un attention portée aux régions cibles, aux contraintes géométriques spatiales, à la cohérence des objets à travers le temps, ainsi qu'à l'accumulation d'erreurs lors des rollouts continus. Dans le Track 3, ViTacX de l'équipe MiRobot de Xiaomi remporte la première place globale, mais son avantage dans les tâches purement visuelles ne s'est pas pleinement prolongé aux opérations visuo-tactiles. Cela montre que la manipulation réelle par robot exige non seulement de bien voir l'environnement, mais aussi de traiter les informations de contact.Les informations multimodales peuvent-elles s'intégrer de manière stable dans la boucle fermée de planification d'actions et de contrôle ?, est la partie la plus difficile. Les équipes en tête des trois pistes ont chacune leurs points forts, et présentent des avantages uniques sur différents plans de compétences. Comme la participation est sélective, il reste à vérifier si un modèle peut atteindre un niveau de pointe à la fois en génération vidéo, en entraînement de stratégies et en manipulation réelle de robots — ce qui mérite d'être attendu avec impatience.。

04

Dialogue avec les organisateurs :Comment s'est construit le « terrain d'examen » des modèles du monde

Du jugement unifié du résultat de la compétition par plusieurs institutions, jusqu'à la manière dont la configuration de l'évaluation réduit les biais liés à une seule métrique, l'évaluation de WorldArena 2.0 soulève encore de nombreuses questions techniques et organisationnelles. L'équipe organisatrice de Tsinghua a également répondu à ces questions lors d'un entretien. Voici le compte rendu de la conversation, légèrement remanié par AI 科技评论 sans en altérer le sens.

Le positionnement et le mécanisme d'évaluation de WorldArena

▎AI科技评论 : WorldArena est aujourd'hui devenu l'un des benchmarks d'évaluation centraux pour les modèles du monde. Que pensez-vous de cette reconnaissance ? Et d'où pensez-vous qu'elle provient principalement ?

Organisateur :Cette reconnaissance provient principalement d'un besoin commun aux milieux universitaires et industriels :Il faut une méthode d'évaluation pour déterminer si le futur prédit par un modèle du monde peut réellement aider un robot à exécuter des actions.Pour l'intelligence incarnée, il faut voir si le modèle peut répondre avec précision aux commandes d'action, si le mouvement prédit est conforme aux lois de la physique, et s'il peut prendre en charge l'apprentissage de stratégies et leur exécution réelle. Ces capacités sont difficiles à évaluer uniquement en regardant des vidéos ; des tests spécialisés sont nécessaires. WorldArena 1.0 transforme ces problèmes en un processus de test exécutable selon des critères unifiés, et 2.0 ajoute en outre l'apprentissage par renforcement en ligne et l'interaction avec de vrais robots, ce qui permet de progresser davantage.Examiner le transfert de la simulation vers le réel (Sim2Real) et le retour en boucle ferméePour nous, un benchmark n'a de valeur à long terme que s'il aide les chercheurs et les praticiens à identifier les problèmes fondamentaux des modèles, à expliquer leurs forces et leurs faiblesses, et à améliorer les méthodes en conséquence.

▎AI Science et Technologie : WorldArena implique plusieurs institutions, dont Tsinghua, l'Université de Pékin, CMU, Stanford, Princeton, l'Université de Hong Kong, le NUS et l'Institut d'automatisation de l'Académie des sciences de Chine. Quel rôle exact l'équipe de Tsinghua, en tant qu'organisateur, joue-t-elle ?

Organisateurs : l'équipe de Tsinghua est principalement responsable de la conception et du développement de la recherche sur le cadre d'évaluation, ainsi que de l'évaluation de la compétition et de la maintenance de la communauté open source.Ce benchmark couvre tout, de la génération vidéo à la manipulation sur robot réel ; il exige d'importants investissements en logiciels, matériel, puissance de calcul et ressources humaines, si bien qu'il est difficile à réaliser par une seule équipe et doit être le fruit d'une collaboration entre plusieurs institutions. Les travaux concrets comprennentMise en place du processus d'évaluation、Normalisation du code soumis、Connexion au service d'inférence à distance inter-régions、Maintenance d'un cluster d'évaluation distribué, ainsi queRésumé des résultats de vérification。「真机赛道」还需要与机器人平台的合作方完成硬件接口适配、测试时段预约和现场操作安排。

▎AI Science et Technology Review : Y a-t-il des difficultés dans la coordination entre les différentes institutions ? Pourriez-vous donner un ou deux exemples concrets ?

Organisateur :Deux difficultés notables se dégagent :Premièrement, comment garantir la reproductibilité des résultats d'évaluation dans différents environnements de calcul;Deuxièmement, comment coordonner les équipements robotiques et le personnel sur les différents sites.Par exemple, si l'on exécute le même code d'évaluation sur des cartes graphiques d'architectures différentes, comme NVIDIA et AMD, et si les implémentations des opérateurs sous-jacents et les dépendances de l'environnement ne sont pas rigoureusement alignées, de légères variations peuvent apparaître dans les résultats. Il faut donc procéder à l'adaptation aux différents environnements matériels, unifier les configurations de bas niveau, puis effectuer une vérification approfondie, afin d'éviter de confondre des différences de plateforme avec des différences de capacités du modèle. L'évaluation sur machines réelles implique également des sites, des états d'équipement et des dispositions de personnel dans différentes régions, et nécessite la conception de tâches et de processus de collecte de données adaptés à chaque robot. Les services de modèles à distance doivent en outre se synchroniser avec l'exécution sur place à la milliseconde près, et les protocoles d'interface, les conditions physiques initiales ainsi que les journaux d'exécution doivent tous être clairement documentés.

▎AI Tech Review : Les dimensions d'évaluation sont très nombreuses, lesquelles peuvent être évaluées automatiquement et lesquelles dépendent de la notation subjective d'experts ? Comment garantir la cohérence des scores entre institutions et entre filières ?

Organisateur :Les trois pistes diffèrent par leur degré d'automatisation, selon que les tests impliquent ou non des interactions en ligne et des opérations d'équipements sur site.La piste 1 évalue principalement la capacité de génération, les métriques sont principalement calculées par des processus automatisés, tout en conservant une revue humaine des sorties anormales et des commits suspects.La piste 2 examine la performance itérative des stratégies d'apprentissage par renforcement dans des environnements de modèle du monde, le degré d'automatisation du processus d'évaluation est également assez élevé. Le travail manuel consiste principalement à vérifier la connectivité des appels de services et à coordonner les créneaux de calcul interactif entre les équipes.Track 3 implique une manipulation sur appareil réel, avec la présence du personnel sur place pour participer à la réinitialisation des équipements, à la capture et à l'observation, au traitement des anomalies et à la détermination du succès ou de l'échec des tâches, tout en maintenant une liaison en temps réel avec les équipes participantes ; les deux parties confirment en temps réel les résultats des tests par communication, sur la base desquels le taux de réussite est calculé. La cohérence est principalement garantie par l'application de règles uniformes au sein d'une même piste. Le format d'entrée, les spécifications des API, le budget de calcul, la version des métriques d'évaluation et les critères d'échec sont identiques pour toutes les équipes. Les différentes pistes évaluent des capacités différentes, et les scores ne peuvent donc pas être directement comparés ; nous nous concentronsCe qui est garanti, c'est la cohérence des conditions d'évaluation et des critères de jugement au sein de chaque piste.。

▎AI科技评论 : le classement est-il divisé entre un classement de défi et un classement quotidien ? Quel est le mécanisme de mise à jour du classement quotidien ? À quelle fréquence est-il mis à jour ?

Organisateur :La liste des défis et la liste de recherche quotidienne ont des usages différents, et leurs conditions de publication ainsi que leurs modalités de mise à jour diffèrent également.Le classement du challenge sert à déterminer les résultats de la compétition et les prix, avec une date limite de soumission claire, des règles de gel du classement et un processus de vérification des lauréats. Afin de garantir l'équité de la compétition, une partie des données de test n'est pas entièrement publique. Le classement de recherche quotidien reste ouvert à long terme au monde académique, avec un code et un protocole d'évaluation entièrement open source ; les chercheurs peuvent les réutiliser localement, offrant ainsi une référence de performance continue pour les futures améliorations algorithmiques.

Le challenge ajoute deux nouvelles pistes pour évaluer si les modèles peuvent réellement exécuter

▎AI科技评论 : WorldArena 2.0 ajoute par rapport à 1.0 la Track 2 (MB-RL) et la Track 3 (WAM sur robot réel). Comment cette idée est-elle née ? Pourquoi ajouter précisément ces deux pistes ? Quelles sont les considérations derrière ?

Les organisateurs :L'ajout de ces deux pistes vise à examiner davantagele rôle des modèles dans l'interaction et l'exécution réelle. La version 1.0 se concentrait principalement sur le moteur de données embodiment et l'évaluation hors ligne des politiques, avec surtout des tests statiques en boucle ouverte dans des environnements de simulation. Les modèles étaient testés après un fine-tuning local, sans retour en temps réel ni capacité d'auto-correction pendant l'interaction. La version 2.0 vise à examiner davantage deux capacités. D'abord, la capacité d'interaction en boucle fermée: la politique peut-elle utiliser le modèle du monde comme environnement d'interaction, pour apprendre et faire des essais-erreurs en continu dans l'espace dynamique généré par le modèle. Ensuite, la capacité degénéralisation embodiment: les compétences apprises dans l'environnement du modèle, après un transfert Sim2Real, peuvent-elles être utilisées pour la manipulation d'un bras robotique réel. La considération sous-jacente est la suivante : générer des vidéos cohérentes ne signifie pas que le modèle peut fournir un retour physique fiable ; fonctionner de manière stable en simulation ne signifie pas non plus qu'il pourra s'exécuter correctement sur un robot réel. Il était donc nécessaire de faire de l'interaction en ligne et du déploiement sur robot réel des pistes distinctes.

▎AI科技评论 : Précédemment, lors d'une interview avec nous, M. Shang Yu avait admis la limite du « sim-to-real gap » du classement. La Track 3 sur robot réel répond-elle directement à ce problème ? Dans quelle mesure peut-elle le résoudre ?

Les organisateurs :L'évaluation sur robot réel intègre au test les capteurs réels, les conditions de contact et le processus d'exécution de l'équipement, offrant un complément à la recherche en simulation. Des facteurs tels que les variations de friction, les perturbations lumineuses, les délais de contrôle des moteurs et le contact entre corps rigides affectent les résultats des tâches sur robot réel. Cependant, les tâches, les environnements et les robots couverts par la Track 3 restent actuellement limités ; ils seront continuellement étendus et améliorés par la suite.

▎AI科技评论 : Y aura-t-il une itération vers WorldArena 3.0 ? Quelles dimensions de test envisagez-vous d'ajouter ?

Les organisateurs :Au cours de l'avancement de la version 2.0, nous avons déjà identifié plusieurs pistes de recherche dignes d'être poursuivies : des interactions à plus haute fréquence et de plus longue duréeinteraction en boucle fermée, après des erreurs d'exécution, l'auto-correction, entre robots de configurations différentes, letransfert de généralisation, ainsi que, dans l'assemblage de précision, lafusion de la perception tactile et multimodale。

▎AI科技评论 : la participation est-elle sélective au point qu'une piste pourrait rassembler les plus forts tandis qu'une autre resterait déserte, affaiblissant ainsi la représentativité globale du classement ?

Les organisateurs :Cela dépend des exigences techniques, des coûts de R&D, des conditions logicielles et matérielles, du temps d'itération, etc. Chaque piste a ses particularités et reflète les capacités de différents modèles à différents niveaux.

Portrait des équipes du classement : quelle route technique est la plus performante ?

▎AI科技评论 : les deux premiers de chacune des trois pistes comprennent des représentants de l'industrie et du milieu académique. Quels sont, dans l'innovation sur les modèles du monde, les avantages centraux et les faiblesses de chacun ?

Les organisateurs :Du point de vue des équipes participantes de cette édition, universités et entreprises présentent des avantages complémentaires. Les équipes universitaires sont plus enclines à essayerdes architectures de pointe et de nouvelles fonctions objectif, avec une exploration plus souple; les équipes d'entreprises ont accumulé davantage d'expérience dansles réserves de données de haute qualité, l'ordonnancement de puissance de calcul à grande échelle et le déploiement de systèmes, et leurexécution d'ingénierieest aussi plus stable. C'est notre observation concernant cette édition, qu'il ne faut pas généraliser à toutes les équipes. La compétition a aussi rendu plus concrètes les lacunes que chaque camp doit combler. L'innovation algorithmique doit encore fonctionner de manière stable dans de véritables processus d'ingénierie ; disposer d'avantages en données et en puissance de calcul exige aussi une modélisation physique précise et une définition claire des problèmes pour se traduire en résultats. Combiner capacité de recherche et capacité d'ingénierie contribue à raccourcir le chemin qui mène une technique de sa proposition méthodologique à son application réelle.

▎AI科技评论 : les modèles du monde comptent actuellement quatre grandes voies techniques ; les équipes primées de cette édition couvrent globalement les voies JEPA, intelligence spatiale/4D structuré et génération en pixels, mais les équipes de la voie JEPA semblent avoir davantage gagné : Shiqi Weilai a pris la première place du Track 1, et Chenhunxian la deuxième du Track 2. En tant qu'organisateurs, comment interprétez-vous ce résultat ?

Les organisateurs :Dans les systèmes réels, les voies techniques ne sont pas totalement séparées. La génération autorégressive au niveau des pixels, l'apprentissage de représentations en espace latent — par exemple l'idée JEPA — ainsi que la modélisation de topologie spatiale et les moteurs physiques explicites peuvent être combinés dans un même système, et bon nombre d'équipes de pointe adoptent précisément une architecture multi-modules. En outre, les équipes diffèrent fortement en nombre de paramètres des modèles, en nettoyage des données de pré-entraînement, en interfaces d'abstraction d'actions et en fréquence des boucles de contrôle. Ce résultat fournit des pistes qui méritent d'être poursuivies en apprentissage de représentations incarnées.

▎AI科技评论 : après avoir été témoins de tant de changements de classement et d'évolutions de la compétition, quel est selon vous le degré de développement actuel des modèles du monde ? Où se situe le principal goulot d'étranglement ?

Les organisateurs :Au vu des résultats des tests de cette édition, dans des tâches spécifiques contrôlées, les meilleurs modèles du monde commencent à disposer d'une capacité de réponse aux relations de causalité des actions, et peuvent apporter une certaine aide à l'apprentissage de politiques en aval. Mais dans des interactions complexes plus longues, ainsi que dans la manipulation robotique réelle à contacts denses, les modèles du monde présentent encore des goulots d'étranglement.Le modèle ne parvient pas encore à caractériser avec suffisamment de précision et de constance les transitions d'état provoquées par l'application d'une action. Les moindres erreurs de la prédiction continue s'accumulent et s'amplifient progressivement ; et sur un vrai robot, il faut en outre gérer des latences d'action de l'ordre de la milliseconde, ainsi que les retours de force non linéaires dus au contact de corps rigides.

Faire progresser continûment la recherche sur les méthodes d'évaluation

▎AI科技评论 : M. Shang Yu mentionnait lors de notre précédent entretien qu'« il faut éviter que WorldArena ne devienne une nouvelle dépendance au chemin pour les modèles » (que tous cherchent à obtenir de hauts scores sur WorldArena en épousant ses métriques et ses tâches). Au fil des deux éditions du défi et des mises à jour quotidiennes du classement, avez-vous réellement observé une telle dépendance ? Sous quelles formes concrètes ?

Les organisateurs :L'optimisation visant des règles publiques est un phénomène difficile à éviter totalement dans le fonctionnement d'un benchmark. Ce qui nous importe, c'est de savoir si l'amélioration des scores reflète réellement un progrès de la capacité physique générale des modèles, ou simplement un meilleur ajustement à une métrique donnée ou à une catégorie de tâches. Pour réduire ce dernier effet, nous avons principalement travaillé sur trois points :suivre en continu le coefficient de corrélation entre les scores et la réussite ou l'échec sur de véritables tâches physiques, afin de calibrer les métriques qui donnent de hauts scores sans refléter la capacité physique réelle ;augmenter continuellement les scènes et les tâches, en élargissant la distribution des tests OOD et en intégrant davantage de tâches à contacts complexes ;conserver un ensemble de tests à l'aveugle indépendant et fermé, les étapes clés des tests restant strictement confidentielles.

▎AI科技评论 : si vous deviez fixer un objectif à la prochaine étape de WorldArena, quel problème aimeriez-vous qu'il résolve en priorité, et quel rôle joueriez-vous qu'il endosse ?

Les organisateurs :À l'étape suivante, nous espérons évaluer plus clairement le périmètre d'application réel des modèles : lorsqu'un chercheur obtient un modèle du monde, il devrait pouvoir savoir dans quelles scènes physiques il est fiable, et dans quelles conditions, dans quelles situations il tend à défaillir. L'objectif à plus long terme est defaire de WorldArena un outil qui aide chacun à améliorer ses méthodes, afin que les capacités des modèles du monde généralisent mieux vers les scènes réelles。

Pour faciliter les échanges communautaires et le partage d'informations sur les conférences, nous avons créé un groupe dédié IROS 2026 Groupe d'échange de la conférence!Rejoignez le groupe pour débloquer ces « avantages » ?

  • Poste d'information de la conférence : DDL de soumission, normes de format, avancement de l'évaluation… Les jalons clés vous sont envoyés en premier temps, vous n'aurez plus jamais peur de rater un deadline, votre préparation de soumission sera bien solide.

  • Thé des collègues : des chercheurs de tous horizons sont dans le groupe, échangez vos expériences, confrontez vos idées, construisez votre réseau, sur la route de la recherche nous avançons ensemble.

  • Station de ravitaillement en pointe : les dernières découvertes et les sujets d'actualité sont synchronisés en temps réel, en lien avec le thème de la conférence pour vous aider à clarifier votre démarche de soumission et faire le plein d'inspiration pour votre article.

  • Équipe de soutien sur place : (ouvert exclusivement pendant la conférence) :Sur place, pas de panique —

    Navigation des itinéraires: répartition des salles, comment trouver les auditoriums, demandez à tout moment dans le groupe ;

    Lecture commune des sujets: sessions populaires, discussions sur les Keynotes, rattrapez-les même si vous les avez manquées ;

    Compilation des Posters: le meilleur des affiches sur place, collectez-les en un clic sans rien manquer ;

    Place des rendez-vous: repas, interviews, échanges… pour discuter, collaborer ou se rencontrer en personne, il suffit de lancer l'invitation dans le groupe.

? Portail d'accès au groupe : Scannez le code QR pour rejoindre le groupe ou ajoutez sur WeChat Luyoyo_2026, avec la mention : IROS + organisme/école + nom + domaine de recherche.

Dans la recherche comme dans la technique, la différence d'information est cruciale.

Venez, prenez une longueur d'avance avec nous !

Montez à bord, on vous fait découvrir l'essentiel des grandes conférences mondiales sur l'IA

Vous pourrez y consulter en exclusivité :

PPT des conférences d'experts

Texte intégral des rapports du congrès

Analyses des articles populaires

Entretiens avec les nouvelles étoiles académiques

Scannez le code QR ci-dessus

ou cliquez sur « Lire l'article original » pour suivre la rubrique.

Leiphone (compte officiel : Leiphone)

Leifeng Wang

Article original de Leifeng Wang, reproduction interdite sans autorisation. Voir lesdirectives de republication。

Source originale

雷峰网 AI

À propos du contenu

La publication originale et les droits appartiennent à la source.

Traduction automatique · Consultez l’original