Auteur | Wu Simei
Édition | Cen Feng
Une assiette, une robinet, un petit morceau de savon bleu. Wu Jiajun a commencé son discours à IROS 2026 avec une scène de cuisine qui ne nécessite presque aucune compétence technique. Un étudiant a appliqué le savon, ouvert le robinet, nettoyé à moitié, puis est parti temporairement. Maintenant, c’est le robot qui s’en charge. À première vue, la tâche est claire : nettoyer l’assiette et la remettre en place. Mais ce que le robot doit vraiment traiter, ce ne sont pas ces trois mots « nettoyer les assiettes ». Il doit d’abord savoir quelle chose devant lui est une assiette ; il doit savoir si cette assiette est sale ou non ; il doit remarquer s’il y a un petit morceau de nettoyant bleu sur l’assiette. Il doit également savoir si la pomme de douche est ouverte, si l’assiette a été lavée, et si, lorsqu’il l’emporte, une nouvelle problématique se révèle sur la table. Pour la même tâche, avec un état initial différent, la réponse peut être complètement autre. L’assiette a déjà été lavée, il n’est donc pas nécessaire de la laver à nouveau. Sans nettoyant, il faut d’abord presser un peu. Si des choses sales sont pressées sous la assiette, « la nettoyer » ne signifie plus simplement la mettre sur le présentoir. Lorsque les gens font face à ces changements, ils ne se sentent généralement pas comme ayant effectu une raisonnement complexe. Nous jetons juste un coup d’œil, puis continuons. Mais pour un robot, chaque fois qu’il « jette un coup d’œil et continue », il y a une question derrière : qu’est-ce que cet objet comprend réellement du monde qui l’entoure ? Le 27 septembre, lors de l’ouverture de IROS 2026, Wu Jijun, professeur assistant au département de science informatique de l’Université de Stanford, a présenté un rapport invité intitulé « Building Physical Agents via Structured Representations » lors du séminaire RoBoWoMo. Au cours des dernières années, il a étudié comment reconstituer dans les images le monde caché derrière la vision : géométrie, matériaux, propriétés physiques et relations entre les objets. Maintenant, lorsque ces questions sont intégrées dans le monde physique de la vie réelle des robots, d’autres problèmes apparaissent. Comment un robot devrait-il décrire une tâche ? Ces descriptions peuvent-elles être apprises par eux-mêmes ? Quand un modèle a-t-il besoin d’un entraînement supplémentaire face à des objets jamais rencontrés dans les données d’entraînement ? Si la planification elle-même peut être apprise, est-il encore nécessaire un planificateur traditionnel ? Enfin, la question ne devient même plus « le robot a-t-il vu comment les humains font quelque chose ». Sans démonstration, sans données de téloperations, et même face à une robinet qu’il n’a jamais vue, le robot peut-il se souvenir lui-même de la manière dont elle peut être utilisée ? Ceci est le texte révisé de la conférence présentée par Wu Jiajun à IROS 2026. Le site Lei Feng Wang (account public: Lei Feng Wang) · AI Technology Review a édité la conférence anglaise en direct, reordonnant les expressions orales et les termes techniques sans modifier le sens original.
▎Construction d’agents physiques via des représentations structurées
Conférencier : Wu Jijun, professeur assistant au département de sciences informatiques de l'Université de Stanford (professeur assistant également au département de psychologie)01
Un plat, pourquoi cela pose problème aux robots
Aujourd’hui, je voudrais parler de la manière dont nous pouvons utiliser des représentations structurées pour construire des agents intelligents capables d’agir dans le monde physique. Commençons par la vision. En fin de compte, on ne voit que des images, mais derrière ces images se trouve tout un monde : géométrie, matériaux, différentes propriétés physiques. L’objectif principal de notre recherche a toujours été de déterminer dans quelle mesure ces éléments peuvent être restitués ; et une fois qu’ils sont restitués, on peut recréer ce monde. Ces dernières années, il y a aussi une tendance très active : les agents dans l’espace numérique. Ils reçoivent des instructions et interagissent avec le monde entier. Cela amène naturellement à se poser une autre question : existe-t-il une structure similaire dans le monde physique ? Dans le monde numérique, on dispose de dossiers, qui contiennent des fichiers, et les fichiers ont leurs propriétés ; dans le monde physique, on dispose de scénarios, qui contiennent des objets, et les objets ont également leurs propriétés. Alors, pouvons-nous utiliser cette structure pour transporter ces entités intelligentes du espace numérique vers l’espace physique ? C’est le thème de ce rapport d’aujourd’hui. Dès que vous voulez vraiment que la robotique et les humains coexistent dans le même monde, les choses deviennent difficiles. Ce monde est complexe, il est dynamique et varié ; vous devez gérer une grande quantité de tâches différentes. Bien sûr, il faut utiliser des modèles de base, qui sont de plus en plus puissants, au point que c’est difficile de ne pas les utiliser. Mais la manière dont vous les utilisez peut être très différente : devoir effectuer un entraînement postérieur, introduire davantage de structures, intégrer certaines connaissances supplémentaires, et ensuite combiner ces éléments avec ceux existants. Ce sont toutes des choix à finaliser. Il y a encore un aspect particulièrement lié aux robots et très différent du monde numérique. Le monde numérique est, dans une certaine mesure, unifié par le langage ; côté robots, c’est une autre réalité : différents domaines, différentes tâches, souvent des scénarios et données spécifiques, chaque robot étant différent. Ces données ne figurent pas dans les masses de texte utilisées pour entraîner les grands modèles. Ainsi, la question devient : comment franchir ce mur. Après tant de choses abstraites, commençons par une scène complètement non spécialisée, une scène de cuisine très ordinaire, pour voir ce qui est nécessaire pour que le système robotique travaille réellement avec les humains, même dans un tel contexte. Un étudiant verse du détergent sur une assiette, ouvre la robinet, puis doit s’éloigner. Maintenant, il faut faire appel au robot. Il doit bien sûr d’abord effectuer une sorte de raisonnement sémantique : parmi tous ces ustensiles en céramique, lequel doit être lavé par moi ? C’est cette assiette. Cette étape est relativement facile à réaliser aujourd’hui avec un modèle visuel. Ensuite, il faut comprendre que cette assiette doit être lavée. Le détergent a déjà été versé, le robinet est ouvert. Donc, ce que je dois faire, c’est prendre l’assiette, la laver, la placer sur l’étagère et fermer le robinet. Cela semble très clair. Mais la partie vraiment difficile, c’est : comment rester cohérent entre différents environnements, différents objets et différents objectifs. Même dans cette situation déjà simple, plusieurs situations complètement différentes peuvent survenir. La première, c’est que vous devez vous adapter aux actions des autres. Par exemple, quelqu’un entre, nettoie les assiettes et les repose sur la table. À ce moment-là, vous devriez savoir que les assiettes ont déjà été nettoyées, il n’est pas nécessaire de les nettoyer à nouveau. Tout ce qu’il faut faire, c’est les remettre à leur place, et il n’est pas nécessaire d’éteindre le robinet, car celui-ci est déjà éteint. La deuxième catégorie concerne une différence très subtile dans l’état initial. En supposant que tout reste comme avant, la seule différence est qu’il n’y a pas de savonnette sur cette assiette. Si vous regardez l’image entière, cette différence est très faible : ce n’est qu’un petit tas de matière bleue, très difficile à voir. Mais ce n’est pas une simple « différence mineure » qui peut être transportée : il s’agit d’une différence qualitative dans la représentation de l’état. Car si aucun détergent n’a été appliqué sur le plateau, il est très probable que vous ne devriez pas le laver, et le laver directement causerait un désordre. Vous devez d’abord appliquer le détergent, puis le laver, puis le placer sur le plateau, et ensuite effectuer les autres tâches. La différence dans l’entrée est minime, mais la différence dans l’état est qualitative, et les actions à entreprendre sont complètement différentes. Troisièmement, il faut suivre les observations en constante évolution. Par exemple, le robot prend la assiette, la pose sur le support, c’est suffisant, car elle est déjà propre, il n’est pas nécessaire d’éteindre le robinet. Mais sous l’assiette se trouvent des choses sales. À ce moment-là, vous devez réaliser que si mon objectif est vraiment de rendre tout propre, alors je devrais essuyer la table. Personne ne vous a ordonné cela ; vous avez compris en suivant les nouvelles observations. Dans un état idéal, vous devriez également remettre l’assiette à sa place ; mais nous ne pouvons même pas faire ce pas-là, car le corps du robot et les compétences qu’il maîtrise le limitent. Donc, vous devez être capable de vous adapter à toutes ces situations différentes. La question est : comment faire.02
Si le robot a également besoin d’une langue
Au cours des dernières années, nous avons cherché à mettre en place un modèle. Sa mise en œuvre concrète a toujours évolué, car le modèle de base change, et toutes les possibilités changent également. Mais le squelette reste le même : d’un côté, il y a l’entrée brute, vidéo ou langage ; de l’autre, grâce au modèle de base, on découvre un ensemble d’abstractions combinables ; ces abstractions doivent pouvoir être réutilisées et recombinées pour faire face à des tâches génériques ; et de l’autre côté, il y a les actions de contrôle, qui doivent être découvertes ou apprises par soi-même. En ce qui concerne l’apprentissage des actions, nous espérons apprendre à partir de ce qu’on appelle la supervision naturelle. En d’autres termes, l’ensemble du processus est appris et découvert ; plus les personnes participent moins, mieux c’est. Ce que vous lui donnez peut être simplement un vidéo, une démonstration ou quelques mots, et ces entrées peuvent déjà être traitées. Plus la supervision est faible, plus la généralité est grande. Mais en faisant cela, une série de questions se posent sur le papier. À quoi ressemblent ces abstractions combinées ? Comment sont-elles découvertes ? D’où vient cette langue spécifique pour décrire les tâches ? Si vous n’avez pas besoin de cela ? Comment résoudre la planification : utiliser un planificateur de tâches traditionnel ou apprendre un planificateur ? De plus, le modèle de monde lui-même : l’utiliser tel quel ou le modifier légèrement ou le entraîner à nouveau ? Chaque approche possède différentes méthodes d’implémentation, et nous avons également testé différentes versions au fil du temps. Je vais d’abord expliquer la structure générale de haut niveau. La première version d’implémentation a été réalisée il y a deux ans ; les composants spécifiques étaient beaucoup plus rudimentaires qu’aujourd’hui, mais le paradigme est déjà clair. Supposons que vous ayez un ensemble de démonstrations. Un robot peut effectuer de nombreuses tâches différentes sur place. Vous pouvez repérer les points clés tout au long du processus : par exemple, la première étape consiste à prendre la casserole, la deuxième étape consiste à verser sous la pomme de douceur, et la troisième étape consiste à placer sur l’étagère. Il peut aussi s’agir d’autres choses, comme des données vidéo. En somme, vous avez un ensemble de données. Votre objectif est d’apprendre le système de description qui se cache derrière cette tâche. Cela ressemble à un modèle mondial symbolique, qui comprend approximativement deux groupes de modules. Le premier groupe concerne les attributs et les relations spatiales qui vous intéressent. Cet objet est-il sale ou propre ? Quel est le rapport entre ces deux objets, relation bidimensionnelle ou relation tridimensionnelle ? Il faut pouvoir déterminer cela ; c’est un ensemble de prédicats. Bien sûr, on ne peut pas se fier à des règles écrites par l’homme, il faut utiliser des réseaux et des modèles de base pour apprendre : permettre aux systèmes de déterminer n’importe quel ensemble de prédicats, que ce soit pour savoir s’il est sale ou pour décrire une relation spatiale. La deuxième catégorie concerne les actions. Vous avez un ensemble d’actions atomiques, comme « laver ». Chaque action doit expliquer clairement ses conditions préalables et ses effets postérieurs. L’action de laver, il faut d’abord saisir l’objet dans la main, et l’on se trouve actuellement dans la cuisine ; le résultat est que si cet objet contient de l’eau de javel, il devient propre. Quant à savoir si la robotique tient un objet dans sa main ou non, ou si un objet est propre ou sale, cela est déterminé par le groupe de prédicats précédent. De plus, pour exécuter réellement une action, il faut également une stratégie, c’est-à-dire comment les articulations doivent effectuer leurs mouvements. Cette partie fait également partie d’une réseau de neurones, avec une stratégie de diffusion pour chaque action atomique. Ainsi, la couche de symboles définit la combinabilité : tant que les conditions préalables sont remplies, ces actions atomiques peuvent être reliées pour former des tâches plus longues et plus complexes. La perception et le contrôle sont tous effectués par les réseaux de neurones. Mais dans un certain sens, il s’agit d’une langue spécialisée, un ensemble de langage domaine spécifique (DSL). Il y a donc une question fondamentale : à l’origine, ces éléments étaient soit écrits manuellement, soit directement copiés depuis des sources comme PDDL, et le DSL était déjà établi. Alors, est-ce que cela est suffisamment universel ? Pourquoi cela suffit-il ? Et si quelque chose manque ? Alors la prochaine étape est naturellement : il faut aussi pouvoir apprendre le DSL lui-même. Vous pouvez faire en sorte que le modèle de base examine les données que vous avez, que ce soit via des vidéos démonstratives, des enregistrements d’opération ou du langage, puis lui dire : « C’est une tâche qui nous intéresse. » Ensuite, il devrait produire : je pense que les propriétés suivantes, les actions atomiques suivantes, ainsi que leurs conditions préalables et effets postérieurs sont importants. Et si il se trompe ? Vous pouvez également le vérifier. D’un côté, on peut vérifier de manière symbolique, de l’autre, on peut utiliser directement les données pour la vérification. Par exemple, le système indique qu’il faut absolument saisir l’objet à la main avant de le laver, sinon on ne peut pas le laver. Alors, retournez et vérifiez vos propres données : chaque fois que je lave quelque chose, est-ce vraiment que je saisisse d’abord l’objet ? Vous pouvez utiliser ces exemples ou d’autres données, publiques ou privées, pour valider ces spécifications. Ainsi, cette langue elle-même a été proposée par un autre système. L’année dernière, j’ai parlé de cette partie de manière assez confuse. Cette année, j’espère que ce sera mieux, car j’ai découvert qu’une bonne analogie peut aider à clarifier beaucoup de choses. Cette analogie se trouve dans votre propre ordinateur. Si vous collez une phrase comme « Faites ceci » dans un agent de programmation intelligent, il fera tout seul dix ou huit étapes. La première étape est de créer un fichier, la deuxième est d’exécuter une opération, et ainsi de suite. Il y a beaucoup de différentes étapes. En y réfléchissant bien, cela ressemble beaucoup à ce que nous devons faire. Ce que nous faisons, c’est essentiellement transporter dans l’espace physique des entités intelligentes comme le Cursor qui travaillent sur l’ordinateur : d’abord concevoir une série de plans, puis exécuter cette série d’actions, tout en ayant une validation pour s’assurer que ces actions sont correctement définies et exécutées correctement. C’est essentiellement cela.03
Quand on rencontre quelque chose qu'on n'a jamais vu, que fait-on du modèle
Parlons maintenant de quand il faut s’asseoir pour effectuer l’entraînement postérieur. Bien sûr, si on utilise directement un modèle de pointe pour aller jusqu’au bout, c’est le plus simple. Mais il y a un problème incontournable avec les robots : ce dont vous avez à travailler est très probablement quelque chose que vous n’avez jamais vu auparavant. Car le monde physique est beaucoup plus fragmenté que le monde numérique. Vous avez peut-être déjà vu certains objets, mais en réalité, il est plus fréquent qu’il s’agisse d’une pièce utilisée sur une chaîne de production, qui n’existe que dans votre usine et pas ailleurs. Je n’ai jamais vu cette pièce, maintenant je dois déterminer si elle est sale ou non, et si elle produit un certain effet. Il est évident qu’on ne peut pas utiliser directement le modèle de pointe publié, car il ne connaît même pas la définition de « est-ce que cette pièce est bonne ou mauvaise ». Ainsi, il y aura certaines situations où il faudra effectuer un peu de entraînement supplémentaire. La condition préalable est que vous décidez de ne pas compter uniquement sur ces modèles de pointe prêts à l’emploi. Alors, comment faire ? Attention à un point : bien que ces effets semblent logiques, par exemple, il y a du savon sur lui, et après l’essuyage, il devient propre, en réalité, ils sont écrits de manière approximative, et les opérations logiques se présentent souvent sous forme de probabilités. Ainsi, vous pouvez relier toute la chaîne : je dis qu’il y a du savon sur cet objet, je l’essuie, il devrait être propre. Mais si le critère pour déterminer « y a-t-il du savon » n’est pas bon ? Ceci étant un nouvel objet que je n’ai jamais vu auparavant, il ne peut pas être identifié, donc la sortie est incorrecte, et tout est erroné par la suite. À ce moment-là, ma démonstration m’indique une autre vérité : cet objet est en effet propre. Ainsi, vous obtenez une étiquette. Puisque toutes les étapes d’exécution sont accumulées de manière différentiable, vous pouvez utiliser cette étiquette d’exécution mentionnée dans la démonstration pour une propagation inversée, afin de fournir une supervision au modèle. Par conséquent, l’entraînement ultérieur peut être effectué dans certaines circonstances. Ce n’est pas obligatoire, mais si vous considérez ces modèles comme des modules dans un système, et qu’ils doivent être réentraînés, cette voie est possible. Je ne vais pas entrer dans les détails concernant les résultats de cette série de deux ans ; ces composants sont maintenant obsolètes, et après avoir changé de méthode, on trouve que certains aspects étaient assez rudimentaires à l’époque. Mais le paradigme lui-même a un grand potentiel, et nous avons par la suite remplacé les différentes parties par des versions plus modernes. Par ailleurs, l’un des postdoctoraux impliqués dans ce projet est aujourd’hui professeur à l’Université nationale de Singapour, et l’autre collaborateur était alors doctorant au MIT, qui est également devenu professeur.04
Même la planification commence à être déléguée au modèle
Ensuite, je vais parler de quelques progrès plus immédiats. Je parlerai un peu plus rapidement. Comme mentionné précédemment, les modules du système se développent étape par étape : la validation, la perception et le contrôle ont été confiés aux réseaux de neurones. Mais il y a encore une chose manquante : la planification. Lorsque tous les modules sont présents et l’état est vérifié, devrais-je commencer par le lavage ou faire autre chose en premier ? À l’époque, on utilisait encore des méthodes traditionnelles, basées sur la planification des tâches classiques. Mais récemment, nous avons publié un article qui remplace également cette approche. C’est aussi pourquoi je n’ai pas de très bonnes diapositives aujourd’hui. En réalité, j’aurais dû avoir un vidéo, et je veux vraiment une vidéo. Alors, en restant optimiste, nous aurons une vidéo magnifique dans quelques jours. Pour l’instant, on ne peut que utiliser une image dans le rapport. La logique est la suivante : vous avez toujours un ensemble de états, qui sont vérifiés par les réseaux de neurones ; mais la question de « donner les instructions en fonction de l’état actuel, devrais-je laver d’abord, ou prendre le plat d’abord, ou faire quoi ? » n’est plus confiée au planificateur traditionnel, mais au réseau. Pour être plus précis : ce groupe de propositions est maintenant essentiellement du langage naturel, un véritable langage naturel. Vous combinez le langage naturel et les images en tant que prompt pour le modèle de base, afin qu’il effectue la planification. Mais il doit être entraîné après coup. Par conséquent, nous devons utiliser un modèle de poids ouvert, car il faut le entraîner manuellement ; en même temps, comme les images font partie de l’entrée, le modèle doit être capable de traiter les images. Et il s’est avéré que certains modèles open source ont une capacité de raisonnement visuel très faible, au moins elles sont bien inférieures aux modèles closed source de la même période. Ainsi, si vous les utilisez directement, elles produisent souvent des résultats qui ne font pas du tout sens. En pratique, nous avons plutôt choisi de faire un entraînement postérieur avec certains modèles. De cette manière, même le planificateur lui-même devient quelque chose qui a été appris par l’entraînement postérieur. Il peut utiliser ce type de langage naturel symbolique pour planifier, et les séquences d’actions produites ont une probabilité d’exécution beaucoup plus élevée. Pour ce type de tâches à long terme, cela signifie qu’il faut beaucoup moins d’intervention humaine. Il y a aussi un autre défi : tout cela dépend du répertoire de compétences, et le répertoire de compétences de chaque robot peut être différent. Si vous utilisez directement un modèle de pointe, il n’a pas du tout le contexte de votre répertoire de compétences. Par exemple, il dira : « Maintenant, vous devez remplir ce mug avec l’eau provenant de la robinet, mais la robinet n’est même pas ouverte. » Cette action est donc impossible à exécuter. Après l’entraînement, le planificateur produit des actions qui semblent réellement exécutables lorsqu’il est confronté à de telles opérations à long terme. Dans quelques jours, nous aurons des vidéos ; pour l’instant, examinons simplement les résultats les plus récents. Jusqu’à présent, nous avons toujours supposé qu’il y avait une démonstration : que ce soit par vidéo ou par l’action humaine. Ce que je voudrais dire dans le temps restant, c’est : et si il n’y avait pas de démonstration ? Si je rencontre un objet entièrement nouveau, que je n’ai jamais vu auparavant ? L’approche précédente était de me montrer une démonstration, afin que je sache comment interagir avec cet objet. Mais est-il possible que je trouve moi-même toutes les possibilités d’interaction avec cet objet, sans même une vidéo de démonstration ni aucune aide de la part des gens ? Par exemple, si devant moi se trouve un nouveau type d’objet. Nous avons déjà montré comment ouvrir l’arrosoir. Mais je n’ai jamais utilisé cet arrosoir auparavant. Ne pourriez-vous pas me donner quelques exemples, me montrant quelles manières il est possible d’interagir avec lui ? C’est aussi une tâche que nous explorons. Formalisons cela grossièrement. Supposons que nous ayons un seul objet immobile, une robinet ou une boîte. Est-il possible d’apprendre un système qui puisse déduire une distribution à partir de ces objets immobiles pris sous un seul angle, puis extraire un espace de possibilités à partir de cette distribution ? Si vous lui donnez une robinet, il extrait des formes qui peuvent tourner ; si vous lui donnez une boîte, il extrait les états ouvert et fermé, ainsi que toutes ces différentes formes. Je vais rapidement évoquer la méthode concrète aujourd’hui, en respectant le temps de chacun. Mais le résultat est : dès que vous maîtrisez ce système, vous pouvez entrer dans une scène complètement nouvelle, sur un grand nombre d’objets différents, un modèle peut inférer les possibles interactions. Écrans, clés USB, fleurs, tout y est. De plus, les résultats que cela produit ne sont pas des réponses mémorisées à la lettre, mais utilisent l’élément le plus simple de la distribution que vous avez apprise : comment je peux encore aborder cet objet. Et dans le monde réel ? Un robot entre dans une pièce, sa perception est très sale. Donc nous avons fait encore une chose : demander à un étudiant d’utiliser l’iPhone pour scanner la pièce. L’iPhone peut effectivement effectuer un scan en 3D, mais sa précision n’est pas bonne ; les résultats sont très bruyants et très gros, comme des boules de pâte. Même si nous utilisons ces résultats très bruyants comme entrée pour notre système, vous verrez qu’il présente une certaine généralisation sans échantillon zéro : il peut raisonner sur la manière dont on peut interagir avec une machine à laver, un réfrigérateur ou un micro-ondes. Cela serait bien plus utile pour les robots. Parce que le robot entre dans une pièce que vous n’avez jamais vue, même si l’entrée est aussi grossière, il dira : « Je n’ai jamais vu ce robinet en particulier, mais je peux déduire différentes manières de m’y prendre, imaginer diverses méthodes d’interaction, puis utiliser cet outil pour trouver une stratégie. » Il en va de même pour le bureau : le résultat de la reconstruction est tout aussi encombrant, mais il peut déduire comment interagir avec un ordinateur portable. Cependant, cette déduction présente un problème. Il peut proposer quarante manières de interagir avec cet objet, mais vous vouliez atteindre un objectif donné, et vous ne savez pas quel des quarante moyens est réellement utile pour vous. C’est pourquoi nous nous demandons si l’on peut ajouter des conditions linguistiques à ce paradigme afin de le maîtriser mieux. Par exemple, j’ai une scène immobile, puis je donne une phrase en langage : « Un enfant saute sur la balançoire. » Est-il possible de générer une scène 3D ou 4D en mouvement ? Ainsi, il y a des interactions entre les personnes et les objets, avec les mouvements des enfants qui sautent dessus. Cela est beaucoup plus utile, car on peut ensuite se demander : comment le robot interagit-il avec cet objet ? On génère alors, on peut générer dans cette direction ou dans l’autre, puis on choisit celui qui véritablement aide à résoudre le problème. Comment faire ? Il faut encore compter sur de nombreux modèles de génération pré-entraînés. Dans ce travail, nous nous appuyons principalement sur les modèles de diffusion vidéo. Supposons que vous ayez un scénario statique, qui peut être très sale, dans n’importe quelle situation, vous pouvez le transformer en une représentation intermédiaire comprenant plusieurs milliers de points, puis vous pouvez ajouter une dimension supplémentaire, à savoir le temps. Ainsi, vous obtenez une représentation quadriédimensionnelle. Mais si vous transformez directement une représentation tridimensionnelle en quadratique, elle reste statique ; comment la faire bouger ? Il y a une solution. Si vous avez seulement une forme statique et que vous voulez la rendre plus réaliste, il existe une technique appelée sampling de distillation fractionnée (SDS). Dans le domaine classique en trois dimensions, on procède ainsi : on rend visible cette forme, on obtient des vidéos sous différents angles, puis on les soumet à un modèle de diffusion vidéo pour l’actualiser dans le sens du temps. La même chose peut être faite en quatre dimensions. En pratique, c’est très difficile ; il faut trouver des solutions pour une multitude de problèmes et concevoir des structures de données adaptées aux représentations en quatre dimensions. Mais conceptuellement, on utilise simplement les modèles vidéo et les modèles de diffusion pré-entraînés pour guider l’opération, afin de créer des séquences d’interactions entre des personnes ou des objets réels, ou entre des robots et des objets. Prenons deux autres exemples. Par exemple, si vous avez un bloc de briques et que vous ajoutez la phrase « Le robot est en train de prendre le bloc de briques », il produira une séquence d’interaction où le robot prend le bloc de briques. Ainsi, vous verrez comment cette interaction se déroule sous des conditions linguistiques différentes. Vous pouvez également ajouter quelques démonstrations gratuites pour apprendre des compétences à partir de ces démonstrations gratuites. Avant, il fallait d’abord avoir des vidéos de manipulation humaine ou des données de téléopération pour apprendre des compétences et les intégrer dans un plan de formation ; maintenant, je peux même ne pas avoir de démonstration humaine, je produis moi-même des démonstrations, puis j’apprends des compétences à partir de ces démonstrations, et après avoir appris, je les restitue dans le cadre de formation original. Ce n’est pas obligatoirement destiné aux robots. Un ballon de basket qui rebondit sur le panier, un chat qui saute sur un coussin : tout cela est possible. Mais nous l’avons effectivement utilisé sur les robots. Par exemple, avec un tissu. Vous dites : générez une séquence où l’homme interagit avec ce tissu et le déplie. À gauche, c’est le résultat généré. Comme il est généré, vous obtenez un ensemble de démonstrations gratuites, et vous pouvez obtenir des points sur la surface qui suivent une trajectoire dense en trois dimensions, en étant suivis dans les trois dimensions au fil du temps. Ces éléments constituent alors un ensemble d’objectifs de surveillance gratuits, permettant au robot de savoir : je veux que cet objet se déplace ainsi. À droite, c’est le robot réel qui tente de faire la même chose. Partant de l’imagination, en utilisant un modèle de diffusion pour vous guider, et en prenant sa sortie comme objectif de succès, vous apprenez une stratégie pour faire cela. Un autre exemple est le fermeture de l’ordinateur portable. Récemment, nous avons également travaillé sur quelque chose : rendre l’appareil beaucoup plus rapide. Car dans ce type de méthodes, tant que vous avez affaire aux unités de diffusion, c’est lent, et le distillation des fractions en quatre dimensions est encore plus lente. Nous avons donc utilisé le cache et le rendu sémantique, afin d’augmenter la proportion d’actualisations réussies, sans avoir à appeler le modèle vidéo si fréquemment. De cette manière, vous pouvez générer des séquences de présentation plus longues. Avant, je générais peut-être une seule démonstration : le robot prend des briques ou ferme un cahier, ce qui permet d’apprendre des compétences atomiques. Maintenant, ce n’est pas encore un robot, mais il n’y a aucune raison pour que ce ne soit pas un robot. On peut générer des séquences complexes de longue durée, et faire des choses complètement différentes. Ainsi, on obtient non seulement une démonstration gratuite de compétences atomiques, mais aussi une démonstration gratuite de problèmes d’opérations de longue durée complexes, offrant presque des données illimitées pour la formation de vos compétences. Bon, je m’arrête ici.05
La structure n’est pas la réponse, c’est un échafaudage
En repensant à cela, nous avons toujours parlé de la manière d’identifier ces représentations structurées. Vous verrez que, au fil du temps, il y a de plus en plus de telles choses. Maintenant, presque chaque composant est disponible, mais vous conservez encore cette couche de représentation intermédiaire. Elle existe maintenant à peu près sous forme de langage, et bien sûr, derrière elle se trouve une représentation de scène, ce qui rend l’ensemble explicable.Nous avons également toujours réfléchi à la manière de le rendre plus universel, afin de ne pas être liés aux objets existants ou aux démonstrations existantes.
Concernant le terme « structure », je voudrais ajouter quelque chose. Lorsque quelqu’un parle de structure, il est facile de le comprendre comme une autre chose : on essaie d’imposer la structure dans son système de manière rigide. Cela n’est pas bon, et ce n’est pas ce que nous faisons. Nous pensons à savoir si cette interface peut aider le système à fonctionner plus efficacement ; elle agit comme un étage extérieur, tout en permettant aux humains de communiquer avec lui. Fondamentalement, vous utilisez ces données enrichies en modalités, en particulier les vidéos, ainsi que le langage, et les informations tridimensionnelles et quadridimensionnelles dont vous disposez. Mais au final, ce qui vous importe encore est une autre chose : comment ces représentations structurées nous permettent-elles de raisonner. Vous avez des représentations à l’échelle atomique ; je les nettoierai, je les mettrai en œuvre, je ferai ces choses. Ensuite, quelle est la relation de dépendance entre ces tâches, et quel est leur impact ? C’est cela qui vous permet de résoudre les problèmes à long terme, et ce, d’une manière très généraliste. Merci tout le monde.Pour faciliter les échanges entre tous et la transmission des informations sur les réunions, nous avons créé spécialement le IROS 2026 Groupe de communication pour les participants! Entrer dans le groupe vous permettra d’activer ces « avantages » ?
Station d’information de conférence : soumissions DDL, normes de format, avancement de la revue… Les points clés sont communiqués en temps réel, vous n’aurez plus peur de manquer le délai, les préparations des soumissions sont assurées.
Rencontre de collègues : tous les collègues du monde entier sont dans le groupe. On discute des expériences, on échange des idées et on développe des relations. Nous partageons le même chemin en recherche scientifique.
Station de ravitaillement de pointe : dernières découvertes scientifiques, tendances en temps réel, combinées au thème de la conférence pour vous aider à clarifier le cadre de votre contribution, et pour donner des idées originales aux articles.
Comité de soutien en direct : (activé uniquement pendant la réunion) :On n’a pas besoin de paniquer une fois arrivé au lieu de la réunion —
Navigation de itinéraire : Distribution des salles, comment se rendre au salon de rapport, demandez-le en groupe à tout moment ;
Lecture collective sur le sujet : Sessions populaires, discussions Keynote, on peut revoir tout cela même si on manque de temps ;
Poster compilation : résumé des posters de scène, sauvegarde en un clic sans oublier rien ;
Place Yaoujú : réunions de repas, bureaux d’interviews, bureaux de communication… Si vous voulez discuter, collaborer ou rencontrer quelqu’un, il suffit de lancer une action dans le groupe.
? Portail d’entrée du groupe : Scannez le code pour rejoindre le groupe ou ajoutez WeChat Luyoyo_2026, mentionnez : ECCV + unité/école + nom + domaine.
Pour la recherche scientifique ou les technologies, la différence d’information est très importante.
Viens, prenons l’avantage !
Monte dans la voiture, je t’emmènerai découvrir l’essence des conférences majeures d’IA au monde
Accès exclusif :
PowerPoint pour conférence d'expert
Rapport complet de la conférence
Interprétation des articles de recherche populaires
Entretien avec la nouvelle étoile académique
Scannez le code QR ci-dessus
Ou cliquez sur « Lire l’article » pour suivre la section spécifique.
Article original de Leifengwang, ne pas reproduire sans autorisation. Pour plus d'informations, veuillez consulter les consignes de reproduction.