Auteur | Deng Zhemin
Édition | Qi Cengyǒu
Avez-vous déjà pensé que les robots pourraient entrer dans les ateliers et fabriquer eux-mêmes les pièces nécessaires à la construction d’un robot ? Cela semble être une plaisanterie, mais en réalité, c’est le problème le plus complexe de l’intelligence dotée d’un corps. Les articulations, les mandris et les composants complexes des robots sont tous produits par l’usinage progressif sur des usines CNC (Contrôle Numérique par Ordinateur). Si les robots peuvent prendre soin de ces machines de manière autonome, en saisissant, chargant, insérant, retirant et plaçant les pièces, alors l’industrie des robots sera nourrie par eux-mêmes : plus de robots, plus de capacité à fabriquer des robots, moins de coûts, créant ainsi un boucle de rétroaction positive. Mais réaliser cela est bien plus difficile que prévu. Les pièces nécessaires pour fabriquer des robots sont en effet les plus exigeantes en termes de précision : l’espace entre la pièce et le mandris ne dépasse souvent que 0,5 millimètre ; les surfaces métalliques brillantes, les formes presque sans texture, et les pièces très similaires se posent tous des défis pour la vision, le toucher et la précision totale du robot. Même les démonstrations les plus belles en laboratoire doivent passer d’abord par ces trois obstacles : la tolérance, le rythme, la fiabilité. Le 29 septembre 2026, à Pittsburgh, aux États-Unis, lors de la conférence IROS 2026, un Tech Talk a répondu directement à ce problème : comment faire en sorte qu’un robot prenne soin de deux machines CNC de manière autonome, accomplissant toutes ces opérations avec un espace de 0,5 millimètre, et entraîné uniquement sur 600 trajets réels de robots. Le conférencier est Feng Zongbao, responsable de l’apprentissage par renforcement à la puissance simple. Ce n’est pas simplement une démonstration technique, mais aussi une réponse à la question de savoir comment la précision du laboratoire se transforme en précision industrielle. Voici le texte abrégé de la conférence de Feng Zongbao lors de IROS 2026, établi sur la version anglaise de la présentation en direct, et réorganisé par Leifeng Network (chaîne officielle : Leifeng Network) pour ne pas changer le sens original, tout en reformulant les expressions orales et les termes techniques.
▎Du laboratoire à l’usine : Pourquoi la manipulation d’un tour CNC dans le monde réel perturbe les pipelines d’apprentissage des robots actuels
Conférencier : Feng Zongbao, responsable de l'apprentissage renforcé chez Simplexity Robotics01
Créer des robots avec des robots
Cette présentation commence par un objectif de fabrication : fabriquer des robots avec des robots. L’opération CNC peut sembler simple, mais pour qu’elle soit stable et fiable dans une usine réelle, c’est une question complètement différente. Elle révèle la large brèche entre le succès des tests de référence en laboratoire et la précision à l’échelle de l’usine. Aujourd’hui, je montrerai comment nous nous efforçons de combler cette brèche. SimpleClaw Power est une société de intelligence déployée sur toute la stack. Nos modèles multimodaux développés par nous-mêmes unifient la compréhension et la génération ; un système de roue à données en boucle fermée nous permet de perfectionner ces modèles sans cesse ; une plateforme matérielle modulaire unifiée permet leur fonctionnement sur des robots réels ; la plateforme SimpleClaw offre aux développeurs une plateforme ouverte pour construire et déployer des applications robotiques. Sur le côté matériel, nous avons quatre lignes de produits. i7 Pro est notre robot à roulettes, iX est notre robot à roulettes humain. Nous proposons également deux configurations de bras mécaniques contrôlés par force modulables, présentés ici avec les mains flexibles Dexter et les pinces respectives. Enfin, nos gants de collecte de données nous permettent de collecter en masse des démonstrations humaines, fournissant ainsi des données pour l’apprentissage des robots. Ainsi, notre méthode relie trois éléments : notre développement complet sur toute la stack, du matériel au logiciel et aux modèles ; les gants de collecte de données rendent possible la collecte en masse de démonstrations humaines ; les modèles multimodaux unifient la compréhension et la génération. L’objectif est d’en tirer davantage de connaissances et d’élever le niveau de capacité des robots dans les opérations CNC précises. Cette présentation se concentre sur trois méthodes complémentaires : SimpleWAM génère des segments d’actions à partir d’observations multimodales ; DRAM, c’est-à-dire la mémoire associée à cycles de règles Delta, traite le contexte à long terme avec une matrice de mémoire de taille fixe ; DPE évalue les actions candidates avec un évaluateur entraîné séparément, tout en maintenant la stratégie figée. Ensemble, elles résolvent respectivement les problèmes de génération d’actions, de mémoire et de choix d’actions dans notre système CNC.02
Difficultés de la usine réelle
C’est le problème de l’usine que nous devons relever. Notre objectif est de fabriquer des robots par des robots, et les opérations CNC de précision en sont un exemple. Pourquoi est-ce difficile ? Premièrement, l’espace entre la pièce et le mandrin n’est que de 0,5 millimètre, sans aucun espace pour une erreur d’alignement. Deuxièmement, les surfaces réfléchissantes, les textures faibles et les pièces ayant des formes similaires rendent l’alignement visuel difficile. Troisièmement, le robot doit effectuer une série d’actions dans un espace de travail limité, et les interfaces de contact clés ne sont pas toujours visibles. Par conséquent, le système doit maintenir une précision constante tout au long de la tâche, même si les informations visuelles sont incomplètes. Ces contraintes CNC ont façonné notre architecture : la texture faible exige un encodeur visuel suffisamment puissant ; la proximité à longue distance nécessite plusieurs points de vue fournis par les caméras de tête et de poignet ; le contact précis requiert des conditions conditionnées pour la perception proche. Ainsi, les entrées visuelles, linguistiques et d’état sont converties en tokens. SimpleWAM fournit un squelette multimodal et l’action DiT. Nous insérons un module DRAM entre les deux pour compléter le contexte historique au-delà de l’observation actuelle. L’action DiT propose des fragments d’actions candidates, et DPE évalue ces candidates avec un évaluateur entraîné séparément, tout en maintenant le proposeur d’actions entraîné reste constant. Les fragments d’actions sélectionnés sont ensuite transmis à i7 Pro.03
Plan d'action spécifique
SimpleWAM est notre modèle unifié d’actions dans le monde. Son concept est le suivant :Apprendre de la supervision future abondante pendant l'entraînement, prédire directement l'action lors de la raisonnement。Pendant la phase d’entraînement, les vidéos DiT, 3D DiT et Action DiT, sous la direction des instructions de tâche, reconstruisent conjointement les frames de vidéo futurs, l’état 3D et les segments d’actions, permettant au modèle d’apprendre simultanément la dynamique visuelle, spatiale et motrice. Pendant la phase de raisonnement, nous ne fournissons que l’image actuelle, l’état 3D actuel et les instructions linguistiques, et le modèle produit directement les segments d’actions, sans avoir à générer de nouvelles images ou états 3D. Avant de procéder, nous extraisons séparément les caractéristiques, puis nous les fusionnons de manière adaptative. Un encodeur de gel partagé, qui conserve les tokens d’images denses provenant des caméras de la tête et du poignet ; ensuite, les requêtes sont lues indépendamment pour chaque vue, de manière que aucune vue ne supprime l’autre avant la fusion ; le gating est appliqué à chaque requête et à chaque canal de caractéristique, afin d’équilibrer le contexte global et les indices de mise en place locales. Enfin, l’histoire visuelle fusionnée avec un modèle DiT robuste et conditionné par l’état permet de prédire les segments d’action. Le diagramme d’attention sur la droite montre un effet de concentration plus fort sur les limites. Dans les tests déclarés de chaque méthode, la méthode de fusion a réussi 15 fois, contre 0 pour Query-concay et 8 pour la base π0.5 SFT. Pour agir de manière stable et continue au cours d’une tâche longue, le robot a besoin du contexte provenant des étapes précédentes. À cette fin, nous avons introduit le DRAM – Delta Rule Recurrent Associative Memory, pour intégrer cette capacité dans la stratégie du robot pré-entraîné. Ici, le noyau SimpleWAM gelé extrait des caractéristiques à partir de l’observation actuelle ; la DRAM lit d’abord ces caractéristiques pour lire l’histoire pertinente dans la mémoire ; l’action DiT combine l’histoire lue avec le contexte actuel pour générer des segments d’action ; ensuite, les règles Delta gérées par le gating mettent à jour la mémoire pour être utilisée dans la prochaine étape. La mémoire est une matrice associative de taille fixe, donc son espacement reste constant lorsque la tâche devient plus longue. DRAM peut être ajouté sans modifier l’architecture de base ni réentraîner les modèles, ce qui permet une intégration plus facile de la mémoire à long terme dans les stratégies existantes. Au cours du processus d’insertion précise, il est possible que la seule vision ne permette pas de déterminer l’état dans lequel le matériel entre en contact avec la mandrine. La force et le moment suffisent pour compléter ces informations de contact manquantes. Nous les utilisons à deux égards : d’une part, la proximité avec les conditions de perception permet d’ajuster les entrées d’état du robot, permettant à l’action DiT de prendre en compte les facteurs de contact lors de la génération de l’action suivante ; d’autre part, le contrôleur d’impédance en temps réel utilise le retour d’information en temps réel pour rendre l’exécution plus stable, et ajuste le mouvement en fonction des changements de contact. En combinant ces deux méthodes, il est possible de soutenir la restauration lors d’une insertion directe avec obstruction. Dans les tâches d’insertion de CNC de précision, cette combinaison a obtenu un taux de succès de 100 % pour les tâches. La pratique courante consiste à mettre à jour l’actuator en utilisant les retours de l’évaluateur, mais cela peut entraîner un dérive de la stratégie. Le DPE entraîne d’abord un actuator clone de comportement, puis utilise un évaluateur entraîné séparément pour noter les actions candidates lors du déploiement ; les rollouts réussis et échoués se mettent ensuite à jour uniquement avec l’évaluateur, formant ainsi un cycle fermé, tandis que l’actuator reste toujours figé sur le robot. Le DPE augmente la probabilité de succès du task et réduit le nombre d’étapes d’exécution.04
Exposition des résultats
Nous avons finalement réalisé un programme complet de fonctionnement pour une machine-outil CNC double à deux axes entièrement automatisée, équipée d’un robot unique. Le vidéo-démonstration principale montre le processus d’opération autonome du robot à cinq fois la vitesse normale, et illustre par plusieurs segments distincts trois étapes clés indépendantes : le prélèvement autonome de la pièce, l’insertion précise dans le mandrin, ainsi que le retrait et le placement de la pièce après la fabrication. Il est à noter que, tout au long du processus d’entraînement du modèle, nous avons utilisé seulement 600 trajectoires réelles de mouvement du robot comme données d’entraînement. Cela constitue également le point central de notre travail : transformer l’intelligence avec corps des tests de base en laboratoire en une application réelle dans des scénarios de fabrication industrielle à haute précision et à haute réalité.Pour faciliter les échanges entre tous et partager les informations des réunions, nous avons créé un groupe de discussion pour la participation à IROS2026 ! Y accéder vous permettra d’obtenir ces « avantages » ?
Station d’information de conférence : soumissions DDL, normes de format, avancement de l’examen… Les points clés sont transmis en temps réel, vous n’aurez plus peur de manquer la date limite, les préparations des soumissions sont bien établies.
Rencontre de collègues : tous les collègues de partout sont dans le groupe, pour discuter des expériences, échanger des idées et étendre leurs réseaux. Nous partageons le même chemin dans la recherche scientifique.
Station de ravitaillement avancée : dernières découvertes scientifiques, axes d’actualité synchronisés en temps réel. En combinant avec le thème de la conférence, elle vous aide à clarifier les aspects de votre contribution, et apporte des idées originales pour vos articles.
Comité de soutien en direct : (ouvert uniquement pendant la réunion) :Ne vous inquiétez pas lorsque vous êtes à l’événement –
Navigation de itinéraire : distribution des salles, comment se rendre au salon de rapport, demandez toujours dans le groupe ;
Lecture collective sur le sujet : Sessions populaires, discussions Keynote, on peut suivre même si on rate les événements ;
Poster compilation : résumé des posters de scène, stockage en un clic sans oublier rien ;
Place Yaoju : réunions de repas, bureaux d’interviews, bureaux de communication… Si vous voulez discuter, collaborer ou rencontrer quelqu’un, il suffit de lancer une action dans le groupe.
? Porte d’entrée pour rejoindre le groupe : Scannez le code pour rejoindre le groupe ou ajoutez WeChat Luyoyo_2026, mentionnez : ECCV + unité/école + nom + domaine.
Pour la recherche scientifique ou les technologies, les informations sont très importantes.
Viens, prenons l’avance ensemble !
Monte dans la voiture, je te ferai découvrir l’essence des conférences majeures en IA du monde entier
Accès exclusif :
PowerPoint pour conférence d'expert
Rapport complet de la conférence
Interprétation des articles de recherche populaires
Entretien avec la nouvelle étoile académique
Scannez le code QR ci-dessus
Ou cliquez sur « Lire l'article » pour suivre la section spéciale.
Article original de Leifengwang, il est interdit de le reproduire sans autorisation. Pour plus d'informations, veuillez consulter les consignes de reproduction.