量子位

0,2 seconde arrêt brusque, réorganisation en secondes !因果智能 entre dans le monde réel

C’est un robot qui est resté en suspension de manière urgente lorsqu’il fermait la porte du micro-ondes, à cause d’une main qui est soudainement entrée.

Source de l’image · 量子位

Jay envoyé depuis le temple concave

Quantum Bit | Chaîne publique QbitAI

0,2 secondes.

C’est le moment où un robot s’arrête brusquement en suspend lorsqu’il ferme la porte du micro-ondes, à cause de quelqu’un qui entre en coup de vent.

Il y a aussi des choses plus intéressantes.

Lorsqu’un canette métallique est mélangé dans un plat de gâteau et porté vers le micro-ondes, le bras mécanique le sort d’abord et le place sur le côté, puis, après s’assurer que le plat est sûr, il l’introduit dans le chauffe-plat.

Pour être honnête, en regardant ces quelques démos, j’ai été un peu stupéfait.

Les amis qui se concentrent sur les robots avec un corps devraient avoir compris que, aujourd’hui, de nombreux robots semblent très cool, mais la plupart du temps, ils sont simplement incompétents. Dès que la lumière change, quelque chose est frappé, ou les instructions expriment une intention implicite, le robot tombe immédiatement dans l’erreur.

Mais même si vous faites comme dans la vidéo, allumant frenétiquement la lampe de poche devant les yeux du robot, celui-ci reste indifférent...

Cependant, ces images de tout à l’heure ne sont ni des répétitions d’actions enregistrées à l’avance, ni une corrélation statistique obtenue par hasard.

Face à des perturbations imprévisibles successives, le système a inféré en temps réel cette série d’actions en se basant sur la compréhension des lois de causalité du monde physique.

Le système qui pilote ce robot s’appelle CRIS-0.

Derrière cela se trouve l’entreprise de intelligence causale fondée par Huang Biwei, professeure associée à l’Université de Californie à San Diego (UCSD) et membre de la школe des causalités au CMU.

Aether AI.

Il y a trois mois, Qwantix avait rapporté la voie de l’intelligence causale choisie par cette entreprise. À l’époque, beaucoup pensaient que l’IA causale se trouvait encore dans les formules mathématiques et les expériences de pensée.

Aujourd'hui, Aether AI a présenté la démo officielle.

Adieu au « bruit » mécanique : les robots apprennent à comprendre les causes et les effets

Dans les scénarios d'implémentation des robots embarqués, ce qui cause le plus de problèmes aux ingénieurs n'est jamais les processus standard, mais les accidents omniprésents.

Les robots traditionnels, face à des perturbations imprévues, répètent mécaniquement les coordonnées anciennes, ce qui entraîne des collisions, ou bien renvoient une erreur et s’arrêtent complètement ; en revanche, les modèles noirs de bout en bout, lors de tâches longues comprenant plusieurs dizaines d’étapes, sont particulièrement sujets à des erreurs cumulatives, et un simple écart dans une étape peut entraîner l’échec de toute la tâche.

La solution de rupture offerte par CRIS-0 est le « cause et effet ».

Laissez le robot passer de « ce qu’il voit » à « comprendre pourquoi cela se produit et quels changements peuvent influencer les résultats ».

Regardons d’abord le bulletin scolaire.

Dans le test de préparation du café face à des interférences externes imprévues, le robot rencontre une déplacement artificiel et des variations de lumière lors de la prise en charge de la machine à café. CRIS-0 reconnaît les changements des variables causales en 2 secondes en moyenne et effectue un replanning en temps réel, réussissant 9 récupérations efficaces sur 10 perturbations aléatoires.

Et ce n’est pas un redémarrage complètement du début pour de raison purement aveugle.

La machine à café a été poussée, et le système traque la variable de cause et effet clé « position relative du poignet ». Lorsqu’il constate un décalage dans l’état de cette variable, il ne fait que corriger les phases d’action de proximité et de saisie, sans avoir besoin de revenir en arrière pour redémarrer.

L’élimination des interférences n’est qu’une base essentielle ; dans les missions autonomes à longue distance, l’avantage du mode de démarrage par causalité se manifeste de manière plus complète.

Dans une tâche continue comprenant plusieurs dizaines de étapes, comme « Recherche et rangement dans le salon », le système décompose l’objectif à long terme en phases causales atomisées et vérifiables, effectuant des vérifications des conditions préalables et postales à chaque étape.

Plus intéressant est le capacité de raisonnement par l’intuition et de perception physique que montre CRIS-0 :

Lors de la mise en ordre de la table de nuit, il range les livres ordinaires éparpillés sur le meuble, mais conserve les factures impliquant des informations personnelles dans un tiroir ;

Face à deux boîtes de boisson ayant une apparence similaire, elle d’abord perçoit le poids du récipient et l’état du liquide à l’intérieur par des mouvements de saisie, puis, après s’être assurée qu’il s’agit d’une boîte vide, elle la jette dans la poubelle. Quant aux boissons non terminées, elle les repose calmement à leur place originale.

Enfin, face à des besoins flous, la causalité peut considérablement améliorer la généralisation du prompt, permettant ainsi une capacité d’interprétation personnalisée.

Dans les tests Personal Pick and Place, face à 20 instructions floues nécessitant une inférence, telles que « Apporte-moi une bouteille de boisson adaptée pour la course matinale », le système a obtenu 18 captures et plaçages précis.

Il ne se fie pas sur la mémorisation de mots-clés pour tenter sa chance, mais en combinant le temps, l’état de l’utilisateur et le contexte environnemental, il extrait comme variables causales cachées « avoir besoin d’énergie après l’exercice et éviter les aliments riches en sucre », puis matche automatiquement les actions correspondantes.

Derrière ces Demos, quelle est donc l'architecture technique qui sous-tend ?

Déconstruction CRIS-0 : transformer la boîte noire en moteur de cause et effet

Avant de répondre à cette question, peut-être devrions-nous d’abord clarifier une autre question —

Pourquoi les robots d’autrefois semblaient-ils toujours « stupides » ?

Le monde physique et le monde purement numérique sont deux choses complètement différentes. Dans un ordinateur, on écrit du code ou on discute, et on peut revenir en arrière si on se trompe. Mais dans le monde réel, la friction, la gravité, les collisions, les changements de lumière – toutes sortes de situations imprévues se produisent toutes les secondes.

Les modèles traditionnels de type end-to-end, comme le programme VLA, apprennent rapidement, mais ils présentent une faiblesse fatale lorsqu’ils sont confrontés à des tâches complexes, à savoir l’accumulation des erreurs.

Étape 1 présente une petite erreur, l’erreur augmente à l’étape 2, et à l’étape 10, l’ensemble de l’action pourrait être complètement déformée. Plus grave encore, lorsqu’un modèle de boîte noire unique rencontre une interférence, il ne sait pas exactement ce qui se passe, et il ne peut souvent que continuer à presser selon le plan initial, ou bien écraser directement pour arrêter.

Et un autre type de solution d’agent courant, bien qu’il divise les étapes, sa logique de pensée reste essentiellement au niveau de la raisonnement probabiliste en texte pur ou dans des modèles de grande taille multimodaux.

Chaque fois que l’environnement change, il doit d’abord convertir l’image en texte, pendant que le modèle réfléchit lentement « quelle est la prochaine étape ». Une fois que vous avez terminé de raisonner, votre main pourrait déjà avoir été écrasée par la porte...

Quel est donc le mécanisme derrière cette résistance aux interférences et cette cohérence que présente CRIS-0 ?

Aether AI a conçu une nouvelle logique :

Architecture d’agent origine-causal.

On peut le comprendre selon trois dimensions —

1. La tâche est l’état : extraire les variables causales physiques

C’est la première principale que je considère comme la plus importante.

Dans le système CRIS-0, il y a un changement très fondamental appelé état unifié et variables causales.

Les robots d’autrefois regardaient le monde à travers des pixels d’images très densément empilés. Mais aux yeux de CRIS-0, ce qui les intéresse n’est pas comment la surface du monde ressemble, mais plutôt à quel stade en est l’exécution de la tâche. La tâche elle-même constitue un barreur de progression d’état causal.

Par exemple, un cas particulièrement concret : un robot qui déplace des nappes de table.

Il ne calculera pas stupidement les coordonnées de chaque pixel du tapis, mais suivra en temps réel quelques variables causales clés. Par exemple, si le tapis est vraiment saisi par les griffes, à quelle distance les coins du tapis se trouvent par rapport à la position cible, et s’il y a ou non un glissement lors de la traction.

Dès que la capture se détache, le système comprend immédiatement que la variable causale « saisir » n’est pas satisfaite. Alors l’état de la tâche retourne directement à l’étape de récupération, plutôt que de tout annuler et recommencer, ou de continuer aveuglément à tirer de l’air en arrière.

Dans les tests d’interférence de la préparation du café publiés officiellement, face à des scénarios frustrants tels que les déplacements répétés de la machine à café et les changements brusques de lumière, le système reconnaît en moyenne les changements des variables clés en 2 secondes et effectue une replanification, réussissant à restaurer efficacement 9 fois sur 10 perturbations externes.

C’est la puissance des variables causales : en cas d’erreur, elle sait clairement où se trouve l’erreur et à quel point de devoir revenir en arrière.

2. Interface des outils unifiés : refuser une seule stratégie qui gère tout

Comment ce système exécute-t-il spécifiquement l’Action ?

Réponse : Tool Call, chaque outil a sa propre fonction.

Dans sa structure, il y a un Planner chargé de la planification globale, qui supervise une boîte à outils complète, permettant l’intégration de plusieurs modules via l’interface Unified Tool.

Fonctions de mouvement basées sur des règles : combinant la localisation visuelle et l'inversion du mouvement, elles résolvent efficacement les déplacements spatiaux étendus et les positions précises.

Modèles de stratégie de compétences (Policy models) : spécifiquement conçus pour aborder des opérations à contact complexes telles que le débordement d’eau et la capture précise.

Module de navigation (SLAM) : responsable de la direction du chemin global ;

Vérifiants (Verifiers) : effectuent des vérifications physiques à chaque nœud de phase ;

Modèle de monde causal (CausalWM) : est responsable de déduire les conséquences physiques d’une action.

Dans ce cas, la clé principale est bien ce modèle du monde causal.

De nombreux amis, lorsqu’ils parlent de modèle du monde, ont pour première réaction de générer une vidéo réaliste pendant quelques secondes. Mais dans CausalWM de CRIS-0, l’attention est davantage portée à l’impact des actions sur l’environnement.

Sa logique est la suivante : d’abord examiner l’état actuel, ensuite prédire quelles variables causales seront modifiées par les actions candidates, et enfin déduire l’état futur.

En d’autres termes, avant que le robot ne tend la main, son cerveau est déjà en train de calculer les conséquences, par exemple : si je fais ça, la main se tordra-t-elle ? La tasse se renversera-t-elle ?

Il s’agit d’une étape supplémentaire de « répétition ». Le système teste d’abord dans le modèle mondial comment les variables causales physiques se développeraient si je exécutais l’action B, puis, après vérification que l’objectif est atteint, il appelle Action Head et envoie les commandes de contrôle au niveau inférieur.

3. Cycles structurés et sécurité native intégrée

Et tout cela se répète en boucle dans le Loop.

Face à des tâches complexes, le Planner décompose les objectifs majeurs en plusieurs étapes. D’abord, il utilise une fonction de règles pour déplacer rapidement les pinces près du objet visé, puis il applique un modèle de stratégie afin d’obtenir une prise précise. Les problèmes complexes qui étaient auparavant difficiles à résoudre avec un seul modèle sont désormais divisés en plusieurs étapes très définies et fiables.

En particulier, il s’agit d’un graphique de tâches en évolution dynamique : Identification de l’état → Sélection des outils → Exécution → Vérification → Ajustement.

À chaque étape réalisée, le vérifieur vérifie immédiatement si les conditions physiques sont remplies. Si ce n’est pas le cas, le système dispose d’un mécanisme de récupération en trois niveaux clair : on détermine d’abord si une répétition peut être effectuée directement à cette étape ; si non, on reporte la planification du chemin ; et seulement en dernier recours, un avertissement est affiché indiquant qu’une intervention humaine est nécessaire.

Dès qu’un ajustement accidentel réussit, ce chemin de restauration réussie sera enregistré et accumulé dans le diagramme de tâches. La prochaine fois, lorsqu’une situation similaire se produira, il sera plus habile.

Cela explique également pourquoi, dans la tâche de mise en ordre à long terme de cette salle de séjour, il peut exécuter des dizaines, voire des centaines de étapes sans casser.

Parce qu’à chaque pas, il vérifie l’état de cause et d’effet, les erreurs sont résolues sur place dès leur apparition, sans aucune chance de se propager comme une boule de neige et entraîner une panne globale.

De même, c’est aussi pourquoi il peut effectuer une arrêt de sécurité en 0,2 seconde.

Dans CRIS-0, le jugement de sécurité est intégré directement dans chaque phase causale.

À l’étape de fermeture des portes, les personnes qui apparaissent soudainement constituent une variable dangereuse qui compromet la sécurité des utilisateurs. Le système peut capturer instantanément et déclencher le blocage de priorité maximale en 0,2 seconde.

Mais si la tâche actuelle est de donner une tasse d’eau à l’humanité, alors la main tendue est la variable cible de l’interaction, et le système ne se mettra pas en panne.

En réalité, les capacités système que présente CRIS-0 ne viennent pas de nulle part ; elles reposent sur une base de recherche solide.

Dans l’évaluation des capacités d’Agent, le cadre d’intelligence causale de Aether AI RSIAgent a obtenu un score partiel de 78.98% sur OSWorld 2.0. Sans mettre à jour les paramètres du modèle, il a permis d’améliorer les capacités d’Agent des modèles open source, dépassant ainsi les modèles closed source tels que GPT-6 Astra.

Sa première version du modèle de monde causal CausalWM a également atteint la première place sur le TriWorldBench, qui est le standard pour les modèles de monde robotiques, obtenant le Top-1.

Et ces deux couches constituent les principaux contributeurs de cette démo.

De plus, deux autres projets sont également en cours de développement – l’architecture neuronale modulaire : chaque module correspond à un mécanisme de causalité différent, et peut être combiné ou remplacé ; Causation Transformer : apprendre les relations de causalité plutôt que les dépendances statistiques.

Le monde physique ne croit pas en la mémorisation passive

À ce point, nous pouvons en fait sortir du démo spécifique du robot et jeter un coup d’œil plus profond.

Pourquoi les gens parlent-ils de plus en plus souvent de l’intelligence causale actuellement ?

Honnêtement, l’explosion des grands modèles de langage au passé a été, dans une large mesure, due à la chance. Ancien, le langage est un mode de communication hautement symbolisé et abstrait par l’humanité. De nombreuses logiques et règles ont déjà été résumées par les humains sur la surface du texte. Il suffit de réaliser des miracles en utilisant fortement l’ajustement statistique lié aux probabilités.

Mais le monde physique ne suit pas cette logique.

La friction ne change pas parce que vous avez lu cent mille articles, et la gravité ne disparaît pas soudainement à cause des statistiques de probabilité. Dans un monde réel plein de dynamiques complexes, compter uniquement sur des corrélations superficielles pour l’adaptation finira par heurter le plafond de la loi de scalage.

En l’absence d’une quantité insuffisante de données physiques, pour créer des systèmes capables de faire face à des environnements physiques complexes, le modèle doit apprendre à agir comme un scientifique humain, afin de déduire des mécanismes causaux fondamentaux à partir d’une petite quantité de données, et comprendre comment les actions peuvent changer le monde.

Cette compression structurée selon le principe primaire de « causalité » est peut-être la loi de scaling native de l’ontogenèse.

Bien sûr, cette voie est extrêmement difficile à parcourir. Les exigences en matière de découverte des causes et de apprentissage de représentations causales pour la théorie mathématique et statistique sont très élevées ; il y a très peu de groupes dans le monde qui combinent à la fois une solide expertise théorique et des compétences pratiques en ingénierie.

Aether AI ose se lancer dans cette initiative, en grande partie liée à son contexte académique unique.

Huang Biwei a travaillé dans ce domaine pendant plus de dix ans. Elle suit les enseignements de Clark Glymour, fondateur de l’école des causalités de CMU, de Peter Spirtes, ainsi que des chercheurs de la deuxième génération, Bernhard Schölkopf et Kun Zhang. Elle fait partie des héritiers clés de l’école de la découverte des causalités.

Le cadre théorique de l'école des causes et effets à trois générations s'est finalement transformé en les piliers techniques fondamentaux de l'Aether AI d'aujourd'hui.

De l’accumulation de théories de l’Université de Carnegie-Mellon et du Max Planck, à la présentation concrète de CRIS-0 sur un bras robotique réel, l’intelligence causale a enfin franchi une étape clé vers le monde physique.

Lorsqu’un système possède réellement la capacité d’extraire les variables causales, de modéliser la dynamique du monde et de raisonner sur les conséquences avant d’agir, ses applications ne se limitent pas seulement à aider les gens à fermer un micro-ondes ou à boire une tasse de café.

Regarder plus loin, de la prédiction des tendances dans les systèmes dynamiques complexes aux découvertes scientifiques dans les domaines des matériaux et de la biologie, il est possible que cette logique puisse être utilisée.

Grande époque, mes amis.

Nous espérons constamment que l’IA pourra vraiment sortir du cadre de la conversation purement numérique et se fixer solidement dans ce monde physique réel, complexe et plein d’inconnu.

Et la causalité, peut-être est-ce cette clé la plus importante.

— Fin —
Quantum Bit QbitAI · Contrat avec le compte principal
Suivez-nous pour être informé en temps réel des tendances technologiques avancées

 

Source originale

量子位

À propos du contenu

La publication originale et les droits appartiennent à la source.

Traduction automatique · Consultez l’original