量子位

L'équipe de He Kaiming a publié le framework multi-modi Harness

Harness visuel native des modèles multimodaux, disponible !

henry 发自 凹非寺

Quantum Bit | Publiqueur de compte QbitAI

Harness visuel native des modèles multimodaux, disponible !

Récemment, l’équipe de He Kai-ming a proposé dans son dernier article « VISTA : A Visual Harness for Reasoning in an Interactive World » un système de Harness entièrement visuel.

VISTA.

Il permet aux modèles multimodaux existants d’observer directement l’environnement, de conserver les images originales, et de revoir, agrandir et examiner les détails à tout moment lors de la raisonnement, sans avoir besoin de s’entraîner depuis le début.

Par rapport à la méthode traditionnelle d’abstraire l’environnement en texte ou en code, VISTA conserve les informations visuelles originales. Le modèle peut, en fonction des problèmes actuels, réintégrer les images vues par le passé dans le contexte, participant ainsi aux jugements et raisonnements actuels.

Sur la base de cette méthode, l’expérience visuelle devient le contexte auquel le modèle peut s’appuyer en permanence et être vérifié à plusieurs reprises, et les modèles multimodaux disposent également d’un socle naturel basé sur la mémoire visuelle.

En termes de évaluation, avec VISTA et Claude Opus 5.0, les 25 jeux publics de ARC-AGI-3 ont été terminés, et le score relatif à l'efficacité des actions humaines a atteint la note maximale 100. Le nombre d'actions utilisées dans les jeux est 57,4% inférieur à celui de la base humaine lors du premier jeu.

Changer en GPT-5.6 Sol, également avoir terminé toutes les épreuves, et atteindre une note de 99.

De plus, l’équipe a également testé cette méthode dans des jeux sur le navigateur, des labyrinthes et des jeux de connexion, et a identifié les tâches impliquant une interaction plus proche du monde physique comme domaine de recherche futur.

Comment est-ce fait ?

Scaffold naturel visuel

De ResNet, Mask R-CNN à MAE, l’apprentissage de perception visuelle et de représentation reste une ligne directrice dans les recherches de He Kaiming.

Cette fois, VISTA se tourne vers une nouvelle question : comment permettre au modèle d’accumuler, de conserver et d’utiliser l’expérience visuelle pendant une interaction continue ?

La réponse est Harness.

En novembre dernier, Anthropic a utilisé une tâche de programmation longue comme exemple pour montrer comment Harness aide les modèles à traverser plusieurs fenêtres de contexte et à poursuivre l’exécution des tâches.

En particulier, Harness enregistre les tâches non terminées dans une liste de tâches, et conserve les travaux accomplis dans des fichiers de progression et du code.

Ainsi, même lorsque le modèle entre dans une nouvelle fenêtre de contexte, il peut en lisant ces informations comprendre ce qui a été fait précédemment et ce qu’il doit faire ensuite.

La tâche complexe peut ainsi être exécutée par étapes, les résultats vérifiés, et le travail peut se poursuivre entre différents contextes.

On peut dire que ce Harness, qui conserve l’état des tâches principalement à travers du texte et du code, a contribué, dans une certaine mesure, au développement de cette vague d’capacités d’agents.

Cependant, dans un environnement réel, seulement une mémoire verbale ne suffit évidemment pas.

Car dès qu’on entre dans un environnement visuel réel, le modèle doit non seulement se souvenir de la position et de l’orientation des objets, mais aussi comprendre quelles sont les changements qui se produisent dans l’environnement avant et après chaque mouvement.

De plus, l’objet de modélisation, lors de sa première vue d’une image, ne sait pas toujours quels détails deviendront importants par la suite.

En même temps, il est également difficile de consigner complètement ces informations visuelles par une note écrite à l’avance, et encore plus de garantir que les informations enregistrées restent suffisantes lorsque le modèle effectue des tâches ultérieures.

Dans des benchmarks comme ARC-AGI-3, une approche existante consiste à convertir d’abord l’image en un réseau de texte composé de chiffres, puis à faire écrire au modèle un programme permettant de simuler les règles de l’environnement et de valider les actions envisagées.

(Note : ARC-AGI-3 est un ensemble de références de raisonnement visuel interactif. Aucun règlement de jeu ou objectif n’est fourni en amont ; l’agent doit observer et agir pour découvrir par lui-même comment passer le niveau.)

Mais le problème est que plus l’environnement est complexe, plus il est difficile de transposer complètement l’apparence d’un objet, les relations spatiales et les changements dynamiques en texte et en code. De plus, à mesure que l’histoire d’interaction s’allonge, les images antérieures seront progressivement exclues du contexte ou remplacées par des résumés textuels.

Ainsi, ici, la question de recherche de VISTA se transforme en :

Comment, sans entraîner de modèle de base supplémentaire, faire en sorte que l’agent vérifie à nouveau les informations visuelles qu’il a vues dans le passé lorsque nécessaire pour la raisonnement ?

Dès lors, VISTA met en œuvreChaque frame retourné par l’environnement est conservé tel quel en dehors du contexte, y compris les frames intermédiaires de l’animation pendant le processus d’action, et est récupéré à nouveau lorsque le modèle en a besoin.

Dans l’évaluation ARC-AGI-3, il permet de comparer les images à différents moments, de zoomer sur des zones spécifiques et d’examiner les indicateurs de orientation sur les petits blocs.

Dans ce cas, le modèle de enregistrement des notes textuelles reflète la compréhension actuelle, tandis que l’image originale est conservée comme preuve pour qu’il puisse la rejuster.

La recherche appelle ce mécanisme l’attention explicite sur l’histoire de l’interaction, et le modèle choisit quelles informations visuelles retournent dans le contexte en fonction des questions sur lesquelles on réfléchit.

Pour rendre cette option possible, le système doit conserver l’image originale et fournir des outils permettant de la récupérer et de la vérifier à tout moment.

Implémentation spécifique

Pour que le modèle puisse être sauvegardé et utiliser l’expérience visuelle passée, VISTA a conçu trois composants fondamentaux :

Observation visuelle, mémoire visuelle non endommagée et inspection visuelle active. Ces trois composants ont chacun une fonction spécifique : ils permettent respectivement à le modèle de voir clairement l’image, de conserver l’histoire, et de revoir les images si nécessaire.

Premièrement, c’est l’observation visuelle qui fournit la scène environnante au modèle.

Dans l’expérience ARC-AGI-3, VISTA agrandira les images officielles de 64×64 à 512×512 en image PNG, tout en conservant les couleurs, l’apparence et les relations spatiales des objets, permettant ainsi au modèle de observer directement l’environnement.

Ensuite, il y a la mémoire visuelle sans perte, qui est chargée de conserver les images que le modèle voit.

Après chaque action exécutée, VISTA conserve intégralement toutes les images retournées par l’environnement, y compris les frames intermédiaires de l’animation pendant l’action, et établit des indices en fonction du numéro de tour et du numéro de frame.

Ainsi, le modèle n’a pas besoin de déterminer à l’avance quelles informations méritent d’être mémorisées, mais peut conserver complètement l’expérience visuelle pour l’utiliser plus tard.

Enfin, l’inspection visuelle active est chargée de faire revenir le modèle sur les images historiques en fonction des besoins.

Avec l’outil d’inspection, le modèle peut spécifier un tour historique donné, afficher la scène correspondante, ou aussi couper et agrandir des zones particulières pour examiner les détails.

Si vous souhaitez savoir exactement ce qui a changé lors d'une opération donnée, le modèle peut également afficher plusieurs images par instantané, afin de comparer les variations avant et après l'action.

Tout le processus équivaut à installer sur le modèle un ensemble de documents visuels que l’on peut consulter à tout moment. Il ne se contente pas de voir l’environnement actuel, mais peut également revenir activement aux résultats d’observation passés, afin de fournir une base pour les actions futures.

À ce sujet, comment ces trois composants fonctionnent-ils concrètement ensemble ?

Conformément au processus d’exécution de VISTA, à l’ début de chaque tour, le modèle observe d’abord la scène actuelle et les actions disponibles, puis, en combinant l’expérience accumulée précédemment, il détermine l’état de l’environnement actuel et formule des hypothèses concernant l’action suivante.

Si les informations disponibles sont insuffisantes, le modèle peut appeler des outils, consulter des images historiques, agrandir des zones particulières, et même lire des données de pixels spécifiques afin de trouver davantage de preuves.

Après avoir trouvé des preuves, le modèle ne prend pas immédiatement des actions, mais prévoit d’abord quels changements cette opération pourrait entraîner.

Une fois les actions exécutées, comparez les résultats réels avec les prédictions, vérifiez si votre jugement est correct, et ajustez ainsi votre compréhension des règles du jeu.

Ainsi, en répétant ce processus, le modèle peut explorer l'environnement tout en accumulant de l'expérience durant une interaction continue.

Bien sûr, un seul fichier visuel ne suffit pas. Afin que le modèle reste cohérent pendant des tâches longues, VISTA a également introduit deux notes textuelles :

  • GUIDE.md : Enregistrer les règles et expériences réutilisables entre les différentes niveaux.
  • WORKING.md : Enregistre l’état du niveau actuel, le progrès et les plans futurs.

Lorsque le contexte approche de la limite supérieure, le modèle commence d’abord à organiser un résumé de transition, puis entre dans une nouvelle fenêtre de contexte pour continuer à exécuter la tâche. Les notes textuelles précédentes, l’historique des actions et les archives visuelles seront conservées.

Il y a aussi un design intéressant : bien que VISTA conserve complètement les images historiques, il ne met pas toutes les images dans le contexte du modèle.

Dans le plan complet, après chaque action exécutée, le cadre ne montre par défaut que la dernière image du modèle. Quant aux images intermédiaires durant l’action, elles sont toutes stockées dans un fichier visuel, et sont récupérées activement lorsque le modèle en a besoin.

Cela conserve ainsi l’information visuelle complète, tout en évitant que de nombreuses images historiques ne occupent continuellement l’espace du contexte.

Il est encore plus important que VISTA n’ait pas entraîné un nouveau modèle supplémentaire pour cela.

La compréhension de l’environnement, la planification des actions et le raisonnement sont toujours réalisés par des modèles multimodaux prêts à l’emploi, tandis que Harness est chargé d’exécuter les appels aux outils, de conserver l’histoire visuelle et de fournir les preuves nécessaires lorsque le modèle en a besoin.

En d’autres termes, VISTA ne modifie pas le modèle lui-même, mais la manière dont le modèle obtient, stocke et utilise les informations visuelles.

Vérification expérimentale

En plus de l’expérience mentionnée au début, l’équipe a également testé VISTA sur trois référents : GameWorld, AI GameStore et BabyVision, en couvrant des tâches telles que les jeux web, les labyrinthes et les connecteurs.

En utilisant le même modèle GPT-5.6 Sol, par rapport au framework de base officiel, VISTA a augmenté le taux de succès de 40.0% à 63.3% sur 170 tâches dans GameWorld ;

Parmi les 10 jeux de AI GameStore, la note globale est passée de 47.3 à 140.3, où la médiane humaine a été normalisée à 100 ;

Sur les 39 jeux de labyrinthe et de connexions choisis par BabyVision, la précision a augmenté de 41,0 % à 63,2 %. Cette dernière série de tâches ne contient que des images statiques, et le modèle peut améliorer son jugement en agrandissant certains éléments et en vérifiant les pixels.

Ces résultats montrent que la conservation de l’image originale et la possibilité pour le modèle de la revoir selon les besoins peuvent permettre d’exploiter davantage les capacités des modèles multimodaux existants.

Le même cadre VISTA nécessite peu de adaptation pour être utilisé dans différents jeux et énigmes, ce qui montre également son potentiel d’application dans de nombreuses tâches visuelles.

En conclusion, l’étude oriente les futurs tests vers des tâches qui s’approchent davantage du monde physique : permettre aux modèles de conserver, réexaminer et utiliser leur expérience visuelle dans un environnement en constante évolution, afin de décider de la prochaine action à entreprendre.

Introduction de l'auteur

Enfin, permettez-nous de présenter les auteurs de cet article.

Les trois premiers auteurs co-auteurs de l’article sont Qiushi Han, Hu Keya et Linlu Qiu. Les deux autres auteurs sont Cathy Wu et He Kai Ming.

Qiushi Han (Josh Han) est actuellement doctorant au Centre de recherche en gestion des ressources de MIT, sous la direction de Cathy Wu.

Hu Keya (Keya Hu) est actuellement doctorante au département d’ingénierie électrique et de sciences informatiques du MIT, sous la direction conjointe de He Kaiming et Jacob Andreas.

Elle a obtenu son diplôme de premier cycle à l’académie ACM de l’Université de Shanghai Jiaotong. Ses intérêts de recherche se concentrent dans le domaine intersection entre langage et vision, et elle espère développer des entités intelligentes qui soient plus efficaces en termes de données et plus capables de généralisation.

Linlu Qiu est actuellement doctorant au département d’ingénierie électrique et de sciences informatiques de MIT, ainsi qu’au laboratoire de sciences informatiques et d’intelligence artificielle, sous la direction de Yoon Kim et Jacob Andreas.

Ses domaines de recherche comprennent le traitement du langage naturel et l'apprentissage automatique. Il a mené des recherches au sein de Google Research et de Meta FAIR.

Cathy Wu est actuellement professeure associée au département de génie civil et d’ingénierie environnementale du MIT, ainsi qu’au Institute for Data Systems and Society. Elle étudie comment améliorer des systèmes complexes tels que les transports grâce à l’apprentissage automatique et à l’apprentissage renforcé.

Elle a obtenu un master en sciences et ingénierie au MIT, puis un doctorat à l’Université de Californie à Berkeley.

He Kai-ming est actuellement professeur associé à vie au département d’ingénierie électrique et de sciences informatiques du MIT, ainsi que principal auteur de travaux tels que ResNet, Mask R-CNN et MAE.

Il a obtenu son master à Tsinghua University et son doctorat à l’Université chinoise de Hong Kong. Il a travaillé pour les Research Institute of Microsoft Asia et FAIR, avant de rejoindre le MIT en 2024.

Lien de référence
[1]https://arxiv.org/pdf/2610.02200

 

Source originale

量子位

À propos du contenu

La publication originale et les droits appartiennent à la source.

Traduction automatique · Consultez l’original