量子位

Die Team von He Kaiming veröffentlicht das Multimodale Harness-Framework

Das visuelle Native Harness für Multimodale Modelle ist da!

henry 发自 凹非寺

Qbit | Public Account QbitAI

Das visuelle Native Harness für Multimodale Modelle ist da!

Kürzlich hat das Team von He Kai-ming in der neuesten Veröffentlichung „VISTA: A Visual Harness for Reasoning in an Interactive World“ ein visuelles, natives Harness vorgestellt.

VISTA.

Es ermöglicht den bestehenden Multimodalmodellen, die Umgebung direkt zu beobachten, die ursprünglichen Bilder zu speichern und bei der Inferenz jederzeit zurückzuschauen, zu vergrößern und Details zu überprüfen – ohne dass sie von Grund auf trainiert werden müssen.

Im Vergleich zu der traditionellen Abstraktion von Umgebungen in Wörter oder Code behält VISTA die ursprünglichen visuellen Informationen bei. Das Modell kann anhand der aktuellen Probleme die zuvor gesehenen Bilder erneut ins Kontext einbeziehen und an den aktuellen Urteilen und Schlussfolgerungen teilnehmen.

Auf der Grundlage dieser Methode wird die visuelle Erfahrung zu einem Kontext, in dem das Modell jederzeit aufgerufen und wiederholt überprüft werden kann. Das Multimodale Modell erhält außerdem eine natürliche Fundamentstruktur, die um die visuellen Erinnerungen errichtet wird.

Im Test wurde mit VISTA und Claude Opus 5.0 alle 25 öffentlichen Spiele von ARC-AGI-3 abgeschlossen, wobei die Score auf der Bewertung der menschlichen HandlungsEffizienz ein 100 erreichte. Die Anzahl der gespielten Spielaktionen war 57,4% niedriger als bei der ersten Spielung mit einem menschlichen Baseline.

Übertrügen auf GPT-5.6 Sol, ebenfalls vollständig durchgegangen, mit einer Punktzahl von 99.

Noch weiterhin haben die Teammitglieder diese Methode in Browserspielen, Labyrinthen und Verbindungsaufgaben getestet und beschlossen, Aufgaben mit einer stärkeren Verbindung zum physischen Weltbild als zukünftige Forschungsrichtungen zu betrachten.

Wie wird das erreicht?

Visuell native Sockel

Von ResNet, Mask R-CNN bis zu MAE ist die visuelle Wahrnehmung und das Representationslernen stets eine zentrale Forschungsrichtung von He Kai-ming.

Diesmal richtet VISTA seinen Blick auf eine neue Frage: Wie kann das Modell in ständiger Interaktion Anteile, Erfahrungen und Informationen im visuellen Bereich ansammeln, speichern und nutzen?

Die Antwort ist Harness.

Im November letzten Jahres zeigte Anthropic mit einer langen Programmieraufgabe, wie Harness Modelle dabei unterstützt, über mehrere Kontextfenster hinweg die Aufgabe kontinuierlich voranzutreiben.

Konkret führt Harness die noch nicht abgeschlossenen Aufgaben in einer Aufgabenliste auf und speichert das bereits erledigte Arbeiten in einem Fortschrittsfile und Code.

So kann das Modell, selbst wenn es in einen neuen Kontextfenster gelangt, durch das Lesen dieser Informationen erkennen, was zuvor geschehen ist und was als Nächstes zu tun ist.

Komplexe Aufgaben können dadurch schrittweise ausgeführt werden, die Ergebnisse überprüft werden und zwischen verschiedenen Kontextfenstern weiterarbeitet werden.

Man kann sagen, dass dieses Harness, das den Zustand von Aufgaben hauptsächlich durch Text und Code speichert, in gewissem Maße die Entwicklung der Agent-Fähigkeiten vorangetrieben hat.

Doch in der realen Umgebung ist nur eine Textmembran offensichtlich nicht ausreichend.

Denn sobald man in eine echte visuelle Umgebung eintritt, muss das Modell nicht nur die Position und Ausrichtung der Objekte im Gedächtnis behalten, sondern auch verstehen, welche Veränderungen in der Umgebung vor und nach jeder Bewegung stattfinden.

Undwenn das Modell zum ersten Mal ein Bild sieht, weiß es nicht unbedingt, welche Details später wichtig werden könnten.

Gleichzeitig ist es auch schwierig, diese visuellen Informationen im Voraus in einer Textnotiz vollständig festzuhalten. Es ist noch schwieriger, sicherzustellen, dass die erfassten Informationen bei den folgenden Aufgaben des Modells weiterhin ausreichen.

In einem Benchmark wie ARC-AGI-3 ist eine vorherige Idee, dass das Bild zunächst in eine Textmatrix aus Zahlen umgewandelt wird, anschließend wird das Modell ein Programm schreiben, Umweltregeln simulieren und Handlungspläne überprüfen.

(Anmerkung: ARC-AGI-3 ist ein interaktives visuelles Logik-Referenzsystem, bei dem keine vorherigen Regeln oder Ziele bereitgestellt werden. Der Agent muss durch Beobachtungen und Handlungen selbst herausfinden, wie man das Spiel beendet.)

Aber das Problem ist, dass je komplexer die Umgebung ist, desto schwieriger ist es, das Erscheinungsbild, die räumlichen Beziehungen und die dynamischen Veränderungen der Objekte vollständig in Text und Code umzusetzen. Darüber hinaus werden mit zunehmendem Interaktionsverlauf die frühen Bilder allmählich aus dem Kontext entfernt oder durch Textbeschreibungen ersetzt.

Daher wird die Forschungsfrage von VISTA hier zu:

Wie kann man den Agenten ohne zusätzliches Trainieren des Grundmodells geben, dass er bei Bedarf die visuellen Informationen überprüft, die er in der Vergangenheit gesehen hat?

Basierend darauf hat VISTAJede Frame, die vom Umfeld zurückgegeben wird, bleibt unverändert außerhalb des Kontexts, einschließlich der Zwischenframes während des Vorgangs der Animation. Das Modell nimmt sie wieder auf, wenn benötigt.

Im ARC-AGI-3-Test kann es sowohl Bilder zu unterschiedlichen Zeiten vergleichen, als auch Bereiche vergrößern und Markierungen der Ausrichtung auf kleinen Quadraten überprüfen.

Dabei dokumentiert das Modell der Textnotizen das aktuelle Verständnis, und die ursprüngliche Bilddarstellung bleibt erhalten, um es neu bewerten zu können.

Die Forschung bezeichnet dieses Mechanismus als explizite Aufmerksamkeit auf die Interaktionsgeschichte. Das Modell wählt, welche visuellen Informationen wieder in den Kontext eindringen, basierend auf den betrachteten Problemen.

Um diese Wahl möglich zu machen, muss das System die ursprüngliche Bildaufnahme speichern und Tools bereitstellen, mit denen man jederzeit aufrufen und prüfen kann.

Konkrete Umsetzung

Um das Modell in der Lage zu halten, die visuellen Erfahrungen aus der Vergangenheit zu speichern und zu nutzen, hat VISTA drei Kernkomponenten entwickelt:

Visuelle Beobachtung, unzerstörbare visuelle Erinnerung und aktive visuelle Überprüfung. Diese drei Komponenten haben jeweils ihre eigene Aufgabe: Sie sorgen dafür, dass das Modell die Szene klar erkennt, die Geschichte speichert und bei Bedarf zurückgesehen wird.

Zuerst ist die visuelle Beobachtung zuständig, um das Umgebungsbild an das Modell zu übermitteln.

Im ARC-AGI-3-Experiment wird das offiziell bereitgestellte 64×64-Bild durch VISTA auf ein 512×512-PNG-Bild vergrößert, wobei die Farben, das Erscheinungsbild und die räumlichen Beziehungen der Objekte erhalten bleiben, damit das Modell den Umgebung direkt sehen kann.

Zweitens ist die unschädliche visuelle Erinnerung, die dafür sorgt, dass das Bild des Modells gespeichert wird.

Jedes Mal nach der Ausführung einer Aktion speichert VISTA vollständig alle Bilder, die vom Umfeld zurückgegeben werden, einschließlich der Zwischendarstellungen der Animation während des Vorgangs, und erstellt Indexe nach dem Runden- und Frame-Nummern.

Damit muss das Modell nicht im Voraus entscheiden, welche Informationen beachtet werden sollten, sondern kann die visuelle Erfahrung vollständig speichern und sie später verwenden.

Schließlich ist die aktive visuelle Überprüfung zuständig, um das Modell nach Bedarf an frühere Bilder zu erinnern.

Mit der Inspekt-Tool-Funktion kann das Modell einen bestimmten historischen Rundkampf anwenden, um die entsprechende Ansicht zu zeigen. Zudem kann es lokale Bereiche ausblenden oder vergrößern und die Details darin untersuchen.

Wenn man wissen möchte, was eine bestimmte Operation tatsächlich verändert hat, kann das Modell auch mehrere Bilder auswählen und die Veränderungen vor und nach der Aktion vergleichen.

Das gesamte Prozess ist so, als würde dem Modell ein visuelles Archiv zur Verfügung gestellt werden, das jederzeit abgegriffen werden kann. Es kann nicht nur die Umgebung vor sich sehen, sondern auch aktiv auf frühere Beobachtungsergebnisse zurückgreifen, um eine Grundlage für die nächsten Handlungen zu bieten.

Wie arbeiten diese drei Komponenten genau zusammen?

Gemäß dem Ausführungsprozess von VISTA beobachtet das Modell zu Beginn jedes Rundens zuerst die aktuelle Szene und verfügbaren Aktionen, führt anschließend die bisher gesammelten Erfahrungen zusammen, beurteilt den Zustand der Umgebung und formuliert Hypothesen für die nächste Handlung.

Wenn die vorhandenen Informationen unzureichend sind, kann das Modell Tools nutzen, um die historischen Bilder zu überprüfen, bestimmte Bereiche zu vergrößern und sogar die spezifischen Pixelinformationen abzurufen, um weitere Beweise zu finden.

Nachdem die Beweise gefunden sind, handelt das Modell nicht direkt, sondern vorherzusagen, welche Veränderungen diese Operation möglicherweise mit sich bringen wird.

Sobald die Aktionen ausgeführt sind, wird das tatsächliche Ergebnis mit der Vorhersage verglichen, um zu überprüfen, ob die eigene Einschätzung richtig war, und entsprechend an der Verständnis der Spielregeln angepasst werden.

So wiederholt sich das Prozess, dass das Modell in stetigen Interaktionen sowohl die Umgebung erkundet als auch Erfahrung sammelt.

Natürlich reicht ein visuelles Archiv nicht aus. Um das Modell bei langen Aufgabenzeiten kontinuierlich zu halten, hat VISTA auch zwei schriftliche Notizen eingeführt:

  • GUIDE.md: Aufzeichnung der Regeln und Erfahrungen, die zwischen den verschiedenen Level wieder verwendet werden können.
  • WORKING.md: Dokumentiert den Zustand, den Fortschritt und die weiteren Pläne für das aktuelle Level.

Wenn der Kontext nah an die Obergrenze kommt, ordnet das Modell zuerst einen Zusammenfassung des Übergangs ein und tritt dann in den neuen Kontextfenster ein, um die Aufgabe fortzusetzen. Die vorherigen Textnotizen, Handlungshistorie und visuelle Archive bleiben erhalten.

Es gibt noch einen bemerkenswerden Designfehler: Obwohl VISTA die historischen Bilder vollständig erhält, fügt es nicht alle Bilder einfach in den Kontext des Modells ein.

Im vollständigen Ansatz zeigt das Framework nach jeder Aktion standardmäßig nur die letzte Frame an das Modell. Die mittelbaren Bilder während der Aktion werden zusammengefasst in einem visuellen Archiv gespeichert, um sie dann aktiv zu abrufen, wenn das Modell dies benötigt.

So bleibt die vollständige visuelle Information erhalten, und es wird vermieden, dass viele historische Bilder den Kontextraum überladen.

Wichtiger noch: VISTA hat kein neues Modell für diese Aufgabe extra trainiert.

Die Umweltverständnis, die Handlungsplanung und die Schlussfolgerungen werden weiterhin von vorhandenen Multimodellen erledigt. Harness ist für die Ausführung von Toolaufrufen, das Speichern der visuellen Historie und das Bereitstellen der entsprechenden Beweise, wenn das Modell es benötigt, zuständig.

Mit anderen Worten ändert VISTA nicht das Modell selbst, sondern die Art und Weise, wie das Modell visuelle Informationen erhält, speichert und verwendet.

Experimentelle Validierung

Abgesehen von den oben erwähnten Experimenten testete das Team VISTA auch auf drei Referenzsystemen – GameWorld, AI GameStore und BabyVision – und umfasste dabei Aufgaben wie Browserspiele, Labyrinthe und Verbindungen.

Mit dem gleichen GPT-5.6 Sol-Modell hat VISTA im Vergleich zum offiziellen Grundrahmen in 170 Aufgaben von GameWorld die Erfolgsrate von 40,0% auf 63,3% erhöht.

Bei den 10 Spielen von AI GameStore stieg das Gesamtscore von 47,3 auf 140,3, wobei die mittlere Werte der Menschen auf 100 normalisiert wurden;

Bei den 39 Labyrinthen und Verbindungssachen, die von BabyVision ausgewählt wurden, stieg die Genauigkeit von 41,0 % auf 63,2 %. Bei dieser letzten Gruppe von Aufgaben handelt es sich nur um statische Bilder, und das Modell kann durch das Vergrößern bestimmter Bereiche und die Überprüfung der Pixel die Entscheidungen verbessern.

Diese Ergebnisse zeigen, dass das Erhalten des ursprünglichen Bildes und die Möglichkeit, das Modell nach Bedarf anzusehen, die Fähigkeiten der bestehenden multimodalen Modelle weiter ausbauen kann.

Eine identische VISTA-Framework-Setzung erfordert nur wenige Anpassungen und kann für verschiedene Spiele und Rätsel verwendet werden, was auch das Potenzial ihrer Anwendung in weiteren visuellen Aufgaben zeigt.

In der Schlussfolgerung weist die Studie die zukünftigen Validierungsrichtungen auf, die auf Aufgaben zielen, die näher an die physische Welt sind: Das Modell soll in einem ständig veränderlichen Umfeld seine visuelle Erfahrung speichern, überprüfen und nutzen, um die nächste Handlung zu bestimmen.

Autorenprofil

Zum Schluss werden wir die Autoren dieser Arbeit vorstellen.

Die drei gemeinsamen Erstautoren des Artikels sind Qiushi Han, Hu Keya und Linlu Qiu, die beiden weiteren Autoren sind Cathy Wu und He Kaiming.

Qiushi Han (Josh Han) ist derzeit Doktorand am Forschungszentrum für Operations Research an der MIT und wird von Cathy Wu betreut.

Hu Keya (Keya Hu) ist derzeit Doktorandin am Fachbereich Elektrotechnik und Informatik an der MIT und wird von He Kaiming und Jacob Andreas gemeinsam betreut.

Sie absolvierte ihren Bachelorabschluss am Shanghai Jiao Tong University ACM-Programm und hat ihr Forschungsthema auf das Gebiet der Schnittstelle zwischen Sprache und Bildung konzentriert. Sie hofft, eine intelligente Maschine zu entwickeln, die eine höhere Dateneffizienz und eine bessere Generalisierungsfähigkeit aufweist.

Linlu Qiu ist derzeit Doktorand am Fachbereich Elektrotechnik und Informatik sowie am Labor für Informatik und künstliche Intelligenz an der MIT, und seine Betreuer sind Yoon Kim und Jacob Andreas.

Ihre Forschungsrichtungen umfassen die Verarbeitung natürlicher Sprache und maschinelles Lernen. Sie haben an Google Research und Meta FAIR Forschungen durchgeführt.

Cathy Wu ist derzeit Dozentin am Fachbereich Bauwesen und Umwelttechnik des MIT und am Institute for Data Systems and Society. Sie erforscht Methoden, wie maschinelles Lernen und Reinforcement Learning verwendet werden können, um komplexe Systeme wie den Verkehr zu verbessern.

Sie erhielt einen Bachelor- und einen Masterabschluss in Ingenieurwissenschaften an der MIT und anschließend einen Doktortitel an der University of California, Berkeley.

He Kai-ming ist derzeit Professor an der Abteilung für Elektrotechnik und Informatik an der MIT und außerdem Hauptautor von Arbeiten wie ResNet, Mask R-CNN und MAE.

Er absolvierte seinen Bachelorabschluss an der Tsinghua-Universität und seinen Doktortitel an der Chinese University of Hongkong. Er arbeitete bei den Microsoft Research Asia und FAIR und trat 2024 bei MIT ein.

Referenzlink
[1] https://arxiv.org/pdf/2610.02200

 

Originalquelle

量子位

Hinweise zum Inhalt

Originalveröffentlichung und Rechte liegen bei der Quelle.

Maschinelle Übersetzung · Original beachten