量子位

El equipo de He Kaiming publicó el framework multimodal Harness

El Harness visual nativo del modelo multimodal ha llegado.

henry desde el lugar del hueco no en un templo

Quantum Bit | Publicación oficial QbitAI

El Harness visual nativo del modelo multimodal ha llegado.

Recientemente, el equipo de He Kaiming presentó en su último artículo, “VISTA: A Visual Harness for Reasoning in an Interactive World”, un sistema de Harness de origen visual.

VISTA.

Permite que los modelos multimodales existentes observen directamente el entorno, guarden las imágenes originales y puedan volver a verlas, ampliarlas y examinar detalles en cualquier momento durante el razonamiento, sin necesidad de entrenar desde cero.

En comparación con el método tradicional de abstractar el entorno en texto o código, VISTA conserva lainformación visual original. El modelo puede, basándose en los problemas actuales, reintegrar imágenes vistas en el pasado en el contexto, participando en las decisiones e inferencias del momento.

Basado en este método, la experiencia visual se convierte en un contexto que el modelo puede llamar y revisar repetidamente, y los modelos multimodales también tienen una estructura nativa construida alrededor de la memoria visual.

En términos de evaluación, con VISTA y Claude Opus 5.0, se completaron todos los 25 juegos públicos de ARC-AGI-3, y la puntuación en eficiencia de movimiento relativa a los humanos alcanzó el 100. La cantidad de movimientos utilizados en los juegos fue 57.4% menor que la del humano en su primera jugada.

Cambió a GPT-5.6 Sol, también completó todo el juego y obtuvo un puntaje de 99.

Además, el equipo también ha probado este método en juegos para navegador, laberintos y tareas de conexión, y ha incluido las tareas que implican la presencia física y están más cerca del mundo real como áreas de investigación futura.

¿Cómo se hace esto?

Estructura visual original

Desde ResNet, Mask R-CNN hasta MAE, el aprendizaje de percepción visual y representación siempre ha sido una línea principal en la investigación de He Kaiming.

Esta vez, VISTA ha dirigido su atención a un nuevo problema: ¿cómo permite el modelo acumular, guardar y utilizar experiencia visual durante la interacción continua?

La respuesta es Harness.

En noviembre del año pasado, Anthropic utilizó una tarea de programación prolongada como ejemplo para explicar cómo Harness ayuda a los modelos a superar varios ventanas de contexto y a llevar adelante la tarea de manera continua.

En particular, Harness registra las tareas que aún no se han completado en una lista de tareas, y guarda el trabajo realizado en archivos de progreso y código.

De esta manera, incluso cuando el modelo entra en una nueva ventana de contexto, puede leer estas informaciones para entender qué se hizo anteriormente y qué debe hacer a continuación.

Las tareas complejas pueden ejecutarse por etapas, se verifican los resultados y se continúa el trabajo entre diferentes ventanas de contexto.

Se puede decir que este Harness, que almacena el estado de las tareas principalmente a través de texto y código, ha impulsado, en cierta medida, el surgimiento de esta ola de capacidades de Agentes.

Sin embargo, en el entorno real, solo tener memoria de texto es, obviamente, insuficiente.

Porque una vez que se entra en un entorno visual real, el modelo no solo debe recordar la posición y la orientación de los objetos, sino también comprender qué cambios ocurren en el entorno antes y después de cada movimiento.

Además, cuando el modelo ve un gráfico por primera vez, no necesariamente sabe qué detalles serán importantes más adelante.

Al mismo tiempo, es difícil también registrar completamente esta información visual con una nota de texto por adelantado, y aún más difícil garantizar que la información registrada siga siendo suficiente cuando el modelo realice tareas posteriormente.

En un benchmark como ARC-AGI-3, una idea existente es primero convertir la imagen en una red de texto compuesta por números, y luego hacer que el modelo escriba programas para simular las reglas del entorno y verificar las acciones planificadas.

(Nota: ARC-AGI-3 es un conjunto de estándares de razonamiento visual interactivo; no se proporcionan reglas ni objetivos de antemano, y el agente debe observar y actuar para descubrir por sí mismo cómo superar la prueba)

Pero el problema es que, cuanto más complejo es el entorno, más difícil es transformar completamente la apariencia del objeto, las relaciones espaciales y los cambios dinámicos en texto y código. Además, a medida que la historia de interacción se alarga, las imágenes iniciales también se eliminarán gradualmente del contexto, o serán reemplazadas por resúmenes en texto.

Así, aquí, la pregunta de investigación de VISTA se convierte en:

¿Cómo permitir que el agente revise la información visual que ha visto en el pasado cuando sea necesario para la inferencia, sin necesidad de entrenar un modelo básico adicional?

Basado en esto, VISTA guarda cada fotograma que devuelve el entorno tal cual fuera, fuera del contexto, incluyendo los fotogramas intermedios de la animación durante el proceso de acción, y los recupera cuando el modelo lo necesita.

En el test ARC-AGI-3, puede comparar las imágenes en diferentes momentos, así como ampliar áreas específicas y examinar los marcadores de orientación en los pequeños cuadrados.

En él, el modelo de registro de notas escritas refleja la comprensión actual, y la imagen original se conserva como evidencia para que pueda ser reevaluada.

El estudio denomina este mecanismo como la atención explícita a la historia de interacción, y el modelo selecciona qué información visual vuelve a entrar en el contexto según las preguntas que se están considerando.

Para que esta opción sea posible, el sistema debe guardar la imagen original y proporcionar herramientas para acceder y verificarla en cualquier momento.

Implementación específica

Para que el modelo pueda guardar y utilizar la experiencia visual del pasado, VISTA diseñó tres componentes clave:

Observación visual, memoria visual sin daño y inspección visual activa. Estos tres componentes tienen funciones distintas: uno se encarga de hacer que el modelo vea la imagen claramente, otro se ocupa de guardar la historia y el tercero permite volver a verla cuando sea necesario.

Primero está la observación visual, que se encarga de proporcionar imágenes del entorno al modelo.

En el experimento ARC-AGI-3, VISTA ampliará la imagen oficial de 64×64 a una imagen PNG de 512×512, manteniendo los colores, la apariencia y las relaciones espaciales de los objetos, permitiendo así que el modelo pueda observar directamente el entorno.

En segundo lugar, está la memoria visual sin daño, que se encarga de almacenar las imágenes que el modelo ve.

Cada vez que se ejecuta una acción, VISTA guarda completamente todas las imágenes devueltas por el entorno, incluyendo las imágenes intermedias durante el proceso de la acción, y establece índices según el número de ronda y el número de fotograma.

De esta manera, el modelo no necesita juzgar de antemano qué información vale la pena recordar, sino que puede guardar completamente la experiencia visual para usarla posteriormente.

Por último, está la inspección visual activa, que se encarga de hacer que el modelo vuelva a ver las imágenes históricas según sea necesario.

A través de la herramienta inspect, el modelo puede especificar un round histórico, mostrar la imagen correspondiente, así como recortar y ampliar áreas particulares para examinar los detalles.

Si se desea saber qué cambió realmente en una operación específica, el modelo también puede mostrar varias imágenes a la vez para comparar los cambios antes y después de la acción.

Todo el proceso es como dotar al modelo de un archivo visual que se puede consultar en cualquier momento. No solo puede ver el entorno presente, sino que también puede volver a mirar los resultados de observaciones pasadas, proporcionando así una base para las acciones futuras.

Hablando de esto, ¿cómo interactúan específicamente estas tres componentes?

De acuerdo con el proceso de ejecución de VISTA, al comenzar cada ronda, el modelo primero observa la pantalla actual y las acciones disponibles, luego combina la experiencia acumulada anteriormente para determinar el estado del entorno actual y formular su hipótesis sobre la siguiente acción.

Si la información existente es insuficiente, el modelo puede llamar a herramientas, revisar imágenes históricas, ampliar áreas específicas e incluso leer información de píxeles concretos, para buscar más pruebas.

Después de encontrar pruebas, el modelo no actúa directamente, sino que primero predice qué cambios podría provocar esa operación.

Después de que se ejecuten todas las acciones, se comparará el resultado real con la predicción, se verificará si la juicio es correcto y, basándose en ello, se corregirá la comprensión de las reglas del juego.

De esta manera, una y otra vez, el modelo puede explorar el entorno y acumular experiencia durante la interacción continua.

Por supuesto, no basta con un archivo visual. Para que el modelo mantenga la coherencia durante tareas prolongadas, VISTA también introdujo dos notas escritas:

  • GUIDE.md: Registra las reglas y experiencias que pueden ser reutilizadas entre diferentes niveles.
  • WORKING.md: Registra el estado del nivel actual, el progreso y los planes futuros.

Cuando el contexto se acerca al límite superior, el modelo primero organiza un resumen de transferencia y, luego, entra en una nueva ventana de contexto para continuar ejecutando la tarea. Las notas textuales anteriores, la historia de acciones y los archivos visuales se conservarán.

También hay un diseño digno de atención: aunque VISTA conserva completamente las imágenes históricas, no introduce todas las imágenes en el contexto del modelo de manera abrupta.

En el planteamiento completo, después de cada acción ejecutada, el marco por defecto solo muestra la última imagen al modelo. En cuanto a las imágenes intermedias durante la acción, se guardan de manera unificada en un archivo visual, y se recuperan activamente cuando el modelo lo necesite.

Así se conserva la información visual completa, y se evita que una gran cantidad de imágenes históricas ocupe espacio en el contexto.

Lo más importante es que VISTA no entrenó un nuevo modelo adicional para ello.

La comprensión del entorno, la planificación de acciones y el razonamiento siguen siendo realizados por modelos multimodales listos para uso. Harness se encarga de llamar a herramientas, guardar el historial visual y proporcionar pruebas correspondientes cuando los modelos lo necesitan.

En otras palabras, lo que VISTA cambia no es el modelo en sí, sino la forma en que el modelo obtiene, almacena y utiliza información visual.

Verificación experimental

Además del experimento mencionado al principio, el equipo también probó VISTA en tres estándares: GameWorld, AI GameStore y BabyVision, abarcando tareas como juegos para navegadores, laberintos y conexiones.

Utilizando el mismo modelo GPT-5.6 Sol, en comparación con el marco base oficial, VISTA aumentó la tasa de éxito en 170 tareas de GameWorld de 40.0% a 63.3%.

En los 10 juegos de AI GameStore, la puntuación total aumentó de 47.3 a 140.3, donde la mediana humana se normalizó a 100;

En los 39 juegos de laberintos y puzzles seleccionados por BabyVision, la precisión aumentó de 41.0% a 63.2%. Esta última serie de tareas consiste únicamente en imágenes estáticas, pero el modelo puede mejorar su juicio al ampliar partes del área y examinar los píxeles.

Estos resultados indican que conservar la imagen original y permitir que el modelo se revise según sea necesario puede aprovechar aún más las capacidades de los modelos multimodales existentes.

El mismo marco VISTA necesita poco ajuste para poder utilizarse en diferentes juegos y acertijos, lo que también demuestra su potencial de aplicación en más tareas visuales.

En conclusión, el estudio apunta hacia direcciones de verificación futuras que se acercan más al mundo físico: permitir que los modelos guarden, revisen y utilicen su experiencia visual en un entorno en constante cambio, para decidir las próximas acciones.

Introducción del autor

Por último, presentemos a los autores de este trabajo.

Los tres primeros autores del artículo son Qiushi Han, Hu Keya y Linlu Qiu; los otros dos autores son Cathy Wu y He Kai Ming.

Qiushi Han (Josh Han) actualmente es un doctorando en el Centro de Investigación de Planificación de Transporte de MIT, y su tutor es Cathy Wu.

Hu Keya (Keya Hu) actualmente es una doctora en ingeniería eléctrica y ciencias de la computación en el departamento de MIT, y es guiada por He Kaiming y Jacob Andreas.

Se graduó en la clase ACM de la Universidad de Shanghai Jiao Tong, donde sus intereses de investigación se centraban en el campo intersectorial entre lenguaje y visión. Desea desarrollar un agente inteligente con mayor eficiencia en el uso de datos y una mejor capacidad de generalización.

Linlu Qiu actualmente es un doctorando en el Departamento de Ingeniería Eléctrica y Ciencia de la Computación, así como en el Laboratorio de Ciencia de la Computación y Inteligencia Artificial del MIT, bajo la supervisión de Yoon Kim y Jacob Andreas.

Sus áreas de investigación incluyen el procesamiento del lenguaje natural y el aprendizaje automático, y ha realizado investigaciones en Google Research y Meta FAIR.

Cathy Wu actualmente es profesora asociada en el Departamento de Ingeniería Civil y Ambiental de MIT, y en el Instituto de Sistemas de Datos y Sociedad. Su investigación se centra en cómo mejorar sistemas complejos como el transporte mediante el aprendizaje automático y el aprendizaje refuerzo.

Obtuvo una maestría en licenciatura y ingeniería en MIT, y posteriormente una doctora en la Universidad de California en Berkeley.

He Kaiming actualmente es un profesor asociado vitalicio en el Departamento de Ingeniería Eléctrica y Ciencias de Computación del MIT, y también es autor principal de trabajos como ResNet, Mask R-CNN y MAE.

Se graduó en la universidad de Tsinghua y obtuvo su doctorado en la Universidad China de Hong Kong. Trabajó en el Instituto de Investigación Asiático de Microsoft y en FAIR, y se unió al MIT en 2024.

Enlace de referencia
[1]https://arxiv.org/pdf/2610.02200

 

Fuente original

量子位

Notas sobre el contenido

La publicación original y los derechos pertenecen a la fuente.

Traducción automática · Consulte el original