헨리 发自 凹非寺
양자비트 | 공식 계정 QbitAI
다중 모달 모델의 시각적 천부적인 Harness가 등장했습니다!
최근, 하카이밍 팀은 최신 논문 “VISTA: 인터랙티브 세계에서 추론을 위한 시각적 하네스”에서 시각적으로 기반된 하네스를 제안했습니다.
비스타.
그것은 기존의 다모달 모델이 환경을 직접 관찰하고 원본 이미지를 저장할 수 있도록 해주며, 추론 과정에서 언제든지 다시 보거나 확대하여 세부 사항을 확인할 수 있게 해줍니다. 처음부터 훈련하는 것이 필요하지 않습니다.
전통적인 환경을 문자나 코드로 추상화하는 방식과 비교해, VISTA는 원시적인 시각 정보를 보존합니다. 모델은 현재의 문제에 따라 과거에 본 이미지를 다시 맥락에 맞게 삽입하여 현재의 판단과 추론에 참여할 수 있습니다.
이 방법에 기반하여, 시각적 경험은 모델이 언제든지 호출하고 반복적으로 검토할 수 있는 컨텍스트가 되고, 다중 모달 모델에는 시각적 기억을 둘러싼 천연적인 스크래치도 생겨난다.
평가 측면에서 VISTA와 Claude Opus 5.0을 사용하여 ARC-AGI-3의 모든 25개 공개 게임을 완료했으며, 인간의 동작 효율 점수는 100점에 도달했습니다. 사용된 게임 동작 수는 처음 플레이한 인간 기준치보다 57.4% 적었습니다.
GPT-5.6 Sol으로 바꾸어도 모든 레벨을 클리어하고 점수는 99에 도달했습니다.
더 나아가, 팀은 브라우저 게임, 미로, 연결 문제에서 이 방법을 테스트했으며, 물리 세계에 더 가까운 실제 환경의 작업을 향후 연구 방향으로 삼고 있습니다.
이것은 어떻게 이루어지는가?
시각적으로 본능적인 스크래치
ResNet, Mask R-CNN부터 MAE까지, 시각 인지 및 표현 학습은 항상 허카이밍의 연구 주요 흐름이었습니다.
이번에 VISTA는 새로운 문제에 주목했습니다. 모델이 지속적인 상호작용 과정에서 시각적 경험을 축적하고, 저장하며, 활용하는 방법은 무엇인가?
답은 Harness입니다.
지난 11월, Anthropic은 긴 시간이 필요한 프로그래밍 작업을 예로 들어, Harness가 모델이 여러 컨텍스트 윈도우를 넘어서 작업을 지속적으로 진행하는 데 어떻게 도움이 되는지를 설명했습니다.
구체적으로는 Harness는 아직 완료되지 않은 작업을 작업 목록으로 기록하고, 진행 상황 파일과 코드로 완료된 작업을 저장합니다.
이렇게 되면 모델이 새로운 컨텍스트 창에 들어가더라도, 이 정보을 읽음으로써 이전에 무엇을 했는지, 다음에 무엇을 해야 하는지 알 수 있다.
복잡한 작업은 이를 통해 단계별로 실행될 수 있으며, 결과를 검사하고 다양한 컨텍스트 창 간에 계속해서 작업할 수 있습니다.
이 문서와 코드를 통해 작업 상태를 저장하는 Harness가, 어느 정도로 에이전트의 능력이 발전하는 데 기여했다고 할 수 있습니다.
하지만 실제 환경에서는 단순한 문자 기억만으로는 충분하지 않습니다.
실제 시각 환경에 들어가면, 모델은 물체의 위치와 방향을 기억하는 것뿐만 아니라, 각 동작 전후에 환경에서 어떤 변화가 일어나는지도 이해해야 합니다.
또한 모델이 처음으로 그림을 볼 때, 어떤 세부 사항이 나중에 중요해질지 알 수 없다.
동시에, 이러한 시각적 정보를 한 장의 텍스트 노트로 완전히 기록하는 것도 어렵고, 모델이 향후 작업을 수행할 때 기록된 정보가 여전히 충분한지 보장하기도 어렵습니다.
ARC-AGI-3과 같은 기준에서, 한 가지 접근 방식은 먼저 화면을 숫자로 구성된 텍스트 격자로 변환한 다음, 모델이 프로그램을 작성하여 환경 규칙을 시뮬레이션하고 행동 계획을 검증하는 것입니다.
(주석: ARC-AGI-3는 규칙과 목표를 미리 제공하지 않는 대화형 시각적 추론 기준으로, 스마트 아군은 관찰과 행동을 통해 스스로 클리어 방법을 찾아야 합니다.)
하지만 문제는 환경이 복잡할수록 물체의 외형, 공간 관계 및 동적 변화를 완전하게 문자와 코드로 변환하기가 어려워진다는 것입니다. 또한 상호작용 기록이 길어질수록 초기 화면도 점차 맥락에서 사라지거나 문자 요약으로 대체되기도 합니다.
그래서 여기서 VISTA의 연구 문제는 다음과 같아졌습니다:
기본 모델을 추가로 훈련하지 않고, 스마트 아티브가 추론에 필요할 때 과거에 본 시각 정보를 다시 확인하도록 하는 방법은 무엇인가?
이에 따라 VISTA는 환경이 반환하는 각 프레임을 그대로 컨텍스트 밖에 저장하며, 동작 과정 중의 애니메이션 중간 프레임도 포함합니다. 모델이 필요할 때 다시 가져옵니다.
ARC-AGI-3 테스트에서, 그것은 서로 다른 시간대의 화면을 비교할 수 있을 뿐만 아니라 부분을 확대하여 작은 사각형 위의 방향 표시를 확인할 수도 있다.
그 중에서도, 텍스트 노트는 모델이 현재 가지고 있는 이해를 기록하고, 원본 이미지는 그가 다시 판단할 수 있도록 증거로 남겨져 있다.
연구진은 이 메커니즘을 상호작용의 역사에 대한 명시적인 주의를 말한다. 모델은 고민 중인 문제에 따라 어떤 시각적 정보가 다시 컨텍스트에 들어오도록 선택한다.
이러한 선택을 가능하게 하려면 시스템은 원본 화면을 저장하고, 언제든지 불러와서 확인할 수 있는 도구를 제공해야 합니다.
구체적인 구현
모델이 과거의 시각 경험을 저장하고 활용할 수 있도록 하기 위해, VISTA는 세 가지 핵심 구성 요소를 설계했습니다:
시각 관찰, 손상 없는 시각 기억 및 주동적인 시각 검사. 이 세 구성 요소는 각자 다른 역할을 하며, 모델이 화면을 명확히 볼 수 있도록 하거나, 역사를 저장하거나, 필요에 따라 다시 보기하는 작업을 담당한다.
먼저 시각 관찰이 이루어지며, 이는 환경 화면을 모델에 제공하는 역할을 합니다.
ARC-AGI-3 실험에서 VISTA는 공식 제공된 64×64 크기의 이미지를 512×512 크기의 PNG 이미지로 확대하며, 물체의 색상, 외형 및 공간 관계를 그대로 유지하여 모델이 환경을 직접 관찰할 수 있도록 합니다.
다음으로는 무손실 시각 기억이 있는데, 모델이 보는 화면을 저장하는 역할을 합니다.
각 동작을 실행할 때마다 VISTA는 동작 과정 중의 애니메이션 중간 프레임을 포함한 환경의 모든 화면을 완전히 저장하고, 라운드 번호와 프레임 번호에 따라 인덱스를 생성합니다.
이렇게 되면 모델은 어떤 정보를 기억해야 하는지 미리 판단할 필요가 없으며, 시각적 경험을 완전히 저장하여 이후에 사용할 수 있다.
마지막으로 능동적 시각 검사가 있는데, 이는 모델이 필요에 따라 과거 화면을 다시 볼 수 있도록 하는 역할을 합니다.
Inspect 도구를 통해 모델은 특정 역사적 회전을 지정하여 해당 화면을 불러오거나, 부분 영역을 잘라내고 확대할 수 있으며, 그 안의 세부 사항을 확인할 수 있습니다.
어떤 작업이 실제로 무엇을 바꾸었는지 알고 싶다면, 모델은 여러 프레임을 한 번에 불러와서 동작 전과 후의 변화를 비교할 수 있습니다.
전체 과정은 모델에 언제든지 살펴볼 수 있는 시각적 자료를 제공하는 것과 같습니다. 이를 통해 현재 환경을 볼 수 있을 뿐만 아니라 과거의 관찰 결과도 능동적으로 다시 살펴보아 다음 행동에 대한 근거를 얻을 수 있습니다.
이제 이 세 개의 구성 요소가 어떻게 함께 작동하는지 말하자면?
VISTA의 실행 프로세스에 따라, 각 라운드 시작 시 모델은 현재 화면과 가능한 동작을 먼저 관찰한 뒤, 이전에 축적된 경험을 결합하여 현재 환경의 상태를 판단하고 다음 단계의 행동을 가정합니다.
기존 정보가 부족한 경우, 모델은 도구를 호출하여 과거 화면을 확인하거나 특정 부분을 확대할 수 있으며, 심지어 개별 픽셀 정보까지 읽어 증거를 더 찾아낼 수 있다.
증거를 찾은 후, 모델은 직접 행동하지 않고 먼저 이 작업이 어떤 변화를 가져올지 예측합니다.
그러한 조작이 완료된 후에 실제 결과와 예측을 비교하여 자신의 판단이 정확한지 확인하고, 이를 바탕으로 게임 규칙에 대한 이해를 수정한다.
이렇게 반복하면, 모델은 지속적인 상호작용 중에 환경을 탐색하면서 경험을 쌓게 됩니다.
물론, 시각 자료만으로는 충분하지 않습니다. 모델이 장시간 작업 중에도 연속성을 유지할 수 있도록 VISTA는 두 가지 텍스트 노트도 도입했습니다.
- GUIDE.md: 다양한 레벨 간에 재사용할 수 있는 규칙과 경험을 기록합니다.
- WORKING.md: 현재 레벨의 상태, 진행 상황 및 향후 계획을 기록합니다.
컨텍스트가 상한선에 가까워질 때, 모델은 먼저 전달 요약을 정리한 후 새로운 컨텍스트 창으로 들어가 작업을 계속 수행합니다. 이전의 문서 노트, 동작 기록 및 시각 파일도 모두 보존됩니다.
여기에 또 하나 주목할 만한 디자인이 있습니다: VISTA는 역사적인 화면을 완전히 보존하지만, 모든 이미지를 모델의 맥락에 한꺼번에 넣지는 않습니다.
전체 솔루션에서 동작을 실행할 때마다 프레임은 기본적으로 모델에 마지막 프레임만 표시됩니다. 동작 과정 중의 중간 화면은 모두 비주얼 아카이브에 저장되어, 모델이 필요할 때 개별적으로 불러오게 됩니다.
이렇게 하면 완전한 시각 정보를 유지하면서도 많은 역사적 이미지가 문맥 공간을 계속 차지하는 것을 방지할 수 있습니다.
더 중요한 것은, VISTA가 이를 위해 새로운 모델을 추가로 훈련하지 않았다는 점입니다.
환경 이해, 행동 계획 및 추론은 여전히 기존의 다모달 모델에 의해 수행되며, Harness는 도구 호출을 실행하고 시각적 역사를 저장하며, 모델이 필요할 때 관련 증거를 제공하는 역할을 합니다.
다른 말로 하면, VISTA가 변화시키는 것은 모델 자체가 아니라, 모델이 시각 정보를 얻고 저장하고 사용하는 방식입니다.
실험 검증
처음에 언급된 실험 외에도, 팀은 GameWorld, AI GameStore 및 BabyVision 세 가지 기준에서 VISTA를 테스트했으며, 브라우저 게임, 미로, 연결 등의 과제를 포함했습니다.
동일한 GPT-5.6 Sol 모델을 사용하여, 공식 기반 프레임워크에 비해 VISTA는 GameWorld의 170개 작업에서 성공률을 40.0%에서 63.3%로 향상시켰다.
AI GameStore의 10개 게임에서 종합 점수는 47.3에서 140.3으로 증가했으며, 그 중 인간의 중앙값은 100으로 정규화되었습니다.
BabyVision에서 선택한 39개의 미로 및 연결 문제에서 정확도가 41.0%에서 63.2%로 향상되었습니다. 마지막 그룹의 작업은 정적 이미지만이었지만, 모델은 부분을 확대하고 픽셀을 확인함으로써 판단력을 개선할 수 있었습니다.
이러한 결과는 원본 화면을 보존하고 모델을 필요에 따라 다시 볼 수 있도록 하는 것이 기존의 다중모달 모델의 능력을 더욱 발휘할 수 있음을 보여줍니다.
동일한 VISTA 프레임워크를 적은 수의 조정만으로 다양한 게임과 퍼즐에 사용할 수 있으며, 더 많은 시각적 작업에서의 활용 가능성도 보여줍니다.
결론적으로, 연구는 미래의 검증 방향을 물리 세계에 더 가까운 '몸을 가진 작업'으로 지목했다. 즉, 모델이 지속적으로 변화하는 환경에서 자신의 시각 경험을 저장하고, 재검토하며, 활용하여 다음 단계의 행동을 결정할 수 있도록 하는 것이다.
저자 소개
마지막으로, 이 연구의 저자들을 소개하겠습니다.
논문의 공동 제1저자 세 명은 Qiushi Han,胡珂雅, Linlu Qiu이며, 다른 두 저자는 Cathy Wu와何恺明입니다.
치시 허ан(조시 허안)은 현재 MIT 전략기획 연구센터의 박사과정 학생이며, 지도교수는 캐시 우입니다.
후커이아(키아 하우)는 현재 MIT 전기공학 및 컴퓨터과학 학부의 박사과정 학생으로, 허카이밍과 제이콥 안드레아스가 공동 지도를 하고 있습니다.
그녀는 상하이 교통대학교 ACM 클래스에서 학사 학위를 받았으며, 언어와 시각의 교차 분야에 대한 연구 관심을 가지고 있습니다. 데이터 효율성이 더 높고 일반화 능력이 강한 스마트 아티브를 구축하고자 합니다.
린루 치우는 현재 MIT 전기공학 및 컴퓨터과학 학과와 컴퓨터과학 및 인공지능 연구실의 박사과정 학생으로, 지도교수는 윤 킴과 제이콥 안드레아스입니다.
그의 연구 분야에는 자연어 처리와 머신러닝이 포함되며, Google Research 및 Meta FAIR에서 연구를 진행했습니다.
Cathy Wu는 현재 MIT 토목 및 환경 공학과, 데이터 시스템과 사회 연구소의 부교수로, 기계 학습과 강화 학습을 이용하여 교통 등 복잡한 시스템을 개선하는 방법에 대해 연구하고 있습니다.
그녀는 MIT에서 학사 및 공학 석사 학위를 받았고, 그 후 캘리포니아 대학교 버클리 분교에서 박사 학위를 취득했습니다.
허카이밍은 현재 MIT 전기공학 및 컴퓨터과학 학과의 정회수교수이며, ResNet, Mask R-CNN, MAE와 같은 연구의 주요 저자이기도 합니다.
그는 톈진대학교에서 학사 학위를, 홍콩 중문대학교에서 박사 학위를 받았습니다. 마이크로소프트 아시아 연구소와 FAIR에서 근무했으며, 2024년에 MIT에 합류했습니다.
참고 링크
[1]https://arxiv.org/pdf/2610.02200