量子位

코드로 세계를 만들고, 확산으로 현실을 그리다: AgentGarten이 에이전트가 실시간 시련장에서 놀며 진화하도록 하다

AI가 반복해서 시행착오를 겪을 수 있는 '훈련장'이 등장했다

이미지 출처 · 量子位

윤중(允中), 아페이쓰(凹非寺)에서 발송

양자위(量子位) | 공식 계정 QbitAI

막판 하나를 밀면 통로가 막히고, 경사로 하나를 옮겨 오면 높은 벽도 넘을 가능성이 생긴다.

모든 행동은 세계를 바꾸며, 바뀐 세계는 다시 에이전트의 다음 의사결정 출발점이 된다.

이런 세계가 코드로 구축되고 확산 모델로 실시간에 그려질 수 있다면, AI는 반복적으로 탐색할 수 있는 「시련장」을 갖게 된다. 직접 행동하고, 결과를 관찰하고, 가설을 검증한 뒤, 그 경험을 다음 라운드로 가져가는 것이다.

이것은 MirroS 팀이 최근 공개한 AgentGarten이다. 이는 실행 가능한 코드 환경과 실시간 신경 렌더러를 연결한다. 코드는 물리 규칙을 정의하고, 모델은 시각적 피드백을 생성하며, 30 fps를 넘는 처리량으로 에이전트가 세계와 지속적으로 상호작용할 수 있게 한다.

고전적인 숨바꼭질 실험에서 변화는 빠르게 일어났다. 숨는 쪽은 4라운드에 막판을 옮겨 은신처를 만드는 법을 배웠고, 찾는 쪽은 10라운드에 경사로를 이용해 벽을 넘는 방법을 익혔다. 한 번의 점프가 실패한 후, 찾는 쪽은 경사로를 능동적으로 가까이 옮기고 위치를 조정한 뒤 다시 시도했다.

이러한 전략의 진화를 이끈 것은 에이전트가 스스로 작성한 「실험 매뉴얼」이다.

라운드가 끝날 때마다 그들은 시도를 복기하고, 발견을 기록하고, 의문점을 표시한다. 다음 라운드에서는 이 경험을 가지고 계속 탐색한다.

코드는 세계가 작동하게 하고, 실시간 렌더링은 세계가 보이게 하며, 지속적인 훈련은 경험이 끊임없이 쌓이게 한다.

AgentGarten은 이 셋을 하나의 순환 고리로 연결하여 더 큰 문제를 탐구한다:

에이전트가 행동하고, 시행착오를 겪고, 경험을 쌓을 수 있는 세계를 갖게 된다면, 지능은 그 안에서 어떻게 지속적으로 진화할 것인가?

전체 블로그: https://mirros.ai/blog/worlds-for-evolving-agents
기술 보고서: https://mirros.ai/report/agent-garten.pdf
코드: https://github.com/MirroS-Lab/AgentGarten
프로젝트 홈페이지: https://mirros-lab.github.io/agent-garten

△그림 1|대국에서 창발한 세 가지 전형적인 대립 전략. 막판을 옮겨 은신처를 막기, 경사로를 설치해 높은 벽 넘기, 첫 점프 실수 후 능동적으로 조정 후 재시도.

에이전트에게 부족한 것은 반복해서 연습할 수 있는 세계이다

AI가 물리 세계를 진정으로 이해하게 하려면 방대한 영상을 보여주는 것만으로는 턱없이 부족하다. 수영을 배우는 데 동영상만 보는 것으로는 안 되듯이, 에이전트는 반드시 직접 '필드에 나가', 즉 행동을 취하고 실제 결과를 관찰한 뒤 다음 단계를 결정해야 한다.

이를 위해서는 물리적 인과의 확정성을 갖춘 환경이 필요하다. 밀어낸 상자는 반드시 제자리에 남아 있어야 하고, 막아버린 통로는 반드시 통행할 수 없어야 하며, 이후의 모든 행동은 이러한 물리적 변화에 지속적으로 구속되어야 한다.

현재의 두 가지 주류 기술 경로는 각각 한계가 있다:

전통적인 코드/게임 엔진 환경은 상태가 정밀하고 규칙이 투명하며, 모든 물리 충돌이 하나하나 명확하다.

하지만 약점은 화면에 있다. 절차적으로 구축된 장면은 대개 조악한 기하학적 흰색 모형과 반복되는 텍스처만을 가진다. 수백, 수천 개의 오픈 장면 모두에 사실적인 빛과 질감을 갖추려면 필요한 아트 모델링과 엔지니어링 투자가 천문대다 숫자이다.

영상 생성을 핵심으로 하는 월드 모델(各종 영상 대형 모델 등)은 놀라운 고화질 화면을 생성할 수 있고, 동작에 따라 후속 프레임을 생성할 수도 있다.

하지만 문제는 물리 정보가 완전히 신경망의 기억 속에 암묵적으로 숨겨져 있어, 조회 가능하고 개입 가능한 명확한 상태를 제공할 수 없다는 점이다. 컵에 물이 얼마나 남았는지 확인하거나, 로봇 팔로 나사를 조이게 하거나, 엄격한 작업 심판 규칙을 만들고자 할 때, 순수한 영상 블랙박스 안에서는 한 걸음도 나아가기 어렵다.

MirroS의 해법은 다음과 같다:둘이 각자의 역할을 수행하게 하여, 물리는 코드에 맡기고 빛과 그림자는 신경 모델에 맡긴다.

코드가 세상을 추진하고, 모델은 '보이는 모습'을 담당한다

AgentGarten에서 표준적인 상호작용 폐쇄 루프는 다음과 같이 작동한다:

에이전트가 동작 명령을 내리면; 코드 환경이 즉시 물리 충돌과 상태 갱신을 계산하고, 에이전트의 1인칭 카메라 시점에서 경량화된 '기하 스케치'(즉 공간 깊이 또는 표면 법선)를 내보낸다;

이후 신경 렌더러가 이 기하 스케치를 읽어 들이고 이전의 시각 기억과 결합하여, 실사에 가까운 다음 프레임을 순간적으로 렌더링해 에이전트에게 전달한다.

△그림 2|코드 환경과 신경 렌더러의 폐쇄 루프 흐름. 에이전트가 동작 명령을 내리면, 코드 세계가 상태를 갱신하고 기하 조건을 내보내며, 신경 렌더러가 다음 시각 관측을 실시간으로 생성한다.

이러한 분업은 두 가지 질적 도약을 가져왔다:

첫째, 물리 법칙은 언제나 "확정 가능하고 통제 가능"하다.

씬 레이아웃, 충돌 판정 및 게임의 승패는 모두 코드로 판정되며, 어떠한 '환각 물리'도 발생하지 않습니다.

둘째, 새로운 세계를 구축하는 것이 매우 빨라졌습니다.

과거에는 100개의 사실적인 시뮬레이션 환경을 구축하려면 전문 아트 팀이 모델링, 텍스처링, 라이팅 작업을 해야 했고, 비용이 감당하기 어려울 만큼 높았습니다. 그러나 AgentGarten에서는 간단한 3D 깊이와 노멀 윤곽만 출력할 수 있다면 어떤 미니멀한 코드 장면이라도 이 신경 렌더러를 그대로 적용해 순간적으로 사실적인 조명과 재질을 얻을 수 있습니다. 윙슈트 비행, 로봇 팔 조작, 주방 요리, 다차 경주까지 모두 동일한 시각 인터페이스를 공유합니다. 가상 환경 확장 비용이 처음으로 "아트 노동 집약형"에서 "코드 프로그래밍 방식 확장형"으로 바뀐 것입니다.

△图3|다양한 과업을 아우르는 물리 세계. 공간 내비게이션, 물체 조작, 카메라 워크 재촬영, 다중 차량 상호작용 등을 포함한다. 왼쪽은 코드로 내보낸 간이 화이트 모델이고, 오른쪽은 렌더러가 실시간으로 생성한 사실적인 영상이다.

더욱 중요한 것은, 이 렌더러가스트리밍 생성되는: 동작이 한 걸음 진행되면 화면이 한 구간을 그려내고, 에이전트가 결과를 명확히 파악한 뒤 다음 의사결정을 내리는 방식으로, 상호작용이 실제 세계처럼 끊김 없이 자연스럽게 이어집니다.

숨바꼭질 재방문: 2500만 판과 4회차

세계는 만들어졌고, 이제 주목할 것은 에이전트입니다: 이러한 세계에서 반복적으로 행동하고 복기하면서, 스스로 점점 더 잘해나갈 수 있을까요?

고전적인 참고 사례는 OpenAI의 2019년 숨바꼭질 실험이다: 숨는 쪽과 찾는 쪽이 가림막과 경사로가 놓인 장소에서 대결했고, 대규모 자기 대국을 거치며 차례로 엄폐물을 쌓는 법과 경사로를 이용해 벽을 넘는 법을 학습했다.

MirroS 팀은 AgentGarten에서 이 실험을 다시 수행했으며, 일대일 설정을 채택했다: 숨는 사람이 먼저 장면을 꾸민 다음, 찾는 사람이 등장할 차례가 된다.

대전 규칙은 명확하고 순수합니다. 숨는 쪽이 먼저 장면을 배치해 입구를 막은 뒤, 찾는 쪽이 장면에 들어와 수색합니다. 에이전트는 Python 코드를 작성해 이동과 잡기를 제어하며, 눈앞에 생성된 화면만 보고 판단하고, 공간 좌표나 상대의 위치는 전혀 알지 못합니다.

양측은 완전히 빈 매뉴얼에서 출발하여, 각각 개별 스킬로 구성된 전략 라이브러리를 관리한다. 매 라운드마다 10판씩 대결한 뒤 복기를 통해 축적하고, 다음 라운드에서는 스킬 라이브러리의 일부를 무작위로 추첨하여 적용한다.

곧이어 그 고전적인 게임 전략들이 수 차례 안에 잇달아 등장했습니다: 판막을 옮겨 문을 막고, 경사로를 옮겨 다리를 놓으며, 담을 넘다 실패한 뒤 경사로를 끌어당겨 다시 시도하는 것이었습니다.

2019년의 연구는 이러한 고전적인 행동들이 나타난 것으로 유명하며, 직관적인 대조를 제공한다(그림 4 참조): 그 연구에서 AI는 처음부터 시작하는 강화 학습에 의존해 은신처 건설을 스스로 익히기까지 약 2500만 판을 거쳤고, 경사로를 이용해 벽을 넘는 방법을 배우는 데는 약 1억 판이 걸렸다.

한편 AgentGarten에서는 에이전트가 1인칭 시각 화면을 마주하고 라운드 사이에 복기하며 텍스트 매뉴얼을 수정하는데, 숨는 쪽은 4라운드에서 엄폐물을 만드는 법을 익혔고, 찾는 쪽은 10라운드에서 경사로를 이용해 담을 넘는 방법을 터득했다.

△그림 4|대표 전략이 등장하기까지의 대국 규모 비교. 셀프플레이 RL은 특권 물리 상태에서 수천만에서 수억 판을 제로부터 학습하는 반면, MirroS 에이전트는 1인칭 렌더링 화면을 기반으로 행동하며 턴별 반성 매뉴얼을 통해 몇 판 만에 해당 전략을 빠르게 습득한다.

즐기면서 기록하고, 경험을 글로 남기다

Hide-and-seek에서의 빠른 발전은 일련의 보편적인 훈련 과정 덕분이었다.

MirroS의 방식은 다음과 같다:에이전트가 스스로 "노트를 기록하게 하기". 그것이 학습한 모든 인지는 한 권 한 권의 매뉴얼에 기록된다.

훈련은 엄격한 4단계의 점진적 절차로 나뉘었다:

  • 임무 수령: 임무 파일을 받아 행동 목표와 규칙상의 금지선을 명확히 파악하지만, 표준 정답은 전혀 주어지지 않는다.
  • 블라인드 박스 시행착오: 엄격한 걸음 수와 시간 제한 하에서 자율적으로 행동합니다. 카메라 화면만 있을 뿐, 절대 좌표도, 미니맵도 없으며, 게임이 끝나기 전에는 점수도 볼 수 없습니다.
  • 매뉴얼 작성: 한 라운드가 끝나면 스스로 복기하며 성실히 기록한다. 무엇을 시도했는지, 어떤 현상을 보았는지, 어떤 판단이 의심스러운지, 다음에 어떤 새로운 가설을 검증할지 말이다.
  • 봉인 계대배양매뉴얼은 아카이브 동결되어, 그대로 사전 유산으로서 다음 라운드의 에이전트에게 인계된다.
△图5|단일 라운드 훈련 폐쇄 루프: 과제를 읽고, 행동하고, 매뉴얼을 작성하고, 아카이브합니다. 다음 라운드의 에이전트는 선배들이 축적한 매뉴얼을 출발점으로 탐색을 이어갑니다.

이러한 에이전트가 작성한 매뉴얼들을 살펴보면 과학적 탐구의 색채가 짙다는 것을 알 수 있다. 모델은 "실제로 목격한 사실"과 "머릿속으로 추측한 것"을 엄밀하게 구분하며, 후대를 위해 함정 방지 가이드를 특별히 표시해두기도 한다.

  • 은신술 사용자는 실전 진리를 요약했다: '수비의 핵심은 통로를 막는 것이지, 단순히 시야를 가리는 것이 아니다”라고 후대들에게 경계하며, 사각지대를 활용해 틈새 발생을 줄이고, 작은 폭으로 움직여보며 막히는 효과를 시험하라고 일렀다;
  • 탐색자들은 제어 법칙을 터득해냈다: “물건을 옮기기 전에 먼저 한 번 당겨보고, 끼어서 멈춘 것을 단단히 잡은 것으로 착각하지 말라”, 가까이 다가간 후 먼저 미세 당김 키를 한 번 눌러, 물체가 방의 기준점에 상대적으로 움직이는지 확인함으로써 진정으로 잡았는지 검증한다;
  • 한 다리를 건넌 운전자의 경고는 더욱 깊은 뜻을 담고 있다: “목표 원반이 차량 머리 쪽 사각지대로 미끄러져 들어갔다고 해서, 차가 이미 안전하게 도착한 것은 아니다”。

시련을 통과한 경험은 후계자들이 이어받았고, 실패한 교훈은 그들이 새로운 전략 분기를 시도하도록 이끌었다.

같은 순환을, 네 개의 세계를 바꿔가며 한 번 더 돌리기

Hide-and-seek은 시작에 불과하다. 코드 세계는 본질적으로 프로그래밍 가능한 소프트웨어 환경이기 때문에, 동일한 “탐색—복기—축적” 순환을 더 많은 복잡한 시나리오에도 손쉽게 복제할 수 있다.

팀은 또 다른 완전히 다른 네 개의 세계에서 각각 네 차례의 훈련을 수행했습니다:

  • 강아지 돌보기:에이전트는 60초 안에 손을 뻗어 쓰다듬고 적시에 공놀이를 하며 강아지의 호감도를 유지해야 합니다. 점수는 첫 라운드의 13점에서 4라운드의 19점으로 향상되었습니다.
  • 좁은 다리에서의 회차:두 대의 차가 운전 1인칭 시점을 바탕으로 서로 양보를 협상하며, 좁은 일차선 도로 위에서 가능한 한 짧은 시간 안에 차를 비껴가 양쪽 끝을 서로 바꿔 통과합니다. 두 차의 통관 총 소요 시간은 71초에서 41초로 크게 단축되었습니다.
  • 협동 목양:두 마리의 목양견이 오직 자신의 시선만으로 묵묵히 협력하여 네 마리의 양을 양우리로 몰아 넣고 5초간 유지해야 합니다. 1라운드에서는 시간 초과로 세 마리만 들어갔지만, 이후 세 라운드에서는 '한 마리도 빠짐없이' 안정적으로 모두 들어가는 데 성공했습니다.
  • 채석장 로더:중형 로더는 돌을 밀고, 자재를 공급하고, 창고에 입고해야 합니다. 1라운드에서는 겨우 돌을 밀어내는 수준이었지만, 4라운드에서는 360초 제한 시간 안에서 31초를 남기고 전체 과정을 깔끔하게 완주할 수 있게 되었습니다.
△그림 6|네 개의 태스크 세계에서의 네 라운드 진화 비교. 강아지 돌보기, 좁은 다리 회차, 협동 목양, 채석장 로더 모두 안정적인 행동 진화를 보여줍니다

이렇게 폭이 매우 넓은 태스크들이 시사하는 바는 하나입니다. 이 경험 축적 폐쇄 루프는 완전히 다른 세계로 옮겨도 똑같이 작동한다는 것입니다.

화면은 어떻게 동작을 따라가는가: 싱글 카드 30프레임의 비결

에이전트가 가상 세계에서 '보면서 행동'하게 하려면, 신경 렌더러는 생성형 비디오를 오랫동안 괴롭혀 온 세 가지 큰 산을 넘어야 합니다:갑작스러운 동작을 따라가고, 초장기 상호작용을 안정적으로 유지하며, 충분히 빠르게 실행하는 것。

MirroS 팀은 기반 올모달리티(full-modal) 모델에서 출발하여Adversarial Forcing훈련 방법을 제안했고, 여기에 추론 최적화를 결합하여 이 시각 채널을 개통했습니다:

1. 전체 오프라인 생성에서 스트리밍 방식의 청크 단위 렌더링으로

기존 비디오 모델은 한 번에 전체 비디오를 생성하는 데 익숙했지만, AgentGarten은 이를 스트리밍 방식의 청크 단위 생성으로 개조했습니다. 에이전트가 하나의 동작을 하면 모델이 즉시 대응하는 짧은 화면 청크를 생성하고, 결과를 확인한 뒤 다음 단계를 결정합니다.

2. 장기 상호작용에서도 흐트러지지 않음(정확한 리플레이)

연속 생성이 길어질수록 미세한 오차가 쌓여 외관이 흐트러지기 쉽습니다. 많은 모델이 메모리를 절약하기 위해 과거 계산 그래프를 끊어 그래디언트가 과거 기억으로 역전파될 수 없습니다. 또한 두 번째 패스에서 전체 시퀀스를 일괄 재계산하면, 저수준 실행 순서의 미세한 차이가 수 퍼센트에 달하는 오차를 초래합니다.

팀은 정확한 리플레이 메커니즘을 설계했습니다. 첫 번째 패스는 그래디언트 없이 포워드로 전개하고, 두 번째 패스는 완전히 동일한 청크 단위 리듬에 따라 그래디언트를 붙여 다시 실행함으로써 추론 궤적을 정확히 재현하고, 장시퀀스 상호작용의 시간적 일관성을 안정적으로 유지했습니다.

3. 실제 비디오 대결 도입: 화질 저하와 아티팩트 방지

모델 자신이 생성한 샘플만으로 점수 증류를 하면, 장시간 추론 시 왜곡이 생기고 격자 모양 아티팩트가 나타나기 쉽습니다.

팀은 훈련에 실제 비디오 판별기를 도입해 대적 신호를 구축하고, 실제 물리 화질을 앵커로 삼아 화면의 질감을 구속하는 동시에 생성 결과가 코드가 제시한 기하학적 윤곽에 엄격히 부합하도록 했습니다.

4. 30fps 이상의 실시간 상호작용 유지

팀은 Triton 융합 연산자를 직접 손으로 작성해 GPU 메모리 왕복을 제거하고, 기존 전체 그래프 컴파일의 수 분에 달하는 콜드 스타트 대기를 피했습니다. 여기에 CUDA Graph를 활용해 CPU 스케줄링 오버헤드를 제거하고, 지연 시간이 10밀리초 미만인 초경량 디코더로 교체하여, 최종적으로 480p 해상도에서 30fps 이상의 처리량으로 폐쇄 루프 상호작용을 안정적으로 지원했습니다.

끊임없이 진화하는 에이전트를 위해, 경험할 수 있는 세계를 준비하다

실행 가능한 코드는 훈련 세계가 무한히 프로그램적으로 생성될 수 있게 하고, 학습된 렌더러는 이 세계들이 지각 가능한 사실적인 물리 피드백을 갖도록 하며, 축적된 실험 매뉴얼은每一次의 모색이 다음 탐구의 디딤돌이 되게 합니다.

이 세 가지를 결합하면, 에이전트는 진정으로 탐색하고, 시행착오를 겪고, 진화할 수 있는 공간을 갖게 됩니다.

이것이 바로 MirroS가 탐구하는 Physical RSI(물리 세계의 재귀적 자기 개선)의 핵심 이념입니다.

언어 모델의 스케일링이 한창 진행되고 있는 가운데, 물리 세계에서의 지능의 스케일링은 이제 막 막이 오르고 있습니다.

진정한 범용 구현 지능은 물리 세계와의 실제 왕복 속에서 지속적으로 성장해야 합니다:

모든 미지의 것이 다음 진화의 출발점이 되도록 하십시오.

전문 Blog: https://mirros.ai/blog/worlds-for-evolving-agents

*본문은 quantumbit(퀀터웨이)가 승인을 받아 게재한 것으로, 견해는 원저자에게 귀속됩니다.

원문 출처

量子位

내용 안내

원문 발행 및 권리는 출처에 있습니다.

기계 번역 · 원문을 참고하세요