雷峰网 AI

우자준(吴佳俊) IROS 2026 강연: 구조화된 표현은 답이 아니라, 로봇이 추론을 배우게 하는 비계다 | IROS 2026

구조화된 표현에서 시연 없는 학습으로 가는 길. 작성자丨우스멍(吴思梦) 편집丨총펑(岑峰) 접시 하나, 수도꼭지 하나, 푸른 주방세제 한 덩어리. 우자준은 이처럼 기술적인 요소가 거의 없는 주방 장면으로 IROS 2026에서의 강연을 시작했다. 한 학생이 주방세제를 짜고 수도꼭지를 열고 절반쯤 씻다가 잠시 자리를 떠났다. 이제 로봇이 이어받는다. 언뜻 보면 과제는 단순명료하다: 접시를 깨끗이…

구조화된 표현에서 시연 없는 학습으로 가는 길.

    작성자丨우스멍(吴思梦)

편집丨총펑(岑峰)

                                                                                                       

접시 하나, 수도꼭지 하나, 푸른 주방세제 한 덩어리. 우자준은 이처럼 기술적인 요소가 거의 없는 주방 장면으로 IROS 2026에서의 강연을 시작했다. 한 학생이 주방세제를 짜고 수도꼭지를 열고 절반쯤 씻다가 잠시 자리를 떠났다. 이제 로봇이 이어받는다. 언뜻 보면 과제는 단순명료하다: 접시를 깨끗이 씻고 다시 제자리에 놓는 것. 하지만 로봇이 실제로 처리해야 하는 것은 ‘접시 씻기’라는 세 글자가 아니다. 로봇은 먼저 눈앞의 어느 것이 접시인지 알아야 한다. 이 접시가 실제로 더러운지 아닌지 알아야 하고, 접시 위에 저 푸른 주방세제 한 덩어리가 있는지 주의해야 한다. 또 수도꼭지가 지금 열려 있는지, 접시가 이미 씻겼는지, 그리고 접시를 들어 올린 후 탁자 위에 새로운 문제가 드러났는지도 알아야 한다. 같은 과제라도 초기 상태가 바뀌면 답은 완전히 달라질 수 있다. 접시가 이미 씻겼다면 다시 씻을 필요가 없다. 주방세제가 없다면 먼저 조금 짜야 한다. 접시 밑에 더러운 것이 깔려 있다면 ‘접시를 깨끗이 씻는다’는 것은 더 이상 접시를 선반에 놓는 것과 같지 않다. 인간은 이러한 변화에 직면했을 때 자신이 복잡한 추론을 했다고 느끼는 경우가 드물다. 우리는 그냥 한 번 보고 계속한다. 하지만 로봇에게 매번 ‘한 번 보고 계속한다’는 행위 뒤에는 하나의 질문이 숨어 있다. 로봇은 과연 눈앞의 세계를 무엇으로 이해했는가? 9월 27일, IROS 2026 개막일에 스탠퍼드 대학교 컴퓨터과학과 조교수 우자준은 RoBoWoMo 워크숍에서 《Building Physical Agents via Structured Representations》라는 제목의 초청 강연을 발표했다. 지난 몇 년 동안 그는 이미지 속에서 시각 이면에 숨겨진 세계, 즉 기하학, 재질, 물리적 속성, 그리고 물체 간의 관계를 복원하는 방법을 연구해 왔다. 이제 이러한 문제들이 로봇이 실제로 사는 물리적 세계에 놓이면, 또 다른 문제들이 뒤따라 나타난다. 로봇은 어떤 방식으로 과제를 기술해야 하는가? 이러한 기술을 스스로 학습할 수 있는가? 훈련 데이터에 한 번도 등장하지 않은 물체를 마주할 때, 모델은 언제 후속 훈련이 필요한가? 만약 계획 자체도 학습할 수 있다면, 전통적인 플래너는 여전히 필요한가? 마지막에는 문제가 더 이상 ‘로봇이 인간이 어떻게 하는지 보았는가’가 아니다. 시연도 없고, 텔레오퍼레이션 데이터도 없고, 심지어 한 번도 본 적 없는 수도꼭지를 마주했을 때에도, 로봇은 그것이 어떻게 사용될 수 있는지 스스로 생각해 낼 수 있는가?以下은 우자준이 IROS 2026에서 발표한 강연의 편집본이다. 라이펑왕(공식 계정: 雷峰网)·AI 테크 리뷰는 현장의 영어 강연을 바탕으로 편집했으며, 원래의 취지를 바꾸지 않는 범위에서 구어적 표현과 기술 용어를 재정리했다.

▎구조화된 표현을 통한 물리적 에이전트 구축

발표자: 우자준, 스탠퍼드 대학교 컴퓨터과학과 조교수 (심리학과 조교수 겸임)

01


접시 하나가 왜 로봇을 곤란하게 만드는가

오늘 제가 말씀드리고 싶은 것은, 어떻게 구조화된 표현을 사용해 물리적 세계에서 일을 할 수 있는 에이전트를 구축하는가입니다. 먼저 시각부터 이야기하겠습니다. 결국 당신이 볼 수 있는 것은 이미지뿐이고, 이미지 뒤에는 온 세계가 서 있습니다. 기하학, 재질, 다양한 물리적 속성입니다. 우리의 연구 주제는 줄곧, 이런 것들이 어느 정도까지 복원될 수 있는가였습니다. 그리고 일단 이것들을 복원하고 나면, 당신은 이 세계를 다시 만들어 낼 수 있습니다. 최근 몇 년 동안 또 하나 활발한 방향은, 디지털 공간 속의 에이전트입니다. 이들은 명령을 받아 온 세계와 상호작용합니다. 그러면 자연스럽게 또 다른 질문이 떠오릅니다. 물리적 세계에도 같은 구조가 있는가? 디지털 세계에는 디렉터리가 있고, 디렉터리 안에 파일이 있으며, 파일에는 속성이 있습니다. 물리적 세계에는 장면이 있고, 장면 안에 물체가 있으며, 물체에도 속성이 있습니다. 그렇다면 우리는 이 구조를 활용해 그 에이전트들을 디지털 공간에서 물리 공간으로 데려올 수 있을까요? 이것이 오늘 이 강연의 주제입니다. 일단 정말로 로봇이 인간과 같은 세계에 함께 있게 만들려면, 일이 어려워집니다. 이 세계는 복잡하고, 동적이며, 다양합니다. 수많은 서로 다른 과제를 다뤄야 합니다. 물론 기반 모델을 써야 합니다. 지금은 점점 강해져서, 사용하지 않으면 도저히 말이 안 된다고 느껴질 정도입니다. 하지만 사용하는 방식은 매우 다를 수 있습니다. 후속 훈련을 할 것인가, 더 많은 구조를 도입할 것인가, 어떤 추가 지식을 넣을 것인가, 넣은 후에 기존 부분과 어떻게 결합할 것인가. 이 모두는 아직 정해지지 않은 선택입니다. 그리고 로봇에 특히 관련되고 디지털 세계와 매우 다른 지점이 하나 더 있습니다. 디지털 세계는 상당 부분 언어로 통일되었지만, 로봇 쪽은 사정이 다릅니다. 서로 다른 분야, 서로 다른 과제, 많은 경우 전용 장면, 전용 데이터이며, 로봇마다 모두 다릅니다. 이런 데이터는 대형 모델을 훈련한 그 방대한 말뭉치에는 등장하지 않습니다. 그래서 문제는 이렇게 됩니다. 어떻게 이 장벽을 넘을 것인가. 추상적인 이야기가 길었으니, 전혀 전용적이지 않은 장면에서 시작해 봅시다. 아주 평범한 주방 장면입니다. 이런 장면에서조차 로봇 시스템이 정말로 인간과 함께 일하려면 무엇이 필요한지 살펴봅시다. 한 학생이 접시에 주방세제를 짜고, 수도꼭지를 열고, 그러다 급한 일이 생겨 자리를 떠났습니다. 이제 로봇이 하게 됩니다. 당연히 먼저 의미적 추론 층을 해야 합니다. 이 도자기 식기 더미 중 어느 것이 제가 씻어야 할 것인가? 이 접시입니다. 이 단계는 오늘날 시각 모델로 비교적 쉽게 할 수 있습니다. 이어서 로봇은 이 접시가 씻어야 할 것임을 이해해야 합니다. 주방세제는 이미 짜졌고, 수도꼭지는 이미 열려 있습니다. 그러니 제가 할 일은 접시를 들어 올리고, 씻고, 선반에 놓고, 수도꼭지를 잠그는 것입니다. 깔끔해 보입니다. 하지만 진짜 어려운 점은, 서로 다른 환경, 서로 다른 물체, 서로 다른 목표 사이에서 어떻게 일관성을 유지하느냐입니다. 이미 매우 단순한 이 장면에서도 완전히 다른 몇 가지 상황이 튀어나옵니다. 첫 번째는, 남의 행동에 적응해야 하는 경우입니다. 예를 들어 누군가 들어와서 접시를 씻고 탁자에 다시 놓았습니다. 이때 당신은 접시가 이미 씻겼으니 다시 씻을 필요가 없다는 것을 알아야 합니다. 할 일은 그저 다시 제자리에 놓는 것뿐이고, 수도꼭지를 잠글 필요도 없습니다. 이미 잠겨 있기 때문입니다. 두 번째는, 초기 상태 안의 아주 미세한 차이입니다. 모든 것이 이전과 같고 유일한 차이는 이 접시에 주방세제가 없다는 것뿐이라고 합시다. 그림 전체를 보면 이 차이는 매우 작습니다. 그저 작은 파란 덩어리일 뿐이라 쉽게 보이지 않습니다. 하지만 이것은 ‘미세한 차이’ 한마디로 넘어갈 수 있는 것이 아닙니다. 상태 표현상의 정성적 차이입니다. 왜냐하면 접시에 주방세제가 묻지 않았다면, 당신은 그것을 씻으면 안 될 가능성이 높고, 바로 씻는다면 엉망이 되기 때문입니다. 먼저 주방세제를 바르고, 그다음 씻고, 그다음 선반에 놓고, 나머지 일을 마쳐야 합니다. 입력의 차이는 작지만, 상태의 차이는 정성적이며, 해야 할 행동도 완전히 다릅니다. 세 번째는, 계속 갱신되는 관측을 따라가야 하는 경우입니다. 예를 들어 로봇이 접시를 들어 올려 선반에 놓으면 그걸로 충분합니다. 이미 깨끗하고 수도꼭지를 잠글 필요도 없습니다. 하지만 접시 밑에 더러운 것이 깔려 있습니다. 이때 당신은 이렇게 인식해야 합니다. 제 목표가 정말 모든 것을 깨끗하게 하는 것이라면, 탁자를 닦아야 합니다. 누구도 그렇게 지시한 적 없지만, 새로운 관측을 따라가다 보니 이해하게 된 것입니다. 이상적으로는 그 접시에 담긴 것을 다시 제자리에 놓아야 할 것입니다. 하지만 우리는 이 단계조차 할 수 없습니다. 로봇의 하드웨어와 보유한 기술이 그것을 제한하기 때문입니다. 따라서 이 모든 서로 다른 상황에 적응할 수 있어야 합니다. 문제는, 어떻게 그렇게 하는가입니다.

02


로봇도 언어가 필요하다면

지난 몇 년 동안 우리는 한 패러다임을 계속 모색해 왔습니다. 구체적인 구현은 계속 바뀌었습니다. 기반 모델이 바뀌고 다양한 가능성도 바뀌기 때문입니다. 하지만 뼈대는 늘 이렇습니다. 한쪽 끝은 원시 입력, 즉 비디오나 언어입니다. 중간은 기반 모델이 조합성을 갖춘 추상들의 집합을 발견하는 것에 의존합니다. 이 추상들은 재사용 가능하고 다시 조합될 수 있어야 하며, 범용 과제에 대응해야 합니다. 다른 쪽 끝은 제어 동작이며, 가급적 스스로 발견하고 스스로 학습된 것이어야 합니다. 동작을 배우는 일에 있어, 우리는 소위 자연 감독으로부터 배우기를 바랍니다. 즉 전 과정이 학습되고 발견된 것이며, 인간의 개입은 적을수록 좋습니다. 당신이 주는 것은 단순히 비디오 한 편, 시연 한 번, 혹은 몇 마디 언어일 수 있고, 이제 이런 입력 자체가 처리될 수 있습니다. 감독이 가벼울수록 범용성이 좋아집니다. 하지만 이렇게 그림을 그리면, 종이 위에 일련의 문제들이 떠오릅니다. 이 조합성을 갖춘 추상들은 어떤 모습인가? 어떻게 발견되는가? 과제를 기술하는 그 전용 언어는 어디서 오는가? 애초에 그것이 필요 없다면? 계획은 어떻게 해결하는가. 전통적인 작업 플래너를 쓸 것인가, 아니면 플래너를 학습할 것인가? 그리고 이 세계 모델 자체는, 그냥 가져다 쓸 것인가, 아니면 미세조정이나 후속 훈련을 해야 하는가. 이 경로를 따라 다양한 구현이 있었고, 우리도 여러 버전을 시도해 왔습니다. 먼저 대략적인 구조를 높은 수준에서 말씀드리겠습니다. 가장 초기의 구현은 2년 전에 만들었고, 그때의 구체적 구성 요소는 지금보다 훨씬 조악했지만, 패러다임은 이미 분명했습니다. 당신에게 시演示(시연) 데이터가一批 있다고 합시다. 로봇이 현장에서 많은 서로 다른 과제를 한 번씩 수행하게 하고, 전 과정에서 핵심 지점을 잡아낼 수 있습니다. 예를 들어 첫 단계에서 그릇을 잡고, 둘째 단계에서 수도꼭지 아래로 가져가 헹구고, 셋째 단계에서 선반에 넣는 것입니다. 다른 것일 수도 있습니다. 비디오 데이터도 괜찮습니다. 어쨌든 손에 이런 데이터一批가 있는 것입니다. 목표는 이 과제 이면의 한套 기술(description)을 학습하는 것입니다. 이것은 기호식 세계 모델의 집합과 비슷하며, 대략 두 개의 모듈群이 있습니다. 첫 번째 그룹은 당신이 관심을 갖는 속성과 공간 관계입니다. 이 물체가 더러운지, 더러운지 깨끗한지. 이 두 물체 사이는 어떤 관계인지, 2차원 관계, 3차원 관계. 이런 것들이 판정될 수 있어야 하며, 이것이 술어(predicate)들의 집합입니다. 판정은 당연히 사람이 규칙을 쓰는 방식이 아니라, 신경망과 기반 모델로 학습해야 합니다. 더러운지 아닌지든, 어떤 공간 관계든, 임의의 술어 집합을 판정하도록 학습시키는 것입니다. 두 번째 그룹은 동작입니다. 당신은 원자적 동작들의 집합을 가지고 있습니다. 예를 들어 ‘씻기’. 각 동작은 선행조건과 후행효과를 명확히 해야 합니다. 씻기 동작은, 먼저 물건을 손에 잡고 있어야 하고, 사람은 지금 주방에 있어야 합니다. 효과는, 이 물체에 주방세제가 묻어 있다면 깨끗해진다는 것입니다. 로봇 손에 물건을 잡고 있는지 어떻게 아는지, 물체가 깨끗한지 더러운지 어떻게 아는지는 앞의 술어 집합에 맡겨 판정합니다. 동시에 동작을 실제로 실행하려면 정책(policy), 즉 관절을 어떻게 움직일지가 필요합니다. 이 부분 역시 신경망이며, 각 원자적 동작에 하나의 확산 정책(diffusion policy)이 대응됩니다. 이렇게 되면 기호 층이 조합성을 정의합니다. 선행조건이 모두 충족되기만 하면, 이 원자적 동작들은 연결되어 더 길고 더 복잡한 과제로 이어질 수 있습니다. 그리고 지각과 제어는 전부 신경망이 하고 있습니다. 하지만 어떤 의미에서, 이것은 바로 하나의 전용 언어, 즉 영역 특화 언어(DSL)입니다. 그래서 매우 근본적인 문제가 놓여 있습니다. 초기에는 이런 것들이 사람이 직접 쓰거나 PDDL 같은 곳에서 그대로 가져왔고, DSL은 이미 고정되어 있었습니다. 그렇다면 충분히 범용인가? 왜 충분하다는 것인가? 안에 빠진 것이 있다면 어떻게 하는가? 그래서 다음 단계는 자연스럽게 DSL 자체도 학습 가능해야 한다는 것입니다. 기반 모델에게 손에 있는 데이터를 보게 할 수 있습니다. 시연 비디오일 수도, 조작 기록일 수도, 언어일 수도 있고, 그다음 이것은 우리가 관심을 갖는 과제라고 알려주면, 이어서 모델이 출력해야 합니다. 내 생각에 다음 속성들이 중요하고, 다음 원자적 동작들과 그 선행조건과 후행효과들이 중요하다고요. 그럼 모델이 틀리게 말하면? 검증할 수도 있습니다. 한편으로는 기호적으로 검증할 수 있고, 다른 한편으로는 직접 데이터로 검증할 수 있습니다. 예를 들어 시스템이, 무언가를 씻기 전에 반드시 손에 잡아야 하며 그렇지 않으면 씻을 수 없다고 했다고 합시다. 그러면 당신은 돌아가 자신의 데이터를 한 번 훑어봅니다. 내가 무언가를 씻을 때마다 정말로 먼저 잡았는가? 손에 있는 시演示(시연)나 다른 데이터, 공개된 것이든 전용이든, 이 규격(spec)을 검증하는 데 사용할 수 있습니다. 그래서 이 언어 자체도 또 다른 시스템이 제안하는 것입니다. 작년에 이 부분을 발표했을 때는 좀 어수선했는데, 올해는 좀 더 나았기를 바랍니다. 좋은 비유가 이것을 훨씬 명확하게 해 주기 때문입니다. 이 비유는 바로 여러분의 컴퓨터 안에 있습니다. 코딩 에이전트에 ‘이것 좀 해줘’라고 붙여 넣으면, 스스로 열 단계 여덟 단계를 해냅니다. 첫 단계에서 파일을 만들고, 둘째 단계에서 어떤 작업을 실행하는 식으로 한 걸음씩 내려갑니다. 여러 가지 서로 다른 단계들이 있습니다. 잘 생각해 보면, 이것은 우리가 하려는 일과 매우 비슷합니다. 우리가 하는 일은 본질적으로 Cursor처럼 컴퓨터에서 일하는 에이전트를 물리 공간으로 옮기는 것입니다. 먼저 일련의 계획을 세우고, 그다음 이 일련의 동작을 실행해야 하며, 동시에 검증 층이 있어 이 동작들이 올바르게 정의되었고 올바르게 실행되었는지 확인해야 합니다. 대체로 이것입니다.

03


본 적 없는 것을 만났을 때, 모델은 어떻게 하는가

이제 언제 후학습(post-training)을 위해 자리에 앉아야 하는지 이야기해 보겠다. 물론 앞서 든 비유처럼 최전선 모델을 끝까지 그대로 밀고 가는 것이 가장 편하다. 하지만 로봇 쪽에는 피할 수 없는 문제가 하나 있다. 다루게 될 것은 아마 이전에 한 번도 본 적 없는 물건일 수 있다는 것이다. 물리 세계는 디지털 세계보다 훨씬 분절되어 있기 때문이다. 어떤 모양의 물체를 본 적이 있을 수 있지만, 더 흔한 경우는 당신 공장에만 있고 다른 어디에도 없는 생산 라인용 부품 한 줄을 다루게 되는 것이다. 나는 이 부품을 본 적이 없는데, 지금 그것이 더러운지 판단하고 어떤 효과가 생겼는지 판단해야 한다. 이때는 당연히 공개된 최전선 모델을 바로 가져다 쓸 수 없다. '이 부품이 좋은지 나쁜지'에 대한 정의조차 모르기 때문이다. 그래서 실제로 후학습을 조금 해야 하는 상황이 존재한다. 전제는 당신이 그런 기성 최전선 모델에만 의존하지 않기로 결정했다는 것이다. 그럼 어떻게 할까? 한 가지 유의할 점이 있다. 이런 효과들은 논리적으로 보이지만, 예컨대 세제가 묻어 있으면 씻고 나면 깨끗해진다 같은 것들 말이다. 하지만 구현 차원에서 보면 이것들은 근사적으로 쓰여 있고, 논리 연산은 최종적으로 대부분 확률의 형태로 존재한다. 그래서 전체 사슬을 이어 붙일 수 있다. 나는 이 물건에 세제가 있다고 하고, 내가 씻었으면 깨끗해졌어야 한다. 하지만 만약 '세제가 있는지 없는지'에 대한 판별 기준이 좋지 않다면? 이건 한 번도 본 적 없는 새 물체이기 때문에 판별해 내지 못하고, 출력이 틀리면 뒤따르는 것들이 전부 틀린다. 그리고 이때, 내 시연은 나에게 또 다른 사실을 알려 준다. 이 물체가 실제로 깨끗해졌다는 것이다. 그러면 당신은 하나의 라벨을 갖게 된다. 모든 실행 단계가 미분 가능하게 쌓여 있으므로, 시연 속의 이 실행 라벨로 역전파하여 모델에 감독을 줄 수 있다. 그래서 후학습은 어떤 상황에서는 할 수 있다. 필수는 아니지만, 이 모델들을 시스템의 모듈로 다루고 그 모듈들이 후학습을 필요로 한다면 이 길은 통한다. 2년 전의 그 결과들을 자세히 말하지는 않겠다. 그 구성 요소들은 지금 보면 이미 낡았고, 방법을 바꾸고 나니 당시 어떤 부분은 꽤 서툴게 했다는 것을 느끼게 된다. 하지만 그 패러다임 자체의 잠재력은 매우 크며, 우리는 이후 그 안의 서로 다른 구성 요소들을 각각 더 현대적인 버전으로 교체했다. 덧붙이자면, 그 연구 당시의 박사후 연구원 한 명은 지금 싱가포르 국립대학교 교수이고, 또 다른 협력자는 당시 MIT 박사과정 학생이었는데 지금은 교수가 되었다.

04


계획(planning)까지도 모델에 맡기기 시작하다

이제 좀 더 최근의 진전 몇 가지를 이야기하겠다. 조금 빠르게 말하겠다. 앞서 말했듯, 그 시스템의 모듈들은 한 층 한 층 자라 나왔고, 검증, 인식, 제어는 이미 신경망에 넘겨졌다. 하지만 아직 남아 있는 것이 하나 있다. 계획이다. 모든 모듈을 갖추고 상태도 검증했다면, 나는 먼저 씻어야 하는가, 아니면 다른 것을 먼저 해야 하는가? 이 단계는 당시에는 전통적인 것, 전통적 작업 계획의 계보에서 온 것을 아직 쓰고 있었다. 그리고 바로 최근, 우리는 바로 이 부분도 교체한 연구 한 편을 막 투고했다. 그래서 오늘 나에게 좋은 슬라이드가 없는 것이다. 원래는 영상이 하나 있어야 했고, 나는 정말로 영상을 원한다. 그러니 낙관적으로 말하면, 며칠 뒤에는 멋진 영상이 있을 것이다. 지금은 논문의 그림 한 장으로 우선 대신해야 한다. 이 아이디어는 이렇다. 여전히 신경망이 검증하는 상태들의 집합이 있다. 하지만 '현재 상태가 주어졌을 때, 먼저 씻어야 하는가, 접시를 먼저 집어야 하는가, 아니면 무엇을 해야 하는가'라는 일은 더 이상 전통적 플래너에 맡기지 않고 네트워크에 맡긴다. 좀 더 구체적으로 말하면, 그 술어 집합은 이제 기본적으로 자연어, 진짜 자연어이며, 자연어와 이미지를 함께 프롬프트로 기반 모델에 넣어 계획을 세우게 한다. 하지만 이것도 후학습을 거쳐야 한다. 그래서 여기서 우리는 어쩔 수 없이 오픈 웨이트 모델을 사용해야 한다. 직접 후학습을 해야 하기 때문이고, 동시에 이미지를 입력의 일부로 넣어야 하므로 모델이 이미지를 받아들일 수 있어야 한다. 그런데 알게 된 것은, 일부 오픈 모델의 시각 추론 능력은 아직 매우 떨어진다는 것이었다. 적어도 우리가 측정한 바로는 같은 시기의 클로즈드 모델보다 훨씬 못했다. 그래서 바로 가져다 쓰면 이들은 종종 완전히 말이 안 되는 것들을 출력한다. 실무적으로 우리는 몇몇 모델을 골라 역시 후학습을 했다. 이렇게 되면 플래너 자체마저 후학습되고 학습된 것이 된다. 그것은 이런 부호적(symbolic) 자연어를 활용해 계획을 세울 수 있고, 산출하는 행동 시퀀스는 실행 가능 확률이 훨씬 높다. 그리고 이런 장시간(long-horizon) 작업에게 이것은 필요한 인간 개입이 훨씬 적다는 것을 의미한다. 여기에는 또 하나의 도전이 있다. 이 모든 것은 스킬 라이브러리를 조건으로 하는데, 로봇마다 스킬 라이브러리가 다를 수 있다는 것이다. 어떤 최전선 모델을 바로 가져다 쓰면, 그것에는 당신의 스킬 라이브러리에 대한 맥락이 전혀 없다. 예컨대 그것은 '지금 수도꼭지로 이 머그컵을 가득 채워라'라고 말하지만, 정작 수도꼭지는 아직 차 있지도 않다. 이 행동은 실행 불가능하다. 그리고 후학습 후에는, 플래너가 이런 장시간 조작을 다룰 때 내놓는 행동이 실제로 실행 가능한 것처럼 된다. 며칠 뒤에 영상이 있을 것이고, 오늘은 최신 결과를 이렇게 잠깐 보는 것으로 하자. 지금까지 우리는 손에 시연이 있다고 계속 가정해 왔다. 영상 시연이든, 인간의 조작이든. 이어서 남은 시간에 말하고 싶은 것은, 만약 시연이 없다면? 만약 내가 만난 것이 완전히 새로운, 한 번도 본 적 없는 물체라면? 예전 방식은 이렇다. 한 번 시연해 보여 주고, 이 물체와 어떻게 다뤄야 하는지 알려 달라. 하지만 시연 영상 한 편, 인간의 도움 조차도 없이 스스로 이 물체와 다루는 여러 가능한 방식을 생각해 낼 수는 없을까? 예컨대 당신 앞에 새 물체들이 놓여 있다. 수도꼭지는 예전에 여는 법을 시연해 준 적 있다. 하지만 지금 이 수도꼭지는 내가 한 번도 써 본 적이 없는데, 당신은 그것과 상호작용할 수 있는 방식들이 어떤 것들이 있는지 알려 주는 샘플들을 생성해 낼 수 있는가? 이것이 우리가 탐구 중인 연구 하나다. 먼저 대략 형식화해 보자. 손에 정지된 물체 하나, 수도꼭지나 상자 하나만 있다고 하자. 이런 단일 시점의 정지 물체들로부터 하나의 분포를 학습하고, 그 분포에서 가능성 공간을 샘플링해 내는 시스템을 배울 수 있을까? 수도꼭지를 주면 돌릴 수 있는 형태를 샘플링하고, 상자를 주면 열기와 닫기, 그리고 서로 다른 이런 형태들을 모두 샘플링한다. 구체적 방법은 오늘은 빠르게 훑고 시간을 존중하겠다. 하지만 결과는 이렇다. 이 시스템을 한번 학습해 내면, 완전히 새로운 장면에 들어가 수많은 서로 다른 물체들 위에서, 하나의 모델로 가능한 상호작용 방식들을 추론할 수 있다. 모니터, USB 메모리, 꽃, 무엇이든. 그리고 그것이 내놓는 것은 단순 암기한 답이 아니라, 학습한 분포 안에서 가장 소박한 그 한 가지를 사용한 것이다. 이 물체에 나는 또 어떻게 접근할 수 있을까? 그렇다면 실제 세계에서는? 로봇이 한 방에 들어가면 인식은 매우 지저분하다. 그래서 우리가 한 일이 하나 더 있다. 학생 한 명에게 iPhone으로 방을 훑어 스캔하게 했다. iPhone은 실제로 3차원 스캔을 할 수 있지만 정밀도가 높지 않아, 스캔된 결과는 매우 시끄럽고 매우 비대해서 덩어리진 면들처럼 보인다. 이렇게 노이즈가 극심한 결과를 입력으로 우리 시스템에 넣어도, 놀랍게도 어느 정도 제로샷 일반화의 모습을 보인다는 것을 알게 된다. 식기세척기, 냉장고, 전자레인지를 놓고 그것과 어떻게 다뤄야 할지 추론할 수 있다. 이것은 로봇에게 훨씬 유용하다. 로봇은 당신이 한 번도 본 적 없는 방에 들어가기 때문이다. 입력이 그렇게 조악해도, 로봇은 여전히 이 특정 수도꼭지는 본 적 없지만 그것과 다루는 여러 방식을 추론할 수 있고, 서로 다른 접근 방법들을 상상해 낼 수 있으며, 이것으로 정책 하나를 발견할 수 있다고 말할 수 있다. 사무실 방도 같은 상황이었고, 재구성 결과 마찬가지로 비대했지만 노트북과 어떻게 다뤄야 할지 추론해 냈다. 하지만 이런 추론에는 아직 문제가 하나 있다. 그것은 이 물체와 상호작용하는 40가지 방식을 줄 수 있지만, 당신은 본래 어떤 목표를 달성하려는 것이고, 이 40가지 중 어느 것이 당신에게 정말 유용한지 모른다. 그래서 우리는 이 패러다임에 언어 조건을 붙여 더 잘 다룰 수 있게 할 수 없을까도 생각하고 있다. 예컨대 정지된 장면이 하나 있고, 한 문장의 언어를 준다. '어린아이가 시소 위로 뛰어오른다.' 움직이는 3차원 장면, 아니 4차원 장면을 만들어 낼 수 있을까? 그러면 그 안에는 인간과 물체의 상호작용이 있고, 아이가 뛰어오른 뒤 양쪽의 움직임이 있다. 이것이 훨씬 유용하다. 이어서 물을 수 있기 때문이다. 로봇은 이 물체와 어떻게 상호작용해야 하는가? 그러면 생성하면 된다. 이 방향으로도 생성할 수 있고 저 방향으로도 생성할 수 있고, 그다음 정말 문제를 해결해 주는 행동을 골라 낸다. 어떻게 할까? 역시 대량의 사전학습 생성 모델에 의존해야 한다. 이 연구에서 우리가 주로 의존한 것은 영상 확산 모델이다. 이 정지 장면을 손에 넣었다고 하자. 아주 지저분할 수 있고, 어떤 상황이든 상관없다. 이것을 수천 개의 점 같은 중간 표현으로 바꾸고, 여기에 차원 하나를 더 추가할 수 있는데, 그것은 시간이다. 그러면 4차원 표현을 얻는다. 하지만 3차원을 4차원으로 바로 올리면 그것은 정적이다. 어떻게 움직이게 할까? 여기 방법이 하나 있다. 정지된 형태 하나만 있고 그것을 더 사실적으로 만들고 싶다면, 사람들에게는 점수 증류 샘플링(Score Distillation Sampling, SDS)이라는 기술이 있다. 일반 3차원에서의 방식은 이렇다. 이 형태를 렌더링해 서로 다른 시점의 영상을 얻고, 이것을 영상 확산 모델에 넣어, 그것으로 시간 방향을 따라 이 표현을 앞으로 갱신한다. 같은 일을 4차원에서도 할 수 있다. 실무적으로는 매우 어렵다. 수많은 문제에 대한 방법을 강구해야 하고, 4차원 표현 위에서 데이터 구조 설계도 해야 한다. 하지만 개념적으로는, 바로 이렇게 영상 모델과 사전학습된 확산 모델로 당신을 이끌어 사실적인 인간-물체 혹은 로봇-물체 상호작용 시퀀스를 만들어 내는 것이다. 결과를 두 가지 더 예로 들자. 예컨대 벽돌 하나와 '로봇이 벽돌을 집고 있다'라는 문장이 있으면, 로봇이 벽돌을 집는 상호작용 시퀀스를 만들어 내어, 서로 다른 언어 조건 아래 이 상호작용이 어떤 모습일지 볼 수 있게 한다. 공짜 시연들을 덧붙일 수도 있고, 이 공짜 시연들로부터 스킬을 학습할 수 있다. 예전에는 인간 조작 영상이나 텔레오퍼레이션 데이터가 있어야 스킬을 학습하고 계획에 연결할 수 있었다. 이제는 인간의 시연조차 없이 내가 직접 시연을 만들어 내고, 이 시연들로부터 스킬을 학습한 뒤, 다시 원래의 훈련 프레임워크에 넣을 수 있다. 꼭 로봇에 쓸 필요는 없다. 농구공이 골대에 맞고 튕겨 나가는 것, 고양이가 방석 위로 뛰어오르는 것, 이 모두 가능하다. 하지만 우리는 실제로 이것을 로봇에도 적용했다. 예컨대 천 한 장이 있다. 인간이 이 천과 상호작용해 천을 펼치는 시퀀스를 생성해 보라고 말한다. 왼쪽이 생성된 것이다. 생성된 것이기 때문에 공짜 시연 한 세트를 갖게 되고, 게다가 시간에 따라 3차원에서 추적되는 천 위 점들의 조밀한 궤적을 얻을 수 있다. 이것들은 로봇에게 '이 물체를 이렇게 움직여야 한다'를 알려 주는 공짜 감독 목표 한 세트가 된다. 오른쪽은 같은 일을 시도하는 실제 로봇이다. 상상에서 출발해 확산 모델로 하여금 안내를 주게 하고, 그 출력을 성공의 목표로 삼으면, 이 일을 해내는 정책 하나를 학습하게 된다. 또 하나의 예는 노트북을 닫는 것이다. 최근 우리는 또 한 가지를 하고 있는데, 그것을 훨씬 빠르게 만드는 것이다. 이런 방법들에서 확산 유닛과 다루는 한 느리며, 4차원에서 점수 증류를 하면 더 느리다. 그래서 우리는 캐싱을 쓰고 의미론적 렌더링도 써서, 한 번의 성공적 갱신의 비율을 올려 영상 모델을 그렇게 자주 호출하지 않아도 되게 했다. 이렇게 하면 더 긴 시간 범위의 시연 시퀀스를 생성할 수 있다. 예전에는 시연을 하나만 생성했을 수 있다. 로봇이 벽돌을 집거나 노트북을 닫는 것, 그것은 원자적 스킬을 학습하게 하는 것이다. 지금 이것은 아직 로봇이 아니지만, 로봇으로 만들 수 없을 이유가 없으며, 매우 긴 시간 범위의 교차 시퀀스를 생성할 수 있어 완전히 다른 일들을 해낼 수 있다. 그러면 얻는 것은 원자적 스킬의 공짜 시연만이 아니라 복잡한 장시간 조작 문제의 공짜 시연이 되고, 사실상 스킬 훈련에 무한한 데이터를 제공할 수 있다. 자, 나는 여기서 멈추겠다.

05


구조는 정답이 아니라 하나의 비계(scaffold)다

돌이켜보면, 우리가 계속 이야기해 온 것은 이런 구조화된 표현들을 어떻게 찾아 내는가였다. 시간이 지남에 따라 이런 것들이 점점 더 많아진다는 것을 알게 될 것이다. 지금은 거의 모든 구성 요소가 갖춰졌지만, 여전히 그 한 층의 중간 표현을 유지하고 있다. 그것은 이제 거의 언어의 형태로 존재하며, 물론 그 뒤에는 장면 표현이 대응되어 있어, 이로써 전체 체계가 해석 가능해진다.

우리는 또한 계속 생각해 왔다. 어떻게 하면 더 범용적으로 만들 수 있을까, 기존의 물체들, 기존의 시연들에 묶이지 않을 수 있을까.

'구조'라는 단어에 대해 한마디 더 하겠다. 다른 사람이 당신에게 구조를 이야기할 때, 쉽게 다른 한 가지로 이해하기 쉽다. 구조를 당신의 시스템에 경직적으로 밀어 넣어야 한다는 것이다. 그것은 좋지 않으며, 우리가 하는 일도 아니다. 우리가 생각하는 것은, 이 한 층의 인터페이스를 이용해 이 시스템이 더 효율적으로 학습하도록 도울 수 있는가이다. 그것은 외부의 비계처럼 작동하면서 동시에 인간이 그것과 소통할 수 있게 한다. 근본적으로 말하면, 당신은 데이터가 풍부한 모달리티, 특히 영상, 그리고 언어, 또 얻을 수 있는 3차원과 4차원을 활용하고 있는 것이다. 하지만 최종적으로 당신이 관심을 가져야 하는 것은 또 다른 한 가지다. 이 구조화된 표현들이 어떻게 우리에게 추론 능력을 갖게 하는가. 당신은 원자 수준의 표현을 갖고 있다. 나는 씻을 수 있고, 놓을 수 있고, 이런 일들을 할 수 있다. 그렇다면 다음 단계는, 이 작업들 사이의 의존 관계는 무엇인가, 그것들의 영향은 무엇인가이다. 정말로 당신이 장시간 문제를 해내고, 또 아주 일반화된 방식으로 해내게 하는 것은 바로 이것이다. 감사합니다.

여러분이 함께 모여 소통하고 회의 정보를 서로 공유하실 수 있도록, 우리는 별도로 IROS 2026 참가 교류 단톡방을 만들었습니다! 단톡방에 들어오시면 이런 「혜택」을 누리실 수 있습니다?

  • 회의 정보 스테이션: 투고 DDL, 형식 규정, 심사 진행 상황…… 중요한 시점을 가장 먼저 전해 드려, 더 이상 deadline을 놓칠 걱정 없이 투고 준비를 안정적으로 할 수 있습니다.

  • 동행 살롱: 사방 곳곳의 동료들이 모두 방에 있습니다. 경험을 나누고, 생각을 부딪치고, 인맥을 쌓으며, 연구의 길에서 우리가 함께 갑니다.

  • 최전선 보급 스테이션: 최신 연구 성과와 뜨거운 방향을 실시간으로 공유하고, 회의 주제와 결합해 투고의 큰 흐름을 정리하도록 도와 논문 영감에 기름을 가득 채웁니다.

  • 현장 후원단: (회의 기간 한정 운영):회장에 도착해도 걱정하지 마세요——

    경로 내비게이션: 장소 배치, 강당 가는 법, 방에서 언제든 물어보세요;

    세션 함께 읽기: 인기 session, Keynote 토론, 놓쳐도 다시 쫓을 수 있습니다;

    Poster 모음집: 현장 포스터의 핵심을 정리해, 한 번에 저장하고 하나도 빠뜨리지 않습니다;

    모임 광장: 밥약, 인터뷰 모임, 교류 모임…… 수다를 떨고 싶고, 협력하고 싶고, 만나고 싶으면 방에서 모집하면 됩니다.

? 단톡방 입장 포털: QR코드를 스캔해 입장하거나 위챗 Luyoyo_2026을 추가하고, 메모: ECCV + 소속/학교+이름+연구 방향.

연구든 기술이든, 정보 격차가 중요합니다.

자, 함께 한 발 앞서 갑시다!

탑승하세요, 전 세계 AI 최고 학회의 정수를 모두 보여 드립니다

독점으로 감상할 수 있습니다:

전문가 강연 PPT

대회 보고 전문

인기 논문 해설

학계 신성 인터뷰

위 QR코드를 스캔하거나

「원문 보기」를 클릭하여 전용 페이지를 팔로우하세요.

레이펑왕(雷峰网) 오리지널 기사이며, 허가 없이 전재를 금지합니다. 자세한 내용은전재 안내를 참조하세요。

원문 출처

雷峰网 AI

내용 안내

원문 발행 및 권리는 출처에 있습니다.

기계 번역 · 원문을 참고하세요