雷峰网 AI

1933편의 IROS 논문을 연구한 결과, 우리는 로봇공학의 6가지 새로운 변화를 발견했습니다

대형 모델이 로봇공학을 '잡아먹지' 않았다. 저자丨마샤오닝(马晓宁) 편집丨岑峰 9월 27일, IROS 2026이 피츠버그에서 개막한다. 31년 만에 IROS가 이 강철의 도시로 돌아온다. 세계 최대 규모의 로봇 학술대회 중 하나인 이 행사에 올해 정식 일정에 들어간 논문은 1933편에 달한다. 이 약 2,000편의 논문을 펼쳐놓고 보면, 그것은 2026년 로봇 연구의 한 단면에 가깝다.…

대형 모델은 로봇공학을 ‘집어삼키지’ 않았다.

    저자丨 마샤오닝

편집丨 쑹 펑

                                                                                                       

9월 27일, IROS 2026이 피츠버그에서 개막한다. 31년 만에 IROS가 이 강철의 도시로 돌아온다. 세계 최대 규모의 로봇 학술대회 중 하나인 이 행사에 올해 정식 일정에 들어간 논문은 1933편에 달한다. 이 약 2,000편의 논문을 펼쳐놓고 보면, 그것은 2026년 로봇 연구의 한 단면에 가깝다. 강화학습과 모방학습부터 경로 계획, 시각 인식, 운동 제어, 정교한 조작을 거쳐 휴머노이드 로봇, 촉각, 대형 모델에 이르기까지, 지난 몇 년간 로봇 분야의 거의 모든 중요한 기술 노선이 이 지도 위에 동시에 나타나 있다. 하지만 진정으로 주목할 만한 것은 Humanoid, VLA, World Model 같은 산업계와 언론의 주목을 더 쉽게 받는 키워드가 아니다. 1933편의 논문을 멀티 라벨로 정리해 보면, Robot Learning / Embodied AI 관련 논문이 약 809편, Navigation / Planning이 564편, Perception / Vision이 556편, Control / Dynamics가 546편, Manipulation이 520편이며, Humanoid / Legged 관련 논문은 약 213편이다. 하나의 논문이 여러 방향을 동시에 다룰 수 있기 때문에 이 수치들을 단순히 더할 수는 없지만, 이는 한 가지 사실을 보여준다. 로봇 연구는 대형 모델의 등장으로 인해 단일한 'AI 문제'로 재편되지 않았다는 것이다. 그 반대로 학습, 인식, 계획, 제어, 조작이 전례 없는 밀도로 서로 얽혀가고 있다. 모두의 시선을 사로잡은 AGI 열풍이라는 큰 배경 속에서, 이 약 2,000편의 논문은 하나의 신호를 내보내고 있다.대형 모델은“집어삼키지”않았다. 로봇공학을.정반대로, 2년간의 엔드투엔드 질주를 거친 후 로봇 연구는 3차원 기하학, 기호 추론, 저수준 제어의 ‘중간층 르네상스’를 통해 픽셀과 Token에 가려졌던 물리적 영혼을 피츠버그에서 되찾으려 하고 있다.” IROS 2026에서 진정으로 물어야 할 것은 어쩌면 ‘대형 모델이 전통 로봇공학을 대체하고 있는가’가 아니라, 로봇 연구가 더 복잡한 시스템 단계에 진입하고 있는가일 것이다.

01


  AI는 전통 로봇공학을 대체한 것이 아니라,

다시 그 안에 깊이 들어가고 있다

이 논문들 사이의 교차 관계를 더 자세히 살펴보면, 대형 모델이 로봇에 진입한 후 실제로 일어난 변화가 더욱 분명해진다. Robot Learning과 Manipulation이 동시에 나타난 논문은 약 276편, Perception과 교차하는 것은 269편, Navigation / Planning과 교차하는 것은 225편, Control / Dynamics와 교차하는 것도 221편이다. 학습 방법은 로봇의 기존 기술 모듈을 단순히 압축해 버린 것이 아니라, 오히려 점점 더 깊이 이 전통적 문제들 속에 파고들고 있다. 이러한 변화는 우선 계획에서 나타난다. 스토니브룩대학교의 Jorge Mendez-Mendez는 《PDDLStream을 활용한 태스크 및 모션 플래닝을 위한 대규모 언어 모델에 관한 체계적 연구》 에서 대규모 언어 모델을 전통적인 Task and Motion Planning 프레임워크에 삽입한 후의 성능을 체계적으로 테스트했다. 연구는 ‘대형 모델이 계획기를 직접 대체할 수 있다’는 방향을 가리키지 않았고, 오히려 기하학적 구속 조건, 운동 실현 가능성, 실행 논리에는 여전히 전통적 계획 체계의 참여가 필요하다는 것을 보여주었다. 이는 매우 대표적이다. LLM은 ‘컵을 테이블 반대편으로 가져가라’는 말의 의미를 이해할 수 있지만, 로봇이 실제로 실행할 때는 로봇팔이 충돌하지 않는지, 관절이 도달 가능한지, 경로가 실행 가능한지, 그리고 현재 환경에 변화가 있는지를 반드시 답해야 한다. 문제는 이리하여 ‘LLM이 Planner를 대체할 수 있는가’에서 두者が 어떻게 역할을 나누어야 하는가로 바뀌었다. 비슷한 현상이 VLA의 지각 측면에서도 나타난다. IROS 2026 Cognitive Robotics 최우수 논문 후보에 오른 GeoVLA: Empowering 3D 시각-언어-행동 모델(Vision-Language-Action Models)에서의 표현 방식는 톈진대학교, 원리링지(原力灵机), 칭화대학교 팀이 협력하여 완성했으며, 저자에는 원리링지의쉐 빈, 칭화대학교의스 하오등이 포함되어 있다. 이 연구가 겨냥한 것은 바로 기존 VLA가 2차원 시각에 과도하게 의존하는 문제이다: 전통적인 VLA는 RGB 이미지와 언어 지시로부터 직접 동작을 생성하지만, 실제 로봇이 마주하는 것은 3차원 세계이며, 물체의 높이, 크기, 카메라 시각의 변화가 모두 그리핑에 직접 영향을 줄 수 있다. GeoVLA는 단순히 모델을 계속 확대하는 대신, 깊이와 3차원 기하학 정보를 명시적으로 추가하고, 3D representation과 시각언어 특징을 함께 동작 생성에 사용했다. 다시 말해, 대형 모델이 강해진 후에 로봇공학의 가장 전통적인 ‘공간 기하학’이 다시 보완되어 돌아온 것이다. 제어 측면에서도 비슷한 현상이 나타났다. 중앙플로리다대학교, 인도공과대학교 칸푸르, 배스대학교, 메릴랜드대학교 파크分校 팀의 느린 파운데이션 모델을 활용한 빠른 로봇 정책 학습가 연구한 것은 매우 현실적인 문제이다: 대형 Foundation Model은 더 강력한 지식과 일반화 능력을 제공할 수 있지만, 추론 속도가 너무 느려 로봇의 고주파 제어 루프에서 지속적으로 실행되기에 적합하지 않다. 따라서 연구자들은 대형 모델이 주로 훈련에 더 많이 참여하도록 하고, 실제 실행을 담당하는 더 가볍고 빠른 로봇 정책을 학습시켰다. 언어 모델이 수백 밀리초 늦게 답변하면 사용자는 보통 반응이 약간 느리다고만 느끼지만, 로봇이 그리핑, 접촉 또는 균형 유지 시 수백 밀리초 늦게 움직이면 작업은 이미 실패했을 수 있다. 모델 능력과 실시간 제어는 결코 같은 문제가 아니다. 물리 세계에 더 가까운 촉각 연구에서도 비슷한 방향이 나타난다. 콜로라도대학교 덴버分校의팡 신민등과 케네소주립대학교 팀이 협력하여 완성한 DexTact: 섬세한 손 그리핑을 위한 시각-촉각 파운데이션 모델은 시각과 촉각을 동시에 섬세한 손 그리핑 문제에 넣었다. 이것이 연구하는 것은 이제 ‘이미지가 로봇에게 물체가 어디 있는지 알려준다’만이 아니라, ‘손이 물체에 접촉한 후 시스템이 무엇을 더 감지할 수 있는가’이다. 여기서 Foundation Model, 촉각, 섬세한 조작, 제어가 하나의 시스템 안에 넣어져 이해된다. 따라서 2026년에 진정으로 주목할 만한 변화는 로봇공학이 AI에 의해 대체되고 있다는 것이 아니다. 더 정확히 말하면, AI가 로봇공학의 가장 전통적인 부분에 깊이 들어가기 시작했으며, 동시에 이 전통적 문제들에 의해 다시 형성되고 있다는 것이다.

02


VLA는 ‘할 수 있음을 증명’에서 ‘약점 보완’ 단계로 진입

지난 2년간 VLA의 가장 핵심적인 문제가 ‘하나의 통합 모델이 시각과 언어를 이해하고 로봇 동작을 직접 생성할 수 있는가’였다면, IROS 2026에 이르러 연구의 초점은 뚜렷하게 다른 방향으로 이동했습니다. 모델이 이미 할 수 있게 되었으니, 이제 해결해야 할 것은 어떻게 더 빠르고, 더 안정적으로, 그리고 실제 로봇에 더 적합하게 만드느냐입니다. 우리의 다중 라벨 통계에서 VLA, VLM, LLM 및 Foundation Model 관련 논문은 약 162편으로 전체 논문의 8.4%를 차지했으며, 그중 명확히 VLA를 다룬 논문은 약 82편입니다. 이 규모는 이미 하나의 독립적인 연구 주류를 형성하기에 충분합니다. 그러나 이들이 주목하는 문제는 ‘모델이 더 커질 수 있는가’에 머무르지 않고, 빠르게 효율, 3차원 이해, 장기 기억, 시점 변화, 현실 환경 적응, 안전 등의 문제로 분화했습니다. 가장 직접적인 예가 Shallow-π: Flow 기반 VLA를 위한 지식 증류입니다. 이 논문은 42dot, 서울대학교 및 Samsung Research에서 발표했으며, IROS 2026 Best Paper / Best Student Paper Award 후보에 선정되었습니다. 이 논문이 해결하는 것은 더 큰 VLA를 어떻게 훈련하느냐가 아니라, 바로 모델이 너무 크고 추론이 너무 느리다는 문제로, 지식 증류를 통해 VLA를 압축하여 모델이 실제 로봇과 엣지 디바이스 배포에 더 적합하도록 만들었습니다. 이는 VLA가 로봇에 진입한 후의 첫 번째 현실적 제약을 드러냅니다. 모델은 ‘똑똑하기’만으로는 부족하고 충분히 빨라야 합니다. 또 다른 약점은 3차원 공간 이해입니다. 앞서 언급한 톈진대학교, 원력링기(Force Robotics) 및 칭화대 팀의 GeoVLA는 본질적으로 VLA에 로봇공학의 가장 전통적인 기하학 능력을 보완해 주는 작업입니다. 시점 변화 자체조차 하나의 독립적인 문제로 자리 잡았습니다.AnyCamVLA: 시점 강인 비전-언어-액션 모델을 위한 제로샷 카메라 적응 는 서울대학교와 MIT 팀의 연구입니다. 이 연구는 카메라 위치가 변경된 후 원래 훈련된 VLA가 왜 쉽게 실패하는지, 그리고 전체 모델을 다시 훈련하지 않고도 새로운 camera viewpoint에 적응할 수 있는지를 연구합니다. 실제 배포 환경에서는 카메라 설치 오차, 로봇 플랫폼 차이, 시점 변화가 매우 흔하며, 고정된 시점에서만 작동하는 정책은 진정한 일반화를 이루기 어렵습니다. 장기 과제는 또 다른 종류의 결함을 드러냈습니다. 모델은 동작을 수행할 수 있지만 반드시 경험을 축적하는 것은 아닙니다.오픈월드 작업 수행에서 VLA 기반 에이전트를 위한 장기 기억 은 난징대학교, 와세다대학교, LimX Dynamics, 저장대학교 등의 팀이 완성한 연구로, 장기 기억을 VLA Agent에 직접 연결하여 시스템이 이미 완료한 궤적과 경험을 저장하고 이후 다시 호출할 수 있게 합니다. 여기서의 문제는 더 이상 한 번의 그립 성공 여부가 아니라, 로봇이 긴 프로세스의 과제에서 ‘앞서 무엇이 일어났는지’를 기억할 수 있는가입니다. 성균관대학교의 RoboBRIDGE: 정책을 강인한 실제 세계 로봇 에이전트에 연결하기 위한 모듈형 프레임워크 는 한 걸음 더 나아갑니다. 이 연구는 더 강한 VLA를 다시 훈련하려 하지 않고, 사전 훈련된 정책 주위에 Monitor, Perceptor, Planner, Controller 및 Robot Interface를 추가했습니다. 실행이 실패하면 Monitor가 문제를 발견하고, 환경이 변하면 Planner가 다시 계획하며, Perceptor가 장면을 갱신하고, Controller가 고수준 정책을 실제 동작으로 변환합니다. 이 구조는 VLA의 다음 단계에서 무엇이 일어나고 있는지 잘 보여줍니다. 연구가 ‘더 강한 action predictor를 만드는 것’에서 그것을 중심으로 완전한 시스템을 구축하는 방법으로 전환되고 있는 것입니다. 따라서 VLA의 다음 경쟁은 단순한 scaling이 아닐 수 있습니다. 더 큰 문제는 system engineering으로 변하고 있습니다. 하나의 VLA가 인식, 기억, 계획, 제어 및 하드웨어와 어떻게 함께 작동하며, 최종적으로 동작을 출력할 수 있는 모델에서 장기간 실행할 수 있는 로봇 시스템으로 변모할 것인가입니다.

03


로봇은 다시 ‘중간층’을 재생성하고 있다

VLA의 첫 번째 단계가 인식, 언어, 동작을 하나의 모델로 통합하려는 시도였다면, IROS 2026의 또 다른 점점 뚜렷해지는 연구 흐름은 연구자들이 다시 이 엔드투엔드 체인의 중간에 새로운 구조를 능동적으로 추가하기 시작했다는 것입니다. 1933편의 논문 중 Reasoning / Memory 관련 논문은 약 119편으로 전체 논문의 6.2%를 차지했으며, 그중 명확히 Reasoning을 다룬 논문은 64편, Memory는 36편입니다. 이들은 이미 매우 명확한 세션들을 형성했는데, Agents and Memory for Robust VLA Manipulation, Constraint-Guided Reasoning for Long-Horizon Manipulation, LLM Agents Reasoning Through Robot Tasks, Representing 3D Space for Robot Reasoning 등이 포함됩니다. 이 사실 자체가 질문할 가치가 있습니다. 엔드투엔드 모델이 이미 시각과 언어에서 직접 동작을 생성할 수 있다면, 왜 로봇에는 여전히 Reasoning, Memory, Planner, 심지어 Symbolic Constraint와 명시적인 3D representation이 다시 필요할까요? 그 이유 중 하나는 로봇 과제가 길어지는 순간, ‘현재 이 프레임에서 무엇이 보이는가’만으로는 더 이상 충분하지 않기 때문입니다.TempoFit: 장기 VLA 조작을 위한 플러그 앤 플레이 방식의 계층별 시간적 KV 메모리 는 시안주푸단대학교(Xi'an Jiaotong-Liverpool University) 팀의 연구입니다. 이 연구는 더 큰 VLA를 다시 훈련하는 대신, 모델 내부의 temporal KV memory를 활용하여 기존 정책이 시간에 걸쳐 과거 정보를 저장하고 호출할 수 있게 합니다. 그러나 로봇이 진정으로 기억해야 하는 것은 ‘과거에 무엇을 보았는가’만이 아닙니다. 도쿄이과대학교 팀의 GaussMemory: 장기 로봇 조작을 위한 작업 기반 3D 가우시안 장면 기억은 Memory를 3차원 공간에 넣었습니다. 한 물체가 일시적으로 가려지더라도, 카메라가 지금 그것을 보지 못한다고 해서 로봇의 ‘세계’에서 사라져서는 안 됩니다. 이미 이동된 물체도 위치를 제때 갱신해야 합니다. 따라서 로봇의 Memory는 언어 모델의 컨텍스트 메모리와 완전히 같지 않습니다. 그것은 반드시 실제 3차원 공간과 지속적으로 대응해야 합니다. 추론 문제도 마찬가지입니다.DualCoT-VLA: 비전-언어-액션 모델을 위한 병렬 추론 기반의 시각-언어 사고 연쇄 은 홍콩과기대학(광저우)과 화웨이 팀의 협력으로 완성되었습니다. 이 연구는 VLA가 동작을 직접 출력하도록 하는 데 만족하지 않고, 동작 생성 전에 시각 Chain-of-Thought와 언어 Chain-of-Thought를 추가했습니다. 하나는 공간 관계를 처리하고, 다른 하나는 고수준 과제 논리를 처리합니다. 원래 엔드투엔드 모델이 생략하려 했던 ‘고수준-저수준’의 분업이 또 다른 형태로 돌아온 것입니다. Cognitive Robotics 최우수 논문 후보에 오른 VL-Nav: 추론 기반 비전-언어 내비게이션을 위한 신경-기호론적 접근법은 주로 뉴욕주립대학교 버팔로分校 팀이 완성했으며, 제1저자는두이(杜燚)입니다. VL-Nav는 시각 언어 모델의 의미 이해와 명시적인 공간·기호 추론을 결합하여 복잡한 환경에서의 vision-language navigation에 사용합니다. Symbolic 방법이 다시 등장했다고 해서 로봇공학이 완전히 규칙 기반의 시대로 회귀했다는 의미는 아닙니다. 그것이 담당하는 것은 대형 모델이 아직 안정적으로 수행하기 어려워하는 부분, 즉 공간 관계, 실행 조건 및 제약을 더 명확하게 만드는 작업입니다. Memory, Reasoning에서 Geometry, Planner, Symbolic Constraint까지, 이러한 작업들은 표면적으로 채택한 기술은 다르지만 모두 동일한 구조적 문제를 해결하고 있습니다. 고수준 의미 이해와 저수준 연속 동작 사이에는 엄청난 거리가 존재한다는 것입니다. 따라서 IROS 2026에서 나타난 Reasoning, Memory, Planner 및 Symbolic Constraint는 ‘반(反)엔드투엔드’라기보다, 로봇공학이 대형 모델과 저수준 제어 사이의중간층을 다시 발명하고 있는 것에 가깝습니다. 엔드투엔드가 단순히 실패한 것도 아니고, 모듈화가 단순히 복귀한 것도 아닙니다. 더 정확한 변화는 이렇습니다. 과제가 단일 단계 그립에서 장기 조작으로, 실험실 환경에서 오픈 월드로 나아가면서 로봇 시스템에 계층 구조가 다시 나타나고 있다는 것입니다.

04


Manipulation 

이 구현된 지능(Embodied AI)의 가장 밀집된 전장 중 하나가 되다

VLA, Reasoning, World Model이 주로 로봇이 ‘어떻게 생각하는가’를 대표한다면, Manipulation은 또 다른 질문에 가깝습니다. 이러한 능력들이 최종적으로 어떻게 한 손, 한 그리퍼 또는 한 로봇 팔을 통해 물리적 세계에 실제로 작용하는가입니다. Manipulation 관련 논문은 약 520편입니다. Dexterous Manipulation, Tactile, In-hand Manipulation, Contact-rich Manipulation 등의 방향으로 추가 필터링하면 관련 논문은 약 225편입니다. 그중 명확히 Tactile을 다룬 논문은 약 91편, 명확히 Dexterous Manipulation을 다룬 논문은 52편입니다. 이 225편의 Dexterous/Tactile 관련 논문 중 약 165편이 동시에 Manipulation을, 79편이 Learning을, 57편이 Perception을, 52편이 Control을 다루고 있습니다. 촉각, 학습, 인식 및 제어가 동일한 조작 과제에서 지속적으로 수렴하고 있는 것입니다. IROS 2026 Award Candidate인 VTAP Gripper: 손안의 정교한 조작을 위한 손끝 감각과 시각-촉각 능동 손바닥의 협융은 퍼듀대학교와 컬럼비아대학교 팀의 협력으로 완성되었으며, 여기에는 퍼듀대학교의후즈셴(胡智娴)과 컬럼비아대학교의황빙하오(黄秉豪), 리윈촤(李昀烛)등 연구자들이다. 이 연구는 자유도가 점점 인간의 손에 가까워지는 의수(擬人)형 덱스터러스 핸드를 계속 추구하는 대신, 재구성 가능한 유연 손가락 세 개와 능동 시각·촉각 손바닥 면을 설계하여, 손끝 촉각과 손바닥 면의 능동 접촉을 통해 파지 및 손안 조작을 수행한다. 여기서 가장 흥미로운 점은, 높은 수준의 숙련 조작이 반드시 극도로 높은 자유도를 가진 의인화 구조에 의존할 필요가 없다는 것이다. 기계 구조, 능동 접촉, 멀티모달 감지 사이의 협동 역시 복잡한 조작 능력을 만들어낼 수 있다. 또 하나의 로봇 기구 설계상 후보작인 PDS Joint: 로봇 손(덱스터러스 핸드)을 위해 맞춤 설계된 파라메트릭 이중 나선 관절는 베이징이공대학 5인 팀의 작품이다. 그들은 더 하위 수준의 관절 구조에서 착안하여, 순응 구조, 관절 강성, 고유수용 감각, 학습 기반 교정을 함께 덱스터러스 핸드 관절 설계에 넣었다. VTAP에서 PDS Joint에 이르기까지, 하드웨어 자체가 여전히 수렴에 이르지 않았지만, 하드웨어 역시 점점 감지·제어·학습과 분리하기 어려워지고 있음을 알 수 있다. 동시에 촉각은 '센서를 하나 장착하는 것'에서 '정책(strategy) 안으로 들어가는 것'으로 나아가고 있다.TacVLA: 견고한 비전-언어-액션 조작을 위한 접촉 인식 촉각 융합 은 퍼듀 대학과 이탈리아 기술연구소(IIT)의 협력으로 완성되었으며, 퍼듀 팀에는쉬정퉁(徐政通), 장즈위안(张志远)등의 연구자가 포함되어 있다. 이 연구는 촉각을 VLA에 직접 넣어, 실제로 접촉이 일어날 때 촉각 정보가 동작 결정에 참여하도록 한다. 가림(occlusion), 정밀한 삽입·분리, 혹은 이미 접촉이 이루어진 장면에서는 시각이 제공하는 정보가 빠르게 떨어지기 때문이다. 또 다른 노선은 배포 단계에서 촉각 하드웨어에 대한 의존을 줄이려고 시도한다.HapticVLA: 추론 시점의 촉각 센싱 없이 비전-언어-액션 모델을 통한 풍부한 접촉 조작 은 스콜코보 과학기술원 팀의 작품이다. 그들은 학습 단계에서 촉각 정보를 사용하여 정책이 접촉 지식을 학습하도록 하지만, 추론 단계에서는 실시간 촉각 입력에 더 이상 의존하도록 강제하지 않는다. TacVLA와 HapticVLA는 정확히 두 가지 서로 다른 사고방식을 대표한다. 하나는 촉각을 실시간으로 정책에 연결하는 것이고, 다른 하나는 촉각을 활용해 학습한 뒤 촉각 경험을 최대한 모델 안에 압축하는 것이다. 데이터 문제도 떠오르기 시작했다. Entertainment and Amusement Paper Award 후보에 오른 PianoFingering-1.5K: 로봇의 숙련된 동작 학습을 위한 대규모 전문가 피아노 운지 데이터셋 은 중국과학기술대학 팀의 작품으로, 저자에는왕뤄위(王若宇)등이 포함되어 있다. 그들은 전문가의 피아노 운지법을 구조화된 데이터셋으로 정리했다. 피아노 연주는 언뜻 특수해 보이지만, 실제로는 매우 까다로운 숙련 조작 과제이다. 여러 손가락이 극히 짧은 시간 안에 정확하고 연속적이며 강한 시간적 제약을 지닌 접촉을 완수해야 하기 때문이다. 이런 전문가 수준의 동작을 체계화하는 것은 본질적으로 로봇 숙련 조작에 고품질의 인간 선prior(先验)을 제공하는 것이다. 하드웨어, 촉각에서 데이터에 이르기까지, 여러 노선은 결국 같은 문제로 수렴한다. 로봇이 어떻게 진정한 폐쇄 루프 조작 능력을 형성하느냐는 것이다. 그렇기에 숙련 조작은 '더 나은 손을 만드는 것'에서감지—촉각—데이터—정책—제어의 완전한 폐쇄 루프를 구축하는 것으로 확장되고 있다.

05


휴머노이드, '걷기 가능'에서 '걸으면서 일하기'로 확장

인간형 로봇은 지난 2년간 산업과 미디어의 주목을 가장 많이 받은 로봇 형태 중 하나일 수 있지만, 이를 IROS 2026의 전체 논문 지도에 다시 놓고 보면 상황은 훨씬 절제된 모습을 보인다. 통계에 따르면 Humanoid / Loco-Manipulation 관련 논문은 약 89편으로 전체 논문의 4.6%를 차지한다. 이 중 46편은 Control과 교차하고, 44편은 Learning과 교차하며, 34편은 Manipulation, 32편은 Planning과 관련된다. 진정으로 주목할 만한 점은 이 논문들 내부의 문제의식이 변화하고 있다는 것이다. 지난 몇 년간 인간형 로봇의 가장 중요한 기술 진전은 대부분 locomotion에 집중되어 있었지만, 이제는 '이동'과 '조작'을 하나의 시스템에 넣기 시작한 또 다른 연구 흐름이 나타나고 있는 것이 보인다. 대표적인 예가 ULTRA: 자율 휴머노이드 전신 이동-조작(Whole-Body Loco-Manipulation)을 위한 통합 멀티모달 제어。이 논문은 일리노이 대학교 어배너-섐페인 캠퍼스하샤린(He Xia-lin)등 연구자가 상하이교통대학교, 칭화대학교 연구자들과 공동으로 완성했으며, IROS 2026 Mobile Manipulation 관련 최우수 논문 후보에 올랐다. 이 연구는 더 강한 보행 정책을 다시 훈련하는 것이 아니라, 인간형 로봇이 물체에 접근하고, 집어 들고, 운반하고, 내려놓는 등의 연속 과제를 수행하도록 만든다. 여기서 가장 주목할 점은 로봇이 드디어 '물건을 옮길 수 있게 됐다'는 것이 아니라, 문제의 구조 자체가 바뀌었다는 것이다. 순수 locomotion에서 핵심 목표는 신체의 안정성을 유지하는 것이다. 그러나 로봇이 손에 물체를 들고 있으면 팔 동작이 무게중심을 바꾸고, 하중이 보행에 영향을 미치며, 발바닥 접촉·상지 운동·파지 과제가 동시에 충족되어야 한다. '걷기'와 '조작'은 더 이상 완전히 분리될 수 없다.SteadyTray: 잔차 강화학습을 통한 휴머노이드 트레이 운반에서의 객체 균형 작업 학습 캘리포니아대학교 샌디에이고 캠퍼스(UCSD) 팀의 연구로, 제1저자는황안룬。이는 이 모순을 매우 직관적인 과제로 확대합니다: 인간형 로봇이 트레이를 들고 걸으면서 트레이 안의 물체가 떨어지지 않게 하는 것입니다. SteadyTray는 기존의 locomotion policy 위에 residual policy를 추가하여, 보행이 말단(end-effector)에 주는 교란을 전담해서 처리합니다.DreamMimic: 월드 모델을 통한 시각운동 전신 이동-조작 학습 그러면 상하이교통대학인제(殷杰)清华大学 팀과의 협력으로 완성되었으며, 비전과 World Model을 whole-body loco-manipulation에 도입하여 예측 모델을 통해 로봇이 장시간 비전 제어 중 상태에 대한 이해를 유지하도록 돕는다. VLA 역시 같은 문제에 진입하기 시작했다.시각-언어-행동 모델을 위한 책임 유도형 전문가(Responsibility-Induced Specialized Experts)를 통한 휴머노이드 로코-매니퓰레이션 학습 서울대학교 팀의 연구입니다. 이 연구는 locomotion과 manipulation의 동작 분포 차이가 크다는 문제를 다루며, specialized experts를 도입하여 서로 다른 전문가가 서로 다른 제어 책임을 담당하도록 했습니다. 이는 다시 한번, “범용”이 “내부에서 아무것도 구분하지 않는다”는 뜻이 아님을 보여줍니다. 더 극단적인 또 다른 사례는 Award Candidate입니다. 불완전한 인간 모션 데이터로부터 운동 능력을 갖춘 휴머노이드 테니스 기술 학습. 이 작업은 칭화대학교장즈카이등이 주도하고 베이징대학교, 상하이인공지능연구소, Galbot 및 델프트공과대학교 연구자들과 함께 완수했다. 테니스는 로봇이 고속으로 움직이는 공을 관찰하고, 궤적을 예측하고, 몸을 이동시키고, 라켓을 휘두르면서 동시에 균형을 유지할 것을 요구한다. 이는 공장 물류이송과는 멀어 보이지만, 드러나는 것은 동일한 문제다: 휴머노이드 로봇은 안정적인 보행 세트를 가진 뒤 단순히 '두 손을 추가'하는 방식으로는 안 된다. 진정한 whole-body intelligence는 다리, 몸통, 팔이 과제를 중심으로 함께 움직일 것을 요구한다. 따라서 IROS 2026의 휴머노이드 로봇 논문을 단순히 'Humanoid가 점점 인기를 끈다'고 요약하면 오히려 진정한 변화를 놓치게 된다. 더 정확한 묘사는 다음과 같다:연구 중심은 단순한 locomotion에서 whole-body loco-manipulation으로 확장되고 있다.

06


World Model이 뜨겁지만, 아직 주류가 되지는 못했다

지난 1년간 로봇 분야의 논의 열기를 기준으로만 보면, World Model은 이미 '본격적으로 주력 전장에 진입했다'는 인상을 쉽게 준다. 하지만 전체 논문 중 World Model을 명시적으로 다룬 논문은 단 19편으로, 전체 논문의 약 1%에 불과하다. '뜨겁다'는 것이 '많다'는 것을 의미하지는 않는다. 진짜 주목할 점은 World Model 논문이 얼마나 많아졌느냐가 아니라, 어떤 위치에 등장하기 시작했느냐이다: 사족 보행, 감각적 조작(dexterous manipulation), 정밀 삽입, 휴머노이드 whole-body control, 의료 로봇 및 내비게이션. Best Paper / Best Student Paper Award Candidate DAWN: 깊이-디노이징 월드 모델을 통한 노이즈 강건 4족 파쿠르 한국기술교육대학교 팀의 연구입니다. 이는 사족 보행 로봇이 더 사실적인 영상을 '상상'하게 하는 것이 아니라, World Model을 활용해 잡음이 있는 심층 인식을 모델링함으로써 로봇이 실제 환경에서 파쿠르를 수행하도록 돕습니다. 여기서 World Model은 이미 인식—제어 사슬에서 상태 모델링 도구로 자리 잡기 시작했습니다. 정교한 조작 분야에서는,Failed to translate: The translation content involves the cross-embodiment world model and other related technical fields, involving many professional terms. To ensure translation quality and accuracy, it is recommended to consult relevant professional materials or use professional translation tools. 에 의해허쯔하오총괄하며, 캘리포니아 대학교 샌디에이고(UC San Diego), MIT 등 기관의 연구자들과 공동으로 완수했습니다. 이 연구는 서로 다른 로봇 핸드 간의 완전히 다른 관절 및 동작 공간을 우회하여, 보다 일반적인 "동작이 물리 세계를 어떻게 변화시키는가"에 대한 법칙을 학습하려고 시도합니다. 그 이면에는 흥미로운 가설이 있습니다. 미래에 서로 다른 로봇들이 진정으로 공유할 수 있는 것은 어쩌면 동작 그 자체가 아니라,행동은 세상을 어떻게 바꿀까。월드 모델을 활용한 일반화 가능한 로봇 삽입 이 연구는 UC San Diego, NVIDIA, 워싱턴 대학교 및 서던 캘리포니아 대학교 팀이 공동으로 수행했습니다. 이 연구는 World Model을 정밀한 삽입 작업에 적용했습니다. 정책이 "이 부품을 어떻게 끼우는지"를 단순히 암기하게 하는 대신, 연구자들은 모델이 "내 행동이 현재 상태를 어떻게 변화시킬 것인가"를 학습한 뒤 이 예측을 활용해 제어를 수행하기를 바랐습니다. 휴머노이드 로봇에 대해서는 앞서 언급한 상하이교통대학교인제(殷杰)清华 팀과 함께한 DreamMimic은 World Model을 whole-body loco-manipulation으로 진입시켰다. 그리고 RoDyn: 로봇 조작을 위한 인터랙티브 로봇-다이내믹 2.5D 월드 모델 길들이기 은 남양이공대학교와 칭화대학교 팀의 합작으로 완성되었다. RoDyn은 순수 2차원 비디오 예측의 한 가지 명백한 문제, 즉 미래 화면이 그럴듯해 보인다고 해서 물리적 관계가 올바른 것은 아니라는 점을 해결하고자 한다. 이 연구는 깊이와 로봇 역학 정보를 추가로 도입하여 예측 결과가 진정으로 로봇 제어에 사용할 수 있는 상태 표현에 더 가깝도록 만든다. 이는 바로 World Model이 로봇 분야에서 가장 중요한 모순을 지적한다. 로봇이 진정으로 필요로 하는 것은 시각적으로 그럴듯한 미래가 아니라행동 조건 하에서 기하학적·물리적으로 충분히 신뢰할 수 있는 미래이다. 따라서 올해 World Model의 문제는 더 이상 "로봇이 이렇게 행동하면 미래는 어떤 모습일까?"만이 아니라, "미래를 예측할 수 있다면, 이 예측이 다음 행동을 진정으로 바꿀 수 있을까?"로 변하기 시작했다. 이런 의미에서 World Model은 현재세계 예측에서제어 참여로 이행 중인 기술 경로에 가깝지, 이미 로봇 연구를 지배하고 있는 방법론은 아니다.

07


로봇의 '시스템 문제 시대' 진입

이 연구들을 함께 놓고 보면, IROS 2026에서 가장 주목할 만한 점은 어떤 기술 경로가 '승리'하고 있다는 것이 아니다. VLA는 전통적인 계획과 제어를 대체하지 못했고, World Model은 아직 주류가 되지 않았으며, Humanoid 역시 로봇 연구 지도의 일부일 뿐이다. 진정으로 일어난 변화는 이러한 새로운 방법들이 물리 세계에 진입한 이후, 지각, 기억, 계획, 제어, 촉각, 안전 및 복구라는 문제들이 다시 피할 수 없는 것들이 되었다는 점이다. 언어 모델이 지난 몇 년간 거둔 성공은 상당 부분 수많은 과제를 하나의 모델로 통합한 데서 왔다. 그러나 로봇은 다르다. 로봇은 '이해'할 뿐만 아니라 실제로 행동해야 하며, 물리 세계는 오차, 지연, 접촉, 실패를 모두 드러낸다. 따라서 IROS 2026은 하나의 새로운 질문에 답하고 있다고 볼 수 있다. 모델이 이미 충분히 강해진 이후, 이러한 능력들을 어떻게 다시 하나의 진정으로 작동하는 로봇 시스템으로 조립할 것인가. 이것이 엔드투엔드의 실패를 의미하지도, 전통적 모듈이 다시 주도권을 쥐었다는 것도 아니다. 더 정확히 말하면, 로봇은 대규모 모델, 계획, 제어, 하드웨어 사이의 경계를 다시 찾고 있다. 미래의 경쟁은 누구의 모델이 더 크고 능력이 많은가의 비교가 아니라, 누가 이러한 능력들을 진정으로 안정적으로 조합할 수 있는가의 경쟁이 될 것이다.로봇이 점점 똑똑해질수록 진정으로 어려워지는 것은, 어떻게 오류를 내지 않게 할 것인가가 된다.

여러분이 함께 모여 교류하고 회의 소식을 공유할 수 있도록 우리는 특별히 IROS 2026 참가 교류 그룹을 만들었다! 그룹에 가입하면 다음 '혜택'을 누릴 수 있다?

  • 회의 정보 스테이션: 투고 DDL, 형식 규정, 심사 진행 상황…… 핵심 일정을 가장 먼저 전달해 드리니, 더 이상 deadline을 놓칠 걱정 없이 투고 준비를 안심하고 할 수 있다.

  • 동료 티타임: 사방 곳곳의 동료들이 그룹에 모여 있어, 경험을 나누고 아이디어를 교환하며 인맥을 쌓을 수 있다. 연구의 길에서 우리는 동행이다.

  • 최전선 보급 스테이션: 최신 연구 성과와 핫한 연구 방향을 실시간으로 공유하고, 회의 주제와 결합해 투고의 흐름을 정리하도록 도와 논문 영감에 기름을 가득 채운다.

  • 현장 서포트단: (회의 기간 동안에만 운영):회장에 도착해도 걱정 없이——

    경로 안내: 시설 배치, 강당 가는 방법 등은 그룹에서 언제든 물어보세요;

    세션 공동 독서: 인기 session, Keynote 토론, 놓쳐도 다시 볼 수 있습니다;

    Poster 모음집: 현장 포스터의 핵심을 정리하여 원클릭으로 저장하고 하나도 놓치지 않습니다;

    모임 광장: 식사 모임, 인터뷰 모임, 교류 모임…… 수다든 협업이든 오프라인 만남이든, 그룹에서 제안하면 됩니다.

? 그룹 입장 포털: QR 코드를 스캔해 그룹에 가입하거나 위챗 Luyoyo_2026을 추가하세요. 비고: ECCV + 소속/학교 + 이름 + 연구 분야.

연구든 기술이든, 정보 격차가 중요하다.

자, 함께 한발 앞서 나가자!

탑승하세요, 글로벌 AI 주요 학회의 핵심을 모두 보여드립니다

단독으로 자유롭게 열람 가능:

전문가 강연 PPT

컨퍼런스 보고서 전문

인기 논문 해설

학계 신성 인터뷰

위 QR 코드를 스캔하거나

「阅读原文」을 클릭하여 레이펑왕(공식 계정: 雷峰网) 전용 페이지를 팔로우하세요.

레이펑왕 오리지널 기사이며, 허가 없이 전재를 금지합니다. 자세한 내용은전재 안내를 참조하세요。

원문 출처

雷峰网 AI

내용 안내

원문 발행 및 권리는 출처에 있습니다.

기계 번역 · 원문을 참고하세요