저자丨덩저민
편집丨치청융
로봇도 작업장에 들어가 로봇 한 대를 조립하는 데 필요한 부품을 직접 만들 수 있다고 생각해 본 적이 있으신가요? 이것은 농담처럼 들리지만, 실제로는 엠비디드 AI의 가장 하드코어한 실용화 과제입니다. 로봇의 관절, 척, 정밀 구조 부품은 모두 CNC(컴퓨터 수치 제어) 선반과 밀링 머신으로 한 단계씩 가공됩니다. 만약 로봇이 이러한 공작 기계를 자율적으로 관리하고, 공작물의 파지, 공급, 삽입, 꺼내기 및 배치를 완료할 수 있다면, 로봇 산업은 로봇 자신에게서 피드백을 받게 될 것입니다——로봇이 많아질수록 로봇을 만드는 능력이 강해지고 비용은 낮아지며, 긍정적 피드백 루프가 형성됩니다. 하지만 이를 실현하는 것은 상상보다 훨씬 어렵습니다. 로봇을 만드는 데 필요한 부품은 바로 정밀도 요구가 가장 엄격한 부류입니다: 공작물과 척 사이의 틈새는 대개 0.5밀리미터에 불과하며, 반사되는 금속 표면, 거의 무늬가 없는 형상, 매우 유사한 부품들이 모두 로봇의 시각, 촉각 및 전 과정 정밀도에 도전을 줍니다. 실험실에서 아무리 멋진 시연이라도 여기서는 먼저공차, 타트타임, 수율이라는 세 관문을 통과해야 합니다. 2026년 9월 29일, 미국 피츠버그, 로봇공학 최고 회의인 IROS 2026 현장에서 한 Tech Talk이 이 과제에 정면으로 답했습니다: 한 대의 로봇이 두 대의 CNC 공작 기계를 자율적으로 관리하면서, 0.5밀리미터 틈새에서 위의 모든 작업을 완수하고, 단 600개의 실제 로봇 궤적으로만 훈련을 완료하는 방법입니다. 발표자는 至简动力 강화학습 책임자 펑쭝바오입니다. 이것은 단순한 기술 시연이 아니라, 실험실 정밀도가 어떻게 공장 정밀도로 전환되는지에 대한 참고 답안입니다. 다음은 IROS 2026 현장에서 펑쭝바오가 발표한 내용을 편집한 것으로, 현장 영어 발표를 바탕으로 정리되었으며, 레이펑왕(공식 계정: 레이펑왕)은 원래 의미를 변경하지 않는 범위에서 구어 표현과 기술 용어를 다시 정리했습니다.
▎실험실에서 공장으로: 실제 환경의 CNC 선반 조작이 현재의 로봇 학습 파이프라인을 무너뜨리는 이유
발표자: 펑쭝바오, 至简动力(Simplexity Robotics) 강화학습 책임자01
로봇으로 로봇 만들기
이번 발표는 하나의 제조 목표에서 시작합니다——로봇으로 로봇을 만드는 것입니다. CNC 조작은 간단해 보일 수 있지만, 이를 실제 공장에서 안정적이고 신뢰할 수 있게 만드는 것은 전혀 다른 문제입니다. 이것은실험실 벤치마크 테스트의 성공과 공장 수준 정밀도 사이의 명확한 간극을 드러냅니다. 오늘 저는 우리가 이 간극을 메우기 위해 어떻게 노력해 왔는지를 보여 드리겠습니다. 至简动力는 풀스택 엠비디드 AI 회사입니다. 우리가 자체 개발한 멀티모달 모델은 이해와 생성을 하나로 통합합니다. 폐쇄 루프형 데이터 플라이휠은 이러한 모델을 지속적으로 개선할 수 있게 해 줍니다. 통합된 모듈형 하드웨어 플랫폼은 이 모델들이 실제 로봇에서 실행되도록 합니다. 그리고 SimpleClaw 플랫폼은 개발자에게 로봇 애플리케이션을 구축하고 배포할 수 있는 개방형 플랫폼을 제공합니다. 하드웨어 측면에서 우리는 네 가지 제품 라인을 보유하고 있습니다. i7 Pro는 우리의 휠 기반 로봇이고, iX는 우리의 휠 기반 휴머노이드 로봇입니다. 또한 두 가지 구성의 모듈형 힘 제어 로봇 팔을 제공하며, 여기서 각각 Dexter 덱스터러스 핸드를 장착한 형태와 그리퍼를 장착한 형태를 보여 드립니다. 마지막으로, 우리의 데이터 수집 글러브는 인간 시연을 규모화하여 수집하여 로봇 학습에 데이터를 제공합니다. 그래서 우리의 방법은 세 부분을 연결합니다: 우리는 풀스택 자체 개발로 하드웨어, 소프트웨어부터 모델까지 아우릅니다; 데이터 수집 글러브는 인간 시연의 규모화된 수집을 가능하게 합니다; 멀티모달 모델은 이해와 생성을 하나로 통합합니다. 목표는 이 데이터에서 더 많이 학습하여 정밀 CNC 조작에서 로봇의 능력 상한선을 높이는 것입니다. 이번 발표는 세 가지 상호 보완적인 방법에 초점을 맞춥니다: SimpleWAM은 멀티모달 관측에서 동작 세그먼트를 생성합니다; DRAM, 즉 델타 규칙 순환 연상 메모리(Delta-Rule Recurrent Associative Memory)는 고정 크기의 메모리 행렬로 장기 시계열 문맥을 처리합니다; DPE는 별도로 훈련된 평가기로 후보 동작에 점수를 매기면서 정책을 동결 상태로 유지합니다. 이 셋이 합쳐져 각각 우리 CNC 시스템의 동작 생성, 기억, 동작 선택 문제를 해결합니다.02
실제 공장의 난제
이것은 우리가 직면한 공장의 난제입니다. 우리의 목표는 로봇으로 로봇을 만드는 것이며, 정밀 CNC 조작이 바로 그 대표 사례입니다. 왜 어려울까요? 첫째, 공작물과 척 사이의 틈새가 0.5밀리미터에 불과하여 정렬 오차를 허용할 여지가 거의 없습니다. 둘째, 반사되는 표면, 미약한 무늬, 형상이 유사한 부품들로 인해 시각적 정렬이 어렵습니다. 셋째, 로봇은 제한된 작업 공간에서 일련의 동작을 완료해야 하며, 핵심 접촉 계면이 항상 보이는 것은 아닙니다. 따라서 시각 정보가 불완전하더라도 시스템은 전체 작업 과정에서 항상 정밀도를 유지해야 합니다. 이러한 CNC 제약 조건이 우리의 아키텍처를 형성했습니다: 약한 무늬는 충분히 강력한 시각 인코더를 요구합니다; 장거리 접근은 헤드 카메라와 손목 카메라가 제공하는 다중 시점을 필요로 합니다; 정밀 접촉은 근접 감지 조건화를 필요로 합니다. 그래서 시각, 언어 및 상태 입력이 토큰으로 변환됩니다. SimpleWAM은 멀티모달 백본과 동작 DiT를 제공합니다. 우리는 이 둘 사이에 DRAM 모듈을 삽입하여 현재 관측 외에 과거 문맥을 보완합니다. 동작 DiT가 후보 동작 세그먼트를 제안하면, DPE는 별도로 훈련된 평가기로 이 후보들에 점수를 매기면서 훈련된 동작 제안기를 고정 상태로 유지합니다. 선택된 동작 세그먼트는 이후 i7 Pro에 전달됩니다.03
구체적인 대응 방안
SimpleWAM은 우리의 통합된 세계-동작 모델입니다. 그 발상은 다음과 같습니다:훈련 시에는 풍부한 미래 지도(감독)에서 학습하고, 추론 시에는 직접 동작을 예측한다는 것입니다. 훈련 단계에서는 비디오 DiT, 3D DiT, 동작 DiT가 작업 지시문의 안내에 따라 미래의 비디오 프레임, 3D 상태 및 동작 세그먼트를 공동으로 재구성하여, 모델이 시각적, 공간적, 동작 역학을 동시에 학습할 수 있게 합니다. 추론 단계에서는 현재 이미지, 현재 3D 상태 및 언어 지시문만 입력하면, 모델은 미래의 이미지나 3D 상태를 생성할 필요 없이 직접 동작 세그먼트를 출력합니다. 실행하기 전에, 우리는 각각 특징을 추출한 후 이들에 대해 적응형 융합을 수행합니다. 공유되는 동결된 인코더가 헤드 카메라와 손목 카메라에서 온 밀집 이미지 토큰을 유지합니다; 이후 쿼리는 각 시점을 독립적으로 읽어 들여, 융합 전에 어떤 시점도 다른 시점을 억압하지 않도록 합니다; 게이팅은 각 쿼리와 각 특징 채널에 대해 전역 문맥과 국소 정렬 단서의 균형을 맞춥니다. 최종적으로, 시각적 역사를 융합하고 견고하며 상태 조건화된 동작 DiT로 동작 세그먼트를 예측합니다. 오른쪽의 어텐션 맵은 더 강한 경계 초점 효과를 보여 줍니다. 각 방법의 명목 시험에서 융합 방법은 15회 성공했으며, 이에 비해 Query-concay는 0회, π0.5 SFT 기준선은 8회였습니다. 긴 작업에서 지속적으로 안정적으로 동작하려면 로봇은 이전 단계로부터의 문맥이 필요합니다. 이를 위해 우리는 DRAM——델타 규칙 순환 연상 메모리(Delta-Rule Recurrent Associative Memory)를 도입하여, 이러한 능력을 사전 훈련된 로봇 정책에 부가합니다. 여기서 동결된 SimpleWAM 백본이 현재 관측에서 특징을 추출합니다; DRAM은 먼저 이 특징들로 메모리에서 관련 과거를 읽어 들입니다; 동작 DiT는 읽어 들인 과거와 현재 문맥을 결합하여 동작 세그먼트를 생성합니다; 그 후 게이팅된 델타 규칙을 통해 메모리를 갱신하여 다음 단계에서 사용합니다. 메모리는 고정 크기의 연상 행렬이므로, 작업이 길어져도 그 점유율은 일정하게 유지됩니다. DRAM은 백본 아키텍처를 수정하거나 백본을 재훈련하지 않고도 부가할 수 있어, 장기 기억을 기존 정책에 더 쉽게 접목할 수 있습니다. 정밀 삽입 과정에서는 시각만으로는 공작물이 어떤 상태로 척에 접촉하고 있는지 판단할 수 없을 수 있습니다. 힘과 토크가 바로 이러한 누락된 접촉 정보를 보완합니다. 우리는 이것을 두 가지 측면에서 사용합니다: 첫째, 근접 감지 조건화는 로봇의 상태 입력을 조정하여, 동작 DiT가 다음 동작을 생성할 때 접촉 요소를 고려하게 합니다; 둘째, 실시간 임피던스 컨트롤러는 실시간 피드백으로 실행을 더 견고하게 하고, 접촉 변화에 따라 운동을 조정합니다. 이 둘을 결합하면 직접 삽입이 막혔을 때 복구를 지원할 수 있습니다. 정밀 CNC 삽입 작업에서 이 조합 방법은 100%의 작업 성공률을 달성했습니다. 흔히 평가기의 피드백으로 동작기를 갱신하는 방식을 쓰지만, 이는 정책 드리프트를 초래할 수 있습니다. DPE는 먼저 행동 복제(behavior cloning)로 훈련된 동작기를 두고, 별도로 훈련된 평가기가 배포 시 후보 동작에 점수를 매기게 합니다; 성공한 롤아웃과 실패한 롤아웃은 이후 평가기만 갱신하며, 폐쇄 루프가 여기서 형성되고 동작기는 로봇 위에서 항상 동결 상태로 유지됩니다. DPE는 작업 성공률을 높이고 실행 단계 수를 줄였습니다.04
성과 시연
우리는 최종적으로 로봇 한 대로 두 대의 CNC 공작 기계를 완전 자동으로 상주 관리하는 전체 작업 방안을 실현했습니다. 이번 주요 시연 영상은 5배속으로 로봇의 전 과정 자율 작업을 보여 주며, 동시에 여러 세부 클립을 통해 세 가지 핵심 독립 공정을 각각 보여 줍니다: 공작물 자율 파지, 척으로의 정밀 공급, 가공 완료 후의 꺼내기와 원위치 배치입니다. 공작물 파지하기 공작물을 척에 삽입하기 꺼내서 공작물을 배치하기 언급할 가치가 있는 것은, 전체 모델 훈련 과정에서 우리는 600개의 실제 로봇 운동 궤적만을 훈련 데이터로 사용했다는 점입니다. 이것이 바로 이번 연구의 핵심 가치입니다: 엠비디드 AI를 실험실의 벤치마크 성과에서 진정으로 고정밀도, 고현실감의 산업 제조 시나리오로 착지시킨 것입니다.여러분이 함께 소통하고 회의 정보를 공유할 수 있도록, 우리는 전용 IROS 2026 참가 교류 그룹을 만들었습니다! 그룹에 들어오면 이러한 「혜택」을 누리실 수 있습니다?
회의 정보 스테이션: 투고 DDL, 형식 규정, 심사 진행…… 핵심 일정을 가장 먼저 전달해 드려, 더 이상 마감일을 놓칠 걱정 없이 투고 준비를 안심하고 할 수 있습니다.
동료 차닮회: 사방의 동료들이 모두 그룹에 있어, 경험을 나누고 아이디어를 교환하며 인맥을 쌓을 수 있습니다. 연구의 길에서 우리가 함께합니다.
최전선 보급 스테이션: 최신 연구 성과와 핫한 방향을 실시간으로 공유하고, 회의 주제와 결합하여 투고의 흐름을 정리하도록 도와 논문 영감에 기름을 가득 채웁니다.
현장 응원단: (회의 기간 한정 운동):회장에 도착해도 당황할 필요 없습니다——
경로 내비게이션:전시장 배치, 강당 가는 길은 그룹에서 언제든 물어보세요;
주제 공동 읽기:인기 session, Keynote 토론, 놓쳐도 나중에 볼 수 있습니다;
Poster 모음집:현장 포스터의 핵심을 정리, 원클릭 저장으로 하나도 놓치지 마세요;
모임 광장:식사 모임, 인터뷰 모임, 교류 모임…… 수다를 떨고 싶거나, 협업을 원하거나, 만나고 싶다면 그룹에서 시작하면 됩니다.
? 그룹 입장 링크: QR코드를 스캔해 그룹에 들어오거나 위챗 Luyoyo_2026을 추가하세요. 비고: ECCV + 소속/학교+이름+연구방향.
연구를 하든 기술을 하든, 정보 격차가 매우 중요합니다.
자, 함께 남들보다 한 발 앞서 나가요!
탑승하세요, 전 세계 AI 최고 학회의 핵심을 모두 보여드립니다
단독으로 자유롭게 열람 가능:
전문가 강연 PPT
대회 보고 전문
인기 논문 해설
학계 신성 인터뷰
위 QR코드를 스캔하거나
「阅读原文」을 클릭하여 전용 코너를 팔로우하세요.
레이펑왕(雷峰网) 오리지널 기사로, 무단 전재를 금지합니다. 자세한 내용은전재 안내。