저자丨우쓰멍
편집丨쑹 펑 마샤오닝
《Mario Tennis》나 《TopSpin》을 해본 사람이라면 테니스 치는 일이 특별히 복잡한 일이라고는 느끼지 않을 것이다. 공이 날아오면, 캐릭터를 움직이고, 낙하 지점을 판단하고, 적절한 타이밍에 타격 버튼을 누른다. 특히 《Mario Tennis Aces》에서는 게임이 테니스를 더 한층 직관적인 동작 언어로 분해하기까지 했다: 포핸드, 백핸드, 탑스핀, 슬라이스, 로브, 심지어 정확한 타이밍을 맞춰야만 완성할 수 있는 특수 타격까지 있다. Mario Tennis Aces 게임 화면 현실의 테니스는 물론 이보다 훨씬 복잡하다. 게임이 하는 일은“동작 매핑”(action mapping)으로, 본질적으로 플레이어의 매우 추상적인 “버튼 조작”을 캐릭터의 일련의 복잡한 신체 동작으로 매핑하는 것이다. 플레이어는 이 동작이 어떻게 완성되는지 알 필요가 없는데, 중간의 운동 제어를 게임 시스템이 대신하기 때문이다. 공이 언제 떨어지는지, 몸이 언제 허리를 트는지, 발이 어느 쪽으로 나아가야 하는지, 팔은 얼마나 빠른 속도로 휘둘러야 하는지, 이런 일들은 게임 속에서 거의 모두 숨겨져 있다. 플레이어가 보는 것은 단순한 입력 하나뿐이고, 게임 엔진이 그것을 일련의 완전한 신체 동작으로 번역하는 일을 맡는다. 공이 아무리 빨리 날아와도 캐릭터는 무게중심을 조정할 시간이 없어 균형을 잃지 않고, 발이 한 박자 늦어 몸 전체의 균형을 잃는 일도 없다. 하지만 이 “버튼 한 번만 누르면 라켓을 휘두를 수 있는” 캐릭터를 진짜 휴머노이드 로봇으로 바꾸면, “구체성(具身性)”이 일을 완전히 다르게 만들 것이다.구체지능은 로봇에게 게임이 숨겨놓은 이 신체 과정, 즉 의도에서 동작에 이르는 간극을 다시 떠맡도록 요구한다.로봇은 먼저 공이 어디서 오는지 판단해야 하고, 그다음 언제 움직이고 얼마나 움직일지 결정해야 한다. 타격 지점에 가까워질 때는 두 다리, 허리, 몸통, 어깨, 팔, 손목이 조화를 이루어야 한다. 라켓이 테니스 공에 닿는 시간은 아주 짧은 한순간일 수 있는데, 바로 이 짧은 시간 동안 로봇은 자세, 관절 속도, 마찰력, 라켓 무게, 공의 속도 등 일련의 변화를 처리해야 한다. 그래서 테니스는 매우 흥미로운 로봇 문제가 된다. 그것은 실험실에서 정지해 있는 컵을 집는 것과 같지 않다. 공은 계속 날아다니고, 타격 지점은 계속 변하며, 로봇은 어떤 동작을 한 번만 올바르게 하면 되는 것이 아니라 끊임없이 변화하는 상태 속에서 반복해서 올바르게 해내야 한다. 필요한 것도 더 이상 “무엇을 해야 하는지 아는 것”만이 아니라, 몸 전체가 수백 밀리초甚至 그보다 짧은 시간 안에 조화로운 반응을 형성하게 하는 것이다. 이것이 바로 IROS 2026 에서 갤럭시 제너럴 GaLbot 팀, 칭화대학교, 베이징대학교, 상하이 치즈 연구원, 상하이 인공지능 연구소 연구팀이 발표한 연구——LATENT가 답하려 한 문제이다. 논문 제목 자체가 매우 흥미롭다:불완전한 인간 모션 데이터로부터 운동형 휴머노이드 테니스 스킬 학습하기. 키워드는 “perfect”가 아니라 오히려 “imperfect”이다. 연구팀은 로봇에게 정교하게 선별되고 완전하며 정확한 인간 프로 테니스 경기 데이터를 준비해 주지 않았다. 반대로 그들은 의도적으로 완벽하지 않은 인간 동작 데이터에서 출발하여, 로봇이 테니스 운동에서 가장 기본적인 신체 능력을 학습하게 한 뒤, 강화학습과 시뮬레이션을 통해 이 능력들을 실제로 공을 칠 수 있는 정책으로 조합했다. 다시 말해, 그들이 해결하려 한 것은 “인간 동작을 로봇에 어떻게 완전히 복제할 것인가”가 아니라 현실에 더 가까운 문제였다:인간이 로봇에게 준 시범이 본래부터 불완전하고 정확하지 않다면, 로봇은 그 안에서 무엇을 배울 수 있을까?
01
다섯 시간의 불완전한 데이터
정말로 로봇에게 인간 테니스 선수를 학습시키고 싶다면 가장 직관적인 방법은 그 선수를 완전하게 기록하는 것이다. 준비 자세부터 이동, 스윙, 타격, 자리 복귀, 그리고 다음 타격에 이르기까지. 이상적으로는 다양한 공, 다양한 낙하 지점, 다양한 신체 자세, 심지어 완전한 경기 과정까지 대량으로 있는 것이 좋다. 그래야 로봇이 보는 것이 “손을 어떻게 휘둘러야 하는가”만이 아니라 하나의 완전한 테니스 행위가 된다. 문제는 이런 데이터를 수집하기가 매우 어렵다는 것이다. 게다가 목표가 휴머노이드 로봇이라면 더욱 그렇다. 인체와 로봇 자체의 신체 구조는 같지 않다. 사람의 팔 길이, 관절 범위, 몸무게, 근력은 모두 로봇과 다르며, 모션 캡처 시스템이 한 사람의 동작을 정확하게 기록했다 하더라도 로봇이 똑같이 실행할 수 있다는 보장은 없다. LATENT는 다른 길을 택했다. 연구팀은 아마추어 테니스 선수 5명을 모집하여 약 3m×5m 크기의 동작 수집 공간에서 약 5시간 분량의 인체 운동 데이터를 기록했다. 이 공간은 표준 테니스 코트의 아주 작은 일부에도 미치지 못했다. 연구자들은 선수들에게 완전한 경기를 하도록 요구하지 않고, 테니스 운동에서 가장 기본적인 신체 동작들, 포핸드와 백핸드, 그리고 측면 슬라이드 스텝, 크로스 스텝 등 이동 동작에 주력했다. 인간 테니스 동작 모션 캡처 이 동작들은 매우 조각적으로 보인다. 한 사람이 옆으로 두 걸음 나아가고, 한 사람이 포핸드 스윙을 한 번 하고, 한 사람이 백핸드 동작을 한 번 한다. 이것들은 완전한 테니스 경기를 구성할 수 없고, 하물며 로봇에게 “다음 공을 어디로 쳐야 하는가”를 알려줄 수도 없다. 하지만 연구팀은 이 조각들 속에 여전히 매우 중요한 무언가가 담겨 있다고 보았다:인간이 테니스 운동에 직면했을 때 자신의 몸을 어떻게 사용하는가.이것이 바로 논문이 말하는 “imperfect human motion data”이다. 소위 “불완전함”에는 적어도 두 가지 층위가 있다.첫째, 그것은 충분히 정확하지 않다.모션 캡처로 얻은 인체 운동은 로봇이 전혀 수정 없이 그대로 옮길 수 있다는 뜻이 아니며, 특히 손목 같은 국부 동작에서 인간 데이터와 로봇 몸 사이에 뚜렷한 차이가 존재한다.둘째, 그것은 충분히 완전하지 않다.연구팀이 수집한 것은 테니스 기본 동작이지 하나의 완전한 경기 행위가 아니다. 데이터는 로봇에게 어떻게 움직이고 어떻게 스윙하는지 알려줄 수 있지만, 다양한 공에 직면했을 때 어떤 전략을 선택해야 하는지 직접 알려주지는 않는다. 전통적인 사고방식은 이런 단점들을 쉽게 문제로 여긴다: 데이터가 정확하지 않으면 더 수집하고, 데이터가 불완전하면 더 많이 수집하면 된다는 것이다. 그런데 LATENT의 사고방식은 살짝 옆으로 한 걸음 나아갔다. 그들은 이 데이터를 “완벽한 인간 테니스 운동 설명서”로 수선하려 하지 않고, 그것을 하나의 선험(prior)으로 취급했다. 로봇은 특정 인간 선수의 복제품이 될 필요가 없으며, 먼저 알아야 하는 것은 인간이 테니스 같은 고속 운동에서 대체로 어떻게 몸을 사용하는가이다. 이 구분이 중요하다. 강화학습에게 모든 가능한 신체 동작을 처음부터 탐색하는 것은 비용이 매우 높기 때문이다. 29자유도 휴머노이드 로봇에게는 “스윙한다”와 “스윙하지 않는다”는 두 가지 선택지만 있는 것이 아니다. 매 순간마다 다리, 허리, 몸통, 어깨, 팔의 상태를 바꿀 수 있다. 완전히 처음부터 시작하면 어떤 신체 운동이 합리적인 것인지조차 모른다. 인간의 동작 데이터는 조각일지라도 먼저 대략적인 경계를 그려줄 수 있다. 이것은 마치 어떤 사람이 처음으로 테니스 라켓을 들었을 때와 같다. 먼저 완전한 프로 훈련 과정을 줄 필요는 없고, “인간은 대체로 이렇게 서고, 이렇게 움직이고, 이렇게 스윙한다”는 것만 알면, 그다음에 시행착오를 거듭하며 자신만의 플레이 스타일을 찾을 가능성이 생긴다. LATENT가 하는 일은 대체로 로봇이 먼저 이런 “신체 직관”을 얻게 하는 것이라고 이해할 수 있다.02
로봇에게 필요한 것은 하나의 “신체 언어”다
연구팀은 수집한 인간 동작을 단순히 관절별로 로봇에 집어넣지 않았다. 진짜 난점은 바로 여기에 있다:인간의 동작은 로봇의 동작이 아니다.사람이 스윙할 때 뇌는 “왼쪽 무릎을 몇 도 구부리고, 오른쪽 고관절을 몇 도 회전하고, 몸통을 몇 도 기울일 것인가”를 명시적으로 계산하지 않는다. 이 동작들이 최종적으로 형성하는 것은 하나의 신체 조화이다. 만약 로봇이 매번 29개 자유도가 어떻게 움직여야 하는지 직접 결정해야 한다면 학습 공간이 매우 방대해지고, 강화학습 과정에서 부자연스럽거나 불안정한 동작이 생기기 쉽다. LATENT 방법 프레임워크 도그램 LATENT는 먼저 모션 트래커를 훈련시켜 로봇이 인간 동작에 담긴 신체 운동 패턴을 학습할 수 있게 했다. 그런 다음 연구팀은 이 모션 트래커를 더 압축하여 연속적인 latent action space, 즉 이른바 잠재 동작 공간으로 만들었다. 더 직관적인 비유를 들자면 그것은 마치 한 권의 “동작 사전”과 같다. 로봇은 매번 29개 관절이 어떻게 협력해야 하는지 처음부터 다시 계산할 필요 없이, 먼저 이 사전에서 이미 학습된 신체 운동 하나를 선택한 뒤 눈앞의 공에 따라 그것을 조정하면 된다. 이 동작 공간에는 또 하나 매우 중요한 특징이 있다. 그것은 로봇을 인간 동작에 고정하지 않는다는 것이다. 인간 시범은 동작의 선험을 제공할 뿐이며, 실제로 테니스 공을 마주할 때 로봇은 여전히 스스로 학습해야 한다. 바로 그렇기 때문에 논문은 “인간 모방”을 최종 목표로 삼지 않았다. 인간 선수가 스윙할 때 손목에 어떤 동작이 있다고 가정하자. 그런데 이 동작이 G1에게는 신뢰할 수 없는 것이라면, 로봇은 이 동작을 고집할 필요가 없다. 연구팀은 심지어 오른손 목을 별도로 처리했다. 모션 트래킹 단계에서 그 신뢰도를 낮추어 로봇이 이 오차가 존재하는 국부 동작에 과도하게 의존할 수 없게 하고, 상위 정책이 실제 타격 시 그것을 수정하도록 했다. 이 설계는 마치 로봇에게 일부러 헐거운 나사 하나를 남겨둔 것과 같다. 어떤 시스템이 이 나사가 완전히 정확할 때만 작동한다면, 현실의 작은 오차 하나가 전체 동작을 무효로 만들 수 있다. 반대로 로봇이 처음부터 다리, 고관절, 몸통, 어깨 등 신체 부위가 함께 동작을 완성하는 것에 의존하도록 강요받았다면, 손목에 편차가 생겼을 때에도 여전히 전체 몸을 조정할 기회가 있고 공을 되돌려 보낼 수 있다. 이것 또한 LATENT가 매우 흥미로운 점이다:인간 데이터는 로봇이 최종적으로 추구하는 답이 아니라, 오히려 로봇이 신체 운동을 학습할 때의 하나의 출발점에 가깝다.다음으로 연구팀은 강화학습에서 매우 전형적인 문제에 직면해야 했다. 로봇이 이미 “동작 사전” 한 세트를 갖춘 상태에서, 강화학습이 리턴 성공률을 높이기 위해 사전 안의 전혀 다른 동작들 사이를 함부로 넘나들기 시작할 수 있을까? 답은 가능하다는 것이다. 그래서 연구팀은 Latent Action Barrier, 즉 LAB을 제안했다. 그것은 상위 정책이 생성하는 동작을 제약하여 정책이 원래의 동작 분포에서 쉽게 벗어나지 않도록 한다. Latent Action Barrier 여기서 “Barrier”는 로봇을 잠가버리는 것이 아니라, 탐색할 때 하나의 경계를 그어두는 것이다. 논문은 동작의 이탈 정도를 측정할 때 단순한 유클리드 거리가 아니라 Mahalanobis distance를 사용했다. 그 이유도 잘 이해할 수 있다. 서로 다른 동작 차원의 척도와 변화 범위는 같지 않으며, 모든 방향의 변화를 똑같은 “이탈”로 취급할 수는 없다. 실험에서도 이 제약의 가치가 증명되었다. 포핸드 타격 과제에서 완전한 LATENT 정책의 성공률은 96.52%에 달했고, LAB을 제거한 후 성공률은 93.12%로 하락했다. 하지만 더 뚜렷한 변화는 동작 품질에서 나타났다. 동작 평활성 지표는 25.61에서 37.64로 상승했고, 관절 토크도 7.40에서 12.53으로 상승했다. 다시 말해, LAB이 진정으로 개선한 것은 “공을 되돌려 보낼 수 있는가”만이 아니라, 로봇이 과제를 수행할 때 갑작스럽고 격렬하며 기계적인 동작을 줄일 수 있는가이다. 이는 사람이 운동할 때의 차이와 매우 닮았다. 어떤 사람은 우연히 한 번 공을 되돌려 보낼 수도 있지만, 매 타격이 몸을 마구 흔들고 갑자기 멈추고 끊임없이 수정하는 것에 의존한다면 그런 동작은 지속되기 어렵다. 진정으로 유용한 운동 능력이란 한 번 성공하는 것이 아니라, 성공을 하나의 안정적인 신체 습관으로 만들 수 있는 것이다.03
로봇 역시 '깨끗한 세계'에서만 학습할 수는 없다
여기까지 오면 로봇은 이미 동작도 있고 전략도 갖추게 되었다. 하지만 더 큰 문제가 하나 남아 있다: 시뮬레이션 세계와 현실 세계는 다르다. 시뮬레이터 안에서 연구자들은 공의 질량, 탄성, 공기 저항을 알고 있고, 로봇 몸체의 질량과 마찰 파라미터도 알고 있다. 공이 어디서 날아오는지, 속도가 얼마인지도 정밀하게 제어할 수 있다. 현실에서는 테니스 공의 바운스가 항상 같지 않고, 라켓의 무게중심에는 미세한 오차가 존재할 수 있으며, 지면의 마찰력도 변한다. 로봇의 관절, 구동기, 센서에도 마찬가지로 오차가 존재한다. 더 말할 것도 없이 실제 시스템에는 지연, 노이즈, 가끔 관측이 누락되는 상황까지 있다. 만약 로봇이 '완벽한 시뮬레이션 세계'에서만 공 치기를 배웠다면, 현실에 오는 순간 원래 익힌 동작이 곧바로 무효화될 수 있다. LATENT가 택한 방법은 시뮬레이션 세계를 최대한 완벽하게 만드는 것이 아니라, 오히려 그 반대였다:능동적으로 불확실성을 시뮬레이션 세계 안에 집어넣은 것이다.연구팀은 로봇의 몸체 질량, 무게중심, 발 마찰, 관절 마찰, 구동기 관성 등의 파라미터를 무작위화했고, 테니스 공의 질량, 반발계수, 공기 저항 등 역학 파라미터도 무작위화했다. Figure 2(c+d): Dynamics Randomization + Observation Noise 동시에 그들은 관측 노이즈, 프레임 누락, 지연 등의 요인도 추가했다. 즉, 로봇은 시뮬레이션 학습에서 고정된 테니스 세계가 아니라 하나의 '가능한 현실 세계 전체'와 마주하게 된다. 어떤 때는 공이 좀 무겁고, 어떤 때는 좀 가볍다; 어떤 때는 마찰력이 크고, 어떤 때는 작다; 어떤 때는 센서가 보는 데이터가 조금 늦고, 어떤 때는 아예 프레임 하나가 빠진다. 로봇이 강제로 배워야 하는 것은 이것이다: "내가 세계가 정확히 어떤 상황인지 모르더라도, 나는 최선을 다해 공을 되돌려 보내야 한다." 이것이 바로 로봇 학습과 전통적 프로그램 제어 사이의 매우 흥미로운 차이점이기도 하다. 프로그램은 기계에게 말할 수 있다: 공 속도가 A이고, 마찰력이 B이고, 지연이 C이면, 동작 D를 실행하라고. 하지만 진짜 세계는 A, B, C처럼 깔끔하게 정리된 조건을 잘 주지 않는다. 그래서 LATENT는 불확실성을 없애려 하지 않고, 로봇이 훈련 단계에서부터 불확실성에 익숙해지도록 만들었다. 논문의 소거 실험이 이를 잘 보여준다. 테니스 공 역학 무작위화를 제거하면 실제 세계의 포핸드 성공률이 눈에 띄게 떨어져 16.67%가 되었고, 관측 노이즈를 제거하면 백핸드 실험은 아예 0%로 떨어졌다. 이 두 결과는 정확히 하나의 문제를 보여준다:로봇이 현실에서 실패하는 이유는 때때로 동작을 배우지 못해서가 아니라, 배운 세계가 너무 깨끗했기 때문이다.이것이 sim-to-real의 가장 핵심적인 난점 중 하나이기도 하다. 시뮬레이터를 점점 현실처럼 만드는 것도 물론 중요하지만, 또 다른 경로는 로봇이 현실이 결코 완전히 시뮬레이터처럼 되지 않는다는 것에 익숙해지도록 만드는 것이다. LATENT는 후자를 택했다. 이 사고방식은 최종적으로 실제 Unitree G1에 적용되었다. 하지만 여기서 특별히 강조할 필요가 있다: 이것은 로봇 한 대가 일반 테니스 코트에 서서 자신의 카메라만으로 전체 실험을 완수한 것이 아니다. 현재의 실기 검증은 여전히 모션 캡처 시스템에 의존한다. 연구팀은 모션 캡처 카메라를 사용해 로봇과 공의 운동 정보를 얻었으며, 실제 실험은 대규모 모캡 환경을 사용했다. 공식 프로젝트 자료에 따르면 실험에는 50대 이상의 모션 캡처 카메라가 사용되었고, 모션 캡처 영역은 19미터×15미터에 달했다. 이것은 앞선 데이터 수집과 흥미로운 대조를 이룬다. 5명의 아마추어 선수의 인체 동작을 수집할 때 연구팀은 3미터×5미터의 작은 영역만 필요로 했다; 하지만 진짜로 로봇이 현실 세계에서 안정적으로 공 치기를 하게 만들려면 복잡한 모션 캡처 인프라 전체가 필요했다. 다시 말해,"불완전한 데이터"가 실험 시스템 전체가 단순하다는 것을 의미하지는 않는다.정반대로, 연구팀은 문제의 일부를 "완벽한 데이터를 어떻게 수집할 것인가"에서 "로봇이 불완전한 데이터로부터 안정적인 능력을 어떻게 학습하게 만들 것인가"로 옮겼지만, 실기 검증 자체는 여전히 비싸고 복잡한 엔지니어링 시스템이다. 논문도 모션 캡처 시스템에 대한 의존을 현재 연구의 한계로 명확히 명시하고, 향후 능동 비전의 추가 활용을 다음 단계의 방향으로 제시했다. 이는 오늘날의 LATENT가 아직 실험실 조건을 벗어나지 못한 '자율 테니스 로봇'이 아니라는 것을 의미한다. 하지만 그것은 적어도 한 가지를 증명했다:불완전한 데이터는 로봇이 동적 운동 능력을 얻는 출발점이 될 수 있다.04
진짜로 공을 되돌려 보냈다
마지막으로 진정으로 직관적으로 와닿는 것은 역시 공이다. 시뮬레이션 실험에서 연구팀은 대규모 테스트를 진행하여 다양한 조건으로 날아오는 공에 대해 평가했다. LATENT의 포핸드 리턴 성공률은 96.52%에 달했고, 평균 낙하 지점 오차는 1.32미터였다. 대조적으로, AMP, ASE, PULSE 등의 방법의 포핸드 성공률은 각각 41.32%, 63.47%, 71.85%였고, 이에 대응하는 평균 낙하 지점 오차도 명확히 더 컸다. 이 숫자들은 LATENT가 단순히 로봇에게 "스윙 동작 하나를 하게 만든" 것이 아님을 보여준다. 그것은 이미 몸동작, 날아오는 공의 조건, 과제 목표를 연결할 수 있게 된 것이다. 다른 위치와 다른 속도로 오는 공 앞에서, 로봇은 자신의 몸을 움직여 적절한 위치에서 타구를 완성한 다음, 가능한 한 공을 목표 영역에 되돌려 보내야 한다. 그리고 실제 세계에 와서도 결과는 여전히 성립했다. 논문은 20회 연속의 인간-로봇 랠리 실험을 진행했다. 포핸드 조건에서 논문이 보고한 리턴 성공률은 90.90%, 백핸드는 77.78%였다; 전위와 후위 조건에서는 각각 88.89%와 81.82%였다. 여기에는 매우 중요한 단서가 있다: 이 숫자들은 "로봇의 진짜 테니스 경기 승률"이 아니다. 실제 실험에서의 성공 기준은 로봇이 공을 상대 코트 안으로 되돌려 보낼 수 있는지였고; 실험 규모도 20회 연속 랠리에 불과했다. 따라서 90.90%를 더 정확하게 이해하면: 논문이 설정한 실제 실험 조건에서 로봇이 포핸드 리턴을 상당히 안정적으로 수행할 수 있었다는 것이다. 그것이 증명하는 것은 능력이지 프로 선수급 경기력이 아니다. 사실, LATENT가 현재 해결한 과제도 아직 비교적 명확하다: 로봇은 날아오는 공을 목표 위치로 되돌려 쳐야 하며, 진짜 테니스 선수처럼 완전한 단식 또는 복식 경기를 수행하는 것이 아니다. 진짜 테니스 경기에는 훨씬 더 복잡한 문제들이 많이 포함되어 있다. 언제 스트레이트를 쳐야 하고, 언제 크로스를 쳐야 하는가? 상대는 어디에 서 있는가? 이 타구 후에는 어떻게 포지션으로 돌아가야 하는가? 만약 상대가 계속 낙하 지점을 바꾼다면 로봇은 어떻게 자신의 전술을 조정하는가? 만약 공이 예상 영역에 떨어지지 않는다면 다음 타구는 어떻게 해야 하는가? 이 문제들은 이미 "어떻게 스윙하는가"만은 아니다. 그것들은 로봇이 지속적으로 변화하는 대립 환경을 이해할 것을 요구한다. 논문의 robot-robot self-play는 하나의 보충을 제공한다. 시뮬레이션 환경에서 이 정책을 사용하는 두 대의 로봇은 자기 대결을 할 수 있으며, 최장 25개의 랠리를 연속으로 완수했다. 하지만 여기서도 마찬가지로 경계를 분명히 해야 한다:25개의 랠리는 시뮬레이션의 로봇 대 로봇 실험에서 나온 것이지, 현실 세계의 인간 대 로봇 경기가 아니다.따라서, LATENT를 더 긴 로봇 발전사 속에 놓고 보면, 그것이 지금 완수한 것은 사실 "로봇이 테니스 경기를 배우게 만든 것"이 아니라, 과거에 풀기 어려웠던 문제를 한 걸음 앞으로 밀어낸 것이다: 로봇은 제한된 인간 동작 조각들로부터 전이 가능한 신체 능력을 배울 수 있는가, 그리고 고속, 동적, 오차로 가득한 환경에서 그것을 진정으로 사용해낼 수 있는가? 답은 현재 긍정적이다. 적어도 논문이 설정한 과제 안에서는 이미 가능하다. 그리고 이 일이 주목할 가치가 있는 이유는, 정작 테니스 자체 때문이 아니다.05
테니스는 하나의 입구일 뿐이다
지난 오랜 기간 로봇 운동 능력의 시연은 상대적으로 확정적인 환경에서 이루어지는 경우가 많았다. 걷기, 파지, 운반, 문 열기, 각 과제마다 명확한 목표가 있었고, 물체의 위치도 보통 갑자기 변하지 않았다. 하지만 스포츠는 그렇지 않다. 공은 날아다니고, 목표는 움직이고, 접촉 시간은 짧고, 동작은 연속으로 수행되어야 한다. 로봇은 자신의 몸을 제어할 뿐만 아니라, 외부 세계의 변화에 따라 다음 단계를 끊임없이 다시 결정해야 한다. 따라서 스포츠는 실제로 매우 극단적인 embodied intelligence 시험장을 제공한다. 축구는 로봇에게 달리기, 방향 전환, 공 차기를 요구하고, 다른 선수들의 위치도 이해해야 한다; 배드민턴은 고속으로 오는 공 앞에서 풋워크, 스윙, 낙하 지점 제어를 완수할 것을 요구한다; 테니스는 이 문제들을 더욱 하나의 매우 구체적인 순간에 집중시킨다: 로봇은 반드시 올바른 위치에서, 올바른 신체 자세로, 올바른 시간에 고속으로 날아오는 공을 쳐야 한다. 이것이 바로 올해 IROS 2026에서 athletic humanoid robotics가 별도로 논의되는 방향으로 자리 잡은 이유이기도 하다. IROS 2026의 "Perception and Decision Making for Athletic Humanoid Robotics" 워크숍은 agile locomotion, sports, dynamic manipulation, real-time planning, embodied AI 등을 직접 논의 주제로 삼았으며, 주목하는 것은 정확히 로봇이 고속, 접촉 밀집, 예측 불가능한 환경에서 어떻게 지각, 의사결정, 전신 제어를 수행하는가이다. 워크숍에는 Unitree, Phybot, Booster Robotics의 운동 로봇 시연도 마련되어, 달리기, 배드민턴, 축구 등의 과제를 망라했다. LATENT의 가치도 바로 여기에 있다. 그것은 인간 운동 데이터를 지독하게 정밀한 답안지로 만들려 하지 않았다. 5명의 아마추어 선수가 남긴 것은 일부 동작 조각들일 뿐이며, 이 조각들 자체에도 오차가 있다. 하지만 이 불완전한 데이터는 여전히 로봇에게 무언가를 알려준다: 인간이 이 세계에서 어떻게 움직이고, 어떻게 균형을 유지하고, 어떻게 자신의 몸을 휘둘러 고속으로 움직이는 물체를 쫓는지. 그런 다음, 로봇이 스스로 앞으로 나아간다. 그것은 인간 동작을 잠재 동작 공간으로 압축하고, 강화 학습으로 자신의 몸에 맞는 동작 조합을 찾는다; 인간 손목의 움직임을 완전히 믿지 않아서, 몸 전체가 보상에 참여하도록 배운다; 현실 세계의 파라미터가 항상 정확하다고 가정하지 않아서, 시뮬레이터에 능동적으로 노이즈, 지연, 역학 변화를 추가한다; 마지막으로, 이 모든 것을 실제 로봇의 몸에 적용한다. 그것은 더 큰 질문에 답하려 하고 있다:우리가 로봇에게 완벽한 세계 설명서를 줄 수 없을 때, 그것은 불완전한 정보 속에서 스스로 몸과 세계에 대한 이해를 세울 수 있는가?이것이 바로 테니스라는 실험장이 구현 지능 장면에서 흥미로운 이유이다: 그것은 로봇이 정해진 답이 없고, 다른 주체들에 의해 끊임없이 변화하는 세계에서 행동하도록 요구하며, 문제를 지속적으로 드러내고, 지속적으로 최적화한다. 공은 로봇을 기다리지 않는다. 공이 오면, 몸은 언어보다 먼저 반응해야 한다. 센서에는 지연이 있고, 동작에는 오차가 있으며, 원래의 궤적은 더 이상 그대로 따라 실행할 수 있는 명령이 아니다. 그래서 마지막으로 진정으로 코트에 서 있는 것은, 인간 동작을 프레임 단위로 복제해 낸 기계가 아니다. 그 발밑에는 5명의 아마추어 선수가 남긴 동작 조각이 있고, 완벽하지 않은 인체 데이터가 있고, 의도적으로 드러낸 불확실성이 있으며, 강화 학습의 끝없는 시행착오 후에 형성된 신체 전략도 있다. 인간이 제공하는 것은 지식의 흔적이지만, 로봇이 얻는 것은 지식 그 자체가 아니며, 남은 부분은 그 자신의 몸이 완성해야 한다.여러분의 교류와 회의 정보 공유를 돕기 위해, 레이펑왕(공식 계정: 레이펑왕)은 별도로 IROS 2026 참가 교류 그룹을 만들었습니다! 그룹에 가입하면 이런 「혜택」이 열립니다?
회의 정보 스테이션: 투고 DDL, 형식 규정, 심사 진행 상황…… 핵심 시점을 첫 시간에 전달하여, 더는 deadline을 놓칠 걱정 없이 투고 준비를 안정적으로 할 수 있습니다.
동료 차담회: 천남해북의 동료들이 모두 그룹에 있어, 소감을 나누고, 생각을 부딪치고, 인맥을 쌓으며, 연구의 길에서 함께 나아갑니다.
최전선 보급 스테이션: 최신 연구 성과, 핫한 방향을 실시간으로 동기화하고, 회의 주제와 결합해 투고 흐름을 정리하도록 도와 논문 영감에 기름을 가득 채웁니다.
현장 후원단: (회의 기간 한정 운영):회장에 가도 당황할 필요 없습니다——
경로 내비게이션: 전시장 배치, 발표장 가는 길, 그룹에서 언제든 물어보세요;
세션 공동 독서: 인기 session, Keynote 토론, 놓쳐도 따라갈 수 있습니다;
Poster 모음: 현장 포스터의 핵심 정리, 원클릭 저장으로 하나도 빠뜨리지 않습니다;
모임 광장: 식사 모임, 인터뷰 모임, 교류 모임…… 수다도, 협업도, 오프라인 만남도, 그룹에서 시작하면 됩니다.
? 그룹 입장 링크: QR코드를 스캔하여 그룹에 가입하거나 위챗 Luyoyo_2026을 추가하고, 메모: ECCV + 소속(회사/학교) + 이름 + 연구 분야를 남겨주세요.
연구든 기술이든, 정보 격차는 매우 중요합니다.
자, 함께 남들보다 한 발 앞서 나아가요!
승선하세요, 전 세계 AI 주요 학회의 핵심을 함께 보여드립니다
독점적으로 감상 가능:
전문가 강연 PPT
대회 기조연설 전문
인기 논문 해설
학계 유망주 인터뷰
위 QR코드를 스캔하거나
「阅读原文(원문 보기)」을 클릭하여 전용 페이지를 팔로우하세요.
雷峰网 오리지널 기사이며, 허가 없이 전재를 금지합니다. 자세한 내용은전재 안내를 참조하세요。