雷峰网 AI수정일

JEPA와 공간 지능 노선의 정면 대결: WorldArena 2.0 챌린지가 개시되다—「로봇이 정말로 쓸 수 있는가」를 시험하다 | IROS 2026

JEPA 노선이 먼저 한 수 앞서다: 시기미래(视启未来)가 Track 1 1위, 천혼선(晨昏线)이 Track 2 2위. 작성丨장치핑(张岂萍) 싱리쥔(幸丽) 편집丨싱리쥔(幸丽) 세계 모델의 경쟁이 '미래 생성'에서 '로봇이 정말로 쓸 수 있는가'로 옮아가고 있다. 영상은 갈수록 사실적으로 생성될 수 있지만, 로봇 시스템에 들어간 후 세계 모델은 더 구체적인 질문에 답해야 한다. 동작 실행 후의…

JEPA 노선이 먼저 한 수 앞서다: 시기미래(视启未来)가 Track 1 1위, 천혼선(晨昏线)이 Track 2 2위.

    작성丨장치핑(张岂萍) 싱리쥔(幸丽)

편집丨싱리쥔(幸丽)

                                                                                                       

세계 모델의 경쟁이 '미래 생성'에서 '로봇이 정말로 쓸 수 있는가'로 옮아가고 있다.영상은 갈수록 사실적으로 생성될 수 있지만, 로봇 시스템에 들어간 후 세계 모델은 더 구체적인 질문에 답해야 한다. 동작 실행 후의 상태 변화를 예측할 수 있는지, 정책 훈련을 지원할 수 있는지, 궁극적으로 실제 로봇에서 과제를 수행할 수 있는지 말이다. WorldArena는 세계 모델을 하나의 '시험장'으로 끌어들였다. 이 평가 체계는 칭화대학교 팀이 해내외 여러 대학과 함께 출시한 것으로, 세계 모델 분야에서 가장 권위 있는 평가 순위표 중 하나다. WorldArena 1.0은 이미 세계 모델 평가를 단순한 영상 생성에서 데이터 생성, 정책 평가, 동작 계획 등 구체화된(embodied) 과제로 초기 단계까지 확장했다. 하지만 전반적으로 여전히 주로 시각 입력, 오프라인 과제, 시뮬레이션 환경에 집중되어 있었다. 실제 로봇 실행, 온라인 강화 학습 폐루프, 시각-촉각 멀티모달 감지, 그리고 실제 배포에서의 노이즈, 지연, 오차 누적에 대해서는 체계적인 평가가 아직 부족했다.이러한 공백을 겨냥해 WorldArena 2.0은 평가 체계를 한층 더 업그레이드했다.모달리티는 순수 시각에서 시각-촉각으로, 기능은 오프라인 과제에서 온라인 강화 학습으로, 플랫폼은 시뮬레이션 환경에서 실제 로봇으로 확장되었다. IROS는 로봇 분야에서 가장 영향력 있는 국제 최상위 학술대회 중 하나로, WorldArena 2.0 Challenge는 이 성회에서 실기 폐루프 경기장을 마련했으며, 세 개의 트랙이 각각 영상 품질, 온라인 강화 학습 환경, 실제 로봇 조작을 겨냥한다. 여러 세계 모델 진영이 오랫동안 논쟁을 벌여 왔고, 서로 다른 기술 노선 아래의 모델들도 마침내 이 경기장에서 실력을 겨뤄 보였다.JEPA 노선을 명확히 걷는 시기미래(视启未来)가 Track 1 우승을 차지했고,공간 지능 노선인 퉁지대학교 BWM-Turbo 모델은 0.84점 차로 2위를 기록했다. 또한 같은 JEPA 노선인 천혼선(晨昏线) 테크가 Track 2 총점 2위를 차지했다. 그 밖에 주목할 만한 세부 사항 하나는, 세 트랙 모두에서 상위 두 곳을 학계 진영과 산업 진영이 각각 한 자리씩 차지했다는 점이다. 세계 모델 트랙의 경쟁은 이제 학술 능력과 엔지니어링 능력의 정면 충돌 국면에 들어섰다. 대회의 위상, 다기관 협력, 트랙 구성과 순위표 결과를 두고 AI 科技评论(AI 테크 리뷰)은 WorldArena 2.0 Challenge 주최 측인 칭화 팀을 인터뷰했다. 그들의 답변은 이 평가 체계가 온라인 상호작용과 실기 실행으로 나아가는 과정에서 어떻게 설계하고, 어떻게 협력하며, 어떤 경계가 있는지를 더 잘 보여 준다.

01

WorldArena 2.0,새로운 '대형 시험'의 어려움은 어디에 있나

WorldArena 2.0은 세계 모델 평가를 온라인 상호작용과 실제 로봇까지 한층 더 진전시켰다.WorldArena 1.0은 주로 두 가지 능력을 검사했다. 하나는 세계 모델이 생성하는 미래 영상의 품질로, 15개 지표가 시각 품질(Visual Quality), 운동 품질(Motion Quality), 내용 일관성(Content Consistency), 물리 준수성(Physics Adherence), 3D 정확성(3D Accuracy), 제어 가능성(Controllability)을 포괄했다. 다른 하나는 이러한 예측이 로봇에 실제로 유용한지 보는 것으로, 데이터 생성, 정책 평가, 동작 계획이 포함되었다. 14개 대표 모델에 대한 평가에서 영상 품질과 구체화된 과제 수행은 항상 대응하지는 않는 것으로 나타났다. 화면이 더 선명하고 매끄럽게 생성된다고 해서, 모델이 데이터 생성, 정책 평가, 동작 계획에서 반드시 더 좋은 성과를 내는 것은 아니었다. WorldArena 1.0의 커버 범위도 상대적으로 한정적이었다.모달리티상 시각 정보만 처리했고, 기능상 데이터 생성, 정책 평가, 동작 계획 등 오프라인 과제가 중심이었으며, 플랫폼 역시 주로 시뮬레이션 환경에 머물렀다. 촉각 피드백, 온라인 상호작용, 그리고 실제 로봇에서의 실행 성과는 이 평가 체계에 들어오지 못했다.WorldArena 2.0의 업그레이드는 다음 세 방향을 따라 전개되었다.모달리티(Modality), 기능(Functionality), 플랫폼(Platform)이다.모달리티상으로는 순수 시각에서 시각-촉각으로 확장되었다.모델이 화면과 접촉 정보를 동시에 처리할 수 있는지를 검증한다.기능상으로는 오프라인 평가에서 온라인 강화 학습으로 확장되었다.세계 모델이 상호작용 환경으로서 정책 훈련을 지원할 수 있는지를 검증한다.플랫폼상으로는 시뮬레이션 환경 중심에서 실제 로봇 평가를 포함하는 것으로 확장되었다.RoboTwin 2.0과 LIBERO 등 시뮬레이션 환경 외에 WorldArena 2.0은 한층 더 실제 로봇 테스트를 추가해, 물리 환경에서의 모델 실행 성과도 평가에 넣었다. WorldArena 2.0에 기반한 이 평가 방향에 따라 Challenge는 세 개의 트랙을 설치했다.Track 1은 영상 품질을 평가하고, Track 2는 세계 모델의 강화 학습 환경으로서의 능력을 평가하며, Track 3는 실제 로봇 조작을 평가한다.
Track 1은 기존의 영상 품질 평가를 계승·업그레이드했으며, Track 2와 Track 3는 2.0에서 새로 추가된 트랙이다.

Track 1은 70개의 공식 태스크를 설정했습니다. 그중 50개는 흰색 데스크톱의 ID(In-Distribution, 분포 내) clean 시나리오이고, 나머지 20개는 컬러 또는 텍스처가 있는 데스크톱의 OOD(Out-of-Distribution, 분포 외) 시나리오입니다. 모든 참가 모델은 동일한 데이터셋 세트로 테스트를 받습니다.

이 트랙은 롱호라이즌 및 분포 외 시나리오에서의 비디오 생성 성능을 평가합니다. OOD 시나리오는 데스크톱의 색상과 텍스처를 바꿔 ID 시나리오와 다른 시각적 조건을 도입함으로써, 모델이 분포 변화에 직면했을 때 물체 정체성, 공간 위상, 동작 인과 일관성을 계속 유지할 수 있는지 관찰합니다. 최종 점수는 15개 지표가 공동으로 결정하며, 화면 품질, 운동 품질, 콘텐츠 일관성, 상호작용 정확성, 3D 기하, 명령 실행 등의 측면을 포괄합니다. JEPA 표현 유사도(JEPA Similarity)도 포함되어, V-JEPA로 비디오 특징을 추출하여 생성된 비디오와 실제 참조 비디오의 특징 분포가 가까운지 비교합니다.Track 2는 한 걸음 더 나아가 연속 상호작용에 들어갑니다.세계 모델은 강화학습 환경으로서 작동해야 하며, 정책이 그 안에서 반복적으로 동작을 실행하고 새로운 상태와 보상을 얻은 뒤 계속 업데이트합니다. 훈련이 완료된 후 정책은 RoboTwin 2.0으로 돌아가 태스크 성공률을 테스트하여 세계 모델이 진정으로 다음을 지원하는지 검증합니다.온폴리시(on-policy) 훈련.

이는 세계 모델이 다중 턴 상호작용에서 안정성과 동작 제어 가능성을 유지해야 하며, 서로 다른 동작이 가져오는 상태 변화를 정확히 반영하고, 신뢰할 수 있는 화면을 생성하여 모델에 효과적인 보상 신호를 제공해야 함을 요구합니다. 한 번의 예측 편차도 다음 턴의 상호작용으로 넘어가 연속 상호작용 속에서 계속 누적될 수 있습니다.

Track 3는 평가를 실제 로봇 조작에 직접 적용합니다. 주최 측은 동시에 순수 비전 태스크와 시각-촉각 태스크 두 종류를 설정했습니다: 테이블 닦기, 물 따르기, 테이블 정리, 옷 개기 등 시각 기반 조작뿐 아니라 감자칩 집기, 오이 깎기, 2구 플러그 꽂기 등 접촉 정보가 필요한 태스크도 포함됩니다. 실기(實機)에서는 접촉력 변화, 센서 노이즈, 통신 지연이 모두 태스크 결과에 직접 영향을 미칩니다. 핵심 평가 항목은 모델과 정책의 실제 환경에서의 일반화 견고성과 동작 이탈 후 자가 복구 능력입니다.Track 1부터 Track 3까지, 평가는 '예측할 수 있는가'에서 '학습을 지원할 수 있는가'로, 마지막에는 '실제 로봇에서 태스크를 완수할 수 있는가'로 점진적으로 나아갑니다.

02

세 개의 트랙 결과가 공개되고,각 트랙의 우승 팀은 어디가 강한가

9월 16일, WorldArena 2.0 Challenge의 글로벌 최종 순위가 발표되었습니다. 세 개의 트랙은 독립적으로 순위를 매기고 독립적으로 시상하며, 공식 웹사이트에 공개된 상금 기준으로 계산하면총 상금은 7,000달러입니다.

▎Track 1: WorldIncept, 비디오가 '예쁜' 것만으로 이긴 게 아니다

Track 1 최종 순위에서 총 81개 모델이 최종 점수를 획득했습니다.视启未来(Visincept)의 WorldIncept가 72.33점으로 1위를 차지했고, 동제대학교 컴퓨터과학기술학院 공간지능팀의 BWM-Turbo는 71.49점으로 2위에 올라, 두 팀의 격차는 0.84점입니다. 세부 항목으로 보면 WorldIncept의 우위는 화면 품질에만 집중되어 있지 않습니다. 최종 순위 결과에 따르면,WorldIncept는 물리 준수성(Physics Adherence)과 3D 정확성(3D Accuracy) 두 개 차원에서 1위를 차지했으며;의미 정렬(Semantic Alignment)은 90.11점으로 역시 단일 항목 1위입니다.물리 준수성은 생성 과정이 실제 세계의 운동 및 상호작용 법칙을 따르는지에 주목하고, 3D 정확성은 깊이, 원근, 공간 기하 관계를 더욱 검토하며, 의미 정렬은 생성 결과가 태스크 요구에 따라 실제로 변화했는지를 봅니다. 이러한 선도 지표들은 WorldIncept 배후 팀의 축적과도 일정하게 대응합니다. WorldIncept의 배후인 视启未来는 IDEA연구원이 인큐베이팅한, DINO-X 시리즈 비전 모델과 DINO-XGrasp 만물 파지 모델을 출시했고, 바이두 스마트클라우드와 협력해 EgoTwin 데이터 엔진을 선보였습니다. 이 팀은 100,000시간급 Ego 데이터와 텔레오퍼레이션 데이터를 바탕으로 로봇 역학 모델링을 수행하며, 범용 물체 이해, 공간 지능, 인체/인체 손 동작 이해 분야에서 쌓은 팀의 역량을 융합합니다. 이에 비해 퉁지대학교 공간 지능 팀은 장시간 생성의 안정성에 더 주목합니다. BWM-Turbo는 DiT 아키텍처를 기반으로 첫 프레임 가이던스, 동적 메모리, 동작 제어 등의 설계를 추가하여, 장시간 생성에서의 장면 안정성, 동작 응답, 시간적 일관성 문제를 중점적으로 처리합니다. 이번 최종 순위에서 BWM-Turbo는 배경 일관성(Background Consistency)과 JEPA 표현 유사도(JEPA Similarity) 두 지표에서 1위를 차지했으며, 이는 이 방안이 장면 안정성과 표현 일관성 면에서 지닌 우위를 보여줍니다. 두 방안의 기술적 지향은 서로 다르지만, Track 1의 경쟁 초점은 이미 분명합니다. 비디오 생성은 어디까지나 기초일 뿐,공간 구조, 동작 변화, 장시간 추론에서의 물리 일관성을 안정적으로 유지할 수 있는지가 격차를 벌리는 열쇠가 되기 시작했다는 것입니다.

▎Track 2: MW2, 세계 모델이 진정으로 정책 훈련에 들어가다

Track 2는 WorldArena 2.0에 새로 추가된 온라인 강화학습 트랙으로, 평가는세계 모델이 정말로 로봇 훈련 정책의 환경으로 기능할 수 있을까전략이 먼저 행동을 생성하면, 세계 모델이 행동 이후의 미래 상태를 예측하고, 이러한 예측을 바탕으로 보상 계산과 전략 업데이트를 수행한 뒤, 마지막으로 훈련된 전략이 과제를 해낼 수 있는지 확인한다.

트랙은 RoboTwin 환경을 기반으로 하며, Adjust Bottle(병 조정)이라는 과제를 사용하여 진행됩니다. 이 과제는 로봇이 병의 자세와 위치를 다시 조정하도록 요구하며, 정밀한 포즈 제어와 파지 안정성을 시험합니다.

최종 차트에서,베이징 중관춘대학(北京中关村学院)의 MW2가 72.93점으로 1위를 차지했다,천혼선커지(晨昏线科技)의 TTWM은 72.40점으로 2위를 차지했으며,两者의 차이는 0.53점에 불과하며, 47개 참가 모델 중 72점을 넘은 단 두 개의 솔루션에 속한다. MW2 배후의 베이징 중관춘학원(北京中关村学院)은 최근 몇 년간 구현 지능(embodied intelligence)과 물리 지능 분야에 지속적으로 투자해 왔다. 바로 뒤를 이은 TTWM은 월드 모델 훈련에 보다 구체적인 최적화 방안을 채택했다. 이것은晨昏线 목표 인과 세계 모델 GCWM의 대회 참가 버전, '미래 상태가 어떻게 변화하는지'를 중점적으로 모델링합니다. 모델은 현재 상태, 과제 목표, 로봇의 행동을 조건으로 하여, 행동이 실행된 후의 물리적 상호작용과 상태 변화를 예측합니다. Track 2의 연속 rollout에서 팀은 목표 영역, 공간 기하학, 시간 간 일관성을 중심으로 한 맞춤형 최적화를 진행했으며, 프레임 단위 노이즈, 콜드 스타트 랜덤화 등의 설계를 통해 다중 라운드 예측에서의 오차 누적을 줄였습니다. 이러한 설계는 다운스트림 정책 성능에서도 더욱 드러났습니다. Baseline VLA π0.5의 성공률은 55.46%였으며, GCWM을 강화학습 환경으로 삼아 정책을 최적화한 후 VLA 모델의 성공률은 72.40%로 향상되었습니다. Track 2는 경쟁의 초점을 정책 학습 쪽으로 더욱 밀어붙였으며, 월드 모델이 실제로 다운스트림 정책 성능을 향상시킬 수 있는지가 이 트랙의 핵심이 되었습니다.

▎Track 3: ViTacX, 실기기 작업 종합 1위

Track 3는 WorldArena 2.0에 새로 추가된 실제 로봇 평가 트랙으로, 다음을 포괄합니다 AgileX 양팔 로봇 및 Franka Panda 단팔 로봇。그중 Track 3.1은 시각-촉각 조작을 평가하며, AgileX에서 수행된다칩 집기, 오이 깎기, 두 구멍 콘센트에 꽂기 3가지 과제; Track 3.2는 순수 시각 조작 평가, AgileX 설정탁자 닦기, 물 따르기, 탁자 정리, 지시에 따른 탁자 정리, 옷 개기와 종이 상자 접기 6가지 작업에서 Franka는 테이블 닦기, 물 따르기, 테이블 정리도 지원합니다.

각 과제는 실제 로봇 수행 성공률로 평가하며, 종합 총 순위표는 과제 난이도를 반영하고 시각 및 시촉각 방향의 가중치에 따라 점수를 집계한다. 로봇은 정해진 스텝 수 안에 조작을 완료해야 하며, 과정에서 안전 개입을 유발해서는 안 된다.

종합 전체 순위에서는,샤오미 로봇 MiRobot 팀이 제출한 ViTacX가 76.64점으로 1위를 차지했다,상하이테크대학교(上海科技大学) OmniFlow 팀이 67.37점두 번째를 차지했습니다. ViTacX의 주요 강점은 순수 비전 부문 리더보드에서 나왔습니다. Track 3.2에서 이 시스템은 85.00점으로 1위를 차지했다테이블 닦기, 물 붓기, 옷 개기, 종이 상자 접기 4개 항목에서 단일 항목 최고 점수를 기록했으며, 이 중 앞의 세 항목은 모두 100점이었다. 팀의 기술 배경을 보면, 샤오미 로봇(Xiaomi Robot)은 오랫동안 구현(embodied) 기반 모델, VLA, 실제 로봇 실행에 주목해 왔으며, 연구는 시각 지각, 동작 생성부터 실기 연속 실행 등의 단계를 아우른다. 이러한 방향들은 Track 3.2가 평가하는 시각 기반 조작 및 실제 로봇 실행 능력과 정확히 대응된다.Track 3.2 순수 비전 조작 리더보드Track 3.1 시각-촉각 서브 리더보드에서는 ViTacX가 66.67점으로 3위를 차지했습니다. 이에 비해 OmniFlow는 순수 시각과 시각-촉각 두 서브 리더보드 모두에서 2위를 유지하고 있습니다. 그 배후인 상하이과기대학은 로봇 조작 및 촉각 관련 연구를 오랫동안 수행해 왔으며, 자동화와 로봇 센터의 엠보디드 조작 연구는 촉각 지각, 원격 조작, 모방 학습, 강화 학습 및 다중 접촉 운동을 아우릅니다.Track 3.1 시각-촉각 조작 리더보드두 개의 세부 순위를 보면, ViTacX의 종합 순위 우위는 주로 비전 기반 실기 로봇 조작에서 비롯되었으며, 시각-촉각 과제에서의 성적은 상대적으로 뒤처져 있다.

03

동일한 평가 기준에서,세계 모델 기술 노선은 각기 다른 방향에 중점을 둔다

이미 공개된 방안과 순위표 성과를 보면, WorldArena 2.0은 서로 다른 세계 모델 기술 노선을 동일한 평가 체계 안에서 비교하도록 만들었으며, 각 방안이 무엇에 강한지도 점점 더 명확해지고 있다. Track 1의 상위 두 팀은 서로 다른 두 가지 기술 노선을 가리킨다. WorldIncept의 배후인 视启未来는 뚜렷하게 JEPA 잠재 공간(hidden space) 노선을 걷는 모델과BWM-Turbo는공간 지능 노선을 걷는다. 두 노선의 모델이 한자리에서 겨뤘고, WorldIncept는 물리 준수성과 3D 정확성에서 앞섰으며, BWM-Turbo는 배경 일관성과 JEPA 표현 유사도에서 1위를 차지했다. Track 2는 세계 모델이 정책 학습 환경으로서 안정적으로 기능할 수 있는지를 직접 검증했다. 우승은 베이징 중관춘학원의 MW2로, 이 팀은 로봇의 물리 법칙 이해에 주목하고 이러한 이해를 행동 학습 및 실행과 결합했다. 2위인 천혼선(晨昏线)테크의 TTWM은 행동 인과 예측에 더 중점을 두고, 목표 영역, 공간 기하학적 제약, 물체의 시간 간 일관성, 그리고 연속 rollout에서의 오차 누적에 주목한다. Track 3에서는 샤오미 로봇 MiRobot 팀의 ViTacX가 종합 1위를 차지했지만, 순수 시각 과제에서의 우위가 시각-촉각 조작까지 완전히 이어지지는 않았다. 이는 실제 로봇 조작이 환경을 명확히 보는 것뿐 아니라 접촉 정보까지 처리해야 함을 보여준다.멀티모달 정보가 안정적으로 행동 계획과 제어 폐루프에 들어올 수 있는가가 더 어려운 부분이다. 세 트랙의 상위 팀들은 각자의 강점을 지니고 서로 다른 능력 차원에서 독특한 우위를 보여주었다. 참가가 선택적이었기 때문에, 비디오 생성, 정책 학습, 실제 로봇 조작에서 동시에 선두 수준에 도달하는 모델이 나올 수 있는지는 아직 검증이 필요하며 기대할 만하다。

04

주최 측 인터뷰:세계 모델의 '시험장'은 어떻게 만들어졌나

여러 기관의 경기 결과 통일 판정에서부터 평가 설정이 단일 지표의 편향을 어떻게 줄이는지에 이르기까지, WorldArena 2.0의 평가 이면에는 적지 않은 기술적·조직적 문제들이 있다. 주최 측인 칭화대 팀은 인터뷰에서 이러한 문제들에 대해 답변했다. 다음은 대화 원문이며, AI 科技评论이 원뜻을 바꾸지 않는 범위에서 편집했다.

WorldArena의 위치와 평가 메커니즘

▎AI科技评论: WorldArena는 이제 세계 모델의 핵심 평가 벤치마크 중 하나가 되었습니다. 이러한 인정을 어떻게 생각하시나요? 그리고 이 인정이 주로 어디서 온다고 보시나요?

주최 측:이러한 인정은 주로 학계와 산업계의 공통된 필요에서 비롯됩니다:세계 모델이 예측한 미래가 실제로 로봇의 행동 수행에 도움이 될 수 있는지를 판단하는 평가 방법이 필요하다는 것입니다. 구현(embodied) 지능에게는 모델이 행동 지시에 정확히 반응하는지, 예측된 운동이 물리 법칙에 부합하는지, 그리고 정책 학습과 실제 실행을 지원할 수 있는지를 봐야 합니다. 이러한 능력은 비디오를 보는 것만으로 판단하기 어렵고 전문적인 테스트가 필요합니다. WorldArena 1.0은 이러한 문제들을 통일된 기준으로 실행할 수 있는 테스트 절차로 전환했고, 2.0은 온라인 강화 학습과 실제 로봇 상호작용을 추가해시뮬레이션에서 실제(Sim2Real)로의 전이와 폐루프 피드백을 더욱 검증했다. 우리에게 하나의 벤치마크가 장기적 가치를 지니는지는, 연구자와 실무자가 모델의 본질적 문제를 찾고 장단점을 설명하며 이를 바탕으로 방법을 개선하도록 도울 수 있는지에 달려 있다.

▎AI科技评论: WorldArena는 칭화대, 베이징대, CMU, 스탠퍼드, 프린스턴, 홍콩대, NUS, 중국과학원 자동화연구소 등 여러 기관이 관여합니다. 주최 측인 칭화대 팀은 구체적으로 어떤 역할을 하나요?

주최 측: 칭화대 팀은 평가 프레임워크의 연구 설계와 개발, 그리고 대회 평가와 오픈소스 커뮤니티 유지보수를 주로 담당한다.이 벤치마크는 비디오 생성부터 실기(real robot) 조작까지를 다루며, 대량의 소프트웨어·하드웨어, 연산 자원, 인적 자원이 투입되어야 하므로 한 팀만으로는 완성하기 어렵고 반드시 여러 기관이 협력해야 한다. 구체적인 작업에는평가 절차 구축、제출 코드의 규범적 처리、지역 간 원격 추론 서비스 연계、분산 평가 클러스터 유지보수그리고결과 검증 및 취합이 포함된다. 실기 트랙은 또한 로봇 플랫폼 협력사와 하드웨어 인터페이스 적합화, 테스트 시간대 예약, 현장 조작 일정 조율을 완료해야 한다.

▎AI科技评论: 여러 기관 간 조율에서 문제가 생기기도 하나요? 구체적인 예를 한두 개 들어줄 수 있나요?

주최 측:두드러진 어려움은 두 가지입니다:하나는 서로 다른 연산 환경에서 평가 결과의 재현성을 어떻게 보장할 것인가;다른 하나는 서로 다른 현장의 로봇 장비와 인력을 어떻게 조율할 것인가입니다.예를 들어, 동일한 평가 코드를 NVIDIA와 AMD 등 서로 다른 아키텍처의 그래픽카드에서 실행할 때, 하위 레벨 연산자 구현과 환경 의존성이 세밀하게 정렬되어 있지 않으면 결과에 미세한 변동이 나타날 수 있습니다. 따라서 다중 하드웨어 환경 적응, 하위 구성 통일을 수행한 뒤 집중적으로 재검토하여, 플랫폼 간 차이를 모델 능력 차이로 잘못 판단하는 일을 방지해야 합니다. 실기 평가에는 지역별 장소, 장비 상태, 인력 배치도 관련되므로, 서로 다른 로봇 본체에 맞춰 작업과 데이터 수집 절차를 설계해야 합니다. 원격 모델 서비스는 현장 실행과 밀리초 단위의 타이밍 정합을 이루어야 하며, 인터페이스 프로토콜, 물리적 초기 조건, 실행 로그도 모두 명확히 밝혀야 합니다.

▎AI科技评论: 평가 차원이 매우 많은데, 어떤 것은 자동 평가가 가능하고 어떤 것은 전문가의 주관적 채점에 의존합니까? 기관 간, 트랙 간 채점 일관성은 어떻게 보장합니까?

주최측:세 트랙의 자동화 수준은 테스트가 온라인 상호작용과 현장 장비 조작을 포함하는지에 따라 다릅니다.Track 1은 주로 생성 능력을 평가하며지표는 대부분 자동화 파이프라인으로 계산되고, 동시에 비정상 출력과 의심스러운 제출물에 대한 인간 검토는 유지됩니다.Track 2는 강화학습 정책의 월드모델 환경에서의 반복 수행을 평가하며평가 절차의 자동화 수준도 비교적 높습니다. 인간의 작업은 주로 서비스 호출의 연결성 점검과 각 팀의 상호작용 계산 시간대 조율입니다.Track 3은 실기 조작과 관련되어현장 인력이 장비 리셋, 그리핑 관찰, 예외 처리, 과제 성공/실패 판정에 참여해야 하며, 참가 팀과 실시간 연결을 유지하고 양측이 실시간 소통으로 테스트 결과를 확인한 뒤 이를 바탕으로 성공률을 집계합니다. 일관성은 주로 동일 트랙 내에서 통일된 규칙을 적용함으로써 보장됩니다. 각 팀의 입력 형식, API 규범, 계산 예산, 평가 지표 버전, 실패 판정 기준은 모두 일치합니다. 서로 다른 트랙은 평가하는 능력이 다르므로 점수를 직접 비교할 수 없으며, 우리가 중점적으로보장하는 것은 각 트랙 내부에서 평가 조건과 판정 기준의 일관성입니다。

▎AI科技评论: 리더보드는 챌린지 리더보드와 일상 리더보드로 나뉩니까? 일상 리더보드의 업데이트 메커니즘은 무엇이며, 얼마나 자주 업데이트됩니까?

주최측:챌린지 리더보드와 일상 연구 리더보드는 용도가 다르며, 공개 범위와 업데이트 일정도 차이가 있습니다.챌린지 리더보드는 대회 성적과 시상을 확정하는 데 사용되며명확한 제출 마감 시각, 리더보드 마감(封榜) 규칙과 수상 심사 절차가 있습니다. 대회 공정성을 위해 일부 테스트 데이터는 완전히 공개되지 않습니다. 일상 연구 리더보드는 학계에 장기적으로 개방되며, 코드와 평가 프로토콜은 완전 오픈소스로 공개되어 연구자가 로컬에서 재사용할 수 있고, 후속 알고리즘 개선을 위한 지속적인 성능 참조를 제공합니다.

챌린지에 두 개의 트랙을 신설하여 모델이 실제로 실행할 수 있는지 평가

▎AI科技评论: WorldArena 2.0은 1.0에 비해 Track 2(MB-RL)와 Track 3(실기 WAM)을 신설했습니다. 이 아이디어는 어떻게 나왔습니까? 하필 이 두 트랙을 신설한 이유는 무엇입니까? 그 배경에는 어떤 고려가 있었습니까?

주최측:이 두 트랙을 신설한 것은상호작용과 실제 실행에서 모델이 하는 역할을더 검증하기 위함입니다. 1.0은 주로 임바디드 데이터 엔진과 정책의 오프라인 평가에 초점을 맞추었고, 여전히 개루프(開環)의, 시뮬레이션 환경 내 정적 테스트가 중심이었습니다. 모델은 로컬에서 미세조정 후 테스트를 받았으며, 실시간 피드백이 없고 상호작용 과정에서 스스로 수정할 수도 없었습니다. 2.0은 두 가지 측면의 능력을 더 평가하고자 합니다. 첫째는폐루프(閉環) 상호작용능력입니다. 정책이 월드모델을 상호작용 환경으로 삼아, 모델이 생성한 동적 공간에서 지속적으로 학습하고 시행착오를 거칠 수 있는가. 둘째는임바디드 일반화능력입니다. 모델 환경에서 학습한 기술이 Sim2Real 전이를 거친 후 실체 있는 로봇팔 조작에 사용될 수 있는가. 배경의 고려는 이렇습니다: 비디오가 매끄럽게 생성된다고 해서 모델이 신뢰할 수 있는 물리적 피드백을 제공할 수 있는 것은 아니며, 시뮬레이션에서 안정적으로 실행된다고 해서 실기에서도 정상적으로 작동하는 것은 아닙니다. 따라서 온라인 상호작용과 실기 배포를 별도의 트랙으로 설정할 필요가 있습니다.

▎AI科技评论: 앞서 상우(商宇) 교수는 우리와의 인터뷰에서 리더보드의 'sim-to-real gap' 한계를 솔직히 말씀하셨습니다. Track 3 실기 트랙은 이 문제에 직접 대응한 것입니까? 어느 정도까지 해결할 수 있습니까?

주최측:실기 평가는 실제 센싱, 접촉 조건, 장비 실행 과정을 테스트에 포함시켜 시뮬레이션 연구에 보완을 제공합니다. 마찰력 변화, 조명 간섭, 모터 제어 지연, 강체 접촉 등의 요인은 실기 과제 결과에 영향을 미칩니다. 다만 Track 3이 현재 다루는 과제, 환경, 로봇 본체에는 여전히 한계가 있으며, 이후 지속적으로 확장하고 개선해 나갈 것입니다.

▎AI科技评论: 이후 WorldArena 3.0으로도 반복 개발될 예정입니까? 어떤 차원의 테스트를 추가할지 고려하고 있습니까?

주최측:2.0을 추진하는 과정에서 계속 연구할 가치가 있는 몇 가지 방향을 확인했습니다: 더 높은 빈도, 더 긴 시간의폐쇄 루프 상호작용실행 실수 후의자기 오류 수정서로 다른 구성의 로봇 간의일반화 전이그리고 정밀 조립에서의촉각 및 멀티모달 감각 융합。

▎AI테크리뷰: 참가는 선택적인데, 특정 트랙에 강자가 몰리고 특정 트랙은 한산해져 순위표 전체의 대표성이 약화되는 일은 없을까요?

주최 측:이는 기술 요구 사항, 연구개발 비용, 소프트웨어·하드웨어 조건, 반복 개발 기간 등과 관련이 있습니다. 각 트랙은 저마다 특색이 있으며, 서로 다른 모델의 서로 다른 측면에서의 능력을 보여줍니다.

순위표 팀 프로필, 어떤 기술 노선이 더 우수한가?

▎AI테크 리뷰: 세 개 트랙의 상위 두 곳 모두 산업계 파와 학계 파가 있습니다. 월드 모델 혁신에서 각각의 핵심 강점과 약점은 무엇인가요?

주최측:이번 대회 참가 팀을 보면 대학과 기업이 서로의 강점을 보완하고 있습니다. 대학 팀은 더욱 시도하고자 하는 의지가 강합니다.최신 아키텍처와 새로운 목적 함수를 탐구하는 것은 비교적 유연하다; 기업 팀은양질의 데이터 비축, 대규모 연산 능력 스케줄링 및 시스템 배치에서 상당히 축적되어,공정 운영번역도 더 안정적입니다. 이는 이번 대회에 대한 저희의 관찰이며, 모든 팀을 직접 일반화하기에는 부적절합니다. 대회는 또한 양측이 보완해야 할 부분을 더 구체적으로 드러냈습니다. 알고리즘 혁신은 실제 엔지니어링 프로세스에서 안정적으로 작동해야 하며, 데이터와 연산 능력의 우위가 있어도 정확한 물리 모델링과 명확한 문제 정의가 있어야 성적으로 이어질 수 있습니다. 연구 능력과 엔지니어링 역량을 결합하면 기술이 방법 제안에서 실제 응용에 이르기까지의 과정을 단축하는 데 도움이 됩니다.

▎AI테크리뷰: 세계 모델은 현재 전체적으로 네 가지 기술 노선이 있는데, 이번 대회 수상 팀들은 JEPA, 공간 지능/구조화 4D, 픽셀 생성 노선을 대체로 커버하지만, JEPA 노선을 걷는 팀의 승률이 더 높아 보입니다:视启未来가 Track 1 1위를 차지했고, 晨昏线은 Track 2에서 2위를 기록했습니다. 주최 측으로서 이번 결과를 어떻게 해석하시나요?

주최 측:실제 시스템에서의 기술적 접근 방식은 완전히 분리되어 있지 않습니다. 픽셀 수준 자기회귀 생성, 잠재 공간 기반 표현 학습(예: JEPA 사상), 그리고 공간 위상 모델링, 명시적 물리 엔진은 하나의 시스템에서 결합하여 사용할 수 있으며, 선도적인 여러 팀들이 채택하고 있는 것이 바로 다중 모듈 아키텍처입니다. 또한 각 팀은 모델 파라미터 수, 사전학습 데이터 정제, 행동 추상 인터페이스, 제어 루프 주파수 면에서도 차이가 큽니다. 이번 결과는 구현(embodied) 표현 학습에 계속 연구할 가치가 있는 단서를 제공합니다.

▎AI科技评论: 수없이 많은 순위 변동과 대회의 발전을 지켜보면서, 월드 모델이 현재 어느 정도 발전했다고 보시나요? 가장 큰 병목은 어디에 있나요?

주최측:이번 대회의 테스트 결과를 보면, 통제된 특정 과제에서 선진 세계 모델은 동작 간 인과관계에 대한 반응 능력을 초기 수준으로 갖추었으며, 다운스트림 정책 학습에 일정한 도움을 줄 수 있음을 보여주었다. 그러나 더 긴 시간의 복잡한 상호작용과 접촉이 많은 실제 로봇 조작 환경에서는 여전히 세계 모델이 한계에 직면해 있다.모델은 아직 동작이 가해진 후 발생하는 상태의 순간적 변화를 충분히 정확하고 지속적으로 묘사하지 못합니다.. 연속 예측 속의 작은 오차가 점진적으로 누적되고 증폭된다. 실제 로봇(실기)에서는 밀리초 단위의 동작 지연까지 처리해야 하며, 강체 접촉이 가져오는 비선형 힘 피드백도 다뤄야 한다.

평가 방법론 연구를 지속적으로 추진

▎AI테크리뷰: 샹위(商宇) 교사님은 지난 인터뷰에서 "WorldArena가 모델의 새로운 경로 의존(path dependence)이 되는 것을 피해야 한다"고 언급했습니다(사람들이 WorldArena에서 높은 점수를 받으려고 그 지표와 과제에 맞추는 상황). 두 번의 챌린지와 일상적인 리더보드 업데이트 과정에서 실제로 이러한 의존이 관찰되었습니까? 구체적으로 어떤 모습으로 나타나고 있습니까?

주최측:공개된 규칙에 맞춰 최적화하는 것은 벤치마크 운영에서 완전히 피하기 어려운 현상입니다. 우리가 주목하는 것은 점수 향상이 모델의 범용 물리 능력 향상을 반영하는 것인지, 아니면 단순히 특정 지표나 특정 유형의 작업에 더 잘 맞춰진 것에 불과한지입니다. 후자의 영향을 줄이기 위해 우리는 주로 세 가지 작업을 수행했습니다.평가 점수와 실제 물리 작업 성공 여부 간의 상관계수를 지속적으로 추적한다, 실제 물리 능력을 반영하지 못하는 지표를 높게 맞추는 것;시나리오와 임무를 지속적으로 추가하다코드 또는 HTML 없음. ,OOD 테스트 분포를 확대하여 더 많은 복잡한 접촉 작업을 포함시킨다;독립 폐쇄 블라인드 테스트 세트 유지핵심 테스트 단계는 철저히 비밀에 부쳐졌다.

▎AI科技评论:WorldArena의 다음 단계 목표를 정한다면, 어떤 문제 해결에 중점을 두고 어떤 역할을 하기를 바라시나요?

주최측:다음 단계에서는 모델이 실제 세계에서 어느 정도까지 적용 가능한지를 더 명확하게 평가하기를 희망합니다. 즉, 연구자가 월드 모델을 받았을 때 어떤 물리적 시나리오에서 신뢰할 수 있고, 어떤 조건과 상황에서 쉽게 실패하는지 알 수 있기를 바랍니다. 더 장기적인 목표는,WorldArena가 여러분의 방법을 개선하고 월드 모델 능력이 실제 시나리오로 더 잘 일반화되도록 돕게 하십시오。

회의 소식을 서로 공유하고 함께 교류할 수 있도록, 저희는 IROS를专门... — 번역: 여러분이 함께 모여 소통하고 회의 소식을 서로 공유할 수 있도록, 저희는 IROS를专门 만들었습니다. 잘못된 중국어가 섞였습니다. 올바른 번역: 여러분이 함께 모여 교류하고 회의 소식을 서로 공유하실 수 있도록, 저희는 IROS를专门... → "저희는 IROS를专门" — 최종: 여러분이 함께 모여 소통하고 회의 정보를 서로 공유할 수 있도록, 저희는 IROS 전용 그룹을 만들었습니다. 하지만 원문은 "IROS" 뒤에서 끊기므로: 여러분이 함께 모여 교류하고 회의 소식을 서로 공유하실 수 있도록, 저희는 IROS를 만들었습니다. 2026 참가 교류 그룹! 그룹에 가입하면 이런「혜택」을 잠금 해제할 수 있어요?

  • 컨퍼런스 정보 스테이션: 투고 DDL, 포맷 규격, 심사 진행 상황…… 핵심 노드를 첫째 시간에 전달해 드립니다. 더 이상 deadline을 놓칠 걱정 없이, 투고 준비를 안정적으로 할 수 있습니다.

  • 동료 티타임: 사방 곳곳의 동료들이 모두 그룹에 있습니다. 경험을 나누고, 아이디어를 교환하고, 인맥을 쌓으며, 연구의 길에서 우리가 함께합니다.

  • 최전선 보급 스테이션: 최신 연구 성과, 핫한 연구 방향을 실시간으로 공유하고, 컨퍼런스 주제와 결합해 투고의 흐름을 정리하도록 도와드려 논문 영감에 기름을 가득 채웁니다.

  • 현장 지원단: (컨퍼런스 기간 동안만 개설):회장에 도착해도 걱정 없습니다——

    경로 안내: 장소 분포, 발표장 가는 길, 그룹에서 언제든 물어보세요;

    주제 공동 읽기: 인기 session, Keynote 토론, 놓쳐도 다시 따라갈 수 있습니다;

    Poster 모음집: 현장 포스터의 핵심을 정리하여, 한 번에 저장하고 하나도 놓치지 않습니다;

    모임 광장: 식사 모임, 인터뷰 모임, 교류 모임…… 수다 떨고 싶을 때, 협력하고 싶을 때, 직접 만나고 싶을 때, 그룹에서 먼저 제안하면 됩니다.

? 그룹 가입 포털: QR코드를 스캔하여 그룹에 가입하거나 위챗 Luyoyo_2026을 추가하세요. 비고: IROS + 소속/학교 + 이름 + 연구 방향.

연구를 하든 기술을 하든, 정보 격차가 매우 중요합니다.

자, 함께 한 발 앞서 나가봅시다!

승차하세요, 전 세계 AI 최고 컨퍼런스의 핵심을 모두 보여드립니다

독점적으로 자유롭게 열람 가능:

전문가 강연 PPT

대회 기조연설 전문

인기 논문 해설

학계 신예 인터뷰

위 QR코드를 스캔하세요

또는 「阅读原文」을 클릭하여 전용 존을 팔로우하세요.

雷峰网

레이펑왕(공식 계정: 레이펑왕)

레이펑왕 오리지널 기사이며, 허가 없이 전재를 금지합니다. 자세한 내용은전재 안내를 참조하십시오。

원문 출처

雷峰网 AI

내용 안내

원문 발행 및 권리는 출처에 있습니다.

기계 번역 · 원문을 참고하세요