MarkTechPost

도메인 특화 월드 모델을 넘어서: JEPA-Anything, 단 1가지 레시피로 7개 분야를 커버

JEPA-Anything은 JEPA의 단일 잠재 타깃을 4개의 직교 요인으로 분할하며, 각 요인에는 자체 예측기가 있습니다. 7개 도메인에 걸쳐 테스트된 결과, 10개 동역학 과제 모두에서 동일한 조건의 JEPA 베이스라인을 능가했으며 Interventional Pong의 개입 오류를 34.8% 줄였습니다. Beyond Domain-Specific World Models…

PhAI Labs, 중국홍콩대학교(CUHK), 푸단대학교, 스탠퍼드대학교, 옥스퍼드대학교 및 프린스턴대학교의 연구진이 공개했습니다 JEPA-Anything세계 모델을 구축하기 위한 도메인 불문 프레임워크입니다. 각 분야마다 새로운 예측 모델을 설계하는 대신, 하나의 공유 학습 방식을 매우 다른 시스템들에 적용합니다. 이는 공동 임베딩 예측 아키텍처(JEPA)를 다음과 같은 방법으로 확장합니다: Orthogonal Predictive Factorization (OPF). 연구진은 시각, 생물학, 임상 경로, 제어, 분자 동역학, 물리 장, 기상이라는 7개 분야에 걸쳐 이를 테스트했습니다.

JEPA-Anything는 어떤 문제를 해결하나요?

표준 JEPA(예: I-JEPA 또는 V-JEPA 2, 컨텍스트 인코더, EMA 타겟 인코더, 그리고 하나의 예측기를 사용합니다. 예측기는 하나의 단일 타겟 임베딩을 출력합니다. 연구진은 이를 용량 할당(capacity-allocation) 문제라고 부릅니다: 높은 분산의 구조가 지배적이 되고, 약한 모드는 상충하는 그래디언트를 받게 됩니다.

직교 예측 인수분해(Orthogonal Predictive Factorization)는 어떻게 작동하나요?

OPF는 너비의 잠재 타깃을 분할한다 d 안으로 K 너비의 학습된 부분공간 r, 그리고 d = K × r. 대부분의 실험에서는 사용한다 K = 4. 각 요인은 전용 예측기를 할당받습니다. 그런 다음 요인 예측은 프로젝터 행렬의 Moore-Penrose 유사역행렬을 통해 다시 결합됩니다. 그 결과는 디코딩, 계획 또는 롤아웃을 위한 1개의 완전한 잠재 상태입니다.

세 가지 정규화기가 요인을 유용하게 유지합니다:

  • 직교성 손실: 각 프로젝터 내부의 열들이 직교정규(orthonormal)를 유지하고 서로 다른 프로젝터들이 겹치지 않는 부분공간에 있도록 합니다.
  • 요인 활동 손실: 좌표별 표준편차에 힌지(hinge)를 적용하여 어떤 요인도 죽지 않도록 합니다.
  • 인코더 분산 손실: 온라인 인코더에 직접적인 반붕괴(anti-collapse) 신호를 보냅니다.

OPF 손실은 각 도메인의 원래 학습 손실에 단순히 더해집니다. 도메인 어댑터가 토크나이제이션과 인코더를 처리하고, core library 는 공유 코어를 OrthogonalFactorProjection.

직교성은 안정적인 합성에 중요합니다. CITRIS Interventional Pong에서 용량이 동일한 제약 없는 멀티헤드 모델의 조건수는 438.52였습니다. 직교 버전은 1.00005에 도달했으며, 교차 요인 중첩은 거의 0에 가까웠습니다.

이 연구는 어떤 결과를 보고하고 있나요?

그룹 I, 최종 판독: 단일 세포 데이터에서 제로샷 PBMC 클러스터링(AvgBIO)은 0.7752로 상승한 반면, 다음의 경우는 0.7194였습니다 Cell-JEPA의 0.7194 대비 0.7752로 상승했습니다. Norman perturbation Pearson은 0.787에서 0.814로 상승했습니다. UK Biobank 데이터에서 1,000건의 임상 이벤트에 대한 예측에서 평균 PRAUC는 동일 조건의 표준 JEPA의 0.711 대비 0.718이었습니다.

그룹 II, 잠재 세계 동역학: Interventional Pong에서 단일 개입 MSE는 34.83% 감소했습니다. 보지 못한 결합 개입은 12.90% 개선되었고, 6단계 자유 롤아웃은 8.58% 개선되었습니다. JEPA-Anything은 10개의 매칭된 동역학 작업 전체에서 보고된 지표를 개선했습니다. 벤치마크에는 CausalWorld, DeepMind Control, PDEBench 및 WeatherBench2가 포함됩니다. APEBench Burgers에서 6단계 롤아웃 오차는 약 44.7% 감소했으며, 모든 시드에서 개선되었습니다. 다음을 사용한 100단계 분자 롤아웃의 경우, TrajCast스타일 백본을 사용한 100단계 분자 롤아웃에서 물, 석영, 파라세타몰, 벤젠에서 가장 낮은 MAE와 RMSD를 기록했습니다.

플래닝 결과는 엇갈립니다. 매개변수를 0.3% 이내로 맞춘 조건에서 JEPA-Anything은 Walker2d와 HalfCheetah에서 CEM 리턴을 개선했습니다. Hopper는 표준 JEPA를 선호했습니다.

그룹 III, 과학적 분석: 요인 분석은 IL-18 plus CD73 blockade를 암 개입으로 지목했습니다. 습실험은 co-culture, 환자 유래 오가노이드, 종양 절편 및 마우스에서 이를 뒷받침했습니다. 잠재 궤도 모드는 또한 이론값 −1.5에 대해 −1.4991의 피팅 기울기로 케플러 법칙을 재현했습니다.

JEPA-Anything은 다른 세계 모델과 어떻게 비교됩니까?

FeatureJEPA-AnythingV-JEPA 2DINO-WMDreamerV3TD-MPC2
핵심 아이디어K개의 직교 예측 인자를 갖는 JEPAVideo JEPA와 액션 조건부 V-JEPA 2-AC사전학습된 시각 특징 기반의 월드 모델월드 모델과 상상 속에서 훈련된 actor-critic의 결합디코더 없는 잠재 다이내믹스와 MPC
타깃 구조인자화 후 의사역행렬(pseudoinverse)로 재결합단일 잠재 타깃단일 잠재 타깃범주형(categorical) 잠재 상태단일 잠재 상태
제시된 도메인7: 비전, 세포, 임상, 제어, 분자, PDE, 기상비디오 이해, 로봇 조작PointMaze, PushT, Wall, 변형 가능 객체(deformables)다양한 RL 도메인, 고정된 하이퍼파라미터104개 연속 제어 태스크, 4개 도메인
계획 / 롤아웃잠재 롤아웃, CEM 계획이미지 목표로부터의 계획CEM 계획상상 속 롤아웃으로부터의 정책MPC 계획
공개 체크포인트HF에 도메인별 연구용 체크포인트예, 300M에서 1B (V-JEPA 2)PointMaze, PushT, Wall저장소에 기재되지 않음300개 이상의 체크포인트, 최대 317M
라이선스Apache-2.0MIT (일부 파일은 Apache-2.0)MITMITMIT

출처: 각 프로젝트의 GitHub README, 헤더 행에 링크됨. JEPA-Anything 체크포인트 상태는 해당 Hugging Face 카드에서 확인. 2026년 10월 5일 검증됨.

핵심 요약

  • OPF는 1개의 JEPA 타겟을 K 개의 직교 인자로 분할하고 각각에 전용 예측기를 둡니다.
  • 10개의 모든 역학 태스크에서 동등한 조건의 JEPA 베이스라인을 능가했습니다.
  • Interventional Pong의 단일 개입 오류가 34.83% 감소했습니다.
  • 계획 수립 향상은 환경에 따라 다릅니다. Hopper는 표준 JEPA를 선호했습니다.
  • 핵심 코드는 Apache-2.0이며, 연구용 체크포인트는 Hugging Face에 있습니다.


다음도 확인해 보세요: 논문, GitHub 저장소 그리고 모델 체크포인트. 이 프로젝트의 모든 크레딧은 해당 연구자에게 돌아갑니다. 또한 저희를 Twitter 에서 팔로우하고 150k+ ML SubReddit 에 참여하시고 저희 뉴스레터를 구독하는 것도 잊지 마세요. 잠깐! 텔레그램을 사용하시나요? 이제 텔레그램에서도 저희와 함께하실 수 있습니다.

GitHub 저장소, Hugging Face 페이지, 제품 출시, 웨비나 등을 홍보하기 위해 저희와 파트너십이 필요하신가요? 저희에게 연락하세요

이 글 도메인 특화 세계 모델을 넘어서: JEPA-Anything이 7개 분야에 1가지 레시피를 적용하다 는 다음에서 처음 게시되었습니다: MarkTechPost.

원문 출처

MarkTechPost

내용 안내

원문 발행 및 권리는 출처에 있습니다.

기계 번역 · 원문을 참고하세요