MarkTechPost

Reka가 Rho-1을 출시함: 비디오를 이해하고 생성하며 로봇 행동을 출력하는 19BOmni-Reasoning 모델

Reka는 처음부터 훈련된 19B 개의 omni-reasoning 모델인 Rho-1을 출시했습니다. 한 네트워크는 공유된 KV 캐시를 통해 텍스트, 이미지, 비디오 및 로봇 동작을 읽고 생성합니다. 간소화된 변형 버전은 약 1초 만에 5.3초짜리 클립을 생성합니다. 이는 아직 공개된 가중치가 없는 연구 예비 제품입니다. MarkTechPost에 게시된 "Reka, Rho-1 출시: 이해하고…

Reka는 19B 크기의 omni-reasoning 모델인 Rho-1의 연구 프리뷰를 공개했습니다. 이 모델은 처음부터 직접 훈련된 것입니다. 단일 신경망이 텍스트, 이미지, 비디오를 이해하고 생성하며, 이를 바탕으로 논리를 수행하고 로봇 행동을 출력합니다. Reka는 모드별 모델 간에 작업을 전달하는 에이전트식 파이프라인의 직접적인 대체재로 이를 설명합니다.

Rho-1이 변경한 내용

오늘날 대부분의 다모달 시스템은 파이프라인 형태입니다. 중앙 모델이 계획을 세운 다음, 이미지, 비디오 또는 감지 작업을 전문가들에게 맡깁니다. 각 전문가에게 작업이 넘어가는 과정에서 지연이 발생하며, 각 전문가는 좁은 범위의 요청만을 받습니다.

Rho-1은 그러한 전달 과정을 제거합니다. 텍스트, 시각 정보 및 로봇의 동작이 하나의 컨텍스트 창 내에서 토큰으로 변환됩니다. Reka의 연구에 따르면, 한 번의 미편집 세션에서 전체 과정이 보입니다. 모델은 등대를 그리고, 그것을 상자로 묶고, 애니메이션을 적용하며, 비디오를 눈보라로 편집하고 그 차이점을 설명합니다. 이 모든 것이 5번의 턴 안에 일어나며, 도구 호출도 없고 두 번째 모델도 없습니다.

아키텍처: 두 개의 스트림, 하나의 KV 캐시

모든 입력 및 출력은 두 가지 기본 형식 중 하나를 사용합니다:

  • 분리된 토큰은 텍스트, 기호적 추론 및 고급 명령을 담고 있습니다.
  • 연속 토큰은 이미지 랜티스, 비디오 프레임, 로봇 동작 및 자기 인식 정보를 포함합니다.

각 트랜스포머 블록은 두 개의 전문가 무게 스트림을 담고 있습니다. 이해 스트림은 언어 및 시각적 파싱을 처리하며, 생성 스트림은 잔차를 이미지와 비디오로 변환합니다. 두 스트림은 같은 주의를 공유하고 동일한 KV 캐시를 통해 작동합니다.

답장에 픽셀이 필요할 때, 이해 스트림은 개별적인 전달 토큰을 생성합니다. 그 후 생성 스트림은 축적된 전체 상태로부터 렌더링됩니다. 훈련 과정에서는 개별 시퀀스에 대한 다음 토큰 예측과 연속적인 출력에 대한 플로우 매칭을 결합합니다.

이 디자인은 실용적인 효과를 가집니다. 경계 상자들은 별도의 검출기에서 생성된 것이 아니라 좌표 토큰으로 나타납니다. 비디오의 첫 번째 프레임은 재인코딩된 복사본 대신 컨텍스트 내 이미지 표현을 재사용합니다.

속도: 기본 모드 vs 정제된 모드

기본 모델은 실시간의 0.79배 (중앙값)로 비디오를 생성하며, 시청 가능한 스트림은 약 6초에 시작됩니다. Reka 팀은 첫 번째 클립을 생성하는 데 7.0초가 걸렸으며, 다중 에이전트 파이프라인의 경우 설명용으로 13.8초가 소요되었습니다.

정제된 버전은 디노이징 단계를 99단계에서 8단계로 줄였으며, 품질 손실도 거의 없었다. 약 1초 만에 5.3초 길이의 클립을 생성했다. Reka의 내부 테스트에서는 가장 빠른 전용 이미지 모델과 비슷한 성능을 보였다. 또한 첫 번째 텍스트 토큰까지 처리하는 데 가장 빠른 모델이었다. 이는 공급업체가 진행한 테스트이며, 독립적인 벤치마크는 아니다.

세계 모델 및 로봇공학

Rho-1은 연속적으로 스트림을 전송하며, 클립마다 새로운 지시가 들어옵니다. 이러한 지시는 이해 스트림을 통해 전달되며, 롤아웃 중에 상태가 업데이트됩니다. Reka는 ‘은행 왼쪽’과 ‘은행 오른쪽’으로의 연속적인 진행 방식 중 하나를 보여줍니다.

로봇공학의 경우, 동작과 미래 프레임은 같은 잠재적 상태에서 디코딩된다. LIBERO 시뮬레이션 에피소드에서는 Rho-1이 7개의 동작 채널을 방출하는 것을 보여준다. 부족한 원격 조작 로그를 넘어서는 규모로 확장하기 위해, Reka는 Rho-1과 인버스 동적 모델을 결합하여 원시 비디오로부터 제어 신호를 추론한다.

Rho-1의 비교 방법

2026년 10월 5일 공식 출처로부터 데이터가 확인되었습니다.

특징레카 로-1ByteDance BAGELBAAI Emu3.5구글 Genie 3
개발자레카바이트댄스 시드BAAI구글 딥마인드
매개변수19B14B 총, 7B 활성화된 것 (MoT)34B공개되지 않았습니다
입력값텍스트, 이미지, 비디오, 액션, 자기 인식텍스트, 이미지혼합된 텍스트와 이미지텍스트 프롬프트, 내비게이션 입력
출력물텍스트, 이미지, 비디오, 액션, 자기 인식텍스트, 이미지혼합된 텍스트와 이미지인터랙티브 비디오 세계
네이티브 비디오 생성네, 672×384로 제한됩니다아니요아니요 (이미지 프레임, 원본 클립은 아닙니다)네, 720p, 24fps입니다.
실시간 스티어링네, 지속적인 배포가 진행됩니다아니요아니요네, 요청에 응답할 수 있는 세계 사건들
로봇 동작네이티브 연속 행동 토큰아니요몸에 담긴 조작 데모내비게이션 작업을 수행하고, 그 작업을 출력하지 않음
개방형 가중치아니요예, Apache 2.0예, Apache 2.0아니요
오늘 바로 접속하기contact@reka.ai를 통해 연구 미리보기를 받으세요.하우징 페이스, GitHub하ング패스, emu.world 앱Google AI Ultra 구독자을 위한 프로젝트 제니
출처/자료Reka 블로그GitHubHugging FaceDeepMind 블로그

Project Genie의 Genie 3 접근 권한; Hugging Face 모델 카드에 명시된 Emu3.5 매개변수 수.

주요 요점

  • Rho-1은 텍스트, 이미지, 비디오 및 로봇 동작을 읽고 쓰는 19B 모델입니다.
  • 각 블록에 두 개의 전문가 스트림과 하나의 KV 캐시가 존재합니다.
  • 디스틸레이션 과정은 디노이징을 99단계에서 8단계로 줄여주며, 5.3초의 클립당 약 1초가 걸립니다.
  • 3개월 동안 320대의 H100을 통해 훈련되었으며; 비디오는 672×384로 제한됩니다.
  • 리서치 미리보기일 뿐입니다: 공개된 무게 정보, API 또는 가격 정보는 아직 없습니다.


기술 세부 정보과 X에서의 공지을 확인해 보세요. 모든 공로는 이 프로젝트의 연구원에게 있습니다. 또한, Twitter에서 저희를 팔로우하고, 150k+ML SubReddit에 가입하고 저희 뉴스레터을 구독하는 것을 잊지 마세요. 잠깐! 당신은 Telegram에도 있나요? 이제 당신도 Telegram에서 저희와 함께할 수 있습니다.

GitHub 저장소, Hugging Face 페이지, 제품 출시, 웹 세미나 등을 홍보하기 위해 저희와 협력하고 싶으신가요? 저희와 연락하세요

Reka가 Rho-1을 출시함: 영상을 생성하고 로봇 동작을 출력하며 이해할 수 있는 19B Omni-Reasoning 모델라는 게시물은 MarkTechPost에 처음 등장했습니다.

원문 출처

MarkTechPost

내용 안내

원문 발행 및 권리는 출처에 있습니다.

기계 번역 · 원문을 참고하세요