The Decoder수정일

Reka AI의 옴니모델 Rho-1, 단일 모델로 텍스트·이미지·비디오·로봇 제어 처리

Reka AI의 Rho-1은 텍스트, 이미지, 비디오, 로봇 제어 동작을 하나의 신경망에서 처리하고 생성하는 19B 파라미터 옴니 모델입니다. 320장의 H100 GPU로 약 3개월 동안 학습되었으며, 오늘날 최상위 모델에 필요한 연산량의 극히 일부만 사용합니다. 작업을 특화된 시스템으로 라우팅하는 대신, Rho-1은 모든 모달리티를 하나의 공유 컨텍스트 윈도우에서 토큰으로 처리합니다.…

Matthias Bastian
이미지 출처 · The Decoder

Reka AI의 옴니모델 Rho-1, 단일 모델로 텍스트·이미지·비디오·로봇 제어 처리

Matthias Bastian Matthias Bastian Matthias Bastian의 LinkedIn 프로필 보기 2026년 10월 5일

Reka AI가 Rho-1의 리서치 프리뷰를 공개했습니다. 이 19B 파라미터 옴니 모델은 하나의 신경망에서 텍스트, 이미지, 비디오, 로봇 제어 동작을 처리하고 생성합니다. 대부분의 AI 시스템처럼 작업을 특화된 모델로 라우팅하는 대신, Rho-1은 도구 호출이나 외부 모델 없이 모든 모달리티를 하나의 공유 컨텍스트 윈도우에서 토큰으로 처리합니다. 이 모델은 실시간으로 연속 비디오를 생성하고, 재시작 없이 새로운 지시에 즉시 대응합니다.

카메라 이미지를 예측하는 동일한 가중치가 로봇 움직임도 제어합니다. 부족한 로봇 학습 데이터를 보완하기 위해 Reka AI는 일반 인터넷 영상에서 제어 신호를 추출하는 역동학 모델 을 구축했습니다. Rho-1은 320장의 H100 GPU로 약 3개월간 학습되었습니다.

Reka AI는 멀티모달 AI 분야의 신입이 아닙니다. 2024년 4월, 이 회사는 벤치마크에서 GPT-4, Claude 3, Gemini Ultra와 경쟁한 멀티모달 언어 모델인 Reka Core, GPT-4, Claude 3 및 Gemini Ultra와 벤치마크에서 경쟁했던 멀티모달 언어 모델입니다. 이번 출시는 소위 월드 모델을 향한 AI 연구의 더 넓은 흐름에 부합합니다.Ad

과장 없는 AI 뉴스 – 사람이 직접 큐레이션

광고 없는 읽기, 매주 AI 뉴스레터, 연 6회 독점 "AI Radar" 프론티어 리포트, 전체 아카이브 접근, 그리고 댓글 섹션 이용을 위해 THE DECODER를 구독하세요.

출처: Reka AI
원문 출처

The Decoder

내용 안내

원문 발행 및 권리는 출처에 있습니다.

기계 번역 · 원문을 참고하세요