量子位

0.2초 급정거, 초 단위 재계획! 카인지 인텔리전스가 실제 세계로 진입하다

이것은 로봇이 전자레인지 문을 닫고 있는 중에 갑자기 사람의 손이 들어오면서 급하게 멈춘 순간입니다.

이미지 출처 · 量子位

제이가 구멍이 있는 사원에서 보내다

양자비트 | 공식 계정 QbitAI

0.2초.

이는 로봇이 전자레인지 문을 닫고 있을 때, 갑자기 사람의 손이 들어오면서 급히 멈춘 순간입니다.

더 흥미로운 것도 있어요.

메탈 캔이 케이크 접시에 섞여 있는 상태에서 전자레인지로 가져가는 경우, 로봇 팔은 먼저 캔을 꺼내서 한쪽에 놓고, 접시가 안전한지 확인한 후에 다시 전자레인지 안으로 넣습니다.

사실, 이 몇 개의 데모를 보면서 나는 정말 놀랐어요.

몸을 갖춘 로봇에 오랫동안 관심을 가진 사람이라면 알 수 있듯이, 지금 많은 로봇들이 꽤 멋져 보이지만 대부분의 경우는 '실수'를 하죠. 빛이 바뀌거나, 무언가가 차이거나, 명령에 약간의 숨은 의도가 생기면 로봇은 순식간에 엉망이 되어버립니다.

하지만 영상처럼 손전등으로 로봇의 눈을 번쩍이며 공격해도, 그 로봇은 아무런 반응도 보이지 않았다...

하지만 방금 보인 그 장면들은 미리 녹화된 동작 재생도 아니고, 우연히 맞은 통계 상관관계도 아닙니다.

연속적으로 발생하는 돌발적인 교란에 직면하여, 시스템은 물리 세계의 인과 법칙에 대한 이해를 바탕으로 실시간으로 이 일련의 동작을 추론해냈습니다.

이 로봇을 구동하는 시스템의 코드는 CRIS-0입니다.

그 뒤에는 캘리포니아 대학교 산디에고 분교(UCSD)의 조교수이자 CMU 인과학 학파 연구원인 황비위가 설립한 인과 지능 기업이 있다.

Aether AI.

3개월 전, 쿼크위티는 이 회사가 선택한 인과지능 방향에 대해 보도했습니다. 당시 많은 사람들은 인과 AI가 아직 수학 공식과 사고 실험에 머물러 있다고 생각했습니다.

현재, Aether AI는 공식 데모를 공개했습니다.

기계적 «헛소리»를 끝내기: 로봇이 인과관계를 이해하는 법

몸을 가진 로봇의 실제 적용 시나리오에서 엔지니어들이 가장 골치 아픈 것은 표준 프로세스가 아니라, 어디에나 존재하는 예기치 못한 문제들입니다.

전통적인 로봇은 갑작스러운 방해에 직면했을 때 기계적으로 기존 좌표를 반복하여 충돌을 일으키거나, 전체 과정을 통틀어 오류를 표시하며 멈추는 경우가 많습니다. 반면 엔드투엔드 블랙박스 모델은 수십 단계에 달하는 긴 작업에서 누적 오차가 매우 심해, 한 단계의 오류로 전체 시스템이 붕괴될 수 있습니다.

CRIS-0이 제시한 해결책은 ‘인과’입니다.

로봇이 '무엇을 보는지'에서 '왜 그런 일이 일어나는지, 무엇이 변하면 결과가 어떻게 달라지는지 이해하는 데로 나아가도록 하세요.

첫째, 성적표를 보세요.

외부의 갑작스러운 방해에 직면한 커피 준비 테스트에서, 로봇이 커피 머신을 잡는 과정에서 인위적인 이동이나 빛의 급변이 발생했습니다. CRIS-0은 평균 2초 안에 원인과 결과 변수의 변화를 인식하고 실시간으로 재계획을 수행했으며, 10번의 무작위 방해 중 9번에 걸쳐 효과적인 복구를 이루었습니다.

그리고 맹목적으로 전 과정을 다시 시작하는 것이 아닙니다.

커피 머신이 밀려 나가고, 시스템이 추적하는 것은 '손잡이의 상대 위치'라는 중요한 인과 변수입니다. 이 변수의 상태가 변동된 것을 발견하면, 시스템은 근접 및 잡는 동작 단계만 수정할 뿐, 원래 위치로 돌아가서 다시 시작할 필요는 없습니다.

방해에 대한 저항은 기본 기술일 뿐이며, 장거리 자율 임무에서는 인과학적 구동의 장점이 더욱 두드러진다.

“거실 물건 찾기 및 정리”와 같은 수십 단계에 달하는 연속적인 작업에서, 시스템은 장기적인 목표를 원자화되고 검증 가능한 인과적 단계로 나누고, 한 단계씩 진행할 때마다 전제 조건과 후속 조건 검사를 수행합니다.

더 흥미로운 것은 CRIS-0이 보여주는 상식적 추론과 물리적 인지 능력입니다:

책상을 정리할 때, 흩어져 있는 일반적인 책들은 테이블 위에 정리되지만, 개인정보와 관련된 청구서는 서랍에 넣어둡니다.

외형이 비슷한 두 개의 음료 캔을 마주했을 때, 그것은 먼저 잡고 흔들어서 캔의 무게와 내부 액체의 상태를 감지한다. 빈 캔임을 확인한 후에야 쓰레기통에 버린다. 마시지 않은 음료는 제자리에 잘 보관해 둔다.

마지막으로, 불명확한 요구 상황에서 인과는 지시어의 범용성을 크게 향상시켜 개인화된 이해 능력을 제공할 수 있습니다.

Personal Pick and Place 테스트에서 「조기 달리기 후 마시기에 적합한 음료 한 병 가져오세요」와 같은 20개의 모호한 지시에 직면했을 때, 시스템은 18번의 정확한 집어서 놓는 작업을 수행했습니다.

그것은 키워드를 기억하여 운을 쫓는 것이 아니라, 시간, 사용자 상태, 환경 맥락을 결합하여 ‘운동 후에 에너지를 보충하고 고당지수 식품을 피해야 한다’는 것을 숨겨진 인과 변수로 추출하여 해당 작업을 자동으로 매칭한다.

이러한 Demo들 뒤에는 도대체 어떤 기술 아키텍처가 존재하는가?

CRIS-0을 분해하기: 블랙박스를 인과 연산기로 변형하기

이 질문에 답하기 전에, 먼저 다른 문제를 명확히 해야 할 것 같습니다—

왜 예전의 로봇들은 항상 '무능한' 느낌을 주었을까?

물리적 세계와 순수 디지털 세계는 완전히 다른 것이다. 컴퓨터에서 코드를 작성하거나 채팅을 할 때 실수하면 되돌릴 수 있지만, 현실 세계에서는 마찰력, 중력, 충돌, 빛의 변화 등 다양한 돌발 상황이 초당 일어난다.

전통적인 엔드투엔드 모델, 예를 들어 VLA 방식은 학습 속도가 빠르지만, 긴 프로세스 작업을 처리할 때 치명적인 약점이 하나 있는데, 그것은 바로 오차의 누적입니다.

1단계는 약간의 편차가 있고, 2단계에서는 편차가 커진다. 10단계에 이르면 전체 동작이 완전히 변형될 수도 있다. 더욱 심각한 것은 단일 블랙박스 모델이 방해를 받았을 때, 무슨 일이 일어났는지 알 수 없으며, 결국 원래 계획대로 계속 누르거나 직접 멈추고 작동을 중단해야 한다.

또 다른 흔한 에이전트 방안은 단계별로 구분을 하지만, 그 사고 논리는 순수 텍스트나 다중 모달 대형 모델의 확률 추론에 머물러 있습니다.

환경이 바뀔 때마다, 먼저 화면을 텍스트로 변환해야 합니다. 모델이 '다음에 무엇을 해야 할까'를 천천히 고민하는 동안, 당신이 추론을 마치기도 전에 손이 문에 끼일 수도 있습니다...

CRIS-0이 보여주는 이러한 방해에 대한 저항력과 연속성은 도대체 어떻게 가능한 걸까?

에테르 AI는 새로운 논리 체계를 개발했습니다:

인과적 원천적인 에이전트 아키텍처.

세 가지 차원에서 이해할 수 있다—

1. 작업이 상태 그 자체이다: 물리적 인과 변수를 추출하라

이것이 제가 가장 중요하다고 생각하는 제1원리입니다.

CRIS-0 시스템에서 매우 근본적인 변화가 있었는데, 이는 통일된 상태와 인과 변수라는 것입니다.

과거의 로봇은 세계를 보며 빽빽한 이미지 픽셀을 관찰했습니다. 하지만 CRIS-0의 눈에는 세계의 표면이 어떻게 생겼는지가 아니라, 작업이 어느 단계에 이르렀는지가 중요합니다. 작업 자체가 바로 인과관계 상태 진행바입니다.

특히 실제적인 예를 들자면, 로봇이 테이블 커버를 깔는 경우 같은 것입니다.

그는 테이블보의 모든 픽셀의 좌표를 어리석게 계산하지 않고, 몇 가지 핵심 인과 변수를 실시간으로 추적합니다. 예를 들어 테이블보가 클로에 의해 실제로 잡혀 있는지, 테이블보의 모서리가 목표 위치에서 몇 센티미터 떨어져 있는지, 당기는 과정에서 미끄러지는 현상이 발생했는지 등입니다.

잡기 과정에서 미끄러지면 시스템은 '잡는'이라는 인과 변수가 충족되지 않았다는 것을 즉시 알게 되고, 그러면 작업 상태는 다시 잡기를 시작하는 단계로 바로 돌아가며, 전체 동작을 취소하고 처음부터 다시 시작하거나 맹목적으로 공기를 더 끌어당기는 것은 없습니다.

공식적으로 발표된 커피 제조 방해 테스트에서, 커피 머신이 반복적으로 위치가 바뀌고 빛이 급격히 변하는 고통스러운 상황에 직면했을 때, 시스템은 평균 2초 내에 주요 변수의 변화를 인식하고 재계획을 수행할 수 있었으며, 10번의 외부 방해 중 9번에서 효과적인 복구를 이루었습니다.

이것이 인과 변수의 힘입니다. 예상치 못한 상황이 발생했을 때, 그것은 어떤 단계에서 잘못되었는지, 어느 단계로 되돌아가야 하는지를 명확하게 알고 있습니다.

2. 통합 도구 인터페이스: 단일 전략만으로 모든 것을 처리하는 것을 거부하라

그렇다면 이 시스템은 구체적으로 Action을 어떻게 실행하는가?

답변: Tool Call, 각각의 도구가 각자의 역할을 수행합니다.

그 구조에는 전체 스케줄링을 담당하는 Planner가 있으며, 이 Planner는 기능이 완비된 도구 세트를 관리하고 Unified Tool Interface를 통해 다양한 모듈을 통합합니다.

규칙 기반 함수 (Rule-based functions): 시각적 위치 설정과 역운동학을 결합하여 넓은 공간의 이동 및 사전 위치 설정을 효율적으로 처리합니다.

스킬 전략 모델 (Policy models): 물을 뒤집는 작업, 정밀 잡기와 같은 높은 난이도의 접촉식 작업을 해결하기 위한 전문 모델입니다.

내비게이션 모듈(SLAM): 전역 경로 지정을 담당합니다;

검증기(Verifiers): 각 단계 노드에서 물리적 검사를 수행합니다;

인과 세계 모델(CausalWM): 동작이 가져오는 물리적 결과를 추론하는 역할을 합니다.

그 중에서도 가장 핵심적인 무기란 바로 이 인과적 세계 모델입니다.

많은 친구들이 세계 모델에 대해 이야기할 때, 첫 번째 반응은 앞으로 몇 초간의 사실적인 비디오를 생성하는 것이었다. 하지만 CRIS-0의 CausalWM는 행동이 환경에 미치는 영향에 더 주목한다.

그의 논리는 현재 상태를 먼저 살펴보고, 후보적인 동작이 어떤 인과 변수에 변화를 가져올지 예측한 다음, 미래의 상태를 도출하는 것입니다.

다시 말해, 로봇은 손을 뻗기 전에 머릿속에서 이미 시뮬레이션을 하고 있습니다. 예를 들어, 이렇게 하면 손이 비뚤어질까? 컵이 넘어질까?

'리허설' 단계가 하나 추가된 것과 같아서, 시스템은 세계 모델에서 '행동 B를 수행하면 물리적 인과 변수는 어떻게 변화할까'를 시뮬레이션합니다. 목표를 달성할 수 있다는 것을 확인한 후에 Action Head을 호출하여 최하위 제어를 실행합니다.

3. 구조화된 루프와 생동성 보안 내장

그리고 이 모든 것은 Loop 안에서 반복됩니다.

복잡한 작업에 직면했을 때, Planner는 큰 목표를 작은 단계로 나누고, 규칙 함수를 호출하여 클램핑 도구를 목표 근처로 빠르게 이동시킨 다음, 전략 모델을 호출하여 정밀한 접촉 잡기를 완료합니다. 원래 단일 모델로는 끝까지 해결하기 어려운 복잡한 문제도 몇 개의 확실한 작은 단계로 나뉩니다.

구체적으로는 이런 동적인 진화하는 작업 그래프입니다: 상태 인식 → 도구 선택 → 실행 → 검증 → 조정.

각 단계를 완료할 때마다 검증기가 물리적 조건이 충족되는지 즉시 확인합니다. 조건이 충족되지 않으면 시스템에는 명확한 3단계 복구 메커니즘이 있어, 이 단계에서 바로 다시 시도할 수 있는지 판단하고, 불가능하면 경로를 재계획하며, 여전히 불가능하면 인간의 개입이 필요하다는 알림을 줍니다.

일단 예기치 않은 조정이 성공하면, 이 성공한 복구 경로는 작업 다이어그램에 기록되어 저장됩니다. 다음에 비슷한 상황이 발생할 때면 더욱 능숙해질 것입니다.

이는 그 거실의 장기적인 정리 작업에서 수십 또는 수백 단계를 연속적으로 실행하면서도 시스템이 붕괴되지 않는 이유를 설명해 준다.

그것은 한 걸음씩 나아갈 때마다 인과관계의 상태를 확인하기 때문에, 오류는 발생하는 순간에 바로 해결되며, 눈덩이처럼 전체 시스템이 붕괴될 가능성은 전혀 없다.

마찬가지로, 이것이 0.2초의 안전 정지를 달성할 수 있는 이유이기도 합니다.

CRIS-0에서는 보안 판단이 각 인과 관계 단계에 직접 내장되어 있습니다.

문을 닫는 단계에서 갑자기 나타난 사람의 손이 사용자의 안전 조건을 위협하는 위험 변수가 되며, 시스템은 상태 계층에서 즉시 이를 포착하여 최우선 순위의 차단을 수행하고 0.2초 만에 정지합니다.

하지만 현재의 과제가 인류에게 물 한 잔을 주는 것이라면, 내밀어진 손이 상호작용의 목적 변수가 되고, 시스템은 혼란스럽게 멈추지 않을 것이다.

실제로 CRIS-0이 보여주는 이러한 시스템 수준의 능력은 갑자기 생겨난 것이 아니라, 견고한 연구 기반이 뒷받침하고 있습니다.

에이전트 능력 평가에서, 이전에 Aether AI의 인과 지능체 프레임워크 RSIAgent는 OSWorld 2.0에서 78.98%의 Partial Score를 달성했으며, 모델 파라미터를 업데이트하지 않아도 오픈소스 모델의 에이전트 능력을 향상시켜 GPT-6 Astra와 같은 폐쇄형 모델을 넘어섰습니다.

첫 번째 버전의 인과적 세계 모델CausalWM도 로봇 세계 모델 기준 TriWorldBench에서 리더보드에서 1위를 차지했습니다.

그리고 이 두 층은 바로 이 데모의 주요 기여자들입니다.

또한 두 가지 측면도 지속적으로 발전하고 있습니다—모듈화 신경 아키텍처: 각 모듈은 서로 다른 인과 메커니즘에 해당하며, 조합하거나 교체할 수 있습니다; Causation Transformer: 통계적 의존성이 아닌 인과관계를 학습합니다.

물리적 세계는 암기에 의존하지 않는다

이 정도로 이야기했으면, 우리는 실제 로봇 데모를 벗어나 더 깊은 곳을 살펴볼 수 있을 거예요.

왜 지금 사람들은 인과지능에 대해 점점 더 자주 이야기하고 있을까?

솔직히 말해서, 지난번 대언어 모델의 급성장은 상당 부분 운이 좋았던 것이에요. 언어 자체는 인간이 고도로 기호화되고 추상화된 형태입니다. 많은 논리와 규칙들은 이미 인간이 텍스트 표면에 정리해 두었죠. 단순히 확률과 관련된 통계적 적합을 통해 기적을 이룰 수 있어요.

하지만 물리 세계는 이런 방식으로 작동하지 않는다.

마찰력은 십만 편의 논문을 읽는다고 해서 변하지 않으며, 중력도 확률 통계 때문에 갑자기 사라지지 않는다. 복잡하고 역동적인 현실 세계에서는 단순한 표면적 상관관계에 의존하는 방식으로는 결국 스케일링 법칙의 한계에 부딪힐 수밖에 없다.

물리적 데이터가 심각하게 부족한 상황에서 복잡한 물리 환경에 대응할 수 있는 시스템을 만들려면, 모델은 인간 과학자처럼 적은 양의 데이터로부터 근본적인 인과 메커니즘을 찾아내고 행동이 세계를 어떻게 변화시키는지 이해하는 법을 배워야 합니다.

‘인과’의 첫 번째 원리 구조로 구성된 이런 압축 방식이야말로 본래적인 Scaling Law일지도 모릅니다.

물론, 이 길은 매우 험난합니다. 인과관계 발견과 인과관계 표현 학습은 수학 및 통계 이론에 있어 매우 높은 요구를 가지며, 전 세계적으로 깊은 이론적 축적과 엔지니어링 적용 능력을 동시에 갖춘 팀은 극소수에 불과합니다.

에테르 AI가 참여하는 것은, 상당 부분 그 독특한 학문적 흐름과 관련이 있을 것이다.

황비위는 이 분야에서 십여 년간 깊이 있게 연구해왔습니다. CMU 인과학파의 기반을 마련한 클라크 글리무어, 피터 스피르테스와 2세대 학자인 베른하르트 쇼르코프프, 쿤 장 등으로부터 배웠으며, 인과 발견학파의 핵심 후계자 중 한 명입니다.

세대에 걸친 인과학파의 이론적 흐름은 결국 오늘날 Aether AI의 기반 기술 기둥으로 통합되었다.

카네기 메릴랜드 대학과 마프의 이론적 기반에서 현재 CRIS-0이 실제 로봇팔에 구현된 것으로, 인과지능은 마침내 물리 세계로 나아가는 중요한 한 걸음을 내딛었다.

한 시스템이 인과 변수를 추출하고 세계 역학을 모델링하며 행동 전에 결과를 추론하는 능력을 갖추면, 그 활용 범위는 단순히 전자레인지를 끄거나 커피를 따르는 것에만 국한되지 않습니다.

더 먼 곳을 바라보면, 복잡한 동적 시스템의 트렌드 예측부터 재료학, 생명과학 등 분야의 과학적 발견에 이르기까지, 아마도 이 논리를 활용할 수 있을 것이다.

위대한 시대이야, 친구들.

우리는 AI가 순수한 숫자로만 구성된 채팅창을 벗어나, 실제적이고 복잡하며 미지가 가득한 물리 세계에서 안정적으로 자리 잡기를 기대해왔습니다.

그리고 인과관계는, 아마도 가장 중요한 열쇠일 것이다.

— 완 —
양자비 QbitAI · 헤드라인 계약
우리를 팔로우하여 최신 기술 동향을 가장 먼저 알아보세요

 

원문 출처

量子位

내용 안내

원문 발행 및 권리는 출처에 있습니다.

기계 번역 · 원문을 참고하세요