雷峰网 AI

데이터가 많다고 해서 의사결정이 더 좋다는 것은 아닙니다: 드론의 활주로에서 다중 로봇 통신까지, 데이터와 정보의 관계를 다시 살펴보다 | IROS 2026

지능의 상한을 결정하는 것은 데이터의 절대적 규모가 아니라, 데이터의 질과 정보 밀도입니다. 저자 | 천펑. 생성형 AI의 물결 속에서 로봇 커뮤니티는 전통적인 제어 방식에서 엔드투엔드 학습으로의 패러다임 전환을 겪고 있습니다. 많은 분야와 마찬가지로, 여기에서도 데이터 규모에 대한 미신이 퍼져 있으며 “데이터가 많을수록 더 똑똑해진다”는 것이 범용 신체적 지능으로 가는 유일한 길이라고 믿고…

지능의 상한을 결정하는 것은 데이터의 절대적 규모가 아니라, 데이터의 품질과 정보 밀도입니다.

저자 | 첸펑

                                                                                                       

생성형 AI의 물결 속에서, 로봇 커뮤니티는 전통적 제어 방식에서 엔드투엔드 학습으로의 큰 전환을 겪고 있다. 많은 분야와 마찬가지로, 여기서도 데이터 규모에 대한 미신이 퍼져 있으며, “데이터가 많을수록 더 똑똑해진다”는 것이 범용 신체화 지능으로 가는 유일한 길이라고 믿는다. 그러나 최근 끝난 IEEE/RSJ 스마트 로봇 및 시스템 국제 회의(IROS)에서 퀸스랜드 대학의 Jen Jen Chung 교수가 기조 연설에서 10여 년간의 연구 사례를 바탕으로 깊은 통찰을 주는 결론을 제시했다.모든 데이터가 평등한 것은 아닙니다. 무의식적으로 데이터를 쌓아놓으면 시스템이 붕괴되고 전략이 제 기능을 하지 않게 됩니다.충 교수는 강연 시작에서 바로 핵심 주장을 제시했습니다:방대한 데이터는 높은 정보량과 동일하지 않다방대한 데이터를 가지고 있음에도 불구하고 아무런 성과도 얻지 못하는 경우가 많습니다. 왜냐하면 많은 데이터가 문제의 본질을 제대로 이해하는 데 도움을 주지 못하기 때문입니다. 범용 자율 시스템으로 나아가는 길에서지능의 상한을 결정하는 것은 데이터의 절대적 규모가 아니라 데이터의 품질과 정보 밀도입니다.。그녀의 연구 경력의 시작점인 드론 자율 활주 과제에서, 종 교수는 “탐구에는 대가가 있다”는 것을 깊이 느꼈습니다. 고정익 드론을 새처럼 상승 기류을 자율적으로 이용하도록 하려면 귀중한 에너지를 소비하여 미지의 상태-동작 공간을 탐색해야 합니다. 이로 인해 그녀는 데이터를 언제 수집해야 하는지, 어떻게 수집해야 하는지에 대해 고민하게 되었습니다. 무의식적이고 균일한 샘플링은 자원 낭비일 뿐만 아니라 학습 과정을 지연시킬 수도 있습니다. 이러한 초기 연구들은 그녀에게 다음과 같은 인식을 주었습니다:데이터의 가치는 균일하게 분포하지 않습니다. 필요에 따라 수집된 고가치 정보가 방대한 무차별적인 중복 관측보다 훨씬 유익합니다.이러한 데이터 가치의 비균질성에 대한 깊은 통찰은 분산형 다로봇 시스템에서 특히 중요하다. 연구 대상이 단일 기계에서 다기계 협력으로 확장되고, 제한적이고 감쇄하며 높은 지연을 보이는 실제 통신 채널에 직면했을 때, "언제 어디서나 모든 노드에 모든 데이터를 전량 브로드캐스트하는" 것은 실현 불가능할 뿐만 아니라 재앙적인 네트워크 혼잡을 초래할 수도 있다. 이러한 상황에서 Chung 교수는 데이터 공유의 가치를 측정하는 유일한 금标准을 제시했다.“이 정보를 파악했다면, 행동 결정에 변화가 생길 수 있을까?”이에 따라 그녀의 팀은 매우 창의적인 핵심 논리를 도입했습니다:전체 데이터가 아닌, 가장 중요한 정보만 전송하세요. 강연에서 쉰 교수는 대역폭 비용과 데이터 정확도 사이에서 훌륭한 균형을 이루는 방법을 잘 보여주는 여러 사례를 제시했습니다. 강연 마지막에 쉰 교수는 현재 로보틱스 분야에서 가장 뜨거운 종단 간 전략 학습 패러다임을 지적하며 "방 안의 거대한 코끼리"에 직면했습니다. 복잡한 풍부한 접촉 조립 작업에서, 기계 팔에 방대한 다중 모드 데이터(시각, 힘 감지, 본체 감지)를 제공했음에도 불구하고 실행 성능은 매우 평범했으며, 심지어 빈 상자 상황에서도 기계적으로 삽입 동작을 반복했습니다. 이에 정 교수팀은 “전략 복구” 방안을 제안했습니다. 실험 결과, 동일한 가르치는 데이터 예산 하에서 이러한 “복구적” 샘플을 지정하는 방법은 데이터를 무분별하게 확장하는 것보다 전략적 일반화 성능이 훨씬 더 향상된다는 것이 입증되었습니다. 이것은 이번 강연의 주제를 다시 한 번 입증합니다:“데이터 품질이 상한선을 결정한다”, 무의식적으로 데이터 규모를 추구하는 것은 헛된 숫자 게임에 불과하다.다음은 Jen Jen Chung의 강연 내용입니다. AI 기술 리뷰는 그 영어 강연 내용을 그대로 편집하지 않고 번역했습니다.

▎강연 제목:(Geometry Strikes Back: 3D 재구성의 확장 및 3D 장면 생성의 구조화)

연사: 퀸즐랜드 대학교 Jen Jen Chung

01


드론 활공으로 시작하기: 데이터와 정보의 단절

“데이터”는 “정보”와 동일하지 않습니다. 일부 데이터 조각은 매우 많은 정보를 담을 수 있지만, 반대로 방대한 양의 데이터를 가지고 있어도 아무것도 얻지 못할 수도 있습니다. 현재 “데이터와 정보의 관계”를 다시 살펴보는 것은 특별히 의미가 있습니다. 현재의 기술 물결 속에서 우리는 가능한 한 많은 데이터를 수집하는 데 집착하며, “데이터가 많을수록 모든 문제를 해결할 수 있다”고 믿습니다. 오늘 저는 바로 이러한 사고방식을 도전하고 싶습니다. 데이터와 정보 사이의 단절은 제 과거의 많은 연구를 관통했습니다. 제 박사 과정에서 연구했던 주제는 드론의 자율 스러스트입니다. 자연이 우리에게 훌륭한 예시를 보여주었습니다: 새들은 바람 속에서 에너지를 얻고 상승하는 열기류를 이용해 높이를 높이는 방법을 알고 있습니다. 우리가 당시 탐구했던 것은 고정익 드론도 같은 작업을 수행할 수 있는지였습니다. 탐색 전략의 관점에서 보면 이는 매우 흥미로운 과제입니다: 비행 시간이 길수록 "상태-동작 공간"을 탐색할 기회가 더 많아집니다. 하지만 핵심은 이렇습니다:탐험은 대가를 치러야 한다당신은 힘들게 얻은 에너지를 소비하여 상태-행동 공간의 미지의 영역을 탐색해야 합니다. 또한 이 여정에 보상을 가져올 수 있는 메커니즘은 전혀 없으며, 특정 지역을 열심히 탐색했지만 결국 아무것도 얻지 못할 수도 있습니다. 따라서 빠르게 배우고자 한다면 “언제 데이터를 수집하는가”와 “어떻게 데이터를 수집하는가”를 매우 신중하게 조절해야 합니다. 적절한 규모를 유지한다면, 거의 많은 훈련 횟수 없이도 꽤 효율적인 스로틀링 전략을 익힐 수 있습니다. 20~27라운드까지 우리는 매우 훌륭한 제어 전략을 훈련시켰으며, 이를 통해 드론이 열기류를 이용해 에너지를 얻을 수 있게 되었다. 더 흥미로운 것은 그 가치 함수 공간의 분석이다. 이러한 차트에서 각 곡선은 다양한 속도에서의 가치 함수를 보여준다. 속도가 특정 임계점에 도달하면 순 에너지 이익이 완전히 zero가 되는 것을 알 수 있다—속도가 너무 빠르기 때문에 드론은 직접 열기류를 통과하여 그 안에서 에너지를 차단할 시간이 전혀 없기 때문이다. 한 번 제어 전략이 이 점을 이해하면, 해당 영역을 탐색하는 것이 무의미하다는 것을 깨닫게 되며, 그 영역에서 더 많은 데이터를 수집하더라도 전략이 조금도 개선되지 않을 것입니다. 또 다른 예시는 미지의 비용 장 속에서의 최단 경로 계획입니다. 문제의 핵심은 두 점 사이의 최적한 경로를 찾는 것이며, 왼쪽 상단에 표시된 실제 비용 장은 초기 상태에서 완전히 알려져 있지 않으므로, 각 영역을 통과하는 비용을 지역적인 샘플링을 통해 파악해야 합니다. 이때 두 가지를 명심해야 합니다. 첫째, 샘플링에는 비용이 듭니다. 데이터를 탐색하고 수집하기 위해 실제적인 대가를 치러야 합니다. 둘째, 당신의 궁극적인 목표는 전체 비용장을 정확하게 재구성하는 것이 아니라 가장 짧은 경로를 찾는 것입니다. 이 점을 명확히 했다면, 균일한 샘플링을 하거나 비용장의 추정 오차를 줄이기 위해 맹목적으로 샘플링하는 것은 피해야 합니다. 데이터 수집을 어떻게 이끌어야 하면 가장 효율적으로 가장 짧은 경로에 대한 추론 정확도를 높일 수 있을까요? 시작점과 종점이 알려져 있으므로, 먼저 양방향 히스테리시스 검색을 실행할 수 있습니다. 우리는 다음과 같은 가정을 제시합니다: 만약 지금 이곳에서 관측 데이터를 수집한다면, 그 측정값이 우리의 후驗 신뢰도를 어떻게 바꾸게 될까요? 그것은 우리의 탐색 경계를 어떻게 재구성하게 될까요? 측정 유형이나 수치 스케일에서 어떤 선험적 변화가 발생할까요? 예상되는 대체 가치는 어느 수준일까요? 가장 중요한 것은: 그것이 최단 경로의 방향에 대한 당신의 판단을 바꾸게 될까요? 만약 그 측정값이 경로 추정치를 전혀 바꿔놓지 못할 것이라고 예측한다면, 이 샘플링은 전혀 필요하지 않습니다. 이에 따라 우리는 목적에 맞게 데이터 수집을 진행할 수 있습니다. 2017년에 제안한 빠른 전진 탐색 방법을 참고하세요: 이 알고리즘은 특정 영역이 매우 높은 비용을 요하는 영역임을 파악하면, 그 상태 공간과 탐색 서브 공간의 샘플링을 즉시 중단합니다—왜냐하면 왼쪽 위로 가면 더 짧은 경로를 찾을 가능성이 거의 없기 때문입니다. 우리는 귀중한 데이터 수집 예산을, 더 나은 해를 발견할 가능성이 높은 우측 하단의 고효율 영역에 집중해야 합니다. 이 두 경우에서 — 최소 경로를 찾는 경우든 드론의 자율 활주 경우든 — 불필요한 데이터를 수집하는 것은 해법을 구하는 데 실질적인 도움이 되지 않지만, 적어도 기존 해법을 파괴하지는 않으며, 단지 계산 효율을 지연시킬 뿐이다.

02


다중 로봇 시스템:

데이터 공유는 결코 무료로 이루어지지 않습니다.

특정 분야에서 시스템 내에 더 많은 데이터를 무의미하게 집어넣는 것은 유익하지 않으며, 오히려 전체 성능이 급격히 악화되는 결과를 초래한다. 이러한 현상은 주로 분산형 다수 로봇 시스템에서 나타난다. 그 이유는 시스템 내의 데이터 분배가 기반 통신 인프라에 전적으로 의존하기 때문이다.데이터 공유는 결코 무료로 이루어지는 것이 아닙니다.“.실제로는 대역폭의 한계를 피할 수 없으며, 통신 채널은 제한, 감쇠 및 지연으로 가득 차 있습니다. 네트워크 채널의 물리적 제약을 고려할 때, 언제 어디서나 모든 노드에 모든 데이터를 전체적으로 방송하는 것은 실현 불가능합니다. 또한, 데이터의 미세한 효용은 균등하게 분포되지 않으며, 이는 데이터 자체의 특성, 수신 노드의 정체성 및 수신 시점에 크게 의존합니다. 이러한 세 가지 요소를 고려하여, 어떻게 하면 각 노드가 가장 중요한 정보를 얻을 수 있도록 시스템 간의 데이터 분배 메커니즘을 계획할 수 있을까?” 우리는 "통신 대상"과 "통신 타이밍"부터 시작할 수 있다. 가장 직관적인 실제 적용 사례는 다대기 충돌 방지이다. 드론은 도대체 언제 다른 로봇의 방향을 알아야 하는가? 교차하는 항로를 가진 드론 무리를 상상해 보자: 그들이 항상 통신을 유지해야 하는가? 아니면 오직 자신들의 다른 개체의 행동에 대해 충분히 신뢰할 수 있는 추측이 없을 때만 통신이 필요한가? 당신이 반드시 물어봐야 할 핵심은:이 정보를 파악했다면 행동 결정에 변화가 생길 수 있을까?”노드가 노란색으로 점멸할 때는 서로 통신을 진행 중이거나 상대의 상태를 요청하고 있음을 나타내며, 파란색으로 표시될 때는 기기 내 예측이 충분히 신뢰할 수 있어 추가 데이터가 필요하지 않다는 것을 의미합니다. 이러한 세심한 통신 메커니즘을 통해 우리는 네트워크 채널 부하를 크게 줄이고, 고가치 정보가 목표에 정확하게 전달될 확률을显著히 높였습니다. 문제의 또 다른 차원은 “무엇을 전송하는가”입니다. 원본 데이터를 직접 전송하는 것 외에도, 근사 표현을 사용할 수도 있습니다. 우리는 매우 정교한 수학 도구인 블롬 필터를 도입했습니다. 로봇이 격자 지도에서 이미 탐색하고 관찰한 지역을 동기화하여 탐색 경로를 구축하는 작업을 생각해 보세요. 자세한 위치 궤적을 직접 전송할 수도 있지만, 훨씬 효율적인 인코딩 방식도 존재합니다. 예를 들어, 블롬 필터는 해시 매핑을 이용하여 상태 정보를 고밀도 배열로 압축함으로써 놀라운 데이터 압축 비율을 실현합니다. 데이터의 정확도가 약간 떨어지더라도, 데이터 크기가 매우 작아져서 불량한 채널에서의 전송 성공률이 크게 향상되었습니다. 정보가 빨간색 로봇에 동기화된 후, 그 로봇은 고양자열을 받아서 현지에서 상태 조회를 수행하여 특정 격자 단위가 확인되었는지 확인할 수 있습니다. 빨간색 로봇은 이를 바탕으로 격자(1,7)(1,7)가 녹색 로봇에 의해 관찰된 것으로 판단할 수 있다. 다른 격자를 조회할 때 해시 위치에 00이 존재하면 상대방이 아직 접근하지 않았음을 의미하므로, 그 영역은 자체적으로 탐험할 가치가 있는 잠재적 후보 지점으로 간주된다. 그러나 이러한 손실 압축의 대가로 일부 정확도가 희생된다. 특정 격자를 조회할 때 잘못된 양성 결과가 나타날 수 있는데, 어떤 격자는 실제로 탐험되지 않았음에도 해시 조회 결과 집합에 존재하는 것으로 표시된다. 이는 높은 압축 비율이 불가피하게 치르는 대가이다. 하지만 도구의 내부 작동 원리를 정확히 이해함으로써, 다른 공학적 기법을 교묘하게 도입하여 기존 도구의 성능 한계를 넘을 수 있습니다. 매우 간소하면서도 정교한 방법은 데이터에 염분을 첨가하는 것입니다: 즉, 무작위한 염분 값을 데이터와 결합한 후 해시를 실행하고, 그 염분 값을 데이터와 함께 전송합니다. 이렇게 하면 연속적인 관측 및 통신 주기 동안 각각 다른 독립적인 염분 값을 사용할 수 있으며, 해시로 생성된 비트 배열도 각각 다릅니다. 이는 네트워크 내에서 매번 전송되는 데이터가 통계적으로 독립적이 되며, 서로 독립적인 관측 샘플을 나타낸다는 것을 의미합니다. 이러한 통계적 독립성 덕분에 베이즈 추론과 순차 정보 합성의 모든 이론적 장점을 활용할 수 있습니다. 이로 인해 수신 측에서는 더욱 안정적인 결정을 내릴 수 있습니다. 시스템이 예정된 최대 단일 거짓 양성률이 50%에 달한다면—순간적인 거짓 양성률은 매우 우려스러울 수 있으며, 그림의 흰색 노이즈처럼 오류가 발생할 수 있습니다. 하지만 사이클 간의 정보 통합을 통해 각 로봇의 후속 신뢰도 오차가 크게 낮아지고, 순간적인 거짓 양성 수준보다 훨씬 우수합니다. 이를 통해 우리는 데이터의 고압축 비율이 가져오는 채널 처리 혜택을 누릴 수 있을 뿐만 아니라 고품질의 의사결정 능력도 유지할 수 있습니다. 따라서 블론 필터와 같은 메커니즘은 통신 대역폭의 비용과 데이터 정보의 정확도 사이에서 직접적인 균형을 맞출 수 있는 레버를 제공한다. 다중 기기 협력 탐색 작업에 이를 적용하면 전체 효율이 상당히 향상된다. 나는 이를 “데이터 정확도”와 “시간적 적절성” 사이의 정량적 균형으로 보는 편이다. 이는 시스템 데이터 스트림의 “전송 내용”과 “전송 타이밍”에 정확하게 대응한다. 하지만 위의 방안에는 여전히 하나의 숨겨진 전제가 있다. 즉, 시스템이 전체 데이터 패킷을 모두 받아들인 후에야만 디코딩하여 사용할 수 있다는 것이다. 이것이 바로 우리가 돌파하고자 하는 또 다른 장벽이다. 현재 로봇 통신 아키텍처에는 일종의 경직된 사고가 존재한다. 어떤 정보를 활용하려면 데이터 패킷을 완전히 받아서야만 해체하고 분석할 수 있다. 악조건의 약한 네트워크나 간헐적인 단절 환경이 발생하면, 데이터 패킷이 일부 분실되면 전체 전송이 완전히 무효가 된다. 검정과 흑색으로만 나뉘는 전송 문제에 빠지는 것보다, 데이터 해상도를 높여 시간을 얻을 수 있을까? 전체 데이터를 기다릴 필요 없이 또는 경량 데이터 패킷을 우선적으로 받아 즉시 디코딩함으로써 실시간 의사결정을 지원하는 스트림 전송 메커니즘을 도입할 수 있을까? 이렇게 하면 약한 신호 상태의 파란색 로봇이 반쪽만의 데이터 패킷만 받더라도, 그 정보 중 일부는 즉시 협업 계획에 활용될 수 있다. 만약 여러분도 저와 함께 90년대 인터넷을 경험했다면, 당시의 스트리밍 미디어 방식을 잘 기억하고 있을 것입니다. 우리는 바로 이 개념을 참고하여, 일상생활에서도 여전히 흔히 사용됩니다. 예를 들어 휴대폰으로 스트리밍 비디오를 볼 때, 고화질 비디오를 전부 로컬에 저장하지 않아도 원활하게 재생될 수 있습니다. 우리는 이러한 점진적 전송 개념을 로봇 시스템에도 적용하여, 정보가 아직 불완전한 상태에서도 빠르게 합리적인 결정을 내릴 수 있도록 합니다. 이러한 스트리밍 전송 개념과 점진적인 다중 세부 수준 표현을 활용하여, 우리는 정확성과 실시간성을 조화시키는 균형을 자유롭게 맞출 수 있습니다. 이를 통해 로봇은 큰 네트워크 의존성 없이도 선제적으로 결정을 내릴 수 있습니다. 기체 간의 지도 정렬 및 일관성 보여주는 성능은 단일한 전체 동기화 방식보다 훨씬 뛰어납니다. 더 큰 규모의 지도 생성 환경과 복잡한 시스템에서 이 방식의 확장성 장점이 더욱 두드러집니다. 여기에는 우리의 핵심 주장을 강력하게 뒷받침하는 정량적 실험 결과가 있습니다. 더 많은 데이터가 더 나은 결정을 직접적으로 의미하지는 않습니다. 그래프 하단부에서 파란색으로 표시된 스트리밍 전송 방식은 모든 기준 방법에 비해 총 통신량이 가장 적으며, 수신端에서 받는 데이터 양도 최소입니다. 하지만 그럼에도 불구하고 지구적 동기화 품질을 살펴보면, 채널이 완전히 손상되지 않고 대역폭에 제한이 없는 이상적인 상태에 근접할 수 있습니다. 따라서 우리는 합리적인 표현, 재구성 및 스트리밍 압축을 통해 데이터를 다듬을 수 있으며, 모든 원본 데이터를 막연히 네트워크에 투입하여 끝점에서 기적적으로 더 나은 결과가 나타나기를 바라는 것이 아닙니다.

03


로봇 전략 학습:

문제는 데이터의 부족이 아니라 과적합입니다

위에서 언급한 모든 준비는, 우리 분야가 현재 직면해야 하는 ‘방 안의 거대한 코끼리’를 제시하기 위한 것입니다. 바로 현재 로봇 전략 학습의 주류 패러다임입니다. 현재의 주류 연구 패러다임은 전 인류의 선천적 지식을 모두 압축하여 로봇 전략에 투입하려는 시도이며, 방대한 일반화 데이터를 통해 보편적인 전략을 만들어내고, 세밀한 조작, 자율 내비게이션, 다중 접촉점 역학적 상호작용 등 모든 복잡한 상황을 처리하려는 것입니다. 우리는 이 방향에서도 많은 어려움을 겪었습니다. 이전에 우리는 복잡한 풀터치 조립 작업에 맞는 전략 학습 방법을 찾고 있었습니다. 이 실험에서 우리는 전문가 원격 조작을 통해 시연 데이터를 수집하여, 엔지니어링 팔이 혼란스러운 쌓아 올린 환경에서 부품 삽입 작업을 수행하도록 훈련시켰습니다. 우리는 모델에 전방위적 센서 입력을 제공했습니다: RGB와 깊이 이미지를 포함한 이중 모드 시각 데이터, 종단 실행기의 6차원 토크 센서 판독값, 그리고 전체 본체 감각 상태도 포함됩니다. 우리는 수집된 모든 데이터를 모델에 전부 입력했지만, 전략이 배포되어 실행된 후의 성능은 매우 평범했습니다. 사람들이 볼 수 있듯이, 로봇 팔은 반복적인 기계적 동작을 수행합니다—무의식적으로 재료를 부딪히고, 장면을 혼란시키며, 물리적 접촉을 일으키고, 훈련 세트에 있는 경로를 기계적으로 모방합니다. 이런 형편없는 성능에 직면하여, 사람들이 가장 흔히 제안하는 “처방”은 바로 훈련 데이터를 늘리고, 더 많은 전문가 원격 조작 시범을 수집하는 것입니다. 하지만 빈 상자 환경에서의 이상한 동작을 자세히 살펴보면, 상자가 아무것도 없음에도 불구하고 로봇 팔이 같은 삽입 동작을 기계적으로 반복한다는 것을 알 수 있습니다. 이 예시는 문제가 데이터 부족에 있지 않고, 전략의 심각한 과적합에 있다는 것을 명확하게 보여줍니다. 모델은 시각 입력을 완전히 무시하고 힘 감각 피드백도 전혀 고려하지 않고, 단지 관절의 본체 감각 데이터만을 의존하여 기계적으로 지시 궤적을 "외우고" 반복합니다. 과적합은 물론 새로운 개념이 아닙니다. 머신러닝이 등장한 이래로 존재해온 것입니다. 이 문제가 존재한다는 것을 우리는 잘 알고 있습니다. 그래서 저는 강조하고 싶습니다. 전략 학습 과정에서 이런 한계를 명확히 인식해야 합니다. 중요한 것은 모델에 더 많은 데이터를 채우는 것이 아니라, 우리가 실제로 모델에 넣어야 할 데이터가 무엇인지 더 현명하게 고민하는 것입니다. 제가 이 문제를 생각하고 있는 것뿐만 아니라, 호주 연방 과학 및 산업 연구 기관의 동료들도 이 문제를 해결하기 위해 노력하고 있습니다. 여기에 있는 많은 동료들도 비슷한 어려움을 겪었을 것입니다. 예를 들어, 블록 쌓기 작업에서 로봇 팔은 녹색 블록을 노란색 블록 위에 정확하게 쌓아야 합니다. 균일하고 깨끗한 환경에서, 환경 특성이 훈련 데이터와 일치할 때 전략의 성능은 매우 안정적입니다. 하지만 배경이 바뀌거나 장면에 몇 가지 방해물이 추가되면 전략의 성능이 갑자기 떨어집니다. 이는 놀라운 일이 아닙니다. 이러한 작은 왜곡들은 항상 명시적으로 깨끗한 데이터로만 훈련된 전략의 “문제점”입니다. 우리는 그 전략이 "블록 쌓기"라는 일반화된 기술을 실제로 배웠다고 단정할 수 없습니다. 우리가 말할 수 있는 것은, 그 전략이 "특정 조명 조건과 특정 환경 설정 하에서의 블록 쌓기"만을 배웠다는 것뿐입니다. 어떻게 해야 할까요? 계속해서 방대한 데이터를 무작정 수집할까요? 아니면 다른 조명 설정으로 다양한 전문가 원격 교육을 지치지 않고 반복할까요? 혹은 더 근본적인 해결책이 있을까요? 이 연구의 첫 번째 저자인 조반니 조셉은 전략 모델 내부의 미세 변화를 탐구하기로 결정했습니다. 두 가지 입력 상황에서 전략의 출력 차이가 무엇인지, 행동 출력이 어떤 방향으로 편차가 발생하는지에 대해 심도 있게 비교했습니다. 명명된 상황과 미세 변동 상황에서의 전략 행동 분포의 편차량을 비교함으로써, 수치화 가능한 증거를 얻어 행동 출력의 분포 변화를 파악할 수 있었습니다. 우리는 많은 훈련 세트에서 이 테스트를 진행했으며, 데이터 편집 기술을 이용하여 다양한 조명 등의 변동 환경을 시뮬레이션함으로써 추론 단계에서 이러한 전략이 붕괴되는 동작 드리프트 공간 분포를 도출했습니다. 이 분포는 성능 드리프트가 어떻게 클러스터링되어 나타나는지 직관적으로 보여줍니다. 이에 따라 시각 표상의 변이에 대응하여, 우리는 특정 시나리오에서 어떤 전문가 원격 조작 가르침을 주입해야 하는지에 대해 목표 지향적으로 역추적할 수 있습니다. 그렇게 함으로써 해당 특성 공간에서 최대한의 지원을 제공하여, 최소한의 비용으로 전략을 바로잡아 올바른 의사결정 경로로 되돌릴 수 있습니다. 우리는 전체 분포 공간 내에서 이 작업을 체계적으로 진행합니다. 이로 인해 훈련 가르침을 수집하고 사용할 때 매우 전향적이고 목표 지향적인 접근이 가능해집니다. 실험에 따르면, 동일한 훈련 데이터 예산 하에서 이 방법이 가져오는 최종 전략 성능 향상폭은 무의식적 데이터 확장보다 훨씬 크다. 이는 단순히 데이터 규모를 추구하는 수단보다, 실제 한계를 결정하는 것은 수집된 데이터의 품질임을 명확하게 보여준다. 핵심은 전략 실패 패턴을 정확하게 “수정”하고 특징적 단점을 커버할 수 있는 중요한 샘플을 집중적으로 선택하는 것이다. 오늘의 공유가, 종합 기계 학습이 주도하는 로봇 전략의 새로운 시대로 나아가는 과정에서 여러분에게 새로운 관점을 제공하기를 바랍니다. 마지막으로 제 핵심 제안을 다시 한 번 강조하고 싶습니다. 보편적인 자율 시스템으로 나아가는 길에서, 우리는 데이터 수집과 데이터 활용에 과학적 원칙을 준수해야 합니다. 항상 기억하세요: 우리의 궁극적인 목표는 시스템에 데이터를 끊임없이 쌓아놓는 것이 아니라, 스마트 에이전트에게 가장 유용하고 중요한 핵심 정보을 제공하여 현실 세계의 문제를 더 뛰어나게 해결할 수 있도록 돕는 것입니다. 마지막으로, 이번 공유를 가능하게 한 모든 훌륭한 협력자들에게 감사를 표합니다. 모두에게 정말 고마우며, 질문이 있으시면 언제든지 알려주세요!

04


Q&A

▎Q: 표시된 환경에서의 기준 성능의 90%에 비해, 전략적 수정을 적용했음에도 불구하고 외부 충격이나 변동에 직면했을 때 여전히 성공률의 차이가 존재합니다.

A: 이것은 매우 깊이 있는 통찰입니다. 이는 우리가 동작의 이동이 공간에서 어떻게 분포하는지를 더 심도 있게 표현하고 분석해야 한다는 것을 보여줍니다. 현재 단계에서는 샘플링 지점의 낙하 시, 그 지점이 특징 공간에서 최대한의 유효한 지지력을 제공할 수 있는지 평가하여 전체적으로 공간 커버리지를 최대화하려고 합니다. 더 정확한 거리 측정 기준을 정할 수 있다면, 전략 수정에 필요한 구체적인 비용에 대해 더 정확한 선험적 추정을 할 수 있을 것입니다. 하지만 현재에도 이는 매우 도전적입니다. 그 이유는 고차원 임베드 공간이 본질적으로 측정 공간의 거친 근사값에 불과하기 때문입니다. 수학적으로는 각종 고전적인 측정 분석 도구가 임베드 공간에서 여전히 엄밀하게 유효할 것이라고 보장할 수 없습니다. 왜냐하면 이러한 표현 공간은 처음 구축될 때부터 엄밀한 진정한 측정 공간이 아니라, 단지 우리의 공학적 근사 방법에 불과하기 때문입니다.

▎Q: 방법론적 차원으로 넘어가면, 로봇 통신 문제를 고찰할 때의 핵심적인 기본 철학은 무엇인가요?

A: 통신의 기본적인 이해에 대해 요약하자면, 핵심은 이 한 가지만입니다: “이것이 상대방의 행동 결정에 변화를 가져올까?” 만약 제가 당신에게 정보를 전달하는데, 그 정보가 당신의 다음 행동에 아무런 영향을 미치지 못한다면—다시 말해, 당신에게 알리지 않아도 당신은 똑같은 행동을 할 것이라는 뜻입니다—그렇다면 저가 사용한 대역폭으로 이 데이터를 공유하는 의미는 무엇일까요? 이것이 바로 제 핵심 원칙입니다.

▎Q:시작 부분에서 언급된 블로온 필터의 한계에 대해 질문하고 싶습니다. 특히 탈중앙화 다로봇 협력 탐색에서 상태를 통합하기 위해 보통 확률론적 방법을 사용합니다. 하지만 데이터의 “이중 활용/순환 계산”이라는 고질적인 문제가 있습니다. 현재 정보가 누구에 의해 생성되었는지, 각 파트너 노드 간에 어떻게 여러 번 전달되었는지를 추적할 수 없습니다. 이러한 높은 압축된 손실된 표현에서 “이 데이터는 누가 생성했는가”와 “이 데이터가 어떤 노드에 통합되었는가”와 같은 추적 메타데이터를 어떻게 인코딩할 수 있을까요?

A: 블롱 필터러를 이용해 정보를 동기화할 때, 입력 소스를 엄격하게 구분합니다. 즉, “동일한 로봇에서 나온 연속 관측 시퀀스”와 “다른 로봇에서 온 교차 정보”를 구분하는 것입니다. “단일 로봇이 특정 격자에 관찰했는지”에 대한 문제에 직면할 때, 본질적으로는 베이즈 신뢰도의 누적을 수행합니다. 해당 로봇에게 지속적으로 질문을 던질수록, 그 격자가 여러 번의 해시 작업에서 항상 존재하는 것으로 나타날 경우, 통계적 독립성에 따라 그 로봇이 실제로 관찰했음에 대한 신뢰도는 점점 증가합니다. 하지만 여러 개의 다른 로봇이 동시에 그 격자에 대한 관찰을 했다고 주장한다면, 문제의 수학적 형태는 “적어도 한 대의 로봇이 실제로 관찰한 부분의 합집합 확률”을 계산하는 것으로 변한다. 따라서 확률을 바탕으로 추론하는 관점에서 처리 방식은 완전히 다르다. 그리고 데이터 자체에 비균일성이 존재할 때——예를 들어 “어떤 로봇이 더 신뢰할 만한가? 어떤 로봇의 센서 정확도가 더 우수한가? 또는 그 로봇이 처한 위치 환경이 더 높은 신호-잡음 비율과 진실성을 가지고 있는가?”와 같은 경우—는 상황이 다르다. ”——문제의 복잡성은 급격히 증가합니다. 로봇의 신뢰도 가중치와 원산지 태그를 간결한 압축 파일에 우아하게 삽입하는 방법은 정말 어려운 과제이며 깊이 있게 연구해야 할 주제입니다. 다시 한번 모든 분께 감사드립니다!

모두가 함께 소통하고 회의 소식을 공유하기 쉽게 하기 위해, 우리는 IROS2026 참가 소통 그룹을 특별히 만들었습니다! 그룹에 가입하면 다음과 같은 «혜택»을 받을 수 있습니다?

  • 회의 정보 센터: 제출된 DDL, 형식 규정, 검토 진행 상황 등을 즉시 전달합니다. 마감일을 놓치는 일이 없도록 제출 준비를 철저하게 진행할 수 있습니다.

  • 동료 tea meeting: 천남해북의 동료들이 모두 그룹에 모여, 경험을 나누고 아이디어를 교류하며 인맥을 쌓습니다. 과학 연구의 길에서 우리는 동료입니다.

  • 첨단 보급소: 최신 연구 성과와 주요 동향을 실시간으로 공유합니다. 회의 주제와 결합하여 논문 투고 흐름을 명확히 하며, 논문에 영감을 불어넣어줍니다.

  • 현장 후원단:(회의 중에만 열리기):회장에 도착해도 당황하지 마세요—

    노선 내비게이션: 경기장 위치, 강연실이 어디인지, 그룹에 문의해 주세요;

    주제 공동 읽기: 인기 있는 세션, Keynote 논의는 놓칠 수 있지만 따라갈 수 있음;

    포스터 컴파일: 현장 포스터의 핵심 내용을 정리하여, 한 번 클릭으로 모두 저장할 수 있음;

    약국 광장: 식사 모임, 인터뷰 회의, 교류 모임… 이야기하고 싶거나 협력하고 싶거나 직접 만나고 싶을 때, 그룹에서 제안하면 됩니다.

? 그룹 입장 링크: 스캔을 통해 그룹에 가입하거나 웨이신 Luyoyo_2026을 추가하세요. 메모에는 IROS + 부서/학교+이름+분야를 적어주세요.

과학 연구/기술 분야에서는 정보의 차이가 매우 중요합니다.

와서, 함께 한 발 앞서 가요!

차에 올라타세요, 당신을 위해 전 세계 AI 컨퍼런스의 핵심 정보를 보여드리겠습니다

독점적으로 볼 수 있는:

전문가 강연 PPT

대회 보고서 전문

인기 논문 해설

학술 신인 인터뷰

위의 QR 코드를 스캔하세요

또는 “원문 읽기”를 클릭하여 레이펑넷(공식 계정: 레이펑넷) 전문 페이지를 방문하세요.

레이펑넷 오리지널 기사이며, 허가 없이는 재게시를 금합니다. 자세한 내용은 재게시 안내를 참조하십시오.

원문 출처

雷峰网 AI

내용 안내

원문 발행 및 권리는 출처에 있습니다.

기계 번역 · 원문을 참고하세요