雷峰网 AI原文 · 中文

至简动力冯宗宝:在间隙仅 0.5 毫米的真实场景下,实现机器人造机器人 | IROS 2026

至简动力在IROS 2026介绍仅用600条真实机器人轨迹训练机器人,在0.5毫米间隙下自主值守双CNC机床,宣称精密插入成功率100%。该结果为演讲方自述,尚需独立验证。

具身智能从实验室走向真实工厂、迈向精密制造。

    作者丨邓哲敏

    编辑丨齐铖湧

                                                                                                       

你有没有想过,机器人也可以走进车间,亲手造出组装一台机器人所需要的零件?这听起来像个玩笑,实际却是具身智能最硬核的落地命题。机器人的关节、卡盘、精密结构件,无一不是靠 CNC(计算机数控)车床、铣床一道道加工出来的。如果机器人能自主照看这些机床,完成工件的抓取、上料、插入、取出与放置,那么机器人工业将被机器人自己反哺——机器人越多,造机器人的能力越强、成本越低,形成正反馈闭环。但要实现这一点,比想象中难得多。造机器人所需的零件,恰恰是对精度要求最苛刻的一批:工件与卡盘之间的间隙往往只有 0.5 毫米,反光的金属表面、几近无纹理的外形、高度相似的零件,都在挑战机器人的视觉、触觉与全程精度。实验室里再漂亮的演示,到了这里都得先过公差、节拍、良率这三道关。2026 年 9 月 29 日,美国匹兹堡,机器人学顶级会议 IROS 2026 现场,一场 Tech Talk 正面回应了这一命题:如何让一台机器人自主照看两台 CNC 机床,在 0.5 毫米的间隙下完成上述全部操作,且仅用 600 条真实机器人轨迹完成训练。演讲者是至简动力强化学习负责人冯宗宝。这不只是一次技术演示,更是一份关于实验室精度如何转化为工厂精度的参考答案。以下是冯宗宝在 IROS 2026 现场演讲的精编稿,基于现场英文演讲整理,雷峰网(公众号:雷峰网)在不改变原意的基础上,对口语表达和技术术语进行了重新梳理。

▎From Laboratory to Factory: Why Real-World CNC Lathe Manipulation Breaks Current Robot Learning Pipelines

主讲人:冯宗宝,至简动力(Simplexity Robotics)强化学习负责人

01

用机器人造机器人

本次分享从一个制造目标说起——用机器人来制造机器人。CNC 操作看起来可能很简单,但要让它在真实工厂里稳定可靠,是完全不同的问题。它揭示了实验室基准测试的成功与工厂级精度之间那道清晰的鸿沟。今天,我将展示我们如何努力去弥合这道鸿沟。至简动力是一家全栈具身智能公司。我们自研的多模态模型,把理解和生成统一在一起;一套闭环的数据飞轮,让我们能够持续改进这些模型;统一的模块化硬件平台,让它们运行在真实的机器人上;SimpleClaw 平台则给开发者提供了一个构建与部署机器人应用的开放平台。在硬件侧,我们有四条产品线。i7 Pro 是我们的轮式机器人,iX 是我们的轮式人形机器人。我们还提供两种配置的模块化力控机械臂,这里分别展示了搭配 Dexter 灵巧手和夹爪的形态。最后,我们的数据采集手套帮助我们规模化采集人类演示,为机器人学习提供数据。所以,我们的方法连接起三个部分:我们全栈自研,从硬件、软件到模型;数据采集手套让规模化采集人类演示成为可能;多模态模型把理解与生成统一在一起。目标是从这些数据中学到更多,抬高机器人在精密 CNC 操作上的能力天花板。本次分享聚焦三个互补的方法:SimpleWAM 从多模态观测中生成动作片段;DRAM,即 Delta 规则循环关联记忆,用固定大小的记忆矩阵处理长时序上下文;DPE 用一个单独训练的评估器对候选动作打分,同时保持策略冻结。三者合起来,分别解决了我们 CNC 系统中的动作生成、记忆与动作选择问题。

02

真实工厂难题

这是我们面对的工厂难题。我们的目标是机器人造机器人,精密 CNC 操作正是其中的代表。它为什么难?第一,工件与卡盘之间的间隙只有 0.5 毫米,几乎没有留给对位误差的空间。第二,反光的表面、微弱的纹理、外形相似的零件,让视觉对位变得困难。第三,机器人必须在受限的工作空间里完成一连串动作,而关键的接触界面并不总是可见的。因此,系统必须在整个任务过程中始终保持精度,即便视觉信息不完整。这些 CNC 约束塑造了我们的架构:弱纹理要求一个足够强的视觉编码器;长程接近需要头部与腕部相机提供的多视角;精密接触则需要接近感知的条件化。于是,视觉、语言和状态输入被转换为 token。SimpleWAM 提供多模态骨干和动作 DiT。我们在两者之间插入一个 DRAM 模块,在当前观测之外补充历史上下文。动作 DiT 提出候选动作片段,DPE 用一个单独训练的评估器对这些候选打分,同时保持训练好的动作提出器固定不变。被选中的动作片段随后下发给 i7 Pro。

03

具体应对方案

SimpleWAM 是我们统一的世界动作模型。它的思路是:训练时从丰富的未来监督中学习,推理时直接预测动作。训练阶段,视频 DiT、3D DiT 和动作 DiT 在任务指令的引导下,联合重建未来的视频帧、3D 状态与动作片段,让模型能够同时学习视觉、空间与动作的动力学。到了推理阶段,我们只输入当前图像、当前 3D 状态和语言指令,模型直接输出动作片段,而不必再生成未来的图像或 3D 状态。在动手之前,我们分别提取特征,再对它们做自适应融合。一个共享的冻结编码器,保留来自头部与腕部相机的密集图像 token;随后,查询分别独立地读取每个视角,这样在融合之前,任何一个视角都不会压制另一个;门控再针对每个查询和每个特征通道,去平衡全局上下文与局部对位线索。最终,融合视觉历史与鲁棒的、状态条件化的动作 DiT,来预测动作片段。右侧的注意力图展示了更强的边界聚焦效果。在各方法的标称试验中,融合方法成功了 15 次,相比之下,Query-concay 为 0 次,π0.5 SFT 基线为 8 次。要在一段长任务中持续稳定地动作,机器人需要来自此前步骤的上下文。为此,我们引入 DRAM——Delta 规则循环关联记忆(Delta-Rule Recurrent Associative Memory),把这种能力附加到预训练机器人策略上。这里,冻结的 SimpleWAM 骨干从当前观测中提取特征;DRAM 先用这些特征读取记忆中的相关历史;动作 DiT 把读取到的历史与当前上下文结合起来,生成动作片段;在这之后,通过门控的 Delta 规则更新记忆,供下一步使用。记忆是一个固定大小的关联矩阵,因此它的占用在任务变长时保持一致。DRAM 可以在不修改骨干架构、也不重新训练骨干的前提下附加进来,让长时序记忆更容易接入现有策略。在精密插入的过程中,仅靠视觉可能无法判断工件正以怎样的状态接触卡盘。力与力矩恰好能补上这些缺失的接触信息。我们从两个方面使用它们:其一,接近感知条件化会调整机器人的状态输入,让动作 DiT 在生成下一个动作时把接触因素考虑进去;其二,实时阻抗控制器利用实时反馈让执行更稳健,并根据接触的变化调整运动。二者结合,能够在直接插入受阻时支持恢复。在精密 CNC 插入任务上,这套组合方法取得了 100% 的任务成功率。常见的做法是用评估器的反馈去更新动作器,但这可能导致策略漂移。DPE 先训练一个行为克隆的动作器,再用一个单独训练的评估器在部署时对候选动作打分;成功的和失败的 rollout 随后只更新评估器,闭环由此形成,而动作器在机器人上始终保持冻结。DPE 提升了任务成功率,并减少了执行步数。

04

成果展示

我们最终实现了机器人单设备全自动值守双 CNC 机床的完整作业方案。本次主演示视频以五倍速呈现了机器人的全流程自主作业过程,同时通过多个细分片段,分别展示三项核心独立工序:工件自主抓取、精准上料卡盘、加工完成后的取件与归位放置。抓取工件把工件插入卡盘取出并放置工件值得一提的是,整个模型训练过程,我们仅使用了 600 条真实机器人运动轨迹作为训练数据。这也是我们本次工作的核心价值:将具身智能从实验室的基准测试效果,真正落地到高精度、高真实度的工业制造场景中。

为了方便大家抱团交流、互通会议消息,我们专门建了 IROS 2026 参会交流群!进群你会解锁这些「福利」?

  • 会议情报站:投稿 DDL、格式规范、评审进度……关键节点第一时间送达,再也不怕错过 deadline,投稿准备稳稳的。

  • 同行茶话会:天南海北的同行都在群里,聊心得、碰思路、攒人脉,科研路上我们同行。

  • 前沿补给站:最新研究成果、热点方向实时同步,结合会议主题帮你捋清投稿脉络,给论文灵感加满油。

  • 现场后援团:(会议期间专属开启):到了会场也不用慌——

    路线导航:场馆分布、报告厅怎么走,群里随时问;

    议题共读:热门 session、Keynote 探讨,错过也能追;

    Poster 汇编:现场海报精华整理,一键收藏不遗漏;

    约局广场:约饭局、采访局、交流局……想唠嗑、想合作、想面基,群里发起就成。

? 进群传送门: 扫码进群或添加微信Luyoyo_2026,备注:ECCV + 单位/学校+姓名+方向。

搞科研/搞技术,信息差很重要。

来,一起快人一步!

上车,带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲PPT

大会报告全文

热门论文解读

学术新星访谈

扫描上方二维码

或点击「阅读原文」关注专区。

雷峰网原创文章,未经授权禁止转载。详情见转载须知。

原始出处

雷峰网 AI

内容说明

原始发布及相关权利归来源方。