雷峰网 AI

Feng Zongbao, de Zhi Jian Dong Li: En escenarios reales donde el espacio entre componentes es solo de 0.5 milímetros, se logra que el robot…

La inteligencia con cuerpo pasa del laboratorio a las fábricas reales, hacia la fabricación de alta precisión. Autor: Deng Zhemin, Editor: Qi Chenyong. ¿Se ha preguntado alguna vez si los robots también podrían entrar en…

La inteligencia cuerpo se traslada desde el laboratorio hacia fábricas reales y hacia la fabricación de alta precisión.

Autor | Deng Zhemin

Edición | Qi Chengyǒu

                                                                                                       

¿Se ha preguntado alguna vez si los robots también podrían entrar en las plantas de producción y fabricar manualmente las piezas necesarias para montar un robot? Esto suena como una broma, pero en realidad es la propuesta más compleja de inteligencia con cuerpo en la práctica. Los articulaciones, los mandriles y las piezas estructurales precisas de los robots son todos producidos a través de procesos en torno a torneros CNC (Control Numérico por Computadora) y fresadoras. Si los robots pudieran cuidar estas máquinas de forma autónoma, realizando el recogimiento, carga, inserción, extracción y colocación de piezas, entonces la industria de robots sería alimentada por los propios robots: cuantos más robots haya, mayor será su capacidad para fabricarlos y menor el costo, creando un bucle de retroalimentación positiva. Pero lograr esto es mucho más difícil de lo que se imagina. Las piezas necesarias para fabricar robots son precisamente las que requieren mayor precisión: la separación entre la pieza y el mandril suele ser solo de 0,5 milímetros; las superficies metálicas reflectantes, las formas casi sin textura y las piezas altamente similares representan desafíos para la visión, el tacto y la precisión en todo el proceso de los robots. Incluso las demostraciones más hermosas en el laboratorio deben superar primero estas tres barreras: tolerancias, ciclos de producción y tasa de aceptación. El 29 de septiembre de 2026, en Pittsburgh, Estados Unidos, durante la conferencia IROS 2026, una charla técnica respondió directamente a esta pregunta: cómo hacer que un robot cuide autónomamente de dos torneros CNC, realizar todas las operaciones mencionadas con una separación de 0,5 milímetros y entrenarlos con solo 600 trayectorias reales de robots. El orador fue Feng Zongbao, responsable del aprendizaje reforzado de simplicidad en tecnología. Esto no es solo una demostración técnica, sino también una respuesta sobre cómo la precisión en el laboratorio se convierte en precisión en la fábrica. Aquí está el texto seleccionado de la charla de Feng Zongbao en IROS 2026, organizado a partir de la presentación en inglés en el lugar, y Reifeng Network (código público: Reifeng Network) ha reorganizado la expresión oral y los términos técnicos sin cambiar el significado original.

▎De el laboratorio a la fábrica: Por qué la manipulación de tornos CNC en el mundo real rompe las líneas de aprendizaje de robots actuales

Orador principal: Feng Zongbao, responsable del aprendizaje refuerzado en Simplexity Robotics

01

Crear robots con robots

Esta presentación comienza con un objetivo de fabricación: fabricar robots con robots. La operación CNC puede parecer sencilla, pero lograr que sea estable y confiable en una fábrica real es una cuestión completamente diferente. Esto revela la clara brecha entre el éxito de las pruebas de referencia de laboratorio y la precisión a nivel de fábrica. Hoy, mostraré cómo nos esforzamos por cerrar esa brecha. SimpleClaw Power es una empresa de inteligencia autónoma full-stack. Nuestro modelo multimodal desarrollado por nosotros mismos unifica la comprensión y la generación; un ciclo de datos cerrado que nos permite mejorar continuamente estos modelos; una plataforma de hardware modular unificada que los hace funcionar en robots reales; la plataforma SimpleClaw proporciona a los desarrolladores una plataforma abierta para construir y desplegar aplicaciones de robots. En el lado del hardware, tenemos cuatro líneas de productos. i7 Pro es nuestro robot sobre ruedas, iX es nuestro robot humanoide sobre ruedas. También ofrecemos dos configuraciones de brazos mecánicos de control de fuerza modulares, donde se muestran las variantes con la mano ágil Dexter y las pinzas. Por último, nuestros guantes de recolección de datos nos ayudan a recopilar en escala humana las demostraciones, proporcionando datos para el aprendizaje de los robots. Así que nuestro método conecta tres partes: nuestro desarrollo full-stack propio, desde hardware, software hasta modelos; los guantes de recolección de datos hacen posible la recolección en escala humana de las demostraciones; el modelo multimodal unifica la comprensión y la generación. El objetivo es aprender más de estos datos y elevar el umbral de capacidad de los robots en la operación CNC precisa. Esta presentación se centra en tres métodos complementarios: SimpleWAM genera segmentos de acción a partir de observaciones multimodales; DRAM, que es la memoria asociativa de ciclos de reglas Delta, procesa el contexto de longitud temporal larga con una matriz de memoria de tamaño fijo; DPE califica acciones candidatas con un evaluador entrenado por separado, manteniendo la congelación de la estrategia. Juntos, resuelven los problemas de generación de acción, memoria y selección de acción en nuestro sistema CNC.

02

Los verdaderos desafíos de la fábrica

Estas son las dificultades de fábrica con las que nos enfrentamos. Nuestro objetivo es que los robots fabriquen otros robots, y la operación CNC de alta precisión es un ejemplo de ello. ¿Por qué es difícil? Primero, la separación entre el pie de trabajo y el mandril es solo de 0.5 milímetros, sin espacio suficiente para errores de alineación. Segundo, las superficies reflectantes, los texturas débiles y las piezas con formas similares dificultan la alineación visual. Tercero, el robot debe realizar una serie de acciones en un espacio de trabajo limitado, y las interfaces de contacto clave no siempre son visibles. Por lo tanto, el sistema debe mantener precisión durante todo el proceso, incluso cuando la información visual es incompleta. Estas restricciones CNC han moldeado nuestra arquitectura: la textura débil requiere un codificador visual suficientemente potente; la proximidad a larga distancia necesita múltiples perspectivas proporcionadas por las cámaras de cabeza y brazo; el contacto preciso requiere condiciones de percepción cercana. Así, la información visual, lingüística y de estado se convierte en tokens. SimpleWAM proporciona un esqueleto multimodal y Action DiT. Insertamos un módulo DRAM entre ambos para complementar el contexto histórico más allá de la observación actual. Action DiT propone segmentos de acción candidatos, y DPE califica estos candidatos con un evaluador entrenado por separado, manteniendo fijo el generador de acciones entrenado. Los segmentos de acción seleccionados se envían posteriormente a i7 Pro.

03

Planes de acción específicos

SimpleWAM es nuestro modelo unificado de acciones en el mundo. Su enfoque es:Durante el entrenamiento, aprende de la rica supervisión futura; durante la inferencia, predice directamente el movimientoEn la fase de entrenamiento, los video DiT, 3D DiT y acción DiT, bajo las instrucciones del trabajo, reconstruyen conjuntamente los fotogramas futuros, el estado 3D y los segmentos de acción, permitiendo que el modelo aprenda simultáneamente la dinámica visual, espacial y de acción. En la fase de razonamiento, solo se introducen la imagen actual, el estado 3D actual y las instrucciones lingüísticas, y el modelo produce directamente los segmentos de acción, sin necesidad de generar imágenes o estados 3D futuros. Antes de empezar a trabajar, extraemos individualmente las características y luego fusionamoslas de manera adaptativa. Un codificador de congelación compartido que conserva los tokens de imágenes densas provenientes de las cámaras de la cabeza y el brazo; posteriormente, la consulta se lee independientemente para cada perspectiva, de modo que ninguna perspectiva oprime a otra antes de la fusión; el gating se aplica a cada consulta y a cada canal de características para equilibrar el contexto global y las pistas de alineación local. Finalmente, la historia visual fusionada junto con un comportamiento DiT robusto y condicionado por el estado, permite predecir los segmentos de comportamiento. El diagrama de atención en el lado derecho muestra un efecto más fuerte de enfoque en los límites. En los experimentos declarados de cada método, el método de fusión tuvo éxito en 15 ocasiones, en comparación con 0 ocasiones para Query-concay y 8 ocasiones para la base de π0.5 SFT. Para actuar de manera estable y continua durante una tarea larga, el robot necesita el contexto de los pasos anteriores. Para ello, hemos introducido DRAM: la Memoria Asociativa Recurrente de Regla Delta (Delta-Rule Recurrent Associative Memory), y hemos añadido esta capacidad a la estrategia del robot preentrenado. Aquí, el eje de SimpleWAM congelado extrae características de las observaciones actuales; la DRAM utiliza primero estas características para leer la historia relevante en la memoria; la acción DiT combina la historia leída con el contexto actual para generar fragmentos de acción; posteriormente, la memoria se actualiza mediante las reglas Delta gestionadas por el control, para ser utilizada en el siguiente paso. La memoria es una matriz asociativa de tamaño fijo, por lo que su uso se mantiene constante a medida que la tarea se alarga. DRAM puede añadirse sin modificar la arquitectura central ni volver a entrenarla, lo que facilita la integración de la memoria de larga duración en las estrategias existentes. Durante el proceso de inserción precisa, la visión por sí sola no puede determinar el estado en el que el elemento se encuentra en contacto con el juego. La fuerza y el momento son precisamente lo que complementan esas informaciones de contacto ausentes. Los usamos en dos aspectos: en primer lugar, el acercamiento a las condiciones de percepción ajusta los datos de entrada del robot, permitiendo que el algoritmo DiT tenga en cuenta los factores de contacto al generar la siguiente acción; en segundo lugar, el controlador de impedancia en tiempo real utiliza la retroalimentación en tiempo real para hacer la ejecución más estable y ajusta el movimiento según los cambios en el contacto. La combinación de ambos permite apoyar la recuperación cuando se inserta directamente en un obstáculo. En las tareas de inserción de CNC de precisión, este método combinado logró una tasa de éxito del 100% en las tareas. La práctica común es usar la retroalimentación del evaluador para actualizar el actor, pero esto puede causar un desplazamiento en la estrategia. El DPE primero entrena un actor de clon de comportamiento, y luego utiliza un evaluador entrenado por separado para puntuar las acciones candidatas durante la implementación; los rollouts exitosos y fallidos posteriormente solo actualizan el evaluador, formando así un ciclo cerrado, mientras que el actor se mantiene siempre congelado en el robot. El DPE aumenta la tasa de éxito del trabajo y reduce el número de pasos de ejecución.

04

Presentación de resultados

Finalmente, logramos implementar un plan de operación completo para una máquina herramental única, totalmente automática y con doble máquina torno CNC. El video de demostración principal presenta el proceso completo de trabajo autónomo del robot a cinco veces la velocidad, y mediante varios segmentos separados, se muestran tres procesos independientes clave: la captura autónoma del pieza, el enganche preciso del material y la extracción y colocación correcta de la pieza después del proceso de mecanizado. Cabe mencionar que durante todo el proceso de entrenamiento del modelo, utilizamos 600 trayectorias de movimiento real del robot como datos de entrenamiento. Este es también el valor central de nuestro trabajo: llevar la inteligencia con cuerpo desde los tests de referencia en el laboratorio, a una aplicación real en escenarios de fabricación industrial de alta precisión y alto grado de realismo.

Para que todos puedan comunicarse entre sí y compartir información sobre las reuniones, hemos creado específicamente un IROS. 2026 Grupo de comunicación para la participación¡Entrar en el grupo te permitirá desbloquear estas «beneficios»?

  • Estación de información de reuniones: envíos de DDL, normas de formato, progreso de revisión… Los puntos clave se notifican en el momento adecuado, para que no se pierda el plazo estipulado. La preparación de los envíos está completamente organizada.

  • Reunión de té entre colegas: todos los colegas de todo el mundo están en el grupo. Hablamos de experiencias, discutimos ideas y construimos contactos. Estamos juntos en el camino del investigación científica.

  • Estación de suministro de vanguardia: los últimos resultados de investigación y las tendencias en tiempo real se sincronizan al instante. Se combina con el tema de la conferencia para ayudarte a organizar tus contribuciones, y proporciona inspiración para tu artículo.

  • Equipo de apoyo en el lugar:(activado solo durante la reunión):No hay necesidad de preocuparse al llegar al lugar——

    Navegación de rutas: distribución de los recintos, cómo llegar al salón de informes, pregunte en el grupo en cualquier momento;

    Leitura colectiva de temas: Sesiones populares y discusiones de Keynote, que puedes seguir aunque se te hayan pasado.

    Compilación de pósters: Recopilación de los mejores pósters en vivo, guardar con un clic sin omitir nada;

    Plaza Yueju: Salas de comida, oficinas de entrevistas, agencias de comunicación… Si quieres charlar, colaborar o conocer a alguien en persona, basta con iniciar una reunión en el grupo.

? Puerta de entrada al grupo: Escanee el código para unirse al grupo o agrega a WeChat Luyoyo_2026, y escribe en la nota: ECCV + institución/universidad + nombre + área de estudio.

En la investigación científica/tecnología, la diferencia de información es muy importante.

Vamos, adelante un paso más!

Sube al coche, te mostraré los aspectos más destacados de las conferencias más importantes de IA del mundo

Acceso exclusivo:

PPT para conferencia de experto

Informe completo de la conferencia

Análisis de artículos de investigación populares

Entrevista con la estrella académica emergente

Escanee el código QR de arriba

O haz clic en «Leer el texto original» para seguir la sección especial.

Artículo original de Leifengwang, no se permite la reproducción sin autorización. Para más detalles, consulte las instrucciones para la reproducción.

Fuente original

雷峰网 AI

Notas sobre el contenido

La publicación original y los derechos pertenecen a la fuente.

Traducción automática · Consulte el original