量子位

0.2 segundos frenada brusca, planificación nueva en segundos. Causa y Inteligencia entra en el mundo real

Es un robot que se detuvo de forma urgente mientras cerraba la puerta del microondas, debido a que alguien entró de repente.

Fuente de la imagen · 量子位

Jay desde el origen no es un templo

Quantum Bit | Account público QbitAI

0.2 segundos.

Es el tiempo en que un robot se detiene de forma inesperada mientras cierra la puerta del microondas, debido a la entrada de alguien por casualidad.

También hay cosas más interesantes.

Cuando una lata metálica se mezcla con un plato de pastel y se lleva al microondas, el brazo mecánico primero saca la lata y la coloca a un lado, para asegurarse de que el plato esté seguro, y luego la introduce en el horno.

Para ser honesto, cuando vi estos segmentos de demostración, me quedé un poco atónito.

Quienes se dedican al estudio a largo plazo de los robots de cuerpo deben haber notado que, en muchos casos, los robots parecen bastante impresionantes, pero la mayoría del tiempo están fallando en sus funciones. Una vez que cambia la luz, se da un empujón o las instrucciones tienen algún tipo de intención oculta, el robot se queda atascado de inmediato.

Pero incluso si, como en el video, apuntas locamente con la linterna a los ojos del robot, él sigue ignorándolo...

Sin embargo, esas imágenes de hace un momento no son una repetición de acciones grabadas con anticipación, ni tampoco es una correlación estadística que se adivina por casualidad.

Frente a los continuos perturbaciones repentinas, el sistema infiere en tiempo real esta serie de acciones basándose en la comprensión de las leyes causales del mundo físico.

El sistema que impulsa este robot tiene el nombre en clave CRIS-0.

Detrás de él está la empresa de inteligencia causal fundada por Huang Biwei, profesora asistente en la Universidad de California en San Diego (UCSD) y estudiosa del grupo de causalidad en CMU.

Aether AI.

Hace tres meses, QuantumWI informó sobre la estrategia de inteligencia causal que esta empresa había elegido. En ese momento, muchas personas pensaban que la IA causal todavía se encontraba en las fórmulas matemáticas y los experimentos mentales.

Hoy, Aether AI ha lanzado la demostración oficial.

Despedirse de la “torpe” mecánica: los robots aprenden a entender las causas y efectos

En los escenarios de implementación de robots con cuerpo, lo que más molesta a los ingenieros no es el proceso estándar, sino los imprevistos que están por todas partes.

Los robots tradicionales, frente a perturbaciones inesperadas, o repeten mecánicamente las coordenadas antiguas, lo que resulta en colisiones, o simplemente producen un error y se bloquean por completo; mientras que los modelos de caja negra de punto a punto, en tareas de varios decenas de pasos, son especialmente propensos a generar errores acumulados, y un pequeño error en un paso puede causar el colapso total.

La solución para romper la situación dada por CRIS-0 es «causa y efecto»—

Haz que el robot pase de “ver qué ocurre” a “comprender por qué sucede y qué cambios afectan los resultados”.

Mira primero el informe de calificaciones.

En el test de preparación de café que enfrenta interferencias externas imprevistas, el robot se encuentra con desplazamientos humanos y cambios bruscos en la luz al agarrar la cafetera. CRIS-0 reconoce los cambios en las variables causales en aproximadamente 2 segundos en promedio y realiza una replanificación en tiempo real, logrando 9 recuperaciones efectivas en 10 perturbaciones aleatorias.

Y no se trata de empezar todo desde cero de forma ciega.

La cafetera fue empujada hacia afuera, y el sistema rastrea la variable causal clave “posición relativa del mango”. Cuando se detecta un desplazamiento en el estado de la variable, solo corrige las fases de acción de acercamiento y agarre, sin necesidad de reiniciar desde el punto original.

La resistencia a la interferencia es solo una habilidad básica; en las tareas autónomas de larga distancia, la ventaja del impulso causal se manifiesta de manera más completa.

En la tarea continua de “buscar y ordenar en el salón”, que consta de decenas de pasos, el sistema descompone el objetivo a largo plazo en etapas causales atomizadas y verificables. Cada paso adelantado realiza una verificación de condiciones previas y posteriores.

Lo más interesante es la capacidad de razonamiento lógico y percepción física que muestra CRIS-0:

Al limpiar la mesa de escritorio, organiza los libros comunes esparcidos en el suelo en el aparador, pero guarda las facturas relacionadas con la privacidad personal en el cajón.

Frente a dos latas de bebida que se parecen en apariencia, primero utiliza el agarre y el movimiento para percibir el peso del recipiente y el estado del líquido interior. Solo después de confirmar que es una lata vacía, la tira en la basura. En cuanto percibe que no se ha bebido todo el contenido, vuelve firmemente al lugar original.

Finalmente, al enfrentar necesidades ambiguas, la causalidad también puede mejorar significativamente la generalización del prompt, lo que permite una capacidad de comprensión personalizada.

En el test Personal Pick and Place, frente a 20 instrucciones ambiguas que requieren razonamiento implícito, como “Trae una botella de bebida adecuada para correr por la mañana”, el sistema logró 18 capturas precisas y colocaciones.

No se basa en recordar palabras clave para arriesgarse, sino que combina el tiempo, el estado del usuario y el contexto ambiental, extrae la condición de “necesidad de reponer energía después del ejercicio y evitar alimentos altos en azúcar” como variables causales ocultas y ajusta automáticamente las operaciones correspondientes.

¿Qué tipo de arquitectura técnica se esconde detrás de estos demos?

Descomponer CRIS-0: transformar la caja negra en una motor causal

Antes de responder a esta pregunta, quizás primero debamos aclarar otro problema.

¿Por qué los robots anteriores siempre parecían “tontos”?

El mundo físico y el mundo puramente digital son completamente diferentes. En la computadora se escribe código o se chatea, y si se comete un error se puede retirar lo hecho, pero en el mundo real, la fricción, la gravedad, los choques y los cambios en la luz ocurren constantemente cada segundo.

Los modelos tradicionales de punto a punto, como el esquema VLA, aunque aprenden rápidamente, tienen una debilidad fatal al enfrentarse a tareas con procesos largos, que es la acumulación de errores.

El paso 1 tiene una pequeña desviación, el paso 2 tiene una desviación mayor, y en el paso 10, todo el proceso podría haberse deformado completamente. Lo peor es que, cuando un modelo de caja negra única se encuentra con interferencias, no sabe qué está sucediendo, y a menudo solo puede seguir presionando según el plan original, o bien colapsar y detenerse.

Y otro tipo común de solución de Agente, aunque descompone los pasos, su lógica de pensamiento se mantiene básicamente en la inferencia de probabilidad de texto puro o de modelos grandes multimodales.

Cada vez que cambia el entorno, primero tiene que convertir la imagen en texto. Mientras el modelo se toma su tiempo para pensar “¿qué debería hacer después?”, es posible que tus manos ya estén atrapadas en la puerta después de que hayas terminado de razonar...

¿Qué es lo que realmente se logra detrás de la capacidad de resistencia a las interferencias y la coherencia que muestra CRIS-0?

Aether AI ha diseñado un nuevo sistema lógico:

Arquitectura de agente de origen causal.

Se puede entender desde tres dimensiones—

1. La tarea es el estado: extraer las variables causales físicas

Esto es lo que considero como el principio primario más importante.

En el sistema CRIS-0, hay un cambio muy básico llamado estado unificado y variables causales.

El robot anterior miraba el mundo a través de los píxeles densos de imágenes. Pero en los ojos de CRIS-0, lo que le importa no es cómo se ve la superficie del mundo, sino en qué etapa se encuentra la tarea. La tarea en sí misma es un barra de progreso de estado causal.

Un ejemplo muy concreto es cuando un robot va a colocar las mantas de mesa.

No calculará tontamente las coordenadas de cada pixel de la tela de mesa, sino que seguirá en tiempo real algunas variables causales clave. Por ejemplo, si la tela de mesa está realmente agarrada por las garras, cuántos centímetros quedan entre los puntos de las esquinas y la posición objetivo, y si hay deslizamiento al tirar.

En cuanto el captura se suelte, el sistema comprende inmediatamente que la variable causal de «agarrar» no se cumple, por lo que el estado de la tarea vuelve directamente a la fase de recaptura, en lugar de revolver todo el proceso desde cero o seguir tirando de aire sin sentido.

En las pruebas oficiales de interferencia en la preparación del café, frente a escenas agotadoras como el movimiento repetido de la cafetera y cambios bruscos en la luz, el sistema puede reconocer los cambios en las variables clave en promedio en 2 segundos y realizar una nueva planificación, logrando una restauración efectiva en 9 de 10 perturbaciones externas.

Esa es la potencia de las variables causales: si ocurre un imprevisto, sabe claramente en qué paso se equivocó y a qué paso debe retroceder.

2. Interfaz de herramientas unificada: rechazar que una única estrategia ocupe todo

¿Cómo especificamente ejecuta el sistema la acción?

Respuesta: Llamada a herramienta, cada herramienta tiene su propio papel.

En su arquitectura, hay un Planner responsable de la programación general, quien maneja una caja de herramientas completa, integrando varios módulos a través de la Interfaz de Herramientas Unificada.

Funciones de movimiento basadas en reglas: Combinan la localización visual y la cinemática inversa, resolviendo eficientemente los desplazamientos espaciales en gran escala y los posicionamientos previos.

Modelos de estrategia de habilidades (Policy models): diseñados específicamente para abordar operaciones de contacto de alta dificultad como el derramamiento y la captura precisa.

Módulo de navegación (SLAM): responsable de la orientación del camino global;

Verificadores: realizan inspecciones físicas en cada nodo de la etapa;

Modelo de mundo causal (CausalWM): es responsable de predecir las consecuencias físicas que provocan las acciones.

Entre ellos, el arma más poderosa es precisamente este modelo del mundo causal.

Muchos amigos, al hablar del modelo mundial, su primera reacción es generar videos realistas en los próximos segundos. Pero en CausalWM de CRIS-0, se presta más atención al impacto de la acción en el entorno.

Su lógica es: primero observar el estado actual, luego predecir qué variables causales cambiarán como resultado de las acciones candidatas, y finalmente derivar el estado futuro.

En otras palabras, antes de que el robot extienda la mano, su mente ya está haciendo las previsiones, por ejemplo: si hago esto, ¿la mano se desviará? ¿El vaso se volverá hacia abajo?

Es como añadir una etapa de «ensayo». El sistema primero simula en el modelo mundial cómo evolucionarán las variables causales físicas si ejecuto la acción B, y solo después de confirmar que se logra el objetivo, llama a Action Head para emitir el control en el nivel más bajo.

3. Ciclos estructurados y seguridad nativa integrada

Y todo esto, todo, se repite en círculos dentro del Loop.

Al enfrentar tareas complejas, el Planner descompone los objetivos grandes; primero llama a la función de regla para mover rápidamente las garras cerca del objetivo, y luego utiliza el modelo de estrategia para lograr un agarre preciso. Los problemas complejos que antes eran difíciles de resolver con un solo modelo, se dividen en varios pasos pequeños con alta certeza.

En particular, se trata de este grafo de tareas que evoluciona dinámicamente: identificación de estado → selección de herramientas → ejecución → verificación → ajuste.

Cada vez que se completa un paso, el verificador examina inmediatamente si se han cumplido las condiciones físicas. Si no se cumplen, el sistema tiene un mecanismo de recuperación de tres niveles claro: primero determina si es posible intentar nuevamente en esta etapa; si no es posible, planifica nuevamente el camino; y solo si eso también falla, indica que se necesita intervención humana.

En cuanto un ajuste inesperado tenga éxito, este camino de recuperación exitoso se registrará y se almacenará en el diagrama de tareas. La próxima vez que se presente una situación similar, será más hábil en ello.

Esto también explica por qué, en la tarea de organización a largo plazo en ese salón, puede ejecutar decenas o incluso cientos de pasos sin colapsar.

Porque en cada paso se verifica el estado de causa y efecto, los errores se resuelven inmediatamente después de surgir, sin ninguna oportunidad de expandirse como una bola de nieve y provocar un colapso global.

De la misma manera, esta es también la razón por la que puede realizar una parada de seguridad en 0.2 segundos.

En CRIS-0, el juicio de seguridad está incorporado directamente en cada etapa causal.

En la etapa de cierre de la puerta, las manos que aparecen repentinamente son una variable peligrosa que compromete las condiciones de seguridad del usuario. El sistema puede captar y activar inmediatamente el bloqueo de mayor prioridad en el nivel de estado, deteniéndose en 0.2 segundos.

Pero si la tarea actual es ofrecerle un vaso de agua a los seres humanos, la mano que se extiende es la variable objetivo de interacción, y el sistema no se detendrá de forma caótica.

De hecho, la capacidad de nivel de sistema que muestra CRIS-0 no surge de la nada; detrás de ella hay una base de investigación sólida.

En la evaluación de la capacidad del agente, el marco de inteligencia causal de Aether AI RSIAgent obtuvo un Puntuaje Parcial del 78.98% en OSWorld 2.0. Sin actualizar los parámetros del modelo, logró mejorar la capacidad del agente del modelo abierto, superando a modelos de código cerrado como GPT-6 Astra.

Su primera versión del modelo de mundo causal CausalWM también ocupó el primer lugar en el TriWorldBench, que es el estándar del modelo de mundo de robots, logrando el Top-1.

Y estos dos niveles son los principales contribuyentes de este Demo.

Además, hay dos aspectos que también se están promoviendo continuamente: la arquitectura neuronal modular; cada módulo corresponde a mecanismos causales diferentes, y puede combinarse o sustituirse; Causation Transformer: aprende las relaciones de causa-efecto en lugar de las dependencias estadísticas.

El mundo físico no confía en la memorización mecánica

Al llegar a este punto, en realidad podemos salir del demo específico del robot y echar un vistazo más profundo.

¿Por qué ahora todos hablan cada vez más sobre la inteligencia causal?

Hablando honestamente, el estallido de los grandes modelos de lenguaje en esta etapa pasada fue, en gran medida, una cuestión de suerte. La lengua es un modalidad altamente simbólica y abstracta por parte de los seres humanos. Muchas lógicas y reglas ya han sido resumidas por los humanos en la superficie de los textos. Se puede lograr milagros mediante el ajuste estadístico de la correlación de probabilidad.

Pero el mundo físico no acepta este sistema.

La fricción no cambiará solo porque hayas leído cien mil artículos; la gravedad tampoco desaparecerá de repente debido a las estadísticas de probabilidad. En un mundo real lleno de dinámicas complejas, confiar únicamente en la adaptación de relaciones superficiales tarde o temprano llevará a que se llegue al límite de la Ley de Escalado.

En situaciones de una insuficiencia grave de datos físicos, para crear sistemas que realmente puedan enfrentarse a entornos físicos complejos, el modelo debe aprender a actuar como un científico humano, descubriendo los mecanismos causales subyacentes a partir de una pequeña cantidad de datos, y comprender cómo las acciones cambian realmente el mundo.

Esta compresión estructurada según el principio primario de “causa-efecto” podría ser la Ley de Escalado original de la existencia corporal.

Por supuesto, este camino es extremadamente difícil de recorrer. Los requisitos para el descubrimiento de causas y el aprendizaje de representaciones de causas en la teoría matemática y estadística son muy altos; hay pocas equipos en todo el mundo que combinen una profunda acumulación teórica con habilidades prácticas en ingeniería.

Aether AI se atreve a entrar en la competencia, en gran medida, también tiene que ver con su único marco académico especial.

Huang Biwei ha trabajado en este campo durante más de diez años. Está influenciada por los fundadores de la escuela de causalidad de CMU: Clark Glymour y Peter Spirtes, así como por los académicos de segunda generación Bernhard Schölkopf y Kun Zhang. Es una de las herederas clave de la escuela de descubrimiento de causas.

El marco teórico de la escuela de causas y efectos de tres generaciones, en última instancia, se ha convertido en los pilares tecnológicos subyacentes de Aether AI hoy en día.

Desde los acumulados de teoría de la Universidad de Carnegie Mellon y el Instituto Max Planck, hasta la presentación concreta de CRIS-0 en un brazo mecánico real, la inteligencia causal finalmente ha dado el paso clave hacia el mundo físico.

Cuando un sistema realmente tiene la capacidad de extraer variables causales, modelar la dinámica del mundo y razonar sobre las consecuencias antes de tomar acción, su aplicación no se limita únicamente a ayudar a quienes cierran un microondas o sirven una taza de café.

Mirar hacia lugares más lejanos, desde la predicción de tendencias en sistemas dinámicos complejos hasta los descubrimientos científicos en campos como los materiales y la vida científica, quizás todo pueda utilizar este mismo método lógico.

Grande era, amigos.

Hemos estado esperando que la IA pueda realmente salir del marco de chat basado en números puros y establecerse firmemente en este mundo físico, real, complejo y lleno de incertidumbres.

Y la causalidad, quizás sea esa llave más importante.

— Fin —
Quantum Bit QbitAI · Contrato con la plataforma de头条
Síguenos para estar al tanto de las últimas tendencias tecnológicas en el instante adecuado

 

Fuente original

量子位

Notas sobre el contenido

La publicación original y los derechos pertenecen a la fuente.

Traducción automática · Consulte el original