Autor | Wu Simeng
Edición | Cen Feng
Un plato, una grifo y un pequeño puñado de jabón limpiador azul. Wu Jiajun comenzó su discurso en IROS 2026 con una escena de cocina que apenas requería habilidades técnicas. Un estudiante se roció el jabón, abre el grifo, lava la mitad y se va temporalmente. Ahora, es el robot quien toma el control. A primera vista, la tarea es clara: limpiar el plato y luego volver a colocarlo. Pero lo que realmente necesita manejar el robot no son las palabras “limpiar platos”. Debe saber primero qué es esa cosa frente a él; debe saber si ese plato está sucio o no; debe observar si hay un pequeño trozo de jabón azul en el plato. También debe saber si la llave de agua está abierta ahora, si el plato ya ha sido lavado, y si, cuando levante el plato, surge otro problema en la superficie de la mesa. La misma tarea, pero con un estado inicial diferente, puede tener una respuesta completamente distinta. Si el plato ya ha sido lavado, no es necesario lavarlo de nuevo. Si no hay jabón, tendrá que aplastar algo primero. Si hay algo sucio presionado debajo de la bandeja, “lavarla bien” ya no equivale a colocarla en el estante. Cuando las personas se enfrentan a estos cambios, a menudo no sienten que han hecho algún razonamiento complejo. Solo echamos un vistazo y luego seguimos con lo nuestro. Pero para un robot, cada “un vistazo y seguir adelante” esconde una pregunta: ¿qué ha entendido como mundo ante sí? El 27 de septiembre, en el día de apertura de IROS 2026, Wu Jijun, profesor asistente del Departamento de Ciencias de la Computación de la Universidad de Stanford, presentó un informe invitado titulado “Building Physical Agents via Structured Representations” en el simposio RoBoWoMo. En los últimos años, ha estado investigando cómo recuperar del conjunto de imágenes el mundo que se esconde detrás de la visión: geometría, materiales, propiedades físicas y las relaciones entre objetos. Ahora, cuando estos problemas se ponen en el mundo físico real de los robots, surgen otros problemas adicionales. ¿Cuál es la forma adecuada de describir una tarea para un robot? ¿Se pueden aprender estas descripciones por sí mismas? Cuando se enfrenta a objetos que nunca aparecen en los datos de entrenamiento, ¿cuándo necesita el modelo un entrenamiento posterior? Si incluso la planificación puede aprender por sí misma, ¿es aún necesario el planeador tradicional? Finalmente, la pregunta ni siquiera es “¿ha visto el robot cómo lo hace una persona?”. Si no hay demostraciones, si no hay datos de operaciones a distancia, e incluso si se enfrenta a un grifo que nunca ha visto antes, ¿puede el robot pensar por sí mismo cómo se utiliza? Se presenta el texto editado del discurso de Wu Jiajun en IROS 2026. Reifeng Net (publicación oficial: Reifeng Net) · AI Technology Review ha realizado la edición basándose en el discurso en inglés en vivo, reorganizando las expresiones orales y los términos técnicos sin cambiar el significado original.
▎Construcción de Agentes Físicos a través de Representaciones Estructuradas
Orador principal: Wu Jiajun, profesor asistente en el Departamento de Ciencias de la Computación de la Universidad de Stanford (también profesor asistente en el Departamento de Psicología)01
¿Por qué una bandeja representa un problema para el robot
Hoy quiero hablar sobre cómo, con representaciones estructuradas, podemos construir agentes inteligentes que puedan actuar en el mundo físico. Comencemos por lo visual. Al final, solo puedes ver imágenes, pero detrás de las imágenes se encuentra todo un mundo: geometría, materiales y diferentes propiedades físicas. La línea principal de nuestro estudio siempre ha sido hasta qué punto se pueden reconstruir estas cosas; y una vez que las hayas reconstruido, puedes recrear ese mundo de nuevo. En los últimos años también hay una dirección muy activa: los agentes en espacios digitales. Reciben instrucciones y interactúan con todo el mundo. Esto naturalmente hace pensar en otra pregunta: ¿existe una estructura similar en el mundo físico? En el mundo digital, tienes carpetas, en las carpetas hay archivos, y los archivos tienen sus atributos; en el mundo físico, tienes escenas, en las escenas hay objetos, y los objetos también tienen sus atributos. Entonces, ¿podemos utilizar esta estructura para llevar esos agentes inteligentes del espacio digital al espacio físico? Este es el tema del informe de hoy. En cuanto realmente quieras que los robots y las personas estén en el mismo mundo, las cosas se vuelven complicadas. Ese mundo es muy complejo; es dinámico y diverso, y tienes que gestionar una gran cantidad de tareas diferentes. Por supuesto, debes usar modelos básicos, que ahora son cada vez más potentes, tan poderosos que parece imposible no usarlos. Pero la forma en que los utilizas puede ser muy diferente: ¿quieres realizar entrenamiento posterior, introducir más estructuras o añadir conocimientos adicionales, y luego cómo combinarlos con las partes ya existentes? Estas son opciones que aún están por determinar. También hay un aspecto especialmente relacionado con los robots y muy diferente del mundo digital. El mundo digital está, en gran medida, unificado por el lenguaje; por otro lado, los robots presentan una situación diferente: diferentes áreas, diferentes tareas. A menudo son escenarios y datos exclusivos, y cada robot es distinto. Estos datos no aparecerán en los grandes conjuntos de texto utilizados para entrenar los modelos grandes. Así que la pregunta es: ¿cómo superar este obstáculo? Después de hablar tanto de lo abstracto, comencemos con una escena completamente no especializada, una situación muy común en la cocina. Veamos qué se necesita para que el sistema robótico trabaje realmente junto con las personas, incluso en tal escenario. Un estudiante aplasta jabón en un plato, abre la fuente de agua y luego tiene que irse. Ahora, déjame al robot hacerlo. Por supuesto, primero debe realizar una inferencia semántica: entre todos estos utensilios de cerámica, ¿cuál es el que necesito ayudar a lavar? Es este plato. Este paso es relativamente fácil de realizar hoy en día con un modelo visual. Luego, tiene que darse cuenta de que esta plato debe ser lavado. El detergente ya se ha añadido y la llave de agua está abierta. Así que lo que tengo que hacer es tomar el plato, lavarlo, colocarlo en el estante y cerrar la llave de agua. Parece muy claro. Pero lo realmente difícil es: cómo mantenerse consistente entre diferentes entornos, diferentes objetos y diferentes objetivos. Incluso en esta situación que ya es simple, pueden surgir varias situaciones completamente diferentes. La primera es que tienes que adaptarte a los movimientos de los demás. Por ejemplo, si entra alguien y lava los platos y los coloca en la mesa. En ese momento deberías saber que los platos ya han sido lavados, así que no es necesario lavarlos otra vez. Todo lo que tienes que hacer es colocarlos de nuevo, y tampoco es necesario cerrar el grifo, ya que está cerrado. La segunda opción es esa diferencia muy sutil en el estado inicial. Supongamos que todo sigue igual que antes, la única diferencia es que en este plato no hay jabón de limpieza. Si miras toda la imagen, esa diferencia es muy pequeña; es solo un pequeño grupo de color azul, y es difícil de ver. Pero no se puede llevar todo con una “sutil diferencia”: se trata de una diferencia cualitativa en la representación del estado. Porque si no se ha aplicado detergente en la bandeja, probablemente no deberías lavarla, lavarla directamente haría que se arruine todo. Primero hay que aplicar el detergente, luego lavarla, después colocarla en el estante y finalmente hacer el resto del trabajo. La diferencia en la entrada es muy pequeña, pero la diferencia en el estado es cualitativa, y las acciones que se deben realizar son completamente diferentes. La tercera opción es seguir los observaciones en constante actualización. Por ejemplo, el robot toma el plato, lo coloca en la estantería, y eso es suficiente, porque ya está limpio, no hay necesidad de cerrar la llave de agua. Pero debajo del plato hay algo sucio. En ese momento, debes darse cuenta de que si mi objetivo realmente es que todo esté limpio, entonces debería limpiar la mesa. Nadie te ha ordenado eso; lo has entendido siguiendo las nuevas observaciones. En el caso ideal, también deberías volver a colocar ese plato; pero ni siquiera podemos hacer ese paso, porque el cuerpo del robot y las habilidades que maneja lo limitan. Por lo tanto, debes ser capaz de adaptarte a todas estas situaciones diferentes. La pregunta es, ¿cómo se hace?02
Si el robot también necesita un idioma
En los últimos años, hemos estado buscando un conjunto de paradigmas. Su implementación concreta ha estado cambiando constantemente, porque el modelo base también cambia y las posibilidades también varían. Pero la estructura sigue siendo la misma: un extremo es la entrada original, video o lenguaje; en el medio, el modelo base ayuda a descubrir un conjunto de abstracciones compuestas; estas abstracciones deben poder ser reutilizadas y recombinadas para afrontar tareas generales; el otro extremo son las acciones de control, preferiblemente descubiertas y aprendidas por uno mismo. En cuanto al aprendizaje de acciones, esperamos aprender a través de lo que se denomina supervisión natural. Es decir, todo el proceso se aprende y se descubre; cuanto menos participen las personas, mejor. Lo que puedes darle puede ser solo un video, una demostración o algunos idiomas, y ahora estos datos de entrada ya pueden ser procesados. Cuanto menor sea la supervisión, mejor será la generalidad. Pero al dibujarlo así, surgen una serie de preguntas en el papel. ¿Cómo se ve esa combinación abstracta? ¿Cómo se descubre? ¿De dónde viene ese lenguaje especializado para describir las tareas? ¿Si en realidad no lo necesitas? ¿Cómo se soluciona la planificación? ¿Usar un planificador de tareas tradicional o aprender uno nuevo? Además, respecto al modelo de mundo en sí, ¿lo usas tal cual o necesitas ajustes o entrenamiento posterior? Todas estas opciones tienen diferentes implementaciones, y nosotros también hemos probado diferentes versiones a lo largo del camino. Comencemos hablando de la estructura general desde una perspectiva superior. La primera versión de la implementación se hizo hace dos años; los componentes específicos de esa época eran mucho más rudimentarios que ahora, pero el paradigma ya está claro. Supongamos que tienes un conjunto de demostraciones. Puede que un robot haga muchas tareas diferentes en el mismo lugar, y puedes identificar los puntos clave durante todo el proceso. Por ejemplo, en el primer paso toma la taza, en el segundo paso toma el grifo y lo enjuaga, y en el tercer paso colócala en el estante. También puede ser algo diferente, como datos de video. En resumen, tienes este conjunto de datos en mano. Tu objetivo es aprender el conjunto de descripciones detrás de esta tarea. Es algo similar a un modelo mundial simbólico, que contiene aproximadamente dos grupos de módulos. El primer grupo son las propiedades y relaciones espaciales que te interesan. ¿Es sucio este objeto, o limpio? ¿Qué relación hay entre estos dos objetos, ya sea una relación bidimensional o tridimensional? Estas cosas deben poder ser determinadas; esto constituye un conjunto de predicados. Por supuesto, no se puede depender de las reglas escritas por personas, sino de redes y modelos básicos para aprender: hacer que aprendan a determinar cualquier conjunto de predicados, ya sea si es sucio o si hay alguna relación espacial. El segundo grupo son acciones. Tienes un conjunto de acciones atómicas, como “lavar”. Cada acción debe explicar claramente sus condiciones previas y efectos posteriores. Para realizar este movimiento de lavado, primero hay que agarrar el objeto en la mano; la persona debe estar en la cocina. El efecto es que, si el objeto contiene detergente, se limpiará. En cuanto a saber si el robot tiene algo en la mano o si un objeto está limpio o sucio, esto lo determina el grupo de predicados anterior. Al mismo tiempo, para ejecutar realmente un movimiento, se necesita también una estrategia, es decir, cómo deben trabajar los músculos. Esta parte también depende de una red neuronal, con una estrategia de difusión para cada acción atómica. De este modo, la capa de símbolos define la combinabilidad: siempre que se cumplan las condiciones previas, estas acciones atómicas pueden unirse para formar tareas más largas y complejas. La percepción y el control son realizados por redes neuronales. Pero en cierto sentido, esto es un lenguaje especializado, un conjunto de lenguaje especializado para el campo (DSL). Así surge una cuestión muy fundamental: en los primeros tiempos, estas cosas eran escritas manualmente o se copiaban directamente de fuentes como PDDL; el DSL ya estaba establecido. ¿Es suficiente para ser universal? ¿Por qué es suficiente? ¿Qué pasa si hay algo que se omite? Por lo tanto, el siguiente paso natural es: también debe ser posible aprender el DSL. Puedes hacer que el modelo básico examine los datos que tienes en mano; puede ser un video de demostración, un registro de operaciones o un lenguaje, y luego le dices que este es el trabajo que queremos atender. A continuación, debería producir: creo que las siguientes propiedades son importantes, así como las siguientes acciones atómicas, y sus condiciones previas y efectos posteriores son importantes. ¿Y si se equivoca? También puedes verificarlo. Por un lado, se puede verificar de manera simbólica; por otro lado, se pueden utilizar los datos directamente para la verificación. Por ejemplo, si el sistema indica que antes de lavar algo es necesario tomarlo en las manos, de lo contrario no se puede lavar. Entonces, debes volver y revisar tus propios datos: cada vez que lavo algo, ¿realmente lo tomo en las manos? Puedes usar estas demostraciones o otros datos que tengas en las manos, ya sean públicos o privados, para verificar estas especificaciones. Por lo tanto, este lenguaje también fue propuesto por otro sistema. El año pasado, cuando hablé de este punto, fue bastante confuso. Este año espero que sea mejor, porque he descubierto que una buena analogía puede hacerlo mucho más claro. Esta analogía está en sus propios ordenadores. Si pegas una frase como “haz esto”, el agente inteligente programado lo hará por sí mismo en diez o ocho pasos. El primer paso es crear un archivo, el segundo es ejecutar alguna operación, y así sucesivamente. Tiene muchos pasos diferentes. Si lo piensas bien, es muy similar a lo que tenemos que hacer. Lo que hacemos es, en esencia, llevar al entidad inteligente como el Cursor que trabaja en la computadora al espacio físico: primero se idea una serie de planes, luego se ejecutan estas acciones, y además hay un proceso de verificación para asegurarse de que estas acciones estén definidas correctamente y se ejecuten correctamente. Básicamente es así.03
¿Qué haces con algo que no has visto antes, del modelo?
A continuación, hablemos de cuándo hay que sentarse y hacer el entrenamiento posterior. Por supuesto, si, como en esa analogía anterior, se utiliza directamente un modelo avanzado para avanzar hasta el final, es lo más fácil. Pero hay un problema ineludible en el caso de los robots: lo que se tiene que tratar probablemente nunca se ha visto antes. Porque el mundo físico es mucho más fragmentado que el mundo digital. Quizás haya visto algún tipo de objeto, pero la situación más común es que hay una pieza utilizada en una cadena de producción, que solo existe en tu fábrica y no en ningún otro lugar. Nunca he visto esta pieza, ahora tengo que determinar si está sucia o no, y si produce algún efecto. Obviamente, no se puede usar directamente el modelo avanzado público, porque ni siquiera conoce la definición de “si esta pieza es buena o mala”. Por lo tanto, en algunos casos tendrás que realizar un poco de entrenamiento posterior. La condición es que decidas no depender únicamente de esos modelos avanzados ya existentes. ¿Cómo se hace eso? Tenga en cuenta algo: aunque estos efectos parecen lógicos, como por ejemplo que tiene detergente y después de lavar se vuelve limpio, en la implementación real están escritos de manera aproximada, y las operaciones lógicas en su mayoría existen en forma de probabilidad. Por lo tanto, puede unir toda la cadena: digo que este objeto tiene detergente, lo lavo, y debería quedar limpio. Pero, ¿qué pasa si mi criterio para determinar si tiene o no detergente es incorrecto? Porque se trata de un objeto nuevo que nunca he visto antes, no puedo juzgarlo, por lo que la salida es incorrecta, y todo lo que sigue también está equivocado. En ese momento, mi demostración me indica otra realidad: ese objeto realmente está limpio. Así que tienes una etiqueta. Dado que todos los pasos de ejecución se acumulan de manera diferenciable, puedes usar esta etiqueta de ejecución de la demostración para propagación inversa, proporcionando supervisión al modelo. Por lo tanto, el entrenamiento posterior puede realizarse en ciertas situaciones. No es necesario, pero si consideras estos modelos como módulos dentro del sistema, y si necesitan ser reentrenados, esa vía funciona. No voy a explicar en detalle los resultados de ese grupo de hace dos años; ese conjunto de componentes ahora está obsoleto, y después de cambiar el método, se sentirá que algunos aspectos fueron hechos de forma bastante torpe en ese momento. Pero el paradigma en sí tiene un gran potencial; posteriormente, cambiamos las diferentes partes por versiones más modernas. Por cierto, uno de los postdoctorados que trabajó en ese proyecto ahora es profesor en la Universidad Nacional de Singapur. Otro colaborador era un doctorando en el MIT, y hoy también es profesor.04
Incluso la planificación, comenzó a ser entregada al modelo
A continuación, hablaré de algunos avances más cercanos. Hablaré un poco más rápido. Como se mencionó antes, los módulos del sistema se desarrollaron capa por capa; la verificación, la percepción y el control han sido entregados a las redes neuronales. Pero hay una cosa que aún no está presente: la planificación. Cuando tengas todos los módulos y el estado haya sido verificado, ¿debería empezar primero con el lavado o hacer algo más? En ese momento, se utilizaba algo tradicional, el método de planificación de tareas tradicional. Y recientemente, acabamos publicando un trabajo especialmente para reemplazar este aspecto. Esto también es por qué hoy no tengo muy buenos diapositivas. En realidad, debería tener un video, y realmente quiero un video. Así que, optimista, en unos días tendremos un video bonito. Ahora solo puedo usar una imagen del artículo para empezar. La idea es la siguiente: todavía tienes un conjunto de estados, que son verificados por una red neuronal; pero lo de “dado el estado actual, ¿debería lavar primero, o tomar la bandeja, o qué hacer”, ya no se deja al planificador tradicional, sino a la red. Dicho de manera más específica: ese conjunto de predicciones es ahora básicamente lenguaje natural, un verdadero lenguaje natural. Se puede utilizar el lenguaje natural junto con imágenes como entrada para el modelo base, para que este haga la planificación. Pero también necesita ser entrenado posteriormente. Por lo tanto, aquí tenemos que usar modelos de pesos abiertos, ya que es necesario realizar el entrenamiento después de implementarlo; además, como las imágenes son una parte de la entrada, también es necesario que el modelo pueda procesar imágenes. Y resultó que la capacidad de inferencia visual de algunos modelos abiertos es bastante deficiente; al menos, nuestros resultados demuestran que son mucho peores que los modelos cerrados de la misma época. Por lo tanto, si los usas directamente, a menudo producen algo que no tiene sentido alguno. En la práctica, hemos optado por usar algunos modelos y hemos realizado entrenamiento posterior. De esta manera, incluso el planificador se convierte en algo que ha sido aprendido mediante entrenamiento posterior. Puede utilizar este tipo de lenguaje natural simbólico para planificar, y las secuencias de acciones generadas tienen una probabilidad mucho mayor de ser ejecutables. Para este tipo de tareas de larga duración, esto significa que se necesita mucho menos intervención humana. Hay además un desafío: todo esto depende de una base de habilidades, y la base de habilidades de cada robot puede ser diferente. Si usas directamente cualquier modelo avanzado, no tiene el contexto de tu base de habilidades. Por ejemplo, dirá que ahora debes llenar este tazón con agua desde la llave de agua, pero la llave de agua aún no está abierta. Esta acción es imposible de ejecutar. Después del entrenamiento, el planificador, al enfrentarse a este tipo de operaciones de larga duración, proporciona acciones que parecen realmente ejecutables. En unos días tendremos un video; por ahora, vamos a echar un vistazo al resultado más reciente. Hasta ahora, siempre hemos asumido que tenemos demostraciones: ya sea videos o operaciones realizadas por humanos. Lo que quiero decir en el tiempo restante es: ¿qué pasa si no hay demostraciones? ¿Y si me encuentro con un objeto completamente nuevo, nunca visto antes? La forma anterior era: que me mostrara una demostración y me dijera cómo lidiar con ese objeto. Pero, ¿es posible que yo pueda pensar en todas las formas posibles de lidiar con ese objeto sin ni siquiera un video de demostración ni ninguna ayuda de nadie? Por ejemplo, si tienes frente a ti un grupo de nuevos objetos. Ya te hemos mostrado cómo abrir la llave de agua. Pero esta llave de agua nunca la he usado antes. ¿Podrías generar algunos ejemplos y decirme qué formas hay para interactuar con ella? Este también es un trabajo que estamos explorando. Formulemoslo de manera aproximada. Supongamos que solo tenemos un objeto inmóvil, una llave de agua o una caja. ¿Podríamos desarrollar un sistema que, a partir de estos objetos inmóviles desde una sola perspectiva, genere una distribución y luego extraiga un espacio de posibilidades a partir de esa distribución? Si le das una llave de agua, generará formas que pueden girar; si le das una caja, generará formas como abrirse y cerrarse, así como todas las demás variantes. Resumiré rápidamente el método específico hoy, para respetar el tiempo de todos. Pero el resultado es: una vez que aprendes este sistema, puedes entrar en una escena completamente nueva, en un montón de objetos diferentes, y un modelo puede inferir las posibles interacciones. Monitores, un pendrive, flores, todo tipo de cosas. Además, lo que produce no son respuestas memorizadas, sino lo más simple de lo que aprendiste sobre la distribución: ¿cómo puedo seguir actuando en relación con esa cosa? ¿Y en el mundo real? Un robot entra en una habitación, y su percepción es muy sucia. Por lo tanto, también hicimos algo: pedimos a un estudiante que usara el iPhone para escanear la habitación. El iPhone puede hacer escaneos tridimensionales, pero la precisión no es alta; lo que se obtiene es muy ruidoso y muy abultado, como una masa de masas. Incluso si le damos como entrada al sistema nuestro los resultados con mucho ruido, descubrirás que tiene algo de generalización sin muestras cero: puede deducir cómo se debe tratar un lavavajillas, una nevera o un microondas. Esto sería mucho más útil para los robots. Porque el robot entrará en una habitación que nunca has visto, y aunque la entrada sea tan tosca, todavía dirá: “Este grifo específico nunca he visto, pero puedo razonar sobre las diversas formas de tratarlo, puedo imaginar diferentes métodos de acción, y luego usar esto para descubrir una estrategia”. Lo mismo ocurre en la oficina; el resultado de la reconstrucción es igualmente abultado, pero puede razonar cómo tratar un portátil. Sin embargo, este razonamiento tiene otro problema. Puede proporcionar cuarenta formas de interactuar con este objeto, pero tú querías alcanzar un objetivo en particular, y no sabes qué de esas cuarenta formas es realmente útil para ti. Por eso también pensamos si podríamos añadir condiciones lingüísticas a este paradigma para poder manejarlo mejor. Por ejemplo, tengo una escena estática y le doy una frase en lenguaje: “Un niño salta en el trompo”. ¿Podría generarse una escena tridimensional en movimiento, o incluso una escena cuaternional? Así, hay interacción entre personas y objetos, con movimientos de ambos lados cuando los niños saltan encima. Esto es mucho más útil, porque puedes seguir preguntando: ¿cómo debe interactuar el robot con ese objeto? Entonces, generas, puedes generar en esa dirección o en otra, y luego seleccionas el movimiento que realmente te ayuda a resolver el problema. ¿Cómo se hace? Todavía se depende de grandes modelos de generación entrenados previamente. En este trabajo, lo principal en el que nos basamos es el modelo de difusión de video. Supongamos que tiene una escena estática, que puede ser muy sucia y en cualquier situación, puede convertirla en una representación intermedia de miles de puntos, y luego puede añadir una dimensión más, que es el tiempo. Así obtiene una representación cuatidimensional. Pero si se pasa de tres dimensiones a cuatro, es estática; ¿cómo la hace girar? Hay una forma de hacerlo. Si solo tiene una forma estática y quiere que sea más realista, existe una técnica llamada muestreo de destilación fraccionada (SDS). En el espacio tridimensional convencional, se hace de la siguiente manera: se renderiza esta forma para obtener videos desde diferentes ángulos, y luego se envían a un modelo de difusión de video para actualizar su representación en el sentido del tiempo. Lo mismo puede hacerse en el espacio cuaterniano. Es muy difícil en la práctica; hay que encontrar soluciones para una serie de problemas y diseñar estructuras de datos en la representación cuaterniana. Pero en concepto, se utiliza un modelo de video y un modelo de difusión preentrenado para guiarte y crear secuencias de interacción entre personas y objetos reales, o entre robots y objetos. Mencionen dos resultados más. Por ejemplo, si tienes una losa y añades la frase “el robot está levantando la losa”, podrá generar la secuencia de interacción en la que el robot levanta la losa. De esta manera, podrás ver cómo se vería esa interacción bajo un contexto lingüístico diferente. También puedes agregar algunas demostraciones gratuitas para aprender habilidades a partir de ellas. Anteriormente, era necesario tener videos operados por humanos o datos de operación a distancia para aprender habilidades y incluirlas en el planificado; ahora puedo hacerlo sin necesidad de demostraciones humanas, generando mis propias demostraciones y aprendiendo habilidades a partir de ellas. Después de completar el aprendizaje, vuelvo a usar el marco de entrenamiento original. No es necesario que se utilice exclusivamente en robots. Por ejemplo, un balón de baloncesto que rebota al chocar contra la canasta, un gato que salta sobre un cojín: todo esto puede hacerse. Pero realmente lo hemos utilizado en robots también. Como por ejemplo, una tela. Dices: genera una secuencia en la que una persona interactúa con esa tela y la despliega. A la izquierda está lo generado. Por ser generado, tienes un conjunto de demostración gratuita, y puedes obtener las trayectorias densas de puntos sobre la tela en el espacio tridimensional, que se rastrean a lo largo del tiempo en el tridimensional. Estos elementos se convierten en un conjunto de objetivos de supervisión gratuitos, para que el robot sepa: quiero que este objeto se mueva de esta manera. A la derecha está el robot real que intenta hacer lo mismo. Partiendo de la imaginación, deja que el modelo de difusión te guíe, y considera su salida como un objetivo exitoso; así aprendes una estrategia para hacerlo. Otro ejemplo es cerrar el portátil. Recientemente también estamos trabajando en algo: hacer que sea mucho más rápido. Porque en este tipo de métodos, si te ocupas de las unidades de difusión, es muy lento, y en el espacio cuaterniano, la destilación de fracciones también es muy lenta. Por eso hemos utilizado caché y renderizado semántico, para aumentar la proporción de actualizaciones exitosas, de modo que no necesites llamar al modelo de video tan frecuentemente. De esta manera, puedes generar secuencias de demostración con un período de tiempo más largo. Antes, probablemente solo generaba una demostración: el robot tomaba ladrillos o cerraba el cuaderno, lo que permitía aprender habilidades atómicas. Ahora esto no es un robot, pero no hay razón para que no pueda ser uno. Se pueden generar secuencias interconectadas de muy larga duración, capaces de hacer cosas completamente diferentes. Así, lo que se obtiene no es solo una demostración gratuita de habilidades atómicas, sino también demostraciones gratuitas de problemas complejos de operaciones de larga duración, que pueden proporcionar datos ilimitados para el entrenamiento de habilidades. Bueno, me detengo aquí.05
La estructura no es la respuesta, sino una plataforma de apoyo
Mirando hacia atrás, siempre hemos estado hablando de cómo encontrar estas representaciones estructuradas. Verás que, a medida que pasa el tiempo, hay cada vez más de este tipo de cosas. Ahora, casi cada componente ya existe, pero todavía conservas esa capa de representación intermedia. Ahora está prácticamente en forma de lenguaje; por supuesto, detrás de esto hay una representación de escenario, lo que hace que todo el conjunto sea explicable.También hemos estado pensando en cómo hacer que sea más universal, cómo no quedar atado por los objetos existentes o las demostraciones existentes.
Sobre la palabra “estructura”, quiero decir algo más. Cuando otros hablan de estructura, es fácil entenderla como algo diferente: se trata de insertar la estructura de forma rígida en tu sistema. Eso no es bueno y no es lo que hacemos. Lo que queremos es ver si este interfaz puede ayudar al sistema a funcionar de manera más eficiente; actúa como un andamio externo, pero también permite que las personas puedan comunicarse con él. En esencia, estás utilizando aquellos modales de enriquecimiento de datos, especialmente los vídeos, incluyendo el lenguaje, así como los tres y cuatro dimensiones que puedes obtener. Pero al final, lo que realmente importa es otra cosa: cómo estas representaciones estructuradas nos permiten tener capacidad de razonamiento. Tienes representaciones a nivel atómico; yo las lavo, las guardo y hago estas cosas. Luego, el siguiente paso es determinar qué son las relaciones de dependencia entre estas tareas y cuál es su impacto. Lo que realmente te permite resolver problemas de larga duración, y hacerlo de una manera muy general, es esto. Gracias a todos.Para que todos puedan comunicarse entre sí y compartir información sobre las reuniones, hemos creado específicamente el IROS 2026 Grupo de comunicación para la participación¡¿Entrar en el grupo te permitirá desbloquear estas «beneficiencias»?
Estación de información de reuniones: envíos de DDL, normas de formato, progreso de revisión… Los puntos clave se notifican en el momento adecuado, así no hay más riesgo de pasar el plazo establecido. La preparación para los envíos es segura.
Reunión de té entre colegas: todos los colegas de todo el mundo están en el grupo. Hablan de sus experiencias, discuten ideas y construyen relaciones. Estamos juntos en el camino científico.
Estación de suministro de vanguardia: resultados de investigación más recientes y direcciones destacadas sincronizadas en tiempo real. Se combina con el tema de la conferencia para ayudarte a organizar tus artículos, y proporciona inspiración para tu tesis.
Comité de apoyo en el lugar: (activado solo durante la reunión):No hay que preocuparse al llegar al lugar —
Navegación del recorrido: Distribución de las salas, cómo llegar al salón de informes, pregunte en el grupo en cualquier momento;
Leitura conjunta de temas: Sesiones populares y discusiones de Keynote, que no se hayan visto también pueden seguirse;
Compilación de posters: Recopilación de los mejores posters en vivo, guardar con una sola clic sin omitir nada;
Plaza Yueju: reuniones para comer, oficinas de entrevistas, departamentos de comunicación… Si quieres charlar, colaborar o conocer gente en persona, basta con iniciar una reunión en el grupo.
? Puerta de entrada al grupo: Escanee el código para unirse al grupo o agrega a WeChat Luyoyo_2026, con una nota: ECCV + institución/sistema educativo + nombre + área de estudio.
En la investigación científica/tecnología, la diferencia de información es muy importante.
Vamos, avanzando un paso más.
Sube al coche, te mostraré los aspectos más destacados de las conferencias más importantes de IA del mundo
Acceso exclusivo:
PPT para la presentación de un experto
Informe completo de la conferencia
Análisis de artículos destacados
Entrevista con la estrella académica
Escanee el código QR de arriba
O haga clic en «Leer el artículo original» para seguir la sección especial.
Artículo original de Leifengwang, no se permite la reproducción sin autorización. Para más detalles, consulte las instrucciones para la reproducción.