Investigadores de PhAI Labs, CUHK, Fudan, Stanford, Oxford y Princeton han publicado JEPA-Anything, un marco agnóstico al dominio para construir modelos del mundo. En lugar de diseñar un nuevo modelo predictivo para cada campo, aplica una única receta de aprendizaje compartida a sistemas muy distintos. Amplía las arquitecturas predictivas de incrustación conjunta (JEPAs) con un método llamado Orthogonal Predictive Factorization (OPF). El equipo de investigación lo probó en 7 dominios: visión, biología, trayectorias clínicas, control, dinámica molecular, campos físicos y meteorología.
¿Qué problema resuelve JEPA-Anything?
Un JEPA estándar, como I-JEPA o V-JEPA 2, utiliza un codificador de contexto, un codificador objetivo EMA y un predictor. El predictor produce una única incrustación objetivo monolítica. El equipo de investigación llama a esto un problema de asignación de capacidad: las estructuras de alta varianza dominan y los modos más débiles reciben gradientes contradictorios.
¿Cómo funciona Orthogonal Predictive Factorization?
OPF divide el objetivo latente de ancho d en K subespacios aprendidos de ancho r, con d = K × r. La mayoría de los experimentos usan K = 4. Cada factor recibe un predictor dedicado. Las predicciones de los factores se recombinan después mediante la pseudoinversa de Moore-Penrose de la matriz de proyección. El resultado es 1 estado latente completo para decodificación, planificación o rollout.
Tres regularizadores mantienen útiles los factores:
- Pérdida de ortogonalidad: mantiene las columnas dentro de cada proyector ortonormales y los distintos proyectores en subespacios no superpuestos.
- Pérdida de actividad del factor: una bisagra sobre la desviación estándar por coordenada para que ningún factor muera.
- Pérdida de varianza del codificador: envía una señal directa anti-colapso al codificador en línea.
La pérdida OPF simplemente se añade a la pérdida de entrenamiento original de cada dominio. Los adaptadores de dominio gestionan la tokenización y los codificadores; la biblioteca principal expone el núcleo compartido como OrthogonalFactorProjection.
La ortogonalidad importa para una síntesis estable. En CITRIS Interventional Pong, un modelo multicabezal sin restricciones con capacidad equivalente tenía un número de condición de 438.52. La versión ortogonal alcanzó 1.00005, con una superposición entre factores cercana a cero.
¿Qué resultados reporta la investigación?
Grupo I, lectura terminal: En datos de células individuales, la agrupación zero-shot de PBMC (AvgBIO) subió a 0.7752 frente a 0.7194 para Cell-JEPA. La Pearson de perturbación de Norman subió de 0.787 a 0.814. Para pronóstico sobre 1,000 eventos clínicos en datos de UK Biobank, el PRAUC medio fue de 0.718 frente a 0.711 del JEPA estándar equivalente.
Grupo II, dinámica latente del mundo: En Interventional Pong, el MSE de intervención única cayó un 34.83%. Las intervenciones combinadas no vistas mejoraron un 12.90%, y el despliegue libre de 6 pasos mejoró un 8.58%. JEPA-Anything mejoró las métricas reportadas en las 10 tareas de dinámica equivalentes. Los benchmarks incluyen CausalWorld, DeepMind Control, PDEBench y WeatherBench2. En APEBench Burgers, el error de despliegue de 6 pasos cayó alrededor del 44.7%, mejorando en cada semilla. Para despliegues moleculares de 100 pasos con un backbone tipo TrajCast, registró el MAE y RMSD más bajos en agua, cuarzo, paracetamol y benceno.
Los resultados de planificación son mixtos. Con parámetros emparejados dentro del 0.3%, JEPA-Anything mejoró el retorno de CEM en Walker2d y HalfCheetah. Hopper favoreció al JEPA estándar.
Grupo III, análisis científico: El análisis factorial nominó el bloqueo de IL-18 más CD73 como una intervención contra el cáncer. Las pruebas de laboratorio húmedo lo respaldaron en cocultivos, organoides derivados de pacientes, fragmentos tumorales y ratones. Los modos orbitales latentes también recuperaron la ley de Kepler con una pendiente ajustada de −1.4991 frente a la teórica −1.5.
¿Cómo se compara JEPA-Anything con otros modelos del mundo?
| Característica | JEPA-Anything | V-JEPA 2 | DINO-WM | DreamerV3 | TD-MPC2 |
|---|---|---|---|---|---|
| Idea central | JEPA con K factores predictivos ortogonales | Video JEPA más V-JEPA 2-AC condicionado a acciones | Modelo del mundo sobre características visuales preentrenadas | Modelo del mundo más actor-crítico entrenado en la imaginación | Dinámica latente sin decodificador más MPC |
| Estructura de objetivos | Factorizado, recombinado mediante pseudoinversa | Objetivo latente único | Objetivo latente único | Estados latentes categóricos | Estado latente único |
| Dominios mostrados | 7: visión, células, clínico, control, moléculas, EDPs, meteorología | Comprensión de video, manipulación robótica | PointMaze, PushT, Wall, objetos deformables | Dominios RL diversos, hiperparámetros fijos | 104 tareas de control continuo, 4 dominios |
| Planificación / rollout | Rollout latente, planificación con CEM | Planificación a partir de objetivos en imagen | Planificación con CEM | Política a partir de rollouts imaginados | Planificación MPC |
| Checkpoints públicos | Checkpoints de investigación por dominio en HF | Sí, de 300M a 1B (V-JEPA 2) | PointMaze, PushT, Wall | No listados en el repositorio | Más de 300 checkpoints, hasta 317M |
| Licencia | Apache-2.0 | MIT (algunos archivos Apache-2.0) | MIT | MIT | MIT |
Fuentes: el README de GitHub de cada proyecto, enlazado en la fila de encabezado. El estado del checkpoint de JEPA-Anything proviene de su tarjeta de Hugging Face. Verificado el 5 de octubre de 2026.
Conclusiones clave
- OPF divide 1 objetivo JEPA en K factores ortogonales con predictores dedicados.
- Superó a líneas base JEPA comparables en las 10 tareas de dinámica.
- El error de intervención única en Pong intervencionista cayó un 34.83%.
- Las ganancias en planificación dependen del entorno; Hopper favoreció el JEPA estándar.
- El código central es Apache-2.0; los checkpoints de investigación están en Hugging Face.
Consulta el Paper, GitHub Repo y Model Checkpoints. Todo el crédito corresponde al investigador de este proyecto. Además, no dudes en seguirnos en Twitter y no olvides unirte a nuestro 150k+ML SubReddit y suscribirte a our Newsletter. ¡Espera! ¿estás en telegram? ahora también puedes unirte a nosotros en telegram.
¿Necesitas asociarte con nosotros para promocionar tu GitHub Repo O Página de Hugging Face O Lanzamiento de Producto O Webinar, etc.? Conéctate con nosotros
El post Más allá de los modelos del mundo específicos de cada dominio: JEPA-Anything usa 1 receta para 7 campos apareció primero en MarkTechPost.