MarkTechPost

Au-delà des modèles du monde spécifiques à un domaine : JEPA-Anything utilise 1 recette pour 7 domaines

JEPA-Anything décompose la cible latente unique d'un JEPA en 4 facteurs orthogonaux, chacun doté de son propre prédicteur. Testé sur 7 domaines, il a surpassé des baselines JEPA équivalentes sur les 10 tâches de…

Des chercheurs de PhAI Labs, de l'CUHK, de Fudan, de Stanford, d'Oxford et de Princeton ont publié JEPA-Anything, un cadre indépendant du domaine pour construire des modèles du monde. Au lieu de concevoir un nouveau modèle prédictif pour chaque domaine, il applique une recette d'apprentissage partagée à des systèmes très différents. Il étend les architectures prédictives à plongement conjoint (JEPAs) avec une méthode appelée Orthogonal Predictive Factorization (OPF). L'équipe de recherche l'a testé sur 7 domaines : la vision, la biologie, les trajectoires cliniques, le contrôle, la dynamique moléculaire, les champs physiques et la météorologie.

Quel problème JEPA-Anything résout-il ?

Un JEPA standard, tel que I-JEPA ou V-JEPA 2, utilise un encodeur de contexte, un encodeur cible EMA et un seul prédicteur. Le prédicteur produit un plongement cible monolithique. L'équipe de recherche appelle cela un problème d'allocation de capacité : les structures à forte variance dominent, et les modes plus faibles reçoivent des gradients contradictoires.

Comment fonctionne l'Orthogonal Predictive Factorization ?

OPF décompose la cible latente de largeur d en K sous-espaces appris de largeur r, avec d = K × r. La plupart des expériences utilisent K = 4. Chaque facteur reçoit un prédicteur dédié. Les prédictions des facteurs sont ensuite recombinées par le pseudoinverse de Moore-Penrose de la matrice de projection. Le résultat est 1 état latent complet pour le décodage, la planification ou le rollout.

Trois régularisateurs maintiennent les facteurs utiles :

  • Perte d'orthogonalité: maintient les colonnes de chaque projecteur orthonormales et les différents projecteurs dans des sous-espaces sans chevauchement.
  • Perte d'activité des facteurs: une charnière sur l'écart-type par coordonnée afin qu'aucun facteur ne devienne inactif.
  • Perte de variance de l'encodeur: envoie un signal anti-effondrement direct à l'encodeur en ligne.

La perte OPF est simplement ajoutée à la perte d'entraînement originale de chaque domaine. Les adaptateurs de domaine gèrent la tokenisation et les encodeurs ; la bibliothèque principale expose le noyau partagé sous la forme OrthogonalFactorProjection.

L'orthogonalité compte pour une synthèse stable. Sur CITRIS Interventional Pong, un modèle multi-têtes sans contraintes à capacité équivalente avait un nombre de condition de 438.52. La version orthogonale a atteint 1.00005, avec un chevauchement inter-facteurs proche de zéro.

Quels résultats la recherche rapporte-t-elle ?

Groupe I, lecture terminale: Sur des données single-cell, le clustering zero-shot de PBMC (AvgBIO) est monté à 0.7752 contre 0.7194 pour Cell-JEPA. Le Pearson de perturbation Norman est passé de 0.787 à 0.814. Pour la prévision sur 1,000 événements cliniques de données UK Biobank, le PRAUC moyen était de 0.718 contre 0.711 pour le JEPA standard apparié.

Groupe II, dynamique du monde latent: Sur Interventional Pong, la MSE des interventions simples a chuté de 34.83 %. Les interventions combinées non vues se sont améliorées de 12.90 %, et le rollout libre à 6 pas s'est amélioré de 8.58 %. JEPA-Anything a amélioré les métriques rapportées sur les 10 tâches de dynamique appariées. Les benchmarks incluent CausalWorld, DeepMind Control, PDEBench et WeatherBench2. Sur APEBench Burgers, l'erreur de rollout à 6 pas a diminué d'environ 44.7 %, avec une amélioration à chaque seed. Pour des rollouts moléculaires à 100 pas avec un backbone de type TrajCast, il a affiché le MAE et le RMSD les plus bas sur l'eau, le quartz, le paracétamol et le benzène.

Les résultats de planification sont mitigés. Avec des paramètres appariés à 0.3 % près, JEPA-Anything a amélioré le retour CEM sur Walker2d et HalfCheetah. Hopper a favorisé le JEPA standard.

Groupe III, analyse scientifique: L'analyse factorielle a désigné le blocage de IL-18 plus CD73 comme une intervention contre le cancer. Les tests en laboratoire l'ont confirmée dans des co-cultures, des organoïdes dérivés de patients, des fragments de tumeurs et des souris. Les modes orbitaux latents ont également retrouvé la loi de Kepler avec une pente ajustée de −1.4991 contre le −1.5 théorique.

Comment JEPA-Anything se compare-t-il aux autres modèles du monde ?

CaractéristiqueJEPA-AnythingV-JEPA 2DINO-WMDreamerV3TD-MPC2
Idée principaleJEPA avec K facteurs prédictifs orthogonauxVideo JEPA plus V-JEPA 2-AC conditionné par les actionsModèle du monde sur des caractéristiques visuelles pré-entraînéesModèle du monde plus actor-critic entraîné dans l'imaginationDynamique latente sans décodeur plus MPC
Structure des ciblesFactorisée, recombinée via pseudoinverseCible latente uniqueCible latente uniqueÉtats latents catégorielsÉtat latent unique
Domaines présentés7 : vision, cellules, clinique, contrôle, molécules, EDP, météoCompréhension vidéo, manipulation robotiquePointMaze, PushT, Wall, objets déformablesDomaines RL diversifiés, hyperparamètres fixes104 tâches de contrôle continu, 4 domaines
Planification / rolloutRollout latent, planification CEMPlanification à partir d'objectifs en imagesPlanification CEMPolitique issue de rollouts imaginésPlanification MPC
Checkpoints publicsCheckpoints de recherche par domaine sur HFOui, de 300M à 1B (V-JEPA 2)PointMaze, PushT, WallNon répertorié dans le dépôt300+ checkpoints, jusqu'à 317M
LicenceApache-2.0MIT (certains fichiers Apache-2.0)MITMITMIT

Sources : le README GitHub de chaque projet, lié dans la ligne d'en-tête. Le statut du checkpoint de JEPA-Anything provient de sa carte Hugging Face. Vérifié le 5 octobre 2026.

Points clés à retenir

  • OPF décompose 1 cible JEPA en K facteurs orthogonaux avec des prédicteurs dédiés.
  • Il a surpassé des baselines JEPA équivalentes sur les 10 tâches de dynamique.
  • L'erreur d'intervention simple sur Interventional Pong a chuté de 34,83 %.
  • Les gains de planification dépendent de l'environnement ; Hopper favorisait le JEPA standard.
  • Le code principal est sous Apache-2.0 ; les checkpoints de recherche sont sur Hugging Face.


Découvrez le Paper, GitHub Repo et Model Checkpoints. Tout le crédit revient au chercheur de ce projet. N'hésitez pas également à nous suivre sur Twitter et n'oubliez pas de rejoindre notre SubReddit ML de plus de 150k et de vous abonner à notre Newsletter. Attendez ! êtes-vous sur telegram ? vous pouvez désormais nous rejoindre sur telegram également.

Besoin de vous associer à nous pour promouvoir votre dépôt GitHub OU votre page Hugging Face OU un lancement de produit OU un webinaire, etc. ? Contactez-nous

L'article Au-delà des modèles monde spécifiques à un domaine : JEPA-Anything utilise 1 recette pour 7 domaines est apparu en premier sur MarkTechPost.

Source originale

MarkTechPost

À propos du contenu

La publication originale et les droits appartiennent à la source.

Traduction automatique · Consultez l’original