Forschende von PhAI Labs, CUHK, Fudan, Stanford, Oxford und Princeton haben veröffentlicht JEPA-Anything, ein domänenagnostisches Framework zur Erstellung von Weltmodellen. Statt für jedes Fachgebiet ein neues Prädiktionsmodell zu entwerfen, wendet es ein gemeinsames Lernrezept auf sehr unterschiedliche Systeme an. Es erweitert Joint-Embedding Predictive Architectures (JEPAs) um eine Methode namens Orthogonal Predictive Factorization (OPF). Das Forschungsteam hat es über 7 Domänen hinweg getestet: Vision, Biologie, klinische Verläufe, Regelungstechnik, Molekulardynamik, physikalische Felder und Wetter.
Welches Problem löst JEPA-Anything?
Ein Standard-JEPA, wie I-JEPA oder V-JEPA 2, verwendet einen Kontext-Encoder, einen EMA-Ziel-Encoder und einen Prädiktor. Der Prädiktor gibt eine einzige monolithische Ziel-Einbettung aus. Das Forschungsteam nennt dies ein Kapazitätszuweisungsproblem: Strukturen mit hoher Varianz dominieren, und schwächere Modi erhalten widersprüchliche Gradienten.
Wie funktioniert Orthogonal Predictive Factorization?
OPF spaltet das latente Ziel der Breite d in K gelernte Unterräume der Breite rauf, mit d = K × r. Die meisten Experimente verwenden K = 4. Jeder Faktor erhält einen eigenen Prädiktor. Die Faktorprädiktionen werden dann über die Moore-Penrose-Pseudoinverse der Projektionsmatrix wieder kombiniert. Das Ergebnis ist 1 vollständiger latenter Zustand für Dekodierung, Planung oder Rollout.
Drei Regularisierer halten die Faktoren nützlich:
- Orthogonalitätsverlust: hält Spalten innerhalb jedes Projektors orthonormal und verschiedene Projektoren in nicht überlappenden Unterräumen.
- Faktoraktivitätsverlust: ein Hinge auf der Standardabweichung pro Koordinate, damit kein Faktor abstirbt.
- Encoder-Varianzverlust: sendet ein direktes Anti-Kollaps-Signal an den Online-Encoder.
Die OPF-Verlustfunktion wird einfach zum ursprünglichen Trainingsverlust jeder Domäne addiert. Domänen-Adapter übernehmen Tokenisierung und Encoder; die Kernbibliothek legt den gemeinsamen Kern offen als OrthogonalFactorProjection.
Orthogonalität ist wichtig für eine stabile Synthese. Bei CITRIS Interventional Ponghatte ein kapazitäts-gleiches unbeschränktes Multi-Head-Modell eine Konditionszahl von 438.52. Die orthogonale Version erreichte 1.00005, mit nahezu null Überlappung zwischen Faktoren.
Welche Ergebnisse berichtet die Forschung?
Gruppe I, terminale Auslesung: Bei Einzelzell-Daten stieg das Zero-Shot-PBMC-Clustering (AvgBIO) auf 0.7752 gegenüber 0.7194 für Cell-JEPA. Der Norman-Perturbations-Pearson stieg von 0.787 auf 0.814. Für die Prognose über 1,000 klinische Ereignisse auf UK-Biobank-Daten lag die mittlere PRAUC bei 0.718 gegenüber 0.711 für das angepasste Standard-JEPA.
Gruppe II, latente Weltdynamik: Bei Interventional Pong sank die MSE bei Einzelinterventionen um 34.83%. Ungesehene kombinierte Interventionen verbesserten sich um 12.90%, und der freie 6-Schritt-Rollout verbesserte sich um 8.58%. JEPA-Anything verbesserte die berichteten Metriken bei allen 10 übereinstimmenden Dynamik-Aufgaben. Zu den Benchmarks gehören CausalWorld, DeepMind Control, PDEBench und WeatherBench2. Bei APEBench Burgers sank der 6-Schritt-Rollout-Fehler um etwa 44.7%, mit Verbesserungen in jedem Seed. Bei 100-Schritt-Molekül-Rollouts mit einem TrajCast-artigen Backbone erzielte es den niedrigsten MAE und RMSD bei Wasser, Quarz, Paracetamol und Benzol.
Die Planungsergebnisse sind gemischt. Bei innerhalb von 0.3% angepassten Parametern verbesserte JEPA-Anything die CEM-Rendite bei Walker2d und HalfCheetah. Hopper bevorzugte das Standard-JEPA.
Gruppe III, wissenschaftliche Analyse: Die Faktorenanalyse schlug IL-18 plus CD73-Blockade als Krebsintervention vor. Nasslabor-Tests unterstützten dies in Ko-Kulturen, patientenabgeleiteten Organoiden, Tumorfragmenten und Mäusen. Latente Orbits-Modi reproduzierten auch das Kepler'sche Gesetz mit einer angepassten Steigung von −1.4991 gegenüber den theoretischen −1.5.
Wie vergleicht sich JEPA-Anything mit anderen Weltmodellen?
| Merkmal | JEPA-Anything | V-JEPA 2 | DINO-WM | DreamerV3 | TD-MPC2 |
|---|---|---|---|---|---|
| Kernidee | JEPA mit K orthogonalen prädiktiven Faktoren | Video JEPA plus aktionskonditioniertes V-JEPA 2-AC | Weltmodell auf vortrainierten visuellen Merkmalen | Weltmodell plus Actor-Critic, trainiert in der Vorstellung | Dekoderfreie latente Dynamik plus MPC |
| Zielstruktur | Faktorisiert, rekombiniert über Pseudoinverse | Einzelnes latentes Ziel | Einzelnes latentes Ziel | Kategoriale latente Zustände | Einzelner latenter Zustand |
| Gezeigte Domänen | 7: Vision, Zellen, klinisch, Regelung, Moleküle, PDEs, Wetter | Videoverständnis, Robotermanipulation | PointMaze, PushT, Wall, deformierbare Objekte | Vielfältige RL-Domänen, feste Hyperparameter | 104 Continuous-Control-Aufgaben, 4 Domänen |
| Planung / Rollout | Latenter Rollout, CEM-Planung | Planung aus Bildzielen | CEM-Planung | Policy aus imaginierten Rollouts | MPC-Planung |
| Öffentliche Checkpoints | Domänenspezifische Forschungs-Checkpoints auf HF | Ja, 300M bis 1B (V-JEPA 2) | PointMaze, PushT, Wall | Nicht im Repository aufgeführt | 300+ Checkpoints, bis zu 317M |
| Lizenz | Apache-2.0 | MIT (einige Dateien Apache-2.0) | MIT | MIT | MIT |
Quellen: das GitHub-README jedes Projekts, verlinkt in der Kopfzeile. Der Checkpoint-Status von JEPA-Anything stammt von dessen Hugging Face-Karte. Überprüft am 5. Oktober 2026.
Wichtigste Erkenntnisse
- OPF zerlegt 1 JEPA-Ziel in K orthogonale Faktoren mit dedizierten Prädiktoren.
- Es schlug vergleichbare JEPA-Baselines bei allen 10 Dynamik-Aufgaben.
- Der Fehler bei Einzelinterventionen bei Interventional Pong sank um 34,83 %.
- Planungsgewinne sind umgebungsabhängig; Hopper begünstigte das Standard-JEPA.
- Der Kerncode steht unter Apache-2.0; Forschungs-Checkpoints befinden sich auf Hugging Face.
Schauen Sie sich die Paper, GitHub Repo und Model Checkpointsan. Alle Credits gehen an den Forscher dieses Projekts. Folgen Sie uns gerne auch auf Twitter und vergessen Sie nicht, unserem 150k+ML SubReddit beizutreten und unseren Newsletterzu abonnieren. Moment! Sind Sie auf Telegram? jetzt können Sie uns auch auf Telegram beitreten.
Möchten Sie mit uns zusammenarbeiten, um Ihr GitHub-Repo ODER Ihre Hugging Face-Seite ODER Ihr Produktrelease ODER ein Webinar usw. zu bewerben? Kontaktieren Sie uns
Der Beitrag Jenseits domänenspezifischer Weltmodelle: JEPA-Anything nutzt 1 Rezept für 7 Bereiche erschien zuerst auf MarkTechPost.