MarkTechPost

Jenseits domänenspezifischer Weltmodelle: JEPA-Anything nutzt 1 Rezept für 7 Bereiche

JEPA-Anything spaltet das einzelne latente Ziel eines JEPA in 4 orthogonale Faktoren auf, jeder mit seinem eigenen Prädiktor. Getestet über 7 Domänen hinweg übertraf es angepasste JEPA-Baselines bei allen 10…

Forschende von PhAI Labs, CUHK, Fudan, Stanford, Oxford und Princeton haben veröffentlicht JEPA-Anything, ein domänenagnostisches Framework zur Erstellung von Weltmodellen. Statt für jedes Fachgebiet ein neues Prädiktionsmodell zu entwerfen, wendet es ein gemeinsames Lernrezept auf sehr unterschiedliche Systeme an. Es erweitert Joint-Embedding Predictive Architectures (JEPAs) um eine Methode namens Orthogonal Predictive Factorization (OPF). Das Forschungsteam hat es über 7 Domänen hinweg getestet: Vision, Biologie, klinische Verläufe, Regelungstechnik, Molekulardynamik, physikalische Felder und Wetter.

Welches Problem löst JEPA-Anything?

Ein Standard-JEPA, wie I-JEPA oder V-JEPA 2, verwendet einen Kontext-Encoder, einen EMA-Ziel-Encoder und einen Prädiktor. Der Prädiktor gibt eine einzige monolithische Ziel-Einbettung aus. Das Forschungsteam nennt dies ein Kapazitätszuweisungsproblem: Strukturen mit hoher Varianz dominieren, und schwächere Modi erhalten widersprüchliche Gradienten.

Wie funktioniert Orthogonal Predictive Factorization?

OPF spaltet das latente Ziel der Breite d in K gelernte Unterräume der Breite rauf, mit d = K × r. Die meisten Experimente verwenden K = 4. Jeder Faktor erhält einen eigenen Prädiktor. Die Faktorprädiktionen werden dann über die Moore-Penrose-Pseudoinverse der Projektionsmatrix wieder kombiniert. Das Ergebnis ist 1 vollständiger latenter Zustand für Dekodierung, Planung oder Rollout.

Drei Regularisierer halten die Faktoren nützlich:

  • Orthogonalitätsverlust: hält Spalten innerhalb jedes Projektors orthonormal und verschiedene Projektoren in nicht überlappenden Unterräumen.
  • Faktoraktivitätsverlust: ein Hinge auf der Standardabweichung pro Koordinate, damit kein Faktor abstirbt.
  • Encoder-Varianzverlust: sendet ein direktes Anti-Kollaps-Signal an den Online-Encoder.

Die OPF-Verlustfunktion wird einfach zum ursprünglichen Trainingsverlust jeder Domäne addiert. Domänen-Adapter übernehmen Tokenisierung und Encoder; die Kernbibliothek legt den gemeinsamen Kern offen als OrthogonalFactorProjection.

Orthogonalität ist wichtig für eine stabile Synthese. Bei CITRIS Interventional Ponghatte ein kapazitäts-gleiches unbeschränktes Multi-Head-Modell eine Konditionszahl von 438.52. Die orthogonale Version erreichte 1.00005, mit nahezu null Überlappung zwischen Faktoren.

Welche Ergebnisse berichtet die Forschung?

Gruppe I, terminale Auslesung: Bei Einzelzell-Daten stieg das Zero-Shot-PBMC-Clustering (AvgBIO) auf 0.7752 gegenüber 0.7194 für Cell-JEPA. Der Norman-Perturbations-Pearson stieg von 0.787 auf 0.814. Für die Prognose über 1,000 klinische Ereignisse auf UK-Biobank-Daten lag die mittlere PRAUC bei 0.718 gegenüber 0.711 für das angepasste Standard-JEPA.

Gruppe II, latente Weltdynamik: Bei Interventional Pong sank die MSE bei Einzelinterventionen um 34.83%. Ungesehene kombinierte Interventionen verbesserten sich um 12.90%, und der freie 6-Schritt-Rollout verbesserte sich um 8.58%. JEPA-Anything verbesserte die berichteten Metriken bei allen 10 übereinstimmenden Dynamik-Aufgaben. Zu den Benchmarks gehören CausalWorld, DeepMind Control, PDEBench und WeatherBench2. Bei APEBench Burgers sank der 6-Schritt-Rollout-Fehler um etwa 44.7%, mit Verbesserungen in jedem Seed. Bei 100-Schritt-Molekül-Rollouts mit einem TrajCast-artigen Backbone erzielte es den niedrigsten MAE und RMSD bei Wasser, Quarz, Paracetamol und Benzol.

Die Planungsergebnisse sind gemischt. Bei innerhalb von 0.3% angepassten Parametern verbesserte JEPA-Anything die CEM-Rendite bei Walker2d und HalfCheetah. Hopper bevorzugte das Standard-JEPA.

Gruppe III, wissenschaftliche Analyse: Die Faktorenanalyse schlug IL-18 plus CD73-Blockade als Krebsintervention vor. Nasslabor-Tests unterstützten dies in Ko-Kulturen, patientenabgeleiteten Organoiden, Tumorfragmenten und Mäusen. Latente Orbits-Modi reproduzierten auch das Kepler'sche Gesetz mit einer angepassten Steigung von −1.4991 gegenüber den theoretischen −1.5.

Wie vergleicht sich JEPA-Anything mit anderen Weltmodellen?

MerkmalJEPA-AnythingV-JEPA 2DINO-WMDreamerV3TD-MPC2
KernideeJEPA mit K orthogonalen prädiktiven FaktorenVideo JEPA plus aktionskonditioniertes V-JEPA 2-ACWeltmodell auf vortrainierten visuellen MerkmalenWeltmodell plus Actor-Critic, trainiert in der VorstellungDekoderfreie latente Dynamik plus MPC
ZielstrukturFaktorisiert, rekombiniert über PseudoinverseEinzelnes latentes ZielEinzelnes latentes ZielKategoriale latente ZuständeEinzelner latenter Zustand
Gezeigte Domänen7: Vision, Zellen, klinisch, Regelung, Moleküle, PDEs, WetterVideoverständnis, RobotermanipulationPointMaze, PushT, Wall, deformierbare ObjekteVielfältige RL-Domänen, feste Hyperparameter104 Continuous-Control-Aufgaben, 4 Domänen
Planung / RolloutLatenter Rollout, CEM-PlanungPlanung aus BildzielenCEM-PlanungPolicy aus imaginierten RolloutsMPC-Planung
Öffentliche CheckpointsDomänenspezifische Forschungs-Checkpoints auf HFJa, 300M bis 1B (V-JEPA 2)PointMaze, PushT, WallNicht im Repository aufgeführt300+ Checkpoints, bis zu 317M
LizenzApache-2.0MIT (einige Dateien Apache-2.0)MITMITMIT

Quellen: das GitHub-README jedes Projekts, verlinkt in der Kopfzeile. Der Checkpoint-Status von JEPA-Anything stammt von dessen Hugging Face-Karte. Überprüft am 5. Oktober 2026.

Wichtigste Erkenntnisse

  • OPF zerlegt 1 JEPA-Ziel in K orthogonale Faktoren mit dedizierten Prädiktoren.
  • Es schlug vergleichbare JEPA-Baselines bei allen 10 Dynamik-Aufgaben.
  • Der Fehler bei Einzelinterventionen bei Interventional Pong sank um 34,83 %.
  • Planungsgewinne sind umgebungsabhängig; Hopper begünstigte das Standard-JEPA.
  • Der Kerncode steht unter Apache-2.0; Forschungs-Checkpoints befinden sich auf Hugging Face.


Schauen Sie sich die Paper, GitHub Repo und Model Checkpointsan. Alle Credits gehen an den Forscher dieses Projekts. Folgen Sie uns gerne auch auf Twitter und vergessen Sie nicht, unserem 150k+ML SubReddit beizutreten und unseren Newsletterzu abonnieren. Moment! Sind Sie auf Telegram? jetzt können Sie uns auch auf Telegram beitreten.

Möchten Sie mit uns zusammenarbeiten, um Ihr GitHub-Repo ODER Ihre Hugging Face-Seite ODER Ihr Produktrelease ODER ein Webinar usw. zu bewerben? Kontaktieren Sie uns

Der Beitrag Jenseits domänenspezifischer Weltmodelle: JEPA-Anything nutzt 1 Rezept für 7 Bereiche erschien zuerst auf MarkTechPost.

Originalquelle

MarkTechPost

Hinweise zum Inhalt

Originalveröffentlichung und Rechte liegen bei der Quelle.

Maschinelle Übersetzung · Original beachten