PhAI Labs、香港中文大学、復旦大学、スタンフォード大学、オックスフォード大学、プリンストン大学の研究者らが発表した JEPA-Anything、世界モデルを構築するためのドメイン非依存のフレームワークです。分野ごとに新しい予測モデルを設計する代わりに、1つの共有された学習レシピをまったく異なるシステムに適用します。これは、ジョイント・エンベディング予測アーキテクチャ(JEPA)を、次のような手法で拡張したものです。 直交予測因子分解法(Orthogonal Predictive Factorization、OPF)研究チームは、ビジョン、生物学、臨床経過、制御、分子動力学、物理場、気象の7つの領域にわたってこれを検証しました。
JEPA-Anythingはどんな問題を解決するのか?
「などの標準的なJEPA、例えば」 I-JEPA または V-JEPA 2「、文脈エンコーダ、EMAターゲットエンコーダ、および1つの予測器を使用します。予測器は単一のモノリシックなターゲット埋め込みを出力します。研究チームはこれを容量割り当て問題と呼んでいます。分散の大きい構造が支配的になり、弱いモードには矛盾する勾配が流れます。」
直交予測因子分解(Orthogonal Predictive Factorization)はどのように機能するのでしょうか?
OPFは潜在ターゲットの幅を分割する d へ K 幅を持つ学習された部分空間 r, それに伴い d = K × r。ほとんどの実験では K = 4。各要素には専用の予測器が割り当てられます。そして、その要素予測は射影行列のMoore-Penrose疑似逆行列を通じて再結合されます。その結果、デコーディング、プランニング、またはロールアウトに使用できる完全な潜在状態が1つ得られます。
3つの正則化項が因子を有用に保ちます:
- 直交性損失: 各射影子内の列を正規直交に保ち、異なる射影子を重ならない部分空間に置く。
- 要因活動損失: 座標ごとの標準偏差にヒンジを設け、どの因子も死滅しないようにする。
- エンコーダー分散損失: オンラインエンコーダーに対して直接的な反崩壊シグナルを送ります。
OPF損失は各ドメインの元の訓練損失にそのまま加算されます。ドメインアダプターがトークン化とエンコーダーを担当し、 コアライブラリ は共有コアを次として公開します。 OrthogonalFactorProjection.
安定した合成には直交性が重要です。 CITRIS Interventional Pongでは、容量を一致させた制約なしマルチヘッドモデルの条件数は438.52でした。直交版は1.00005に達し、因子間のオーバーラップはほぼゼロでした。
この研究はどのような結果を報告していますか?
グループI、終端読み出し: 単一細胞データにおいて、ゼロショットPBMCクラスタリング(AvgBIO)は0.7194に対して0.7752に上昇しました。 Cell-JEPAの0.7194を上回りました。Norman摂動のPearson相関は0.787から0.814に上昇しました。UK Biobankデータで1,000件の臨床イベントを対象とした予測では、平均PRAUCは0.718であり、条件を揃えた標準JEPAの0.711を上回りました。
グループII、潜在世界ダイナミクス: Interventional Pongにおいて、単一介入のMSEは34.83%低下しました。未見の複合介入では12.90%の改善、6ステップのフリーロールアウトでは8.58%の改善を示しました。JEPA-Anythingは、一致した10のダイナミクス課題すべてで報告されている指標を改善しました。ベンチマークには CausalWorld、DeepMind Control、 PDEBench および WeatherBench2が含まれます。 APEBench Burgersでは、6ステップのロールアウト誤差が約44.7%低下し、すべてのシードで改善しました。100ステップの分子ロールアウトでは、 TrajCast風のバックボーンを用いた100ステップの分子ロールアウトでは、水、石英、アセトアミノフェン、ベンゼンのすべてで最低のMAEとRMSDを記録しました。
計画の結果は mixed(まちまち)です。パラメータを0.3%以内で一致させた条件下で、JEPA-AnythingはWalker2dとHalfCheetahでCEMリターンを改善しました。Hopperでは標準JEPAが優位でした。
グループIII、科学的分析: 因子分析は、IL-18とCD73遮断の併用をがん介入として提案しました。湿式実験の検証では、共培養、患者由来オルガノイド、腫瘍断片、マウスにおいてこの提案が裏付けられました。また、潜在軌道モードはケプラーの法則を再現し、フィットされた傾きは理論値の−1.5に対して−1.4991となりました。
JEPA-Anythingは他のワールドモデルとどのように比較されますか?
| 特徴 | JEPA-Anything | V-JEPA 2 | DINO-WM | DreamerV3 | TD-MPC2 |
|---|---|---|---|---|---|
| 中核となるアイデア | K個の直交する予測因子によるJEPA | Video JEPA にアクション条件付き V-JEPA 2-AC を組み合わせ | 事前学習済み視覚特徴上のワールドモデル | ワールドモデルに想像上で訓練されたアクター・クリティックを追加 | デコーダなしの潜在ダイナミクスとMPC |
| ターゲット構造 | 因子分解され、疑似逆行列により再結合 | 単一の潜在ターゲット | 単一の潜在ターゲット | カテゴリカルな潜在状態 | 単一の潜在状態 |
| 示されたドメイン | 7種: 視覚、細胞、臨床、制御、分子、PDE、気象 | 動画理解、ロボット操作 | PointMaze、PushT、Wall、変形体 | 多様なRLドメイン、固定ハイパーパラメータ | 104の連続制御タスク、4ドメイン |
| 計画 / ロールアウト | 潜在ロールアウト、CEM計画 | 画像ゴールからの計画 | CEM計画 | 想像ロールアウトからのポリシー | MPC計画 |
| 公開チェックポイント | HF上のドメイン別研究チェックポイント | あり、300Mから1B (V-JEPA 2) | PointMaze、PushT、Wall | リポジトリには未記載 | 300以上のチェックポイント、最大317M |
| ライセンス | Apache-2.0 | MIT (一部ファイルは Apache-2.0) | MIT | MIT | MIT |
出典:各プロジェクトのGitHub README(ヘッダー行にリンクあり)。JEPA-Anythingのチェックポイントの状況はその Hugging Faceカードによる。2026年10月5日に確認。
要点
- OPFは1つのJEPAターゲットを K 個の直交する因子に分割し、それぞれに専用の予測器を割り当てます。
- 10種類すべてのダイナミクスタスクで、同条件のJEPAベースラインを上回りました。
- 介入Pongの単一介入誤差は34.83%減少しました。
- 計画性能の向上は環境に依存します。Hopperでは標準のJEPAが有利でした。
- コアコードはApache-2.0で、研究用チェックポイントはHugging Face上にあります。
ぜひご覧ください: 論文, GitHubリポジトリ および モデルチェックポイント。このプロジェクトの功績はすべて研究者に帰属します。また、ぜひ Twitter をフォローし、 150k+ML SubReddit に参加して ニュースレターを購読してください。お待ちください!Telegramをご利用ですか? 現在、Telegramでも参加できるようになりました。
GitHubリポジトリ、Hugging Faceページ、製品リリース、ウェビナーなどのプロモーションで当社と提携をご希望ですか? 当社にご連絡ください
この記事「 ドメイン特化型ワールドモデルを超えて:JEPA-Anything、1つのレシピで7つの分野をカバー 」は、次のサイトで最初に公開されました: MarkTechPost.