来自 PhAI Labs、香港中文大学、复旦大学、斯坦福、牛津和普林斯顿的研究人员发布了 JEPA-Anything,一个用于构建世界模型的领域无关框架。它没有为每个领域设计新的预测模型,而是将一套共享的学习配方应用于差异极大的系统。它通过一种名为 正交预测因子分解(OPF)的方法扩展了联合嵌入预测架构(JEPA)。研究团队在 7 个领域对其进行了测试:视觉、生物学、临床轨迹、控制、分子动力学、物理场和天气。
JEPA-Anything 解决什么问题?
标准 JEPA,例如 I-JEPA 或 V-JEPA 2,使用一个上下文编码器、一个 EMA 目标编码器和一个预测器。预测器输出一个整体式的目标嵌入。研究团队将此称为容量分配问题:高方差结构占主导地位,较弱的模式收到相互冲突的梯度。
正交预测因子分解是如何工作的?
OPF 将宽度为 d 的潜在目标拆分为 K 个宽度为 r的可学习子空间,其中 d = K × r。大多数实验使用 K = 4。每个因子都有一个专属的预测器。随后,因子预测通过投影矩阵的 Moore-Penrose 伪逆重新组合。结果是 1 个完整的潜在状态,可用于解码、规划或 rollout。
三个正则化项保证因子有效:
- 正交性损失:保持每个投影器内部的列正交归一,并使不同投影器处于不重叠的子空间。
- 因子活性损失:对每个坐标的标准差施加铰链约束,防止任何因子失效。
- 编码器方差损失:向在线编码器发送直接的防崩溃信号。
OPF 损失直接加到每个领域的原始训练损失中。领域适配器负责分词和编码器; 核心库 将共享核心暴露为 OrthogonalFactorProjection.
正交性对于稳定合成至关重要。在 CITRIS Interventional Pong上,容量匹配的无约束多头模型的条件数为438.52。正交版本达到了1.00005,跨因子重叠接近零。
该研究报告了哪些结果?
第一组,终端读出:在单细胞数据上,零样本PBMC聚类(AvgBIO)上升至0.7752,而对比的为0.7194,针对 Cell-JEPA为0.7194。Norman扰动Pearson相关从0.787上升到0.814。在UK Biobank数据上对1,000个临床事件进行预测,平均PRAUC为0.718,而匹配的标准JEPA为0.711。
第二组,潜在世界动力学:在Interventional Pong上,单次干预MSE下降了34.83%。未见过的组合干预提升了12.90%,6步自由滚动提升了8.58%。JEPA-Anything在全部10个匹配的动力学任务上都改进了报告的指标。基准测试包括 CausalWorld、DeepMind Control、 PDEBench 和 WeatherBench2。在 APEBench Burgers上,6步滚动误差下降了约44.7%,且在每个种子上都有改进。对于使用a进行100步分子滚动预测的情况, TrajCast风格骨干的100步分子滚动,它在水、石英、扑热息痛和苯上取得了最低的MAE和RMSD。
规划结果好坏参半。在参数匹配在0.3%以内的条件下,JEPA-Anything在Walker2d和HalfCheetah上改进了CEM回报。Hopper则偏向标准JEPA。
第三组,科学分析:因子分析提名IL-18加CD73阻断作为癌症干预方案。湿实验室测试在共培养物、患者来源的类器官、肿瘤碎片和小鼠中支持了该方案。潜在轨道模式还恢复了开普勒定律,拟合斜率为−1.4991,而理论值为−1.5。
JEPA-Anything与其他世界模型相比如何?
| 特性 | JEPA-Anything | V-JEPA 2 | DINO-WM | DreamerV3 | TD-MPC2 |
|---|---|---|---|---|---|
| 核心思想 | JEPA,带 K 个正交预测因子 | 视频 JEPA 加上动作条件化的 V-JEPA 2-AC | 基于预训练视觉特征的世界模型 | 世界模型加上在想象中训练的 actor-critic | 无解码器的潜在动力学加 MPC |
| 目标结构 | 因子化,通过伪逆重组 | 单一潜在目标 | 单一潜在目标 | 分类潜在状态 | 单一潜在状态 |
| 所示领域 | 7:视觉、细胞、临床、控制、分子、PDE、天气 | 视频理解、机器人操作 | PointMaze、PushT、Wall、可变形物体 | 多样化 RL 领域,固定超参数 | 104 个连续控制任务,4 个领域 |
| 规划 / 推演 | 潜在推演,CEM 规划 | 从图像目标进行规划 | CEM 规划 | 由想象推演得到的策略 | MPC 规划 |
| 公开检查点 | HF 上按领域提供的研究检查点 | 是,300M 至 1B(V-JEPA 2) | PointMaze、PushT、Wall | 仓库中未列出 | 300 多个检查点,最高 317M |
| 许可证 | Apache-2.0 | MIT(部分文件为 Apache-2.0) | 麻省理工学院 | MIT | MIT |
来源:各项目的 GitHub README,已在表头行中链接。JEPA-Anything 的检查点状态来自其 Hugging Face 卡片. 已于2026年10月5日核实。
要点速览
- OPF将1个JEPA目标拆分为 K 具有专用预测器的正交因素。
- 它在全部10个动力学任务上均优于匹配的JEPA基线。
- 干预式Pong的单次干预误差下降了34.83%。
- 规划收益取决于环境;Hopper更倾向于标准JEPA。
- 核心代码采用Apache-2.0许可证;研究检查点托管在Hugging Face上。
请查看 论文, GitHub仓库 以及 模型检查点。所有功劳归于该项目的研究者。另外,欢迎在 Twitter 上关注我们,别忘了加入我们的 150k+ML SubReddit 并订阅 我们的通讯。等等!你在用Telegram吗? 现在你也可以在Telegram上加入我们了。
需要与我们合作推广您的GitHub仓库、Hugging Face页面、产品发布、网络研讨会等吗? 与我们联系
本文《 超越特定领域世界模型:JEPA-Anything 用 1 套配方覆盖 7 个领域 》首发于 MarkTechPost.