资讯动态

从 JEPA 演进到 WAM:LeWorldModel 与 Fast-WAM 的一条连续技术脉络

发布时间:2026/8/25 17:06:09 来源:尧图企业网站定制
0. 简介2026 年 3 月到 4 月世界模型方向连续出现了两组放在一起看才真正有意思的信号。第一组来自 JEPA 路线本身从 V-JEPA 2、LeJEPA、Causal-JEPA、LeWorldModel、V-JEPA 2.1 到 ThinkJEPA这条原本常被当作“抽象表征学习方法”的路线开始明显分叉成动态视觉先验、轻量潜空间 world model、dense grounding 与长时语义推理等不同分支。第二组则来自一场更直接的方法论碰撞2026 年 3 月 13 日公开的LeWorldModel与 3 月 17 日公开的Fast-WAM几乎在同一时间把“world model 的价值到底留在训练时还是推理时”这个问题摆到了台面上。如果说第一组信号回答的是“JEPA 这条线现在到底走到了哪”那么第二组信号回答的就是“当 JEPA 式 latent world model 与大视频 backbone 的 WAM 正面对上时真正的分歧在哪里”。LeWorldModel 更接近 JEPA 系的潜空间世界模型强调稳定表征学习、rollout 和 goal-conditioned planningFast-WAM 则属于机器人控制中的世界动作模型强调视频建模怎样在训练阶段塑造更强的内部表示并在部署时尽量避免昂贵的显式未来生成。把它们放在一起看会发现当前具身 world model 已经开始分成两种互补倾向一种继续把 world model 当作推理时可查询的潜空间模拟器另一种则把 world model 当作训练阶段塑造表征的机制部署时尽量退到后台。因此本文真正要回答的不只是“LeWorldModel 和 Fast-WAM 谁更强”也不是“JEPA 算不算 world model”而是三个更关键的问题JEPA 为什么重新回到具身主线它现在已经分叉成了哪些真正不同的系统角色以及 world model 的价值究竟应该更多保留在推理时还是应该在训练时被吸收到参数里。为了回答这些问题本文将从四个层次展开。第一部分先给出一个尽量清晰的世界模型分类把“动作条件世界模型”“视频世界模型”“联合世界-动作模型”放到统一框架里解释。第二部分梳理 JEPA 的演进并补上它在 2026 年前后出现的三条新分叉。第三部分再详细拆解 LeWorldModel 与 Fast-WAM 的方法、实验与实现流程。最后一部分则把两篇论文重新放回同一张图里讨论它们共同指向的研究判断世界建模最有价值的部分往往不是把未来画出来而是把物理结构学进去并在系统中放到最合适的那一层。1. 为什么世界模型重新成为机器人研究的核心议题机器人控制从来不是简单的分类任务。一个系统如果只是把视觉输入直接映射为动作它当然也可以在很多封闭场景中表现不错但它对环境的理解往往是局部、短程和脆弱的。一旦任务跨越更长时间尺度或者需要在未见过的场景里快速适应这类“直接策略”就会暴露出明显局限模型会做出合理动作但未必知道动作将如何改变环境更谈不上在内部推演不同方案的后果。这正是世界模型被重新重视的原因。所谓世界模型本质上是学习一个关于环境动态的内部表示。这个表示既可以是像素级未来视频也可以是潜空间中的状态转移既可以只建模观测如何变化也可以同时建模动作、奖励乃至目标。对机器人来说世界模型的价值至少体现在三个方面。第一它让系统能够在执行前进行内部推演而不是完全依赖在线试错。第二它能把海量无标签视频或弱标签轨迹转化为关于物理世界的先验从而缓解机器人数据昂贵的问题。第三它让控制问题从“看到什么就做什么”转变为“基于世界如何演化来决定做什么”这会直接改变系统的泛化方式。过去几年视频生成模型和视觉表征学习的快速进展使这条路再次具备现实可行性。早期世界模型经常因为建模能力太弱、长程误差积累太快、数据规模太小而无法落地但今天视频主干模型、离线轨迹数据、扩散模型、表征学习和具身基准都比早期成熟得多。这也是为什么 2025 到 2026 年间机器人世界模型论文开始集中爆发且不同路线之间的差异越来越值得被认真区分。2. 先分类世界模型不止一种LeWorldModel 与 Fast-WAM 也不在同一类里如果不先分类很容易把所有“能预测未来”的模型都混在一起最后既看不清方法差异也很难判断一篇论文真正解决了什么问题。结合近年的机器人研究和公开综述可以把当前主流世界模型大致分成三类再额外补充一个三维场景方向。2.1 动作条件世界模型这一类是最经典、也最“正统”的世界模型形式。它建模的是在当前观测和动作条件下未来状态将如何变化。形式上可以写成p ( o t 1 : t H ∣ o ≤ t , a t : t H − 1 ) p(o_{t1:tH} \mid o_{\le t}, a_{t:tH-1})p(ot1:tH​∣o≤t​,at:tH−1​)如果模型不直接预测像素而是在潜空间中建模则对应为p ( z t 1 : t H ∣ z ≤ t , a t : t H − 1 ) p(z_{t1:tH} \mid z_{\le t}, a_{t:tH-1})p(zt1:tH​∣z≤t​,at:tH−1​)这类方法最贴近控制理论和基于模型的强化学习也最强调“动作会如何改变世界”。其代表工作包括 Dreamer 系列、V-JEPA 2、RISE以及很多 latent dynamics MPC 的规划方法。它们的优点在于形式清晰、目标明确天然适合做 roll-out、规划和 model predictive control缺点则在于长期滚动误差极易累积对动作标签和高质量轨迹依赖较强而且一旦 roll-out 时长变长预测偏差就可能迅速放大。从研究传统上看LeWorldModel 基本落在这一类内部。它虽然采用 JEPA 式潜空间训练而不是像素重建但推理接口依然是典型的 latent planning先编码当前观测和目标观测再在潜空间里对动作序列做优化搜索。因此它属于动作条件世界模型中的潜空间规划分支而不是直接输出动作的控制策略。2.2 视频世界模型第二类世界模型把重点放在未来视频生成上。它们并不总是显式建模动作条件有些甚至主要依赖大规模互联网视频做预训练然后再通过少量机器人数据配合一个逆动力学模型把动作恢复出来。其基本思路可以理解为两步先预测未来视觉轨迹再从连续观测之间反推出可能的机器人动作。第 1 步p ( v t 1 : t T ∣ c o n t e x t ) p(v_{t1:tT} \mid context)p(vt1:tT​∣context)第 2 步p ( a t : t H − 1 ∣ v t : t T ) p(a_{t:tH-1} \mid v_{t:tT})p(at:tH−1​∣vt:tT​)这一类方法的关键优势在于可以最大化利用视频数据因为未来视频建模本身不要求每条数据都带动作标签。典型工作包括 DreamGen、LingBot-VA以及一些以视频生成模型为核心、后接逆动力学或动作恢复模块的系统。它们通常拥有很强的视觉先验能覆盖更丰富的现实场景也更容易从互联网视频中获益但它们同样面临一个老问题未来视频虽然可以生成但“从视频恢复可执行动作”本身并不简单而且显式视频生成的推理成本往往很高。2.3 联合世界-动作模型也就是 WAM第三类是近两年具身控制中最受关注的一条路线即 World Action ModelsWAM。这类方法不再把“预测未来视频”和“生成动作”拆成两个几乎独立的模块而是尝试在统一框架中联合建模未来视觉演化与动作序列。最粗略地说它建模的是p ( v t 1 : t T , a t : t H − 1 ∣ o t , l ) p(v_{t1:tT}, a_{t:tH-1} \mid o_t, l)p(vt1:tT​,at:tH−1​∣ot​,l)或者在一些实现中视频 token 与动作 token 在同一个扩散或去噪框架中被共同预测。DreamZero 和 Fast-WAM 都属于这一类只是它们对“推理时是否要显式解码未来视频”给出了不同程度的回答。WAM 之所以吸引人是因为它试图兼得两边的优势。一方面它保留了世界模型从视频建模中学习物理与时间结构的能力另一方面它又不像传统视频世界模型那样必须先完整生成未来视频再恢复动作而是可以把动作预测做得更直接。问题也恰恰出在这里过去很多 WAM 把“训练时的视频协同建模”和“测试时的显式未来想象”绑在一起因此很难判断模型变强到底是哪一环起了作用。Fast-WAM 的核心贡献就是第一次比较系统地把这两个因素分开讨论。2.4 三维世界模型是一个并行扩展方向除了上面三类以外还存在一个不断升温的方向即 3D 世界模型。它们不满足于在 2D 图像或视频层面表示环境而是直接学习三维场景表示、点云动态或几何一致的世界演化。这一方向与本文主线并不完全重合但值得指出的是很多 3D 世界模型实际上同样会借鉴 JEPA 的思想即尽量在抽象表征空间里预测结构变化而不是做逐点重建。PointWorld、Marble 等工作可以视为把世界建模从 2D 感知进一步推进到几何层的平行分支。3. 用一张表看清三条主线路线代表建模对象典型接口代表工作主要优势主要问题动作条件世界模型状态或潜状态转移latent rollout MPC / planningDreamer、V-JEPA 2、LeWorldModel、RISE物理因果关系清晰适合规划长时误差积累依赖动作标签视频世界模型未来视频生成视频后再恢复动作DreamGen、LingBot-VA能最大化利用无动作视频数据推理慢动作恢复有歧义联合世界-动作模型 WAM未来视频与动作联合建模统一生成或共享主干DreamZero、Fast-WAM同时吸收视频建模与动作学习收益训练与推理因素容易耦合从这张表可以看出LeWorldModel 与 Fast-WAM 在比较对象上并不对称。前者更像是在改进动作条件世界模型内部的“表征学习与稳定训练”问题后者则是在质疑 WAM 这条线中一个非常流行的设计假设。因此把两篇论文放在同一篇文章里不是因为它们是同类模型而是因为它们分别代表了当前世界模型研究中两个最关键的技术争点潜空间怎么学稳未来想象是否真的要在测试时显式发生。4. JEPA 为什么重要它不是“少生成一点”而是改变了预测发生的空间JEPA 的核心思想不是“少生成一点”而是把预测从像素空间转移到抽象表征空间。传统生成式自监督学习往往要求模型重建像素、patch 或 token也就是尽可能还原原始输入的细节。JEPA 则认为这种训练目标把过多算力浪费在和下游决策无关的细节上。模型真正需要学习的不是每个像素如何复原而是哪些抽象因素能够支配未来状态变化。因此JEPA 把学习问题改写成了“在表征空间预测表征”。给定上下文观测编码器先提取抽象特征预测器再根据当前特征去预测未来或被遮挡区域的目标特征模型损失发生在这个抽象空间里而不是回到像素空间逐点对齐。这样做有两个直接好处。第一模型会更倾向于保留语义上和动力学上重要的结构而不是被纹理、颜色和高频噪声牵着走。第二训练成本更低因为不需要昂贵的像素级解码过程。但这条路一开始也有一个几乎决定成败的问题表征坍塌。如果目标只是“让预测表征接近目标表征”那么最容易的作弊方式就是把所有输入都映射到差不多的常数向量。这样损失照样可以变小但模型再也没有区分能力。此后几乎所有 JEPA 路线的演进某种意义上都可以被理解为一边证明“在表征空间预测未来”确实是值得走的路一边不断寻找更稳定、更一般化的抗坍塌机制。下面这段极简伪代码可以帮助理解 JEPA 的本质。它并不对应某一篇具体论文的原始实现只是把思想压缩成最小可理解单元上下文编码器负责提取当前特征目标编码器负责生成监督信号预测器则在抽象空间里做对齐。defjepa_step(context_view,target_view,context_encoder,target_encoder,predictor):z_ctxcontext_encoder(context_view)withtorch.no_grad():z_tgttarget_encoder(target_view)z_predpredictor(z_ctx)return((z_pred-z_tgt)**2).mean()真正困难的部分当然不在这四行代码而在于如何让z_ctx和z_tgt既不坍塌又保留足够多的动态结构。也正因此JEPA 的历史不能只看“有哪些应用”还必须看它是如何一层层处理这个稳定性问题的。5. JEPA 的演进史从理论主张到视频规划再到端到端世界模型5.1 概念阶段从“不要重建像素”到“在抽象空间预测未来”JEPA 最早的重要意义不在于它一开始就拿下了多少 benchmark而在于它明确提出了一个与主流生成范式不同的研究纲领预测应当发生在抽象表征空间而不是发生在像素空间。这背后对应的是 LeCun 对感知与智能关系的长期判断即真正支撑规划和物理理解的不是细枝末节的重建能力而是稳定、可组合、可外推的世界表示。这一阶段的工作主要是在理论层面和结构层面提出 JEPA、层级 JEPA 等设想试图说明如果模型拥有多时间尺度、多层级的潜空间表示那么它就更可能承载长程预测与计划。虽然这些工作离现实机器人系统还有距离但它们为后面的 I-JEPA 和 V-JEPA 划定了一个很明确的方向世界模型不必先学会“生成得很像”而应先学会“理解得足够抽象”。5.2 I-JEPAJEPA 在图像上的第一次大规模落地2023 年的I-JEPA是 JEPA 真正完成工程落地的关键一步。它的核心贡献不是发明了复杂的新模块而是证明了在不依赖手工数据增强、不做像素重建的前提下模型依然可以学到高质量图像语义表征。训练时I-JEPA 会在图像中采样上下文区域和多个目标区域上下文编码器只看可见部分目标编码器生成目标区域的抽象表征预测器则基于上下文去预测目标区域在表征空间中的表示。这一步的重要性在于它把 JEPA 从“一个听起来很有道理的思想”变成了“在大规模图像预训练上可以工作的路线”。I-JEPA 还展示了一个后续影响很大的判断如果掩码区域足够大、上下文与目标不重叠那么模型会被迫学习全局语义而不是依赖局部像素插值来作弊。也就是说JEPA 不只是把损失挪到了潜空间它同时把“预测什么”这件事设计成了一个必须理解结构才能完成的任务。5.3 V-JEPAJEPA 进入视频世界模型意味开始显现到 2024 年的V-JEPAJEPA 的重点已经从图像表征学习推进到时空动态学习。视频相比静态图像真正难的地方在于不仅信息量更大而且未来存在时间因果与运动不确定性。传统像素重建式视频模型虽然也能学习时空结构但代价高昂而且很容易把容量耗在视觉细节上。V-JEPA 的贡献是证明视频表征预测本身就可以成为独立且有效的自监督目标。V-JEPA 在训练时大量掩蔽视频中的时空块让模型只根据少量上下文去预测目标块的表征。为了防止模型通过相邻帧做简单插值掩码会穿透整个时间维度从而迫使模型学习更真实的动态结构。这一步非常关键因为从这里开始JEPA 已经不再只是“一个高效的视觉预训练方法”而是逐渐具备了世界模型的味道。模型虽然不显式生成未来视频但它必须在内部形成对世界动态的抽象理解才能把未来的表征预测对。5.4 V-JEPA 2从表征学习走向动作条件规划真正让 JEPA 进入机器人语境的里程碑是V-JEPA 2。这篇工作把 JEPA 不只是当作一个视频理解 backbone而是明确朝着“理解、预测与规划”三合一的方向推进。它不再只关心“未来表征能不能预测对”而是进一步把动作条件和目标导向的规划问题纳入框架展示出一定程度的零样本机器人规划能力。从研究意义上说V-JEPA 2 做了两件事。第一它让 JEPA 和“动作条件世界模型”真正接轨不再只是自监督表征学习。第二它证明了潜空间世界模型不一定需要回到像素空间才能为控制服务潜空间本身就可以成为规划发生的场所。LeWorldModel 后面会沿着这条路继续向前但它关注的焦点已经不是“JEPA 能不能规划”而是“JEPA 端到端从像素学出来时到底如何稳定训练”。5.5 LeWorldModelJEPA 演进中的一个分水岭LeWorldModel 之所以重要不只是因为它是一篇 2026 年的新论文而是因为它正面处理了 JEPA 路线最顽固的问题从像素端到端训练时的表征坍塌与训练不稳定。过去许多 JEPA 世界模型都需要 EMA 目标编码器、stop-gradient、复杂的多项损失、甚至外部预训练编码器来“扶着走”LeWorldModel 则尝试把这个问题重新数学化只保留“下一步特征预测”和“潜空间高斯正则”两个核心目标。这意味着 JEPA 的演进到 LeWorldModel 这里出现了一个明显的研究重心变化。早期路线主要在证明“抽象空间预测是可行的”中期路线在扩展到视频、动作与规划而 LeWorldModel 所代表的新阶段开始更强调如何用足够简单而稳定的机制把 JEPA 真正变成一个端到端世界模型基础范式。5.6 2026 年之后的三条分叉JEPA 不再只是 V-JEPA 2如果今天还把 JEPA 理解成“V-JEPA 2 那条线的延长版”已经不够了。2026 年前后的新工作更重要的变化是 JEPA 从单一视频表征路线分化成了几条系统位置不同的技术支线。第一条分叉是把 JEPA 当作具身系统里的动态视觉先验。这条线以 V-JEPA 2 为分水岭但重点已经不再只是“能不能做一个机器人 demo”而是互联网视频中学到的动态抽象能否变成 VLA、policy 或 imitation learning 的上游先验。ACT-JEPA、VLA-JEPA、JEPA-VLA、EmbodiSwap 这类工作本质上都在强调同一件事仅有 image-language 或 image-SSL 特征对具身控制来说仍然太静态系统需要某种 video predictive embedding去补上动作后果建模这块短板。换句话说JEPA 在具身里最先稳定落地的角色很可能不是“大一统 agent”而是 agent 栈前端的一层 dynamics prior。第二条分叉是把 JEPA 继续往真正可训练、可部署的 world model 结构推进。这条线上的代表不只包括 LeWorldModel还包括更偏训练理论的 LeJEPA、引入对象级 latent intervention 的 Causal-JEPA以及把双曲几何与多步视觉规划结合起来的 GeoWorld。它们共同回答的是另外一类问题如果 JEPA 不再只被看作表示学习而是要真正成为 planner 背后的世界模型那么它能否摆脱过多 heuristics、学到对象级交互、并在计算成本和复现稳定性上更接近可部署系统。LeWorldModel 在这里的重要性不只是它跑得轻而是它第一次让“端到端 JEPA world model”这件事看起来像一个能被系统工程吸收的形态。第三条分叉是把 JEPA 从“会预测”继续推向“会定位、会交互、会和高层语义推理拼接”的表征层。V-JEPA 2.1 的 dense predictive loss、deep self-supervision 和 image-video unified tokenizer解决的是 JEPA 早期一个很现实的问题如果 latent world model 只擅长全局语义却不擅长 dense、space-aware、interaction-sensitive 的表征那么它离真实操作仍然很远。ThinkJEPA 则更进一步明确把 dense physical prediction 和 VLM thinker 组合起来让 JEPA 负责高频物理动态VLM 负责长时语义与知识引导。这意味着 JEPA 正在从“一个会预测的视频 backbone”走向“能和高层 reasoning 模块形成稳定分工的底层预测层”。把这三条分叉放在一起看JEPA 的身份已经变了。它不再只是一个单点方法名而更像是一层latent predictive substrate有时位于 VLA 前端有时位于 planner 背后有时又作为 dense/3D/语义推理模块的底层预测层。也正因为这样今天再谈 JEPA已经不能只停在 I-JEPA、V-JEPA、V-JEPA 2 那条单线时间轴上。6. LeWorldModel把“稳定训练 JEPA 世界模型”这件事做成了LeWorldModel 的关键贡献是把“从原始像素稳定训练 JEPA 世界模型”这件事真正做成。LeWorldModel 的标题非常直白Stable End-to-End Joint-Embedding Predictive Architecture from Pixels。它关心的重点不是让模型规模更大而是把“从像素到潜空间、再到世界动态”的全过程做得尽量简单和稳定。论文采用的是离线、无奖励、任务无关的数据设定只使用观测序列和动作序列进行训练。模型本体由两个部分组成一个视觉编码器e n c θ enc_\thetaencθ​把每一帧图像o t o_tot​映射到潜表示z t z_tzt​一个动力学预测器p r e d ϕ pred_\phipredϕ​根据当前潜表示和动作a t a_tat​预测下一时刻的潜表示z ^ t 1 \hat{z}_{t1}z^t1​。从结构上看这其实非常朴素z t e n c θ ( o t ) z_t enc_\theta(o_t)zt​encθ​(ot​)z ^ t 1 p r e d ϕ ( z t , a t ) \hat{z}_{t1} pred_\phi(z_t, a_t)z^t1​predϕ​(zt​,at​)如果只做到这一步问题并不难真正难的是只优化下一步预测误差时模型极易把所有输入压缩到近乎恒定的表征也就是前面提到的 collapse。LeWorldModel 的关键做法是在预测损失之外加入SIGReg把潜表示约束为接近各向同性高斯分布。它不是简单做 batch normalization 意义上的白化而是把高维表征投影到大量随机方向上并在这些一维投影上做统计正则从而逼迫潜空间保留多样性和结构性。这种设计的意义在于它把过去大量启发式稳定技巧压缩成了一个更像目标函数本身组成部分的正则项。论文强调LeWorldModel 的有效超参数几乎只剩一个主要权重λ \lambdaλ而不再需要围绕多个损失项反复配平。对于研究者而言这点非常重要因为很多 JEPA 或 latent world model 论文的复现困难往往并不来自主干网络本身而恰恰来自那些为防坍塌而加上的附加机制过多、耦合太强。LeWorldModel 的训练目标可以概括为L L pred λ ⋅ S I G R e g ( Z ) L L_{\text{pred}} \lambda \cdot SIGReg(Z)LLpred​λ⋅SIGReg(Z)其中L pred L_{\text{pred}}Lpred​是下一步潜表示预测误差S I G R e g ( Z ) SIGReg(Z)SIGReg(Z)用于约束潜表示张量的分布。把这件事写成代码逻辑其实非常清楚。下面这段 PyTorch 风格代码不是官方仓库逐行复制而是根据论文训练目标整理出的最小骨架足以看清方法到底在做什么。importtorchimporttorch.nn.functionalasFdeflewm_loss(encoder,predictor,obs,actions,lambda_sigreg,sigreg_fn): obs: [B, T, C, H, W] actions: [B, T, A] zencoder(obs)# [B, T, D]z_predpredictor(z,actions)# [B, T, D]pred_lossF.mse_loss(z_pred[:,:-1],z[:,1:])reg_loss0.0fortinrange(z.shape[1]):reg_lossreg_losssigreg_fn(z[:,t,:])reg_lossreg_loss/z.shape[1]returnpred_losslambda_sigreg*reg_loss需要强调的是LeWorldModel 的推理接口并不是“直接输出动作”而是“在潜空间里做规划”。在测试时系统会先把当前观测o 1 o_1o1​和目标观测o g o_gog​分别编码为z 1 z_1z1​和z g z_gzg​再对候选动作序列进行 rollout使预测到的末端潜状态尽量接近目标潜状态。论文使用的是 CEM也就是 Cross-Entropy Method。换句话说LeWorldModel 在运行时仍然把世界模型保留在控制环里让模型辅助搜索动作而不是提前蒸馏成一个简单策略头。defplan_with_cem(encoder,predictor,obs0,goal_obs,horizon,action_dim,num_iters5,num_samples256,elite_ratio0.1):z0encoder(obs0)zgencoder(goal_obs)meantorch.zeros(horizon,action_dim,devicez0.device)stdtorch.ones(horizon,action_dim,devicez0.device)for_inrange(num_iters):samplesmeanstd*torch.randn(num_samples,horizon,action_dim,devicez0.device)costs[]foriinrange(num_samples):zz0.clone()fortinrange(horizon):zpredictor.step(z,samples[i,t])costs.append(((z-zg)**2).sum())coststorch.stack(costs)elite_nummax(1,int(num_samples*elite_ratio))elite_idxtorch.topk(-costs,kelite_num).indices elitesamples[elite_idx]meanelite.mean(dim0)stdelite.std(dim0).clamp_min(1e-4)returnmean从结果上看LeWorldModel 最醒目的不是某一个 benchmark 的单点分数而是它在低成本条件下取得的整体平衡。论文和项目页都给出了一个非常有辨识度的数字在使用约 1500 万参数模型的情况下它能在多个 2D 与 3D 控制环境中保持竞争力并将规划时间相比 DINO-WM 加速到约48 倍。这说明如果潜空间学得足够稳、表征足够紧凑那么世界模型的实用性并不一定依赖于极其庞大的基础模型。…详情请参照古月居

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价