资讯动态

# 2026 具身智能 VLA/WAM 全栈学习与训练路线:从动作建模、SFT、RL 到世界模型的 RTX PRO 6000 96GB 单卡实战指南

发布时间:2026/8/25 13:56:15 来源:尧图企业网站定制
我会把这张表做成“能拿来训练”而不是只列论文名:先核对每个模型截至2026-08-23的公开代码、训练目标和数据接口,再单独给你一套RTX PRO 6000 96GB 单卡 SFT / RL 实操路线。对于没有公开RL 配方(RL Recipe)、只有推理代码或训练细节不完整的模型,我会明确标出来,避免把“论文里提到”误写成“可复现”。目前有一个重要更新:GR00T 不应该再只按 N1/N1.5 学。截至今天 NVIDIA 官方开源主线已经是GR00T N1.7 3B:视觉语言模型主干(VLM Backbone)换成 Cosmos-Reason2-2B/Qwen3-VL 架构,动作端仍是连续扩散模型(Diffusion)/流匹配(Flow Matching)路线,而且官方明确给出单卡微调时默认只训练投影层(Projector)+ 扩散动作头(Diffusion Action Head),峰值显存约35GB 以下。所以你的 96GB 单卡对 GR00T SFT 非常宽裕。可以。下面我按2026-08-23 的开源状态,把它整理成一张真正面向“自己训练”的路线图,而不是只比较论文指标。先把一个概念钉死:在 VLA 里你说的监督微调(SFT,Supervised Fine-Tuning)本质上通常就是监督行为克隆(Supervised Behavior Cloning)/模仿学习(Imitation Learning):(image/video,language,proprio/state)→actionchunk(\text{image/video},\text{language},\text{proprio/state})\rightarrow\text{action chunk}(image/video,language,proprio/state)→actionchunk而强化学习后训练(RL Post-Training)才会额外引入轨迹采样(Rollout)、奖励(Reward)、成功/失败(Success/Failure)、价值/优势(Value/Advantage)、偏好(Preference)等信号。另外,下面按RTX PRO 6000 Blackwell 96GB单卡来计算。它有 96GB GDDR7 ECC 显存,因此对现在 3B–7B 级 VLA 来说,真正的限制很多时候已经不是“模型能不能装下”,而是优化器状态(Optimizer State)、多副本轨迹采样(Multi-Copy Rollout)、仿真并行度(Simulation Parallelism)、视频数据 I/O(Video Data I/O)和训练时间。一、先看 8 个模型属于哪条技术路线技术路线模型你真正应该学习什么离散动作 Token VLA(Discrete Action Token VLA)OpenVLA动作离散化(Action Discretization)、自回归动作 Token(Autoregressive Action Token)、交叉熵损失(Cross-Entropy Loss)连续流 VLA(Continuous Flow VLA)π0、π0.5、SmolVLA、GR00T动作块(Action Chunk)、流匹配(Flow Matching)、扩散动作专家(Diffusion Action Expert)混合离散 + 连续 VLA(Hybrid Discrete + Continuous VLA)π0.5/KI、MolmoAct2推理/动作 Token(Reasoning/Action Token)+连续动作专家(Continuous Action Expert)世界动作模型 / VLA + 世界模型(WAM / VLA + World Model)Fast-WAM、Cosmos Policy动作条件未来预测(Action-Conditioned Future Prediction)、视频潜变量(Video Latent)、世界模型(World Model)、价值模型(Value Model)强化学习后训练(RL Post-Training)π0/π0.5、OpenVLA/OFT、GR00T 等 + RLinfPPO、GRPO、DSRL、优势/价值条件微调(Advantage/Value-Conditioned Fine-Tuning)这实际上也是我建议你的学习顺序:OpenVLA → SmolVLA → π0.5 → MolmoAct2 → GR00T → RLinf → Fast-WAM → Cosmos Policy二、《2026 VLA/WAM 模型架构总表》为了避免一张表横向长到不可读,我拆成“架构/损失”和“数据/RL/GPU”两张。表 1:架构、动作表示(Action Representation)、Tokenizer、Loss模型核心架构动作表示 / Tokenizer动作时域(Action Horizon)主要训练损失(Loss)最值得学的点π0VLM backbone + 独立 action expert;continuous flow-based VLA无离散动作 Tokenizer;Gaussian noise → continuous action chunkopenpi 默认可到约 50 step流匹配均方误差(Flow Matching MSE)Flow Matching VLA 最经典的完整实现π0.5π0 架构升级;VLM reasoning + continuous action expert;Knowledge Insulation低层控制:continuous flow;论文/KI 路线还用FAST 离散动作 Token(FAST Discrete Action Tokens)辅助 VLM 学 embodied knowledge常见 50-step / ~1s chunkcontinuousFM loss+ 高层 text/action token CE;KI 阻断 action expert → VLM 的部分梯度推理与运动控制解耦(Reasoning and Motor-Control Decoupling)OpenVLA 7BDINOv2 + SigLIP → projector → Llama-2 7B每个动作维度 percentile clipping 后量化成256 bins,映射到 LLM 少用 token原始版偏单步;OFT/FAST 扩展到 action chunk自回归交叉熵(Autoregressive Cross Entropy)最容易理解“动作为什么可以当语言 token”SmolVLA 450MSmolVLM2 + ~100M continuous action expert无动作 Tokenizer;normalized continuous action chunkchunk policy流匹配(Flow Matching)最小、最容易单卡彻底拆开的现代 VLAGR00T N1.7 3BCosmos-Reason2-2B/Qwen3-VL 系 VLM + diffusion Transformer action head无离散 tokenizer;continuous normalized action;支持 absolute / relative、joint / EEF 等当前配置通常最高约 16continuous diffusion /流匹配去噪(Flow-Matching Denoising)异构具身(Heterogeneous Embodiment)、模态配置(Modality Config)、工业级 VLA pipelineMolmoAct2 ~5BMolmo2/MolmoER reasoning backbone + continuous flow action expertOpenFAST 离散 Tokenizer(OpenFAST Discrete Tokenizer)+ 连续流动作专家(Continuous Flow Action Expert)两条路径典型 fine-tune chunk 10;依数据可调discrete CE + continuous FM,可配置 continuous/discrete/both当前非常典型的推理 VLA + 动作专家(Reasoning VLA + Action Expert)Fast-WAMWan2.2 video DiT backbone + action expert;训练期 world/action joint modelingcontinuous action chunk;不是 LLM tokentask-dependent视频流匹配(Video Flow Matching)+ 动作流匹配(Action Flow Matching)学会为什么 world model 可以只在训练期存在Cosmos PolicyCosmos Predict2/Predict2.5 Video2World 改造成 joint policy/world/value modelaction/state/value 全部编码进视频潜帧序列(Video Latent-Frame Sequence),无传统 action tokenizerLIBERO≈16、RoboCasa≈32、ALOHA≈50diffusion/flow denoising;同时训练 policy/world/value 条件任务策略 + 世界模型 + 价值模型统一生成模型(Unified Policy + World Model + Value Model)π0/openpi 当前公开实现明确包含 π0、π0-FAST、π0.5;其中 π0/π0.5 的运动控制(Motor Control)主线采用 continuous flow matching,而 π0.5 的知识隔离(Knowledge Insulation)路线进一步把 embodied knowledge 和连续控制解耦。当前公开 openpi 对 π0.5 的直接训练/推理重点仍是 flow-matching head。OpenVLA 则代表另一代思路:7B Llama-2 为语言骨干,结合 DINOv2+SigLIP,把连续机器人动作量化为离散 token,通过标准 next-token CE 学动作。官方后续又增加 OFT 和 FAST,目的之一就是摆脱逐 token 动作生成的速度瓶颈。SmolVLA 很适合教学,因为它把现代 continuous VLA 缩到了约 450M:SmolVLM2 backbone 加约 100M action expert,直接通过 flow matching 输出 action chunks。截至2026-08-23,GR00T 建议直接学N1.7 3B,而不是停在 N1/N1.5。N1.7 使用 Cosmos-Reason2-2B、Qwen3-VL 系视觉语言架构,再接 continuous diffusion/flow action model。MolmoAct2 更值得认真研究,因为它同时保留了OpenFAST 离散动作建模(OpenFAST Discrete Action Modeling)和连续流动作专家(Continuous Flow Action Expert),非常适合研究“reasoning token 和精细 motor control 到底该不该共享同一个输出空间”。三、数据、SFT、RL、代码、GPU 横向对比表 2:训练数据 + 开源程度 + RTX PRO 6000 96G 可行性模型Foundation / Pretrain 数据推荐 SFT 数据官方 RL 情况开源代码官方/典型 GPU 情况RTX PRO 6000 96Gπ0OXE + PI 多机器人数据;公开 base checkpoint 来源于大规模 robot mixture,官方称 base 覆盖 10k+ robot hoursLIBERO、DROID、自采 LeRobot/ALOHA 类数据openpi 当前主要是 supervised;RL 可用 RLinfPhysical-Intelligence/openpi官方:LoRA 22.5GB;full FT 70GBLoRA ✅;Full FT ✅π0.5robot demonstrations + web VLM + high-level subtask annotation + cross-embodiment/multi-environment mixtureLIBERO / DROID是当前最好入门RECAP 属后续 π0.6* RL 路线;π0.5 本身 public openpi 没有完整官方 RL pipeline;RLinf 已支持 PPO/GRPO同 openpi同 π0,full FT 官方门槛 70GB非常适合 96GOpenVLAOXE ~970k trajectoriesBridgeData V2、LIBERO、DROID/custom RLDS官方 repo 主要 SFT;RLinf、VLA-RL 等可做 RLOpenVLA GitHub官方 LoRA A100-80GB 示例 batch16 ≈72GB;full FT 通常多 GPULoRA ✅;OFT ✅;full FT 不优先SmolVLALeRobot Community 开源数据,训练规模 30k episodes自采约 50+ episodes、LIBERO、SO100/SO101暂无成熟官方 VLA PPO/GRPO recipeLeRobot / SmolVLA设计目标就是 consumer GPUFull FT 非常轻松 ✅GR00T N1.7heterogeneous robot data +20k h EgoScale human video等LIBERO、DROID、Bridge/Fractal、自己的 LeRobot v2 datasetNVIDIA 主 repo 重点是 SFT;RLinf 已纳入 GR00T 系列NVIDIA Isaac-GR00T默认只调 projector + diffusion head,官方称峰值显存35GB;full VLM/vision 建议 80GB+默认 SFT 极舒服 ✅;全参数可实验MolmoAct23.3M embodied-reasoning corpus + BimanualYAM 720h + DROID + SO100/101 等LIBERO、BimanualYAM、DROID、SO100/101暂无官方 PPO/GRPO;但公开 policy rollouts,可做 failure/reward-model/RL 数据MolmoAct2 GitHub官方单 H100 测试:full model both-mode bs32 ≈60.1GiBFull FT ✅,很推荐Fast-WAMvideo foundation model 继承 Wan2.2;论文核心实验无需额外 embodied foundation pretrainLIBERO-FastWAM、RoboTwin2.0-FastWAM本身不是 RL algorithmFast-WAM GitHub官方 LIBERO 训练典型 8 GPU,RoboTwin 达 64 GPU推理/小规模 partial FT ✅;全量复现 ❌Cosmos PolicyCosmos Predict2/2.5 pretrained Video2World foundationCosmos-LIBERO、RoboCasa、ALOHA有价值预测(Value Prediction),但原始 recipe 本质是 joint supervised/generative post-training,不等价于 PPONVIDIA Cosmos Cookbook原 recipe:ALOHA 8×H100、RoboCasa 32×H100、LIBERO 64×H100 级小数据 post-train ✅;论文规模 ❌π0/openpi 官方给出的单 GPU 显存量级很有参考意义:推理 8GB、LoRA fine-tuning 22.5GB、full fine-tuning 70GB,因此 96GB 对学习 π0/π0.5 的 SFT 已经属于非常不错的配置。OpenVLA 官方 LoRA 示例在 A100 80GB 上 batch size 16 约占 72GB,所以你的 96GB 可以很好地跑 LoRA;不过为了“学习”没有必要强行做 7B full FT,尤其Adam 优化器状态(Adam Optimizer State)会迅速把显存预算吃掉。GR00T N1.7 对你这张卡尤其友好:官方 fine-tuning 默认冻结大部分 foundation backbone,只更新 projector 和 diffusion action head,报告峰值显存约35GB 以下;如果解冻 LLM/vision,官方才建议 80GB+。MolmoAct2 则是另一个“96GB 单卡甜点位”。官方 LeRobot fine-tuning 测试里,action expert only bs32 约 21.4GiB、VLM LoRA+action expert bs32 约 41.3GiB、full model both-mode bs32 约 60.1GiB,所以你的卡甚至可以做完整的 full-vs-LoRA-vs-frozen-backbone 消融。四、RTX PRO 6000 96GB:最适合你的 SFT 学习方案如果目标是学原理 + 真正亲手训练,我建议不要先拿最大的模型狠狠干几天。你的 96GB 最有价值的地方,是可以在同一个数据集上做:FullFTvsLoRAvsFreezeVLM+trainActionExpert\text{Full FT}\quad vs\quad\text{LoRA}\quad vs\quad\text{Freeze VLM + train Action Expert}FullFTvsLoRAvsFreezeVLM+trainActionExpert这样你才会真正理解现代 VLA post-training。实验 A:SmolVLA —— 第一个完整 Full SFT数据:LIBERO-10 / 自采 LeRobot输入:Itagent,Itwrist,st,instructionI_t^{agent},I_t^{wrist},s_t,\text{instruction}Itagent​,Itwrist​,st​,instruction输出:at:t+Ha_{t:t+H}at:t+H​训练:ϵ∼N(0,I)\epsilon\sim\mathcal N(0,I)ϵ∼N(0,I)xτ=(1−τ)ϵ+τax_\tau=(1-\tau)\epsilon+\tau axτ​=(1−τ)ϵ+τa网络预测向量场(Vector Field):vθ(xτ,τ,c)v_\theta(x_\tau,\tau,c)vθ​(

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价