回顾先看看他们各自的网络结构pi0pi0.5pi0.6这三个模型代表了机器人基础模型VLAVision-Language-Action的演进路线核心区别在于训练数据、模型架构和泛化能力。第一阶段pi 0在网络结构上是一个VLA典型结构由视觉编码器siglip)和LLMpaligemma), 最后通过一个动作头Action Head)输出控制指令训练数据主要基于静态数据集如 Open X-Embodiment即预先录好的机器人操作视频和对应的动作标签。训练方式纯粹的 SFT (监督微调)。它看人类怎么做它就怎么学。局限性泛化能力有限由于数据是静态的模型难以应对未见过的物体、场景或任务变体 本质上是离线模仿学习。缺乏自我纠错无法从自身的失败中学习执行过程中一旦出错很难自行修正特别是遇到采集数据没有出现过的错误。改进动机需要让模型具备更强的适应性和鲁棒性能够处理真实世界中动态、多变的环境。就像是死记硬背的“好学生”2. Pi0.5 引入反馈与初步修正网络结构上和pi0相似不过有两个关键改进点:一是时间步的注入方式与Pi0使用MLP将时间嵌入和动作token拼接后混合不同的是 pi0.5使用adaRMSNorm(自适应RMS归一化)将时间步信息注入到Action Expert的每一层二是在状态输入方式:Pi0的状态输入在后缀作为连续点token, 这是为了将状态和动作放在一起而Pi0.5则是作为前缀特别的是需要进行离散化后作为语言token,目的是未来状态和语义一起处理使得语义更统一。引入了自监督学习和数据增强策略在数据上对任务进行划分像subtask使用仿真数据, 图像上引入bounding box图像增强等。训练方式动作专家的网络的权重不转递到vlm. 采用KI知识隔离Knowledge insulating vision-language-action models: Train fast, run fast, generalize better停止梯度来避免流匹配动作专家影响模型的VLM还会使用FAST tokenizer,预测动作片段a t : t H a_{t:tH}at:tH的分词表示。效果在物体识别和基础操作上有所提升但动作的精细度和成功率仍有瓶颈。改进动机Pi0 的静态数据训练方式导致模型“死记硬背”Pi0.5 试图通过数据多样性和自监督预训练来提升模型的表征能力但尚未解决“从经验中学习”的根本问题简而言之无法超越人类。3. Pi*0.6核心突破从经验中学习Learning from Experience即引入了强化学习RL和在线数据收集。具体改进在线交互模型在真实环境中执行任务收集成功和失败的轨迹数据。网络结构 这里只说主策略网络首先是VLA使用了Gemma(4B)模型使得模型在语言理解图像理解生成跨模态对齐方面有了更强的能力另外动作专家的参数量增加到860M这些改进使得在VLA模型面对复杂语言指令长序列任务上变得更稳健。在prompt设计上,除了任务指令 / 子任务指令输入外还引入了元数据metadata本质上是任务结构化的文本如房间类型位置物理先验as well as additional language inputs s providing metadata that further modulates how the task is performed)奖励驱动通过一个奖励模型Reward Model对动作结果进行评分利用强化学习如 PPO优化策略。失败数据利用关键创新——不仅从成功中学习还从失败中学习。模型会分析失败原因如抓取位置偏差、力度不足并调整策略。效果泛化能力大幅提升能处理更复杂的任务如叠衣服、开抽屉且对物体位置、光照变化不敏感。自我纠错在执行过程中如果第一次尝试失败模型会尝试调整姿态或策略而不是直接放弃。改进动机Pi0.5 虽然数据多了但模型仍然是被动的“模仿者”。Pi0.6 的核心理念是真正的智能来自于与环境的主动交互和试错学习。通过让模型“动手做”并“从结果中反思”才能突破模仿学习的上限。为何要做出这些改进从“看”到“做”Pi0 只是学会了“看视频模仿”Pi0.5 学会了“更好地看”而 Pi0.6 学会了“边做边学”。这是从感知智能到具身智能的关键一步。解决数据瓶颈真实世界的机器人数据昂贵且难以获取。Pi0.5 用仿真数据缓解了数据量问题Pi0.6 则通过在线交互自动生成高质量数据打破了数据依赖。迈向通用机器人只有具备从经验中持续学习的能力机器人才能像人类一样适应各种新任务。Pi0.6 的 RL 框架为未来实现“通用机器人大脑”奠定了基础。总结对比特性Pi0Pi0.5Pi0.6训练范式静态模仿学习静态 自监督在线强化学习数据来源预录数据集预录 仿真数据预录 仿真 真实交互失败学习无无有核心创新泛化能力弱中等强自我纠错无无有适用场景固定环境、固定任务轻度变化环境复杂、动态、开放环境2 π∗0.6对于每个任务作者部署模型以收集自主执行的轨迹同时获取在线的人类纠正数据。随后作者在这些在线数据上对价值函数进行微调。基于更新后的优势估计进一步微调VLA则能够反过来改进策略行为。2.1 RECAP: RL with Experience and Corrections via Advantage-conditioned Policies用“真实经验 人类纠正 advantage 条件化策略”来训练一个可以不断改进的 VLA。这套方法的结构可以拆成四步先有一个预训练 VLA 底座在真实任务里部署它采集 autonomous rollouts 和 human corrections训练一个 value function估计每个状态/动作到底有多“接近成功”把这个优势信息再喂回 VLA让策略朝“更可能成功”的动作分布靠拢这四步看起来像 offline RL但真正难的地方是它要兼容机器人领域里非常异构的数据来源。论文里明确利用了三类数据demonstration dataon-policy collected autonomous dataexpert teleoperated intervention data也就是说它不是把人类示范和自主尝试割裂开而是把它们放进同一个改进循环里。这正是它比“纯行为克隆”和“纯在线 RL”更有现实意义的地方。蓝色方框和pi0.6相同绿色方框表示优势指示器把优势函数的输出转化为离散的文本格式加入到VLA的prefix 输入中红色方框的价值函数网络与VLA主干网络一致不过使用更小的gemma backbone.为什么要引入 value function而不是直接 PPO 到底论文其实已经给了一个很清晰的方向对大规模 VLA 来说直接做传统 policy gradient 并不一定是最合适的。原因至少有三层连续动作大模型的 policy gradient 很难稳定机器人 VLA 的动作不是简单离散 token而是连续控制量多步 horizonflow matching / diffusion 风格的动作建模在这种情况下直接套 PPO、REINFORCE 之类方法训练稳定性和计算效率都容易出问题。真实世界在线 RL 数据非常贵每一条机器人 rollout 都不是廉价仿真数据。如果算法要求非常强的 on-policy 性质那数据利用率会很差。而RECAP的设计更接近尽可能复用已有数据用 value function 来重估行为质量再通过 advantage-conditioned extraction 把改进信号蒸馏回策略advantage conditioning 更适合和 VLA 现有训练方式兼容没有强行将VLA作为一个RL actor 去优化而是算出动作相对于策略是好是坏再去打标签以文本方式输入给策略这像是利用RL带来的偏好方向去引导策略优化同时保持训练的稳定2.2 HIL在对任务进行SFT微调后会得到初始策略π_l^0这份策略用于开始收集新一轮的数据Autonomous Rollouts(自主执行机器人遵循当前策略独立完成整个episode系统完整记录动作、观测和奖励。这部分数据反映当前策略的真实失败模式。2Expert-Monitored Rollouts(人工纠正当模型出现重大错误或探索困难时人类专家可实时介入纠正2.3 Advantage Indicator(优势指示器1.即时奖励对于每个标签用于指示该episode是否成功且从其每个episode的成功标签中获取奖励。T对应于episode的最后一步C f a i l C_{fail}Cfail是一个较大的常数失败的回合价值较低。核心在于训练价值函数成功预测成功episode中“直到成功还剩的步数的负数”不过会把预测值归一化到 (−1,0)区间因为不同任务完成的时间不一样。但是这么设计就是最好吗?2.轨迹从 t 开始的累积奖励计算:价值函数V^π_ref的预测离散化为 B201 个 bins记作R t B R_t^BRtB然后在当前数据集 D 上最小化交叉熵 H 来训练问题来了为什么使用201bin去表示原因有以下几点架构的统一value function 本质上是VLM模型VL都是离散的token价值离散为bin后就是词表中的普通token不需要架构的改动训练目标统一离散bin的loss是交叉熵和VLM主干道next-token prediction 是同一个loss家族可以加权联合训练梯度的尺度统一对噪声鲁棒本身对于价值的估计就存在着噪声分类损失对个别标签错误宽容度高那么为什么是201个呢这是分辨率和词表开销的 trade-off太少比如 2 个 bin 只分好坏价值函数的分辨率不够无法区分马上要成功了和刚开始advantage 排序退化RL 加权失去区分度。太多比如 10000 个词表膨胀、每个 bin 的训练样本变稀疏token embedding 学不充分而且价值判断本质是序数信息这个状态比那个好不是精密测量——精度收益快速递减。201 的量级把评分区间离散到约 0.5% 的分辨率比如 [-1, 1] 分 200 段足以支撑 advantage 排序同时 201 个 token 对词表的开销可以忽略对比 VLM 几万的基础词表。类比LLM 处理数字时也常用类似量级的 digit/bin 离散化。“离散化会不会损失精度影响控制”“不会影响控制精度因为价值信号只负责’引导方向’不直接输出动作。动作的连续精度由 Action Expert 的 Flow Matching 头保证——那是专门的连续动作生成模块。bin 离散化的是价值评分它只需要序数分辨率哪个状态更好201 个 bin 的分辨率绰绰有余。这本质是一个分层设计语义层用离散 token 交互动作层用连续向量场生成。”优势函数的计算动作的 advantage 可按 n 步估计定义为其中o t N \mathbf{o}_{tN}otN是在同一路径上向前N 步采样得到的观测优势指示器的计算人类干预下的优势指示器的计算I_t True (e.g. positive) if human corrections最终优势指示器True/False的结果以文本的形式(e.g. “Advantage: positive/negative”)输入给VLA prefix为什么因为对于一个大模型而言prefix 里加入一个结构清楚的语言标签通常比硬加一个浮点数更自然也更稳定另一方面则是因为真实世界的价值估计存在误差进而容易引入噪声到策略中最后也是最重要的更容易和原有多行为克隆目标拼接。2.4 损失函数损失函数由两部分组成1. 分布式价值函数损失这是数据集D \mathcal{D}D所代表的行为策略π ref \pi_{\text{ref}}πref的价值函数的蒙特卡洛估计器。训练目标是把模型预测的回报分布和轨迹上观测到的离散化经验回报对齐, 最小化交叉熵损失。而分布式价值函数的信息量更丰富更稳定这使得我们能够从学得的价值分布中提取连续价值函数怎么做呢求期望。其中v ( b ) v(b)v(b)表示第 b 个区间对应的价值。数据集D对应人工示范数据价值函数学习任务在给定条件下单期望回报后续加入了当前策略经验数据,进而计算 advantage2. 基于优势条件的策略提取损失简单来说就是用我们上一步计算得到的价值函数训练出改进后的策略第一项-log π θ ( a t ∣ o t , ℓ ) \log \pi_{\theta}\left(\mathbf{a}_{t} \mid \mathbf{o}_{t}, \ell\right)logπθ(at∣ot,ℓ)是标准的行为克隆BC, 在只看当前画面和语言指令l的情况下模型预测动作a_t的概率。第二项α log π θ ( a t ∣ I t , o t , ℓ ) \alpha \log \pi_{\theta}\left(\mathbf{a}_{t} \mid I_{t}, \mathbf{o}_{t}, \ell\right)αlogπθ(at∣It,ot,ℓ)是优势条件项在已知画面o_t、指令l 和优势标签I_t的情况下预测动作a_t的概率,最小化以下负对数似然由于真实的连续数据分布极其复杂深度学习模型很难直接给出一个解析表达式来计算它在某一点的精确概率密度Precise probability density。因此连续动作的对数似然无法精确计算。而在概率生成模型的理论中扩散模型Diffusion的训练目标通常是去噪分数匹配可以被严格推导为数据真实分布的 变分下界VLB, Variational Lower Bound 或证据下界ELBO。这意味着最小化 Diffusion 损失≈ \approx≈最大化对数似然的下界。你虽然求不出精确的 100 分但你能求出一个保底的 80 分你只要努力把这个 80 分的下界往上提真实的得分也会跟着提高。a t : t H η , ω η a t : t H ( 1 − η ) ω a _ { t : t H } ^ { \eta , \omega } \eta a _ { t : t H } ( 1 - \eta ) \omegaat:tHη,ωηat:tH(1−η)ω是加噪后的动作η ∈ [ 0 , 1 ] η∈[0,1]η∈[0,1]是 flow-matching 的时间索引f θ f_{\theta}fθ表示diffusion/expert在连续域的输出 α_η是损失加权项可以设置为与噪声相关的权重将其分解为离散的对数似然和连续的动作流匹配项表达为公式使用替代损失来进行训练。2.5 算法流程图采集数据后根据公式1训练价值函数有了价值函数V ( o t ) V(o_t)V(ot)便可以计算某个动作a_t的优势。A π ( o t , a t ) ≈ r t V π ( o t 1 ) − V π ( o t ) A ^ { \pi } \left( o _ { t } , a _ { t } \right) \approx r _ { t } V ^ { \pi } \left( o _ { t 1 } \right) - V ^ { \pi } \left( o _ { t } \right)Aπ(ot,at)≈rtVπ(ot1)−Vπ(ot)如果A 0 A0A0说明动作a t a_{t}at比平均水平好如果A 0 A0A0说明动作a t a_{t}at较差,策略目标对应于最小化以下负对数似然价值函数和策略都是从预训练的检查点π p r e \pi_{pre}πpre开始微调而不是从上一轮迭代得到的策略和价值函数开始2.6实验吞吐量不同任务上的每小时成功完成的任务数量包括洗衣简单版与多样版、制作咖啡、以及纸箱组装。误差棒表示标准误差这个指标同时衡量了成功率和执行速度。在所有场景中将 RECAP 应用于 π0.6 都带来了显著的吞吐量提升。特别是在洗衣任务多样版和咖啡制作任务中RECAP 的影响最大使得每小时成功完成的任务数量提高了一倍以上。图各任务的绝对成功率并附带标准误差。RECAP 的每一个阶段都能提升任务性能其中具有挑战性的多样化洗衣任务和浓缩咖啡制作任务的提升幅度最大成功率显著提高相当于将失败率减少了超过 2 倍。对于纸箱组装任务RECAP 使得所有子任务的成功率更加稳定且整体最高。迭代多次迭代后的吞吐量提升随着 RECAP 迭代次数的增加这两个任务的吞吐量都得到了显著提升。其中纸箱组装任务在最初阶段的吞吐量会出现一次下降但随后又获得了大幅度的提升这是因为模型在进行探索特别对于这种长序列复杂的任务recap迭代的步数会更长。多次迭代后的成功率提升。在多轮 RECAP 迭代中洗衣任务的成功率会非常快速地达到最高水平但其吞吐量仍会继续提升如左图所示而纸箱组装任务的成功率则会持续不断地提升。不同策略提取方法对比图不同策略提取方法的对比在洗衣任务中将 RECAP 应用于 π*_0.6 的方法其吞吐量显著高于 AWR 和 PPO是目前表现最好的策略提取方式。在洗衣任务中将 RECAP 应用于 π*_0.6 的方法其吞吐量显著高于 AWR 和 PPO是目前表现最好的策略提取方式。失败模式的消除作者将 RECAP 应用于一个洗衣任务的变体任务中只有一个物品但成功判定标准非常严格。在这种更苛刻的评判条件下RECAP 尤其擅长消除那些在严格标准下会被判定为失败的行为模式。ref具身智能之心https://blog.csdn.net/v_JULY_v/article/details/154989166π*0.6: 从实践中学习paper地址π∗0.6: a VLA That Learns From Experience页面地址pi.website/blog/pistar06