资讯动态

【学习笔记】训练时动作条件化:一种更高效的机器人实时控制方案

发布时间:2026/10/2 15:06:36 来源:尧图企业网站定制
大型视觉-语言-动作模型VLA让机器人拥有了“大脑”但它们庞大的体积导致推理延迟这成了机器人实现流畅、实时动作的最大掣肘。Real-Time Chunking (RTC) 提出了一种异步预测与“填补”的巧思但推理时的修补计算却引入了新的开销。本文解读的这篇论文提出了一种极其优雅的解决方案将推理延迟的模拟过程前置到训练阶段无需改变模型架构仅用几行代码的改动便实现了更高效、更鲁棒的实时控制。1. 背景为什么机器人不能像聊天机器人那样“卡顿”在数字世界中ChatGPT 思考 2 秒钟再回复一句话用户可能毫无察觉。但在物理世界中一个正在组装盒子的机械臂如果每执行一步都要“停下来想一想”哪怕只是 100 毫秒就会导致动作僵硬、轨迹不顺甚至任务失败。这就是具身智能与非具身智能的本质区别。为了让越来越大的VLA 模型如 π0.6、RT-2能够以 50Hz 甚至更高的频率控制机器人业界提出了Action Chunking动作分块策略模型一次预测未来 N 步的动作序列称为一个 Action Chunk机器人一边执行这些动作一边去计算下一个 Chunk。但这里有个时间差问题如果执行到一半下一个 Chunk 还没算完怎么办新旧 Chunk 之间的衔接如何才能不“抽搐”2. 现有方案的困局RTC 的巧思与“隐形成本”Real-Time Chunking (RTC)是解决上述问题的 SOTA 方法之一。它的核心机制如图 1 所示异步执行机器人执行上一个 Chunk 的最后d步时模型开始推理下一个 Chunk。动作填补 (Inpainting)为了让新旧 Chunk 无缝衔接新生成的 Chunk 必须以前面重叠部分的动作作为条件Prefix Conditioning。RTC 的痛点在于其实现方式它使用了伪逆引导 (Pseudoinverse Guidance)。这是一种推理时技术能在不重新训练模型的情况下强行让生成的动作符合给定的前缀。但代价是——在每一个去噪步中都要计算向量-雅可比积VJP这需要额外的反向传播计算。结论为了解决延迟问题而生的 RTC其解决方案本身又引入了不可忽视的计算延迟Overhead这让它的实时性打了折扣。3. 核心创新将“填补”压力从推理端转移至训练端这篇论文《Training-Time Action Conditioning for Efficient Real-Time Chunking》的核心洞察非常直接既然我们在推理时无论如何都要面对延迟d为什么不直接在训练时就教会模型如何处理这个延迟呢作者提出的训练时动作条件化 (Training-Time Action Conditioning)抛弃了推理时的伪逆引导通过修改训练数据的构造方式让模型天然学会“给定前d步补全剩余H-d步”的能力。3.1 具体实现三要素仅需几行代码改动论文指出对于标准的 Diffusion Transformer 架构如 π0.6 的动作专家实现该方案只需做三个微小改动详见 Algorithm 1分化的时间步嵌入在扩散模型或流匹配模型中Time Stepτ通常对所有 Token 是统一的。在训练时对于前缀部分已知动作强制将τ设为1.0代表无噪声的真值对于后缀部分待预测动作保持正常的采样噪声τ。架构影响仅需让 AdaLN 的 Scale/Shift 参数支持按 Token 变化参数量零增长。真值注入对于前缀部分的输入 Token不添加噪声直接喂入 Ground-Truth 动作。掩码损失函数计算 Loss 时只计算后缀部分的预测误差忽略前缀部分因为前缀已经是真值了不需要模型去预测。3.2 为什么这比推理时填补更好零推理开销推理时只需要做标准的前向传播Forward Pass不需要 VJP 计算。论文数据显示端到端延迟从 135ms 降低到了 108ms。更强的鲁棒性在模拟器中当推理延迟d较大时例如d 2训练时 RTC 的表现显著优于推理时 RTC。这是因为随着前缀变长推理时引导算法的线性近似误差会累积而训练时模型是通过真实数据分布学会的填补不存在近似误差。4. 实验数据解读又快又稳模拟实验Kinetix Benchmark下图展示了不同推理延迟下的成功率对比低延迟场景 (d0,1)两者表现接近训练时 RTC 略低一点点因为训练时部分算力用于学习大延迟填补。高延迟场景 (d2)训练时 RTC 拉开明显差距成功率下降曲线更为平缓证明其对网络波动和计算高峰的容忍度更高。真实世界实验做咖啡 折纸盒团队在真实的机械臂上使用π0.6模型进行了微调测试任务包括制作浓缩咖啡和组装纸盒——这都是需要极高精度和连续性的长程任务。成功率训练时 RTC 与推理时 RTC 持平。速度训练时 RTC 任务执行时间显著短于同步推理基线且由于单次推理耗时更短整体运动更加流畅。5. 硬核解析代码层面的魔法Algorithm 1 解读论文最精华的部分其实藏在 Page 6 的伪代码中。我们逐段拆解训练损失的计算逻辑# 核心改动点 1: 生成差异化时间步# time 原本是 shape (b,) 的向量现在变成 (b, action_horizon)prefix_maskjnp.arange(H)[None,:]delay[:,None]timejnp.where(prefix_mask,1.0,time[:,None])# 核心改动点 2: 噪声只加在后缀上x_ttime*action_chunk(1-time)*noise# 解读当 time1.0 时x_t action_chunk (真值)# 当 time1.0 时x_t 混合了噪声的待预测值# 核心改动点 3: 掩码损失postfix_maskjnp.logical_not(prefix_mask)lossloss*postfix_mask# 前缀部分不参与梯度回传推理时的对应逻辑在生成循环的每一步强制将输入 Tensor 的前d个位置替换为action_prefix然后让模型做一次标准去噪。这完全复用了标准扩散采样循环无需任何额外梯度计算。6. 局限性与展望尽管该方法优势明显作者也坦诚了其局限性灵活性丧失无法像推理时 RTC 那样使用Soft Masking即对重叠部分赋予指数衰减权重而不是硬切一刀。延迟分布依赖训练时采样的延迟分布必须覆盖实际部署时的延迟范围。如果实际运行时网络突然变得极差延迟远超训练时设定的最大值模型表现会下降。未来方向探索一种既能享受训练时效率红利又能保留推理时灵活性的混合架构。7. 总结机器人控制中“少即是多”的哲学这篇论文再次证明了一个工程学真理最好的优化往往不是增加复杂的模块而是改变问题定义的方式。通过将“推理时填补”转化为“训练时条件生成”作者用极小的代码修改代价甚至不需要改模型结构换取了可观的推理加速和鲁棒性提升。对于正在从事 VLA 模型部署、人形机器人实时控制的工程师来说Training-Time Action Conditioning无疑是目前最值得尝试的Drop-in Replacement方案。参考文献:Black, K., Ren, A. Z., Equi, M., Levine, S. (2025).Training-Time Action Conditioning for Efficient Real-Time Chunking. Physical Intelligence.Black, K., et al. (2025).Real-Time Execution of Action Chunking Flow Policies.

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价 →
↑