前言对于本文要介绍的Ψ0首先作者在大规模第一视角人类视频(约800 小时的人类视频数据)上对一个 VLM 主干进行自回归预训练以获得具有良好泛化能力的视觉-动作表征随后再在高质量的人形机器人数据(30 小时的真实世界机器人数据)上后训练一个基于流flow-based的动作专家用于学习精确的机器人关节控制第一部分 Ψ0: An Open Foundation Model TowardsUniversal Humanoid Loco-Manipulation1.1 引言与相关工作1.1.1 引言如原论文所说大规模遥操作数据对于人形机器人行走-操作任务来说在成本上极其高昂且在采集上极具挑战性值得庆幸的是人类第一视角视频提供了一种可扩展的替代方案因为这类视频在无需进行机器人远程操控的前提下就能捕获大量自然的运动模式以及丰富的行为层面的信息然而由于人类与机器人在形体结构上的巨大差异直接将人类视频中的知识迁移到仿人机器人控制上并非易事早期工作[10, 40, 3] 试图通过采用统一的人类中心状态-动作表示从人类视频中进行学习。然而由于人类与仿人机器人在本质上存在差异包括动作频率、运动动力学以及自由度的不同从这类异构数据中学习仍然具有挑战性————尽管这些方法采用了领域自适应 [10] 或将人类与机器人数据混合进行协同训练[40] 的策略但用单一的整体策略去建模两种在本质上截然不同的动作分布从根本上来说是次优的其结果是所学得的策略在控制仿人机器人执行复杂的、长时程任务时依然表现吃力因此作者研究一个根本性问题如何有效地从人类第一视角视频中提炼运动先验和世界知识从而支持人形机器人实现鲁棒的全身控制为此来自1 南加州USC Physical Superintelligence (PSI) Lab、2 NVIDIA、3 WorldEngine的研究者提出了Ψ0一种新颖的多阶段训练范式其paper地址为Ψ0: An Open Foundation Model Towards Universal Humanoid Loco-Manipulation其作者包括Songlin Wei1*, Hongyi Jing1*, Boqian Li1*, Zhenyu Zhao1*, Jiageng Mao1 , Zhenhao Ni1 , Sicheng He1 , Jie Liu1 , Xiawei Liu1 , Kaidi Kang1 , Sheng Zang1 , Weiduo Yuan1 , Marco Pavone2 , Di Huang3 , Yue Wang1†其项目地址为其github地址为其对每个阶段设定不同的学习目标首先作者在“人机统一动作空间”上预训练一个视觉语言模型VLM使其能够预测下一步动作该阶段的目标是让模型在各类丰富活动中学习任务层面的运动先验同时学习与下游机器人任务对齐的视觉表征随后利用真实人形机器人数据单独训练一个基于流模型的动作专家使其能够直接在关节空间中预测动作序列这个后训练阶段同时包含在跨任务的人形数据上的与任务无关训练以及在同域遥操作示范上的任务特定微调————且作者将动作专家实现为一个多模态扩散TransformerMM-DiT[15]该模型相比朴素的 DiT这一模型更为强大在以 VLM 提供的视觉-语言特征作为条件的前提下动作专家能够高效且并行地输出关节空间中的动作片段该阶段使得动作专家能够捕捉到与具体形体相关的动力学特性。因此只需要少量额外的真实机器人数据进行任务级的微调模型便可以快速习得具有长时间跨度的灵巧行走-操控一体化技能1.1.2 相关工作首先对于全身灵巧操作近年来类人机器人全身控制在诸多研究工作中取得了显著进展 [42, 12, 26, 27, 16, 1, 45, 36]当前的类人机器人已经能够模仿多样的人体动作如跑步、跳舞甚至空翻可尽管在运动能力方面的进展显著研究者在实现与之相当水平的类人灵巧“行走-操作”loco-manipulation方面仍面临挑战LangWBC [37] 和 LeVERB [39] 提出了基于语言条件的全身控制策略使类人机器人能够鲁棒地执行高层级、由语言指定的行为然而这些方法主要聚焦在行走与导航对灵巧操作场景关注有限与此并行AMO [25] 和 TWIST2 [43] 通过基于 VR 的遥操作实现类人机器人的全身控制为采集“行走-操作”数据提供了一种高效框架但它们更侧重于低层控制而非学习适用于长时间尺度灵巧行走-操作任务的精确策略另一方面灵巧操作 [18] 由于需要高自由度控制以及手掌与手指之间频繁的自遮挡而长期面临挑战这些因素使得基于视觉的灵巧操作极其困难Being-H0 [30] 通过收集大量手-物体交互视频并利用运动填补motion-infilling和轨迹平移translation等多种任务数据对预训练的 VLM 进行微调从人类视频中进行学习然而该方法仅限于单臂的桌面操作为了解决上述挑战作者提出构建一个用于人形整体身体灵巧操作的统一 VLA 模型其次对于人形VLA受基础模型非凡成功的启发VLA视觉语言动作模型[48, 24, 5, 44, 17, 38] 作为一种有前景的研究方向逐渐兴起被用于将人工智能带入物理世界π0系列[5, 21] 在具有挑战性的操作场景中展现出了卓越的泛化能力和鲁棒性这些场景包括双臂操作和移动操作GR00T [4] 进一步开源了首个面向人形机器人的基础模型该模型在由真实世界数据与从视频生成的合成数据构成的大规模混合数据上进行训练然而与这些工作相反作者发现相比于单纯扩展到海量、形态各异的跨载体数据规模在更高质量数据上进行训练更加关键故在本工作中作者探索了一种用于训练人形 VLA 的新范式利用大规模人类自视角视频数据并辅以少量真实机器人交互数据最后对于从第一人称视频中学习数据稀缺依然是训练 VLA 的根本瓶颈因为遥操作数据的采集效率较低且在规模化时成本高昂。相比之下人类视频数据蕴含了丰富的人与物体交互的先验知识 [33, 23, 41]因此提供了一种可扩展的替代方案最新方法如 EgoVLA [40] 和 In-n-On [10]在人类视频与机器人数据上对模型进行联合训练以预测统一的人类手腕与手部动作随后在推理阶段通过逆运动学IK将这些预测映射为机器人动作类似地H-RDT [3] 训练了一个大型 diffusiontransformerDiT在末端执行器空间中预测手臂与手部动作然而将人形机器人与非人形机器人数据混合起来端到端联合训练模型并非最优做法因为模型必须同时学习两种本质上不同的动作分布相反作者指出了一条关键但被忽视的训练路径在通过“下一步动作预测”完成预训练以学习任务语义和视觉表征之后再对动作专家进行后训练使其在关节空间中直接建模动作从而避免联合训练带来的低效1.2 Ψ0基础模型在本节中作者介绍Ψ0(Psi-Zero)一种用于类人灵巧运动操作的VLA 模型给定自然语言任务指令和当前观测作者的模型预测全身动作片段观测包含当前的头部相机图像和全身本体感觉状态包括上身关节状态、躯干横滚、俯仰、偏航以及底座高度动作被定义为其中和分别为双手和手臂关节为躯干横滚、俯仰、偏航是类人的底座高度是水平线速度而表示绕竖直方向的角速度是目标偏航转角总之作者采用基于RL 的控制策略[25] 来控制数据收集和策略评估全过程中的下肢和躯干关节1.2.1 模型架构Ψ0 是一个采用三重系统架构的基础模型遵循以往工作[21, 4]如图2 所示高层策略由两个端到端训练的组件组成一个视觉-语言骨干网络作为system-2作者使用最先进的视觉-语言基础模型Qwen3-VL-2B-Instruct[2] 作为system-2和一个多模态扩散TransformerMM-DiT动作专家作为system-1动作专家被实现为一种基于流的MM-DiT灵感来自Stable Diffu-sion 3 [15]包含大约5 亿个参数。与朴素的基于DiT 的动作头相比这种设计能够更高效地融合动作和视觉-语言特征————最终在以VLM 骨干网络的隐藏特征为条件的情况下动作专家预测未来的全身动作片段8 自由度的下肢动作被传递给system-0一个基于RL 的跟踪策略——作者采用现成的控制器AMO [25]它将这些输入映射为15 自由度的下肢关节角包括3DoF 腰部和12 自由度腿部关节再加上28 自由度的上肢关节系统输出43 自由度动作以实现全身控制1.2.2 训练方案作者提出了一种高效的训练方案用于从人类视频和真实机器人数据中学习类人机器人行走-操作loco-manipulation技能整体训练过程包含三个阶段第一阶段在大规模、高质量且多样化的人类第一视角视频上预训练 VLM 主干网络第二阶段在跨任务的真实类人机器人数据上对基于流的动作专家flow-based actionexpert进行后训练第三阶段使用少量任务域内数据对该动作专家进行微调从而实现对新任务的快速适应首先对于在第一人称人类视频上进行预训练训练类人基础模型面临显著的数据稀缺瓶颈。相比真实世界机器人数据人类第一人称视频的扩展成本要低得多因此提供了一种很有前景的替代方案因此作者利用EgoDex[20]其中包含约829 小时的人类第一人称视频记录了人手执行多种灵巧操作任务的过程且为了进一步缓解人类视频与机器人观测之间的视觉差异作者加入了Humanoid Everyday[47]其中包含31 小时的类人数据涵盖260 种多样任务从人-物体交互到对可变形和关节物体的操作且对人手和机器人末端执行器使用统一的动作表示具体而言任务空间中的48 自由度动作被定义为其中每个或为其中是一个9 自由度的手腕位姿向量由3D 位置和6D 旋转组成每个是一个3D 指尖位置因为有五个手指所以对应五个这样的统一动作表示使人类数据和机器人数据的联合训练成为可能并实现了稳定训练然而直接训练模型自回归地预测多个高维动作块在计算上非常昂贵并且会极大地减慢预训练过程作者的关键见解是预训练VLM 骨干网络的目标是学习语言指令的任务语义以及用于下游真实机器人操作的视觉表征对于这样的目标预测单个下一步动作就足够了因此作者训练VLM 仅预测一个单步动作而不是这需要少得多的计算作者使用FAST [34] 将连续动作离散化为离散的token即从 EgoDex [20] 中随机抽取的 50 万条动作数据上训练 FAST tokenizer最终训练得到的分词器实现了平均L1 重建损失为0.005并将每个动作序列从48 个token 压缩到可变token 长度然后VLM 以自回归方式训练来预测下一个动作token即最大化其次对于在跨任务真实人形数据上的后训练在训练完VLM 骨干网络后作者冻结其参数并从头开始训练动作专家以从VLM 骨干中提取的隐藏特征和均匀采样的流动时间步为条件流匹配训练目标为——定义为公式2其中是高斯噪声是加噪后的动作且作者改编了MM-DiT 架构[15] 来实现动作专家网络如图3 所示具体来说模型使用时间条件特征分别调制动作A特征和视觉-语言VL特征在每个transformer 块中动作token 和VL token 执行联合全局注意力这相比于朴素的DiT 有利于更有效地融合视觉信息最后对于在域内遥操作数据上进行微调在已经完成 VLM预训练和动作专家后训练的基础上作者的模型可以使用少量域内数据进行端到端的进一步微调从而快速学习长时域、高灵巧性的行走-操作一体化任务比如在八个真实世界任务上对模型进行评估如图 6所示每个任务都提出了不同的挑战有的需要精确的机械臂协调有的则要求长距离导航大多数任务在 30Hz 频率下的步数超过 2,000 步使其真正成为长时域任务每个任务包含三到五个子任务每个子任务对应一种技能例如抓取或推动1.2.2 实时动作分块RTC人形机器人在控制过程中需要平滑且具备快速反应的能力尤其是在执行长时域、灵巧操作任务时然而现有的VLA 通常包含数十亿个参数这不可避免地由于推理延迟而引入” 停下来思考” 的行为作者的Ψ0 模型同样包含超过25 亿个参数单次前向传播大约需要160 ms为了在存在这种延迟的情况下仍然实现平滑的策略展开作者采用了训练阶段的实时分块RTC遵循文献[7]利用RTC每次动作预测都以先前已经执行的动作块为条件并输出一个一致的未来动作块如图4 所示为了在训练过程中真实地模拟推理延迟作者随机从前个token 中移除扩散噪声并在式(2)的损失计算中将其掩蔽在这里表示以时间步为单位的最大推理延迟而H 和s 分别对应动作分块预测视界和执行视界1.2.4 面向行走-操作一体化的远程操作定制高效地学习一个长时域的步行–操作loco-manipulation任务在很大程度上取决于用于微调的、同分布in-domain数据的质量然而现有的远程操作系统主要是为运动控制设计的缺乏灵巧操作所需的稳定性和适应性要为类人机器人实现有效的步行–操作远程控制系统需要在全身表达能力、行走稳定性以及操作简洁性之间取得平衡现有的端到端全身远程操作流水线 [43, 31]通常是通过强化学习将人类全身动作直接映射为类人机器人控制信号但由于跟踪信号存在噪声以及全身运动模式不稳定这类方法往往鲁棒性有限此外这些系统依赖手持控制器并将灵巧的手部控制降维为类似夹爪的低维指令从而限制了操作的表达能力另一方面通过显式底座指令将操作与行走解耦的系统[25] 提升了下肢的稳定性但通常需要额外的控制器或多名操作员从而降低了其实用性为了解决这些局限性作者提出了一种定制的远程操作框架该框架将上半身姿态跟踪、灵巧操作和运动控制指令明确解耦同时仍支持单个操作员对整个人形机器人实施全身控制如图 5 所示远程操作员的上半身姿态通过1PICO 头显[35] 和2 手腕腕追踪器进行采集并实现了一个多目标逆运动学求解器用于计算人形机器人的手臂和躯干构型精细的手指运动通过3 MANUS 手套[32] 进行采集从而可以直接控制灵巧手的所有自由度包括平移速度和转向朝向在内的运动控制指令则由4 腰部和5 脚部追踪器直接推断并作为高层指令提供给负责下肢稳定控制的强化学习RL策略 [25]通过使用一小套可穿戴追踪器并将行走运动与原地的全身动作分离作者的框架实现了由单一操作者完成的人形机器人远程操控并在多样化任务场景中提升了行走运动的稳定性。此外2 腕部追踪器与3 MANUS 手套的组合缓解了基于视觉的 VR 追踪中常见的遮挡和视野外问题从而实现了精准且可靠的上半身与手部追踪这些设计选择共同支持在人形机器人上实现稳健且实用的全身远程操控以完成复杂的行走-操作一体化任务有意思的是PICO 4 Ultra全能版Pro包含腕部追踪器、腰部追踪器、腿部追踪器1.3 实验1.3.1 实现首先对于硬件平台在所有真实环境实验中作者使用Unitree G1 仿人平台该平台为全身控制提供了29 个自由度此外每只手臂都配备了一只具有7 自由度的 Dex3-1 灵巧手视觉观测由默认的头部安装式 Intel RealSense D435i 摄像头获取其次对于数据准备EgoDex 数据集包含大约900M 帧并为上半身人形体提供逐帧的全局变换矩阵包括7 个脊柱关节、2 条手臂以及每只手的21 个关节为提高预训练效率所有动作都被转换到当前头部相机的坐标系中并且将帧率上采样3 倍由于EgoDex 中存在极端离群值动作数值使用第1 和第99 分位数进行归一化在预训练阶段作者省略状态输入作者使用Humanoid Everyday 数据集[47] 进行与任务无关的后训练该数据集包含大约300万帧真实世界遥操作数据动作被表示为36 自由度的关节空间向量由于Humanoid Everyday 只提供上半身运动作者以类似方式填充缺失的下半身动作分量状态由当前帧中双手和手臂的28 自由度关节位置组成并在未进行归一化的情况下输入模型最后对于训练细节训练首先通过从 EgoDex 中随机采样500,000 个动作来拟合一个 FAST tokenizer开始使用该分词器在保留的动作数据上的 L1 重构损失约为 0.005相比使用原始开源 FAST tokenizer时的 0.01 有所提升FAST tokenizer将每个动作序列压缩为 20 个token从而加快后续训练的速度然后作者在预训练阶段对 Qwen3-VL-2B-Instruct [2] 进行微调使用 64 张 A100 GPU 训练10 天训练形式仅为下一步动作预测(next-action prediction)并且避免使用动作分块(action chunking)以降低计算开销学习率固定为 0.0001全局 batch size 为 1024接下来作者在 HumanoidEveryday 数据集上对包含约 5 亿参数的动作专家action expert进行后训练在该阶段VLM 主干网络被冻结学习率固定为 0.0001全局 batch size设为 2048。在单个包含 32 张 A100 GPU 的节点上该阶段大约需要 30 小时最后作者仅针对每个下游任务对动作专家进行 40,000 步微调使用余弦学习率调度器初始学习率为 0.00011.3.2 真实环境人形机器人实验第一对于任务描述如图 6 所示作者在八个真实世界的长时域操作任务上评估 Ψ0这些任务涵盖多样的日常场景任务从简单交互例如抓取与放置、推动和擦拭到更加具有挑战性的灵巧操作这些操作需要精确的手指—物体协调包括旋转水龙和拉出芯片托盘除上半身操作外这些任务还涉及全身运动如躯干旋转和下蹲以及下肢行走和转向整体而言该评测在多个真实环境中对模型在复杂长时域灵巧行走—操作loco-manipulation任务上的性能进行基准测试第二对于评估协议作者为每个任务收集80 条遥操作轨迹。所有基线模型都在相同的数据集上进行微调使用相同的图像观测以及相同的动作和状态表示每个长时程任务由三到五个子任务组成这些子任务涉及灵巧操作、双臂协同和移动其结果是策略可能会在早期子任务中失败从而导致整个rollout 失败故为了充分评估每个基线的能力评估者被允许进行干预并协助策略越过失败的子任务以便执行可以继续因此作者除了报告整体任务成功率外还报告各个子任务的成功率对于每个任务作者为每个模型执行10 次rollout 试验。仅当所有子任务都完成时才认为一次rollout 是成功的所有基线模型包括Ψ0都使用相同的客户端代码来控制机器人进行部署第三对于基线作者针对最新的大多数开源基线在真实世界环境下进行了全面的基准测试。作者投入了大量精力为每一种方法复现尽可能优异的结果π0.5在具备双机械臂和夹爪的移动机器人平台上展现出很强的泛化能力然而已发布的模型与检查点仅支持 30 维的动作空间————为适配人形机器人任务作者将动作维度扩展到 36并将动作分块大小设置为 16。相应线性层的检查点权重也进行了填充以适配扩展后的动作空间且为弥合原始训练数据与人形机器人之间的形体差异embodimentgap作者将学习率从 1e-5 提高到 1e-4并将全局 batch size 从 32 提升到 128——以获得更好的性能并确保公平对比且作者对π0.5 DROID 检查点进行微调并将其转换为 PyTorch 实现GR00T N1.6在抓取和行走-操作任务中表现出色并具有稳健的空间泛化能力作者在发布的代码中使用全部默认超参数进行微调且从GR00T N1.6 3B 预训练检查点初始化模型并在他们的遥操作数据上进行 20,000 步微调在三块NVIDIA A100 GPU 上使用全局 batch size 为 24学习率采用 1e-4 的 cosine 调度方案由于官方代码库中尚未公开 GR00T N1.6 的 RTC 推理代码作者采用标准的顺序推理方案使用与最近一次已执行动作对应的观测来作为条件预测后续动作InternVLA-M1 [11]是一个用于空间指向与机器人控制的统一框架展现出较强的空间推理能力然而它仅在空间推理和机械臂数据上进行了预训练这限制了其在类人任务上的表现作者从在 RT-1Bridge 数据集上预训练完成的检查点开始冻结VLM 主干网络并在单张 NVIDIA A100 GPU 上以批大小 64 对动作头进行 30,000 步的微调在作者的实验中InternVLA-M1 在连续动作块之间表现出动作抖动导致执行过程不稳定H-RDT是一个拥有 20 亿参数的单个大型 DiT 动作专家模型作者在一块 NVIDIA A100 GPU 上以batch size 为 32 训练该模型 10,000 个训练步。得到的策略在不需要精细运动的任务上表现出色然而它在需要在多关节上实现高精度控制的操作任务中表现不佳EgoVLA是一个视觉–语言–动作模型使用 EgoDex 和其他数据源对第一视角的人类操作视频进行预训练由于其原始代码库只预测末端执行器的手腕和手部姿态作者对动作解码器进行了适配使其输出下游任务所需的机器人关节空间指令作者在远程操作的下游任务上对预训练的 EgoVLA 进行微调其训练配置与原始论文中报告的一致训练 115 个epoch有效 batch size 为 16×8×4在作者的实验中EgoVLA 在下肢动作指令上的表现有限这很可能是因为其预训练主要侧重于上肢和手部操作技能的建模没有为协同下肢运动提供足够强的先扩散策略DP[13]在视觉特征提取方面作者采用预训练的ResNet-18 [19] 作为视觉编码器且将学习率设置为1×10−4全局批大小设置为32。训练在两块A100GPU 上进行40,000 步每个任务的训练时间约为15 小时作者观察到尽管DP 可以较好地拟合训练数据但在大多数任务上仍然失败作者推测基于UNet 的DP模型在视觉表征方面容量不足在推理过程中作者执行100 次迭代去噪步骤将随机噪声逐步转换为可执行的轨迹基于 Transformer 的动作分块Action Chunking withTransformersACT[46]为了适应类人行走与操作任务作者将动作头action head重新配置为输出 36 维动作并将 chunk 大小调整为 100同时将 Transformer模块初始化为 4 个编码器层和 1 个解码器层的配置以与公开发布的 ACT 框架 [9] 保持一致其他训练超参数如学习率、批大小和训练步数则与 DP 保持相同第四与基线方法的比较如图 7 所示作者的模型在所有基线方法之上取得了大幅领先在全部八个长时域灵巧行走-操作任务中作者的模型表现出最稳定的性能值得注意的是它在整体平均成功率上至少比第二佳基线 GR00T-N1.6 [4]最新发布的人形基础模型高出 40%这些结果突显了作者的训练范式在预训练和后训练阶段都仅使用相对少量机器人数据的前提下依然具有显著效果对此作者将这一成功归功于独特的训练配方。一个关键的见解在于在大规模的人类视频上对视觉语言模型进行预训练使其能够学习到与下游操作任务相匹配的视觉表示同时避免了对两个本质上截然不同的分布进行危险且困难的联合训练利用从预训练 VLM 中提取的语言与视觉表征作者进一步仅在联合空间中使用高质量真实机器人数据对动作专家进行后训练从而使其能够学习到用于具身控制的强先验。更为详细的结果包括各子任务的分阶段进展以及策略 rollout 视频均在补充材料中给出1.3.3 消融研究由于算力和时间有限作者在一项单一的真实世界任务上进行消融研究将玩具捡起放入盒中并将盒子抬起该任务由三个子任务组成使用右臂拾取玩具饺子并将其放入盒子使用左臂拾取玩具河马并将其放入盒子双臂一起搬运盒子该任务包含多个执行阶段要求策略既能处理单臂的抓取与放置又能完成双臂协调预训练与后训练的作用首先作者研究在他们的设定下最初在文本生成任务上预训练的 Qwen3-VL VLM 的表现。如表 I 所示在冻结预训练的 Qwen3-VL 主干网络、仅微调动作头的情况下性能最差总体成功率仅为 0.2(如下表的第2行)这个结果凸显了在人类数据上对 VLM 主干进行预训练以学习如何生成动作 token 的重要性。而在 EgoDex 上进行任务空间下一步动作预测的预训练之后模型性能有了显著提升——值得注意的是尽管 VLM主干被训练来预测的动作表征与下游动作头所使用的表征不同将其监督为预测下一步 48 自由度48-DoF动作仍然能够使模型学到对机器人任务有意义的视觉表征这些发现表明了一条有效的路径可以从大规模人类视频数据中进行学习同时避免完全自回归式 VLM 动作生成所带来的推理时延此外通过在高质量机器人数据上对动作专家进行后训练整体性能进一步得到提升MM-DiT 对比 Naive DiT作者还通过将所提出的MM-DiT 动作头与用于动作预测的朴素 DiT 进行比较来做消融实验以评估其有效性结果表明MM-DiT 始终优于该 DiT 变体这一改进可归因于 MM-DiT 的双调制设计及其联合注意力机制该机制将来自 VLM 主干的VL特征与动作A分支表示相结合总之作者的分析表明直接套用最初为文本条件图像生成而设计的朴素 DiT在用于视觉-语言VL引导的动作预测时其条约束能力较弱。关于动作专家的更多消融实验结果详见补充材料实时分块行为由于模型规模庞大VLA 通常推理速度较慢。当接收到一个用于生成动作的新查询时推理可能需要超过 200 毫秒在此期间类人机器人必须暂停以等待动作生成完成从而在全身控制任务中引入抖动和不稳定行为一个解决方案是测试阶段的实时分块test-time real-time chunking[6]。该方法在推理阶段对基于流flow-based的动作生成施加梯度引导使未来生成的动作与过去的动作保持一致从而实现关节指令的平滑执行然而作者发现模型在测试阶段无法被稳定地引导————因此作者实现了训练阶段的实时分块training-timereal-time chunking[7]作者观察到实时分块在策略执行过程中能减轻物理碰撞并在不损害性能的前提下提升策略 rollout 的吞吐量// 待更