资讯动态

EgoSteer:一种基于第一人称视角视频、实现可控灵巧操作的全栈系统

发布时间:2026/8/5 1:27:14 来源:尧图企业网站定制
26年7月来自北大、灵初智能和UPenn的论文“EgoSteer: A Full-Stack System Towards Steerable Dexterous Manipulation from Egocentric Videos”。“可操控性”Steerability是通用机器人策略的关键能力但由于缺乏大规模、语言对齐且动作精准的演示数据这一能力在灵巧手系统中长期缺失。为突破这一瓶颈提出一套全栈系统实现基于人类第一人称视角egocentric视频的灵巧手 VLA预训练并支持数据高效的真实机器人后训练。该系统集成以下组​​件EgoSmith——一个将野外场景下的第一人称视频转化为 9600 小时高质量预训练数据的流水线其吞吐量是此前 SOTA 方案的 9 倍且精度更高一套支持遥操作与人在环修正human-in-the-loop correction的统一机器人控制栈以及 EgoSteer——一个基于优化基础设施训练的、由世界模型增强的 VLA 模型。基于人类数据的预训练赋予 EgoSteer 语言引导的操作先验知识这些知识通过机器人后训练得以落地并通过 DAgger 算法进一步优化。实验表明EgoSteer 能够稳健地执行 40 多种不同任务的自由形式指令展现出故障恢复、灵巧操作及泛化能力。该预训练模型还能通过少样本学习适配few-shot adaptation适应复杂的长程任务如折叠纸盒在两种不同的机器人形态上均实现超过 75% 的成功率。如图1 所示尽管以自我为中心egocentric的数据蕴含丰富的细粒度交互信息且极具通用具身学习embodied learning的扩展潜力但它们通常表现为单目 RGB 视频存在相机抖动、频繁遮挡及缺乏标注等问题。EgoSmith图 2所示这是一个高效的自动化流水线旨在将海量原始视频转化为带有完整标注的训练样本从而实现有效学习。为实现原始数据的清洗、标注及质量控制EgoSmith 采用一个包含四个阶段的流水线。第一阶段为预过滤pre-filtering利用简单而有效的启发式规则剔除那些会干扰后续 4D 运动估计的片段例如包含运动locomotion的片段或手部误检结果。具体而言利用光流与以自我为中心视频中人体运动的强相关性通过计算 128 点网格上的平均光流来滤除包含主动位移active displacement的片段。随后基于 YOLO [44, 45] 检测的手部数量、尺度及坐标信息应用几何准则剔除存在严重遮挡或旁观者干扰的帧仅保留清晰可见的以自我为中心操作动作。第二阶段为 4D 运动估计该阶段基于最先进的 HaWoR [19] 方法重建相机外参、深度信息以及世界坐标系下的手部轨迹。鉴于 HaWoR 缺乏深度估计功能且依赖 DROID-SLAM [46] 进行追踪后者计算开销大且在头部快速运动或场景剧烈变化时易产生漂移其提出一种改进方案使其更具鲁棒性与效率。利用 DPVO [47] 实现更稳定且无需度量尺度metric-free的相机追踪与关键帧深度估计并结合 Any4D [48] 进行逐帧的度量尺度深度预测。通过对齐两者的尺度比率能够恢复更精确的度量尺度相机轨迹进而将相机坐标系下的手部动作转换为更一致的世界坐标系轨迹。得益于 DPVO 远超 DROID-SLAM 的运行速度以及对 I/O 和批处理batching的优化该流水线的吞吐量较 HaWoR 提升 9 倍从而支持大规模数据处理。第三阶段为语言标注该阶段执行多粒度语言标注这对实现自由形式指令遵循free-form instruction following至关重要。首先利用 Qwen3.5-VL-Plus [49] 筛选出缺乏有意义的“手-物”交互操作的片段剔除另外 3.5% 虽然通过启发式规则但实际缺乏主动操作的视频片段。针对剩余片段该模型生成从粗到细、包含五个层级的语言指令。这种分层标注同时提供任务级的语义对齐与动作级的时空对齐使下游模型能够学习并响应不同抽象层级的指令。第四阶段后过滤对生成的数据执行多级质量控制。首先在episode级别计算相机平移分布以丢弃异常值同时应用硬旋转阈值以丢弃头部运动过多的剧集。其次在块chunk级别将手腕姿势转换为其中间相机框架将手指关键点投影到逐帧手腕框架中并丢弃手腕和手指坐标上的空间异常值。最后在帧frame级别计算相机、手腕和手指运动的帧到帧增量用硬阈值过滤掉突然的跳跃。这种从粗到细的过滤系统地消除由动作跳跃、不准确的度量尺度或头部跟踪漂移引起的不可靠剪辑确保高语料库质量。通过 EgoSmith在 12 个原始数据集 [35、50、34、33、51、36、52、31、18、17、32、37] 中策划一个大规模的以自我为中心的预训练语料库。为了过滤掉高度重复的视频对 Egocentric-10K [32] 和 Egocentric-100K [37] 进行二次采样。对于 Ego4D [31] 和 EPIC-KITCHENS [52]将 EgoSmith 应用于它们各自的 VITRA [38] 子集。最终该管道产生一个完全注释的以自我为中心数据集包括 960K 小时、209 万集和 104B 帧。尽管 EgoSmith 提供的精选以自我为中心egocentric的数据包含丰富的操作先验知识但由于视觉、动力学及运动学自由度方面的“具身差异”embodiment gap这些数据无法直接迁移到真实机器人上因此必须通过真实机器人遥操作将这些先验知识映射到目标机器人的具体形态上。“统一机器人栈”Unified Robot Stack见图 3所示共享底层控制与动力学模块从而同时支持遥操作、策略推理以及“人在环”human-in-the-loop的纠正干预。在遥操作模式下系统利用一对 P​​siBot SynGlove-Air 手套和 Vive 追踪器捕捉操作员手腕位姿及手部关节角度这些数据分别通过基于 mink [53] 计算的逆运动学IK驱动两条机械臂并通过关节映射驱动两只 6 自由度6-DoF机械手。在策略推理阶段训练好的策略会输出相机坐标系下的手腕位姿轨迹以及手腕坐标系下的手部关键点信息。这些动作指令与遥操作模式共用相同的机械臂与机械手正/逆运动学FK/IK及控制节点从而确保了训练与推理过程中的执行动力学特性保持一致。实现“人在环”干预的主要挑战在于防止控制权交接时出现状态突变以确保过渡平滑。为此提出一种相对运动映射方案。当操作员在时间步 t 踩下脚踏板发出干预信号时系统会记录下针对每条机械臂/手索引 i ∈ {1, 2}的机器人末端执行器位姿、人手腕位姿、机器人手部关节状态以及手套状态。这种设计允许操作员仅通过模仿机器人的运动即可平滑地接管控制权。在纠正失败动作后操作员再次踩下脚踏板将控制权交还给策略从而恢复推理过程。后续训练仅使用这些干预片段的数据。该设计实现超过 85% 的交接成功率从而能够高效地收集纠正性演示数据。基于这一统一机器人架构构建一个包含 187 小时数据的机器人数据集涵盖 193 项桌面操作任务这些任务分属七大类别简单/中等/困难难度的抓取与放置PnP、非抓取式操作、重定向操作、双臂操作以及高接触性操作。数据集包含56项涵盖大多数核心操作原语的常见任务以及137项旨在促进“人-机”技能迁移与语义落地的长尾任务。研究利用Qwen3-VL-Flash [54] 生成多层级语言标注并辅以人工核查。为涵盖多样化的操作原语并建立模态对齐数据采集采用自由形式的方案环境布局杂乱且桌布、物体实例及初始配置均随机设定不预设运动轨迹。这种强调自然、类人执行方式的策略带来极高的数据多样性从而增强策略的鲁棒性与多任务泛化能力。为了从人类数据、遥操作及人工修正中有效地学习语言引导的操作任务提出 EgoSteer——一种结合世界模型world-model目标的基于流flow-based VLA模型如图 4 所示。为在建模多模态连续动作的同时确保稳健的视觉-语言理解能力EgoSteer 结合 Qwen3-VL 2B 主干网络 [54] 与基于 DiT [55] 的动作专家模块两者通过协同注意机制joint attention相互交互并利用流匹配flow-matching技术 [1] 生成动作块action chunks。为促进人机间的知识迁移在两个领域间设计统一的数据格式及状态-动作空间。一个长度为 N 的片段episodeτ 表示为 τ {l, K, (I_t, D_t, Tw2c_t, sw_t, aw_t)}其中 l 为指令K 为相机内参t 为时间步I_t 和 D_t 分别为 RGB 图像与深度图像Tw2c_t 为世界坐标系到相机坐标系的外参双手的世界坐标系状态 sw_t 和动作 aw_t 包含双手手腕的 3D 平移、6D 旋转以及 15 维指尖关键点信息。由于本模型不使用深度信息每个时间步 t 训练样本简化为 {l, K, Ic_t_t−k1:t, sc_t_t−k1:t, ac_t_t:th−1}其中 k 和 h 分别表示历史窗口长度与预测窗口长度sc_t_t−k1:t 是通过 Tw2c_t 转换至当前相机坐标系 c_t 的状态历史序列。相对动作块 ac_t_t:th−1 是在相机坐标系 c_t 下相对于 sc_t_t 计算得出的其中手腕运动表示为相对 SE(3) 变换手指运动则表示为坐标位移。此外为了避免在真实机器人推理过程中出现执行停顿在动作专家模型中采用训练阶段的实时分块RTC[24] 策略。具体而言将基于随机采样延迟 d 得到的干净动作前缀 a_pre a_t:td-1 作为真值ground truth并专门训练专家模型对后续动作序列 a ̃_suf a ̃_td:th-1 进行去噪。在部署阶段机器人会在异步 VLA 推理期间执行预留的前缀 a_pre并无缝过渡到新的动作块 a_suf从而避免执行间隙。将模型记为 pi并利用条件流匹配CFM[56] 对其进行训练具体做法是在给定上下文 C_t {l, K, I_t-k1:t, s_t-k1:t, a_pre} 的条件下回归目标动作后缀 a_suf 的线性速度场其中目标函数 L_CFM(π)。为了扩大有效批次大小并改善损失梯度针对每个样本随机采样四个 eta 值。尽管 VLA 在视觉-语言理解方面表现出色但缺乏对未来的想象能力限制其动作生成的准确性 [16]。为解决这一问题引入一个世界模型专家world-model expert来预测由动作引发的未来 DINOv3 特征 [21]。该专家以真实动作序列 a_{t:th-1}、相对相机运动 Delta T 以及长度为 L_z 的可学习查询tokenz_0:L_z-1 作为输入对自身及主干网络backbone进行联合注意计算。z 经上采样后的输出通过回归损失regression loss与未来帧 I_th-1 的 DINOv3 特征进行监督这种方式相比生成式损失提供更直接且稳定的监督信号。对于配备额外胸部相机的机器人配置主干网络接收两个相机的历史图像及内参作为输入专家则接收两者的相对运动信息并通过向 z 添加不同的相机嵌入camera embeddings来回归两组未来的 DINOv3 特征。为了将优化重点集中在主干网络的表征上该模块仅包含四个 Transformer 层并以固定间隔对主干网络层进行注意计算从而引导梯度主要作用于主干网络。关键在于该专家在推理阶段会被移除从而避免额外的计算开销。可控多任务操作与泛化能力测试的设置。 EgoSteer 首先在分辨率为 384×384 的 9600 小时第一人称视角egocentric数据集上进行预训练随后在分辨率为 640×480、利用头部和胸部摄像头采集的 187 小时真实机器人数据集上进行后训练。接着进行三轮 DAgger 迭代涵盖 56 个任务并收集 3700 条轨迹从而获得 8.3 小时的修正数据以优化策略。最后该策略在 32 个已见任务、4 个组合泛化任务和 4 个未见任务上进行评估。组合任务将已见的基本动作单元primitives重新组合成新序列而未见任务则涉及全新的动作语义。每个任务均在自由形式指令下进行 10 次随机试验以衡量成功率。DAgger 后训练有效性实验的设置。仅遥操作数据微调的模型被称为 EgoSteer-FT而经过三轮 DAgger 迭代优化的模型被称为 EgoSteer-DG。这些模型在四个需要灵巧操作且易失败的已见任务例如“将手机放置在支架上”上进行比较。针对每个任务均采用相同的设置进行 10 次评估试验。​预训练规模扩展与基线比较的实验设置。分别在 3000、6000 和 9600 小时第一人称视角数据上预训练的 EgoSteer 模型以及一个从零开始训练的无预训练基线模型均在真实机器人数据集上进行了后训练。这些模型分别标记为 EgoSteer-0/3/6/9.6K在 10 个任务上进行了评估。此外基线模型 π0.5 [2] 和 Being-H0.5 [8] 也在真实机器人数据集上进行后训练并在 10 个难度较低的任务上进行比较。

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价