资讯动态

具身智能卖铲人:数据标注与采集半年融资170亿背后的技术逻辑

发布时间:2026/8/28 1:22:13 来源:尧图企业网站定制
具身智能这条赛道现在最赚钱的可能不是做机器人的而是给机器人“喂饭”的。半年时间这个群体融了超过 170 亿元人民币。这不是整车厂的故事也不是大模型公司的故事而是数据标注与采集公司的故事。业内把这类角色叫“卖铲人”——别人淘金他们卖铲子。具身智能的铲子就是数据。这篇文章不聊“具身智能多伟大”这种宏观叙事直接拆三件事数据为什么成了具身赛道的硬通货数据生意的技术门槛到底在哪以及作为技术开发者和创业者怎么接住这波数据红利。1. 半年 170 亿数据标注公司凭什么成为资本焦点先说一组能看到的行业事实。2025 年上半年具身智能领域的数据采集、标注、合成相关公司融资节奏明显加快。综合公开披露信息围绕“具身智能数据”这一环节的融资规模累计已超过 170 亿元人民币。这个数字放在整个人工智能融资大盘里也很突出。为什么资本突然盯上数据生意核心逻辑只有一个数据缺口已经超过算力缺口成为具身智能落地的主要瓶颈。大模型时代文本数据几乎被互联网存量吃干榨尽各大厂开始用合成数据续命。但具身智能不一样机器人需要的是物理世界的交互数据——机械臂怎么抓杯子、双足机器人怎么上下楼梯、服务机器人怎么避开障碍物。这类数据互联网上没有必须要到真实世界去采或者用工程手段合成。而采集真实物理数据又慢又贵。一个熟练的遥操员一天可能只能采集几十条有效轨迹一条高质量的“抓取—移动—放置”数据从硬件调试到人工标注成本可能达到几十元甚至上百元。对比之下CV 时代的一张图片标注只要几毛钱。数据标注行业等于从“劳动密集型”直接跳到了“高技术密度 重资产”阶段。2. 具身数据生意的三个技术环节采集、标注、合成从技术开发者的视角看具身智能数据不是“拍视频 框物体”这么简单。它是一条完整的流水线拆开看有三个核心环节每个环节都有对应的工具链和岗位需求。2.1 数据采集遥操作、自动采集、多模态对齐具身智能训练数据的采集方式目前主流有三类。第一类是人工遥操作采集。操作员通过 VR 设备、主从机械臂或示教器远程控制机器人完成动作同时记录关节角度、力矩、视觉图像、语音指令等多维数据。这种方式数据质量高但成本也最高。第二类是自动化采集。在固定工位上布置多台相机让机器人反复执行同一任务利用视觉算法自动切分有效片段。这种方法适合数据量要求大、动作相对固定的场景例如分拣、码垛。第三类是异构机器人数据复用。同一个操作轨迹通过运动学映射迁移到不同构型的机器人上。这条路径对算法要求高但能显著摊薄单台设备的采集成本。技术上的关键点在于多模态对齐视觉流、关节角度流、力觉流和语言指令需要精确到毫秒级同步。很多团队初期只关注图像质量忽略了关节角度的采样频率结果训练出来的策略一上真机就“手抖”。这属于典型的数据采集环节经验坑。如果你的团队要自建数据采集流水线优先检查三个指标指标建议基线说明关节角度采样频率不低于 100Hz低于 30Hz 会导致动作轨迹失真视觉与关节数据时间差小于 10ms超过 50ms策略学习会出现明显偏差单条数据有效长度3s 到 30s过短无法学习完整动作过长引入冗余噪声2.2 数据标注从 2D 框选到 3D 语义理解传统 CV 标注用矩形框、多边形、关键点就能交差。具身智能数据的标注维度复杂得多至少包括五层2D 视觉标注目标检测、分割、追踪这是基础层。3D 空间标注点云分割、三维包围盒、物体位姿估计。动作语义标注把连续的动作流切成原子动作例如“伸手”“抓取”“移动”“释放”。任务级标注标注整个任务的目标、约束条件和成功标准。语言对齐标注把自然语言指令和对应的视觉、动作片段关联起来。当前行业里最缺的是第 3 层和第 5 层标注能力。原因很直接这两层既需要理解机器人运动学又需要理解自然语言意图普通标注员经过短期培训很难达标。这种复合型标注团队的搭建本身就是数据公司的核心壁垒。资本看好的不是“人多”而是“懂机器人又懂标注”的团队密度。如果你在做相关项目这里有一个实操建议优先用半自动标注工具分流 70% 的简单工作量把人力集中在动作语义和语言对齐这两个高价值环节。比如先用预训练模型生成 2D 检测框和 3D 点云伪标签再让标注员修正效率能提升 3 到 5 倍。2.3 数据合成仿真引擎与真实数据混合训练真实数据太贵、太难采行业自然走向仿真合成。具身智能中常用的合成方案包括物理仿真引擎如 MuJoCo、Isaac Sim、Genesis在虚拟环境中大规模生成交互数据。随机域泛化随机化纹理、光照、物体形状让策略学到任务本质而非场景特征。扩散模型生成数据利用大模型生成物体的多视角图像再投影到三维空间。大语言模型驱动的任务生成用 LLM 自动生成任务描述和指令再驱动仿真环境自动执行。仿真数据的问题也很明显Sim-to-Real Gap仿真到真实迁移差距。在仿真里学得再好一到真实世界就“水土不服”。当前工程界的通行做法是混合训练——真实数据做底仿真数据做量比例大概从 1:1 到 1:10 不等具体要看任务复杂度和真机验证反馈。这里要泼一盆冷水合成数据不是“免费午餐”。它只是把采集成本从硬件侧转移到了算法侧。如果团队没有足够的真实数据作为锚点大量合成数据反而会引入系统性偏差。3. 端到端模型时代数据成了新的军备竞赛目前具身智能模型的主流技术路线已经从“感知 规划 控制”的分层架构逐步转向端到端模型其中最典型的是 VLAVision-Language-Action视觉语言动作模型。VLA 模型的训练逻辑和 LLM 高度相似给它海量的“视觉输入 语言指令 动作输出”三元组数据让它学会直接输出动作。问题在于LLM 的训练数据是互联网海量文本而 VLA 的训练数据还没有形成规模效应。这也是为什么科技巨头和头部创业公司都在疯狂囤数据。从数据规模看行业头部玩家已经展示出明显的“数据飞轮”效应数据规模策略表现参考场景千条级单一场景、固定物体可完成泛化差实验演示万条级同一场景多物体可完成仍受场景限制初步试产十万条级跨场景泛化明显初步具备通用操作能力规模化测试百万条级接近通用操作可处理长时序复杂任务商业探索上面这个表格是从多份公开技术报告中归纳的相对量级不是某个具体模型的官方参数。但它反映了一个趋势具身智能模型的智能水平直接受数据规模驱动。谁的数据管线更高效谁的模型迭代就更快谁就能拿到下一轮融资。这就是数据公司“暴利”的本质——它们不是靠卖一次数据赚钱而是靠持续构建别人无法轻易复制的高质量数据管线。4. 数据采集和标注企业的核心壁垒不是数据本身仔细看这轮融资中跑出来的公司会发现它们的共同点不是“数据量大”而是**“数据闭环能力强”**。数据闭环指什么简单说就是四个环节循环起来在真实或仿真环境中采集数据。清洗、标注、增强、格式化。输入模型训练在真机上评测。把失败案例返回数据管线补充标注和采集。闭环能力的核心是工程效率。同样训练一个“拿起水杯”的任务A 公司可能需要 3 万条数据、6 周时间B 公司通过数据增强和仿真优先策略可能只用 8000 条数据、2 周时间就达到同等效果。差距不在模型结构而在数据管线的工程调度能力。对于想入局的技术团队这里有几个可执行的方向4.1 面向中小机器人团队的“数据工具链”外包服务很多机器人创业团队有硬件能力、有算法能力但数据基础设施一塌糊涂。你可以提供标准化的采集 SDK、标注平台、数据格式转换工具按项目收费或做 SaaS 订阅。这是典型的“卖铲子”生意。工具链应该包括多传感器同步采集 SDK相机、IMU、关节编码器。数据可视化回放工具同时显示视频和关节角度曲线。标注任务分发与质检后台。模型训练结果反馈接口形成闭环。4.2 垂直场景数据集建设与其做大而全的通用具身数据不如在细分场景深挖。比如零售货架拣选数据集。医疗陪护机器人交互数据集。物流分拣场景的包裹操作数据集。餐饮场景的餐具抓取与摆放数据集。垂直数据集的商业价值是很明确的机器人公司落地时都需要场景化数据冷启动它们往往没有时间和成本自己去采集采购垂直数据集比自建便宜得多。4.3 数据合成与增强工具平台如果你熟悉仿真引擎和生成式 AI可以做一个面向具身智能的数据合成平台用户上传 3D 物体模型平台自动生成带标注的全场景仿真数据。这类平台有两条路可以走一是做通用平台二是和仿真引擎厂商深度绑定做垂直集成。5. 数据清洗与数据增强具身数据治理的工程实践上一部分讲了商业机会这部分落到具体工程师的日常拿到一批原始具身数据后怎么处理才能用于模型训练具身数据的原始形态通常是一堆文件夹包含图像序列、深度图、关节角度 JSON、语音指令等。直接丢给模型训练大概率效果很差必须经过清洗和增强。5.1 数据清洗四步走第一步时间戳对齐。检查图像帧和关节角度的时间戳偏差超过阈值则丢弃或用插值修补。这一步最常见的坑相机缓存导致图像流延迟做完对齐后发现动作提前于画面。import numpy as np def align_timestamps(image_timestamps, joint_timestamps, joint_data, max_diff_ms10): aligned [] for idx, img_ts in enumerate(image_timestamps): # 找到最近的关节数据帧 diff np.abs(joint_timestamps - img_ts) nearest_idx np.argmin(diff) if diff[nearest_idx] max_diff_ms: aligned.append((idx, nearest_idx, joint_data[nearest_idx])) # 偏差过大则丢弃该图像帧 return aligned第二步质量筛选。图像模糊、遮挡过重、机器人执行失败的数据直接过滤。这里建议用 CLIP 或自监督模型做嵌入相似度筛选人工只复核边界样本。第三步任务切片。把连续数据流切分成“单次尝试”样本。判断依据通常是执行器状态变化、任务完成信号的跳变以及动作序列的停顿点。第四步格式标准化。统一图像分辨率、归一化关节角度范围、统一语言指令模板。格式不统一会在训练时引入大量隐性噪声。5.2 数据增强的具身版本传统 CV 的数据增强随机裁剪、翻转、色彩抖动在具身数据上基本不够用。具身场景更有效的增强方式包括视角扰动随机平移/旋转相机位姿模拟相机安装误差。动力学参数扰动修改仿真中的摩擦力、质量、电机力矩系数生成对抗性样本。语言改写增强用 LLM 把同一条指令改写成多种自然表达。时序裁剪与拼接从长轨迹中随机裁剪不同长度的片段同时改变任务起始状态。def augment_language_instruction(instruction): 利用 LLM 生成语义一致但表达多样的指令 prompt f请将下列机器人操作指令改写为 5 种不同的自然语言表达 要求语义完全一致句式多样适合用于具身智能模型训练。指令原文{instruction} # 这里对接企业内部的 LLM API return response这层增强做得好可以用更少的真实采集成倍数扩大有效数据量。从公开案例看做得好的团队数据增强带来的效果提升甚至超过增大模型参数量。6. 具身智能数据赛道的争议与风险说回“暴利”这个词。任何一个高速增长的赛道都会有泡沫和争议。具身数据生意至少有四个风险需要冷静看待。6.1 数据价值难以标准化定价同样是“拿起杯子”的数据A 公司采集的能用B 公司采集的不能用但定价上可能看起来差不多。具身数据目前缺乏统一的评测基准和验收标准买方很容易踩坑。这也意味着数据公司在商业化过程中需要花大力气做效果展示和信任建设。6.2 仿真数据“内卷”严重仿真采集的门槛正在快速降低开源仿真平台越来越多。如果只是做通用仿真数据差异化空间很小。真正的壁垒还是在于“仿真数据 真实数据混合训练”的工程经验而不是仿真本身。6.3 单一客户依赖风险具身数据公司的下游客户高度集中可能就几家头部机器人企业和科技大厂。一旦大客户自建数据团队或转向内部闭环数据公司的营收会剧烈波动。资本看重“数据闭环能力”本质是在赌数据公司能持续绑定客户的长线价值。6.4 隐私与安全合规具身数据采集通常发生在真实物理空间可能涉及人脸、家庭环境、商业场所等敏感信息。尤其是家用服务机器人、医疗陪护机器人场景数据采集必须获得明确授权必须做人脸打码、位置模糊等脱敏处理。从合规角度看以下动作是底线采集前获得场景负责人和涉及个人的书面授权。数据存储和传输使用加密方案限定访问权限。涉及人脸、车牌等敏感信息在进入训练流程前完成脱敏。数据导出、共享、商用前进行法律复核。这些不是可有可无的流程在当前监管环境下数据合规问题可以直接决定一个项目能不能继续推进。7. 普通开发者如何参与具身数据浪潮如果你不想创业也不想加入数据公司作为算法工程师或后端工程师同样有非常具体的切入路径。7.1 优先掌握数据工具链具身数据领域最缺的不是算法科学家而是能把数据管线跑通的人。建议优先熟悉以下工具链仿真数据生成MuJoCo、Isaac Sim、Genesis 至少精通一个。数据标注平台熟悉 Label Studio、CVAT了解 3D 点云标注插件。多模态数据格式熟悉 ROS2 bag、HDF5、JSON Lines、WebDataset 等格式。模型评测掌握在真实机器人或仿真环境中跑评测的流程。7.2 关注开源数据集和模型目前已经有不少机构开源了具身智能数据集包括抓取、操作、导航等任务类型。初学者可以先用这些开源数据跑通训练流程再考虑自建数据。实操路线建议下载一个中等规模的开源操作数据集。完成数据可视化、清洗、切片。用开源的 VLA 模型做微调训练。在仿真环境中部署评测。这个流程走完你对“数据管线对模型效果的影响”会有明显感知。7.3 把数据能力做进简历从技术招聘的角度看有真实数据管线经验的候选人非常稀缺。如果你能在简历里写清楚处理过哪些类型的具身数据。数据清洗和增强的工程方法。数据规模对模型效果的影响分析。踩过哪些数据坑、如何解决。会比单纯写“熟悉 PyTorch”有竞争力得多。8. 具身数据“卖铲人”生意的下一步回到开头的 170 亿融资。资本在这个时间点重金押注数据公司说明行业已经形成共识具身智能赛道的瓶颈从模型结构转向了数据供给。接下来值得关注的方向有三个8.1 数据标准化目前具身数据领域还没有像 COCO、ImageNet 那样的公认基准数据集。谁能牵头建立具身数据的统一格式、标注规范和评测标准谁就能占据产业链的制高点。8.2 真机数据工厂高端数据采集设备和专业采集团队的规模化运作正在成为一种重资产商业模式。这种“机器人数据工厂”的建设需要大量硬件投入、人力管理和自动化软件支持壁垒比单纯的标注公司高一个量级。8.3 数据飞轮生态未来更健康的模式可能是机器人厂商在真实运行中持续回传脱敏数据数据公司负责清洗增强再反过来训练更好的模型给机器人厂商。这种数据飞轮一旦建立就形成了商业上的强绑定关系。这就是“卖铲人”真正值钱的地方——它们不只是卖数据而是在搭建数据再生产的闭环系统。只要具身智能没有实现完全的小样本学习这个闭环就会持续运转下去。对技术开发者来说现在入场还有窗口期。建议从数据工具链入手不管你是做仿真、标注平台、数据清洗还是评测系统需求都在持续放大。先把自己的“铲子”磨利比什么都实在。

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价