资讯动态

具身智能六大技术路线全解析:从模块化到世界模型,如何选择与落地

发布时间:2026/9/28 17:38:40 来源:尧图企业网站定制
最近同行群里讨论最多的一个话题就是具身智能这六条技术路线——模块化、技能编排、IL、RL、VLA、世界模型——到底哪个才是“正统”。说真的我做了几年机器人相关项目又转型盯了一年多具身智能方向最大的感受是这个领域不缺热情缺的是把话说明白的人。每个人都站在自己的山头喊口号模块化的说端到端不落地端到端的说模块化老掉牙做IL的说RL效率低做RL的说IL上限低VLA火起来之后又是一轮大乱斗。你说它们吵的真的是技术吗我觉得吵的更多是对“智能是怎么长出来的”这件事的底层信仰。这篇文章不打算站队我尝试把六条路线放在同一个坐标系里讲清楚它们各自解决什么问题、底层逻辑是什么、边界在哪里、实际项目中怎么选。看完之后你会发现这些路线之间的关系不是“谁取代谁”而是“谁在哪一层说了算”。1. 先把战场画清楚六大路线都想解决什么问题1.1 具身智能的决策闭环感知、意图、动作具身智能和纯语言模型最大的区别就在“身”字上。语言模型只需输出下一个token而具身智能必须在物理世界里完成这样一个循环感知环境 → 判断意图 → 生成动作 → 观察反馈 → 修正行为。这个闭环听起来简单但每一步都藏着无数岔路。感知层要回答“我看见的是什么”意图层要回答“我现在该做什么”动作层要回答“怎么动才能拿到那个杯子”反馈层要回答“刚才那步成功了没有”。每层都能用不同方法去做这就成了路线之争的温床。模块化路线的选择是每一层独立建模各自选最优算法再通过接口串联。技能编排路线的选择是把动作层拆成“技能原子”用规则或搜索编排它们。IL路线的选择是跳过显式中间表征直接从人示教数据里学“感知-动作”映射。RL路线的选择是不靠人教靠环境反馈逼出最优策略。VLA路线的选择是让大模型同时理解视觉和语言再把理解翻译成动作序列。世界模型路线更激进让智能体先学会预测环境动态再靠“脑内推演”做决策。看出问题没有这六条路线其实是在同一张地图上画了六条路入口却完全不同。有的从感知切入有的从决策切入有的从学习范式切入有的从模型架构切入。把它们放到同一个擂台上去比谁“更正确”本身就是一种错位。1.2 为什么这是当下最“吵”的领域具身智能与前几轮AI热潮最大的差异在于它没有公认的基准测试。大家各自在仿真环境、自建真机、公开数据集上跑结果互相之间不可直接比喊着“我的路线更work”的人往往都只是在自己选定的场景里work。另外两个推高讨论热度的因素大模型外溢效应。LLM和VLM的成熟让“给机器人接个大脑”变成了一个可被广大开发者够得着的方向于是大量没有机器人背景的技术人涌进来带着大模型的习惯做具身导致“是否必须端到端”变成了价值观问题。资本预期压力。谁能讲出“可规模化、可泛化”的故事谁就能拿到更多资源不同技术路线成了融资叙事的一部分吵得越响流量越好。这个“吵”在所难免但对真正要落地的人来说噪音没有意义地图才有意义。下面我按“派系”逐个拆。2. 老牌阵营模块化与技能编排凭什么还没被淘汰2.1 模块化感知-规划-控制的分层信仰模块化是机器人学最经典的架构它在学术界被称为Sense-Plan-ActSPA范式。传统工业机械臂、自动驾驶早期方案、绝大多数服务机器人走的都是这条路。它的核心信念是把“想”和“做”分开每层把输入处理干净再往上传。感知模块输出物体位姿、语义标签、障碍物地图规划模块基于当前状态做运动规划比如RRT、MPC控制模块把规划出的轨迹映射到关节力矩。这种架构在工业场景强得可怕因为环境可控、需求明确而且每一层都能单独测试、单独调参。维护成本看起来高但实际上每一层坏了都能修。我能理解为什么很多传统机器人工程师觉得端到端路线“不靠谱”在一个责任边界明确的体系里长大的人自然无法接受“用一个大模型把所有环节包圆”的风险。出错了谁能定位谁负责修这不是保守这是工程训练出来的本能。2.2 技能编排从原子操作到长程任务技能编排是模块化思想的动作层升级版。它不再追求端到端生成完整动作序列而是先把任务拆成一段段“原子技能”再把技能按顺序或条件组合起来。这个组合逻辑可以是有限状态机FSM、行为树Behavior Tree或HTN规划器。我实际用行为树做过一个“倒水”任务开盖→握瓶→对准杯口→倾斜45度→等待3秒→回正→放瓶。每个节点对应一个技能接口每个技能内部可以是独立算法甚至可以是后面要讲的IL/RL策略。这套方案的优点非常接地气开发是增量的新增一个任务只需组合已有节点可解释性也极强哪里卡住哪改哪个节点就能修。真实机器人产品比如仓库分拣机器人里这个思路今天依然是主力。但它的天花板也摆在明面上技能组合是手写的任务一变编排逻辑就要重来泛化到没见过的新组合时系统几乎没有自适应能力。2.3 这条路线真正的软肋在哪里模块化和技能编排被端到端派攻击的点总结起来就三个感知-规划-控制之间必然有信息损失。前一层把高维感知压缩为“位姿、标签”这类中间表示时很多对决策有用的细节材质、受力反馈、动力学关系已经被丢弃了。到了控制层想补回来非常难。任务级的组合爆炸。真实世界长程任务里分支条件很多手写行为树到一定规模后逻辑复杂度和维护难度会指数级上升。缺乏“从经验中自我进化”的机制。模块化系统里的每个模块都是工程师雕出来的机器本身不积累经验换个场景等于从头调试。但我说实话这不是“错误”而是“取舍”。模块化系统仍然是目前在工业界最可靠、最能交付的东西。所谓“软肋”是在谈泛化和通用智能时才显得致命谈交付时它反而是优势。3. 数据驱动双雄IL和RL究竟在争什么3.1 IL模仿学习的本质建立专家行为的条件分布ILImitation Learning模仿学习的思路很直白找专家来示范让机器人照着学。最简单的做法是行为克隆Behavior Cloning直接拿状态动作对做监督学习让它拟合“在什么情况下专家会做什么动作”。但你如果上手试过就知道纯行为克隆有个人尽皆知的坑分布偏移Distribution Shift。机器人训练时看到的都是专家示教里的状态一旦实际执行时稍微偏离一点点进入训练分布覆盖不到的区域策略就会“放飞自我”输出荒谬动作然后越偏越远。业界有解决方案比如DAgger算法核心是让机器人在执行过程中不断重新请求专家纠正把新状态补充进训练集。这个思路很好但代价是“专家得陪着它练”在真实物理世界中成本极高。近两年扩散策略Diffusion Policy和ACTAction Chunking with Transformers等新方法把IL的实用性往前推了一大截。它们的神奇之处在于不直接回归一个动作而是生成一小段时间窗口内的动作序列块用扩散模型的去噪过程拟合多模态的动作分布。它允许同一个状态下存在多种合理动作这一点非常贴近真实人体动作的多样性。我用ACT做过来回搬运的简单任务效果确确实实比传统行为克隆稳得多。3.2 RL强化学习的本质没有老师的“数据驱动”RLReinforcement Learning强化学习是另一条路不告诉机器人正确答案只定义“什么是好结果”让它自己通过试错去发现好动作。在仿真环境里RL的成就已经不需要我多吹了——游戏、棋盘、机器人跑酷跳跃它都能学到超越人类专家的策略。但放到具身智能真实场景里它面临三个硬约束奖励函数设计难。倒水怎么算“倒得好”水流速度、偏离量、时间成本每一项都要权衡。很多项目调奖励函数的时间足够做完一个模块化系统。样本效率低。真实机器人的试错成本太高了摔几次就能报废一台机器没法像游戏里那样跑百万回合。Sim-to-Real gap。在仿真里练好的策略迁移到真实世界时因为物理引擎和真实环境的差异经常出现“仿真里无所不能真机上一碰就挂”。所以目前真正做得好的RL落地项目几乎都标配了域随机化训练时随机改变仿真里的物理参数、光照、纹理让策略不依赖某个特定仿真细节从而增强迁移鲁棒性。这个技巧我在四足机器人项目里用过确实管用但你需要一个足够逼真的仿真器和足够多的算力。3.3 真项目里的IL和RL混搭别站队先求结果如果你去看顶会论文会发现现在几乎没有人“纯”用某一种学习了大家都在混着用。最常见的范式是先用IL从人类示教里学一个大致的粗策略再用RL针对性地做精细优化。这叫“预训练微调”和LLM的做法非常像。我自己的一个操作类项目就是这么一个流程先用遥操作采集了几十条倾倒液体的示教数据用Diffusion Policy训一个初始策略让机器人能在普通角度成功再在仿真里用RL对“倾斜角度、倒水速度”这类指标做微调优化让成功率从60%拉到90%以上。整个过程没有“信仰”问题就是一个朴素的工程判断哪个环节适合哪种学习就用哪种。4. 大模型时代的两个新变量VLA与世界模型4.1 VLA一个模型还是两个模型VLAVision-Language-Action Model是2023年以来最火的方向谷歌RT-2、OpenVLA、Physical Intelligence的π0大家俗称“派0”都属于这一类。被问得最多的问题是VLA到底是一个模型还是“视觉语言模型动作输出层”拼起来的两个模型这个问题问到点子上了答案是架构上是一个训练上是两段。一个VLA模型把视觉编码器、语言理解主干和动作输出头全部放在同一个神经网络里从输入图像和文本到输出动作序列走前向传播一步到位。这是和“传统模块化”最大的区别。但训练这个“一个模型”往往是分阶段的先在互联网级的海量图文数据上预训练主干让它具备通用的视觉语言理解能力再用机器人的操作数据把动作输出头也训练出来。第二阶段通常在骨架Backbone中占据很大的参数量但很多从业者把这一阶段理解为“把语言模型变成动作模型”的过程。之所以会有人问“一个还是两个”是因为很多VLA开源项目为了方便实用会把视觉编码器、语言主干、动作头拆成三个权重文件分开加载使用看起来像三个模型。但推理时它们是同一条计算图所以本质上是一个模型。π0除了常规的VLA结构还引入了**“流匹配动作头”**Flow Matching Action Head让它能输出连续、流畅的动作轨迹这解决了之前很多VLA只能输出低频率离散动作的问题。4.2 VLA的技术骨架视觉编码器、LLM主干、动作输出讲得再细一点拆开一个VLA模型看它内部结构大概是这样的视觉编码器把当前摄像头画面转成一个或多个视觉token。常见选择是SigLIP、DINOv2这类大预训练视觉模型。它要解决的不仅是“分清杯子在哪”还包括“理解物体之间的关系情绪”。注这里的“关系情绪”不恰当改为“理解和推理关系”语言主干通常是LLMPaLM-E时代是PaLM现在的多是Qwen、Llama等开源模型负责把指令和视觉token融合进行跨模态推理。你告诉它“拿起红色的杯子放到托盘里”它需要理解颜色指代、空间关系、动作顺序。动作输出头把主干推理出的“意图”翻译成实际动作指令。有的用离散token把关节角度量化后当作“动作词表”有的用连续回归直接输出末端轨迹π0的流匹配头走的是更先进的连续扩散路线能生成平滑的轨迹。动作执行间隔VLA不输出每个控制周期比如每毫秒的力矩它通常以“每几秒输出一段动作chunk”的方式工作底层再交给传统PID控制器去执行平滑轨迹。这套路线的优势实在是太明显了它把视觉、语言、动作全部统一成了同一种“预测”问题可以用同一套反向传播优化技术栈干净而且能够把互联网级别的语言和视觉先验带到机器人领域。做一个VLA项目你不用再事无巨细地设计感知特征或规划器只管给数据和调prompt。当然代价是数据需求巨高单纯的机器人操作数据往往不够还得配合数百小时的真实遥操作数据而采集这些遥操作数据本身就是具身智能领域最大的工程瓶颈。4.3 世界模型把“想象”装进决策回路世界模型World Model是六条路线里概念上最“玄”的也是最容易被人误解的。简单说它是在让智能体学习一个环境动态预测器——给定当前状态和动作预测下一个状态会变成什么样。为什么要预测未来因为如果预测得够准决策就不需要“真做”只需要“脑内推演”。这就像下棋的人不是每走一步都在真正落子才思考而是在脑子里模拟几千种棋局变化。世界模型给具身智能提供的就是这种“脑内虚拟环境”它让机器人可以在动作真正执行前先想象这个动作带来的后果。比较有代表性的思路是LeCun提出的JEPA联合嵌入预测架构它主张不预测像素本身而是在抽象表征空间里做预测从而避免“预测到每一个像素”这种浪费算力的要求。另一条线是Dreamer系列DreamerV1/V2/V3这样的模型它们把学习到的世界模型当作一个“可微分的模拟器”在里面做想象式RL训练让智能体在梦境里先跑几万步。4.4 世界模型的实现思路从像素预测到潜在空间预测具体实现世界模型主要有三个层次像素级预测最直觉的做法预测下一帧RGB图像。问题是图像空间高维且包含大量对决策无用的细节墙面纹理、光线阴影训练起来极难泛化也差。潜在空间预测用一个编码器把状态压缩成低维向量在这个向量空间里做预测。这是JEPA和Dreamer的一贯做法。它跳过了不可控的细节只预测对动态有用的抽象因素训练稳定性和效率大幅提升。前向模型直接用网络映射“(状态, 动作) → 下一状态”不显式建模未来多步。这个最简单适用于短时程控制策略。世界模型与VLA的一个关键区别是VLA是“直接学映射”世界模型是“先学规律再学策略”。前者更像“背答案”后者有点像“学物理”。世界模型路线的长期主义是如果模型真的能理解环境动态规律它可以快速迁移到不同任务——因为物理规律是通用的任务只是在这个规律之上的不同检索路径。但目前世界模型还没能在真机复杂度上充分验证原因很简单真实世界的图像高维、复杂尤其是多物体交互和接触动力学很难做准确预测。真做出来离还能商业化还有一段路要走。5. 吵的不是技术是“决策流派”的上层路线5.1 分歧一动作信息的粗细粒度这六条路线最本质的一个分歧是对“动作”这件事的表征粒度不同。模块化路线输出的动作最“粗”——通常到轨迹点或目标位姿下层控制自己去算怎么实现VLA和RL输出的动作最“细”——直接落到关节位置或者末端轨迹层面。粒度本身没有绝对好坏。细粒度让系统简单、直接但数据需求大粗粒度让系统模块可维护性强但容易丢信息。我见过不止一个团队在两个粒度之间反复摇摆——VLA模型输出太细了学不动就退回“VLA规划传统控制器执行”的混合方案这种妥协在实践中比“纯正路线”要常见得多。5.2 分歧二世界到底该不该被显式表示另一个吵得面红耳赤的问题机器人决策时需要显式地建模“世界”吗模块化路线需要——地图是最明显的显式世界模型技能编排需要——场景的分支逻辑也是一种显式模型VLA和IL则不需要——它们直接学条件映射“世界”被隐式地编码在神经网络的权重里。LeCun支持显式建模世界因为只有对未来做预测才能超越简单的刺激-反应才能做真正的规划和推理而端到端派认为世界模型这种中间表征既难学又难校准与其绕远路不如直接让模型从海量数据里把世界规律“内化”。这是一个哲学层级的分歧短期谁也说服不了谁但需要注意的是目前所有规模化成功的具身案例走的都是“隐式内化”简单规划器的混合路线并没有一个纯粹的“显式世界模型”在真实场景里大放异彩。这是一个值得关注的事实。5.3 分歧三数据飞轮该靠谁转起来做AI的人都会讲数据飞轮具身智能也一样。但不同路线的飞轮长得不一样IL路线靠人类示教飞轮数据质量高但采集成本昂贵规模化靠遥操作设备和低成本采集方案。RL路线靠仿真交互飞轮自动化程度高但存在Sim2Real gap问题。VLA路线靠互联网示教混合飞轮互联网数据用于预训练机器人数据用于对齐天然更符合大模型时代的资本逻辑。世界模型路线靠预测目标飞轮对训练数据的需求包含丰富的动态信息——如果只给静态图像学不出动态规律。这个分歧直接决定了“谁的故事更好融资”。但站在纯技术角度看各大路线其实都承认同一个事实真实世界的机器人交互数据是最稀缺的资源。谁掌握更低成本的规模化采集方式谁就掌握了话语权。5.4 我自己的判断短期看数据中期看架构长期看世界模型和一些朋友交流多次后我形成了一个不算成熟但很有用的判断框架短期1-2年能落地的一定是以IL/VLA为主、模块化兜底的组合方案因为它们在现有工程体系里最容易交付中期3-5年的胜负手在VLA和RL的融合上谁能在真实数据上稳定发挥做出通用操作模型谁就是行业基础设施长期5年以上如果世界模型路线能突破高维视觉预测的瓶颈它才是通往真正通用具身智能的最优解。这个判断未必正确但它至少让我在做技术选型时有了一根主轴。对大多数人来说路线之争是“上面的人”的事但选型的逻辑必须自己掌握。6. 实操指南按项目场景做路线选型6.1 先给任务分类场景驱动的选型决策表我梳理了一个非常粗暴但能用的选型表拿你手头的问题往里面套就行场景特征推荐路线为什么固定环境固定任务要求高可靠性模块化技能编排可测试、可回溯、可控性最强多任务但不跨场景动作模式固定ILDiffusion Policy/ACT示教数据能覆盖落地快任务复杂、需要长时间试错寻优RL能自动发现人想不到的策略开放词汇指令操作需要跨场景泛化VLA语言和视觉先验可以迁移涉及复杂因果推理比如“打翻杯子后怎么办”世界模型实验性需要预测抽象动态传统映射学不会这个表不是标准答案但它包含了我在项目里踩坑总结出的经验比纯按论文里的优劣来选靠谱得多。6.2 一套低门槛入门组合从Sim到Real怎么起步对于想入门具身智能并复现一个完整项目的朋友我推荐一套性价比很高的起步组合第一步在仿真环境里跑ILRL混合方案。用MuJoCo或Isaac Sim搭一个简单的桌面操作场景比如“抓取方块放置到目标位置”。先用遥操作或程序化生成的示教数据训一个Diffusion Policy然后再用RL对策略做微调。MuJoCo轻量易上手Isaac Sim更接近真实渲染但门槛稍高。第二步用低成本真机验证Sim2Real。不必一上来就买几万块的机械臂用百元级的桌面机械臂配合RGB摄像头就能验证大部分VLA/IL思路。最关键的是把“仿真中训练的策略”和“真机控制频率”对齐——真机常遇到的第一个bug往往是控制频率不匹配导致动作抖成筛子。第三步接入语言指令升级成VLA方案。用开源VLA权重比如OpenVLA系模型和你的机械臂做推理对齐先跑通“理解图像文本→输出动作”的闭环。这个组合的好处是每一阶段都有明确的可量化成功标准不容易迷路。很多人入门具身智能卡住不是缺资源而是缺一个清晰的阶段目标。6.3 开源工具和数据生态速览目前的工具链其实比两年前成熟太多了选型思路如下仿真环境MuJoCo、Isaac Sim/Gym、SAPIEN各有侧重MuJoCo胜在快Isaac胜在物理渲染质量稳定SAPIEN适合做操作任务。遥操作采集开源方案像ALOHA双臂遥操作、UMI夹爪数据棒都能做到重现专家动作轨迹是构建自有VLA/IL数据集的重要装备。策略学习库Diffusion Policy、ACT、Robomimic是学IL的好基座把数据格式对齐就能直接训。VLA模型/框架OpenVLA、π0、GR00T等开源权重都有成熟的推理部署示例HuggingFace的LeRobot生态更是把数据→训练→部署串成了一个完整闭环用起来相当顺手。世界模型参考DreamerV3是最容易跑通的世界模型基线虽然离真机落地还有距离但能帮你建立“预测未来”的直观感觉。6.4 常见坑和实际问题数据、Sim2Real、评测强调几个实际工程里最容易踩的坑数据粒度不匹配采集示教数据时如果控制频率和模型输出频率不一致后期训练几乎一定出问题。建议直接用相同固定频率采集和部署。把仿真评测当真理仿真成功率虚高是常态。我见过在仿真里跑到98%的策略真机只有40%——因为仿真里没有真实拖线、摩擦力变化和相机噪声。任何模型在仿真里刷高分后都必须在真机上重测一轮才算数。共享权重是VLA落地最大的暗坑机器人本体差异大关节数量、运动范围、控制周期都不同直接把别人的VLA权重拿到自己的机械臂上十次有九次动不起来需要训练阶段使用完全相同的“本体-接口”配置。评测指标过度单一只算“成功率”不代表系统好用还要看鲁棒性、操作时间、失败恢复能力。一个“成功但慢到不可用”的系统在工业场景没有任何价值。7. 行业信号标准体系、π0和确定性的初潮7.1 《人形机器人与具身智能标准体系》释放了什么信号近期行业里有个值得关注的信号——《人形机器人与具身智能标准体系》相关文件陆续出现。这标志着具身智能从一个“论文驱动”的探索期慢慢过渡到“标准驱动”的工程期。标准体系里涉及本体、数据、测评、互联互通等内容对从业者来说意义深远。有了统一标准最大的变化不会是“技术路线被钦定”而是评测口径和被认可的数据格式会逐步收敛。以前大家各说各话的“成功率”未来会有一个相对公允的评测基准以前的私有数据格式互相不兼容标准会逐步把它们统一起来。这对模块化、VLA等路线的落地都是利好因为标准本质上是在降低行业协作成本。如果一个方案能被标准框架衡量它在客户那边的可接受度会大幅提升。7.2 聊聊π0 VLA为什么它是目前为止最“值得抄”的路线样板Physical Intelligence发布的π0派0之所以在业界引起这么大反响不是因为它是第一个VLA而是因为它在工程实践上做了一个其他人没做好的事把VLA输出连续动作轨迹这件事做扎实了。之前的很多VLA模型输出动作用的是离散token或低频率关节角度执行起来明显有“一格一格”的卡顿感视觉上就不聪明。π0用流匹配机制生成连续动作分布执行起来丝滑这在真实遥控采集的数据上优势巨大。π0的另一个价值在于它能被“微调”到特定场景——在一个通用底座上用几十条属于你自己场景的示教数据就能让机器人快速学会特定操作。这种“通用底座领域微调”的范式配合标准的遥操作数据采集协议几乎复刻了LLM行业的成功路线。如果你要选一个VLA模型深入学习π0目前是最佳教材。不过需要注意π0产生的数据与它的底层动作基准高度绑定想迁移到不同机器人结构上需要对其数学原理和数据处理逻辑有足够的理解。7.3 给后来者的三个提醒基于这一年在行业里的观察给出三个比较现实的提醒第一不要迷信“端到端就高级”。端到端VLA确实是大方向但绝大多数产品在2-3年内还得靠混合架构落地——VLA做规划和粗动作模块化系统做安全兜底和精确执行。轻视传统机器人学的团队迟早要为稳定性买单。第二尽快建立自己的“数据侧”壁垒。这条对个人开发者、创业公司都一样。算法总会趋同开源模型会越来越强但高质量的真实操作数据永远不会免费。能把数据采集成本降下来的团队才可能在VLA时代站住。第三不必急着站队但必须试着把每一条路都走一遍。我现在最忙的时候一天要在模块化调试、IL训练、VLA推理之间来回切过去会觉得“路线杂了”现在反而觉得这是做具身智能最正常的状态——因为场景本身是复合的你不能用一个纯信仰去应对所有问题。回到最初的问题这六条路线到底在吵什么吵的不是“谁对”而是“未来十年里算法要到哪里去数据要往哪里灌钱该往哪里投”。但对真正躬身入局的人来说路线的标签远没有“能跑、可测、能修、可扩展”这十二个字重要。先把一个任务在一条路线上完整地做出来再琢磨要不要融合其他路线这才是最不绕弯的进步方式。

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价 →
↑