资讯动态

把 Agent 的推理从循环体内拉到循环体外

发布时间:2026/8/18 13:22:20 来源:尧图企业网站定制
场景ReAct 每一步都做推理→行动循环Token 消耗大、执行慢。Plan-then-Execute 把推理集中到规划阶段一次性制定完整计划再执行。路径理解了规划与执行分离你就知道为什么有些场景 Token 可以省一半。上篇我们把 ReAct 拆成了推理→行动的每步循环——每一步 LLM 都先想再干。这篇我们来看一个反直觉的进化如果让 Agent 先一次性规划好所有步骤再执行Token 能省多少Plan-then-Execute 不是 ReAct 的替代品——它是把 Agent 的思考从执行中分离出来的架构决策。你可以把它想象成写代码 vs 编译执行ReAct 是 REPL边写边跑Plan-then-Execute 是先写完整程序再编译。两者都有用但用错了场景等于浪费 Token。理解这个分离你就掌握了 Agent 架构设计中最重要的一个权衡什么时候该让 Agent 思考什么时候该让它干活。【起源】Single-shot LLM 的局限从无状态到 ReAct上两篇文章已经覆盖了 Single-shot 和 ReAct 的细节这里只提炼核心冲突模式每步调用 LLM推理次数Token 效率Single-shot1 次1 次最高但做不了多步ReAct每步都调N 次灵活但 80% Token 花在内部独白Plan-then-Execute仅规划阶段调1 次省 ~44%ReAct 解决了让 LLM 自己决定下一步做什么但代价是每步都推理——3 步 3 次昂贵的 LLM 调用。Plan-then-Execute 打破了这个假设。一眼看懂的代码对比把两段伪代码并列核心差异一目了然ReAct 的推理在循环内部每步都要llm.thinkPtE 的推理在循环外部仅规划阶段。省 Token的本质就是把推理从循环体内拉到循环体外。【演进】从 ReAct 到 Plan-then-ExecuteReAct 的隐性成本ReAct 解决了让 LLM 自己决定下一步做什么的问题但没有解决每步都做推理的 Token 开销。让我们用数据说话。一次典型的 ReAct 多步调用中Token 消耗结构如下阶段LLM 调用推理 Token工具调用 Token合计Thought 1 Action第 1 次推理~150 Token~30 Token~180Observation → Thought 2 Action第 2 次推理~200 Token (含上下文)~30 Token~230Observation → Thought 3 Final第 3 次推理~250 Token (含上下文)~50 Token~3003 步任务 3 次推理调用约 710 Token 的推理消耗。其中约 80% 的 Token 消耗在Thought上——即 LLM 对自己说我看到了什么、我现在要做什么的内部独白。这个模式的核心洞察来自 ReAct 论文Yao et al., 2023LLM 需要这些中间思考来维持推理的连贯性但这些思考对最终用户来说是无价值的开销。规划与执行的分离Plan-then-Execute 解决了多步任务中推理次数与步骤数成正比的问题——把 N 次推理压缩到 1 次。核心思想来自 ReWOOReasoning WithOut ObservationXu et al., 2023把 Agent 的工作分成两个阶段Phase 1 — 规划PlanningLLM 一次性生成完整的执行计划声明每一步的工具调用和参数但不执行任何工具Plan:1. tool: query_database|param:SELECT * FROM users WHERE statusactive2. tool: analyze|param:$1(上一步的输出)3. tool: write_report|param:$24. tool: send_email|param:report_recipientcompany.comPhase 2 — 执行Execution按计划顺序执行工具调用每步只做工具调用不再触发 LLM 推理。前一步的输出自动作为后一步的输入。这种方法的核心改变是推理调用从 N 次减为 1 次。维度ReActPlan-then-Execute推理次数N 次每步一次1 次仅规划阶段Token 消耗3 步~710~400含规划输出Token 节省—~44%灵活性高可中途改变策略低规划后不修改执行速度慢每步都调 LLM快纯工具调用为什么能省 Token用一个类比来理解ReAct 做三步任务是每搬一块砖都想一次怎么搬Plan-then-Execute 是先想好整个砌墙顺序再一次性搬完。规划阶段的输出虽然也消耗 Token但它是一次性的思维产物。执行阶段没有推理开销——所有步骤都是预定的工具调用类似编排好的函数链。Token — 模型处理的最小单位类似编程语言的字符。越多 Token 意味着越多推理开销和越高延迟。【路径】 “理解了规划与执行分离你就知道为什么 Token 可以省一半”一句话驯服 Agent 性能讨论下次身边的人问为什么 Agent 这么慢你可以说Agent 的慢通常不是因为工具调用毫秒级而是因为每次工具调用前的推理秒级。ReAct 每一步都要推理所以 3 步至少 3 秒。Plan-then-Execute 只在开头推理一次所以 3 步 1 3×0.1 1.3 秒。Token 优化的本质不是少输出——而是少推理。最实用的 Agent 选型法则下次跟团队争论 Agent 框架选型先抛一个问题你的场景是已知路径还是探索路径已知路径数据处理流水线、定时报表、ETL→Plan-then-Execute快、省 Token、不需要中途改主意探索路径客服对话、Web 搜索、Debug 排查→ReAct慢但灵活每一步都可以根据上一步结果调整方向这个二选一能解决 80% 的 Agent 架构争论。剩下 20% 才是框架层面的差别。【现状】ReWOOPlan-then-Execute 的经典实现ReWOO 架构ReWOOReasoning WithOut Observation是 Plan-then-Execute 模式最有影响力的实现之一。它的核心架构包含三个组件组件角色类似传统架构中的Planner制定执行计划不执行项目经理画甘特图Worker执行具体工具调用不思考搬砖工按图施工Solver汇总执行结果生成最终答案质检员检查交付物工作流程Planner接收用户问题输出一组工具调用计划完全放弃 Observation 的 ReAct 循环Worker按顺序执行计划中的每个工具调用每步只做调用不调用 LLMSolver将 Worker 各步骤的结果汇总进行一次最终推理生成回答这个分离的意义在于Planner 只做推理不做操作Worker 只做操作不推理。推理和执行的关注点完全解耦。适用边界ReWOO 不是 ReAct 的全面替代品——它有自己的适用场景限制适合 Plan-then-Execute 的场景执行步骤可预定义如数据处理流水线、定时报表、ETL 管道每步输入输出类型固定查询→处理→生成→发送不需要在执行过程中看中间结果改变策略不适合 Plan-then-Execute 的场景需要在执行中根据动态结果调整方向如客服对话、debug 排查上一步的执行结果会影响到下一步做什么如 Web 搜索后根据结果决定下一步搜什么用户可能中途中断或修改输入如交互式对话用一句话概括Plan-then-Execute 适合已知路径的任务ReAct 适合探索路径的任务。实际 Token 节省估算用 ReWOO 论文的数据结合实测一个 3 步工具调用任务的 Token 消耗模式规划 Token执行 Token合计ReAct~7103 次推理0~710Plan-then-Execute~2501 次规划~150Worker Solver 调用消耗~400节省——~44%注意Solver 的最终推理在一次执行中也是必需的——它把各步骤结果整合成用户能读的答案。即使 ReAct 模式最终也需要一次推理来生成回答。【趋势】从静态规划到自适应规划当前局限Plan-then-Execute 目前最常用的实现是静态规划——Planner 一次生成完整计划之后完全不修改。如果执行过程中发现第一步的结果不符合预期Agent 只会继续按原计划走不会停下来重新评估。如果你已经在用 LangGraph 或 CrewAI这些框架对 PtE 模式有原生支持。LangGraph 的StateGraph支持在任意节点设置检查点checkpoint当节点输出偏离预期时触发重新规划。CrewAI 的Process.hierarchical模式天然实现了 Manager→Worker 的规划-执行分离——Manager 负责制定任务计划Worker 执行Manager 审查结果。改框架就是改一个配置的事。下一站Plan-then-Replan下一代优化方向是引入检查点Planner 先生成初步计划Worker 执行到检查点检查是否符合预期→ 是则继续否则触发 ReplannerReplanner 修改剩余计划这样就融合了 ReAct 的灵活性能改和 Plan-then-Execute 的效率大部分步骤不推理。再下一站Tree-of-Thought更进一步的方向是用 Tree-of-ThoughtToT代替线性规划——同时生成多条规划路径在执行过程中基于中间结果切换最优路径。这个方案虽然推理成本更高但在需要大量探索的场景如代码生成、研究分析中效果更好。每个选择都对应一个权衡全部推理ReAct最灵活最贵规划→执行Plan-then-Execute最便宜最死板规划→检查→再规划Plan-then-Replan折中多路径并行Tree-of-Thought最贵但探索最彻底【锚点】“记住一句话”脑中的锚点“Plan-then-Execute 先画施工图再施工ReAct 边施工边改图纸。”如果你在搭一个步骤确定的 Agent 流水线先用 Plan-then-Execute 省下那 40% 的 Token。如果 Agent 需要在执行中看情况变通回到 ReAct 的每步推理。下篇我们聊 Reflection——Agent 如何像程序员 review 自己代码一样自我纠错。

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价