资讯动态

告别写时固化:Just-in-Time Memory让LLM Agent按需定制

发布时间:2026/10/3 7:05:29 来源:尧图企业网站定制
Just-in-Time Memory: Learning to Curate Task-Adaptive Memory for LLM Agents作者Yefan Zhou, Yang Li, Zeyu Leo Liu, Semih Yavuz, Shafiq Joty核心发表机构论文源码未明确标注或暂未可靠识别论文链接arXiv:2609.27334v1发布于arXiv 预印本cs.AI|—|———| Qwen3-8B | No Memory | 47.9 ± 1.2 | 33.3 ± 0.7 | 9.8 ± 0.5 || Qwen3-8B | SkillOS (RL) | 61.2 ± 4.6 | 40.6 ± 0.7 | 16.5 ± 0.7 || Qwen3-8B | JitMem-base | 60.5 ± 2.6 | 32.5 ± 3.2 | 11.7 ± 0.5 || Qwen3-8B |JitMem (RL)|77.4 ± 2.9|61.1 ± 0.9|32.8 ± 1.7|| Gemini-2.5-Pro | No Memory | 66.4 ± 2.0 | 48.6 ± 0.3 | 38.4 ± 0.5 || Gemini-2.5-Pro | SkillOS (RL) | 80.2 ± 3.1 | 56.0 ± 0.7 | 41.3 ± 0.8 || Gemini-2.5-Pro | JitMem-base | 80.0 ± 1.5 | 54.7 ± 1.4 | 44.4 ± 0.6 || Gemini-2.5-Pro |JitMem (RL)|86.2 ± 1.9|61.0 ± 0.8|50.5 ± 0.8|| Gemini-2.5-Pro | JitMem-gemini | 81.9 ± 2.7 | 72.1 ± 1.0 | 61.0 ± 0.7 || GPT-5.4 | No Memory | 62.6 ± 0.3 | 40.9 ± 0.5 | 32.6 ± 0.6 || GPT-5.4 | SkillOS-gpt | 70.0 ± 3.3 | 33.3 ± 1.1 | 26.9 ± 1.4 || GPT-5.4 | JitMem-base | 79.3 ± 3.6 | 49.9 ± 1.0 | 39.3 ± 0.7 || GPT-5.4 |JitMem (RL)|86.7 ± 0.7|53.8 ± 0.3|45.4 ± 0.0|| GPT-5.4 | JitMem-gpt | 83.3 ± 2.1 | 57.0 ± 1.5 | 47.5 ± 1.4 |这里有一个必须点出的细节表格中JitMem-gemini 与 JitMem-gpt 都是提示式未 RL 训练curator而非 RL 训练变体。它们在某些设定下甚至高于 RL 训练的 Qwen3-8B 版本如 Gemini executor 下 WebShop Score 72.1 vs 61.0这说明“强模型 读时策展”的组合本身就极具竞争力也为 4.3 中“读时策展本身是主要增益来源”的判断提供了旁证。τ 2 \tau^2τ2-bench上只评估无训练变体因为该 benchmark 不提供标准训练 split为其设计有效的合成训练数据仍是开放问题。使用 GPT-5.4 executor 时方法CuratorAirlineRetailTelecomMacro Avg.Micro Avg.No Memory—65.0 ± 5.779.8 ± 4.250.2 ± 2.065.0 ± 3.265.0 ± 2.8ReasoningBankGPT-5.465.0 ± 5.084.6 ± 2.261.6 ± 8.470.4 ± 4.171.7 ± 3.9SkillOS-gptGPT-5.468.0 ± 1.478.5 ± 3.553.3 ± 2.766.6 ± 1.366.4 ± 1.9JitMem-baseQwen3-8B66.0 ± 4.981.1 ± 1.557.9 ± 8.568.3 ± 2.268.9 ± 2.6JitMem-gptGPT-5.463.5 ± 3.084.0 ± 3.672.6 ± 4.573.4 ± 2.075.6 ± 2.3按域看增益最大在Telecom11.0该领域任务涉及复杂多步策略验证。在 Airline 与 Retail 上没有任何 memory 方法超过 no-memory agent 且超出方差JitMem 变体与基线持平——Airline 上 JitMem-gpt 的 63.5 甚至低于 No Memory 的 65.0。这提示读时策展在任务需要合成程序性指导而非简单事实检索时价值最大Telecom 域恰好要求把若干 MMS 失败案例蒸馏成“先收集设备/网络状态、按序做非账户侧修复、设备状态正常后才是账户侧阻塞检查、涉及变更类工具必须先获得用户明确批准”这样一条有序诊断流程。4.3 消融实验 / Ablation Study消融的设计逻辑是分两层先在无训练的 JitMem-base 上做消融用来隔离单个设计选择的贡献再在RL 训练后的 JitMem 上做消融用来探测 RL 到底学到了什么。第一层JitMem-base 消融。三项操作分别是移除 curator 输入中的当前任务描述x t x_txt​使其退化为一个与查询无关的 summarizerw/o task adaptivity改为存储所有轨迹并附上正确性标签而不是只保留成功轨迹w/o successful traj. filtering在写入时做 ReasoningBank 风格蒸馏、只存蒸馏条目w/o raw traj.。根据图注与源码笔记的对应该图展示的是在无训练 JitMem-base 上逐项移除设计选择后的对比。结论是三项移除都会导致性能下降移除任务自适应在跨 executor 上最多下降3.1ALFWorld与4.6WebShop移除成功轨迹过滤下降1.5–2.9ALFWorld与2.3–3.4WebShop说明即使 curator 能看到正确性注释也无法完全抑制失败轨迹引入的噪声移除原始轨迹即改为写时蒸馏下降1.7–2.9ALFWorld与6.8–8.2WebShop在 WebShop 上尤为严重因为写时蒸馏承诺了一个 query-independent 摘要存储时不可逆丢失的信息读时 curator 再也无法恢复。具体数值例如 Qwen3-8B executor 下 WebShop Score 从 32.5 ± 3.2 掉到 17.8 ± 1.7、SR 从 11.7 ± 0.5 掉到 4.9 ± 0.7。第二层RL 训练后的 JitMem 消融这项最关键因为它直接回答“RL 是不是真的学会了蒸馏检索经验还是只是从参数知识里生成有用提示”。该图展示的是在 RL 训练后 JitMem 上追加的消融项。最核心的一项是把 retriever 强制返回空集w/o retrieved traj.此时所有 executor 上都出现最大退化ALFWorld 最多下降14.8GPT-5.4 executor 下从 86.7 ± 0.7 掉到 72.9 ± 0.6WebShop 最多下降15.2Qwen3-8B executor 下 SR 从 32.8 ± 1.7 掉到 17.6 ± 1.1。没有检索上下文时JitMem 退化到甚至低于未训练的 JitMem-base这确认了 RL 训练的增益建立在“学习如何蒸馏检索到的经验”之上而非获得了独立的任务求解知识。移除任务自适应性的影响在训练后同样放大ALFWorld 上 Qwen3-8B executor 从 77.4 掉到 66.0GPT-5.4 executor 从 86.7 掉到 77.4说明 RL 专门学会了利用任务信号而不是更高效地压缩轨迹。这套结论还可以用一个更直观的定性对照来印证在同一输入上未训练的 curator 产出的是通用动作序列而训练后的 curator 恢复出了环境特定的 workflow先把 desklamp 移到身边再用它 examine the bowl。这类环境特定工作流并没有写在策展 prompt 里而是在优化即时任务奖励的过程中自己涌现出来的——这恰好说明即时任务奖励确实在鼓励“任务相关的策展”而不是泛化的复述。这一点也呼应了训练曲线的观察ALFWorld 与 WebShop 上验证成功率在 100 个训练步内稳步上升同时每个任务的 executor 轮数持续下降即 curator 学会产出既提高成功率、又减少执行步数的 payload。第三层训练/评测设置的两项附加消融。由于静态训练 bank 造成轻微 train/test 分布偏移作者尝试staged bank refresh在 100 步 GRPO 后丢弃原训练 bank用训练后 curator 增强的轨迹重建 bank固定后再继续训练 50 步。WebShop 上它改善 SR——Qwen3-8B executor 从 32.8 提升到 35.62.8GPT-5.4 executor 从 45.4 提升到 46.30.9Gemini-2.5-Pro executor 无变化。增益相对额外训练成本是边际的说明静态 bank 已提供足够训练信号。另一项是test bank warm-starting即用训练集的 100 条轨迹预填充测试 bank 来缓解冷启动三个 executor 上的差异都可忽略SR 变化最多1.3且落在标准差内说明 curator 能优雅处理测试序列开始时的稀疏检索冷启动不是瓶颈。注意这两项在 ALFWorld 上未报告结果。此外检索数量k kk的敏感性也在 WebShop 上做了消融k 3 k3k3与k 5 k5k5相比所有设定下 SR 变化小于 2 个点Qwen3-8B 与 GPT-5.4 上的差异落在标准差内Gemini-2.5-Pro 上k 5 k5k5略降SR 50.5 → 48.6因此主结果统一取k 3 k3k3以提升效率。4.4 效率与跨执行器迁移 / Efficiency Transfer上下文效率方面ALFWorld 上用 GPT-5.4 executor 的平均 tokenK与每任务步数为MethodIn. Tok. (↓ \downarrow↓)Out. Tok. (↓ \downarrow↓)Steps (↓ \downarrow↓)No Memory9.01.4017.8ReasoningBank19.71.2616.2SkillOS-base22.41.3616.9JitMem-base10.91.0013.2JitMem9.80.8711.6所有记忆方法都会向 executor prompt 注入额外上下文因此输入 token 高于 no-memory但换来更少的步数与更少的输出 token。JitMem-base 的权衡明显更好相比 no memory 只增加1.9K输入 token而 ReasoningBank 增加10.7K、SkillOS-base 增加13.4K同时 executor steps 减少18.5%–21.9%。RL 训练进一步改善三项指标相比 JitMem-baseJitMem 输入 token 减少10.1%、输出 token 减少13.0%、步数减少12.1%。作者把这一点与“上下文中更高的信息密度与更高效的任务完成相关”的既有发现联系起来。摘要层面给出的区间是输入 token 相对写时方法减少50.3%–56.3%、executor 步数减少28.4%–31.4%。跨 executor 迁移是 JitMem 模块化设计的直接产物。由于 executor 在训练期间被冻结且 curator 与 executor 解耦一个只用 Qwen3-8B 训练过的 curator 可以不作任何重训就迁移到更强的 executor。ALFWorld 上的迁移结果SR为Curator trainingQwen3-8B executorGPT-5.4 executorNo training60.5 ± 2.679.3 ± 3.6Trained w/ Qwen3-8B exec.77.4 ± 2.986.7 ± 0.7Trained w/ GPT-5.4 exec.—88.1 ± 0.9迁移后的 curator 与直接用 GPT-5.4 训练的 curator 之间只差1.4 SR 点说明它学到的是可泛化的策展策略而不是 executor-specific 的模式。在 Gemini-2.5-Pro 与 GPT-5.4 executor 上迁移后的 curator 一致超过 JitMem-baseALFWorld6.2 / 7.4WebShop6.1并在 Gemini-2.5-Pro 上超过 RL 训练过的 SkillOS。一个训练好的 curator 可以服务多个 executor这在部署成本上是实质性优势。原论文对应图片Comparison of untrained vs.\ RL-trained curator payloads on the same input. The untrained curator produces a generic action sequence; the trained curator recovers the environment-specific workflow (move to the desklamp, then examine the bowl with it).五、相关工作 / Related Work论文把相关工作梳理为四条脉络并逐条指出区别所在。启发式写时记忆。这一类的代表包括 Reflexion言语化反思、ExpeL抽取的洞见、Generative Agents记忆流加周期性摘要、Voyager可执行技能、Agent Workflow Memory归纳出的工作流、MemP多粒度记忆项、自组织链接笔记以及 ReasoningBank从成功与失败中提取推理策略。较新的工作如 Ma et al. 2026 用预测误差信号判断哪些经验值得蒸馏为“存什么”增加了自适应性。作者的批判点在于它们的策展都在写时触发存储产物是查询无关的在任何未来任务出现前就已固定。其中最强、也最直接可比的实例是 ReasoningBank它用提示化的 LLM 蒸馏可迁移推理策略并按余弦相似度检索。学得的写时记忆。Retroformer 微调一个 retrospective 模型来改写 agent 的 prompt但只在单个任务实例内运作把记忆操作当作 RL 优化动作的方法包括 Memory-R1、Agentic Memory渐进式 GRPO 课程、Mementocase-selection 策略、Memory as a Controlled Process轻量控制策略MemRefine 通过 LLM 引导的合并离线压缩已存储的记忆库。它们的共同点仍然是在写时或维护时运作。最接近的先前工作是SkillOS它用 GRPO 训练技能 curator但必须把相关任务分组来制造延迟学习信号因为写决策的奖励只有等到未来查询命中时才会到达。JitMem 的区别正是把策展移到读时使奖励即时从而取消任务分组。学得的会话内工作记忆。Sculptor 与 ContextCurator 训练策略压缩或重构累积的观测历史MemSearcher 迭代重写定长工作记忆Proactive Memory Agent 学习长程任务中何时注入提醒Recuris 把步级工作记忆选择与跨任务技能演化结合。区别在于这些方法优化的是会话内/轮级上下文而 JitMem 策展的是跨任务的持久情景记忆。读时与测试时上下文处理。Synapse 检索完整轨迹作为示例但不做蒸馏、也不以当前新任务为条件MemToolAgent 根据相似度分布自适应决定检索多少条目但条目本身是写时蒸馏好的、读时原样返回Decocted experience 把过去轨迹蒸馏成 lessons但每个 lesson 仍是 query-independent 的且策略靠提示而非学习Agentic Plan Caching 抽取可复用的 plan templates但计划结构在抽取时就已固定SkillTTA 在测试时通过 meta prompt optimization 合成任务条件化的 skill但 skill 来自预构建池部署期间该池不增长。同期工作MemHarness也在读时策展、也用 GRPO 训练但它训练的是单一策略同时负责适配检索经验并执行任务由于策展与执行被纠缠在同一个模型里训练后的策略不能跨 executor 迁移。JitMem 的关键区别是把 curator 与 executor 解耦因此支持跨 executor 迁移并运行在持续增长的 streaming bank 之上。六、局限性与展望 / Limitations Future Work需要先说明论文的 Limitations 章节并未出现在本文档所获得的源码片段中因此以下第一段所列为作者在正文中明确承认的局限其后几条为基于实验设置与消融结果可以合理推断的研究注意事项本文不把它们冒充为作者的原文表述。作者明确承认的局限有三点。其一retriever 使用简单的 BM25当记忆库变得大而多样时它可能成为瓶颈而且 BM25 只检索任务描述无法感知轨迹内容的语义相似性。其二curator 对每个任务增加一次额外的 LLM 调用这带来额外推理延迟与成本尽管论文的效率分析表明它换回了更短的 executor 步数与更少的输出 token。其三payload 格式是固定的、并按 benchmark 手工设计的三个环境各有一套 curator prompt 与输出约定这限制了方法的即插即用性。作者提出的未来方向包括联合优化 payload 格式而不是手工设计探索更强的 retriever把策展从“每任务一次”扩展到turn-level 或 step-level 的自适应以便利用执行过程中新到达的观测。从实验设置与源码可以进一步识别出若干值得关注的问题。训练成本不低单次 GRPO 训练在 8×H200 上需要约 21 小时ALFWorld到 27 小时WebShop。τ 2 \tau^2τ2-bench 上只评估了无训练变体因为该 benchmark 不提供标准训练 split因此“训练式读时策展在对话式工具使用任务上是否仍然有效”这一问题尚未得到回答。静态训练 bank 与在线增长 bank 之间存在轻微分布偏移作者的 staged bank refresh 只能带来最多 2.8 SR 的边际增益说明这一偏移虽被量化但没有被根本解决同时也意味着“静态 bank 已够用”的结论是在特定规模下得到的。执行器模式与提示词强耦合Qwen3-8B 需要按环境切换 thinking / non-thinking且默认 thinking 格式指令在 non-thinking 模式下会导致退化输出这说明复现与迁移对配置相当敏感。此外WebShop 示例 payload 与执行器 search guidance 之间存在张力附录中的示例 payload 建议把颜色、尺寸、价格都写进搜索词而执行器 prompt 的 search guidance 却要求 search 只用短核心查询、属性通过商品页选择示例中 curator 同时也给出了“打开商品页选择颜色/尺寸”的步骤但这一致性问题提示 curator 与 executor 的行为约定之间还需要更显式的对齐。最后从结果覆盖看JitMem 并非在所有子集上都最优τ 2 \tau^2τ2-bench 的 Airline 域上 JitMem-gpt 为 63.5低于 No Memory 的 65.0增益主要来自 Retail 与 Telecom尤其是 Telecom 的 11.0。这说明读时策展的价值高度依赖任务是否需要合成程序性指导。七、总结 / ConclusionJitMem 的核心洞见可以概括为一句话有效的 agent memory 不仅取决于存储了什么经验还取决于何时、为哪个任务去策展这些经验。现有系统几乎都在写时把轨迹蒸馏成固定产物从而在下游任务还未知的情况下就不可逆地承诺了一种抽象方式同时训练这样的写时 curator 会面临长时程信用分配问题迫使研究者引入任务分组等脚手架。JitMem 把存储与策展彻底分离写时保留原始轨迹什么都不丢读时只在当前任务已知之后合成任务自适应的 payload。这一转变同时解决了两个问题——既避免了过早承诺单一抽象又把 curator 的学习从延迟未来效用问题转化为即时的单步目标使 GRPO 可以直接以同一任务的成功作为唯一奖励无需任务分组、无需延迟回报塑形、无需辅助的内容质量奖励。实证层面在 ALFWorld、WebShop 与τ 2 \tau^2τ2-bench 上即使完全未训练的读时 curator 也已与强写时基线持平或超过它们说明读时任务自适应策展本身就是主要增益来源RL 训练在此基础上进一步叠加提升同时改善效率并赋予跨 executor 迁移能力消融则确认了任务条件化、成功轨迹过滤与原始轨迹保留三者各自独立有贡献且 RL 训练学到的确实是“如何蒸馏检索到的经验”而不是获得了与检索无关的参数化知识。这些结论共同支持了一个更一般的判断在 agentic memory 的设计空间里“何时策展”与“存什么”同样重要而推迟到读时是一个被此前工作系统性忽略、却收益显著的选择。原文摘要:Agentic memory systems reuse past experience to improve future performance, yet most existing designs curate memory at write time: once a task is completed, its trajectory is distilled into a fixed artifact, such as a reflection, workflow, skill, or reasoning strategy, that is later retrieved by similarity. This forces the system to decide what is worth remembering before the future query is known, irreversibly discarding information and producing a query-independent summary that must serve many possible downstream tasks. Learning such a write-time curator is also difficult because the value of a storage decision may only become apparent when a relevant query arrives, potentially many tasks later, creating a long-horizon credit-assignment problem. We instead retain raw trajectories and defer curation until read time, when the current task is known. Given the retrieved traces and the new task, a memory curator synthesizes a compact, task-adaptive payload tailored to the immediate need. Because this payload is consumed on the same task, the curator can be trained directly from immediate task success, avoiding delayed utility signals and the need to artificially group related tasks. Across ALFWorld, WebShop, andτ 2 τ^2τ2-bench, our Just-in-Time Memory (JitMem) consistently outperforms no-memory agents as well as heuristic and learned write-time memory methods, improving over the strongest baseline by 16.2, 16.3, and 3.9 absolute success-rate points, respectively. Notably, even an untrained curator is already competitive with or surpasses these baselines, showing that task-adaptive read-time curation itself is a major source of the gain; training the curator further compounds the improvement.PDF链接:https://arxiv.org/pdf/2609.27334v1部分平台可能图片显示异常请以我的博客内容为准

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价 →
↑