资讯动态

【EMNLP 2025 (Oral)】MemoryOS 论文解读:给 AI 智能体装上记忆操作系统|从智能体长期记忆工程视角

发布时间:2026/9/16 7:09:47 来源:尧图企业网站定制
摘要本文解读 EMNLP 2025 Oral 论文《Memory OS of AI Agent》它提出MemoryOS——一个把操作系统内存管理思想搬进对话记忆的智能体记忆系统。论文通过融合三级分层存储STM/MTM/LPM、对话链与段页式组织、热度驱动的换页与检索调度让大模型在数百轮长对话里既记得住细节、又保得住用户长期偏好其特别之处在于把记忆从一堆互不相关的技巧升级为一套统一的、可配置的操作系统策略。实验表明在 LoCoMo 基准上 F1 平均提升 49.11%、BLEU-1 提升 46.18%GPT-4o-mini 底座同时每次响应的检索 token 消耗只有 MemGPT 的约四分之一、LLM 调用次数只有 A-Mem 复现版的约三分之一为长对话智能体的记忆管理提供了可复用的架构范式。视频讲解点击观看 B 站视频摘要论文基本信息背景与动机研究主线从问题到结论系统设计三级存储与段页式组织分类全景三类记忆各自解决什么方法细节热度换页与两阶段检索实验设计与结果结果对比总结关键发现局限性常见问题FAQMemoryOS 和 MemGPT 有什么区别热度Heat是怎么算的检索一次要取多少内容它在哪些基准上验证过代码开源吗提升主要来自哪一部分参考链接论文基本信息项目内容标题英文Memory OS of AI Agent标题中文MemoryOS给 AI 智能体装上记忆操作系统作者Jiazheng Kang, Mingming Ji, Zhe Zhao, Ting Bai机构北京邮电大学 BAI-LAB百家 AI 团队 · 腾讯 AI Lab会议EMNLP 2025主会 OralACL Anthology 2025.emnlp-main.1318arXivarXiv:2506.06326项目网站github.com/BAI-LAB/MemoryOS1,500 stars含 MCP 服务背景与动机大语言模型的上下文窗口是固定长度的而用户与助手之间的关系不是。一旦对话跨越多个会话、间隔数周固定窗口就会把早期信息挤出上下文表现为前后矛盾、重复提问、个性化断裂。论文把这类问题归纳为一句话现有模型在长程对话的时间跨度上无法维持连续性。围绕这个缺口已有工作大致分为三类但每一类只优化一个维度知识组织类Think-in-MemoryTiM把推理产物而不是原始对话存进记忆用局部敏感哈希LSH检索A-Mem 把知识组织成互相链接的笔记网络语义表达丰富但多步建链带来额外延迟与误差累积。检索机制类MemoryBank 用艾宾浩斯遗忘曲线调整记忆强度并构建用户画像AI-town 保留自然语言记忆并加入反思回路EmotionalRAG 把情绪状态纳入检索权重。这一类的共性问题是缺少主题层面的结构遗忘曲线也回答不了该存什么。架构驱动类MemGPT 借鉴操作系统设计主上下文与外部上下文两层并暴露显式的read/write调用Self-Controlled MemorySCM用双缓冲加记忆控制器做选择性召回。它们是最接近的思路但层级是固定的两层淘汰策略只是一个扁平的 FIFO 队列——对话一长不同主题就被混在一起。论文的问题链因此很清楚只做存储结构、只做检索效率、或只做更新策略都不足以支撑长期记忆缺的是把它们统一起来的操作系统。操作系统领域早已给出成熟答案Multics 式的分段分页用来平衡逻辑结构与物理利用率LRU 与工作集模型用访问频率与时间衰减决定哪些数据留在内存、哪些被换出。MemoryOS 的判断是——对话记忆完全可以套用同一套机制主题即段、问答即页、频繁被访问的主题自动变热冷门主题自然出局。这也是它拿下 EMNLP 2025 Oral 的叙事基础不是又加了一个检索器而是把“记忆管理”整体重述为一个已经存在解法的工程问题。延伸视角时间线定位。2023–2024 年MemGPT、MemoryBank、TiM、A-Mem 让外部记忆进入大模型智能体但组织方式与淘汰规则仍由工程预定义2025 年MemoryOS 第一次把操作系统的分段分页与热度换页完整搬进对话记忆2025–2026 年Mem0、Zep、MemOS 以及各类 MCP 记忆服务把分层记忆与可插拔记忆做成智能体标配记忆管理正从“某个模块的实现”变成跨模型、跨模态的基础设施。用创新模式的语言说它同时命中了“统一异构输入”把短期对话、主题化历史、长期画像统一进一套体系与“审计并扭转负载假设”审计“记忆只需在固定窗口里检索”这一前提验证方式则是实测——移除记忆系统后指标直接崩塌。另需提醒的是论文定稿把 Limitations 一节整段注释掉、也删去了提示词模板附录正文与图表中还留有若干拼写残留如 resutls、machinism、“Memorias”图例、“GPT-40-mini”读原文时需要注意。研究主线从问题到结论系统设计三级存储与段页式组织MemoryOS 的第一层设计是确定存储的粒度。系统把一次问答冷却成一个对话页$page_i{Q_i,R_i,T_i}$即用户提问、模型回答与时间戳短期记忆STM就是保存这些对话页的定长队列论文中容量取 7。为了不让页与页之间失去联系每一页还带一段由大模型生成的链式元信息先判断新页是否延续上一页的话题再把整条链总结成一句上下文摘要——这条对话链让跨主题但语义连续的几轮对话保持可追溯。第二层是中期记忆MTM的段页结构。同主题的对话页被聚成一个“段”段的划分不靠人工规则而由匹配分 $\mathcal{F}_{score}\cos(\mathbf{e}_s,\mathbf{e}_p)\mathrm{Jaccard}(K_s,K_p)$ 决定其中 $\mathbf{e}_s$ 与 $\mathbf{e}_p$ 是段与页的嵌入向量$K_s$ 与 $K_p$ 是大模型抽取的关键词集合匹配分超过阈值 $\theta0.6$ 的页被并入该段。语义相似度负责捕捉“意思相近”关键词重合度负责捕捉“用词相同”两者相加避免单一信号的偏差。第三层是长期个人记忆LPM分用户与智能体两侧用户侧包含静态画像性别、称呼、出生年、持续抽取的知识库与 90 维特质基础需求与人格、AI 对齐维度、内容平台兴趣标签智能体侧包含角色设定与随交互演化的特质。知识库与智能体特质各用 100 条 FIFO 队列维持容量。分类全景三类记忆各自解决什么把三级记忆按存什么、管什么、为谁服务摊开看结构会更清楚方法细节热度换页与两阶段检索模块层面MemoryOS 由存储、更新、检索、生成四部分构成真正让它区别于既有系统的是更新与检索之间的闭环。更新靠热度。每个段维护一个标量热度 $Heat\alpha \cdot N_{visit}\beta \cdot L_{interaction}\gamma \cdot R_{recency}$其中时间衰减项为 $R_{recency}\exp(-\Delta t/\mu)$。$N_{visit}$ 是该段被检索到的次数$L_{interaction}$ 是段内对话页数量$R_{recency}$ 按距上次访问的时间做指数衰减论文把三个权重都设为 1时间常数 $\mu$ 取 $10^{7}$。当段数超过上限 200 时淘汰热度最低的段当某段热度超过阈值 5 时它会被升级到长期记忆由大模型从中抽取用户特质、知识库条目与智能体特质——升级后该段的 $L_{interaction}$ 归零热度随之下降从而避免同一批内容被反复抽取。检索分两阶段。短期记忆全量取回中期记忆先按匹配分选出前 $m5$ 个段再在段内按语义相似度取前 $k$ 个对话页GVD 上 $k5$、LoCoMo 上 $k10$长期记忆则从知识库与智能体特质中各取语义最相关的 10 条。关键在于检索会反过来更新热度每次命中都会刷新该段的访问次数与最近访问时间也就是说——被反复用到的记忆会越来越热长期没人碰的段自动降温出局。存储策略与使用行为由此形成闭环。实现上整个系统的超参数只有十几个全部公开在论文里$k_{MTM}$、$\theta$、$\tau$ 等配置项取值配置项取值STM 队列长度7MTM 段上限200段落匹配阈值 $\theta$0.6热度阈值 $\tau$5热度权重 $\alpha,\beta,\gamma$1, 1, 1时间常数 $\mu$$10^{7}$检索段数 top-$m$5检索页数 top-$k$5GVD/ 10LoCoMo用户知识库与智能体特质各 100 条用户特质维度90 维3 大类实验设计与结果评测在两个长对话基准上展开。GVD包含 15 个虚拟用户与助手 10 天的多轮对话、每天至少两个话题由 DeepSeek-R1 自动打分指标是记忆检索准确率、回答正确性与连贯性三档打分LoCoMo是专门为长期记忆设计的超长对话基准平均 300 轮、约 9K tokens问题分成单跳、多跳、时间与开放域四类用 F1 与 BLEU-1 评估。基线包括 TiM、MemoryBank、MemGPT 与 A-Mem其中 A-Mem 的原论文结果记为 A-Mem本文同环境复现记为 A-Mem*。GVD 结果GPT-4o-mini 底座检索准确率 93.3、正确性 91.2、连贯性 92.3三项全部领先相对最强基线 A-Mem 分别提升 3.2%、5.4% 与 1.0%。同底座换用 Qwen2.5-7B 后MemoryOS 依旧最优91.8 / 82.3 / 90.5检索准确率相对 A-Mem 提升 5.3%。方法GVDGPT-4o-mini检索准确率正确性连贯性TiM84.578.890.8MemoryBank78.473.391.2MemGPT87.983.289.6A-Mem90.486.591.4MemoryOS93.391.292.3LoCoMo 结果四类问题的 F1 全部第一平均排名 1.0时间推理相对 MemGPT 提升 118.80%单跳提升 32.35%开放域提升 18.47%。换到 Qwen2.5-3B 底座后结论不变23.26 / 21.44 / 10.18 / 26.23平均排名同样 1.0。方法LoCoMo F1单跳多跳时间开放域TiM16.2518.438.3523.74MemoryBank5.009.685.566.61MemGPT26.6525.529.1541.04A-Mem*22.6133.238.0434.13MemoryOS35.2741.1520.0248.62成本也一起降。每次响应MemoryOS 消耗 3,874 个检索 token、平均 4.9 次大模型调用平均 F1 达 36.23对比 MemGPT 的 16,977 tokens / 4.3 次调用 / 29.13 F1以及 A-Mem* 的 2,712 tokens / 13.0 次调用 / 26.55 F1——token 只有 MemGPT 的约四分之一调用次数只有 A-Mem* 的约三分之一效果反而最好。方法LoCoMo 效率检索 tokens平均 LLM 调用平均 F1MemoryBank4323.06.84TiM1,2742.618.01MemGPT16,9774.329.13A-Mem*2,71213.026.55MemoryOS3,8744.936.23消融实验回答了哪一层在起作用。去掉整套记忆系统后GVD 检索准确率跌到 2.7、正确性 6.8LoCoMo 四类 F1 只剩 1.16–4.56长对话回答几乎完全失效在保留系统的前提下移除中期记忆损失最大LoCoMo 多跳 F1 从 41.15 掉到 12.12其次是长期画像时间推理从 20.02 掉到 17.81对话链影响最小单跳从 35.27 降到 31.42。退化排序在 GVD 与 LoCoMo 上完全一致MTM LPM Chain说明分层存储本身承担主要负载。召回不是越多越好。检索页数 $k$ 的敏感性分析显示$k$ 从 5 增到 10 带来最大跃升单跳 F1 25.13 → 35.27、多跳 25.42 → 41.15、时间 12.11 → 20.02、开放域 29.32 → 49.62此后收益迅速递减$k40$ 时多数类别反而回落——多余内容变成噪声论文因此默认取 10。定性案例跨会话细节 长期目标。在同一个对话历史下默认模型想不起来几周前提过的湿地公园、跑步、看到松鼠而 MemoryOS 能把这些细节召回并串联更进一步当用户说想吃汉堡时系统会结合他此前想变瘦的目标主动提醒一句——这正是中期记忆的段页存储、对话链与 persona 模块同时生效的结果。结果对比总结关键发现优势随任务难度放大在已经接近饱和的 GVD 上仍有 3.2% 的检索准确率相对提升在更难的 LoCoMo 上时间推理 F1 相对 MemGPT 提升118.80%20.02 vs 9.15单跳提升32.35%。效果与成本同时改善每次响应3,874 tokens / 4.9 次调用对比 MemGPT 的 16,977 tokens 与 A-Mem* 的 13.0 次调用token 约为前者四分之一、调用次数约为后者三分之一。分层存储是承重结构消融中 MTM 移除损失最大多跳 F1 41.15 → 12.12LPM 次之时间推理 20.02 → 17.81Chain 最小但仍有贡献单跳 35.27 → 31.42。退化排序跨数据集一致GVD 与 LoCoMo 上的组件重要性排序完全一致说明结论不是单一基准的偶然。召回存在拐点$k$ 从 5 到 10 的增益最大$k40$ 时多数类别回落召回越多越好不成立。架构收益与底座无关GPT-4o-mini、Qwen2.5-7B、Qwen2.5-3B 三类底座上均取得最优平均排名1.0说明分层记忆不是针对某个模型的调优产物。局限性超参数缺少理论依据STM 队列长度 7、MTM 段上限 200、热度权重与阈值都是经验设定论文没有给出基于认知模型或理论推导的容量配置方法。主题不会自动合并段落划分依赖大模型抽取能力缺少相似主题的动态合并机制话题重叠或演化时会残留冗余段。评测仍限于文本只在 GVD 与 LoCoMo 两个文本基准、三类底座模型上验证未覆盖多模态记忆与真实线上长周期部署。成本结构依赖大模型对话链判定、主题摘要与 persona 抽取都要调用大模型平均 4.9 次调用对低延迟场景仍是负担。论文草稿给出的方向是从人类记忆机制出发推导更原则化的容量配置并为中期记忆引入自适应主题合并。需要说明的是定稿版本中 Limitations 一节被整段注释掉这些内容来自作者草稿。常见问题FAQMemoryOS 和 MemGPT 有什么区别两者都借用操作系统的隐喻但 MemGPT 只有主上下文与外部上下文两层淘汰策略是扁平的 FIFO 队列MemoryOS 把中期记忆组织成段页结构主题分段、问答分页并用热度访问次数 交互长度 时间衰减决定保留与升级因此对话变长后主题不会混在一起。热度Heat是怎么算的$Heat\alpha N_{visit}\beta L_{interaction}\gamma R_{recency}$其中 $R_{recency}\exp(-\Delta t/\mu)$。论文取 $\alpha\beta\gamma1$、$\mu10^{7}$段数超过 200 时淘汰热度最低的段热度超过 5 的段升级到长期记忆。检索一次要取多少内容中期记忆两阶段检索先取匹配分最高的 $m5$ 个段再在段内取 top-$k$ 个对话页GVD $k5$、LoCoMo $k10$长期记忆从用户知识库与智能体特质中各取 10 条。$k$ 继续增大收益递减$k40$ 时多数类别反而回落。它在哪些基准上验证过两个GVD15 个虚拟用户与助手 10 天多轮对话用 DeepSeek-R1 三档打分与 LoCoMo平均 300 轮、约 9K tokens 的超长对话四类问题。底座模型覆盖 GPT-4o-mini、Qwen2.5-7B 与 Qwen2.5-3BMemoryOS 在所有组合上都取得最优平均排名。代码开源吗开源。项目地址为 github.com/BAI-LAB/MemoryOS仓库明确标注 EMNLP 2025 Oral目前已有 1,500 stars并提供 MCP 服务接口以便接入各类智能体应用。提升主要来自哪一部分消融实验显示主要来自中期记忆移除 MTM 后 LoCoMo 多跳 F1 从 41.15 掉到 12.12其次是长期画像时间推理 20.02 → 17.81对话链贡献最小单跳 35.27 → 31.42。三者合起来构成完整的分层记忆体系。参考链接论文 arXiv 摘要页arXiv:2506.06326 Memory OS of AI Agent开源代码与项目主页github.com/BAI-LAB/MemoryOSMemGPT: Towards LLMs as Operating Systems最近的 OS 式基线arXiv:2310.08560A-Mem: Agentic Memory for LLM AgentsNeurIPS 2025最强基线arXiv:2502.12110MemoryBank: Enhancing Large Language Models with Long-Term Memory遗忘曲线 用户画像arXiv:2305.10250LoCoMoEvaluating Very Long-Term Conversational Memory of LLM AgentsarXiv:2402.17753Think-in-MemoryTiMarXiv:2311.08719给大家推荐一款自用写文献综述、无虚构文献的 AI复旦大学 FudanNLP 团队自研 切问学术官网qiewenpaper.com覆盖3.6 亿篇可溯源真实中英文文献能自动整合文献观点生成规范综述还能挖掘研究创新点、复现实验配合视频教学新手快速上手文献综述写作后记博客的关键词集中在编程、算法、机器人、人工智能、数学等等持续高质量输出中。讨论QQ群白拾的小屋 (750365700)⭐B站账号白拾的物理AI组会活跃于知识区和动画区✨GitHub主页YhbCode000工程文件

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价