摘要本文解读 arXiv 2025 论文《Titans: Learning to Memorize at Test Time》。该论文提出Titans 神经长期记忆架构通过融合短程注意力、测试时在线更新的神经记忆与可学习持久记忆三分支让模型在推理时把重要历史持续写入自己的网络权重其特别之处在于把记忆建模为在线学习问题——用惊奇度量决定记什么、动量保持记忆、权重衰减决定遗忘。实验表明760M 规模下 Wiki 困惑度达到 18.61、有效上下文超过 200 万 token并在 BABILong 百万级长文档推理上超越 GPT-4为长上下文序列建模提供了全新范式。视频讲解点击观看 B 站视频摘要论文基本信息背景与动机研究主线从问题到结论基准/方法设计分类全景方法细节实验设计与结果结果对比总结关键发现局限性常见问题FAQTitans 和 TTT 有什么区别MAC、MAG、MAL 三种变体怎么选Titans 为什么能超过 200 万 token为什么说 LMM 是 Gated DeltaNet 的推广神经记忆在非语言任务上表现如何有哪些已知局限参考链接论文基本信息项目内容标题英文Titans: Learning to Memorize at Test Time标题中文测试时记忆学习Titans 神经长期记忆架构作者Ali Behrouz, Peilin Zhong, Vahab Mirrokni机构Google Research会议arXiv 2025arXivhttps://arxiv.org/abs/2501.00663项目网站https://arxiv.org/abs/2501.00663背景与动机Transformer 的注意力机制本质上是一块联想记忆模型存储键值关联并用查询与键的相似度做检索。但注意力对当前上下文窗口之外的依赖无能为力且计算量随序列长度二次增长——2 万 token 以上的序列就难以承受。另一条路线是线性注意力与状态空间模型Mamba、Mamba2、GLA、RetNet 等它们把历史压缩进固定大小的矩阵状态推理成本线性但压缩导致精度下降加性写入还会造成记忆溢出。从记忆科学视角看两者都缺少人类记忆系统的关键组件短期记忆、长期记忆、元记忆持久记忆以及它们之间的协同。Titans 的核心主张长期记忆不该是固定结构而应该是一个神经网络在测试时用联想记忆损失在线更新自己的权重——越是出乎意料惊奇的信息越值得记住。这正是与 TTT、DeltaNet 一脉相承的测试时学习思想但 Titans 补上了遗忘门、动量更新与深度记忆三个关键设计。研究主线从问题到结论图 7Titans 研究主线Mermaid 流程图问题 → 动机 → 设计 → 方法 → 实验 → 结论基准/方法设计Titans 架构包含三个分支核心分支用滑动窗口注意力负责短程精确建模长期记忆分支是神经记忆模块LMM把过去的历史在线压缩进 MLP 权重持久记忆分支是一组输入无关的可学习参数编码任务级知识。作者给出三种接入方式MACMemory as Context把记忆检索结果作为上下文拼进注意力输入注意力同时决定需要哪些历史与哪些信息值得写入MAGMemory as Gate用门控机制融合记忆输出与滑动窗口注意力输出MALMemory as Layer把记忆作为网络中的一层先压缩再交给注意力。图 1Memory as a ContextMAC架构核心注意力 上下文长期记忆 持久记忆三分支分类全景图 8Titans 记忆系统分类全景Mermaid 流程图短程注意力、神经长期记忆 LMM 与持久记忆方法细节记忆模块的四个关键设计惊奇度量Surprise用输入梯度 $\nabla \ell(\mathcal{M}_{t-1}; x_t)$ 衡量意外程度——梯度越大说明输入越偏离已有记忆越值得记住动量式更新$S_t \eta_t S_{t-1} - \theta_t \nabla \ell$过去与当前的惊奇共同决定写入避免一次大惊奇后梯度消失、错过后续重要信息自适应遗忘权重衰减门 $\alpha_t$ 管理有限容量$\alpha_t \to 0$ 保留记忆、$\alpha_t \to 1$ 清空记忆等价于数据依赖的遗忘机制并行化训练逐 token 串行梯度下降被重写为分块矩阵乘法 并行关联扫描训练吞吐随序列长度线性扩展。图 2神经记忆的并行化训练分块内用 matmul 与关联扫描避免串行 O(N) 内循环理论结果同样重要Titans 的深度记忆在状态追踪任务上表达力超出 TC⁰而 Transformer 与多数线性循环模型被限制在 TC⁰ 内。附录中进一步证明LMM 是 Gated DeltaNet 的严格推广——DeltaNet、Longhorn、RWKV-7、TTT 均可视为其特例LMM 补上了动量规则、深度记忆与遗忘门。图 5Memory as a LayerMAL架构记忆层先压缩过去与当前上下文再交给滑动窗口注意力实验设计与结果评测覆盖 170M / 340M / 400M / 760M 四档规模前三个在 FineWeb-Edu 的 15B token 上训练760M 用 30B token。任务分五类语言建模WikiText、LMB、常识推理PIQA、HellaSwag、WinoGrande、ARC、SIQA、BoolQ、长上下文RULER S-NIAH、BABILong、时间序列ETT、ECL、Traffic、Weather与 DNA 建模GenomicsBenchmarks。基线包括 Transformer、Mamba、Mamba2、GLA、RetNet、DeltaNet、Gated DeltaNet、TTT 及混合模型 Samba、Gated DeltaNet-H2。760M / 30B tokens 语言建模主表模型Wiki ppl↓LMB ppl↓LMB acc↑平均 acc↑Transformer25.2127.6435.7848.69Mamba222.9428.3733.5448.34TTT24.1723.5134.7447.32Gated DeltaNet-H2*19.8820.8339.1851.49Titans (MAC)*19.9320.1239.6252.51Titans (MAG)*18.6119.8640.9852.50Titans 在困惑度与推理两个维度同时压过同规模全部模型MAG 的 Wiki 困惑度 18.61 比最强混合基线 Gated DeltaNet-H2 低 1.27平均准确率 52.51MAC领先 1.02 个百分点。纯记忆模块 LMM不带注意力在简单模型中同样最优证明记忆机制本身有效。图 3BABILong 微调设定TitansMAC在 1M 级长文档推理上超越 GPT-4 等超大模型图 4训练吞吐对比TitansMAL吞吐随序列长度保持恒定快于多数循环基线长上下文是 Titans 的主场。S-NIAHRULER 基准中序列从 2K 拉到 16K 时 TTT 从 98.4 掉到 88.4、Mamba2 从 98.6 崩到 5.4、DeltaNet 从 96.8 掉到 71.4而 Titans 三个变体在 16K 仍保持 96 以上MAC 达 98.4BABILong 微调设定下TitansMAC以不到 8 亿参数超越 Llama3.1-8BRAG、GPT-4 与 Qwen2.5-72B。时间序列预测中神经记忆在 7 个数据集的 6 个取得最优 MSEETTm2 0.261、ECL 0.162、Weather 0.231 等全面优于 Simba、iTransformer、PatchTST。DNA 建模GenomicsBenchmarks上神经记忆在 Enhancer Cohn75.2与 Enhancer Ens89.6取得最优与最强 DNA 模型 HyenaDNA 竞争性相当。消融实验附录 E显示所有组件均为正向贡献影响排序为权重衰减 动量 卷积 持久记忆去掉权重衰减后长上下文准确率从 92.68 掉到 85.60印证遗忘机制对记忆容量管理的核心作用记忆深度从 1 层增加到 4 层困惑度持续下降且对序列长度更鲁棒但吞吐随深度线性下降存在效果与效率权衡。图 6不同记忆深度下 ppl 随序列长度的变化更深的记忆在更长序列上收益更明显170M 规模结果对比总结图 9结果对比总结Mermaid 流程图Titans 在困惑度与准确率双维度领先基线关键发现记忆即在线学习长期记忆是一个在测试时做梯度下降的神经网络联想记忆损失 $\ell | \mathcal{M}(k_t) - v_t |_2^2$ 驱动写入这是全文最核心的范式转变。有效上下文超 200 万 token在 S-NIAH 与 BABILong 上Titans 在 16K–1M 级序列保持 96% 以上准确率而 Mamba2 在 16K 时已跌至 5.4%。760M 规模全面领先Wiki 困惑度 18.61MAG与平均准确率 52.51MAC同时击败同规模 Transformer25.21 / 48.69与全部混合基线。纯记忆模块即可打满全场不带注意力的 LMM 在简单模型中困惑度最优760M 下 20.04证明记忆机制独立有效。精度与效率兼得MAL 变体训练吞吐高于多数循环基线得益于 Flash-Attention 与并行化记忆更新的组合。跨领域泛化时间序列 6/7 数据集最优、DNA 建模与 SOTA 竞争性相当机制不止适用于自然语言。局限性规模验证有限论文第一版仅报告到 760M / 30B token更大规模的结论待后续版本。实现开销深度记忆的测试时更新带来额外计算吞吐略低于内核高度优化的 Mamba2。可解释性不足记忆写入权重的语义难以直接审计不像 KV 缓存那样显式可读。流式稳定性测试时持续学习在长流式场景下的稳定性仍需更充分验证。作者计划开源 PyTorch / JAX 实现并接入更复杂的记忆架构如进化记忆、Muon 类更新。常见问题FAQTitans 和 TTT 有什么区别TTT 是 Titans 最接近的前作两者都把记忆当作梯度更新的模型。但 TTT 没有遗忘机制长序列会记忆溢出Titans 引入权重衰减自适应遗忘门、动量式惊奇更新与深度记忆并在消融中验证了每个组件的贡献。MAC、MAG、MAL 三种变体怎么选MAC 长上下文最强注意力帮记忆筛选信息、MAG 语言建模困惑度最低18.61、MAL 训练吞吐最高注意力走 Flash-Attention。追求长程推理选 MAC追求吞吐选 MAL。Titans 为什么能超过 200 万 token因为长期记忆是参数化的历史被在线压缩进网络权重而非显式 KV 缓存推理成本不随历史长度增长短程注意力只处理当前窗口两者叠加使有效上下文远超窗口大小。为什么说 LMM 是 Gated DeltaNet 的推广DeltaNet / Gated DeltaNet 的 Delta 规则只考虑瞬时惊奇且限于线性矩阵记忆LMM 加入动量规则、深度 MLP 记忆与非线性递推令前者成为 $\eta_t 0$ 时的特例RWKV-7、Longhorn 同理。神经记忆在非语言任务上表现如何时间序列预测 7 个数据集中 6 个取得最优 MSE如 ETTm2 0.261、Weather 0.231DNA 建模在 GenomicsBenchmarks 与 HyenaDNA 竞争性相当说明记忆机制对结构化数值与生物学序列同样有效。有哪些已知局限760M 规模封顶、吞吐略慢于 Mamba2、记忆权重不可解释、流式场景稳定性待验证代码当时尚未开源社区复现需自行实现。参考链接arXiv 论文页https://arxiv.org/abs/2501.00663Mamba线性时间序列建模https://arxiv.org/abs/2312.00752TTT测试时学习的 RNNhttps://arxiv.org/abs/2407.04620Gated Delta Networkshttps://arxiv.org/abs/2412.06464Agent Memory SurveyTitans 列为参数化记忆代表https://arxiv.org/abs/2512.13564给大家推荐一款自用写文献综述、无虚构文献的 AI复旦大学 FudanNLP 团队自研 切问学术官网qiewenpaper.com覆盖3.6 亿篇可溯源真实中英文文献能自动整合文献观点生成规范综述还能挖掘研究创新点、复现实验配合视频教学新手快速上手文献综述写作后记博客的关键词集中在编程、算法、机器人、人工智能、数学等等持续高质量输出中。讨论QQ群白拾的小屋 (750365700)⭐B站账号白拾的物理AI组会活跃于知识区和动画区✨GitHub主页YhbCode000工程文件