资讯动态

Engram:大语言模型条件记忆新范式解析

发布时间:2026/9/12 11:52:47 来源:尧图企业网站定制
1. 论文核心思想解析Engram这篇论文提出了一种名为条件记忆Conditional Memory的新范式作为大语言模型稀疏化的新维度。传统MoEMixture of Experts通过条件计算来扩展模型容量而Engram则创新性地引入了O(1)复杂度的可扩展查找机制为Transformer架构补充了原生知识检索能力。1.1 条件记忆与传统方法的对比现有Transformer模型缺乏真正的记忆检索原语不得不通过计算来模拟检索过程这导致效率低下。Engram模块的灵感来源于经典的N-gram嵌入但进行了现代化改造静态记忆 vs 动态计算Engram将部分知识存储在静态内存中与MoE的动态计算形成互补确定性寻址采用哈希表实现O(1)查找避免传统注意力机制的二次复杂度基础设施感知支持运行时从主机内存预取硬件开销可忽略不计关键洞察论文发现将部分功能从计算转移到记忆不仅能提升知识检索能力还能显著改善推理和代码/数学能力。1.2 稀疏分配问题与U型扩展定律论文提出了稀疏分配问题Sparsity Allocation Problem揭示了神经计算MoE与静态记忆Engram之间的权衡关系。通过大量实验作者发现存在一个U型扩展定律小规模模型以MoE为主计算资源更高效中等规模需要平衡计算和记忆分配超大规模Engram的收益显著增加27B参数时性能超越纯MoE基线这个发现为模型架构设计提供了重要指导随着模型规模增长应当动态调整计算与记忆的分配比例。2. Engram技术实现细节2.1 模块架构设计Engram的核心是一个可扩展的键值存储系统主要包含三个组件记忆编码器将输入token映射为固定维度的键哈希索引层使用改良的Cuckoo哈希实现高负载因子90%值存储器存储经过量化的嵌入向量采用混合精度策略关键技术突破包括记忆分片按主题/领域划分记忆库提升局部性容错检索当精确匹配失败时返回top-k近似结果动态更新支持在线学习机制记忆内容可增量更新2.2 与Transformer的集成方式Engram与标准Transformer的集成采用了双通路设计class EngramEnhancedTransformer(nn.Module): def __init__(self, config): super().__init__() self.backbone Transformer(config) # 原始Transformer self.engram EngramMemory( vocab_sizeconfig.vocab_size, memory_dimconfig.hidden_size, num_slotsconfig.memory_slots ) def forward(self, x): # 并行执行 transformer_out self.backbone(x) memory_out self.engram(x) # 动态门控融合 gate torch.sigmoid(self.gate_proj(x)) return gate * transformer_out (1 - gate) * memory_out这种设计使得模型可以灵活地在原始计算通路和记忆检索通路之间分配权重。3. 实验效果与机制分析3.1 基准测试结果在27B参数规模下Engram相比纯MoE基线展现出全面优势测试项目纯MoEEngram提升幅度MMLU知识68.271.63.4BBH推理72.577.55.0HumanEval代码65.368.33.0MATH数学42.745.12.4值得注意的是Engram在长上下文检索任务Multi-Query NIAH中将准确率从84.2%提升至97.0%展现出极强的记忆检索能力。3.2 工作机制解读通过神经元激活分析和注意力模式可视化研究发现Engram通过两种机制提升性能计算卸载效应Engram承担了浅层网络的静态重构工作相当于有效加深了网络深度。在标准Transformer中前几层需要花费大量计算资源重建基础事实而Engram直接提供这些信息释放了计算资源用于高级推理。注意力专业化当局部依赖由Engram处理时注意力机制可以更专注于全局上下文建模。实验显示Engram增强模型的注意力头呈现出更清晰的功能分化部分头专门负责长距离依赖。4. 工程实践与优化技巧4.1 内存效率优化虽然Engram引入了额外参数但通过三项关键技术保持高效量化压缩对记忆值采用8bit量化配合动态范围调整共享记忆跨层共享部分记忆库减少冗余冷热分离将高频访问内容缓存在HBM低频内容存于主机内存4.2 实际部署考量在生产环境中部署Engram模型时有几个关键注意事项批处理策略由于记忆访问模式不规则建议使用动态批处理而非固定大小预取优化利用确定性寻址特性在计算当前批次时预取下一批次的记忆内容缓存管理实现LRU缓存淘汰机制避免内存膨胀一个典型的内存访问优化示例如下// 并行执行计算当前批次同时预取下一批次 #pragma omp parallel sections { #pragma omp section { compute_current_batch(); } #pragma omp section { prefetch_next_batch(); } }5. 未来发展方向虽然Engram已经展现出显著优势但仍有多个值得探索的方向动态记忆分配当前记忆大小是固定的可研究根据输入动态调整记忆容量的机制多模态扩展将条件记忆应用于视觉、语音等其他模态安全机制防止记忆被恶意污染或泄露敏感信息压缩极限探索更极端的记忆压缩技术如哈希冲突的主动利用在实际应用中我们发现Engram特别适合需要频繁访问结构化知识的场景如法律咨询、医疗诊断等专业领域。与传统微调相比通过Engram注入专业知识不会损害模型的通用能力且支持知识的热更新。

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价