资讯动态

冻结大模型也能自我进化?这篇论文让大模型靠“图记忆”自我进化

发布时间:2026/9/6 3:19:34 来源:尧图企业网站定制
一、这篇论文到底想解决什么问题大语言模型智能体要想在部署之后继续进步通常需要回答两个问题第一它下一步应该学什么第二它已经学到的东西应该如何保存过去的自我进化智能体大多采用三类方式保存经验①自然语言反馈例如让一个教师模型给学生模型写反思、建议或批评。优点是直观缺点是容易变成泛泛而谈的建议尤其当错误模式比较系统时反馈很可能不够结构化。②扁平化的经验记忆例如保存过去的轨迹、答案、原则或案例。优点是能复用历史经验缺点是这些记忆往往像一个“经验仓库”缺少任务类型、技能依赖、课程覆盖等结构信息。③隐式强化学习信号例如通过奖励更新模型参数。优点是可以真实改变模型行为缺点是需要可训练的学生模型而且进化过程不够透明不容易知道模型到底学到了什么。作者提出的问题是能否把自我进化的载体从模型参数或自由文本反馈转移到一个结构化图谱中换句话说即使执行模型本身是冻结的它能不能依靠外部图记忆不断变强这就是 MAGE 的出发点。二、MAGE 的一句话理解MAGE 可以被理解为一个让冻结大模型通过“外部知识图谱 成功/失败双记忆 多智能体协作 bandit 策略选择”实现持续进化的框架。它的关键不是继续微调模型而是把“学到的东西”写进一个外部结构中。这个外部结构叫EVOKGCo-Evolutionary Knowledge Graph共进化知识图谱。EVOKG 并不是普通的检索库。它同时记录模型会什么技能当前任务属于什么类型哪些错误曾经发生过哪些正确推理可以复用环境中出现过什么状态、实体和关系哪些任务应该在后续轮次被重新训练或重点关注。因此MAGE 的自我进化不是“模型参数变了”而是图谱在变记忆在变检索策略在变推理路径在变。冻结模型每次推理时都会从这个不断成长的图谱中取出和当前任务最相关的成功案例与失败纠正再把这些内容作为上下文提示辅助自己完成当前问题。三、EVOKG论文最核心的“外部大脑”作者将 EVOKG 设计成一个 typed directed multigraph也就是带类型的有向多重图。它由四个子图组成1. 能力子图Gcap能力子图用于描述智能体掌握的技能。每个技能节点包括技能名称mastery 掌握度prompt template 提示模板strategy 推理策略principles 原则知识prerequisite 前置依赖关系。它的作用类似一张“能力地图”系统不仅知道某个技能是否存在还知道这个技能依赖哪些前置技能以及当前掌握程度如何。2. 任务子图Gtask任务子图用于描述任务类型及其依赖关系。例如数学推理、日期比较、多跳问答、金融数值计算、网页购物导航等都可以被组织成不同任务类型。任务子图和能力子图之间还有连接关系SKILL_FOR_TASK某个技能可以解决某类任务。这样一来系统在遇到任务时不只是检索相似文本而是可以进一步判断这个任务需要什么技能这个技能以前有哪些成功经验这个任务类型以前犯过什么错3. 经验子图Gexp经验子图是整篇论文最重要的部分。作者在这里保存五类经验节点①principle memories原则记忆由强教师模型总结出的抽象规则。②failure memories失败记忆由教师模型根据错误案例写出的纠正示例包括错误答案、正确推理、正确答案。③success memories成功记忆来自冻结执行模型自己曾经答对的问题包括问题、推理轨迹、答案以及多步任务中的技能分解过程。④retrieval recipes检索配方用于指导后续如何检索合适经验。⑤abstracted patterns抽象模式从交互轨迹中总结出的行为模式。其中最关键的是失败记忆 成功记忆。失败记忆告诉模型以前这个类型的问题错在哪里正确做法是什么。成功记忆告诉模型冻结模型自己曾经怎样正确解决过类似问题。这两类记忆不是互相替代而是互补。4. 环境子图Genv环境子图保存智能体在外部世界中遇到的状态、实体、关系和任务上下文。这对于 Crafter、WebShop 这类顺序决策环境尤其重要。因为模型不是只回答一个静态问题而是需要在环境中连续行动例如探索、购买、选择、导航、使用工具等。小结一句EVOKG 的本质是把智能体过去的经验从一堆散乱文本升级成一个可检索、可更新、可分析、可控制的结构化记忆系统。四、MAGE 如何进化六个智能体共同完成一轮循环作者将 MAGE 设计成一个两层架构上层Guidance Tier强指导层这一层使用更强的教师模型例如 Claude Opus、Sonnet、Haiku。它不直接参与最终部署推理而是在进化阶段负责写图谱包括发现技能总结原则写失败记忆生成动态工具优化检索配方协助规划课程。下层Execution Tier冻结执行层这一层使用冻结的开源 8B 模型例如 Qwen3-8B 或 Llama-3.1-8B-Instruct。它负责真正执行任务、回答问题、在环境中生成行动轨迹。重点是执行模型不更新参数。所有跨轮次学习都通过 EVOKG 和两个 bandit 保存下来。一轮 MAGE 进化大致分成六步①PLANNavigator 制定学习计划系统根据当前图谱状态找到应该重点学习的技能和任务。②EXPLOREExplorer 探索环境在顺序环境中冻结执行模型根据计划生成交互轨迹。③EVALUATECritic 评价答案Critic 判断答案是否正确并产生奖励信号。④UPDATECurator 更新图谱正确答案会被写成成功记忆技能 mastery 会被更新失败案例会被整理。⑤EVOLVE教师模型写入新知识强教师层根据错误写失败记忆、总结原则、生成工具或拆分技能。⑥SNAPSHOT保存快照并防止退化如果某一轮更新导致性能下降超过阈值MAGE 会回滚可变部分例如 mastery、prompt template、strategy。但已经写入的核心经验记忆不会删除。五、为什么它能稳定进步作者给出的理论支撑这篇论文不只是提出一个系统还试图解释为什么这个系统在冻结模型场景下有可能持续改进。作者给出四个结构性结论。1. 追加式记忆带来信息单调性MAGE 对三类核心经验采用 append-only 规则principle memoriesfailure memoriessuccess memories。这些节点一旦写入就不会被删除。作者证明在这种机制下EVOKG 中关于答案变量的信息不会随着迭代减少。直观理解就是只要关键经验不被删掉图谱至少不会忘记已经积累的核心知识。这也是 MAGE 能够用外部记忆承载学习信号的基础。2. 轮转式课程选择避免只盯着一种错误如果系统只按照失败次数选择任务它可能会一直盯着某几个高错误任务导致其他任务长期得不到更新。因此作者使用 recency-weighted round-robin 策略任务得分 失败次数 距离上次被选中的时间奖励这使得两类任务都会被关注错得多的任务很久没有被训练的任务。作者证明这种机制可以给任务覆盖提供一个上界即每个已经观察到的任务类型都不会被无限期忽略。非对称 mastery 更新减少灾难性遗忘作者没有让技能掌握度根据一次测量剧烈下降而是使用非对称更新如果本轮表现更好mastery 快速上升如果本轮表现变差mastery 缓慢下降。这种设计像一个“棘轮”好表现可以较快积累坏表现不会立刻抹掉之前的能力判断。它可以降低短期波动对课程规划的干扰。4. 任务过滤检索让记忆更可用MAGE 在推理时不会把所有相似记忆都拿来而是先按照 task type 过滤再在对应任务类型中检索 top-K 经验。这样可以减少错误迁移。例如一个 HotpotQA 的日期比较问题不应该随便检索到数学算术题的经验一个 WebShop 的动作配方也不应该混入医学选择题的记忆。作者强调这个理论结果不是保证任何 LLM 都一定变强而是说明在任务过滤、追加式记忆、课程覆盖同时成立时外部检索基底具备稳定改进的结构条件。六、实验结果九个基准上的表现作者在九个基准上测试 MAGE覆盖六类任务数学推理GSM8K、RealMath多跳和开放域问答HotpotQA、WebQA时空分析STBench金融数值推理FinQA医学选择题MedQA-USMLE开放世界生存游戏Crafter网页导航WebShop。1. 五个推理基准全部超过冻结模型提示基线在 Qwen3-8B 冻结骨干上作者比较了0-shot CoT8-shot CoTSelf-Consistency N10ReActReflexionMAGE with SonnetMAGE with Opus。结果显示MAGE 在五个核心推理基准上全部超过最强 prompt-based baseline。尤其明显的是RealMath 提升最大最佳 MAGE 比最强冻结提示基线高31.6 pointsSTBench 提升20.8 pointsGSM8K、HotpotQA、WebQA 也都有稳定提升。这说明 MAGE 特别适合需要可复用推理模板、任务类型结构和长期经验积累的场景。2. 金融与医学扩展说明方法不只适用于原始任务在 FinQA 和 MedQA-USMLE 上作者使用 benchmark-native exact-match 指标而不是只依赖 LLM judge。结果显示FinQAMAGE Opus 达到69.0 ± 1.5高于 0-shot CoT 的 58.0也高于 Fino1 参考的 60.87MedQAMAGE Opus 达到79.8 ± 1.9超过 0-shot CoT 的 64.5也超过 Medprompt 参考的 74。这说明 MAGE 的图记忆机制可以迁移到金融表格推理和医学选择题这样的专业领域。但作者也特别限定FinQA 和 MedQA 在论文中只是标准化推理基准MAGE 并没有被定位为金融建议系统或临床决策系统。顺序环境WebShop 和 Crafter 也有提升MAGE 不只测试静态问答也测试了顺序决策任务。在 Crafter 中独立 Llama-3.1-8B 的 peak achievement-unlock rate 是25.5 ± 3.2。MAGE 的三个教师版本都超过这个基线其中 Opus teacher 达到37.9 ± 3.5。在 WebShop 中MAGE Sonnet teacher 达到task score90.2 ± 2.3strict success84.0 ± 1.8。这个结果超过 RetroAgent 的两个参考版本。不过作者也指出顺序环境比推理任务更敏感。原因是这类任务不仅需要复用推理结构还需要动作格式、环境状态理解和探索顺序。特别是 Llama-3.1-8B 在 WebShop 中动作格式不够稳定因此不适合作为该环境的主比较模型。七、消融实验成功记忆真的有用吗MAGE 的一个关键设计是保存冻结模型自己的正确推理轨迹。为了验证这一点作者设计了 No-success ablation禁用成功记忆收集只保留失败记忆、原则和其他图更新。结果显示成功记忆在五个推理基准上都带来正向提升GSM8K7.8RealMath11.5STBench6.6HotpotQA4.2WebQA4.8平均提升7.0。这个结果很重要因为它说明成功经验不是可有可无的 few-shot 示例而是 MAGE 自我进化的核心燃料之一。作者的解释是失败记忆负责纠错成功记忆负责复用。失败记忆像教师写下的“不要再这样错”。成功记忆像学生自己积累的“这个方法曾经有效”。两者组合之后冻结模型在下一轮遇到相似任务时既能看到正确模板也能避开过去错误。总结作者提出的 MAGE核心不是让大模型继续训练而是让模型拥有一个会持续成长的外部大脑。这个外部大脑通过 EVOKG 保存技能、任务、环境、成功经验和失败纠正通过课程选择机制避免任务覆盖不均通过 bandit 策略不断调整检索和推理方式通过成功记忆与失败记忆的双通道让冻结模型在下一轮推理中复用过去真正有效的经验。因此MAGE 给自我进化智能体提供了一种新的路线不一定要改变模型参数也可以改变模型所处的记忆环境。当记忆结构足够清晰、检索足够精准、经验积累足够稳定冻结模型也可以表现出跨轮次进步。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价