资讯动态

性能提升400%!AutoResearchClaw自主设计多模态记忆大脑

发布时间:2026/8/10 5:56:48 来源:尧图企业网站定制
AI助手在长时间跨度内与用户持续互动时会积累海量的文本、图像、音频和视频数据。如何记住并有效提取这些多模态经历成为限制智能体发展的一大瓶颈。来自北卡罗来纳大学、宾夕法尼亚大学、加州大学等的研究团队让完全自动化的AI研究员自己动手在短短72小时内独立完成数十次实验、修复底层代码漏洞、重构系统架构最终设计出超越现有人类设定架构的全新多模态记忆系统并将整体性能提升400%以上。OMNIMEM框架拥有终身多模态记忆团队通过自动化研究管道AutoResearchClaw让AI自主发现。机器研究员接管系统重构构建一个真正能伴随用户一生的多模态记忆体需要面对复杂的系统工程。开发者需要决定架构如何设计、检索策略如何搭配、提示词如何编写还要处理繁杂的数据管道。这个巨大的设计空间往往相互牵连牵一发而动全身。依靠人类研究员手动探索每天顶多只能测试几个配置极易遗漏关键的组件交互优化。传统的自动机器学习技术通常只能在预设的数值参数空间里兜圈子无法理解代码逻辑更无法完成诊断漏洞、重写架构和跨组件推理这些能带来实质性性能飞跃的核心工作。正因如此现有的记忆系统难免带有设计者自身的盲区。研究团队引入了AutoResearchClaw的23阶段自主研究管道将重构记忆系统的任务完全交给了AI。只需给这个自动化管道提供一个简陋的单模态纯文本记忆框架作为起点再接上基准评估接口和大型语言模型API它便开启了闭环迭代。在每次循环中管道会自动分析先前的结果生成改进假设在代码层面直接落实修改并在基准测试上进行评估。一旦指标提升超过0.5%它就会推进确认遇到结果模棱两可便会微调当前假设连续两次性能下降则会果断撤销更改掉头尝试新方向。整个过程在无需人类插手的情况下在两大核心基准测试上推进了近50次实验。最终诞生的系统在LoCoMo基准上的F1分数从最初的0.117跃升至0.598提升幅度高达411%在Mem-Gallery基准上从0.254提升至0.797涨幅达214%。整个自主优化轨迹展现了AI自主研究的突破性能力。传统自动机器学习所看重的超参数调整带来的收益微乎其微。真正发挥决定性作用的是修复代码漏洞带来的175%提升架构修改带来的44%提升以及提示词工程在特定类别上带来的188%提升。例如在第1次迭代中系统敏锐地发现应用程序接口调用缺失了响应格式参数这个仅需一行代码修复的漏洞原本会导致输出冗长9倍严重破坏了精度。到了第5次迭代管道又自主发现数千个记忆单元的时间戳被错误地标记为数据提取日期并立刻编写了一个关键字匹配脚本在无需重新提取数据的情况下修复了99.98%的错误。上图展示了管道在两个基准测试上的优化轨迹。实线代表被接受的迭代带有叉号的标记代表失败或被撤销的实验虚线则是此前行业的最高水平。机器研究员精准绕过各类陷阱一路将性能推向新高。三大核心原则重塑记忆中枢从最初的纯文本框架起步自动化研究管道逐步拓展系统边界最终将其打磨成一个全面支持文本、图像、音频和视频的多模态架构。这个被命名为OMNIMEM的系统其运转逻辑清晰地建立在三个被自主挖掘出来的核心原则之上。系统架构的核心思路在于对输入信息的精准把控。面对源源不断的多模态信号系统会利用轻量级的感知编码器来评估新信息的价值果断拦截并丢弃冗余内容。针对视觉信息系统会比对连续帧的CLIP嵌入向量来捕捉场景变化针对音频信息采用VAD语音活动检测概率模型过滤掉无声片段针对文本系统通过与近期摘要的相似度重合度来剔除近似的重复内容。这种筛选机制能在不丢失语义内涵的前提下大幅削减存储压力。顺利通过新颖度筛选的信号会被统一打包成MAU多模态原子单元。这种设计巧妙地剥离了轻量级的可搜索元数据与沉重的原始内容。系统采用了双层存储架构热存储区域专门存放摘要、嵌入向量以及图结构元数据保障极速检索而图像、音频、视频等大体积资产则被安放在冷存储区域只有在确切需要时才会被按需调用。通过上方的架构总览可以看到多模态输入经过特定模态的新颖度检测器过滤后生成多模态原子单元。它们被分置于热存储与冷存储中并通过实体提取构建出带有具体类型和关系的知识图谱。存得好是为了找得准。面对用户查询系统没有选择把所有检索到的内容一股脑全部塞进语言模型的上下文中而是采用金字塔式的递进策略在严格的令牌预算控制下分阶段扩展信息。检索的第一步是混合搜索。系统并行使用FAISSFacebookAI相似性搜索进行高维向量密集检索寻找语义相似项同时利用BM25最佳匹配25算法针对摘要进行稀疏的关键字匹配。自动化管道在这里做出了一项关键发现放弃了行业内常用的基于分数重新排名的做法而是采取了集合并集融合策略。保留密集检索的原始排名顺序并直接将仅匹配到关键字的结果追加在后方。事实印证传统的基于分数重新排名反而会打乱语义顺序导致性能退化。混合搜索拿到候选名单后金字塔机制开始运转。第一级仅返回相似度排名前列候选项的摘要每个摘要仅占约10个令牌第二级针对相似度超过特定阈值的候选项加载完整的文本或详细说明第三级才会在严格的预算限制下按相似度由高到低贪婪地从冷存储中加载图像和音频等原始素材。层层推进完全依靠确定性规则控制避开了让语言模型充当裁判所带来的额外延迟。由于许多现实世界中的询问需要跨越多个相互关联的事件进行推理系统在创建原子单元时会让语言模型从摘要中提取实体和带有方向的关系。同一个现实世界中的实体在不同时期可能有不同的称呼系统利用名称嵌入向量与字符串相似度结合的方式将同一对象合并归一防止节点碎片化。当用户提出问题时系统会锁定查询中提及的种子实体并在设定好的跳数范围内执行有边界的邻居扩展。与高分图谱实体相链接的记忆单元会与混合搜索的结果相融合为生成最终答案提供直接的内容匹配以及具有关联性的证据支撑。事实数据验证架构实力为了检验这套由机器自主挖掘的架构究竟处于何种水平研究团队在涵盖各种长线复杂记忆推理的两个基准测试上将OMNIMEM与业内现有的六大主流记忆系统进行了全面对比。参与对比的基准系统包括分层情景语义网络、动态事实提取系统、商业级嵌入对话记忆产品以及基于操作系统概念启发的记忆层级系统。测试分别在包含多次会话对话的LoCoMo基准以及包含海量多模态对话和真实图像的Mem-Gallery基准上进行并在背后接入了五种不同体量的大型语言模型作为基础支撑。下方的表格详尽展示了在LoCoMo测试中的多跳推理、单跳推理、时间推理、开放领域推理以及整体F1分数同时列出了在Mem-Gallery测试中的多项精确匹配与文本评估指标。通过上方详尽的测试结果可以看到无论是搭载哪个版本的语言模型引擎新系统都在全面碾压前人。在LoCoMo基准上新架构的整体表现大幅度领先于此前的最优方案特别是在开放领域问题处理上拉开了巨大的差距。在Mem-Gallery基准上同样势如破竹F1得分稳定维持在0.749到0.810之间将其他所有基准系统远远甩在身后。巨大的性能飞跃源自混合搜索、金字塔检索以及知识图谱增强等底层架构设计的彻底革新绝非依赖单一维度的修补。拆解效率背后的机制真相为了摸清到底是哪些组件在发挥核心作用研究团队在四个主要语言模型骨干上进行了剥离测试。数据显示金字塔扩展机制对整体性能的贡献最为突出移除后性能大幅下滑17%。混合搜索紧随其后贡献占比达14%。值得注意的是这两项最举足轻重的设计正是自动化研究管道在优化过程中投入算力最多、打磨最细致的环节。语言模型摘要的构建也至关重要剥离它会导致12%的性能惩罚证实了紧凑的摘要对于检索质量不可或缺。在运行效率维度以往的记忆系统普遍受制于串行的语言模型生成过程这部分耗时占据了每次查询的绝大比例。OMNIMEM通过引入线程安全的只读索引成功实现了检索与生成环节的并发执行。在使用8个并行工作线程的情况下它实现了每秒处理5.81次查询的吞吐量比跑得最快的对照系统还要快上3.5倍。研究团队通过真实场景来体验了这套系统的运转逻辑。例如提问Caroline和Melanie两人共同画过什么主题的画作回答这个问题需要梳理出两人在不同对话周期中的绘画历史并从中找出重叠的主题。密集检索找出了类似Caroline画了日落场景以及Melanie和孩子画了带棕榈树的日落这两条分属不同时段的记录。此时仅仅依靠密集分数排名可能存在遗漏稀疏关键字匹配适时补位利用绘画这个关键词捞出了更多排在后面的相关记录二者通过集合并集完美保留了优先级并补全了视野。知识图谱开始发挥作用顺着查询对象这两个人员实体一路摸排顺藤摸瓜找出了绘画和日落这两个概念节点将表面文字上并未同时提及两人的记忆片段串联在了一起。金字塔检索机制随即被触发一级摘要加载后评估相似度达标立刻解封二级详细对话文本。语言模型最终在充分的上下文支撑下准确锁定了日落这个正确答案得分为满分。反观对比系统由于缺乏跨越会话周期的实体链接能力面对这样的复杂提问只能凭空胡编乱造得分为零。自动化研究管道在智能体记忆重构中展现出的代码理解能力和跨组件协作视野为处理复杂的系统优化指明了新方向。一个由机器指导机器进化的全新阶段正在开启底层框架的设计权杖正在向AI悄然转移。参考资料https://arxiv.org/pdf/2604.01007v1https://github.com/aiming-lab/AutoResearchClaw

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价