资讯动态

不是所有经验都适合存入模型权重:面向自改进GUI智能体的组件路由框架

发布时间:2026/10/4 19:26:15 来源:尧图企业网站定制
不是所有经验都适合存入模型权重面向自改进GUI智能体的组件路由框架arXiv:2610.01787v12026‑10‑01摘要自改进GUI智能体会将自身运行产生的轨迹经验复用主要存在两种方案一是对轨迹做微调将经验写入模型权重二是把轨迹检索后放入上下文提示。现有研究对比这两种方案得出互相矛盾的结论本文指出矛盾根源来自经验的粒度问题一条轨迹是多种不同属性经验单元的混合包络整体评估结论会受内部组分占比影响。本文提出组件路由Component Routing将智能体经验拆解为四类组件定位器locators、过程序列procedures、状态事实state facts、经验教训lessons依据训练前即可统计得到的两个属性——重复出现度recurrence、状态条件依赖性state‑conditionality把每一类组件分配到「上下文提示」或者「模型权重」。在三套主干模型、两个GUI仿真环境、3个随机种子下开展对照实验。实验发现最优分配策略定位器、经验教训适合存入权重过程序列、状态事实适合放在上下文。基于两类属性拟合得到路由判定规则在留出的主干模型家族测试集上24组测试样例全部预测正确。两组干预实验可以人为改变组件的最优归属提升训练样本剂量可以让过程序列向权重一侧偏移剥离状态条件会降低上下文方案收益。采用该路由规则的效果平均比每一套主干模型的单一最优方案高出**3.5个百分点**相比反向分配策略高出7.8个百分点。进一步揭示训练、生产者‑消费者模型差异如何改变两种复用路径收益当相同经验写入权重后高重复度经验在上下文里被读取触发的概率大幅下降上下文路径收益会随信息缺口增大而提升权重微调路径收益会随策略缺口增大而衰减。1 引言GUI智能体手机/桌面端大模型代理会把自己执行任务得到的轨迹经验用于自我迭代。行业存在两条主流路线微调路线拿成功轨迹做SFT/偏好微调把经验固化进模型权重检索上下文路线维护轨迹库运行时检索相关样本放到prompt上下文。但是现有文献对比两种路线得到相互冲突结论部分场景微调更好部分场景检索上下文更好。本文发现问题根源现有方法把整条轨迹当作不可拆分的最小经验单元一条轨迹混杂多种属性完全不同的经验片段实验结论取决于轨迹内部组分占比。举一个天气APP直观示例任务为「将罗马添加到已保存城市列表」。完整轨迹包含两类信息①搜索框控件的页面位置定位器跨任务反复出现②在预览页面点击Add按钮的操作过程序列高度依赖当前页面状态。如果直接拿整条轨迹做微调SFT模型学会了控件位置但是会遗忘“需要点击Add”这个状态依赖的关键步骤。而组件路由方案定位器存入权重过程序列保留在上下文二者各司其职。核心研究问题智能体产生的经验哪些适合放到上下文哪些适合写入权重该结论是否在不同主干模型、训练条件下依然成立本文主要贡献经验单元拆解评测把轨迹拆分为4类组件定义训练前可计算的两个统计属性在3套主干模型、2个环境做严格配对对照同一批经验分别送入权重/上下文。基于重复出现度、状态条件依赖性拟合路由判定规则在留出模型家族全部24个样例预测正确两组干预实验验证规则有效性组件路由相比单一方案平均提升3.5pts。揭示生产者‑消费者、信息缺口、策略缺口对两种经验复用路径的影响高重复度经验写入权重后上下文笔记触发率显著下降上下文收益随信息缺口上升权重微调收益随策略冲突缺口下降。2 相关工作2.1 经验复用两大路线权重微调 vs 上下文检索权重微调对智能体自身轨迹做SFT、DPO偏好优化提取技能做蒸馏把经验固化进参数。上下文检索维护轨迹/技能库运行时检索把样本直接放入prompt不修改权重。现有研究经常直接对比两套完整流水线但是输入经验集本身存在差异很少做到保持经验内容完全不变仅仅改变存放目的地做对照。本文组件路由固定经验素材只改变存储目的地。2.2 GUI智能体与轨迹经验GUI智能体训练来源包括人类演示、智能体自生成轨迹。已有工作会提取技能卡片、事后重标记经验观测到微调会学习界面捷径而不是语义逻辑同一套表征在一类任务有效另一类任务产生负面影响。大部分现有系统固定经验存储目的地本文将经验拆分成组件由数据统计属性自动选择存储位置。2.3 生产者‑消费者与自改进智能体脆弱性自改进智能体性能高度依赖经验生成方producer和使用方consumer模型之间的匹配度记忆收益受随机种子、任务顺序影响重复内化经验性能不升反降。本文区分信息缺口、策略缺口两个指标量化解释生产者消费者之间的性能变化。3 实验设置组件路由框架组件路由不再把整条轨迹作为单元而是将原始经验池EEE提取为4类组件集合DcD_cDc​c∈{G,P,F,L}c \in \{G,P,F,L\}c∈{G,P,F,L}。GGGLocators定位器描述界面元素在屏幕的位置键值应用角色元素名PPPProcedures过程序列任务家族内部连续动作子目标序列键值为连续3个动作目标FFFState facts状态事实动作成功执行必须满足的前置条件来自同一目标的成功、失败成对样本LLLLessons经验教训同一个状态下失败动作与对应成功动作的偏好配对每一条经验项ddd包含唯一标识key、上下文使用的文本笔记note、用于微调的训练样本sample。两种存储目的地上下文路线CcC_cCc​运行时根据当前界面状态签名做Jaccard相似度检索将匹配项作为笔记追加到prompt不修改模型权重。权重路线WcW_cWc​使用LoRA低秩适配微调定位器、过程序列、状态事实使用监督微调SFT经验教训使用DPO直接偏好优化。共存CcWcC_cW_cCc​Wc​既做微调运行时同时追加笔记。定义路由增益Δ(c)\Delta(c)Δ(c)同一套经验权重路线减去上下文路线的留任任务成功率。Δ(c)U(Wc)−U(Cc) \Delta(c)U(W_c)-U(C_c)Δ(c)U(Wc​)−U(Cc​)Δ(c)0\Delta(c)0Δ(c)0该组件更适合存入权重Δ(c)0\Delta(c)0Δ(c)0更适合放在上下文。两个核心统计属性训练前仅从经验池计算无需运行模型重复出现度KaTeX parse error: Cant use function \( in math mode at position 1: \̲(̲r(d)\)该经验key在其他无关任务中出现的占比越高代表跨任务频繁复用。状态条件依赖性κ0(d)\kappa_0(d)κ0​(d)经验的可用性多大程度依赖当前界面和生成该经验的原始界面严格匹配数值越高越强依赖特定界面状态。组件统计特性原始实验统计均值|组件|符号|平均重复度r|中位状态条件依赖性κ0\kappa_0κ0​|最优目的地||—|—|—|—|—||定位器|G|0.39|0.10|权重weights||过程序列|P|0.05|0.66|上下文context||状态事实|F|0.32|0.56|上下文context||经验教训|L|0.45|0.53|权重weights|实验环境MobileGym手机仿真GUI环境20款APP416任务模板可以直接读取完整应用内部状态AndroidWorld真实安卓应用通过可访问性树获取界面信息共116个任务。主干模型BackboneGUI‑Owl‑8BScaleCUA‑7BQwen3‑VL‑8B附加Qwen3‑VL 4B /32B做生产者‑消费者对照。评估协议全部采用确定性环境评判器不使用LLM‑as‑judge打分配对bootstrap重采样10000次计算95%置信区间每一组配置3个不同随机种子测试集分为见过应用模板、未见过应用模板。基线对照组Base原始模型不使用任何经验Whole‑trajectory SFT整条轨迹做微调轨迹检索检索1条完整轨迹、检索10条步骤记录Context‑then‑distill先上下文再蒸馏到权重All‑to‑context全部组件送入上下文All‑to‑weights全部组件送入权重Reverse routing组件路由分配完全颠倒反向分配Self‑retry最多重试3次任务4 观测实验结果4.1 组件存在明确最优存储目的地汇总两套环境、三套模型✅定位器G路由增益Δ4.9\Delta4.9Δ4.9适合存入权重✅经验教训L路由增益Δ1.5\Delta1.5Δ1.5倾向权重❌过程序列P路由增益Δ−4.2\Delta-4.2Δ−4.2适合上下文❌状态事实F路由增益Δ−4.1\Delta-4.1Δ−4.1适合上下文。共存模式权重笔记定位器收益几乎不再提升但是过程序列、状态事实即使已经微调过权重上下文笔记仍然带来可观收益。关键现象不是权重一定更好也不是上下文一定更好取决于组件本身统计属性。4.2 生产者‑消费者效应上下文笔记路线收益不强烈依赖经验生成方是谁更强生产者产出经验消费者拿到收益更高跨家族模型产出经验放到上下文依然有效。权重微调路线只有消费者自身产生的经验微调才有正向收益使用其他模型尤其是其他家族生成样本微调性能反而下降。权重微调学到很大一部分收益来自于对自身行为的练习practice而不是跨模型迁移知识。4.3 写入权重后上下文笔记的读取触发率下降读取触发率添加笔记前后模型动作是否发生改变的步骤占比。现象组件写入权重之后笔记的读取触发率显著下降下降幅度和该组件的重复出现度r强负相关Spearman −0.92。高重复度的定位器、经验教训写入权重后笔记几乎不再改变模型输出而高度状态依赖的过程序列笔记依旧有很高价值。解释高重复度的知识被模型权重吸收强状态依赖的知识很难被权重完全吸收笔记仍然不可替代。5 路由判定规则5.1 基于r,κ0r,\kappa_0r,κ0​的线性打分规则s(c)α⋅r(c)−β⋅κ0(c)−γ s(c)\alpha\cdot r(c)-\beta\cdot \kappa_0(c)-\gammas(c)α⋅r(c)−β⋅κ0​(c)−γKaTeX parse error: Cant use function \( in math mode at position 1: \̲(̲s(c)0\)→ 送入权重weightss(c)≤0s(c)\le0s(c)≤0→ 送入上下文context采用留一法每次留出一个主干模型家族做测试在另外两个家族上拟合参数24个留出测试单元格全部符号预测正确24/24。边界把平面划分为两个区域高重复度、低状态依赖 → 权重低重复度、高状态依赖 → 上下文。经验教训L、状态事实F落在边界附近同一个组件内部高r子项走权重、低r子项走上下文性能差异显著。5.2 干预验证实验人为修改属性观测路由收益变化提升训练剂量样本复制×8过程序列P的路由增益从‑4.2提升至‑0.8向权重一侧大幅偏移。剥离状态条件仅用任务文本检索不再匹配界面状态过程序列P上下文收益下降‑3.9pts状态事实F上下文收益下降‑3.4pts。证明过程序列、状态事实从上下文获得的收益绝大部分来自状态匹配检索能力。5.3 冲突场景权重陈旧笔记是新版本当APP界面发生版本变更权重是旧版本知识上下文笔记携带新版本知识。高重复度组件模型更倾向遵循已经固化在权重的陈旧知识忽略笔记低重复度组件更容易采纳上下文笔记给出的新动作。风险高重复度知识一旦过时模型很难被上下文笔记纠正。5.4 整体性能对比实验组MobileGym平均得分相比单一最优方案增益相比反向分配增益组件路由ours32.84.48.9全部送上下文28.6‑‑全部送权重27.9‑‑反向分配23.9‑‑自重试基线22.6‑‑整条轨迹SFT21.1‑‑AndroidWorld上同样取得一致结论。组件路由显著优于所有whole‑trajectory整条轨迹基线。6 生产者‑消费者之间的收益迁移信息缺口与策略缺口定义两个关键缺口指标信息缺口gIg_IgI​生产者会、消费者不会处理的任务占比信息缺口越大上下文笔记收益越高。策略缺口gPg_PgP​同一状态下生产者与消费者输出不同动作的比例策略缺口越大权重微调收益越低甚至负收益。核心观测上下文路线收益随信息缺口上升笔记提供消费者缺失的信息不在乎是谁生成权重微调路线收益随策略缺口衰减如果生产者和消费者策略行为不一致微调会破坏原有模型能力当升级更换消费者模型旧模型产出的笔记库仍然可以复用但是权重LoRA适配器需要基于新消费者轨迹重新训练。7 结论本文提出组件路由Component Routing不要直接把整条轨迹全部丢给权重或者全部丢给上下文将GUI智能体经验拆分为定位器、过程序列、状态事实、经验教训。利用训练前可统计的两个属性重复出现度r、状态条件依赖性κ0\kappa_0κ0​自动判定组件存储目的地。✅最优分配定位器、经验教训 → 模型权重LoRA微调高重复弱状态依赖过程序列、状态事实 → 运行时上下文检索笔记低重复强状态条件依赖关键发现高重复度知识写入权重后上下文笔记的影响力会被显著削弱强状态依赖知识即便做过微调上下文笔记依然不可替代。上下文笔记可以跨模型家族迁移权重微调高度依赖生产者‑消费者策略对齐不同模型生成经验直接微调往往带来负面效果。当发生软件界面版本迭代已经内化进权重的高频知识容易变成陈旧知识上下文笔记很难覆盖纠正。组件路由在两套测试环境对比全部组件单一目的地基线平均提升3.5个百分点。工程启示GUI智能体自改进不应该一刀切选择微调或者检索上下文优先对经验做组件拆分根据统计属性分配存储位置强状态依赖的操作流程尽量保留在检索上下文不要全部压入权重。附录要点摘要附录A四类组件完整定义、提取规则每个组件包含key标识、payload有效载荷、状态条件提供样例给出MobileGym、AndroidWorld两套环境的组件数量统计、r与κ0\kappa_0κ0​分布。附录B实验协议、环境划分、各个实验组配置、干预实验组数据集划分held‑out任务实例数量各类ablation干预臂复制样本、移除状态匹配、打乱key对照实验随机笔记对照组。附录C训练超参LoRA rank16α32\alpha32α32epoch3学习率10−510^{-5}10−5vision塔冻结SFT用于G/P/FDPO用于L经验教训。附录D路由规则拟合数学推导、留一法测试完整表格附录E全部完整实验数值结果干预实验、生产者‑消费者对照数据附录F敏感性测试Jaccard阈值、笔记条数、LoRA秩、经验池大小等参数扫描。附录G两个完整任务案例复现案例1天气APP添加城市展示路由分配与全部送入权重两种方案的执行轨迹对比。案例2日历APP版本冲突权重陈旧上下文笔记给出正确动作。附录H算力统计每个实验组GPU小时消耗、prompt token开销附录I所有主干模型完整系统提示词、笔记块模板

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价 →
↑