资讯动态

2025_NIPS_Group-in-Group Policy Optimization for LLM Agent Training

发布时间:2026/8/22 23:27:15 来源:尧图企业网站定制
文章核心总结与翻译一、主要内容本文针对基于分组的强化学习(RL)算法在多轮LLM智能体训练中信用分配困难的问题,提出了Group-in-Group Policy Optimization(GiGPO)算法。该算法通过两级分组结构,在保留分组RL无评论家、低内存、稳定收敛等优势的同时,实现了细粒度的步骤级信用分配。实验验证了GiGPO在ALFWorld、WebShop等多轮智能体基准测试及搜索增强QA任务中的有效性,性能显著优于现有方法,且未增加额外计算和内存开销。二、创新点两级分组优势估计: episode级基于完整轨迹组计算宏观相对优势,捕捉全局轨迹质量;step级通过锚定状态分组机制, retroactive构建步骤级组计算微观相对优势,实现细粒度信用分配。锚定状态分组机制:利用轨迹中重复出现的环境状态(锚定状态)构建步骤级组,无需额外LLM推理,避免了计算开销爆炸。高效兼容设计:保持与现有分组RL算法(如GRPO)相同的GPU内存占用和推理成本,仅增加少量算术运算,额外时间成本低于0.002%。三、核心翻译(Markdown格式)Abstract基于分组的强化学习(RL)最新进展推动了前沿大型语言模型(LLMs)在数学推理等单轮任务中的性能提升,但它们在多轮LLM智能

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价