资讯动态

Meta:强化学习优化代码执行效率

发布时间:2026/8/5 10:00:00 来源:尧图企业网站定制
标题Reinforcement Learning for Code Optimization来源arXiv, 2607.25970v1️文章简介研究问题如何在保证代码正确性的前提下利用强化学习有效降低生成代码的执行时间主要贡献论文提出了一套包含数据构建、环境设计、奖励机制及训练稳定化的完整RL框架显著提升了模型生成高效代码的能力。重点思路构建DMC-Optim数据集从DeepMind Code Contests中清洗出2723个问题分离正确性测试与大输入优化测试确保测试能区分不同算法的运行时长并过滤掉噪声过大的样本。设计校准沙盒环境采用隔离的远程执行服务CES替代本地沙盒消除并发干扰和测量噪声通过仿射校准修正时间漂移确保执行时间测量的可靠性和可比性。引入离线模拟器筛选在昂贵的在线RL训练前利用离线模拟器回放人类参考解评估不同环境配置如执行前过滤、执行中超时、执行后排名和奖励函数的有效性剔除稀疏或饱和的信号。优化GRPO训练策略针对时序奖励稀疏且噪声大的特点增加同提示词 rollout 数量和训练批次大小以平滑梯度移除标准差归一化以避免难度偏差并采用基于token权重的优势基线。设计二元折叠奖励对比多种奖励组合发现将正确性作为硬性门控、优化目标作为二元信号的折叠奖励效果最佳避免了加法混合奖励导致的正确性下降和奖励黑客行为。分析总结性能显著提升在DMC-Optim基准上Qwen 2.5 7B和CWM 32B模型的严格top-50% pass1分别从18.0%和30.7%提升至31.3%和50.4%且在更严格的top-30%指标上相对提升超过125%同时保持纯正确性分数稳定。泛化能力验证在LiveCodeBench分布外测试中优化后的模型在中位数样本速度对比中胜率高达83%证明其学到的优化策略具有泛化性而非仅过拟合训练集。鲁棒性分析即使在沙盒环境退化或加速的情况下优化RL相比标准RLVR仍保持显著优势表明该方法对测量噪声具有一定的鲁棒性。优化类型分析模型主要学会了I/O优化和常数级改进也能在一定程度上发现算法复杂度改进占速度胜局的13%但与人类专家相比在深层算法重构方面仍有差距。个人观点论文没有简单地将运行时间加入奖励而是通过在沙箱环境中测量代码的执行时间利用噪声模型和时间信号筛选转化为可学习的RL反馈。

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价