资讯动态

蚂蚁牛津新作RULER:实例感知六维评分,让SVG生成告别奖励黑客

发布时间:2026/10/1 14:32:09 来源:尧图企业网站定制
RULER: Instance-aware Rubric Rewards for SVG Generation作者Hangyu Ran, Yuhao Zheng, Yingying Zhang, Kevin Qinghong Lin, Han Peng核心发表机构Ant Group、The Hong Kong University of Science and Technology (Guangzhou)、University of Oxford论文链接arXiv:2609.25270v1发布于arXiv 预印本cs.CV|—|—|—|—|—|—|| Pixel-based | SSIM / PSNR | Fine-grained | N/A | 否 | 否 | 否 || Rule-based | Code Length | N/A | N/A | 是 | 否 | 否 || Embedding-based | CLIPScore | Coarse-grained | Coarse-grained | 是 | 否 | 否 || Rubric-based | Universal Rubric | Fine-grained | Fine-grained | 否 | 是 | 否 || Rubric-based |Instance-aware Rubric (RULER)|Fine-grained|Fine-grained|是|是|是|RULER 的实例感知评分表同时满足无参考、多维、视觉接地、实例条件化。这是它与通用评分表奖励以及标量奖励的本质区别。在基于评分表的评估与奖励方面LLM-Rubric 提出校准的多方面评估RaR 和 RGR-GRPO 将评分表分数直接用作 RL 奖励证明细粒度检查清单反馈能改进文本域任务如指令跟随、推理的策略训练。RULER 从两个方向扩展第一通过 VLM 裁判对渲染 SVG 按实例感知评分表打分将评分表奖励应用到开放式视觉代码第二构建评分表时不使用 ground-truth SVG提供案例特定监督但不把生成限制到单一参考 SVG。与标量指标及其 RL 奖励相比论文的人机对齐研究显示 rubric 评分的相关性/排序一致性远高于 Aesthetic 与 CLIP。与专用 SVG 专家模型相比RULER 在偏好研究中对 OmniSVG 胜率66.9 % 66.9\%66.9%、对 VectorFusion53.3 % 53.3\%53.3%、对 JanusCoder96.5 % 96.5\%96.5%并在 Rubric 指标上超过这些专用方法。与迭代式扩散方法相比RULER 单次自回归生成即可且在 Rubric 上更高。与大型通用模型相比RULER-8B 匹配并在此指标上超过更大的 DeepSeek-V3 与 Qwen3-32B。与需要配对参考的目标相比RULER 的 rubric 仅由文本派生不需要配对 SVG 真值或人类偏好标签更好保留开放式生成的一对多特性。六、局限性与展望 / Limitations Future Work论文作者明确指出了若干局限。第一依赖两个外部模型一个前沿模型生成实例感知 rubric一个 VLM 评判器给渲染输出打分。奖励质量会继承它们的偏见、偏好与失效模式评判器可能高估表层线索、低估细微风格品质尤其在训练分布之外的提示上。第二RL 计算成本上升每个训练步都要渲染采样出的 SVG并查询评判 VLM 对每个渲染输出按其提示专属 rubric 打分显著贵于 CLIP 之类轻量标量奖励或基于代码的启发式信号这会限制向更大模型、更长 rollout 或更广超参搜索的扩展。第三rubric 的分解本身是一种约束把质量拆成语义、视觉、风格三轴在本文基准上有用但可能无法覆盖所有合法的艺术意图或领域特有偏好扩展到可交互、可由人操控、可领域自适应的 rubric 设计是未来工作。此外从实验设置看人类偏好研究基于 150 个 MMSVG-Bench prompts规模有限非平局胜率对不同基线差异很大从对 VectorFusion 的53.3 % 53.3\%53.3%到对 JanusCoder 的96.5 % 96.5\%96.5%说明不同基线难度不同。评分表生成与评判组件的成本、偏差或稳定性在正文片段中虽有部分讨论但更系统的成本—收益分析仍是开放问题。主表与鲁棒性表之间存在数值口径差异例如主表 RULER Rubric 为0.693 / 0.683 0.693/0.6830.693/0.683基座鲁棒性表 RULER-8B 为0.692 / 0.662 0.692/0.6620.692/0.662这提醒读者引用具体数值时必须注明来源表与实验设置。未来工作可能包括降低评判成本例如蒸馏轻量评判器或缓存评分设计可交互、可操控的 rubric把实例感知 rubric 奖励扩展到其他开放式视觉代码生成任务以及在更广泛的分布外提示上系统检验评判器偏差。七、总结 / ConclusionRULER 针对开放式 SVG 生成中“没有绝对视觉真值”导致评估与策略优化都缺乏忠实信号的问题提出了一条基于 rubric 的解决路径。论文首先通过人机对齐研究确立多轴 rubric 评分与人类判断的相关性和成对排序一致性远好于 Aesthetic 与 CLIP 等标量指标。在此基础上RULER 把每条指令转换为实例感知的六项评分表覆盖语义保真、视觉质量与渲染风格三个轴裁判 VLM 对渲染 rollout 逐项打分加权满意度构成密集奖励并用 GRPO 优化。因为评分表仅从文本指令推导RULER 不需要配对 SVG ground truth也不需要人类偏好标签。在 MMSVG-Illustration 与 MMSVG-Icon 上RULER 将 Rubric score 从0.432 / 0.395 0.432/0.3950.432/0.395提升到0.693 / 0.683 0.693/0.6830.693/0.683超过专用 SVG 专家模型匹配规模大得多的 DeepSeek-V3并在盲测人类偏好研究中取得对五个基线均超过50 % 50\%50%的非平局胜率。消融实验进一步指出奖励设计是开放式 SVG 生成 RL 的主动杠杆标量多指标奖励会触发 reward hacking通用评分表奖励能稳定提升但缺乏实例级粒度只有实例感知评分表同时改善多个维度。尽管仍存在对外部模型与评判成本的依赖RULER 表明把模糊的视觉判断转化为实例条件化的显式子目标是提升开放式视觉代码生成质量的有效方向。原文摘要:Generating Scalable Vector Graphics (SVG) code from natural-language instructions is an open-ended task without absolute visual ground truth, leaving both evaluation and policy optimization without a faithful signal. Scalar metrics (CLIP, Aesthetic) calibrated on natural images transfer poorly to stylized vector content, and reusing them as RL rewards triggers reward hacking. We address both limitations with rubric-based scoring. We first establish empirically that prompting a vision-language judge with a multi-axis rubric correlates with human judgments far better than scalar metrics, both across samples and within instructions. Building on this finding, we introduce RULER (Instance-aware Rubric Rewards for Reinforcement Learning), which converts each instruction into an instance-aware rubric of six items spanning semantic, visual, and stylistic axes; a judge VLM scores rendered rollouts item-by-item, and the weighted satisfactions form a fine-grained reward optimized via Group Relative Policy Optimization. Because the rubric is derived from text alone, RULER requires neither paired SVG ground truth nor human preference labels. On MMSVG-Illustration and MMSVG-Icon, RULER lifts the rubric score from 0.432/0.395 to 0.693/0.683, surpassing dedicated SVG specialists and matching the substantially larger DeepSeek-V3, with ablations identifying rubric design as the active lever for RL on open-ended SVG generation. The project page is available at https://hangyuran.github.io/RULER/.PDF链接:https://arxiv.org/pdf/2609.25270v1部分平台可能图片显示异常请以我的博客内容为准

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价 →
↑