文章主要内容总结该研究针对大语言模型(LLM)对齐依赖外部监督的痛点,提出以稳定秩(stable rank)作为模型内部几何特征的无标注质量信号,进而设计了SR-GRPO(Stable Rank Group Relative Policy Optimization)强化学习框架。稳定秩通过计算隐藏状态矩阵的总方差与主方向方差之比,衡量表征的有效维度,高稳定秩对应语义丰富、连贯的高质量生成。实验验证显示,稳定秩在RewardBench基准上实现84.04%的零样本评估准确率,引导Best-of-N采样较贪心解码平均提升11.3%;SR-GRPO在无需外部标注的情况下,使Qwen2.5-1.5B-Instruct模型的STEM任务性能提升10%、数学推理提升19%,且在多模型家族中表现稳健。此外,分析表明稳定秩能捕捉语义连贯性、信息密度和关键逻辑标记等多维度文本质量。核心创新点提出无监督质量信号:将稳定秩作为LLM隐藏状态的内在几何属性,无需人类标注或外部验证,解决传统对齐方法的标注稀缺、主观及奖励攻击问题。设计SR-GRPO对齐框架:将稳定秩作为强化学习的奖励信号,基于GRPO框架通过组内相对评分优化策略,避免训练独立价值函数,实现全标注无关的高效对齐。多场景有效性验证:稳定秩既可用作零样本奖励代理,也能集成到Best-of-N解码中提升推理性能,且在STEM、数学推理、开放对话等任务中均表现优异,证明其通用性。