资讯动态

5、【数学】【基础】归一化的几何意义:球面、超平面与信息去哪了

发布时间:2026/9/29 7:28:17 来源:尧图企业网站定制
【声明】本博客所有内容均为个人业余时间创作所述技术案例均来自公开开源项目如GithubApache基金会不涉及任何企业机密或未公开技术如有侵权请联系删除标题5、【数学】【基础】归一化的几何意义球面、超平面与信息去哪了背景上篇 blog4、【数学】【基础】归一化的数学原理LayerNorm、RMSNorm 与 BatchNorm把归一化统一成x ^ x − c s \hat{x}\frac{x-c}{s}x^sx−c​并留下一句几何视角下一篇单独展开。本篇就补上这块——球面与超平面到底指什么、压到球面是怎么压的、长度被统一之后数据的差异又体现在哪里。把球面、超平面读成集合在n nn维空间里先记住两个集合的定义半径R RR的球面所有长度等于R RR的向量{ v : ∥ v ∥ 2 R } \{v:\lVert v\rVert_2R\}{v:∥v∥2​R}。二维是圆三维是球壳零均值超平面所有均值为0 00的向量{ v : ∑ i v i 0 } \{v:\sum_{i}v_i0\}{v:∑i​vi​0}。它是一张过原点、维数为n − 1 n-1n−1的平直子空间二维就是一条过原点的直线。超平面只是平面在高维的推广。把它们当成点的集合来看后面的推导就很直接了。径向投影沿射线压到球面归一化在几何上就是一次径向投影从原点朝x xx画一条射线把箭头缩短或拉长让它恰好停在这条射线与目标球面的交点上x ⟶ x ∥ x ∥ 2 x\longrightarrow\frac{x}{\lVert x\rVert_2}x⟶∥x∥2​x​方向一点没变只改了长度。以二维x ( 3 , 4 ) x(3,4)x(3,4)为例长度∥ x ∥ 2 5 \lVert x\rVert_25∥x∥2​5投影到单位圆上就是( 3 , 4 ) / 5 ( 0.6 , 0.8 ) (3,4)/5(0.6,0.8)(3,4)/5(0.6,0.8)。L2 为什么落在单位球面L2 归一化就是除以自己的长度x ^ x ∥ x ∥ 2 \hat{x}\frac{x}{\lVert x\rVert_2}x^∥x∥2​x​它的长度必然是∥ x ^ ∥ 2 ∥ x ∥ 2 ∥ x ∥ 2 1 \lVert\hat{x}\rVert_2\frac{\lVert x\rVert_2}{\lVert x\rVert_2}1∥x^∥2​∥x∥2​∥x∥2​​1所以无论原来多长输出长度恒为1 11——所有输出都落在长度 1 11的集合里这个集合就叫单位球面。RMSNorm 为什么落在半径n \sqrt{n}n​的球面RMSNorm 的条件是输出R M S ( x ^ ) 1 \mathrm{RMS}(\hat{x})1RMS(x^)1。把均方根展开R M S ( x ^ ) 1 n ∑ i 1 n x ^ i 2 1 \mathrm{RMS}(\hat{x})\sqrt{\frac{1}{n}\sum_{i1}^{n}\hat{x}_i^2}1RMS(x^)n1​i1∑n​x^i2​​1两边平方得1 n ∑ x ^ i 2 1 \frac{1}{n}\sum\hat{x}_i^21n1​∑x^i2​1即∑ x ^ i 2 n \sum\hat{x}_i^2n∑x^i2​n。而∑ x ^ i 2 ∥ x ^ ∥ 2 2 \sum\hat{x}_i^2\lVert\hat{x}\rVert_2^2∑x^i2​∥x^∥22​所以∥ x ^ ∥ 2 n \lVert\hat{x}\rVert_2\sqrt{n}∥x^∥2​n​RMSNorm 不是把长度压成1 11而是压成n \sqrt{n}n​n nn是维数二维就是2 \sqrt{2}2​。图中原始向量长短不一、方向各异L2 归一化把它们全压到单位圆上RMSNorm 则压到半径2 \sqrt{2}2​的圆上。LayerNorm 为什么是超平面∩ \cap∩球面LayerNorm 比前两者多了一步减均值用正交分解看得最清楚x μ 1 ⏟ 公共部分 ( x − μ 1 ) ⏟ 零均值部分 x\underbrace{\mu\mathbf{1}}_{\text{公共部分}}\underbrace{(x-\mu\mathbf{1})}_{\text{零均值部分}}x公共部分μ1​​零均值部分(x−μ1)​​其中1 ( 1 , … , 1 ) \mathbf{1}(1,\dots,1)1(1,…,1)零均值部分与1 \mathbf{1}1正交内积为 0。减去μ 1 \mu\mathbf{1}μ1后输出的均值为0 00落在零均值超平面上再除以σ \sigmaσ后输出方差为1 11等价于长度∥ x ^ ∥ 2 n \lVert\hat{x}\rVert_2\sqrt{n}∥x^∥2​n​落在半径n \sqrt{n}n​的球面上。两个条件同时满足就落在超平面与球面的交线上。二维时这条交线只剩两个点( ± 1 , ∓ 1 ) (\pm1,\mp1)(±1,∓1)。信息去哪了差异在方向不在长度长度被统一后数据差异全部体现在方向上。用二维例子看得很清楚x ( 3 , 4 ) x(3,4)x(3,4)与y ( 6 , 8 ) y(6,8)y(6,8)方向相同、长度不同L2 后都变成( 0.6 , 0.8 ) (0.6,0.8)(0.6,0.8)被合并——长度信息被故意丢掉x ( 3 , 4 ) x(3,4)x(3,4)与z ( 4 , 3 ) z(4,3)z(4,3)方向不同L2 后是( 0.6 , 0.8 ) (0.6,0.8)(0.6,0.8)与( 0.8 , 0.6 ) (0.8,0.6)(0.8,0.6)差异保留。用自由度来数一数还剩多少信息状态约束剩余自由度原始向量无n nn长度 方向L2 / RMSNorm长度固定n − 1 n-1n−1只剩方向LayerNorm长度固定 均值为 0n − 2 n-2n−2丢掉的正是长度这1 11个自由度LayerNorm 再多丢整体偏移。Qwen2 的隐藏维n 896 n896n896剩895 895895个自由度信息量几乎没少——被丢掉的恰恰是那个会逐层漂移、需要抹掉的尺度。若网络确实需要不同尺度由归一化之后的可学习权重γ \gammaγ逐维缩放回来。二维为什么会看起来全丢n 2 n2n2时 LayerNorm 剩n − 2 0 n-20n−20个自由度零均值且长度固定平面上只剩两个方向所以看起来什么都没了。这是二维的极端情况。高维空间里球面和超平面都很大896 896896维时仍有894 894894维的自由方向不用担心信息被压没。小结归一化的几何动作是径向投影沿原点射线把向量压到固定半径的球面上。L2 压到单位球面∥ x ^ ∥ 2 1 \lVert\hat{x}\rVert_21∥x^∥2​1RMSNorm 压到半径n \sqrt{n}n​的球面LayerNorm 先减均值落到零均值超平面、再压到半径n \sqrt{n}n​的球面即落在两者的交线上。长度被统一后差异体现在方向上从自由度看n nn维只丢1 ∼ 2 1\sim21∼2个自由度高维下信息几乎无损而丢掉的正是需要被抹掉的尺度。OK本篇先到这里如有疑问欢迎评论区留言讨论祝各位功力大涨技术更上一层楼【数学】【基础】RoPE 的数学旋转、复数与相对位置

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价 →
↑