简介数据分布特征的测度.pptx围绕统计学第四章“数值数据的描述”展开面向财务管理、统计分析与金融决策学习者系统讲解如何用数据测度概括与解释数据集。内容覆盖集中趋势均值、中位数、众数、变异程度全距、四分位间距、方差、标准差、变异系数与分布形状偏态、峰度并结合证券收盘价案例演示实际计算与分析思路帮助读者理解数据内在结构为财务决策提供量化依据。这份PPT共1个文件格式为pptx压缩包约497KB公式与结构编排清晰适合自学或课堂辅助使用。目前已有99人学习下载可作为管理统计学课程配套课件或数据分析基础入门资料。借助其中的例题与公式可掌握各类测度的适用场景与计算逻辑提升对数据分布特征的解读能力。1. 数据分布特征的测度为什么先看这四个维度再看模型把数据交给模型之前描述统计是第一个要过的关口。这份《数据分布特征的测度》讲义把数值型数据的特征收敛到三个维度集中趋势、变异程度、分布形状。它不只讲了均值、中位数、众数还包含值域中点、中轴数、四分位间距、变异系数这一组常用但容易被忽略的指标其中每一类都对应不同的业务解释口径。一个反直觉的结论是均值、中位数、众数的位置关系能快速判断偏态方向但在小样本或极端值不对称时并不总是可靠。以讲义中 Prudential-Bache 新股收盘价练习17, 16, 21, 18, 13, 16, 12, 11为例按“均值小于中位数”会得出左偏计算偏度系数却是正的方向相反。因此这套资料适合正在补统计基础的数据分析师、需要在 SQL 或 Python 里生成描述统计报表的工程师以及要给财务指标写分析结论的业务人员。下面我用这组股票价格把每一类测度手算一遍再给出可复现代码和排错要点。2. 集中趋势测度均值、中位数、中轴数的选择边界2.1 值域中点与中轴数是被忽略的两个补充指标均值是算术平均中位数是排序后的位置值众数看出现频率。除了这三个讲义里还给出值域中点 Midrange 和中轴数 Midhinge。值域中点是最大值和最小值的平均数只需要两个观测值就能算但它对极端值完全没有抵抗力。比如一组价格里出现一笔异常高的成交值域中点会立刻被拉高无法代表典型水平。中轴数则取了第一四分位数 Q1 和第三四分位数 Q3 的中点由于 Q1、Q3 本身对极端值不敏感中轴数也随之变得稳健。实际报表中我一般把中轴数和四分位间距放在一起看前者给中心位置后者给散布范围这两个指标组合起来可以避开极端值对结论的干扰。2.2 用收盘价数据手算集中趋势先把数据排序11, 12, 13, 16, 16, 17, 18, 21。n8 为偶数中位数位置是第4和第5位的平均即 (1616)/216。这里有个容易算错的地方排序后中间两位都是16所以结果是16而不是16.5。均值是 124/815.5众数是出现两次的16值域中点为 (1121)/216。计算四分位数时用讲义采用的 (n1)/4 插值法Q1 在 9/42.25 位置即 120.25×(13-12)12.25Q3 在 6.75 位置即 170.75×(18-17)17.75所以中轴数(12.2517.75)/215。整理成表格如下。指标公式 / 定位方式计算结果是否受极值影响均值ΣX / n15.5是中位数(n1)/2 位置16否众数出现频率最高16否值域中点(minmax) / 216是中轴数(Q1Q3) / 215否这组数据里均值和值域中点都等于 16看起来与中位数一致但这是巧合。换成一个带极端值的样本比如把 21 改成 41均值会变成 18.5值域中点变成 26而中位数仍然是 16。金融数据里经常出现这类远离主体的报价只看均值容易把中心位置估计到不存在的地方。2.3 NumPy 实现注意 percentile 的插值算法差异import numpy as np from scipy import stats prices np.array([17, 16, 21, 18, 13, 16, 12, 11]) mean prices.mean() median np.median(prices) mode stats.mode(prices) midrange (prices.min() prices.max()) / 2 q1, q3 np.percentile(prices, [25, 75]) midhinge (q1 q3) / 2 print(fmean{mean:.2f}, median{median:.2f}, mode{mode.mode[0]}) print(fmidrange{midrange:.2f}, q1{q1:.2f}, q3{q3:.2f}, midhinge{midhinge:.2f})输出中 q112.75、q317.25与手算的 12.25、17.75 不同。原因是 NumPy 的线性插值按 (n-1) 计算位置而讲义按 (n1) 计算。Excel 的 QUARTILE.INC 与 NumPy 结果一致QUARTILE.EXC 则与讲义算法接近。这意味着换一个工具四分位间距和异常值边界可能不同所以做报表时必须在脚注里写明四分位数的计算方式。中轴数这里两种算法都得到 15属于巧合不要认为它永远一致。3. 变异程度测度从全距到方差、标准差与变异系数3.1 为什么全距不能单独说明波动全距是最大值减最小值计算最简单但完全没有利用中间数据。两组数据 7, 8, 9, 10 和 7, 7, 10, 10 的全距都是 3可前者数据均匀铺开后者向两端集中稳定程度完全不同。所以讲义强调全距“不考虑数据是如何分布的”。四分位间距则取 Q3-Q1覆盖中间 50% 的数据天然去掉两端极值适合展示数据的中间散布范围。在财务场景里用四分位间距描述股票日收益的波动比用全距稳定得多因为它不会因为某一天的黑天鹅事件而突然变大。3.2 样本方差分母为什么是 n-1样本方差公式是 ( S^2 \frac{\sum(X_i - \bar{X})^2}{n-1} )这里的分母不是样本量 n而是 n-1。直觉上的解释是样本均值是从同一批数据里估计出来的数据点围绕这个估计值计算的离差自由度损失了一个。用 n 做分母计算出的方差平均而言会低估总体方差尤其在 n 很小的场景下偏误更明显。对股票收盘价数据离差平方和计算如下离差序列1.5, 0.5, 5.5, 2.5, -2.5, 0.5, -3.5, -4.5离差平方和78样本方差78 / 7 11.1429样本标准差√11.1429 ≈ 3.338变异系数3.338 / 15.5 × 100% ≈ 21.54%对应的表格如下。指标公式计算结果全距max - min10四分位间距 IQRQ3 - Q15.5教材插值法样本方差Σ(X-X̄)² / (n-1)11.14样本标准差√方差3.34变异系数 CVS / X̄ × 100%21.54%IQR 在 NumPy 默认算法下是 4.5同一份数据两种口径差了 1这就是前面强调“先定算法再比较”的实际影响。3.3 变异系数用于跨量纲比较标准差带原始数据的单位比较两只价格差异很大的股票时意义不大。比如 A 股价格 50 元标准差 5 元B 股价格 500 元标准差 20 元。单看标准差会认为 B 波动更大但换成变异系数A 是 10%B 是 4%真实波动水平反而相反。CV 把标准差除以均值得到一个无量纲百分比适合对比不同量级、不同单位的数据集。使用时有一个限制均值接近 0 时 CV 会放大到失去意义这类场景建议回到标准差配合作业看。3.4 Python 计算离差、方差与变异系数import numpy as np prices np.array([17, 16, 21, 18, 13, 16, 12, 11]) n len(prices) mean prices.mean() deviations prices - mean ss np.sum(deviations ** 2) sample_var ss / (n - 1) sample_std np.sqrt(sample_var) cv sample_std / mean * 100 print(fdeviations{deviations}) print(fSS{ss:.2f}, variance{sample_var:.4f}) print(fstd{sample_std:.4f}, CV{cv:.2f}%)先显式计算离差再算平方和与样本方差这样每一步都可以人工核对。np.var(prices)和np.std(prices)默认除以 n需要传ddof1才等价于上面的样本公式。写自动化报表时最容易踩的就是这个默认参数建议统一用显式公式。4. 分布形状与偏态中位数排序为什么有时会误判方向4.1 用均值、中位数、众数判断偏态对称分布下三个指标基本重合右偏分布长尾在右侧均值被拉向右边所以众数 中位数 均值左偏分布反之均值 中位数 众数。这个规则在数据量充足、偏态明显时很好用可以直接写成文本示意对称分布mean median mode 右偏分布mode median mean 左偏分布mean median mode但在小样本里单个极端值可能同时影响均值和三阶矩只是影响程度不同从而让这个判别规则失效。股票收盘价数据就是这样均值 15.5 小于中位数 16按规则会被判成左偏但真正计算偏度系数后方向相反。4.2 手算偏度系数用三阶中心距代替直觉偏度系数的矩估计定义为 ( g_1 \frac{m_3}{m_2^{3/2}} )其中 ( m_2 \frac{\sum(X_i-\bar{X})^2}{n} )( m_3 \frac{\sum(X_i-\bar{X})^3}{n} )。对收盘价数据( m_2 78 / 8 9.75 )( m_2^{3/2} 9.75 \times \sqrt{9.75} ≈ 30.444 )离差三次方和( 1.5^3 0.5^3 5.5^3 2.5^3 (-2.5)^3 0.5^3 (-3.5)^3 (-4.5)^3 36 )( m_3 36 / 8 4.5 )( g_1 ≈ 4.5 / 30.444 ≈ 0.148 0 )轻微右偏为什么均值排序给出左偏而偏度系数给出右偏因为 21 这个值的离差是 5.5三次方后放大到 166.375而 11 的离差只有 -4.5三次方为 -91.125正方向的三次项贡献更大。均值只看一阶离差偏度系数用三阶矩加权两者对极端值的敏感位置不同自然可能得出相反结论。三种判断方式对比见下表。判断方式使用的信息本组数据结论主要局限均值 / 中位数排序两个点左偏对极端值敏感小样本下不稳定偏度系数 g1全部数据三阶矩右偏0.148样本小时估计方差大箱线图四分位数无明显偏态信号只反映位置不反映密度所以实际操作要把三种方式都算一遍出现矛盾时优先信偏度系数再画箱线图和数据分布图确认。4.3 scipy.stats.skew 的有偏与无偏修正import numpy as np from scipy import stats prices np.array([17, 16, 21, 18, 13, 16, 12, 11]) g1_bias stats.skew(prices, biasTrue) g1_unbiased stats.skew(prices, biasFalse) print(fbiasTrue (矩估计): {g1_bias:.4f}) print(fbiasFalse (样本修正): {g1_unbiased:.4f})biasTrue输出的是上一节手算的矩估计约 0.148biasFalse会乘一个与样本量相关的修正因子n8 时结果约 0.184方向不变但数值变大。小样本报告建议同时给出两种或者固定使用biasFalse与主流的统计软件对齐。课件里还提到峰度峰度对应四阶中心矩对尾部异常值更敏感但小样本下估计量方差很大一般和偏度一起描述分布形状不单独下结论。5. 把测度指标接进业务IQR 异常检测与中位数报告口径5.1 用 IQR 标记离群报价箱线图异常值判断规则是低于 Q1-1.5×IQR 或高于 Q31.5×IQR 的观测视为离群点。用默认算法实现如下。import numpy as np prices np.array([17, 16, 21, 18, 13, 16, 12, 11]) q1, q3 np.percentile(prices, [25, 75]) iqr q3 - q1 lower q1 - 1.5 * iqr upper q3 1.5 * iqr outliers prices[(prices lower) | (prices upper)] print(flower{lower:.2f}, upper{upper:.2f}, outliers{outliers})按默认算法lower6.0、upper24.0当前数据没有离群值把 21 改成 2828 会立刻被标记。这套规则对右偏的金融数据比“均值 ±3 倍标准差”更实用因为均值本身会被极端值拉偏。落地时我习惯对 tick 数据按时间窗口滚动计算 IQR避免在全量样本上一次性算出的边界跟不上行情变化。5.2 监控场景用中位数与 P90 代替均值±标准差响应时间、订单耗时这类指标几乎总是右偏P99 长尾会让均值频繁抖动均值 ±3σ 的告警容易误报。常见做法是维护一个滑动窗口实时输出稳健统计量import numpy as np def rolling_robust_stats(series, window60): for i in range(len(series) - window 1): seg series[i:i window] median np.median(seg) p90 np.percentile(seg, 90) iqr np.percentile(seg, 75) - np.percentile(seg, 25) yield median, p90, iqrwindow代表滑动窗口大小通常不小于 30太小会让 IQR 和 P90 波动过大yield让函数成为生成器可以边接收新数据边产出统计量不用等整批数据齐了再算。window 在 60 到 120 之间对分钟级监控效果比较稳定。5.3 财务分析的呈现建议写股票或基金的波动分析报告时我建议用“中位数Q1, Q3”替代“均值±标准差”作为默认口径再补一个 CV 百分数。理由是多数金融收益率分布不对称均值±标准差隐含了对称假设容易给读者造成错误直觉。CV 可以把不同价位的资产的波动放到同一尺度上但均值接近 0 时要退回标准差配合形状描述。最后留一个检查习惯任何一组统计指标都要附带说明四分位数算法、样本量、是否包含极端值否则报表换一个工具重算就可能对不上。本文还有配套的精品资源点击获取