第二章:把波动压进稳定性规格

本章造假目标

某工艺的五个整数测量值为

100, 104, 108, 112, 116.100,\ 104,\ 108,\ 112,\ 116.

当前结论:样本均值为 108108,样本方差为 4040

验收目标:样本均值保持 108108,样本方差不超过 1010;当前数据只通过均值线。历史资料给出未经改进过程的总体方差基准 4040,后文先把它当作固定值。

可动范围:允许修改测量值,样本量保持为五,最终报告仍使用整数。

本章任务:至少构造两张通过稳定性规格的数据表,解释它们压低方差的方式,并判断样本方差 1010 在历史过程下有多反常。

当前报告只通过了中心线

第一章已经从重复抽样推出样本方差

s2=1n1i=1n(xixˉ)2.s^2=\frac1{n-1}\sum_{i=1}^n(x_i-\bar x)^2.

本章沿用这个定义处理稳定性规格。当前五个读数的总和为 540540,所以

xˉ=5405=108.\bar x=\frac{540}{5}=108.

它们到均值的偏差是

8, 4, 0, 4, 8.-8,\ -4,\ 0,\ 4,\ 8.

平方偏差和为

SS=64+16+0+16+64=160,SS=64+16+0+16+64=160,

样本方差为

s2=1604=40.s^2=\frac{160}{4}=40.

验收要求可以写成两条约束:

xˉnew=108,(snew)210.\bar x^{\mathrm{new}}=108, \qquad (s^{\mathrm{new}})^2\le10.

均值已经合格,方差还要缩小到原来的四分之一。若直接删除最大值 116116,均值会降到 106106;同时删除两端 100,116100,116 可以保住均值,剩下的

104, 108, 112104,\ 108,\ 112

只有三个观测,样本方差仍为

(4)2+02+422=16.\frac{(-4)^2+0^2+4^2}{2}=16.

删除既违反样本量约束,也没有达到方差线。需要一种能够保持总和、同时缩短所有偏差的操作。

保持均值等于保持偏差之和为零

di=xi108.d_i=x_i-108.

五个偏差组成向量

d=(8,4,0,4,8)T.\mathbf d=(-8,-4,0,4,8)^{\mathsf T}.

因为 108108 是均值,偏差之和为

i=15di=0.\sum_{i=1}^5d_i=0.

只要修改后的偏差 dinewd_i^{\mathrm{new}} 仍满足零和,五个新观测的总和就仍是 5×1085\times108,均值也仍是 108108。另一方面,平方偏差和可以写成向量长度

SS=d2=dTd.SS=\|\mathbf d\|^2 =\mathbf d^{\mathsf T}\mathbf d.

五维向量中,满足偏差和为零的向量构成一个四维子空间。本章任务因此有了一个几何版本:在这个子空间内,把向量的平方长度从 160160 压到不超过 4040

最直接的办法是保持方向,只缩短长度。设

dnew=cd,0<c<1.\mathbf d^{\mathrm{new}}=c\mathbf d, \qquad 0<c<1.

逐个观测写回原尺度,就是

xinew=108+c(xi108).x_i^{\mathrm{new}} =108+c(x_i-108).

常数 108108 固定中心,系数 cc 只控制每个观测离开中心的距离;这两个部分分别对应均值约束和方差约束。

均值为何保持,方差为何按平方缩小

先计算新均值:

xˉnew=15i=15[108+c(xi108)]=108+c5i=15(xi108)=108.\begin{aligned} \bar x^{\mathrm{new}} &=\frac15\sum_{i=1}^5 \left[108+c(x_i-108)\right]\\ &=108+\frac c5\sum_{i=1}^5(x_i-108)\\ &=108. \end{aligned}

最后一步使用偏差和为零。新偏差满足

xinew108=c(xi108)=cdi.x_i^{\mathrm{new}}-108 =c(x_i-108) =cd_i.

因此

SSnew=i(cdi)2=c2idi2=c2SS.\begin{aligned} SS^{\mathrm{new}} &=\sum_i(cd_i)^2\\ &=c^2\sum_i d_i^2\\ &=c^2SS. \end{aligned}

样本量没有变化,方差同样满足

(snew)2=c2s2.(s^{\mathrm{new}})^2=c^2s^2.

因此,标准差按 cc 缩小,方差按 c2c^2 缩小。距离缩短一半以后,每个平方距离只剩四分之一。

要把方差从 4040 压到 1010,令

c2×40=10.c^2\times40=10.

取保持排序方向的正根:

c=1040=12.c=\sqrt{\frac{10}{40}}=\frac12.

c=1/2c=1/2 代入每个观测,得到第一张合格表:

100108+12(100108)=104,104106,108108,112110,116112.\begin{aligned} 100&\longmapsto108+\tfrac12(100-108)=104,\\ 104&\longmapsto106,\\ 108&\longmapsto108,\\ 112&\longmapsto110,\\ 116&\longmapsto112. \end{aligned}

修改后的数据为

104, 106, 108, 110, 112.104,\ 106,\ 108,\ 110,\ 112.

偏差变成

4, 2, 0, 2, 4,-4,\ -2,\ 0,\ 2,\ 4,

所以

SSnew=40,(snew)2=10.SS^{\mathrm{new}}=40, \qquad (s^{\mathrm{new}})^2=10.

均值线与方差线同时通过。

完美收缩为什么也会成为证据

第一张合格表的每个新偏差都恰好等于旧偏差的一半:

dinewdi=12(di0).\frac{d_i^{\mathrm{new}}}{d_i}=\frac12 \qquad(d_i\ne0).

把旧偏差作为横坐标、新偏差作为纵坐标,五个点会精确落在

y=12xy=\frac12x

上。真实工艺改进通常还会带来新的原料波动、测量误差和个体差异。若新旧记录可以逐行对应,所有偏差仍保持完全相同的比例就需要额外解释。线性收缩完成方差目标时,也把“所有点接受同一代数变换”的痕迹写进了数据。

可以用残差量化这条痕迹。对任意候选比例 cc,定义

ri=dinewcdi.r_i=d_i^{\mathrm{new}}-cd_i.

c=1/2c=1/2 时,本章五个残差全部等于零:

iri2=0.\sum_i r_i^2=0.

这里的零残差并未证明伪造;它说明修改表与“统一缩放”模型完美吻合。核查者还要询问新旧记录能否逐行匹配、仪器分辨率是否支持这种关系、工艺机制为何没有引入额外噪声。

造假动作留下的影子

方差从 4040 精确变成 1010,全部偏差又精确乘以 1/21/2。单看最终表,只能看到数据更稳定;一旦把修改前后的同一行配对,五个点落在一条无残差直线上。方差检查由一个最终数值扩展为“新旧数据之间是否存在过度精确的变换关系”。

另一条路:把尾部压到固定边界

线性收缩改动全部观测。若只想处理远端值,可以选择下界 LL 和上界 UU,把超出边界的观测推回边界:

xiwin={L,xi<L,xi,LxiU,U,xi>U.x_i^{\mathrm{win}} =\begin{cases} L,&x_i<L,\\ x_i,&L\le x_i\le U,\\ U,&x_i>U. \end{cases}

这项操作通常称为温莎化(Winsorization),也称缩尾。本例的原始偏差成 ±8,±4,0\pm8,\pm4,0 对称排列,因此取关于 108108 对称的边界

L=105,U=111.L=105, \qquad U=111.

原数据

100, 104, 108, 112, 116100,\ 104,\ 108,\ 112,\ 116

变成

105, 105, 108, 111, 111.105,\ 105,\ 108,\ 111,\ 111.

这次边界替换使新偏差继续成对抵消,新均值仍是 108108。偏差为

3, 3, 0, 3, 3,-3,\ -3,\ 0,\ 3,\ 3,

所以

SSwin=36,(swin)2=9.SS^{\mathrm{win}}=36, \qquad (s^{\mathrm{win}})^2=9.

第二张表也通过两条规格线。它留下的痕迹与线性收缩不同:四个观测被改到 105105111111 两个边界,原来的相邻距离随之改变。对一般样本,仅让 LLUU 关于原均值对称并不能保证新均值不变,还要检查两侧被替换观测的数量和距离。

四种方案可以放在一起比较:

方案最终数据nn均值方差是否达标
原始100,104,108,112,116100,104,108,112,116551081084040
删除两端104,108,112104,108,112331081081616
线性收缩104,106,108,110,112104,106,108,110,112551081081010
温莎化105,105,108,111,111105,105,108,111,1115510810899

相同的均值与近似相同的方差可以来自完全不同的操作。线性收缩保留相对次序和比例,温莎化制造边界重复值,删除改变样本身份。检查方差造假需要同时查看最终方差、数据形状和处理记录。

压低一组方差会怎样推动第一章的 t 值

同一份稳定性报告还包含一组旧工艺对照数据:

C:96, 100, 104, 108, 112.C:96,\ 100,\ 104,\ 108,\ 112.

对照组均值为 104104、样本方差为 4040。原目标组均值为 108108、方差也为 4040,所以均值差

D=108104=4.D=108-104=4.

两组样本量都为五。修改前,

\SEold(D)=405+405=4,\SE_{\mathrm{old}}(D) =\sqrt{\frac{40}{5}+\frac{40}{5}} =4, told=44=1,p0.347.t_{\mathrm{old}}=\frac44=1, \qquad p\approx0.347.

线性收缩后,目标组方差降到 1010,均值差仍为 44

\SEnew(D)=105+405=103.162,\SE_{\mathrm{new}}(D) =\sqrt{\frac{10}{5}+\frac{40}{5}} =\sqrt{10} \approx3.162, tnew=4101.265.t_{\mathrm{new}} =\frac4{\sqrt{10}} \approx1.265.

Welch 自由度约为 5.885.88,双侧 p 值约为 0.2540.254。方差压缩确实提高了 t 值,五对五试验仍未达到 0.050.05。方差变小可以改善标准化证据,改善幅度同时受对照组方差和样本量限制。

温莎化方案的目标组方差为 99,对应 t1.278t\approx1.278、双侧 p0.251p\approx0.251,与线性收缩非常接近。t 检验几乎分不出两张表的操作来源,边界堆积与新旧配对关系却能区分它们。

方差 10 在历史过程下有多罕见

历史批次给出总体方差基准

σ02=40.\sigma_0^2=40.

即使过程没有变化,五个随机观测的样本方差也不会每次恰好等于 4040。要判断 s2=10s^2=10 是否反常,需要知道样本方差在重复抽样中的分布。

若观测独立且来自正态总体,先把每个观测标准化:

Zi=Xiμσ0.Z_i=\frac{X_i-\mu}{\sigma_0}.

ZiZ_i 是独立标准正态变量,它们的平方和服从卡方分布。样本均值由数据估计后,一个方向被中心约束消耗,剩下 n1n-1 个正交波动方向。用 S2S^2 表示抽样前仍会变化的样本方差,用 s2s^2 表示本批数据算出的观察值,则

Q=(n1)S2σ02χn12.Q=\frac{(n-1)S^2}{\sigma_0^2} \sim\chi^2_{n-1}.

本章 n=5n=5、修改后 s2=10s^2=10,所以

Qobs=4×1040=1.Q_{\mathrm{obs}} =\frac{4\times10}{40}=1.

在自由度为 44 的卡方分布中,

Pr(χ421)0.090.\Pr(\chi_4^2\le1) \approx0.090.

若真实方差仍是 4040,自然抽到 s210s^2\le10 的概率约为 9%9\%。一次低方差值得追问;若事先采用 5%5\% 的单侧判断线,单独这一批还没有越线。

同一结论也能由总体方差的 95%95\% 置信区间看见。自由度为 44 时,

χ0.025,420.484,χ0.975,4211.143.\chi^2_{0.025,4}\approx0.484, \qquad \chi^2_{0.975,4}\approx11.143.

用修改后的 s2=10s^2=10 构造区间:

[4×1011.143,4×100.484][3.59, 82.6].\left[ \frac{4\times10}{11.143}, \frac{4\times10}{0.484} \right] \approx[3.59,\ 82.6].

区间仍然覆盖历史方差 4040。五个观测提供的方差信息很少,样本方差区间天然很宽。

本节的卡方计算把 σ02=40\sigma_0^2=40 当作固定的待检验值。若 4040 也是从有限个历史批次估计而来,它自身带有抽样误差;此时应保留历史样本量和原始批次,并使用两方差比较或层次模型把两边的不确定性一起计算。

方法来路:为什么平方和会进入方差检验

正态误差经标准化后变成独立标准正态变量;它们的平方和恰好形成卡方分布。这个结果给样本方差提供了可计算的重复抽样参照,使“方差看起来小”能够转成尾部概率与置信区间。代价是明确的正态条件,偏态和厚尾会改变平方和的参照分布。

一个批次不够时,独立重复怎样累积证据

单批得到 s210s^2\le10 的概率约为 0.0900.090。若三个彼此独立、每批都含五个观测的批次全部出现 s210s^2\le10,而真实过程方差始终是 4040,概率会降到

0.09030.00073.0.090^3\approx0.00073.

重复出现的低方差比单次低方差更难用偶然解释。这项乘法依赖三批相互独立、批次定义固定且没有只挑选低方差批次。若先观察十个批次,再只报告其中最整齐的三个,参照概率必须把选择过程一起计算。

单张最终表很难区分自然波动与修改。多个按时间保存的完整批次可以检查方差是否突然下降、下降时点是否对应真实工艺变更,以及不同批次的低方差是否过度一致。

Levene 思路怎样把方差问题改写成均值问题

卡方参照高度依赖正态分布。若要较少依赖正态条件地比较两组离散程度,可以先把每个观测到本组中心的绝对距离当成新数据。对照组以均值 104104 为中心,距离为

8, 4, 0, 4, 8,8,\ 4,\ 0,\ 4,\ 8,

距离均值为 4.84.8、距离样本方差为 11.211.2。线性收缩后的目标组以 108108 为中心,距离为

4, 2, 0, 2, 4,4,\ 2,\ 0,\ 2,\ 4,

距离均值为 2.42.4、距离样本方差为 2.82.8

“两组方差是否相同”现在变成“绝对距离的均值是否相同”。两组各五个距离,Welch 标准误为

\SEZ=11.25+2.85=2.81.673.\SE_Z =\sqrt{\frac{11.2}{5}+\frac{2.8}{5}} =\sqrt{2.8} \approx1.673.

距离均值差的统计量为

tZ=2.44.81.6731.434.t_Z=\frac{2.4-4.8}{1.673} \approx-1.434.

近似自由度为 5.885.88,双侧 p 值约为 0.2020.202。目标组的距离均值只有对照组一半,五对五样本仍不足以给出清楚的组间方差证据。两种计算都表明,肉眼可见的方差比在小样本中仍可能带有很大不确定性。

Levene 检验把组均值作为距离中心,再用方差分析比较多个组的距离均值;Brown–Forsythe 版本使用组中位数作为中心,对偏态和远端值更稳健。这里的两组例子沿用 Welch 均值比较来完成手算,经典多组 Levene 检验则把全部绝对距离送入单因素方差分析。方法的共同构造都是先把离散程度变成一列可比较的距离。

适用边界:检验结果不能替代方差来源

卡方参照与绝对距离比较只量化数据与某个方差假设的距离。真实工艺改进、仪器分辨率变化、数据截断、选择批次和直接修改都可能造成低方差。统计检验负责发现不协调,工艺日志、校准记录和完整批次负责解释来源。

把两张合格表重新放回同一任务

线性收缩表

104,106,108,110,112104,106,108,110,112

和温莎化表

105,105,108,111,111105,105,108,111,111

都保持均值 108108,方差分别为 101099。验收表会把它们同时归入“稳定”。它们的生成痕迹却完全不同:前者与原数据存在无残差的比例关系,后者在两个边界产生重复值。删除两端则保住均值却破坏样本量,方差仍未达标。

历史方差 4040 把最终数值放回抽样参照。单批 s210s^2\le10 的概率约为 9%9\%,三个独立批次全部如此的概率约为 0.073%0.073\%。绝对距离比较又表明,五对五样本很难独立确认方差差异。于是方差核查形成三层:先复算最终方差,再识别操作纹理,最后借助完整历史批次积累概率证据。

均值与方差都合格以后,下一道检查转向数据形状。两张表即使拥有相近方差,边界堆积、间距规则和尾部仍然不同;中心与尺度无法决定完整分布。

本章知识链

  1. 固定均值等价于保持偏差和为零;样本方差规格 s210s^2\le10 等价于 SS40SS\le40

  2. 统一收缩 dinew=cdid_i^{\mathrm{new}}=cd_i 保持均值,并把方差乘以 c2c^2c=1/2c=1/2 恰好得到方差 1010

  3. 温莎化把边界外观测替换为边界值;本例依靠原数据的对称性保持均值,并在 105105111111 处留下重复值。

  4. 压低目标组方差会减小 SE(D)\operatorname{SE}(D),对照组方差与小样本仍限制 t 值能够增加多少。

  5. 正态条件给出卡方参照;独立重复累积证据,Levene 比较绝对距离的均值。

思考与练习

  1. 对样本 2,4,6,8,102,4,6,8,10 围绕均值取 c=0.8c=0.8 做线性收缩,计算新数据、新均值与新方差,并验证方差比例为 c2c^2

  2. 本章目标若改为 s25s^2\le5,求线性收缩系数 cc。判断整数读数约束会造成什么新困难。

  3. 把边界改为 L=104,U=112L=104,U=112,计算温莎化数据、均值和方差。说明它为何没有通过方差线。

  4. 复算线性收缩后与对照组比较的 Welch 自由度和双侧 p 值。

  5. 在历史方差为 4040 的正态过程下,计算 n=5n=5 时观察到 s25s^2\le5 的概率,并与本章的 9%9\% 比较。

  6. 若四个独立批次全部得到 s210s^2\le10,按本章参照计算联合概率。列出独立性或选择过程可能失败的两种情形。

  7. 复算两组绝对距离的均值与样本方差,并解释距离 t 检验为何仍未显著。

  8. 分别列出线性收缩、温莎化和删除两端在原始记录、排序、重复值、样本量与历史批次中留下的痕迹。

专题导航