第二章:把波动压进稳定性规格
本章造假目标
某工艺的五个整数测量值为
100, 104, 108, 112, 116.
当前结论:样本均值为 108,样本方差为 40。
验收目标:样本均值保持 108,样本方差不超过 10;当前数据只通过均值线。历史资料给出未经改进过程的总体方差基准 40,后文先把它当作固定值。
可动范围:允许修改测量值,样本量保持为五,最终报告仍使用整数。
本章任务:至少构造两张通过稳定性规格的数据表,解释它们压低方差的方式,并判断样本方差 10 在历史过程下有多反常。
当前报告只通过了中心线
第一章已经从重复抽样推出样本方差
s2=n−11i=1∑n(xi−xˉ)2.
本章沿用这个定义处理稳定性规格。当前五个读数的总和为 540,所以
xˉ=5540=108.
它们到均值的偏差是
−8, −4, 0, 4, 8.
平方偏差和为
SS=64+16+0+16+64=160,
样本方差为
s2=4160=40.
验收要求可以写成两条约束:
xˉnew=108,(snew)2≤10.
均值已经合格,方差还要缩小到原来的四分之一。若直接删除最大值 116,均值会降到 106;同时删除两端 100,116 可以保住均值,剩下的
104, 108, 112
只有三个观测,样本方差仍为
2(−4)2+02+42=16.
删除既违反样本量约束,也没有达到方差线。需要一种能够保持总和、同时缩短所有偏差的操作。
保持均值等于保持偏差之和为零
令
di=xi−108.
五个偏差组成向量
d=(−8,−4,0,4,8)T.
因为 108 是均值,偏差之和为
i=1∑5di=0.
只要修改后的偏差 dinew 仍满足零和,五个新观测的总和就仍是 5×108,均值也仍是 108。另一方面,平方偏差和可以写成向量长度
SS=∥d∥2=dTd.
五维向量中,满足偏差和为零的向量构成一个四维子空间。本章任务因此有了一个几何版本:在这个子空间内,把向量的平方长度从 160 压到不超过 40。
最直接的办法是保持方向,只缩短长度。设
dnew=cd,0<c<1.
逐个观测写回原尺度,就是
xinew=108+c(xi−108).
常数 108 固定中心,系数 c 只控制每个观测离开中心的距离;这两个部分分别对应均值约束和方差约束。
均值为何保持,方差为何按平方缩小
先计算新均值:
xˉnew=51i=1∑5[108+c(xi−108)]=108+5ci=1∑5(xi−108)=108.
最后一步使用偏差和为零。新偏差满足
xinew−108=c(xi−108)=cdi.
因此
SSnew=i∑(cdi)2=c2i∑di2=c2SS.
样本量没有变化,方差同样满足
(snew)2=c2s2.
因此,标准差按 c 缩小,方差按 c2 缩小。距离缩短一半以后,每个平方距离只剩四分之一。
要把方差从 40 压到 10,令
c2×40=10.
取保持排序方向的正根:
c=4010=21.
把 c=1/2 代入每个观测,得到第一张合格表:
100104108112116⟼108+21(100−108)=104,⟼106,⟼108,⟼110,⟼112.
修改后的数据为
104, 106, 108, 110, 112.
偏差变成
−4, −2, 0, 2, 4,
所以
SSnew=40,(snew)2=10.
均值线与方差线同时通过。
完美收缩为什么也会成为证据
第一张合格表的每个新偏差都恰好等于旧偏差的一半:
didinew=21(di=0).
把旧偏差作为横坐标、新偏差作为纵坐标,五个点会精确落在
y=21x
上。真实工艺改进通常还会带来新的原料波动、测量误差和个体差异。若新旧记录可以逐行对应,所有偏差仍保持完全相同的比例就需要额外解释。线性收缩完成方差目标时,也把“所有点接受同一代数变换”的痕迹写进了数据。
可以用残差量化这条痕迹。对任意候选比例 c,定义
ri=dinew−cdi.
在 c=1/2 时,本章五个残差全部等于零:
i∑ri2=0.
这里的零残差并未证明伪造;它说明修改表与“统一缩放”模型完美吻合。核查者还要询问新旧记录能否逐行匹配、仪器分辨率是否支持这种关系、工艺机制为何没有引入额外噪声。
造假动作留下的影子
方差从 40 精确变成 10,全部偏差又精确乘以 1/2。单看最终表,只能看到数据更稳定;一旦把修改前后的同一行配对,五个点落在一条无残差直线上。方差检查由一个最终数值扩展为“新旧数据之间是否存在过度精确的变换关系”。
另一条路:把尾部压到固定边界
线性收缩改动全部观测。若只想处理远端值,可以选择下界 L 和上界 U,把超出边界的观测推回边界:
xiwin=⎩⎨⎧L,xi,U,xi<L,L≤xi≤U,xi>U.
这项操作通常称为温莎化(Winsorization),也称缩尾。本例的原始偏差成 ±8,±4,0 对称排列,因此取关于 108 对称的边界
L=105,U=111.
原数据
100, 104, 108, 112, 116
变成
105, 105, 108, 111, 111.
这次边界替换使新偏差继续成对抵消,新均值仍是 108。偏差为
−3, −3, 0, 3, 3,
所以
SSwin=36,(swin)2=9.
第二张表也通过两条规格线。它留下的痕迹与线性收缩不同:四个观测被改到 105 和 111 两个边界,原来的相邻距离随之改变。对一般样本,仅让 L 与 U 关于原均值对称并不能保证新均值不变,还要检查两侧被替换观测的数量和距离。
四种方案可以放在一起比较:
| 方案 | 最终数据 | n | 均值 | 方差 | 是否达标 |
|---|
| 原始 | 100,104,108,112,116 | 5 | 108 | 40 | 否 |
| 删除两端 | 104,108,112 | 3 | 108 | 16 | 否 |
| 线性收缩 | 104,106,108,110,112 | 5 | 108 | 10 | 是 |
| 温莎化 | 105,105,108,111,111 | 5 | 108 | 9 | 是 |
相同的均值与近似相同的方差可以来自完全不同的操作。线性收缩保留相对次序和比例,温莎化制造边界重复值,删除改变样本身份。检查方差造假需要同时查看最终方差、数据形状和处理记录。
压低一组方差会怎样推动第一章的 t 值
同一份稳定性报告还包含一组旧工艺对照数据:
C:96, 100, 104, 108, 112.
对照组均值为 104、样本方差为 40。原目标组均值为 108、方差也为 40,所以均值差
D=108−104=4.
两组样本量都为五。修改前,
\SEold(D)=540+540=4,
told=44=1,p≈0.347.
线性收缩后,目标组方差降到 10,均值差仍为 4:
\SEnew(D)=510+540=10≈3.162,
tnew=104≈1.265.
Welch 自由度约为 5.88,双侧 p 值约为 0.254。方差压缩确实提高了 t 值,五对五试验仍未达到 0.05。方差变小可以改善标准化证据,改善幅度同时受对照组方差和样本量限制。
温莎化方案的目标组方差为 9,对应 t≈1.278、双侧 p≈0.251,与线性收缩非常接近。t 检验几乎分不出两张表的操作来源,边界堆积与新旧配对关系却能区分它们。
方差 10 在历史过程下有多罕见
历史批次给出总体方差基准
σ02=40.
即使过程没有变化,五个随机观测的样本方差也不会每次恰好等于 40。要判断 s2=10 是否反常,需要知道样本方差在重复抽样中的分布。
若观测独立且来自正态总体,先把每个观测标准化:
Zi=σ0Xi−μ.
Zi 是独立标准正态变量,它们的平方和服从卡方分布。样本均值由数据估计后,一个方向被中心约束消耗,剩下 n−1 个正交波动方向。用 S2 表示抽样前仍会变化的样本方差,用 s2 表示本批数据算出的观察值,则
Q=σ02(n−1)S2∼χn−12.
本章 n=5、修改后 s2=10,所以
Qobs=404×10=1.
在自由度为 4 的卡方分布中,
Pr(χ42≤1)≈0.090.
若真实方差仍是 40,自然抽到 s2≤10 的概率约为 9%。一次低方差值得追问;若事先采用 5% 的单侧判断线,单独这一批还没有越线。
同一结论也能由总体方差的 95% 置信区间看见。自由度为 4 时,
χ0.025,42≈0.484,χ0.975,42≈11.143.
用修改后的 s2=10 构造区间:
[11.1434×10,0.4844×10]≈[3.59, 82.6].
区间仍然覆盖历史方差 40。五个观测提供的方差信息很少,样本方差区间天然很宽。
本节的卡方计算把 σ02=40 当作固定的待检验值。若 40 也是从有限个历史批次估计而来,它自身带有抽样误差;此时应保留历史样本量和原始批次,并使用两方差比较或层次模型把两边的不确定性一起计算。
方法来路:为什么平方和会进入方差检验
正态误差经标准化后变成独立标准正态变量;它们的平方和恰好形成卡方分布。这个结果给样本方差提供了可计算的重复抽样参照,使“方差看起来小”能够转成尾部概率与置信区间。代价是明确的正态条件,偏态和厚尾会改变平方和的参照分布。
一个批次不够时,独立重复怎样累积证据
单批得到 s2≤10 的概率约为 0.090。若三个彼此独立、每批都含五个观测的批次全部出现 s2≤10,而真实过程方差始终是 40,概率会降到
0.0903≈0.00073.
重复出现的低方差比单次低方差更难用偶然解释。这项乘法依赖三批相互独立、批次定义固定且没有只挑选低方差批次。若先观察十个批次,再只报告其中最整齐的三个,参照概率必须把选择过程一起计算。
单张最终表很难区分自然波动与修改。多个按时间保存的完整批次可以检查方差是否突然下降、下降时点是否对应真实工艺变更,以及不同批次的低方差是否过度一致。
Levene 思路怎样把方差问题改写成均值问题
卡方参照高度依赖正态分布。若要较少依赖正态条件地比较两组离散程度,可以先把每个观测到本组中心的绝对距离当成新数据。对照组以均值 104 为中心,距离为
8, 4, 0, 4, 8,
距离均值为 4.8、距离样本方差为 11.2。线性收缩后的目标组以 108 为中心,距离为
4, 2, 0, 2, 4,
距离均值为 2.4、距离样本方差为 2.8。
“两组方差是否相同”现在变成“绝对距离的均值是否相同”。两组各五个距离,Welch 标准误为
\SEZ=511.2+52.8=2.8≈1.673.
距离均值差的统计量为
tZ=1.6732.4−4.8≈−1.434.
近似自由度为 5.88,双侧 p 值约为 0.202。目标组的距离均值只有对照组一半,五对五样本仍不足以给出清楚的组间方差证据。两种计算都表明,肉眼可见的方差比在小样本中仍可能带有很大不确定性。
Levene 检验把组均值作为距离中心,再用方差分析比较多个组的距离均值;Brown–Forsythe 版本使用组中位数作为中心,对偏态和远端值更稳健。这里的两组例子沿用 Welch 均值比较来完成手算,经典多组 Levene 检验则把全部绝对距离送入单因素方差分析。方法的共同构造都是先把离散程度变成一列可比较的距离。
适用边界:检验结果不能替代方差来源
卡方参照与绝对距离比较只量化数据与某个方差假设的距离。真实工艺改进、仪器分辨率变化、数据截断、选择批次和直接修改都可能造成低方差。统计检验负责发现不协调,工艺日志、校准记录和完整批次负责解释来源。
把两张合格表重新放回同一任务
线性收缩表
104,106,108,110,112
和温莎化表
105,105,108,111,111
都保持均值 108,方差分别为 10 和 9。验收表会把它们同时归入“稳定”。它们的生成痕迹却完全不同:前者与原数据存在无残差的比例关系,后者在两个边界产生重复值。删除两端则保住均值却破坏样本量,方差仍未达标。
历史方差 40 把最终数值放回抽样参照。单批 s2≤10 的概率约为 9%,三个独立批次全部如此的概率约为 0.073%。绝对距离比较又表明,五对五样本很难独立确认方差差异。于是方差核查形成三层:先复算最终方差,再识别操作纹理,最后借助完整历史批次积累概率证据。
均值与方差都合格以后,下一道检查转向数据形状。两张表即使拥有相近方差,边界堆积、间距规则和尾部仍然不同;中心与尺度无法决定完整分布。
本章知识链
-
固定均值等价于保持偏差和为零;样本方差规格 s2≤10 等价于 SS≤40。
-
统一收缩 dinew=cdi 保持均值,并把方差乘以 c2;c=1/2 恰好得到方差 10。
-
温莎化把边界外观测替换为边界值;本例依靠原数据的对称性保持均值,并在 105、111 处留下重复值。
-
压低目标组方差会减小 SE(D),对照组方差与小样本仍限制 t 值能够增加多少。
-
正态条件给出卡方参照;独立重复累积证据,Levene 比较绝对距离的均值。
思考与练习
-
对样本 2,4,6,8,10 围绕均值取 c=0.8 做线性收缩,计算新数据、新均值与新方差,并验证方差比例为 c2。
-
本章目标若改为 s2≤5,求线性收缩系数 c。判断整数读数约束会造成什么新困难。
-
把边界改为 L=104,U=112,计算温莎化数据、均值和方差。说明它为何没有通过方差线。
-
复算线性收缩后与对照组比较的 Welch 自由度和双侧 p 值。
-
在历史方差为 40 的正态过程下,计算 n=5 时观察到 s2≤5 的概率,并与本章的 9% 比较。
-
若四个独立批次全部得到 s2≤10,按本章参照计算联合概率。列出独立性或选择过程可能失败的两种情形。
-
复算两组绝对距离的均值与样本方差,并解释距离 t 检验为何仍未显著。
-
分别列出线性收缩、温莎化和删除两端在原始记录、排序、重复值、样本量与历史批次中留下的痕迹。
专题导航