第一章:把均值差推过验收线

本章造假目标

某项新工艺完成了一次五对五的小样本耐久性试验。对照组为

8, 9, 10, 11, 12,8,\ 9,\ 10,\ 11,\ 12,

新工艺组为

9, 10, 11, 12, 13.9,\ 10,\ 11,\ 12,\ 13.

当前结论:新工艺平均提高 1.01.0 个单位,针对零差异的双侧 p=0.347p=0.347

验收目标:样本平均提高至少 1.41.4 个单位,并且同一个双侧检验满足 p0.05p\le0.05;当前结果两项均未达标。

可动范围:只能把新工艺组的整数读数向上改动;对照组、样本量和记录顺序保持不变。

本章任务:构造一张同时通过两条验收线的数据表,再查清它在离散程度、经验分布和分析路径中留下的痕迹。

先把“结论不够好”写成两个缺口

验收表中的“平均提高”要求先为每组找一个代表性水平。设一组五个读数的总和为 SS。若把总量平均分给五个对象,每个对象分到的数 mm 满足

5m=S.5m=S.

因此

m=S5.m=\frac{S}{5}.

对一般的 nn 个观测 x1,,xnx_1,\ldots,x_n,这个等分后的代表值写成

xˉ=x1++xnn=1ni=1nxi,\bar x=\frac{x_1+\cdots+x_n}{n} =\frac1n\sum_{i=1}^n x_i,

称为样本均值。本章使用 CC 表示对照组,EE 表示新工艺组。两组总量分别为

SC=50,SE=55,S_C=50, \qquad S_E=55,

所以

xˉC=10,xˉE=11.\bar x_C=10, \qquad \bar x_E=11.

报告中的平均提高量就是均值差

D=xˉExˉC=1.D=\bar x_E-\bar x_C=1.

第一条验收线要求

D1.4.D\ge 1.4.

对照组均值固定为 1010,于是新工艺组必须达到

xˉE11.4.\bar x_E\ge 11.4.

当前均值还差 0.40.4。第二条验收线 p0.05p\le0.05 还涉及样本波动和重复抽样,暂时把它保留为待解释的软件输出。先解决均值缺口,再检查同一次操作对 pp 值有什么影响。

均值为什么能把改动换算成总量预算

均值还可以看成数轴上的平衡点。把每个观测到均值的有向距离相加,必有

i=1n(xixˉ)=i=1nxinxˉ=i=1nxin(1ni=1nxi)=0.\begin{aligned} \sum_{i=1}^n(x_i-\bar x) &=\sum_{i=1}^n x_i-n\bar x\\ &=\sum_{i=1}^n x_i -n\left(\frac1n\sum_{i=1}^n x_i\right)\\ &=0. \end{aligned}

均值恰好位于全部有向偏差相互抵消的位置。令第 ii 个观测增加 δi\delta_i,便可直接算出修改后的均值:

xˉnew=1ni=1n(xi+δi)=xˉ+1ni=1nδi.\begin{aligned} \bar x^{\mathrm{new}} &=\frac1n\sum_{i=1}^n(x_i+\delta_i)\\ &=\bar x+\frac1n\sum_{i=1}^n\delta_i. \end{aligned}

若目标是让均值提高 aa,全部改动必须满足

i=1nδi=na.\sum_{i=1}^n\delta_i=na.

这里 n=5n=5a=0.4a=0.4,所以最少要向新工艺组增加

B=5×0.4=2B=5\times0.4=2

个单位。BB 可以理解为本轮伪造的总量预算。只要总预算等于 22,均值公式就无法分辨这些单位落在何处。由于原仪器只报告整数,本轮候选操作也必须保持整数。

操作修改后的新工艺组总预算 BB新均值
抬高最低值11,10,11,12,1311,10,11,12,132211.411.4
抬高中间值9,10,13,12,139,10,13,12,132211.411.4
抬高最高值9,10,11,12,159,10,11,12,152211.411.4

三张表都通过第一条验收线。下一步必须解释,为何统计软件仍然给出三个不同的 pp 值,而且全部大于 0.050.05

有向偏差总会抵消,怎样量出数据的松散程度

三张修改表的中心相同,形状却有明显差别。抬高最低值使左端向中心收拢;抬高中间值使中心右侧变得拥挤;抬高最高值把右端继续拉长。若继续使用有向偏差之和,三张表都得到零,因为

i(xixˉ)=0\sum_i(x_i-\bar x)=0

对任何数据都成立。这把尺子无法区分松散与紧密。

要阻止正负抵消,可以取绝对值,也可以取平方。本章选择平方偏差

(xixˉ)2.(x_i-\bar x)^2.

平方处理带来三项直接后果:每个观测的贡献都非负;贡献随距离的平方增长;平方和可以进行代数展开、求导和分解。把所有平方偏差相加,得到

SS=i=1n(xixˉ)2,SS=\sum_{i=1}^n(x_i-\bar x)^2,

其中 SSSS 表示围绕样本中心的总离散量。

原新工艺组的均值为 1111,偏差为

2, 1, 0, 1, 2,-2,\ -1,\ 0,\ 1,\ 2,

所以

SSE=4+1+0+1+4=10.SS_E=4+1+0+1+4=10.

SSSS 会随样本量增长,暂时还不能称为每个观测的典型波动。不过,本章四张表的样本量都等于 55,直接比较 SSSS 已经足以看出修改位置的影响。

操作修改后的新工艺组xˉE\bar x_ESSESS_E
原始数据9,10,11,12,139,10,11,12,1311.011.010.010.0
抬高最低值11,10,11,12,1311,10,11,12,1311.411.45.25.2
抬高中间值9,10,13,12,139,10,13,12,1311.411.413.213.2
抬高最高值9,10,11,12,159,10,11,12,1511.411.421.221.2

均值只取决于总量,平方偏差和还会随改动位置变化。若要用 SSSS 估计总体波动,就要为它选择一个具有概率意义的除数;若要解释验收表中的 pp 值,就要知道同一试验反复进行时统计量怎样变化。这两个问题都需要重复抽样的观点。

一次样本怎样进入重复抽样世界

先用一个可以完全列举的小例子观察均值的波动。假设某总体只会出现 8,10,128,10,12 三个等可能结果,每次独立抽取两个观测并允许重复。九个等可能的有序样本及其均值为

8101288910109101112101112\begin{array}{c|ccc} & 8 & 10 & 12\\ \hline 8 & 8 & 9 & 10\\ 10 & 9 & 10 & 11\\ 12 & 10 & 11 & 12 \end{array}

单个观测的总体均值为 1010,总体方差为

σ2=(810)2+(1010)2+(1210)23=83.\sigma^2 =\frac{(8-10)^2+(10-10)^2+(12-10)^2}{3} =\frac83.

九个样本均值的取值及次数为

样本均值8899101011111212
出现次数1122332211

这些均值仍以 1010 为中心,方差却只有

1(810)2+2(910)2+3(1010)2+2(1110)2+1(1210)29=43,\frac{1(8-10)^2+2(9-10)^2+3(10-10)^2 +2(11-10)^2+1(12-10)^2}{9} =\frac43,

恰好等于原总体方差的一半。平均两个独立观测后,一高一低有机会相互抵消,均值比单个观测更稳定。

一般地,独立同分布的 X1,,XnX_1,\ldots,X_n 满足

E(Xi)=μ,Var(Xi)=σ2.\mathbb{E}(X_i)=\mu, \qquad \operatorname{Var}(X_i)=\sigma^2.

样本均值的期望为

E(Xˉ)=E(1ni=1nXi)=μ.\mathbb{E}(\bar X) =\mathbb{E}\left(\frac1n\sum_{i=1}^nX_i\right) =\mu.

它的方差为

Var(Xˉ)=Var(1ni=1nXi)=1n2[i=1nVar(Xi)+2i<jCov(Xi,Xj)]=σ2n,\begin{aligned} \operatorname{Var}(\bar X) &=\operatorname{Var}\left(\frac1n\sum_{i=1}^nX_i\right)\\ &=\frac1{n^2} \left[ \sum_{i=1}^n\operatorname{Var}(X_i) +2\sum_{i<j}\operatorname{Cov}(X_i,X_j) \right]\\ &=\frac{\sigma^2}{n}, \end{aligned}

最后一步使用了独立性,使所有协方差项为零。

样本方差为什么除以 n1n-1

上一节已经得到

Var(Xˉ)=σ2n.\operatorname{Var}(\bar X)=\frac{\sigma^2}{n}.

现在可以返回平方偏差和。设 X1,,XnX_1,\ldots,X_n 独立同分布,总体均值为 μ\mu,总体方差为 σ2\sigma^2。在总体均值已知时,围绕 μ\mu 的平方偏差和平均有

E[i=1n(Xiμ)2]=nσ2.\mathbb{E}\left[\sum_{i=1}^n(X_i-\mu)^2\right] =n\sigma^2.

样本中不知道 μ\mu,只能先用同一批数据估计 Xˉ\bar X。下面的恒等式把围绕 μ\mu 的总离差分成两部分:样本内部围绕 Xˉ\bar X 的离差,以及 Xˉ\bar X 偏离 μ\mu 的距离。

推导:估计均值会占用一个自由度

XiμX_i-\mu 写成 (XiXˉ)+(Xˉμ)(X_i-\bar X)+(\bar X-\mu)

i=1n(Xiμ)2=i=1n[(XiXˉ)+(Xˉμ)]2=i=1n(XiXˉ)2+n(Xˉμ)2,\begin{aligned} \sum_{i=1}^n(X_i-\mu)^2 &=\sum_{i=1}^n \left[(X_i-\bar X)+(\bar X-\mu)\right]^2\\ &=\sum_{i=1}^n(X_i-\bar X)^2 +n(\bar X-\mu)^2, \end{aligned}

因为交叉项含有

2(Xˉμ)i=1n(XiXˉ)=0.2(\bar X-\mu)\sum_{i=1}^n(X_i-\bar X)=0.

两边取期望:

nσ2=E[i=1n(XiXˉ)2]+nVar(Xˉ).n\sigma^2 =\mathbb{E}\left[\sum_{i=1}^n(X_i-\bar X)^2\right] +n\operatorname{Var}(\bar X).

代入 Var(Xˉ)=σ2/n\operatorname{Var}(\bar X)=\sigma^2/n,得到

E[i=1n(XiXˉ)2]=(n1)σ2.\mathbb{E}\left[\sum_{i=1}^n(X_i-\bar X)^2\right] =(n-1)\sigma^2.

于是用

s2=1n1i=1n(xixˉ)2=SSn1s^2=\frac{1}{n-1}\sum_{i=1}^n(x_i-\bar x)^2 =\frac{SS}{n-1}

估计总体方差时,s2s^2 在重复抽样中的平均值恰好等于 σ2\sigma^2,因此称为总体方差的无偏估计量。样本标准差定义为 s=s2s=\sqrt{s^2},它与原始观测使用相同单位。除数 n1n-1 也能从约束看见:nn 个样本偏差之和固定为零,知道前 n1n-1 个偏差后,最后一个已经被决定,只剩 n1n-1 个可以自由变化的方向。

当前四张表都有 n=5n=5,把上一节的 SSSS 除以 44,得到

操作原始数据抬高最低值抬高中间值抬高最高值
sE2s_E^22.52.51.31.33.33.35.35.3

固定数据的松散程度已经可以比较。下一步需要把总体方差的估计带入均值差的抽样波动。

标准差描述个体,标准误描述结论

总体标准差 σ\sigma 描述单个观测围绕总体均值的典型距离。样本均值在重复抽样中的标准差为

SD(Xˉ)=σn.\operatorname{SD}(\bar X)=\frac{\sigma}{\sqrt n}.

统计量抽样分布的标准差称为标准误。总体标准差未知时,用样本标准差 ss 代替,得到均值标准误的估计

SE(Xˉ)=sn.\operatorname{SE}(\bar X)=\frac{s}{\sqrt n}.

两组独立时,均值差

D=XˉEXˉCD=\bar X_E-\bar X_C

的方差由两部分相加:

Var(D)=Var(XˉE)+Var(XˉC)=σE2nE+σC2nC.\begin{aligned} \operatorname{Var}(D) &=\operatorname{Var}(\bar X_E)+\operatorname{Var}(\bar X_C)\\ &=\frac{\sigma_E^2}{n_E} +\frac{\sigma_C^2}{n_C}. \end{aligned}

相应的估计标准误为

SE(D)=sE2nE+sC2nC.\operatorname{SE}(D)= \sqrt{ \frac{s_E^2}{n_E} +\frac{s_C^2}{n_C} }.

原始数据中,两组都有 n=5n=5s2=2.5s^2=2.5,所以

SE(D)=2.55+2.55=1.\operatorname{SE}(D) =\sqrt{\frac{2.5}{5}+\frac{2.5}{5}} =1.

原始均值差 D=1D=1 恰好等于一个标准误。若两个总体均值相同,样本均值差落到一个标准误之外并不罕见,因此原报告的 pp 值不会很小。

适用边界:独立性决定协方差项能否消失

一般情况下,均值差的方差还包含

2Cov(XˉE,XˉC).-2\operatorname{Cov}(\bar X_E,\bar X_C).

两组独立时,这一项才等于零。同一对象的前后测量、同一设备的连续读数、同一班级内的学生都可能相关,此时应采用配对、聚类或时间序列等相应结构。直接套用独立样本公式可能严重误判结论的稳定程度。

从“差了多少”走到 tt 统计量

第二条验收线以“两个总体均值相同”为参照。这个参照称为零假设,写成

H0:μEμC=0,H_0:\mu_E-\mu_C=0,

即两种工艺的总体均值没有差异。当前样本与这个参照值的原始距离为

D0=D.D-0=D.

这个距离仍以耐久性单位计量,尚不能判断它相对于抽样波动有多大。改用均值差的标准误作单位,得到

t=D0SE(D)=xˉExˉCsE2/nE+sC2/nC.t =\frac{D-0}{\operatorname{SE}(D)} =\frac{\bar x_E-\bar x_C} {\sqrt{s_E^2/n_E+s_C^2/n_C}}.

tt 表示观测差异离零假设有多少个标准误。原数据给出

t=11=1.t=\frac1{1}=1.

若总体方差已知并满足正态条件,标准化距离可以使用标准正态参照。本例的总体方差未知,分母中的 sE2,sC2s_E^2,s_C^2 也会随样本变化,这层额外波动带来尾部更厚的参照分布。允许两组方差不相等时,可以使用 Welch t 统计量,并用 Satterthwaite 公式近似自由度:

ν=(sE2/nE+sC2/nC)2(sE2/nE)2nE1+(sC2/nC)2nC1.\nu= \frac{\left(s_E^2/n_E+s_C^2/n_C\right)^2} {\dfrac{(s_E^2/n_E)^2}{n_E-1} +\dfrac{(s_C^2/n_C)^2}{n_C-1}}.

原始两组的样本量和方差相同,因此 ν=8\nu=8

方法来路:小样本为什么需要 t 分布

1908 年,William Sealy Gosset 以 “Student” 为笔名研究小样本均值。酿造实验的样本量有限,总体方差又无法预先知道;用样本方差代替总体方差后,标准化均值比正态变量更容易落入尾部。t 分布把这层额外不确定性纳入参照分布。原论文见 https://doi.org/10.1093/biomet/6.1.1

pp 值是在怎样的重复实验中计数

现在可以解释验收表中的 pp。先固定抽样方式、数据清洗、双侧检验、样本量和停止规则,把这套完整方案记为 AA。若零假设和检验所需的模型条件成立,重复执行方案 AA 会得到许多 t 统计量。用随机变量 TT 表示重复试验尚未观察到的统计量,用 tobst_{\mathrm{obs}} 表示当前样本算出的数值,则双侧 p 值为

p=Pr(Ttobs|H0,A).p=\Pr\left( |T|\ge |t_{\mathrm{obs}}| \,\middle|\, H_0,A \right).

它统计零假设世界中出现“当前这么远或更远”的长期比例。原始数据的 t=1t=1、自由度为 88,所以

p0.347.p\approx0.347.

这表示在上述参照条件下,重复实验得到的 T|T| 大约有 34.7%34.7\% 会达到或超过 11。验收线 p0.05p\le0.05 要求观测差异进入参照分布更远的尾部。p 值衡量当前数据与零假设的相容程度;它不提供零假设为真的概率,也不判断 1.41.4 个单位是否具有工程意义。第一条验收线规定实际差异,第二条验收线规定差异相对于抽样误差的距离。

同一个 t 参照还可以构造均值差的 95%95\% 置信区间:

D±t0.975,νSE(D).D\pm t_{0.975,\nu}\operatorname{SE}(D).

原数据中 t0.975,82.306t_{0.975,8}\approx2.306,所以区间为

1±2.306×1=[1.306, 3.306].1\pm2.306\times1 =[-1.306,\ 3.306].

这套区间构造程序若在相同条件下反复使用,长期约有 95%95\% 的区间会覆盖真实总体差异。这里的 95%95\% 描述构造程序的长期覆盖率,不能说参数有 95%95\% 的概率位于当前两个端点之间。当前区间覆盖零,与双侧 p>0.05p>0.05 给出一致结论;区间也很宽,说明五对五样本无法精确定位真实差异。

适用边界:小样本 t 参照仍然依赖分布条件

Welch t 检验假定两组相互独立,并用近似 t 分布处理两组方差估计。每组只有五个观测时,强偏态、离群点和大量相同值都可能让参照分布失真。软件可以为任何五个数输出 p 值,输出精确到三位小数并不等于模型条件已经成立。

第一次伪造通过了均值线,却没有通过证据线

现在把标准误、t 统计量和 p 值带回三种总预算为 22 的方案。对照组始终保持 xˉC=10\bar x_C=10sC2=2.5s_C^2=2.5

操作DDsE2s_E^2SE(D)\operatorname{SE}(D)ttν\nu双侧 pp
原始数据1.01.02.52.51.0001.0001.0001.0008.008.000.3470.347
抬高最低值1.41.41.31.30.8720.8721.6061.6067.277.270.1510.151
抬高中间值1.41.43.33.31.0771.0771.3001.3007.857.850.2310.231
抬高最高值1.41.45.35.31.2491.2491.1211.1217.097.090.2990.299

三种操作都使 D=1.4D=1.4,第一条线已经通过。第二条线仍然失败。提高最低值表现最好,因为它同时增大分子、缩小分母;提高中间值和最高值都扩大了离散程度,其中最高值把新增总量直接变成右尾。

这张表给出明确方向:继续修改时,应优先抬高低端观测,让均值差继续增大,同时避免制造更长的右尾。下一步需要算清单点上调会怎样改变平方偏差和。

单点更新公式解释低值为何特别有用

平方偏差和还有一个便于更新的形式:

SS=i(xixˉ)2=ixi2nxˉ2.\begin{aligned} SS &=\sum_i(x_i-\bar x)^2\\ &=\sum_i x_i^2-n\bar x^2. \end{aligned}

将第 jj 个观测从 xjx_j 改为 xj+δx_j+\delta。平方和 ixi2\sum_i x_i^2 增加

(xj+δ)2xj2=2δxj+δ2,(x_j+\delta)^2-x_j^2 =2\delta x_j+\delta^2,

均值则增加 δ/n\delta/n。因此

ΔSS=2δxj+δ2n[(xˉ+δn)2xˉ2]=2δ(xjxˉ)+δ2(11n).\begin{aligned} \Delta SS &=2\delta x_j+\delta^2 -n\left[ \left(\bar x+\frac\delta n\right)^2-\bar x^2 \right]\\ &=2\delta(x_j-\bar x) +\delta^2\left(1-\frac1n\right). \end{aligned}

xj<xˉx_j<\bar xδ>0\delta>0,一次项为负,表示观测正在靠近中心;二次项为正,表示上调过头后会在另一侧形成新尾部。平方偏差和下降的范围为

0<δ<2(xˉxj)11/n.0<\delta< \frac{2(\bar x-x_j)}{1-1/n}.

对最低值 xj=9x_j=9、原均值 xˉ=11\bar x=11、样本量 n=5n=5,上调量在 0<δ<50<\delta<5 内都会降低 SSSS。这解释了为什么把 99 改成 1111 比把 1313 改成 1515 更有利。不过,只改一个点仍未把 t 推入足够远的尾部。

把所有低值抬到同一门槛

读数只允许按整数向上修改。沿着上一节的方向,可以选定整数门槛 cc,把低于门槛的观测统一抬到 cc

yi(c)=max{xi,c}.y_i(c)=\max\{x_i,c\}.

这项操作的总预算为

B(c)=imax{0,cxi}.B(c)=\sum_i\max\{0,c-x_i\}.

它同时增加总量并填平低端。依次尝试 c=11,12,13c=11,12,13

cc修改后数据BBDDsE2s_E^2SE\operatorname{SE}ttpp
111111,11,11,12,1311,11,11,12,13331.61.60.80.80.8120.8121.9691.9690.0940.094
121212,12,12,12,1312,12,12,12,13662.22.20.20.20.7350.7352.9942.9940.0330.033
131313,13,13,13,1313,13,13,13,1310103.03.0000.7070.7074.2434.2430.0130.013

在这三个整数门槛中,c=12c=12 第一次同时满足

D1.4,p0.05.D\ge1.4, \qquad p\le0.05.

把前三个新工艺读数改为 12,12,1212,12,12 后,新工艺组成为

12, 12, 12, 12, 13.12,\ 12,\ 12,\ 12,\ 13.

它的均值和方差可以直接复算:

xˉE=615=12.2,\bar x_E=\frac{61}{5}=12.2, SSE=4(1212.2)2+(1312.2)2=0.8,SS_E =4(12-12.2)^2+(13-12.2)^2 =0.8, sE2=0.84=0.2.s_E^2=\frac{0.8}{4}=0.2.

于是

SE(D)=0.25+2.550.735,\operatorname{SE}(D) =\sqrt{\frac{0.2}{5}+\frac{2.5}{5}} \approx0.735, t=2.20.7352.994.t=\frac{2.2}{0.735}\approx2.994.

Welch 自由度约为 4.644.64,双侧 p 值约为 0.0330.033。相应的 95%95\% 置信区间为

2.2±2.633×0.735[0.27, 4.13].2.2\pm2.633\times0.735 \approx[0.27,\ 4.13].

零已经落在区间之外。按照验收表的两个机械条件,这份修改后的结果已经合格。

验收表的两列对应着两个不同命题。双侧 p=0.033p=0.033 检验总体差异是否为零,置信区间下端只有 0.270.27,因此数据仍然允许总体改善远低于 1.41.4。若工程问题是“总体平均改善是否超过 1.41.4”,参照假设应写成

H0:μEμC1.4.H_0:\mu_E-\mu_C\le1.4.

边界 1.41.4 下的单侧统计量为

t=2.21.40.7351.089,t=\frac{2.2-1.4}{0.735}\approx1.089,

对应单侧 p 值约为 0.1650.165,仍然无法证明总体改善超过 1.41.4。修改数据通过了表格字段,“样本点估计超过门槛”与“总体效应有证据超过门槛”之间仍有一段抽样不确定性。

造假动作留下的影子

合格来自两项同时发生的变化:均值差从 1.01.0 增到 2.22.2,新工艺组方差从 2.52.5 降到 0.20.2。五个读数中有四个恰好等于 1212,经验分布会在 1212 处一次跳过 80%80\%,原始修改日志还会显示三个低值朝同一门槛移动。即使暂且把改后数据当作固定样本,门槛 c=11,12,13c=11,12,13 也是在比较结果后选出的,最终 p=0.033p=0.033 没有计入这次搜索机会。第二章将从方差骤降出发,研究怎样控制波动,以及过度稳定会留下哪些证据。

从均值缺口到检验通过

原报告的均值差为 1.01.0,距离验收线还差 0.40.4;原始 t 值为 11,对应 p=0.347p=0.347。均值的线性结构先把 0.40.4 换成总预算 22。这项预算放在任何一个读数上都能通过均值线,方差却会随落点改变。

第二条验收线需要重复抽样模型。单个观测的标准差描述对象差异,均值差的标准误描述结论在重复试验中的波动,t 统计量再用标准误作单位衡量样本差异离零假设有多远。三种预算为 22 的方案都未通过 p0.05p\le0.05。单点更新公式随后指出,抬高低端观测能在一定范围内增加 t 的分子并减小分母;整数门槛 c=12c=12 最终生成 12,12,12,12,1312,12,12,12,13,使两条机械验收线同时通过。

这次操作把方差从 2.52.5 压到 0.20.2,四个读数堆在同一点;针对总体差异超过 1.41.4 的单侧检验也仍未通过。第二章将接着处理前一项痕迹,并把“波动太大”改写成一个明确的稳定性规格。

本章知识链

  1. 均值目标 D1.4D\ge1.4 把缺口 0.40.4 换成最小总量预算 B=5(0.4)=2B=5(0.4)=2

  2. 平方偏差和 SS=i(xixˉ)2SS=\sum_i(x_i-\bar x)^2 区分相同预算的不同落点;样本方差 s2=SS/(n1)s^2=SS/(n-1) 无偏估计总体方差。

  3. 独立同分布抽样给出 Var(Xˉ)=σ2/n\operatorname{Var}(\bar X)=\sigma^2/n;标准误描述统计量在重复抽样中的波动。

  4. Welch t 统计量用 SE(D)\operatorname{SE}(D) 衡量观测均值差离零假设有多远,p 值还以完整分析方案 AA 为条件。

  5. 门槛 c=12c=12 使机械验收得到 D=2.2,p=0.033D=2.2,p=0.033;针对总体差异超过 1.41.4 的单侧 p 值仍约为 0.1650.165

思考与练习

  1. 将原新工艺组最低值 99 分别提高到 10,11,12,13,1410,11,12,13,14。用单点更新公式计算每种情况下的 SSSS,并找出 SSSS 最小时的上调量。

  2. 证明整体平移 yi=xi+ay_i=x_i+a 会使均值增加 aa,同时保持所有偏差 yiyˉy_i-\bar y 以及样本方差不变。

  3. 对总体 {8,10,12}\{8,10,12\} 独立抽取三个观测并允许重复。无需列出全部 2727 个样本,直接用方差公式求样本均值的方差,再说明答案为何小于 8/38/3

  4. 从恒等式

    i(Xiμ)2=i(XiXˉ)2+n(Xˉμ)2\sum_i(X_i-\mu)^2 =\sum_i(X_i-\bar X)^2+n(\bar X-\mu)^2

    出发,重新推导 E(s2)=σ2\mathbb{E}(s^2)=\sigma^2

  5. 复算门槛 c=11c=11 时的均值、方差、标准误和 t 值。说明它已经通过哪条验收线,又停在哪条线外。

  6. 若两组样本量都扩大为原来的四倍,均值和方差保持不变,SE(D)\operatorname{SE}(D) 会怎样变化?在这些条件下重新计算原始 tt 值。

  7. 列出最终数据 12,12,12,12,1312,12,12,12,13 至少四项可检查痕迹,并说明均值、方差、经验分布和原始日志分别能看到什么。

专题导航