第十八章:操纵分层与批次

本章造假目标

档案库中,旧、新工艺在简单产品上的成功率分别为 90%90\%95%95\%,在复杂产品上分别为 60%60\%70%70\%。预定抽样各取 120 件,当前粗成功率为旧工艺 85.0%85.0\%、新工艺 74.2%74.2\%,结果卡要求新工艺至少领先 20 个百分点。允许从档案库重选产品难度构成,不得改写难度标签和成败记录。任务一是把旧工艺改选为 20 件简单、100 件复杂,把新工艺改选为 100 件简单、20 件复杂,使粗差达到 25.825.8 点。任务二再用六件产品的质量分数说明:只要旧、新工艺分别占据两个检测批次,表面上的 6 分优势便无法在工艺与批次之间分配。本章沿这两次操作学习分层标准化、交互作用、可识别性、固定效应与随机效应。

粗成功率过线,比较人群已经调换

T=0T=0 表示旧工艺,T=1T=1 表示新工艺。预定抽样的四个“工艺 ×\times 难度”单元为

产品难度旧工艺样本旧工艺成功新工艺样本新工艺成功
简单100902019
复杂201210070
总体12010212089

两层中的新工艺成功率都更高:

0.950.90=0.05,0.700.60=0.10.0.95-0.90=0.05, \qquad 0.70-0.60=0.10.

粗成功率却给出相反方向:

p^0=102120=0.850,p^1=891200.742,\hat p_0=\frac{102}{120}=0.850, \qquad \hat p_1=\frac{89}{120}\approx0.742, Δ^crude=p^1p^0=131200.108.\hat\Delta_{\mathrm{crude}} =\hat p_1-\hat p_0 =-\frac{13}{120} \approx-0.108.

旧工艺样本的 5/65/6 来自成功率较高的简单产品,新工艺样本的 5/65/6 来自成功率较低的复杂产品。层权重压过层内优势,结果卡无法过线。

档案库在四个单元中都有足够记录,且允许按目标重新选择难度构成。改选后的报告表为

产品难度旧工艺样本旧工艺成功新工艺样本新工艺成功
简单201810095
复杂100602014
总体12078120109

四个层内成功率没有变化。新的粗成功率变为

p^0=78120=0.650,p^1=1091200.908,\hat p_0^\star=\frac{78}{120}=0.650, \qquad \hat p_1^\star=\frac{109}{120}\approx0.908, Δ^crude=10978120=311200.258.\hat\Delta_{\mathrm{crude}}^\star =\frac{109-78}{120} =\frac{31}{120} \approx0.258.

新工艺由落后 10.810.8 点变成领先 25.825.8 点,总摆幅为

31120(13120)=4412036.7个百分点.\frac{31}{120}-\left(-\frac{13}{120}\right) =\frac{44}{120} \approx36.7\text{个百分点}.

没有一条成败记录被改写,比较人群的难度构成已经交换。粗率同时读取层内成功率与层权重,只报告末端百分比会把这两个来源压成一个数字。

造假动作留下的影子

预定抽样给新工艺 10.8-10.8 点,重选难度构成后变成 +25.8+25.8 点,四个层内成功率始终不变。操作的有效旋钮是两组各自的分母构成。下一节把这个旋钮写成加权均值,求出方向翻转和越过验收线的代数条件。

两层权重何时压过层内优势

对工艺 tt 和难度层 gg,记层内成功率为 ptgp_{tg},该层在工艺 tt 样本中的权重为 wtgw_{tg}。粗成功率是

ptcrude=gwtgptg,gwtg=1.p_t^{\mathrm{crude}} =\sum_g w_{tg}p_{tg}, \qquad \sum_gw_{tg}=1.

这个恒等式没有要求正态分布或大样本;它只把总体分子按层拆开,再除以总体分母。两组采用不同权重时,粗差为

Δcrude=gw1gp1ggw0gp0g.\Delta_{\mathrm{crude}} =\sum_gw_{1g}p_{1g} -\sum_gw_{0g}p_{0g}.

本例只有简单、复杂两层。令 wtw_t 表示工艺 tt 中简单产品的比例,则

ptcrude=pt,C+wt(pt,Ept,C),p_t^{\mathrm{crude}} =p_{t,\mathrm C} +w_t\bigl(p_{t,\mathrm E}-p_{t,\mathrm C}\bigr),

其中 E\mathrm EC\mathrm C 分别表示简单与复杂。代入四个层内成功率,

Δcrude=0.10+0.25w10.30w0.\Delta_{\mathrm{crude}} =0.10+0.25w_1-0.30w_0.

三项具有清楚的含义:

  • 0.100.10 是两种工艺在复杂层的成功率差;

  • 0.25w10.25w_1 是新工艺因纳入简单产品获得的构成增益;

  • 0.30w00.30w_0 是旧工艺因纳入简单产品获得的构成增益。

总体方向翻转为新工艺落后,当且仅当

0.25w10.30w0<0.10.0.25w_1-0.30w_0<-0.10.

预定抽样取 (w1,w0)=(1/6,5/6)(w_1,w_0)=(1/6,5/6),所以

0.10+0.2565×0.306=0.1083.0.10+\frac{0.25}{6}-\frac{5\times0.30}{6} =-0.1083.

要满足粗差至少为 0.200.20 的结果卡,需要

0.25w10.30w00.10.0.25w_1-0.30w_0\ge0.10.

重选样本取 (w1,w0)=(5/6,1/6)(w_1,w_0)=(5/6,1/6),左侧为

5×0.2560.3060.1583,\frac{5\times0.25}{6}-\frac{0.30}{6} \approx0.1583,

因此粗差达到 0.10+0.1583=0.25830.10+0.1583=0.2583。权重互换造成的摆幅也可以直接计算:

0.25(5616)0.30(1656)=44120.0.25\left(\frac56-\frac16\right) -0.30\left(\frac16-\frac56\right) =\frac{44}{120}.

这套代数还能把“挑到过线为止”写成分析路径:候选纳入标准、时间窗、地点和难度比例共同决定 (w1,w0)(w_1,w_0)。若权重在看见粗率后反复调整,候选规则与停止条件都应进入复核记录。

不同权重回答的是不同产品人群。要把工艺差异从人群构成中分开,两种工艺需要面对同一组目标权重。

共同权重先定义要比较的目标人群

设目标人群在各难度层的权重为 qgq_g,其中

qg0,gqg=1.q_g\ge0, \qquad \sum_gq_g=1.

直接标准化把两种工艺都放到这组共同权重下:

ptstd(q)=gqgptg,p_t^{\mathrm{std}}(q) =\sum_gq_gp_{tg}, Δ(q)=p1std(q)p0std(q)=gqg(p1gp0g).\Delta(q) =p_1^{\mathrm{std}}(q)-p_0^{\mathrm{std}}(q) =\sum_gq_g(p_{1g}-p_{0g}).

若简单、复杂各占一半,即 q=(0.5,0.5)q=(0.5,0.5),则

p0std=0.5(0.90)+0.5(0.60)=0.750,p_0^{\mathrm{std}} =0.5(0.90)+0.5(0.60) =0.750, p1std=0.5(0.95)+0.5(0.70)=0.825,p_1^{\mathrm{std}} =0.5(0.95)+0.5(0.70) =0.825, Δ(q)=0.8250.750=0.075.\Delta(q)=0.825-0.750=0.075.

无论采用预定抽样还是重选抽样,只要四个层内成功率保持不变,这个共同权重差都等于 7.57.5 个百分点。

粗差还可以相对于任意目标权重作精确分解:

Δcrude=gqg(p1gp0g)Δ(q)+g(w1gqg)p1gg(w0gqg)p0gC(q).\Delta_{\mathrm{crude}} =\underbrace{\sum_gq_g(p_{1g}-p_{0g})}_{\Delta(q)} +\underbrace{ \sum_g(w_{1g}-q_g)p_{1g} -\sum_g(w_{0g}-q_g)p_{0g} }_{C(q)}.

Δ(q)\Delta(q) 是共同目标人群中的层内差异,C(q)C(q) 是两组样本构成相对于目标人群的偏离。取 q=(0.5,0.5)q=(0.5,0.5) 时,预定抽样有

C(q)=0.10830.075=0.1833,C(q)=-0.1083-0.075=-0.1833,

重选抽样则有

C(q)=0.25830.075=0.1833.C^\star(q)=0.2583-0.075=0.1833.

标准化差始终为 0.0750.075,构成项从 0.1833-0.1833 变成 +0.1833+0.1833,恰好解释 0.36670.3667 的总摆幅。

目标权重不能只因结果漂亮而选定。常见选择包括外部使用人群、政策服务人群、合并样本构成和预先约定的均衡人群。每一种 qq 都对应一个不同的总体问题;报告应给出权重来源及目标人群的时间、地点和纳入边界。

汇总改变了比较人群

层内结果回答“相同难度下怎样比较”;组别各自的粗率回答“各自样本构成下怎样比较”;共同权重结果回答“放到同一目标人群后怎样比较”。三种计算都可能正确,研究目标决定其中哪一个具有解释意义。隐藏层权重会让构成差异看起来像工艺差异。

方法来路:为什么分层表与汇总表要同时保留?

Yule 在 1903 年研究属性关联时已经展示,合并与分层可能给出不同方向的关联。Simpson 在 1951 年进一步讨论列联表中的交互与机械合并。后来所谓“辛普森悖论”来自比较问题和权重被悄悄更换,代数本身保持一致。应采用哪一组权重,需要由抽样设计、目标人群和因果结构决定。

标准化统一了比较对象,却没有消除估计误差。小单元、空单元和从档案中定向选样都会影响 7.57.5 点的可信程度。

标准化结果仍有抽样误差与重叠要求

先假定每个“工艺 ×\times 难度”单元内的记录是独立 Bernoulli 抽样,目标权重 qgq_g 固定,四个单元彼此独立。层内样本比例满足近似方差

Var(p^tg)ptg(1ptg)ntg.\operatorname{Var}(\hat p_{tg}) \approx \frac{p_{tg}(1-p_{tg})}{n_{tg}}.

标准化差估计量为

Δ^(q)=gqg(p^1gp^0g),\hat\Delta(q) =\sum_gq_g(\hat p_{1g}-\hat p_{0g}),

其近似方差为

Var{Δ^(q)}gqg2[p1g(1p1g)n1g+p0g(1p0g)n0g].\operatorname{Var}\{\hat\Delta(q)\} \approx \sum_gq_g^2 \left[ \frac{p_{1g}(1-p_{1g})}{n_{1g}} +\frac{p_{0g}(1-p_{0g})}{n_{0g}} \right].

对重选后的样本取 q=(0.5,0.5)q=(0.5,0.5),用样本比例代替未知概率:

Var^{Δ^(q)}=0.25(0.95(0.05)100+0.90(0.10)20+0.70(0.30)20+0.60(0.40)100)=0.004469.\widehat{\operatorname{Var}}\{\hat\Delta(q)\} =0.25\left( \frac{0.95(0.05)}{100} +\frac{0.90(0.10)}{20} +\frac{0.70(0.30)}{20} +\frac{0.60(0.40)}{100} \right) =0.004469.

因此

SE{Δ^(q)}0.0668.\operatorname{SE}\{\hat\Delta(q)\} \approx0.0668.

简单 Wald 区间为

0.075±1.96(0.0668)(0.056,0.206).0.075\pm1.96(0.0668) \approx(-0.056,0.206).

这个区间只用于显示小单元带来的不确定性。每个较小单元只有 20 件,正式分析可使用分层二项似然、得分区间或保持分层结构的重抽样方法。若 qgq_g 也由样本估计,还需传播权重本身的方差及其与层内估计的协方差。

标准化还依赖重叠条件。对每个满足 qg>0q_g>0 的目标层,两种工艺都需要有该层数据:

qg>0n0g>0,  n1g>0.q_g>0 \quad\Longrightarrow\quad n_{0g}>0,\;n_{1g}>0.

本例四个单元都有样本,可以直接估计两个层内差异。某个单元若为空,标准化结果就要依赖模型外推;目标权重越大,外推对结果的影响越强。极小单元虽未完全为空,也会产生近似的弱重叠问题。

上述方差公式还假定档案记录在每个单元内按既定规则抽取。若选择者在相同难度内继续查看成败、时间、设备或异常标记,单元比例本身也会被选择。此时二项标准误只刻画抽样波动,无法覆盖定向纳入造成的偏差。

共同权重解决“比较谁”,抽样方差说明“估得多准”。还需说明工艺差异采用百分点、相对风险还是优势比,因为交互作用会随效应尺度改变。

分层差异的大小取决于效应尺度

验收卡使用百分点,因此前四节采用风险差

RDg=p1gp0g.\mathrm{RD}_g=p_{1g}-p_{0g}.

同一组概率也可以形成风险比和优势比:

RRg=p1gp0g,ORg=p1g/(1p1g)p0g/(1p0g).\mathrm{RR}_g=\frac{p_{1g}}{p_{0g}}, \qquad \mathrm{OR}_g =\frac{p_{1g}/(1-p_{1g})} {p_{0g}/(1-p_{0g})}.

本例在三种尺度上的结果为

效应尺度简单层复杂层q=(0.5,0.5)q=(0.5,0.5) 的边缘结果
风险差 RD0.0500.0500.1000.1000.0750.075
风险比 RR1.0561.0561.1671.1671.1001.100
优势比 OR2.1112.1111.5561.5561.5711.571

边缘结果一列先把两种工艺的风险标准化到 0.7500.7500.8250.825,再由这两个风险计算效应。边缘优势比 1.5711.571 无法由两个层内优势比作普通平均得到。条件优势比、边缘优势比和风险差对应不同参数,数值不可直接互换。

分层差异还揭示效应异质性。令 G=1G=1 表示复杂产品,在线性概率尺度上可写成

E(YT,G)=β0+βTT+βGG+βTGTG.\mathbb{E}(Y\mid T,G) =\beta_0+\beta_TT+\beta_GG+\beta_{TG}TG.

四个单元概率给出

β0=0.90,βT=0.05,βG=0.30,βTG=0.05.\beta_0=0.90, \qquad \beta_T=0.05, \qquad \beta_G=-0.30, \qquad \beta_{TG}=0.05.

βT\beta_T 是简单层的工艺差,βT+βTG=0.10\beta_T+\beta_{TG}=0.10 是复杂层的工艺差。目标人群中复杂产品比例为 qCq_{\mathrm C} 时,标准化风险差为

Δ(q)=βT+qCβTG.\Delta(q) =\beta_T+q_{\mathrm C}\beta_{TG}.

qC=0.5q_{\mathrm C}=0.5 即得到 0.0750.075。在线性概率模型超出当前概率范围时,预测可能落到 [0,1][0,1] 之外,可改用二项广义线性模型;交互系数会随链接函数和效应尺度改变。

分层代数本身只给出描述性比较。若难度是工艺使用前的混杂因素,标准化获得因果解释还需要层内可比性、一致性与重叠。难度也可能修饰工艺效果,此时目标权重决定平均哪一种异质效应。第十九章将系统处理这些因果条件。本章先转入一个更直接的信息缺口:工艺与检测批次完全重合时,连描述模型中的两个系数都无法分开。

工艺与批次重合使第二张结果卡过线

粗成功率过线以后,还要填写一张连续质量分数卡。六件产品的检测安排为

产品工艺 TT批次 BB质量分数 YY
10(旧)049
20(旧)050
30(旧)051
41(新)155
51(新)156
61(新)157

旧、新工艺的样本均值为

Yˉ0=50,Yˉ1=56,\bar Y_0=50, \qquad \bar Y_1=56,

所以未经批次调整的差为

Yˉ1Yˉ0=6.\bar Y_1-\bar Y_0=6.

这个数字超过质量卡的 5 分验收线。六条观测还满足

Ti=Bi对所有 i.T_i=B_i \qquad\text{对所有 }i.

工艺变化与批次变化发生在同一组三行之间。设加性均值模型为

Yi=β0+βTTi+βBBi+εi,E(εiTi,Bi)=0.Y_i =\beta_0+\beta_TT_i+\beta_BB_i+\varepsilon_i, \qquad \mathbb{E}(\varepsilon_i\mid T_i,B_i)=0.

旧工艺只在批次 0 出现,新工艺只在批次 1 出现。观测到的 6 分可以全部来自工艺、全部来自批次,也可以由二者按任意比例相加。

每种工艺虽然各测了三件产品,工艺指派只在两个批次之间变化。把六个读数当作六次独立的工艺比较会造成伪重复:批次内的产品波动可以估计,工艺与批次的来源仍只有两个完全重合的组。要看清这个限制,需要检查设计矩阵的秩。

设计矩阵的秩决定哪些参数可以识别

本例的设计矩阵为

X=(100100100111111111),XX=(633333333).X= \begin{pmatrix} 1&0&0\\ 1&0&0\\ 1&0&0\\ 1&1&1\\ 1&1&1\\ 1&1&1 \end{pmatrix}, \qquad X^\top X= \begin{pmatrix} 6&3&3\\ 3&3&3\\ 3&3&3 \end{pmatrix}.

工艺列与批次列完全相同,故

rank(X)=2<3.\operatorname{rank}(X)=2<3.

向量

v=(011)v= \begin{pmatrix} 0\\1\\-1 \end{pmatrix}

位于 XX 的零空间,因为

Xv=0.Xv=0.

若参数向量为 β=(β0,βT,βB)\beta=(\beta_0,\beta_T,\beta_B)^\top,那么对任意常数 aa

X(β+av)=Xβ.X(\beta+av)=X\beta.

数据可以识别旧工艺、批次 0 的均值

β0=50\beta_0=50

以及两个变化之和

βT+βB=6,\beta_T+\beta_B=6,

却无法单独识别 βT\beta_TβB\beta_B。例如

(50,6,0),(50,2,4),(50,0,6)(50,6,0), \qquad (50,2,4), \qquad (50,0,6)

给出完全相同的六个拟合值。它们的残差都是

(1,0,1,1,0,1),(-1,0,1,-1,0,1),

残差平方和均为 4。

更一般地,线性函数 β\ell^\top\beta 可识别,当且仅当它对所有零空间方向保持不变。本例要求

v=0.\ell^\top v=0.

工艺系数对应 =(0,1,0)\ell=(0,1,0)^\top,有 v=1\ell^\top v=1,所以不可识别;工艺与批次之和对应 =(0,1,1)\ell=(0,1,1)^\top,有 v=0\ell^\top v=0,因此可识别。

软件仍可能返回一组数字。Moore–Penrose 伪逆在所有满足 βT+βB=6\beta_T+\beta_B=6 的解中选择欧氏范数最小者,得到

β^T=β^B=3.\hat\beta_T=\hat\beta_B=3.

删掉批次列会把 6 全给工艺;删掉工艺列会把 6 全给批次;不同惩罚或先验还会给出其他分配。这些数值反映求解约定或模型假设,数据没有提供选择其中一组的交叉比较。

零空间揭示的是设计缺口。要让 βT\beta_TβB\beta_B 分开,采集阶段必须让同一批次内出现两种工艺,并让同一工艺跨越多个批次。

交叉、区组与随机化在采集阶段创造比较

工艺和批次的交叉表应让四种组合都出现:

批次 0批次 1
旧工艺有样本有样本
新工艺有样本有样本

例如,一次新的平衡实验得到以下单元均值:

批次 0批次 1
旧工艺5054
新工艺5559

两个批次内的新旧工艺差都为 5,两个工艺内的批次差都为 4。加性模型

E(YT,B)=β0+βTT+βBB\mathbb{E}(Y\mid T,B) =\beta_0+\beta_TT+\beta_BB

由此识别出

β0=50,βT=5,βB=4.\beta_0=50, \qquad \beta_T=5, \qquad \beta_B=4.

若工艺效果随批次改变,还要加入

βTBTB.\beta_{TB}TB.

四个组合使交互项在代数上可识别;每个组合保留重复,才能进一步估计纯误差并检查交互是否超过重复波动。只有单个观测占据每个单元时,四个均值参数会饱和拟合,仍没有残差自由度。

区组化把批次作为已知变异来源,在每个批次内比较工艺。随机化决定同一批产品接受哪种工艺以及上机顺序,使未记录因素较难与工艺列系统重合。跨越多个独立批次则让结论不再依赖某一次试剂、日期或仪器状态。

方法来路:为什么实验设计先处理区组,再计算处理效应?

农田肥力、原料批号和测量日期都会形成空间或时间梯度。Fisher 在实验设计中系统使用区组与随机化:先把相近实验单位放入同一区组,再在区组内随机分配处理。处理比较由区组内变化识别,稳定的区组差异被隔开。这个设计思想后来进入工业试验、临床中心和多批次仪器实验。

交叉设计保护可识别性,实际数据仍可能因缺失、失败运行或临时改批而失去交叉。建模前的第一步应直接查看工艺与批次元数据。

批次交叉表在建模前暴露空单元

批次可以指试剂盒、原料、生产线、医院、日期、操作者、仪器、校准版本或软件版本。章首六件产品的计数交叉表为

批次 0批次 1
旧工艺30
新工艺03

一个简单的批次内重叠计数是

OB=bmin(n0b,n1b).O_B=\sum_b\min(n_{0b},n_{1b}).

当前 OB=0O_B=0,说明没有任何产品能进入批次内工艺比较。这个指标只描述单元是否重叠;精度还取决于批次数、各单元样本量和结果变异。

批次核查可以按以下顺序进行:

  1. 画出工艺与批次、地点、日期、操作者和仪器的交叉表;

  2. 标出空单元、极小单元及每批工艺比例;

  3. 比较每批的空白、标准品、质控、缺失率和失败运行;

  4. 按采集顺序绘制结果,在残差图或 PCA 图上用批次着色;

  5. 检查维护、校准、试剂更换和软件升级是否与工艺切换同日发生;

  6. 计算设计矩阵的秩、条件数和零空间,记录被自动删除的列;

  7. 保存批次标签的生成规则、修改历史和原始时间戳。

PCA 上的批次分离只能提示多变量分布随批次改变,无法单独判断这种变化来自技术因素还是产品构成。质控材料若在所有批次重复出现,可以提供跨批锚点;它们与研究样品承担的比较任务不同。

交叉表确认批次内同时存在两种工艺后,固定效应模型可以直接用批次内变化估计工艺系数。

固定效应只使用批次内的工艺变化

把每个已观察批次赋予独立截距,得到

Yib=αb+βTib+εib,Y_{ib} =\alpha_b+\beta T_{ib}+\varepsilon_{ib},

其中 ii 表示批次 bb 内的产品。对每个批次减去批次均值:

YibYˉb=β(TibTˉb)+(εibεˉb).Y_{ib}-\bar Y_b =\beta(T_{ib}-\bar T_b) +(\varepsilon_{ib}-\bar\varepsilon_b).

批次截距 αb\alpha_b 被消去。最小二乘的批次内估计量为

β^FE=bi(TibTˉb)(YibYˉb)bi(TibTˉb)2.\hat\beta_{\mathrm{FE}} = \frac{ \sum_b\sum_i (T_{ib}-\bar T_b)(Y_{ib}-\bar Y_b) }{ \sum_b\sum_i (T_{ib}-\bar T_b)^2 }.

一个批次只有在

0<Tˉb<10<\bar T_b<1

时才能为分母提供工艺变化。章首数据在批次 0 中有 Tˉ0=0\bar T_0=0,在批次 1 中有 Tˉ1=1\bar T_1=1,所以

TibTˉb=0对所有观测.T_{ib}-\bar T_b=0 \qquad\text{对所有观测}.

估计量分母为零,固定效应模型明确报告工艺系数不可识别。增加每批同一工艺的技术重复只会增加零项;至少要有批次内交叉。

固定效应吸收每个批次内保持不变的已观测和未观测因素。若温度、原料质量或仪器漂移在批次内随工艺顺序共同变化,它们仍会进入工艺比较。固定效应也只描述已经观察到的批次,不直接为更大批次总体建立分布。

当批次被看作更大总体的样本时,可以为批次偏移指定概率分布。这个随机效应模型会改变协方差结构,也会带来新的独立性假设。

随机截距把批次相关写进协方差

Yib=β0+βTTib+ub+εib,Y_{ib} =\beta_0+\beta_TT_{ib}+u_b+\varepsilon_{ib}, ubN(0,σb2),εibN(0,σe2),u_b\sim N(0,\sigma_b^2), \qquad \varepsilon_{ib}\sim N(0,\sigma_e^2),

并暂假定不同批次的随机截距相互独立,ubu_b 与个体误差及工艺指派独立。同一批次的两个观测共享 ubu_b,因此

Var(YibTib)=σb2+σe2,\operatorname{Var}(Y_{ib}\mid T_{ib}) =\sigma_b^2+\sigma_e^2, Cov(Yib,YjbT)=σb2(ij).\operatorname{Cov}(Y_{ib},Y_{jb}\mid T) =\sigma_b^2 \qquad(i\ne j).

组内相关系数为

ρ=σb2σb2+σe2.\rho =\frac{\sigma_b^2} {\sigma_b^2+\sigma_e^2}.

ρ\rho 越大,同一批次记录之间的信息重叠越强,新增一条批内观测所增加的独立信息越少。若每批有 mm 条观测,

Var(Yˉb)=σb2+σe2m.\operatorname{Var}(\bar Y_b) =\sigma_b^2+\frac{\sigma_e^2}{m}.

把它改写为

Var(Yˉb)=σb2+σe2m[1+(m1)ρ],\operatorname{Var}(\bar Y_b) =\frac{\sigma_b^2+\sigma_e^2}{m} \bigl[1+(m-1)\rho\bigr],

方括号中的

D=1+(m1)ρD=1+(m-1)\rho

称为等规模簇抽样下的设计效应。把 mm 条相关观测误当成独立观测,会把均值方差低估为真实值的 1/D1/D

例如 σb2=4\sigma_b^2=4σe2=6\sigma_e^2=6 时,

ρ=410=0.4.\rho=\frac{4}{10}=0.4.

每批 m=3m=3 条观测的设计效应为

D=1+2(0.4)=1.8.D=1+2(0.4)=1.8.

在等簇、同相关和相同目标等理想条件下,六条记录的有效样本量直觉约为

61.83.33.\frac{6}{1.8}\approx3.33.

章首实际只有两个批次,独立批次数仍然极少;有效样本量公式不能替代足够的批次复制。随机截距的另一个作用是让批次效应部分汇聚,下一节说明这种收缩从哪里产生。

部分汇聚依赖批次总体与分配假设

在方差分量已知、固定部分已估计的简化情形下,批次 bb 的残差均值记为

rˉb=Yˉbxbβ.\bar r_b =\bar Y_b-\overline{x}_b^\top\beta.

随机截距的条件均值具有收缩形式

u^b=mbσb2mbσb2+σe2rˉb.\widehat u_b =\frac{m_b\sigma_b^2} {m_b\sigma_b^2+\sigma_e^2} \bar r_b.

收缩因子位于 0 与 1 之间。批内样本量 mbm_b 小或批内噪声 σe2\sigma_e^2 大时,u^b\widehat u_b 更靠近总体均值 0;批内信息增加时,它更接近该批残差均值。这与第十五章层次模型中的部分汇聚具有同一概率结构。

随机截距对工艺系数的解释依赖

ubTibu_b\perp T_{ib}

等分配假设。若高水平工艺系统地安排在响应较高的批次,批次偏移与工艺指派相关,普通随机截距模型会把组间关联混入工艺系数。可在设计中随机化工艺,也可在有充分批次内变化时分别建模批次内与批次间信息。

章首只有两个批次,而且 T=BT=B。随机截距软件可能借助正态分布、惩罚或先验返回一个工艺系数;数据本身仍缺少批次内工艺对照。方差分量也难以由两个批次稳定估计。部分汇聚可以稳定已有比较,无法生成空单元中的比较。

若工艺系数已经可识别,并且独立批次数足够多,批次聚类稳健标准误可以在较少指定相关结构的情况下修正推断。它同样依赖独立簇的数量,面对秩亏设计时也没有可供修正的工艺系数。

适用边界:固定效应与随机效应解决不同问题

固定效应为每个已观察批次设置参数,工艺系数完全由批次内变化识别;随机效应为批次差异指定总体分布,并通过部分汇聚借用组间信息。选择取决于目标总体、分配设计、批次数和分布假设。两类模型都需要可识别的工艺比较,也都无法自动修复工艺与批次完全重合的设计。

分层权重决定比较人群,批次交叉决定效应来源能否分开。下一节把两类结构检查合并为一条可复算的审计顺序。

把分层权重与批次设计放回审计链

章首两次操作留下两种结构证据。难度重选把粗差从 10.8-10.8 点推到 +25.8+25.8 点,共同权重结果却固定在 +7.5+7.5 点;工艺—难度交叉表直接显示两组权重互换。六件产品的质量分数显示新工艺高 6 分,工艺—批次交叉表却有两个空单元,设计矩阵零空间包含

(011).\begin{pmatrix} 0\\1\\-1 \end{pmatrix}.

沿这个方向增加工艺系数、减少同样大小的批次系数,拟合值和残差完全不动。复核顺序可以写成

明确目标人群与效应尺度列出分层分子、分母与权重按共同权重标准化检查重叠与抽样路径交叉工艺、批次与时间检查秩与零空间选择相关结构和推断方法.\begin{aligned} \text{明确目标人群与效应尺度} &\longrightarrow \text{列出分层分子、分母与权重} \longrightarrow \text{按共同权重标准化}\\ &\longrightarrow \text{检查重叠与抽样路径} \longrightarrow \text{交叉工艺、批次与时间}\\ &\longrightarrow \text{检查秩与零空间} \longrightarrow \text{选择相关结构和推断方法}. \end{aligned}

具体记录至少包括:

  1. 每个层和批次的原始样本数、成功数、均值与缺失数;

  2. 粗结果、层内结果、目标权重、标准化结果及其不确定性;

  3. 难度、地点、时间窗和排除规则的预先版本与实际版本;

  4. 工艺—批次交叉表、批次内重叠、独立批次数和上机顺序;

  5. 设计矩阵的列定义、秩、条件数、零空间和软件删除项;

  6. 固定效应的批次内识别来源,或随机效应的总体与独立性假设;

  7. 空白、质控、校准、维护和软件版本等跨批锚点;

  8. 所有粗率、标准化、模型和报告表的可执行复算代码。

辛普森翻转和完全混杂都源于联合结构。前者仍有四个单元,可以在共同目标人群中重新加权;后者缺少两个交叉单元,数据无法分配两个来源。第十九章继续追问:即使各层有重叠、模型也满秩,观察研究中的调整变量究竟是处理前混杂因素、中介还是碰撞节点,仍需由因果结构决定。

本章知识链

  1. 粗成功率是层内成功率按组别自身权重形成的加权均值;改变分母构成可以在不改写单条结果时改变总体方向。

  2. 本例粗差满足 Δcrude=0.10+0.25w10.30w0\Delta_{\mathrm{crude}}=0.10+0.25w_1-0.30w_0,权重互换使结果摆动 36.736.7 个百分点。

  3. 共同目标权重 qq 定义同一个比较人群;简单、复杂各半时,两种抽样方案的标准化差都为 7.57.5 点。

  4. 粗差可精确分解为共同权重层内差异与构成项;本例构成项从 0.1833-0.1833 变到 +0.1833+0.1833

  5. 标准化估计仍有抽样误差;固定权重下的方差由各层二项方差按 qg2q_g^2 合成。

  6. 所有目标层都需要两种工艺的数据;空单元造成外推,极小单元造成弱重叠与大标准误。

  7. 风险差、风险比和优势比描述不同参数;交互作用及边缘—条件差异会随效应尺度改变。

  8. 分层代数提供描述性比较,因果解释还需要处理前变量、层内可比性、一致性与重叠等条件。

  9. 工艺与批次完全重合时,设计矩阵降秩;本例只能识别 β0\beta_0βT+βB\beta_T+\beta_B

  10. 可识别线性函数必须与设计矩阵零空间正交;伪逆、删列或惩罚给出的单个解会引入额外约定。

  11. 交叉、区组化和随机化在采集阶段创造批次内工艺比较;技术重复无法替代独立批次和交叉单元。

  12. 固定效应通过批次内去均值识别工艺系数;工艺在批次内不变化时,估计分母为零。

  13. 随机截距产生组内相关 ρ\rho 和设计效应 1+(m1)ρ1+(m-1)\rho,部分汇聚还依赖批次总体与分配独立性。

  14. 完整审计同时保留分层权重、目标人群、效应尺度、批次交叉、矩阵秩、相关结构和原始版本链。

思考与练习

  1. 复算预定抽样与重选抽样的两组粗成功率、粗差和总摆幅。再用共同权重 q=(0.7,0.3)q=(0.7,0.3) 标准化两种工艺,并说明该目标人群与各占一半时有何差别。

  2. 从两层加权均值推出 Δcrude=0.10+0.25w10.30w0\Delta_{\mathrm{crude}}=0.10+0.25w_1-0.30w_0。在单位正方形 0w0,w110\le w_0,w_1\le1 中画出 Δ=0\Delta=0Δ=0.20\Delta=0.20 两条边界,并标出预定、重选两点。

  3. q=(0.5,0.5)q=(0.5,0.5),分别计算预定抽样和重选抽样的构成项 C(q)C(q),验证标准化差与构成项之和等于对应粗差。

  4. 按重选后的四个单元样本量,复算标准化差的近似方差、标准误和 Wald 区间。若每个小单元从 20 件增加到 80 件且比例不变,标准误怎样变化?

  5. 复算简单层、复杂层及共同权重人群中的 RD、RR 与 OR。解释为什么边缘 OR 1.5711.571 不能由两个层内 OR 作普通平均得到。

  6. 构造一个两层例子,使每层风险差都为负而粗总体风险差为正。给出四个层内率、两组权重和完整加权计算。

  7. 对六件产品写出 XXX^\top X,验证其秩为 2,并证明 (0,1,1)(0,1,-1)^\top 是零空间向量。判断 βTβB\beta_T-\beta_BβT+βB\beta_T+\beta_B2β0+βT+βB2\beta_0+\beta_T+\beta_B 是否可识别。

  8. 证明在约束 βT+βB=6\beta_T+\beta_B=6 下,最小化 βT2+βB2\beta_T^2+\beta_B^2 得到伪逆解 (3,3)(3,3)。再说明对两个系数使用不同惩罚强度时,解会向哪一项移动。

  9. 对正文交叉设计的四个单元均值拟合加性模型,复算 (β0,βT,βB)=(50,5,4)(\beta_0,\beta_T,\beta_B)=(50,5,4)。若新工艺在批次 1 的均值改为 61,求交互项 βTB\beta_{TB}

  10. 从批次内去均值公式推导 β^FE\hat\beta_{\mathrm{FE}}。对章首六件产品证明分母为零;再增加一件“新工艺、批次 0”的产品,说明哪些批次开始提供工艺信息。

  11. σb2=4,σe2=6\sigma_b^2=4,\sigma_e^2=6,计算 ICC、m=3m=3m=10m=10 时的设计效应。再计算 m=1,3,10m=1,3,10 时的随机截距收缩因子,并解释批内样本量的作用。

  12. 为一次跨四个检测批次的新旧工艺试验设计分配表,使每批都有两种工艺且上机顺序随机。列出复核包应保存的权重、批次、质控、矩阵与版本信息,并说明哪些条件将在下一章获得因果解释。

专题导航