第十一章:把负工艺效应改写成正斜率

本章造假目标

五条中心化工艺记录包含负载 ZZ、工艺强度 XX 和产出 YY。预先批准的模型为 YX+ZY\sim X+Z,其中工艺系数是 1.000-1.000,经典双侧 p=0.036p=0.036。结果摘要只验收一项:展示的 XX 斜率至少为 1.01.0。允许的操作仅限于从展示模型中省略负载 ZZ,不得改动数据、删行、替换响应变量或增加变换。本章将构造通过验收的一元回归,并依次追问:斜率怎样由最小二乘产生,正号怎样由遗漏变量产生,“同负载比较”怎样由 FWL 残差化实现,标准误能修正什么,以及高杠杆行是否支撑了验收结论。

省略一列便足以改变斜率方向

五条记录为

ii负载 ZZ工艺强度 XX产出 YY
12-21-14.8-4.8
21-12-21.1-1.1
300000.4-0.4
411003.33.3
522333.03.0

X,Z,YX,Z,Y 的样本均值都为 0。若展示模型只保留 XX,含截距的一元回归斜率为

β^Xsimple=XYXX=1614=871.143.\widehat\beta_X^{\mathrm{simple}} =\frac{X^\top Y}{X^\top X} =\frac{16}{14} =\frac87 \approx1.143.

它超过验收线 1.01.0。恢复负载以后,

YX+Zβ^Xfull=1.Y\sim X+Z \qquad\Longrightarrow\qquad \widehat\beta_X^{\mathrm{full}}=-1.

两次回归使用同样的五行数据,差别只在模型矩阵是否含有 ZZ。一元模型比较不同负载下的记录;完整模型把负载保持不变作为线性比较条件。这种条件比较由投影实现,原表无需出现负载完全相同的两行。斜率方向随比较条件一起改变。

造假动作留下的影子

省略 ZZ 后,数据文件仍然完整,模型规格已经缩短。可复核痕迹会出现在分析方案与代码公式的差异、设计矩阵缺失的列、未报告的控制变量模型,以及残差化前后相反的斜率中。

这个构造提出三个连续问题:87\frac87 为什么是最小二乘解;它为何与 1-1 相差 157\frac{15}{7};恢复 ZZ 以后,系数和不确定性又从哪些数据方向中计算出来。

最小二乘把拟合写成优化问题

含截距的一元线性回归写成

Yi=β0+β1Xi+vi.Y_i=\beta_0+\beta_1X_i+v_i.

最小二乘选择 β0,β1\beta_0,\beta_1,使残差平方和

RSS(β0,β1)=i=1n(Yiβ0β1Xi)2RSS(\beta_0,\beta_1) =\sum_{i=1}^n (Y_i-\beta_0-\beta_1X_i)^2

达到最小。分别求偏导并令其为 0:

i(Yiβ^0β^1Xi)=0,\sum_i(Y_i-\widehat\beta_0-\widehat\beta_1X_i)=0, iXi(Yiβ^0β^1Xi)=0.\sum_iX_i(Y_i-\widehat\beta_0-\widehat\beta_1X_i)=0.

第一条正规方程给出

β^0=Yβ^1X.\widehat\beta_0 =\overline Y-\widehat\beta_1\overline X.

将它代入第二条:

β^1=i(XiX)(YiY)i(XiX)2.\widehat\beta_1 = \frac{\sum_i(X_i-\overline X)(Y_i-\overline Y)} {\sum_i(X_i-\overline X)^2}.

因此,斜率等于 X,YX,Y 的共同变化除以 XX 自身的变化。它也可以写成

β^1=rXYsYsX,\widehat\beta_1 =r_{XY}\frac{s_Y}{s_X},

其中 rXYr_{XY} 是样本相关系数,sX,sYs_X,s_Y 使用相同的方差分母。相关系数没有量纲,回归斜率带有“YY 的单位/XX 的单位”;二者描述相关的几何关系,承担的解释任务仍有区别。

本章三列已经中心化,故 β^0=0\widehat\beta_0=0,并且

XX=14,XY=16.X^\top X=14, \qquad X^\top Y=16.

这便得到 β^1=8/7\widehat\beta_1=8/7

方法来路:最小二乘为何从轨道与测地观测中出现

天文和测地观测常用多条带误差的方程估计少数未知参数,方程数量超过未知量时,各条方程通常无法同时严格成立。Legendre 在 1805 年公开提出“最小二乘”规则,用残差平方和统一处理超定方程;Gauss 在 1809 年的轨道计算著作中进一步讨论误差概率模型。优化问题定义了点估计,误差模型随后为标准误与概率推断提供依据。这个先后关系很重要:算出一条最小二乘直线,无须先假定误差服从正态分布;赋予小样本 tt 检验精确概率含义,则需要额外假设。

点估计通过验收仍不等于统计证据充分

一元模型的拟合值为

Y^i=87Xi,\widehat Y_i=\frac87X_i,

残差向量为

v^=(12835,8370,25,3310,37),\widehat{\mathbf v} = \left( -\frac{128}{35}, \frac{83}{70}, -\frac25, \frac{33}{10}, -\frac37 \right)^\top,

所以

RSSsimple=v^v^=18217026.014.RSS_{\mathrm{simple}} =\widehat{\mathbf v}^{\top}\widehat{\mathbf v} =\frac{1821}{70} \approx26.014.

模型估计截距和一个斜率,残差自由度为 52=35-2=3。经典同方差方差估计与斜率标准误为

σ^v2=RSSsimple3,\widehat\sigma_v^2 =\frac{RSS_{\mathrm{simple}}}{3}, \SEclassic(β^1)=σ^v2i(XiX)2=(1821/70)/3140.787.\begin{aligned} \SE_{\mathrm{classic}} (\widehat\beta_1) &= \sqrt{ \frac{\widehat\sigma_v^2} {\sum_i(X_i-\overline X)^2} }\\ &= \sqrt{\frac{(1821/70)/3}{14}} \approx0.787. \end{aligned}

常规软件据此给出

t=8/70.7871.452,ptwo-sided0.242.t=\frac{8/7}{0.787}\approx1.452, \qquad p_{\mathrm{two\text{-}sided}}\approx0.242.

这里出现了两条互不替代的验收规则:

  1. 点估计规则问 β^11\widehat\beta_1\ge1 是否成立;

  2. 显著性检验问数据与“目标斜率为 0”的模型是否相容,并且答案依赖误差假设与参照分布。

第一条已经通过,第二条没有在 5%5\% 水平拒绝零斜率。

适用边界:自由度为 3 的 tt 参照从哪里来

在把 XX 视为给定的经典模型中,若

vXN(0,σv2I),\mathbf v\mid X\sim N(\mathbf0,\sigma_v^2I),

则用残差均方替代 σv2\sigma_v^2 后,斜率统计量精确服从自由度 n2n-2tt 分布。仅有最小二乘公式并不能推出这个分布。本章一元模型还省略了与 XX 共同变化的 ZZ,所以 p=0.242p=0.242 应读作该一元规格下的常规模型输出。它既没有恢复同负载比较,也没有为工艺因果效应提供检验。

遗漏变量公式分解正斜率的来源

设完整总体条件均值为

Y=β0+βXX+γZ+ε,E(εX,Z)=0.Y=\beta_0+\beta_XX+\gamma Z+\varepsilon, \qquad \mathbb{E}(\varepsilon\mid X,Z)=0.

若只用 XX 与截距对 YY 作线性投影,一元总体斜率满足

βXsimple=Cov(X,Y)Var(X)=Cov ⁣(X,βXX+γZ+ε)Var(X)=βX+γCov(X,Z)Var(X).\begin{aligned} \beta_X^{\mathrm{simple}} &=\frac{\operatorname{Cov}(X,Y)}{\operatorname{Var}(X)}\\ &=\frac{ \operatorname{Cov}\!\left( X,\beta_XX+\gamma Z+\varepsilon \right)} {\operatorname{Var}(X)}\\ &=\beta_X +\gamma\frac{\operatorname{Cov}(X,Z)}{\operatorname{Var}(X)}. \end{aligned}

最后一步使用了 Cov(X,ε)=0\operatorname{Cov}(X,\varepsilon)=0,它由条件均值假设和迭代期望得到。令

δZX=Cov(X,Z)Var(X),\delta_{Z\sim X} =\frac{\operatorname{Cov}(X,Z)}{\operatorname{Var}(X)},

δZX\delta_{Z\sim X} 正是把 ZZXX 与截距回归时的总体斜率。遗漏项

γδZX\gamma\delta_{Z\sim X}

同时需要两段联系:ZZ 进入 YY 的条件均值,并且 ZZXX 系统变化。任一段联系消失,这个遗漏项都为 0。

本章数据也满足完全对应的样本恒等式。完整模型的正规方程为

(14101010)(β^Xγ^)=(1620),\begin{pmatrix} 14&10\\ 10&10 \end{pmatrix} \begin{pmatrix} \widehat\beta_X\\ \widehat\gamma \end{pmatrix} = \begin{pmatrix} 16\\20 \end{pmatrix},

解得

β^X=1,γ^=3.\widehat\beta_X=-1, \qquad \widehat\gamma=3.

同时,

δ^ZX=XZXX=1014=57.\widehat\delta_{Z\sim X} =\frac{X^\top Z}{X^\top X} =\frac{10}{14} =\frac57.

因此

β^Xsimple=1+357=87.\widehat\beta_X^{\mathrm{simple}} =-1+3\cdot\frac57 =\frac87.

正斜率由两部分相加而成:同负载下的条件斜率贡献 1-1,负载随工艺强度共同变化所混入的部分贡献 15/715/7

适用边界:线性投影恒等式不自动给出因果解释

遗漏变量公式精确描述两套线性回归系数之间的关系。把 ZZ 称为因果混杂变量,还要说明研究目标、时间顺序、共同原因、测量方式、函数形式与可识别条件。预测模型可能有意省略 ZZ,关联模型需要准确命名比较条件,因果模型则要论证调整集合。第十八、十九章将用干预和因果图补充这些条件。

FWL 定理把控制变量变成残差方向

“控制 ZZ”可以写成一个明确的投影运算。令

C=(1z),C= \begin{pmatrix} \mathbf1&\mathbf z \end{pmatrix},

并假设 CC 满列秩。投影矩阵与残差生成矩阵分别为

PC=C(CC)1C,MC=IPC.P_C=C(C^\top C)^{-1}C^\top, \qquad M_C=I-P_C.

它们满足

PC=PC,PC2=PC,MC=MC,MC2=MC,CMC=0.P_C^\top=P_C,\quad P_C^2=P_C, \qquad M_C^\top=M_C,\quad M_C^2=M_C, \qquad C^\top M_C=0.

PCP_C 保留由截距和 ZZ 张成的方向,MCM_C 保留与这些方向正交的剩余变化。

推导:FWL 系数公式

考虑完整回归

y=xβ+Cδ+ε.\mathbf y=\mathbf x\beta+C\boldsymbol\delta+\boldsymbol\varepsilon.

先固定 β\beta,再对 δ\boldsymbol\delta 最小化

yxβCδ2.\|\mathbf y-\mathbf x\beta-C\boldsymbol\delta\|^2.

相应解为

δ^(β)=(CC)1C(yxβ).\widehat{\boldsymbol\delta}(\beta) =(C^\top C)^{-1}C^\top(\mathbf y-\mathbf x\beta).

代回以后,未被 CC 解释的残差是

MC(yxβ).M_C(\mathbf y-\mathbf x\beta).

于是原来的多元最小二乘问题化为

minβMCyMCxβ2.\min_\beta \|M_C\mathbf y-M_C\mathbf x\,\beta\|^2.

x~=MCx,y~=MCy.\widetilde{\mathbf x}=M_C\mathbf x, \qquad \widetilde{\mathbf y}=M_C\mathbf y.

x~x~>0\widetilde{\mathbf x}^{\top}\widetilde{\mathbf x}>0,则

β^=x~y~x~x~=xMCyxMCx.\widehat\beta =\frac{ \widetilde{\mathbf x}^{\top}\widetilde{\mathbf y}} {\widetilde{\mathbf x}^{\top}\widetilde{\mathbf x}} =\frac{\mathbf x^\top M_C\mathbf y} {\mathbf x^\top M_C\mathbf x}.

这就是完整回归中 x\mathbf x 的系数。

对本章数据,

X=Z+u,u=(1,1,0,1,1),X=Z+u, \qquad u=(1,-1,0,-1,1)^\top, Y=2Zu+e,e=(0.2,0.1,0.4,0.3,0).Y=2Z-u+e, \qquad e=(0.2,-0.1,-0.4,0.3,0)^\top.

这些向量满足

1u=Zu=0,\mathbf1^\top u=Z^\top u=0, 1e=Ze=ue=0.\mathbf1^\top e=Z^\top e=u^\top e=0.

所以

X~=MCX=u,\widetilde X=M_CX=u, Y~=MCY=u+e=(0.8,0.9,0.4,1.3,1.0).\widetilde Y=M_CY=-u+e =(-0.8,0.9,-0.4,1.3,-1.0)^\top.

FWL 斜率为

β^X=u(u+e)uu=44=1.\widehat\beta_X =\frac{u^\top(-u+e)}{u^\top u} =\frac{-4}{4} =-1.

原始点云中的正方向和残差点云中的负方向可以并列观察。

FWL 同时从 X 和 Y 中剔除截距与负载方向;两幅图使用不同坐标尺度。

FWL 同时从 XXYY 中剔除截距与负载方向;两幅图使用不同坐标尺度。

方法来路:FWL 为什么要同时残差化两边

Frisch 与 Waugh(1933)提出分块回归结果,Lovell(1963)作出一般阐释。FWL 对 X,YX,Y 同时施加 MCM_C,使系数完全由控制变量空间正交补上的变化决定。

矩阵形式统一一元回归与多元回归

把完整模型写成

y=Dθ+ε,D=(1X1Z11X5Z5),θ=(β0βXγ).\mathbf y=D\boldsymbol\theta+\boldsymbol\varepsilon, \qquad D= \begin{pmatrix} 1&X_1&Z_1\\ \vdots&\vdots&\vdots\\ 1&X_5&Z_5 \end{pmatrix}, \qquad \boldsymbol\theta= \begin{pmatrix} \beta_0\\\beta_X\\\gamma \end{pmatrix}.

残差平方和为

RSS(θ)=(yDθ)(yDθ).RSS(\boldsymbol\theta) =(\mathbf y-D\boldsymbol\theta)^\top (\mathbf y-D\boldsymbol\theta).

求导得到正规方程

DDθ^=Dy.D^\top D\widehat{\boldsymbol\theta} =D^\top\mathbf y.

DD 满列秩,

θ^=(DD)1Dy.\widehat{\boldsymbol\theta} =(D^\top D)^{-1}D^\top\mathbf y.

本章的两个矩阵为

DD=(5000141001010),Dy=(01620).D^\top D= \begin{pmatrix} 5&0&0\\ 0&14&10\\ 0&10&10 \end{pmatrix}, \qquad D^\top\mathbf y= \begin{pmatrix} 0\\16\\20 \end{pmatrix}.

并且

(DD)1=(150001414014720).(D^\top D)^{-1} = \begin{pmatrix} \frac15&0&0\\ 0&\frac14&-\frac14\\ 0&-\frac14&\frac7{20} \end{pmatrix}.

因此

θ^=(013).\widehat{\boldsymbol\theta} = \begin{pmatrix} 0\\-1\\3 \end{pmatrix}.

帽子矩阵

H=D(DD)1DH=D(D^\top D)^{-1}D^\top

y\mathbf y 正交投影到 DD 的列空间。它是对称幂等矩阵,

H=H,H2=H,tr(H)=rank(D)=3.H^\top=H, \qquad H^2=H, \qquad \operatorname{tr}(H)=\operatorname{rank}(D)=3.

拟合值与残差为

y^=Hy,e^=(IH)y.\widehat{\mathbf y}=H\mathbf y, \qquad \widehat{\mathbf e}=(I-H)\mathbf y.

正规方程也可写成

De^=0.D^\top\widehat{\mathbf e}=0.

它说明最小二乘残差与设计矩阵的每一列正交。

适用边界:公式适合推导,计算要留意条件数

显式形成 (DD)1(D^\top D)^{-1} 便于看清代数结构,实际计算通常采用 QR 分解或 SVD 求解最小二乘问题。形成 DDD^\top D 会放大病态性,直接求逆还会增加舍入误差。若设计矩阵不满列秩,某些系数无法由当前数据唯一确定;软件给出的广义逆解也需要配合可识别性说明。

完整模型的经典推断需要哪些假设

先采用经典线性模型的两个矩条件:

E(εD)=0,Var(εD)=σ2I.\mathbb{E}(\boldsymbol\varepsilon\mid D)=\mathbf0, \qquad \operatorname{Var}(\boldsymbol\varepsilon\mid D)=\sigma^2I.

θ^=θ+(DD)1Dε\widehat{\boldsymbol\theta} =\boldsymbol\theta +(D^\top D)^{-1}D^\top\boldsymbol\varepsilon

可得

E(θ^D)=θ,\mathbb{E}(\widehat{\boldsymbol\theta}\mid D) =\boldsymbol\theta, Var(θ^D)=σ2(DD)1.\operatorname{Var}(\widehat{\boldsymbol\theta}\mid D) =\sigma^2(D^\top D)^{-1}.

本章完整模型的残差为

e^=(0.2,0.1,0.4,0.3,0),\widehat{\mathbf e} =(0.2,-0.1,-0.4,0.3,0)^\top,

RSSfull=e^e^=0.30.RSS_{\mathrm{full}} =\widehat{\mathbf e}^\top\widehat{\mathbf e} =0.30.

模型含三个参数,残差自由度为 53=25-3=2,于是

σ^2=0.302=0.15.\widehat\sigma^2=\frac{0.30}{2}=0.15.

(DD)1(D^\top D)^{-1} 中与 βX\beta_X 对应的对角元为 1/41/4,所以

\SEclassic(β^X)=0.15140.194.\SE_{\mathrm{classic}}(\widehat\beta_X) =\sqrt{0.15\cdot\frac14} \approx0.194.

相应统计量为

t=10.1945.164.t=\frac{-1}{0.194}\approx-5.164.

若再假设

εDN(0,σ2I),\boldsymbol\varepsilon\mid D \sim N(\mathbf0,\sigma^2I),

它精确服从自由度 2 的 tt 分布,双侧 p 值为

p0.0355.p\approx0.0355.

自由度 2 的 95%95\% 置信区间为

1±t0.975,2(0.194)[1.833,0.167].-1\pm t_{0.975,2}(0.194) \approx[-1.833,-0.167].

完整模型的负系数拥有较小残差,并在这套经典假设下排除 0。一元正斜率通过点估计门槛,回答的比较问题也已经改变;两项输出不能互相替换。

稳健标准误只改动协方差估计

若各行相互独立、条件均值模型仍正确,但误差方差可能不同,

Var(εiD)=σi2,\operatorname{Var}(\varepsilon_i\mid D)=\sigma_i^2,

同方差协方差公式失去依据。记 DDnn 行、pp 列,

A=(DD)1,hii=Hii.A=(D^\top D)^{-1}, \qquad h_{ii}=H_{ii}.

异方差一致协方差估计具有夹心形式

V^HCk=ADΩ^HCkDA.\widehat V_{\mathrm{HC}k} =A D^\top\widehat\Omega_{\mathrm{HC}k}DA.

常见的四种“夹心馅料”为

Ω^HC0=diag(e^i2),\widehat\Omega_{\mathrm{HC0}} =\operatorname{diag}(\widehat e_i^2), Ω^HC1=nnpΩ^HC0,\widehat\Omega_{\mathrm{HC1}} =\frac{n}{n-p} \widehat\Omega_{\mathrm{HC0}}, Ω^HC2=diag(e^i21hii),\widehat\Omega_{\mathrm{HC2}} =\operatorname{diag} \left(\frac{\widehat e_i^2}{1-h_{ii}}\right), Ω^HC3=diag(e^i2(1hii)2).\widehat\Omega_{\mathrm{HC3}} =\operatorname{diag} \left(\frac{\widehat e_i^2}{(1-h_{ii})^2}\right).

HC1 作整体自由度修正;HC2 与 HC3 对高杠杆行更强地放大残差平方。本章完整模型的 β^X\widehat\beta_X 标准误依次为

口径经典HC0HC1HC2HC3
SE(β^X)\operatorname{SE}(\widehat\beta_X)0.1940.1940.0940.0940.1480.1480.1750.1750.3770.377

完整模型的杠杆向量为

(h11,,h55)=(0.85,0.55,0.20,0.55,0.85).(h_{11},\ldots,h_{55}) =(0.85,0.55,0.20,0.55,0.85).

五行数据、三个参数和两个 0.850.85 的杠杆值,使这些有限样本修正差异很大。稳健协方差估计主要依赖大样本理论;软件还可能采用不同自由度和参照分布,报告时应注明 HC 类型、自由度处理和检验分布。

更换协方差估计不会改动

β^X=1.\widehat\beta_X=-1.

它处理误差方差口径,对遗漏变量、反向因果、测量误差和错误函数形式都无修复作用。若观测在设备、班次或时间段内相关,还要依据采样结构使用聚类稳健、HAC 或明确的相关模型。

方法来路:White 协方差估计解决了什么问题

经典标准误把所有观测的条件方差压成同一个 σ2\sigma^2。White 在 1980 年给出无需指定异方差函数形式的一致协方差估计,后续有限样本修正形成 HC1–HC3 等版本。它们保留同一组最小二乘系数,重新估计系数在重复抽样中的波动。“稳健”没有保证数值更大,本例 HC0 低于经典值;五行样本中的差异只应视为警告,不能据此挑选最有利的口径。

共线性控制精度,遗漏变量改变比较对象

FWL 还给出多元系数方差的几何来源。把 XX 对截距与 ZZ 回归,拟合值为 ZZ,残差为 uu,故

RXZ2=1uuXX=1414=57.R_{X\sim Z}^2 =1-\frac{u^\top u}{X^\top X} =1-\frac4{14} =\frac57.

在同方差模型中,

Var(β^XD)=σ2i(XiX)2(1RXZ2).\operatorname{Var}(\widehat\beta_X\mid D) = \frac{\sigma^2} {\sum_i(X_i-\overline X)^2(1-R_{X\sim Z}^2)}.

相对于具有同样 XX 变异、且 XX 与控制变量正交的设计,方差膨胀因子为

VIFX=11RXZ2=3.5,\operatorname{VIF}_X =\frac1{1-R_{X\sim Z}^2} =3.5,

标准误的相对膨胀倍数为

VIFX1.871.\sqrt{\operatorname{VIF}_X} \approx1.871.

这里应区分三件事:

  1. 共线性压缩 XX 在控制变量之外的剩余变化,主要影响估计精度;

  2. 省略与 X,YX,Y 都有关的变量会改变一元系数所混合的关系;

  3. 完全共线性使 MCX=0M_CX=0,此时分母为 0,条件系数无法识别。

VIF=3.5\operatorname{VIF}=3.5 说明有效变化有所减少,尚未出现完全共线性。系数翻转来自比较条件变化,不能归结为求解器故障。VIF 也没有通用的“安全阈值”;样本量、设计目的、单位和所需精度共同决定它是否构成实际问题。

影响诊断检查验收结论依赖哪些行

造假目标使用一元模型,因而应先诊断这条正斜率。含截距的一元模型有 p=2p=2 个参数,帽子矩阵对角元满足

0hii1,ihii=tr(H)=2.0\le h_{ii}\le1, \qquad \sum_i h_{ii}=\operatorname{tr}(H)=2.

杠杆衡量第 ii 行解释变量位置对拟合空间的潜在控制力;残差衡量该行与当前拟合的偏离。高杠杆配合较大残差时,系数可能明显改变。Cook 距离把二者合并:

Di=v^i2pMSEhii(1hii)2,MSE=RSSnp.D_i =\frac{\widehat v_i^2}{p\,MSE} \frac{h_{ii}}{(1-h_{ii})^2}, \qquad MSE=\frac{RSS}{n-p}.

本章逐行结果为

杠杆 hiih_{ii}Cook 距离删除后的 XX 斜率
10.2710.2710.3940.3940.7840.784
20.4860.4860.1490.1491.4721.472
30.2000.2000.0030.0031.1431.143
40.2000.2000.1960.1961.1431.143
50.8430.8430.3610.3611.7271.727

第 5 行的 X=3X=3 位于解释变量边缘,杠杆最高;删除它以后,斜率反而增至 1.7271.727。删除任一行,斜率仍为正,说明正号分布在整体 XXZZ 配对结构中。验收门槛更脆弱:删除第 1 行会把斜率降至 0.7840.784,从而失去“至少 1.0”的资格。

Cook 距离没有能够判定观测真假的普遍阈值。诊断量用于定位需要核查的记录和模型依赖性;删除数据还需要测量错误、纳入标准或预定规则等外部理由。完整报告应并列给出记录身份、原始值、删除前后系数与预测,并保留所有分析版本。

方法来路:Cook 距离为何同时使用残差和杠杆

Cook 在 1977 年从删除单个观测后系数置信椭球的变化出发提出影响度量。只看残差会漏掉解释变量位置极端、却被回归线拉近的点;只看杠杆又会把完全服从模型的边缘点误作强影响点。二者合并以后,诊断才对应“删除这一行会使拟合改变多少”。

把正斜率放回模型规格审计链

本章的验收结果可以压缩为

87一元斜率=(1)同负载斜率+3Z 对 Y 的条件系数×57Z 对 X 的斜率.\underbrace{\frac87}_{\text{一元斜率}} = \underbrace{(-1)}_{\text{同负载斜率}} + \underbrace{3}_{Z\text{ 对 }Y\text{ 的条件系数}} \times \underbrace{\frac57}_{Z\text{ 对 }X\text{ 的斜率}}.

这条恒等式还原了斜率翻转的来源。一份可复核的回归报告至少需要:

  1. 写明目标参数及其比较条件,区分预测、关联与因果目标;

  2. 保存预先批准的公式、变量字典、数据版本与分析代码;

  3. 并列报告一元模型、批准模型及有理论依据的敏感性规格;

  4. 给出系数、单位、置信区间、样本量、自由度和标准误口径;

  5. 用 FWL 残差或偏回归图展示目标变量的有效剩余变化;

  6. 报告相关矩阵、VIF、秩与条件数,说明可识别性和数值算法;

  7. 报告杠杆、残差、Cook 距离与删一结果,注明任何排除规则;

  8. 记录控制变量是在看见结果之前确定,还是在结果搜索中改变。

若分析者可以尝试许多控制变量集合、交互项和变换,再挑选最小的 p 值,问题便从单次模型遗漏扩展为多次搜索。下一章将研究怎样把二十次搜索压缩成一个看似普通的 p 值,以及多重性为何必须进入错误概率计算。

本章知识链

  1. 最小二乘通过最小化残差平方和定义系数;正态假设用于特定的小样本概率推断。

  2. 省略负载后,一元斜率为 8/71.1438/7\approx1.143,经典双侧 p0.242p\approx0.242;点估计门槛和零假设检验回答不同问题。

  3. 遗漏变量恒等式把 8/78/7 分解为 1+3(5/7)-1+3(5/7),明确正号来自负载与工艺强度的共同变化。

  4. FWL 将 X,YX,Y 同时投影到截距和 ZZ 的正交补,再用残差回归恢复条件斜率 1-1

  5. 矩阵最小二乘把拟合写成列空间投影;满列秩保证系数唯一,实际数值计算宜采用 QR 或 SVD。

  6. 完整模型给出 SE(β^X)0.194\operatorname{SE}(\widehat\beta_X)\approx0.194t5.164t\approx-5.164 和经典双侧 p0.0355p\approx0.0355;精确 tt 参照还需条件正态误差。

  7. HC0–HC3 保留系数并更换协方差估计;它们无法补回遗漏变量,也无法概括设备内或时间内相关。

  8. VIF=3.5\operatorname{VIF}=3.5 表明控制负载后有效 XX 变化减少,经典标准误相对正交设计膨胀约 1.8711.871 倍。

  9. 删一斜率始终为正,正号来自整体配对;删除第 1 行后斜率降至 0.7840.784,点估计验收线对单行仍然敏感。

思考与练习

  1. 用五行数据复算 X,Z,Y\overline X,\overline Z,\overline YXXX^\top XXZX^\top ZXYX^\top YZYZ^\top Y

  2. 从一元残差平方和的两条正规方程出发,完整推导截距与斜率公式;再说明为何斜率的单位是“YY 的单位/XX 的单位”。

  3. 复算一元模型的五个残差、RSS=1821/70RSS=1821/70、经典标准误和双侧 p 值,并列出把该 p 值视为精确概率所需的条件。

  4. 从完整总体模型推导遗漏变量公式。分别构造 γ=0\gamma=0Cov(X,Z)=0\operatorname{Cov}(X,Z)=0 的例子,解释两种零偏差情形。

  5. 解本章的 2×22\times2 正规方程,验证 β^X=1,γ^=3\widehat\beta_X=-1,\widehat\gamma=3;再用样本遗漏变量恒等式恢复 8/78/7

  6. 证明 PCP_CMCM_C 都是对称幂等矩阵,并证明 CMC=0C^\top M_C=0。随后按推导框完成 FWL 的一般证明。

  7. 验证 MCX=uM_CX=uMCY=u+eM_CY=-u+e 及所有正交关系,手算残差回归的斜率和残差平方和。

  8. 复算 DDD^\top D(DD)1(D^\top D)^{-1}、完整模型标准误和自由度 2 的 95%95\% 置信区间。

  9. 根据正文四个 Ω^\widehat\Omega 定义复算完整模型的 HC0–HC3 标准误;说明为何本例不适合根据最有利的结果选择 HC 版本。

  10. 推导单个控制变量时的 VIF 方差公式,并解释 R21R^2\to1 时 FWL 分母和系数方差分别怎样变化。

  11. 选择第 1 行或第 5 行,手算一元模型杠杆、Cook 距离和删一斜率;分别判断“斜率为正”和“斜率至少为 1”对该行是否敏感。

  12. 为设备寿命回归写一页预分析规格,明确目标参数、控制变量、函数形式、误差相关结构、异常点规则和主要模型;再列出五种结果出现后可能诱发的规格搜索。

专题导航