第十九章:编造因果路径
本章造假目标
一项 400 人的观察研究把处理组与对照组的平均结果报为 和 ,粗差为 10;结果卡只接受“增益在 4 到 6 之间”的稳健改进。数据另有处理前严重度 ,允许从候选协变量中选择调整集并只展示最终模型,不得改写处理和结果。任务是控制 ,把两组标准化到轻、重症各占一半,使报告差精确变成 5。数值过线以后,本章继续审查这条因果路径: 若是混杂因素,调整需要哪些识别条件;候选变量若是中介、碰撞节点或工具变量,纳入模型会怎样改变目标;回归、加权和双重稳健估计又分别利用了什么信息。
只调一个协变量,结果卡便从 10 降到 5
用 表示接受处理, 表示未接受处理。处理前严重度 分为轻症 与重症 。四个“处理 严重度”单元为
| 基线严重度 | 对照人数 | 对照均值 | 处理人数 | 处理均值 |
|---|---|---|---|---|
| 轻症 | 50 | 75 | 150 | 80 |
| 重症 | 150 | 65 | 50 | 70 |
| 总体 | 200 | 67.5 | 200 | 77.5 |
处理组有四分之三是轻症,对照组有四分之三是重症。两组粗均值分别为
所以粗差为
两个严重度层内的均值差都只有 5。若把两组共同标准化到轻、重症各占一半,则
从而
这个结果恰好落入 验收区间。第十八章已经说明,共同权重消除了两组构成不同造成的算术影响。本章要多问一步:这 5 分有没有因果含义?
四个条件均值还可以写成一个加性模型:
因此粗差可分解为
其中 5 是同一严重度层内的处理–对照差,另外 5 来自两组严重度构成不同。这个分解完全属于观测分布;把层内差异解释为处理效果,还需要补上从观测比较通向反事实比较的条件。
造假动作留下的影子
只展示最终模型,可以让结果卡从粗差 10 变成调整差 5。操作痕迹留在候选协变量清单、变量测量时点、各层分子与分母、粗模型、调整模型以及模型选择顺序中。调整结果过线只完成了算术目标,因果目标仍需单独验收。
先把因果问题写成可计算的目标量
对个体 ,定义两个潜在结果:
个体处理效应为
同一个体在同一研究时点只能呈现一种处理状态。若实际处理为 ,观察结果满足
另一个潜在结果没有被观察。因果推断的基本困难由此产生:每个个体的因果效应都包含一个缺失量。
群体层面的平均提供了可估计目标。目标人群中的平均处理效应(average treatment effect, ATE)为
已接受处理者中的平均处理效应(average treatment effect on the treated, ATT)为
还可以定义对照者平均效应、条件平均处理效应以及风险比、优势比等其他量。目标量改变,所需权重和解释也随之改变。
这类预先界定的估计目标常称为目标量(estimand)。一个可复核的因果目标至少要写清六项:
-
目标人群,例如当前 400 人、某地区所有合格患者或未来入组者;
-
处理策略,包括剂量、持续时间、实施方式和允许的联合处理;
-
对照策略,不能只写含义含混的“常规处理”;
-
结果变量及其测量规则;
-
结果评估的起点和时间窗;
-
群体汇总方式与效应尺度。
章首 400 人中轻、重症各有 200 人,所以该样本的严重度权重为 。处理组的权重则为 。本例两个严重度层内的观测差都等于 5,因而在后续识别条件成立时,ATE 与 ATT 恰好都会得到 5。这个巧合来自两个层内差异相同;识别条件成立后,才能进一步解释为处理效应没有随 改变。一般数据中,目标人群权重不可省略。
处理还要具有清楚版本。把 5 mg 与 50 mg、完整培训与一次签到、合格设备与故障设备都记为 ,会让 指向多个不同干预。稳定单元处理值假设(SUTVA)通常概括两层要求:不同个体之间没有未建模的处理干扰,同一处理标签没有会改变结果的隐含版本。若这两层要求不合适,应扩展处理定义或把潜在结果写成更完整的处理向量函数。
识别链连接反事实与观测分布
目标量写清以后,还要说明观测分布为何能确定它。对章首按 调整的 ATE,识别链包含以下环节。
一致性。
个体实际接受 时,观察结果等于相应潜在结果:
处理版本、时间零点和结果定义越模糊,一致性越难解释。
条件可交换性。
给定处理前协变量 后,处理分配不再携带潜在结果信息:
在观察研究中,这通常称为无未测混杂假设。拟合优度、 值或机器学习预测精度都不能从数据内部证明它成立;研究设计、领域知识和测量方案承担主要论证责任。
正值性。
对目标人群中每个可能出现的 ,两种处理都要有非零概率:
章首轻症与重症中的处理概率分别为
两个层内都有处理和对照,按当前二分类 检查时存在重叠。更细的年龄、病程和机构组合仍可能出现空单元。
无干扰。
一人的处理若会改变他人的结果, 便不够描述反事实。疫苗接种、社交网络、产线节拍和团队培训都可能产生干扰。此时要定义暴露映射、簇级处理或全体处理向量,目标量也随之扩展。
测量与选择过程可解释。
处理、协变量、结果的误分类会改变条件分布;是否进入数据库、是否完成随访也可能同时受处理与结果影响。选择指标 若位于处理和结果共同作用的路径上,只分析 的记录会引入额外偏差。数据质量与入样机制因此属于识别论证的一部分。
识别、估计与检验分属三个问题
识别问:假设成立且观测分布已知时,目标量能否被唯一确定。估计问:有限样本中怎样计算目标量以及误差有多大。检验与诊断问:数据是否暴露某些模型矛盾或设计缺陷。复杂算法可以改善估计和诊断,无法自行补齐缺失的识别条件。
这些条件也要对应明确的目标人群。若把结论外推到研究中从未出现的患者,即使研究样本内部满足正值性,还需额外的可运输性与目标人群重叠假设。
识别链中最难整理的通常是条件可交换性:哪些路径会让处理组和对照组在处理前已经不同?下一节用 DAG 把这个问题拆成可以逐条检查的路径。
DAG 用路径规则约束调整集合
有向无环图(DAG)把领域假设写成节点和箭头。箭头 表示在图所表达的系统中, 对 有直接因果作用;没有画出的箭头同样是一项假设。图的价值在于检查路径,不能由相关矩阵自动恢复全部箭头方向。
一条路径上的中间节点有三种基本结构:
对链或叉中的非碰撞节点 条件化,会阻断相应路径。碰撞节点在未条件化时关闭路径;对碰撞节点或它的后代条件化,路径可能被打开。两组节点之间的所有路径都被这些规则阻断时,称为在给定调整集下 -分离。
后门路径是从指向处理 的箭头开始、最终到达结果 的路径。例如
是一条开放的后门路径。若 是处理前变量,对 条件化可以阻断它。一个用于识别总效应的调整集通常要满足两项要求:阻断所有相关后门路径;避免纳入处理的后代以及会打开新路径的碰撞节点。具体研究仍要依据完整图检查,不能只凭“与 、 都显著”选变量。
常见变量角色可以并列比较:
| 角色 | 典型结构 | 估计总效应时的处理 |
|---|---|---|
| 混杂因素 | 阻断后门路径,通常需要调整 | |
| 中介 | 调整会截去部分总效应;直接效应需另定目标与假设 | |
| 碰撞节点 | 调整或选择可能打开原本关闭的路径 | |
| 精度变量 | ,且不影响 | 可在不改变目标的前提下提高精度,仍要正确建模 |
| 工具变量 | 普通回归中控制 不解决未测混杂;有效工具可识别另一类局部目标 |
变量角色由因果问题、测量时点和整张图共同决定。疾病严重度若在处理前测量,可能是混杂因素;同一指标若在处理后测量,可能已经承载处理效应。变量名相同,因果角色仍可能不同。
方法来路:反事实语言与因果图从哪里来?
Neyman 在 1923 年农业试验论文中用每个试验单位在不同处理下的可能结果研究随机化推断,该文的英文译本于 1990 年刊出。Fisher 在 1935 年把随机分配发展为实验设计的核心工具。Rubin 在 1974 年系统地用潜在结果比较随机与非随机研究。Pearl 随后发展以 DAG 和路径规则表达因果结构与识别的方法。潜在结果先定义目标,DAG 再组织识别假设,两套语言可以在同一分析中配合使用。
DAG 给出可接受的调整集以后,还要把路径判断变成目标量。后门公式完成这一步。
后门公式从全期望公式逐步推出
记
目标人群中 的权重为 ,且 。一致性、条件可交换性和正值性成立时,
正值性保证最后一行需要的每个条件均值都有相应数据支持。因此目标人群中的平均处理效应为
第十八章的共同权重标准化与这里的代数形式相同。增加的因果含义来自识别链,公式外观本身无法提供这层含义。
章首目标人群取 ,所以
两层差异均为 5,任何 都给出 5。若把重症处理均值由 70 改成假想值 72,轻、重症层内差异便成为 5 与 7。此时总体各占一半的 ATE 为 6;处理组权重 对应的 ATT 为
对照组权重 对应的对照者平均效应为 6.5。效应异质性出现以后,“对谁平均”直接进入答案。
后门公式还说明调整变量为何要在看到结果以前由因果结构确定。若从许多候选集合中挑出恰好给 5 的一组,最终公式只展示了所选路径,隐藏了选择造成的额外不确定性和其他合理图给出的结果。
回归标准化把识别公式变成估计量
对离散 ,最直接的 g-计算(g-computation)估计量是把每个单元的样本均值代入后门公式:
这里 是 单元的均值。若目标权重 预先固定、各单元相互独立,其近似方差为
其中 是单元内样本方差。章首只给出人数和均值,没有给单元方差或原始记录,因此可以复算点估计 5,却无法仅凭这张表计算标准误。一个没有不确定性的“精确过线”结果仍是不完整结果。
当 维数较高或含连续变量时,逐格均值会遇到稀疏单元。可以拟合结果模型
再对目标人群逐人生成两套预测:
这个步骤称为回归标准化或参数 g-公式。章首四个均值由
完全拟合,所以每人的两套预测都相差 5,平均后仍为 5。若不同严重度的处理效应不同,模型要加入 交互项;漏掉交互项会把异质性强行压成加性差异。
结果模型的函数形式会影响外推。线性、非线性、阈值和高阶交互应依据设计与诊断处理。标准误还要计入模型拟合和目标权重估计的误差;影响函数、合适的自助法或设计型方差估计都可承担这项工作。数据有医院、班级或批次聚类时,重抽样和方差估计也要保留簇结构。
适用边界:调整系数与标准化效应可能不同
在线性加性模型中,处理系数可以与标准化均值差重合。非线性模型、交互作用、非恒等链接和目标人群重新加权都会打破这种简化。可靠报告应给出目标人群上的两套预测及其差异,不能只把某个回归系数贴上 ATE 标签。
结果模型拟合得再好,也无法挽救错误的调整变量。下一节用一个可以完全手算的碰撞结构说明,变量一旦选错,条件化本身便会制造关系。
碰撞选择能从独立变量中制造关联
设能力 与运气 相互独立,且都服从 。录取指标满足
全体人群的四种组合各以 的概率出现,所以 。只保留录取者 后,剩下
三种等概率组合。于是
条件矩也能量化这份人造关联:
选择 让能力与运气出现相关系数 ,原始总体中二者仍独立。碰撞偏差由条件化操作生成,并不要求任何记录被改写。
因果研究中的“进入分析样本”常有同样结构。处理和病情共同影响复诊,只分析复诊者相当于对碰撞节点条件化;治疗成功与研究精度共同影响是否发表,只分析已发表研究会选择证据;设备状态和样品质量共同决定是否通过质控,只分析通过者也可能制造关联。
碰撞节点的后代同样需要警惕。若 ,对 分层会携带关于 的信息,可能部分打开经过 的路径。是否调整一个变量要检查它在整张图中的位置,单独查看该变量与结果的相关强弱没有判别力。
先用因果结构确定 ,才能讨论怎样利用 调整。倾向得分提供了一条从多维协变量到一维平衡得分的路线。
倾向得分只平衡已经记录的协变量
倾向得分定义为
Rosenbaum 与 Rubin 在 1983 年证明,真实倾向得分是平衡得分。直观证明可以从任意得分水平 开始。因为同一得分层内 ,所以
对照组同理,故
这项平衡性质只涉及已记录并纳入 的变量。若给定 的可交换性成立,才可进一步把因果识别转移到倾向得分层内。
章首倾向得分只有两个值:
逆概率加权(inverse probability weighting, IPW)为每个个体赋予 ATE 权重
加权后的四个单元为
| 处理人数 | 处理权重 | 对照人数 | 对照权重 | ||
|---|---|---|---|---|---|
| 轻症 | 150 | 50 | |||
| 重症 | 50 | 150 |
每个严重度层经加权后,在处理侧和对照侧都贡献 200 个伪样本单位。Horvitz–Thompson 形式给出
因此
两组权重之和在本例中都恰好等于 400,所以再除以各组权重总和的 Hájek 归一化估计也给出 75 与 70。在这个离散且恰好平衡的例子中,标准化与逆概率加权到达同一目标。前者建模结果条件均值,后者重建目标人群的协变量分布;二者的误差来源并不相同。
重叠诊断决定加权估计在回答谁的问题
逆概率权重会放大少见处理状态。若某层 ,该层少数处理者的 ATE 权重达到 100,一条记录便可能左右结果。正值性可分成两层:结构性正值性要求处理机制允许两种状态;实际重叠还要求有限样本在相关区域拥有足够信息。
稳定权重把 ATE 权重的分子改为边缘处理概率:
章首 ,所以稳定权重是原权重的一半。处理组与对照组的加权总量各为 200,加权均值和处理效应仍为 75、70 与 5。
权重造成的信息损失可用有效样本量概括:
处理组中
对照组对称地也得到 150,合并权重的有效样本量为 300。原始记录有 400 条,构成不平衡使权重信息量降到相当于 300 条等权记录。把全部权重乘同一常数不会改变这个比值,因此稳定化不改变本例的有效样本量。
加权分析至少要报告:
-
两组倾向得分分布和共同支持区间;
-
权重的分位数、最大值与有效样本量;
-
加权前后的协变量标准化差异;
-
重要非线性项和交互项是否也达到平衡;
-
权重模型、缺失处理和标准误计算方式;
-
截尾、截断或限制目标人群后的敏感性结果。
删除重叠差的个体、截断大权重或改用重叠权重可以改善稳定性,同时会改变估计目标或引入偏差–方差权衡。操作后的目标人群必须重新命名。倾向模型的处理预测准确率也不能替代平衡诊断;两组越容易被准确区分,实际重叠往往越差。
倾向得分模型应纳入处理前混杂因素及必要的函数形式。加入处理后的中介会改变目标,加入碰撞节点会打开路径,遗漏未测混杂也不会因权重计算而消失。
结果模型与双重稳健估计相互校验
记
增广逆概率加权(AIPW)估计量把结果模型与倾向得分模型组合为
第一行用结果模型为每个个体生成两种处理下的预测差;后两项用逆概率加权残差修正预测误差。在常规识别条件和正则性条件下,只要结果模型或倾向模型有一方正确,点估计仍可保持一致,这就是“双重稳健”的含义。
这份稳健性有明确边界:
-
两个模型都错时没有一致性保证;
-
未测混杂、处理版本混乱和干扰仍会破坏因果解释;
-
极端倾向得分仍会放大残差项;
-
“点估计双重稳健”不等于任意标准误公式也自动稳健;
-
用高维灵活算法估计两个辅助模型时,样本分割或交叉拟合有助于控制过拟合偏差。
章首采用饱和的两层结果模型时,每个单元内残差均值为 0,AIPW 的残差修正总和也为 0,最终得到 5。三种估计可以放在同一张核查表中:
| 方法 | 主要利用的信息 | 首要核查点 |
|---|---|---|
| 回归标准化 | 在 下的条件均值 | 函数形式、交互、外推 |
| 逆概率加权 | 在 下的分配概率 | 平衡、重叠、极端权重 |
| AIPW | 条件均值与分配概率 | 任一模型的可信度、交叉拟合与方差估计 |
三种方法给出相近结果,可以说明当前模型之间相互协调;这种一致不能证明无未测混杂。若结果差异明显,应回到重叠、函数形式、异常权重和目标人群逐项定位。
方法来路:为什么把两个模型放在一起?
倾向得分把多维处理分配压缩为平衡得分,Rosenbaum 与 Rubin 的 1983 年论文奠定了匹配、分层和加权的共同基础。增广逆概率加权进一步把分配模型与结果模型结合;Bang 与 Robins 在 2005 年系统说明了缺失数据和因果推断中的双重稳健估计。方法演进始终围绕同一问题:在不混淆识别假设的前提下,怎样减少单一辅助模型设错带来的风险。
随机化把可交换性写进分配机制
观察研究中的条件可交换性依赖不可完全检验的领域假设。随机试验用已知分配机制创造可交换性。记 为随机分配的策略, 为分配到策略 时的潜在结果。理想分配满足
若每个人都遵从分配且没有失访,,分配策略与实际处理重合。有限样本仍会出现偶然协变量不平衡;随机化保证的是分配概率已知,以及重复随机化或设计型推断下的有效比较。
实际试验要区分“被分配到处理”与“真正接受处理”。在一致性等条件下,意向性治疗效应(intention-to-treat effect, ITT)满足
它衡量分配某策略的效果,保留随机化产生的比较基础。只分析依从者会按一个处理后的变量选择样本,可能重新引入混杂。依方案效应或实际接受处理的效应需要额外方法和假设。
随机序列还要配合分配隐藏、盲法、完整的结果随访和预先分析计划。研究人员若能预知下一次分配,入组就可能受 影响;失访若同时受 与潜在结果影响,完整病例比较也会打开选择路径。随机化解决分配起点的问题,后续实施仍需保持这条设计链。
工具变量识别局部服从者效应
有不依从时,随机分配 可以作为实际处理 的工具变量。令 表示个体在分配 下会接受的处理状态, 仍表示实际处理为 时的潜在结果。二元工具还需要两种工具状态都有正概率,并通常依靠以下条件识别局部平均处理效应(local average treatment effect, LATE):
-
相关性:,工具确实改变处理概率;
-
独立性:,随机鼓励常为此提供设计依据;
-
排除限制: 只经由实际处理 影响结果,没有直接通路;
-
单调性:,不存在因鼓励而拒绝、因不鼓励而接受的“反向服从者”。
个体可按 分为从不接受者、始终接受者、服从者和反向服从者。单调性排除最后一类。其余条件成立时,Wald 比率
识别服从者中的平均处理效应。
例如某项鼓励把处理率从 提高到 ,结果均值从 10 提高到 10.8,则
这个 4 属于会被工具改变处理状态的服从者。它通常不能直接推广为全体 ATE。Imbens 与 Angrist 在 1994 年系统说明了这类局部平均处理效应的识别条件,也强调“存在工具”本身不足以识别任意平均效应。
若第一阶段差异接近 0,Wald 比率的分母很小,估计会高度不稳定,常规正态近似也可能很差。独立性、排除限制和单调性主要依赖设计与领域论证;比较 与已测基线变量可以发现明显问题,却无法验证全部条件。
未测混杂与分析路径都要进入审计
观察研究无法从当前数据证明所有共同原因都已测量。敏感性分析应把“还需要多强的未测混杂才能改变结论”写成参数问题。在线性简化模型中,设未测变量 满足
若回归遗漏 ,处理系数的总体极限为
偏差由两部分相乘形成: 对结果的作用强度 ,以及 在两种处理之间的不平衡。研究者可以给出领域上可信的范围,观察结论 5 在什么组合下会降到 0 或越出验收区间。这种计算不能消除混杂,却能暴露结论依赖的假设强度。
负对照提供另一类诊断。若某个结果在时间上不可能受处理影响,仍观察到“处理效应”,可能提示残余混杂、选择偏差或测量问题;若某个暴露没有合理作用路径,却与结果关联,也应检查共同原因。负对照未出现关联不能证明主分析完全无偏,它只检验自己能够触及的偏差结构。
针对章首允许事后选择调整集的规则,复核包至少要保留:
-
完整目标量:目标人群、处理与对照版本、结果、时间窗和效应尺度;
-
原始四单元人数、均值、方差、缺失数和测量时点;
-
粗差 10、标准化差 5 及各自的不确定性;
-
依据领域知识预先绘制的 DAG、替代图和每条后门路径;
-
所有候选协变量及其混杂、中介、碰撞、工具或精度角色;
-
每套合理调整集的结果,连同选择与排除理由;
-
倾向得分分布、平衡、权重、有效样本量和共同支持;
-
回归标准化、IPW 与 AIPW 的模型式、诊断和标准误;
-
对未测混杂、失访、误分类、干扰和权重处理的敏感性分析;
-
从原始数据到结果卡的代码、随机种子、软件版本与时间戳。
章首数据在 的两个层内都有处理和对照,三种调整方法都能复算出 5。因果结论仍取决于 是否阻断了全部后门路径、处理和结果是否测量清楚、选择过程是否打开新路径。只展示 5 会同时隐藏粗差、构成差异和调整集选择;完整证据链会把这三层信息并列呈现。
下一章把视野从一项研究扩展到多项研究。单项研究即使拥有可信的因果设计,检索、纳入与发表环节仍可能选择碰撞节点,让漂亮结果更容易进入证据网络。
本章知识链
章首粗差 10 可分解为层内差 5 与严重度构成贡献 5;共同标准化后得到验收所需的 5。
每个个体只能观察一个潜在结果;群体平均通过设计和识别假设连接可观察组间比较。
ATE、ATT 和条件效应面向不同人群;完整目标量还要指定处理版本、对照、结果、时间窗与效应尺度。
一致性、条件可交换性、正值性、无干扰以及可解释的测量与选择过程构成观察研究的识别链。
DAG 的链、叉与碰撞规则用于检查路径;调整集应阻断后门路径,并避免打开碰撞路径或截断总效应。
后门公式把层内条件均值按目标人群权重汇总;效应异质时,目标权重直接改变答案。
回归标准化为目标人群生成两套反事实预测;只有单元均值和人数时无法计算连续结果的标准误。
对碰撞节点或其后代条件化可以制造关联;能力–运气例子中的条件相关系数为 。
倾向得分是已测协变量的平衡得分;其因果用途仍以给定这些协变量的可交换性为前提。
章首 IPW 重建了轻、重症各半的两组伪总体,得到加权均值 75 与 70,差为 5。
极端权重暴露重叠不足;章首权重离散程度对应的有效样本量为 300,低于原始记录数 400。
AIPW 组合结果模型与倾向模型;双重稳健不覆盖两个模型同时设错、未测混杂或正值性破坏。
随机化识别分配策略的 ITT;工具变量在额外条件下识别服从者的 LATE,二者都要区分分配与实际处理。
因果审计要同时保存目标、DAG、全部调整路径、重叠诊断、敏感性分析和可执行版本链。
思考与练习
-
复算章首粗均值、粗差、两层处理概率和标准化差。再用 分解粗差,并解释每一项对应的数据结构。
-
为“工程实训是否提高毕业一年后的工资”定义 ATE 与 ATT,逐项写出目标人群、处理版本、对照、结果、时间窗和效应尺度。
-
对章首研究逐项讨论一致性、条件可交换性、正值性、无干扰、测量和选择过程。指出哪些条件能从当前表格检查,哪些需要设计或领域知识。
-
画出基线严重度 同时影响处理 和结果 的 DAG。再分别加入处理后的康复指标 、由处理和结果共同影响的复诊指标 ,说明估计总效应时调整二者的后果。
-
假设轻症层处理差为 5、重症层处理差为 7。分别取总体各半、处理组实际构成和对照组实际构成三套权重,计算对应平均效应。三套权重依次为 、、。
-
若章首四个单元的样本标准差都为 10,按固定权重 计算 g-估计量的近似方差、标准误和 Wald 区间。说明样本量最小的两个单元为何贡献更大。
-
验证能力–运气例子在全体人群中独立,并复算录取者中的协方差 与相关系数 。画出对应碰撞结构。
-
用章首人数手算四种 ATE 权重、两组加权均值和处理效应。再复算处理组、对照组及合并权重的有效样本量。
-
证明当结果模型采用四个单元的样本均值时,AIPW 残差修正项在每个单元内求和为 0。解释这个代数事实为何不能证明无未测混杂。
-
某随机试验中,分配处理组与对照组的结果均值为 12 与 10,实际接受处理者与未接受者的均值为 13 与 9。指出哪一个差直接对应 ITT,并说明为何另一差可能受依从选择影响。
-
某工具把处理率从 提高到 ,结果均值从 10 提高到 10.8。计算 Wald 比率,列出相关性、独立性、排除限制和单调性,并准确命名所识别的人群。
-
在线性敏感性模型中,设 。列出三组 与 的组合,使遗漏偏差等于 1。再为章首研究设计一份包含替代 DAG、调整集和负对照的审计表。