第二十章:让漂亮结果混进证据网络

本章造假目标

三项可比研究的效应估计与标准误分别为 A:(1.20,0.50)A:(1.20,0.50)B:(0.25,0.15)B:(0.25,0.15)C:(0.18,0.08)C:(0.18,0.08)。预定的共同效应合并纳入三项研究,点估计约为 0.2150.215,低于宣传材料要求的 0.300.30;样本最大的研究 C 还把结果拉向 0.180.18。允许重新界定“相邻研究”的纳入范围,不得修改任何研究的效应和标准误。任务是隐藏 C,只合并 A、B,使点估计升到 0.3280.328 并越过验收线。本章随后用共同量尺、森林图区间、逆方差推导、删一影响、随机效应、异质性、漏斗位置和显著性选择,复原筛选前的证据网络。

删去 C 以后,点估计过线而精度下降

三项研究已经统一效应方向和量尺,基本信息为

研究样本规模效应估计 θ^i\hat\theta_i标准误 \SEi\SE_i
A201.201.200.500.50
B2000.250.250.150.15
C5000.180.180.080.08

逆方差权重为 wi=1/\SEi2w_i=1/\SE_i^2。完整网络的合并值与标准误为

θ^ABC=4(1.20)+44.444(0.25)+156.25(0.18)4+44.444+156.250.215,\widehat\theta_{ABC} =\frac{4(1.20)+44.444(0.25)+156.25(0.18)} {4+44.444+156.25} \approx0.215, SE(θ^ABC)=1204.6940.0699.\operatorname{SE}(\widehat\theta_{ABC}) =\frac{1}{\sqrt{204.694}} \approx0.0699.

把 C 排除以后,

θ^AB=4(1.20)+44.444(0.25)4+44.4440.328,\widehat\theta_{AB} =\frac{4(1.20)+44.444(0.25)}{4+44.444} \approx0.328, SE(θ^AB)=148.4440.1437.\operatorname{SE}(\widehat\theta_{AB}) =\frac{1}{\sqrt{48.444}} \approx0.1437.

点估计从 0.2150.215 升到 0.3280.328,越过 0.300.30;标准误扩大到原来的

0.14370.06992.06\frac{0.1437}{0.0699} \approx2.06

倍。研究 C 没有提供有利于验收的方向,却提供了全网 76.3%76.3\% 的共同效应权重。隐藏 C 同时抬高点估计、损失大部分精度,并提高小样本研究 A 的相对影响。

造假动作留下的影子

删去 C 没有改写 A、B 的任何数字,却让点估计跨过验收线。完整检索式、逐篇排除理由、三项研究的森林图、删一结果和合并标准误会共同留下操作痕迹。纳入集合本身就是分析变量;只公布最终集合会隐藏一次结果导向的模型选择。

目前的计算预设三项研究可以直接进入同一加权平均。下一节先检查最基本的前提:它们是否估计同一个、方向一致且量尺可比的目标。

效应定义先于加权合并

元分析合并的是效应估计及其抽样方差。研究问题、目标人群、处理、对照、结果和时间窗先要足够接近,数值才有共同含义。两个都写作“改进”的指标若一个越大越好、另一个越小越好,还要先统一方向。

连续结果使用同一自然单位时,可以合并均值差

MD=Xˉ1Xˉ0.MD=\bar X_1-\bar X_0.

一项研究使用五分量表,另一项使用百分制时,原始均值差单位不同。若量表测量同一构念,可以用研究内合并标准差

sp=(n11)s12+(n01)s02n1+n02s_p =\sqrt{ \frac{(n_1-1)s_1^2+(n_0-1)s_0^2} {n_1+n_0-2} }

构造标准化均值差

d=Xˉ1Xˉ0sp.d=\frac{\bar X_1-\bar X_0}{s_p}.

Cohen’s dd 在小样本中有上偏。令 df=n1+n02df=n_1+n_0-2,Hedges 修正因子为

J(df)=Γ(df/2)df/2Γ{(df1)/2}134df1,J(df) =\frac{\Gamma(df/2)} {\sqrt{df/2}\,\Gamma\{(df-1)/2\}} \approx1-\frac{3}{4df-1},

于是

g=J(df)d.g=J(df)d.

标准化提高了跨量表可比性,也把标准差的来源带进效应定义。这里的 sps_p 采用两组共同方差的合并约定;处理若改变结果离散程度,分母的解释还要单独讨论。人群异质性、量表信度和入组范围都会改变 sps_p;相同原始差异可能得到不同的 gg。有自然工程单位时,原始均值差仍应与标准化效应并列报告。

二分类结果常用风险比或优势比,生存结果常用风险率比。比值型效应通常先取对数:

yi=log(RR^i)yi=log(OR^i),y_i=\log(\widehat{RR}_i) \quad\text{或}\quad y_i=\log(\widehat{OR}_i),

在对数尺度上完成加权与区间计算,再用 exp(μ^)\exp(\widehat\mu) 返回原尺度。此时无效应值在对数尺度为 0,在比值尺度为 1。直接平均未取对数的比值会破坏对称性,也会混淆标准误的近似分布。

章首 A、B、C 已经完成方向统一和 Hedges 修正,因而可以进入同一森林图。若 A 报告原始均值差、B 报告标准化差、C 报告对数风险比,三个小数的外观再相似也不能直接合并。

方法来路:“元分析”为什么从效应量开始?

Glass 在 1976 年用 meta-analysis 指称对多项研究分析结果的统计整合,并强调效应量使研究结果能够进入共同比较。Hedges 在 1981 年研究标准化效应估计量的抽样分布与小样本修正。方法的起点一直是先定义可比效应及其误差,再讨论合并算法。

森林图同时显示方向、大小与精度

若研究 ii 给出 θ^i\widehat\theta_i 与标准误 \SEi\SE_i,正态近似下的 95%95\% 置信区间为

θ^i±1.96\SEi.\widehat\theta_i\pm1.96\SE_i.

章首三项研究得到

研究点估计95%95\% 区间区间总宽度
A1.201.20[0.220,2.180][0.220,2.180]1.9601.960
B0.250.25[0.044,0.544][-0.044,0.544]0.5880.588
C0.180.18[0.023,0.337][0.023,0.337]0.3140.314

A 的点估计最大,区间也最宽;C 的点估计最小,精度最高。“效应最漂亮”与“信息最充分”在这里给出相反排序。

森林图把每项研究画成点与区间,方块面积常编码合并权重,底部菱形表示合并点估计和区间。图中还应标出无效应竖线、效应方向、量尺单位和研究标签。若只让方块面积代表样本量,复杂设计、事件数和不同方差结构可能被错误简化;实际权重应由所选模型决定。

置信区间具有重复抽样覆盖解释。两项研究的区间重叠不能直接回答“两个真实效应是否相同”,因为差值的标准误还取决于两项估计的协方差。独立研究时应直接计算

SE(θ^1θ^2)=\SE12+\SE22;\operatorname{SE}(\widehat\theta_1-\widehat\theta_2) =\sqrt{\SE_1^2+\SE_2^2};

共享对照组、同一队列或重复结局会再加入协方差项。

森林图把研究层信息放到同一坐标上,尚未说明方块为何按逆方差变化。下一节从“在线性无偏合并中让方差最小”推出这条规则。

逆方差权重从最小方差推出

共同效应模型设

θ^i=θ+εi,E(εi)=0,Var(εi)=vi=\SEi2,\widehat\theta_i=\theta+\varepsilon_i, \qquad \mathbb{E}(\varepsilon_i)=0, \qquad \operatorname{Var}(\varepsilon_i)=v_i=\SE_i^2,

并暂定各研究独立。考虑线性合并量

θ~=i=1kaiθ^i.\widetilde\theta=\sum_{i=1}^k a_i\widehat\theta_i.

为了保持无偏,需要 iai=1\sum_i a_i=1;其方差为

Var(θ~)=i=1kai2vi.\operatorname{Var}(\widetilde\theta) =\sum_{i=1}^k a_i^2v_i.

用拉格朗日乘子最小化

iai2vi2λ(iai1),\sum_i a_i^2v_i -2\lambda\left(\sum_i a_i-1\right),

一阶条件给出

ai=λvi.a_i=\frac{\lambda}{v_i}.

代入 iai=1\sum_i a_i=1,得到

ai=1/vij1/vj=wiW,wi=1vi,W=iwi.a_i =\frac{1/v_i}{\sum_j1/v_j} =\frac{w_i}{W}, \qquad w_i=\frac1{v_i}, \qquad W=\sum_iw_i.

因此

θ^CE=iwiθ^iW,Var(θ^CE)=1W.\widehat\theta_{\mathrm{CE}} =\frac{\sum_iw_i\widehat\theta_i}{W}, \qquad \operatorname{Var}(\widehat\theta_{\mathrm{CE}}) =\frac1W.

这里 CE 表示共同效应(common effect);文献也常称固定效应(fixed effect)元分析。在独立正态近似下,同一公式也可由联合似然最大化得到。

章首权重和份额为

研究wiw_i完整网络权重份额wiθ^iw_i\widehat\theta_i
A4.0004.0001.95%1.95\%4.8004.800
B44.44444.44421.71%21.71\%11.11111.111
C156.250156.25076.33%76.33\%28.12528.125
合计204.694204.694100%100\%44.03644.036

完整网络的合并区间为

0.2151±1.96(0.0699)=[0.078,0.352].0.2151\pm1.96(0.0699) =[0.078,0.352].

点估计低于 0.300.30,区间仍覆盖低于和高于该门槛的数值。若验收只读取点估计,筛选研究便可以跨线;若决策还要求下限超过门槛,这次操作依然不能通过。

删去哪一项由影响恒等式精确回答

设完整网络总权重为 WW,共同效应估计为 θ^\widehat\theta。删除研究 jj 后,

θ^j=Wθ^wjθ^jWwj.\widehat\theta_{-j} =\frac{W\widehat\theta-w_j\widehat\theta_j} {W-w_j}.

两者之差可整理为

θ^jθ^=wjWwj(θ^θ^j).\widehat\theta_{-j}-\widehat\theta =\frac{w_j}{W-w_j} \left(\widehat\theta-\widehat\theta_j\right).

删一影响由两部分共同决定:研究的相对权重,以及它与完整合并中心的距离。低效应、高权重的 C 对向上移动最有效。三次删一结果为

删除研究保留研究的合并值相对完整网络的变化是否超过 0.300.30
A0.19550.19550.0196-0.0196
B0.20550.20550.0097-0.0097
C0.32840.3284+0.1133+0.1133

只保留 A、B 时,合并区间为

0.3284±1.96(0.1437)=[0.047,0.610].0.3284\pm1.96(0.1437) =[0.047,0.610].

区间比完整网络宽得多。A 的权重份额从 1.95%1.95\% 升到

44+44.444=8.26%,\frac4{4+44.444}=8.26\%,

扩大约 4.23 倍。标准误扩大因子也可直接由总权重得到:

WWwC=204.69448.4442.06.\sqrt{\frac{W}{W-w_C}} =\sqrt{\frac{204.694}{48.444}} \approx2.06.

删一分析适合发现影响点,不能单独提供排除理由。若看到结果后才把“离群”定义成妨碍过线的研究,影响诊断本身也会变成选择工具。排除标准应依据研究问题、设计和偏倚风险预先规定,删一结果作为透明的敏感性分析并列报告。

共同效应模型把所有差异归入抽样误差。三项研究来自不同人群或实施条件时,这个假设可能过紧。下一节把真实研究效应之间的差异写入模型。

共同效应与随机效应回答不同问题

随机效应模型分成两层:

θiN(μ,τ2),\theta_i\sim N(\mu,\tau^2), θ^iθiN(θi,vi).\widehat\theta_i\mid\theta_i \sim N(\theta_i,v_i).

边缘分布为

θ^iN(μ,vi+τ2).\widehat\theta_i \sim N(\mu,v_i+\tau^2).

μ\mu 是研究效应分布的均值,τ2\tau^2 是研究间方差。随机效应权重为

wi=1vi+τ2,w_i^\star=\frac1{v_i+\tau^2},

合并均值与常规标准误为

μ^=iwiθ^iiwi,\SE0(μ^)=1iwi.\widehat\mu =\frac{\sum_iw_i^\star\widehat\theta_i} {\sum_iw_i^\star}, \qquad \SE_0(\widehat\mu) =\frac1{\sqrt{\sum_iw_i^\star}}.

τ2=0\tau^2=0 时,两种模型给出相同权重。τ2\tau^2 增大后,大研究和小研究的权重差距缩小;小研究若系统地给出更大效应,随机效应合并点也会向它们移动。

共同效应模型的目标是一个共享的 θ\theta。随机效应模型的目标是所设研究总体中的平均 μ\mu,其解释依赖研究如何进入这个总体。若纳入研究是按结果选择的,随机效应分布同样是被截断后的分布。更换合并模型无法修复缺失研究。

正态研究效应分布是一项工作假设。研究数很少时,分布形状和 τ2\tau^2 都难以从数据识别;研究总体的定义、临床或工程差异以及敏感性分析需要与公式并列说明。

方法来路:随机效应为什么加入研究间方差?

Cochran 在 1937 年讨论一系列相似实验的合并与一致性问题。DerSimonian 与 Laird 在 1986 年给出影响深远的矩估计方法,把超出研究内抽样方差的变异写成 τ2\tau^2 并放回合并权重。该方法计算简洁,研究较少时对 τ2\tau^2 和区间的不确定性处理仍有限。

Q、I² 与研究间方差描述不同侧面

先在共同效应权重下计算 Cochran’s QQ

Q=i=1kwi(θ^iθ^CE)2.Q =\sum_{i=1}^kw_i \left(\widehat\theta_i-\widehat\theta_{\mathrm{CE}}\right)^2.

共同效应模型、独立性和正态近似成立时,QQ 近似服从自由度 k1k-1 的卡方分布。章首

Q4.1267,k1=2,p0.127.Q\approx4.1267, \qquad k-1=2, \qquad p\approx0.127.

三项研究使检验功效很低;p>0.05p>0.05 不能确认同质性。研究很多时,QQ 又可能检出工程意义很小的差异。

Higgins 与 Thompson 提出的 I2I^2 指标为

I2=max{0,Q(k1)Q}×100%.I^2 =\max\left\{0,\frac{Q-(k-1)}Q\right\} \times100\%.

本例

I2=4.126724.1267×100%51.5%.I^2 =\frac{4.1267-2}{4.1267} \times100\% \approx51.5\%.

I2I^2 衡量观察效应离散中超出研究内抽样误差的相对份额,经过 0 截断。它没有效应单位,并且在研究很少时区间会很宽。固定的“低、中、高”阈值会掩盖研究数、精度和应用背景。

DerSimonian–Laird 矩估计先定义

C=iwiiwi2iwi75.6955,C =\sum_iw_i -\frac{\sum_iw_i^2}{\sum_iw_i} \approx75.6955,

再计算

τ^DL2=max{0,Q(k1)C}0.02810,\widehat\tau^2_{\mathrm{DL}} =\max\left\{0, \frac{Q-(k-1)}{C} \right\} \approx0.02810,

所以

τ^0.1676.\widehat\tau\approx0.1676.

τ\tau 保留原效应量单位,可以直接与实际重要差异比较。不同效应尺度下的 τ\tau 不能横向照搬。REML、似然剖面和贝叶斯方法还可用于估计研究间方差;只有三项研究时,各方法和先验可能给出明显不同结果。

τ^2\widehat\tau^2 放回权重,得到

(wA,wB,wC)(3.596,19.764,28.989),(w_A^\star,w_B^\star,w_C^\star) \approx(3.596,19.764,28.989),

其权重份额约为 (6.87%,37.75%,55.38%)(6.87\%,37.75\%,55.38\%)。随机效应削弱了 C 的支配地位,同时放大 A 的相对位置。亚组与元回归可以探索这种差异的来源,研究层变量少时会面临过拟合、生态偏差和多重分析;候选效应修饰因素应预先规定。

平均效应区间与预测区间不可混用

用上述 DL 方差,随机效应合并结果为

μ^RE0.2765,\SE0(μ^RE)0.1382.\widehat\mu_{\mathrm{RE}} \approx0.2765, \qquad \SE_0(\widehat\mu_{\mathrm{RE}}) \approx0.1382.

τ^2\widehat\tau^2 当作已知并使用正态临界值,平均效应的常规区间为

0.2765±1.96(0.1382)=[0.006,0.547].0.2765\pm1.96(0.1382) =[0.006,0.547].

这个区间只描述研究总体平均位置的不确定性。一个相似新研究的真实效应还包含研究间变异。教学性的正态预测区间为

μ^RE±1.96τ^2+\SE02(μ^RE),\widehat\mu_{\mathrm{RE}} \pm1.96 \sqrt{\widehat\tau^2+\SE_0^2(\widehat\mu_{\mathrm{RE}})},

代入本例得到

[0.149,0.702].[-0.149,0.702].

预测区间跨过 0,说明平均值为正仍可与某些场景中的零效应或反向效应相容。该简式忽略 τ^2\widehat\tau^2 的估计误差,三项研究时只能作为结构演示。

研究数少还会让平均效应区间偏窄。Hartung–Knapp 思路用加权残差重新估计均值方差:

qHK=1k1iwi(θ^iμ^RE)21.6753,q_{\mathrm{HK}} =\frac1{k-1} \sum_iw_i^\star \left(\widehat\theta_i-\widehat\mu_{\mathrm{RE}}\right)^2 \approx1.6753, \SEHK=qHKiwi0.1789.\SE_{\mathrm{HK}} =\sqrt{\frac{q_{\mathrm{HK}}}{\sum_iw_i^\star}} \approx0.1789.

使用自由度 k1=2k-1=2tt 分布,其 0.9750.975 分位数为 4.3034.303,本例区间为

0.2765±4.303(0.1789)=[0.493,1.046].0.2765\pm4.303(0.1789) =[-0.493,1.046].

它远宽于常规正态区间,直接显示“只有三项独立研究”的代价。Hartung–Knapp 及其修正也有适用边界;这里的重点是把 τ2\tau^2 未知和研究数有限带回推断,不能把参与者总数 720 当成 720 项独立研究。

完整网络的随机效应点估计仍低于 0.300.30。看到结果后在共同效应、DL 正态区间和少研究修正之间挑选最有利版本,会再次增加分析路径。模型和区间方法应在协议中预定,并列敏感性结果。

精度权重既不衡量偏倚,也不创造独立研究

逆方差权重只反映模型内抽样精度。若研究 ii 还带有系统偏差 bib_i,可以写成

θ^i=θi+bi+εi.\widehat\theta_i =\theta_i+b_i+\varepsilon_i.

若共同效应假设 θi=θ\theta_i=\theta 成立,加权估计的期望为

E(θ^CE)=θ+iwibiiwi.\mathbb{E}(\widehat\theta_{\mathrm{CE}}) =\theta +\frac{\sum_iw_ib_i}{\sum_iw_i}.

样本量增大可以压低 Var(εi)\operatorname{Var}(\varepsilon_i),却不会自动让 bib_i 消失。一个分配隐藏失败、结果选择严重或测量口径偏移的大研究,可能以极高精度支配错误中心。偏倚风险要从设计、实施和报告过程单独评价,不能把质量分数直接机械乘进精度权重。

独立性也需要检查。同一试验报告多个时间点、多个量表或多个亚组时,这些效应共享参与者;两项比较共用同一个对照组时,估计也相关;同一项目拆成多篇论文还可能被重复计入。把相关结果当成独立研究会重复计算信息并压低标准误。

若效应向量为 θ^\widehat{\boldsymbol\theta},协方差矩阵为 Σ\boldsymbol\Sigma,共同均值的广义最小二乘形式为

θ^GLS=1Σ1θ^1Σ11,\widehat\theta_{\mathrm{GLS}} =\frac{\boldsymbol 1^\top \boldsymbol\Sigma^{-1} \widehat{\boldsymbol\theta}} {\boldsymbol 1^\top \boldsymbol\Sigma^{-1} \boldsymbol 1}, Var(θ^GLS)=11Σ11.\operatorname{Var}(\widehat\theta_{\mathrm{GLS}}) =\frac1{\boldsymbol 1^\top \boldsymbol\Sigma^{-1} \boldsymbol 1}.

对角 Σ\boldsymbol\Sigma 才退化为普通逆方差公式。实际分析还可以预先选一个主要效应、使用多变量或多层元分析,或按研究聚类采用稳健方差;稳健方差同样需要足够多的独立研究簇。

因此,合并前至少要建立“研究项目–报告–效应量”三层索引。项目是独立性单位,报告用于追踪重复发表,效应量保留结局与时间窗。下一节讨论的漏斗图也必须以正确的独立单位为基础。

漏斗图显示小研究效应,不能诊断单一原因

漏斗图常以效应估计为横轴,以标准误为纵轴并反转纵轴。若真效应相近、抽样近似合适且没有规模相关的选择,精确研究集中在上方,小研究因标准误较大而在下方向两侧展开。

章首只有三个点,无法形成可辨认的漏斗。A 会位于底部偏右,B 居中,C 位于顶部靠近 0.180.18。这个排列与小研究效应相容,随机波动也完全可能产生同样图形。

漏斗不对称的来源包括:

  1. 整项研究或某个结局因方向和显著性未被报告;

  2. 小研究在实施质量、入组风险或干预强度上系统不同;

  3. 真实效应随人群和研究规模变化;

  4. 标准化均值差、对数优势比等效应量与标准误存在数学关联;

  5. 少数高影响研究、数据错误或偶然不平衡;

  6. 检索语言、数据库和发表状态限制遗漏特定研究。

Egger 检验的一种写法令

Zi=θ^i\SEi,Pi=1\SEi,Z_i=\frac{\widehat\theta_i}{\SE_i}, \qquad P_i=\frac1{\SE_i},

并拟合

Zi=β0+β1Pi+εi.Z_i=\beta_0+\beta_1P_i+\varepsilon_i.

截距偏离 0 用于检查效应与精度的系统关系。效应尺度不同,需要的回归形式也会改变。漏斗检验通常至少需要约 10 项研究才有基本功效;三项研究无法支持这类回归。

轮廓增强漏斗图可以标出显著性区域,帮助区分缺口是否集中在“不显著”区域。trim-and-fill 根据对称性补入镜像研究,只能作为依赖模型的探索性敏感性分析。图形、检验和补齐算法都不能直接证明发表偏倚,也不能恢复真实缺失机制。

显著性选择会推高入选研究的条件均值

设单项研究

θ^N(θ,SE2),\widehat\theta\sim N(\theta,\operatorname{SE}^2),

且只有满足 θ^>c\widehat\theta>c 的正向结果能够进入报告。令

Z=θ^θSE,a=cθSE.Z=\frac{\widehat\theta-\theta}{\operatorname{SE}}, \qquad a=\frac{c-\theta}{\operatorname{SE}}.

标准正态密度满足

azϕ(z)dz=ϕ(a),\int_a^\infty z\phi(z)\,dz=\phi(a),

所以截断后的条件均值为

E(ZZ>a)=ϕ(a)1Φ(a),\mathbb{E}(Z\mid Z>a) =\frac{\phi(a)}{1-\Phi(a)}, E(θ^θ^>c)=θ+SEϕ(a)1Φ(a).\mathbb{E}(\widehat\theta\mid\widehat\theta>c) =\theta +\operatorname{SE}\frac{\phi(a)}{1-\Phi(a)}.

第二项为正。若 θ=0\theta=0,并且只保留正向 5%5\% 双侧显著结果,即 c=1.96SEc=1.96\operatorname{SE},则

E(θ^θ^>1.96SE)2.338SE.\mathbb{E}(\widehat\theta\mid\widehat\theta>1.96\operatorname{SE}) \approx2.338\operatorname{SE}.

入选概率只有 0.0250.025,入选后的平均效应却超过显著门槛。这是条件选择产生的赢家诅咒。

把完整网络中心近似看作 θ=0.20\theta=0.20,研究 A 的 SE=0.50\operatorname{SE}=0.50。正向显著门槛为 c=1.96(0.50)=0.98c=1.96(0.50)=0.98,于是

a=0.980.200.50=1.56,Pr(θ^A>0.98)=1Φ(1.56)0.0594.a=\frac{0.98-0.20}{0.50}=1.56, \qquad \Pr(\widehat\theta_A>0.98) =1-\Phi(1.56) \approx0.0594.

入选条件均值为

E(θ^Aθ^A>0.98)=0.20+0.50ϕ(1.56)1Φ(1.56)1.195.\begin{aligned} \mathbb{E}(\widehat\theta_A\mid\widehat\theta_A>0.98) &=0.20+0.50 \frac{\phi(1.56)}{1-\Phi(1.56)}\\ &\approx1.195. \end{aligned}

它几乎等于 A 的观察值 1.201.20。这项计算没有证明 A 经历了选择;它表明在真实效应约为 0.200.20、只保留正向显著小研究的机制下,1.201.20 接近入选研究的期望位置。

选择还可能发生在研究内部。多个结局、时间点、亚组、模型和停止时点中只报告最显著的一项,会让单篇论文进入元分析以前已经被筛过。更大样本、预注册主要结局和独立复现减少这些选择机会后,效应回落具有明确的概率解释。

检索协议决定哪些研究有机会入网

Si=1S_i=1 表示研究 ii 被纳入,选择后的共同效应估计可以写成

θ^sel=iSiwiθ^iiSiwi.\widehat\theta_{\mathrm{sel}} =\frac{\sum_iS_iw_i\widehat\theta_i} {\sum_iS_iw_i}.

章首预定方案为 S=(1,1,1)S=(1,1,1),事后方案为 S=(1,1,0)S=(1,1,0)。若 SiS_iθ^i\widehat\theta_i 的方向、大小或显著性影响,观测到的证据网络已经条件化。第十九章的选择节点在这里以研究为单位再次出现。

系统检索要在看见合并结果以前冻结以下内容:

  1. 研究问题和资格条件,包括人群、处理、对照、结果、设计和时间窗;

  2. 数据库、试验注册库、预印本、学位论文和其他灰色文献来源;

  3. 完整检索式、语言与日期限制、最后检索日期和更新规则;

  4. 去重规则,以及同一项目多篇报告的合并标识;

  5. 标题摘要筛选、全文筛选、复核人员和分歧处理;

  6. 每篇全文排除的预定理由;

  7. 多结局、多时间点和多分析版本的效应选择层级;

  8. 效应方向换算、方差提取、缺失统计量推算和作者联系记录;

  9. 偏倚风险评价及其如何进入解释与敏感性分析;

  10. 协议偏离、检索更新和数据更正的版本记录。

报告流程图可以给出检索、去重、筛选、排除和纳入数量;它要与逐条文献清单对应。PRISMA 2020 提供系统综述报告框架,透明报告仍需以完整检索和预定协议为基础。一个写得完整的流程图无法补回从未检索到的数据库,也无法替代偏倚风险判断。

方法来路:从“汇总研究”到可复核流程

Cochran 的系列实验分析处理统计合并与一致性,Glass 将 meta-analysis 明确为对多项分析结果的整合,DerSimonian–Laird 推动随机效应方法普及,Egger 等人在 1997 年把效应与精度的关系写成小研究效应检验。PRISMA 2020 进一步规范系统综述的检索与筛选报告。方法史由此包含两条并行路线:怎样合并已经看见的研究,以及怎样说明哪些研究获得了被看见的机会。

把完整网络放回复核链

章首操作可以用四组数字复原。完整共同效应结果为

0.215  (SE=0.0699),0.215\;(\operatorname{SE}=0.0699),

隐藏 C 后为

0.328  (SE=0.1437).0.328\;(\operatorname{SE}=0.1437).

完整网络的 DL 随机效应结果为

0.276  (\SE0=0.138),0.276\;(\SE_0=0.138),

A 在正向显著选择模型下的条件均值约为

1.195.1.195.

这四组数分别定位合并中心、精度损失、异质性权重和小研究选择。复核包还应保留:

  1. 全部检索记录、去重映射、全文排除清单与版本时间戳;

  2. 每项研究的目标量、原始汇总数据、效应换算和标准误来源;

  3. 研究项目、论文报告和多个效应量之间的对应关系;

  4. 完整森林图、权重份额、共同效应结果及其区间;

  5. 全部删一结果和预定的影响诊断;

  6. QQI2I^2τ2\tau^2 估计方法、随机效应结果和预测区间;

  7. 少研究区间修正及对 τ2\tau^2 方法或先验的敏感性;

  8. 偏倚风险、相关效应、异常研究和数据更正的处理;

  9. 漏斗图适用性、缺失证据判断和选择模型假设;

  10. 从提取表到所有图表的可执行代码、软件版本和随机种子。

研究 C 的样本最大、共同效应权重最高、效应方向与 B 接近,也完全符合章首已经声明的可比条件。结果出现以后再把“相邻”收窄到 A、B,缺少独立于结果的排除依据。完整报告应把预定与事后两套集合并列,明确宣传值 0.3280.328 来自选择后的网络。

本章结束第四篇:时间顺序、测量链、分层批次、因果路径和研究纳入都说明,统计结论依赖哪些单位有机会进入比较。下一篇转向现代高维数据;第二十一章会在生成 precision、生成 recall、下游效用和隐私距离之间继续检查指标选择怎样隐藏未覆盖的故障模式。

本章知识链

  1. 隐藏 C 使共同效应点估计从 0.2150.215 升到 0.3280.328,标准误同时从 0.06990.0699 增到 0.14370.1437

  2. 效应方向、目标人群、结果时间窗和量尺要先统一;比值型效应通常在对数尺度合并。

  3. Hedges’ ggJ(df)J(df) 修正小样本标准化均值差;标准化后的解释仍依赖研究内标准差。

  4. 森林图同时显示效应、区间和权重;区间重叠不能替代效应差异的直接推断。

  5. 在线性无偏且独立的共同效应模型中,最小方差原则推出 wi=1/\SEi2w_i=1/\SE_i^2

  6. C 占完整网络 76.3%76.3\% 的共同效应权重;删去 C 是三次删一分析中唯一让点估计越过 0.300.30 的操作。

  7. 随机效应模型用 τ2\tau^2 描述研究间方差,并相对提高小研究权重;它估计研究效应分布的平均位置。

  8. 本例 Q=4.1267Q=4.1267I2=51.5%I^2=51.5\%τ^2=0.02810\widehat\tau^2=0.02810;三个量分别对应检验、相对异质性和原尺度异质性。

  9. 随机效应常规均值区间约为 [0.006,0.547][0.006,0.547],教学性预测区间约为 [0.149,0.702][-0.149,0.702],二者回答不同问题。

  10. 只有三项研究时,τ2\tau^2 和均值区间很不稳定;用加权残差与 tt 临界值得到的演示区间为 [0.493,1.046][-0.493,1.046]

  11. 逆方差衡量抽样精度,无法量化系统偏倚;相关效应若被当作独立研究还会重复计算信息。

  12. 漏斗图与 Egger 回归检查小研究效应,发表选择只是多种可能原因之一;三项研究不足以支持不对称检验。

  13. 正向显著性选择把真实效应约 0.200.20、标准误 0.500.50 的研究条件均值推到约 1.1951.195

  14. 完整证据链要保留协议、检索、排除、效应换算、依赖结构、全部合并模型和可执行版本记录。

思考与练习

  1. 复算 A、B、C 的三个 95%95\% 区间、逆方差权重、权重份额、完整共同效应结果和只保留 A、B 的结果。比较两套合并区间的宽度。

  2. 两组样本量均为 10,均值差为 4,样本标准差分别为 5 和 7。计算 sps_p、Cohen’s dd 与近似 Hedges’ gg,并说明标准化单位由什么决定。

  3. θ~=iaiθ^i\widetilde\theta=\sum_i a_i\widehat\theta_i 出发,在 iai=1\sum_i a_i=1 下用拉格朗日乘子推出逆方差权重,并证明合并方差为 1/iwi1/\sum_iw_i

  4. 推导删一影响恒等式。分别删除 A、B、C,复算合并值及其相对完整网络的变化,再说明权重与离中心距离怎样共同决定影响。

  5. 用章首三项研究复算 QQ、卡方近似 p 值、I2I^2、DL 的 CCτ^2\widehat\tau^2τ^\widehat\tau 和三项随机效应权重。

  6. 复算随机效应合并均值、常规正态区间、教学性预测区间和 Hartung–Knapp 演示区间。逐一说明四个结果各自包含哪些不确定性。

  7. 某二分类研究报告 RR^=1.40\widehat{RR}=1.40SE{log(RR^)}=0.12\operatorname{SE}\{\log(\widehat{RR})\}=0.12。在对数尺度计算 95%95\% 区间,再指数变换回风险比尺度。指出两种尺度上的无效应值。

  8. 同一研究给出两个标准误均为 0.100.10 的效应,二者相关系数为 0.80.8。若取等权平均,分别计算错误假定独立和使用真实协方差时的标准误,解释重复计算信息的后果。

  9. 为章首三个点画森林图和漏斗图草图。说明为什么三个点不能支持 Egger 回归,并列出至少五种漏斗不对称来源。

  10. azϕ(z)dz=ϕ(a)\int_a^\infty z\phi(z)\,dz=\phi(a) 推导截断正态条件均值。复算 a=1.56a=1.56 时的入选概率与条件均值,并解释它与 A 的 1.201.20 有何关系。

  11. 为“工程培训是否降低一年内事故率”的系统综述编写一份纳入协议,至少写出研究问题、数据库、灰色文献、时间窗、重复报告、主要效应、排除理由和更新规则。

  12. 假设复核者只拿到 A、B 的宣传图。设计一份最小审计请求,使其能够发现 C、复算两套合并结果、检查偏倚与依赖,并重建检索版本链。

专题导航