第十二章:把二十次搜索缩成一个 p 值
本章造假目标
同一次产品实验同时检验 20 个指标。完整结果中最小原始 p 值为 0.003;按总水平 0.05 进行 Bonferroni、Holm 或 BH 校正,三个程序都没有发现,当前结论是“尚无通过多重性控制的指标”。结果卡片只检查一项:展示的原始双侧 p 值不超过 0.01。允许的操作只有从二十项中挑一项展示并隐藏其余结果,不得重算、修改或新增检验。本章将先完成这项选择,再把十九次隐藏机会放回有效 p 值、最小值分布、FWER、FDR、依赖条件和确认流程中。
完整家族无发现,最小原始值却能过线
二十个原始双侧 p 值已经按从小到大排列:
| | | | |
|---|
| 0.003 | 0.009 | 0.018 | 0.041 | 0.067 |
| 0.090 | 0.120 | 0.150 | 0.180 | 0.220 |
| 0.270 | 0.310 | 0.360 | 0.410 | 0.460 |
| 0.520 | 0.580 | 0.640 | 0.730 | 0.880 |
结果卡片的机械条件是
pshown≤0.01.
选择最小值便得到
pshown=p(1)=0.003.
第二小的 0.009 也能过线;只展示 0.003 会让结果显得更强。完整家族给出另一项判断。Bonferroni 的单项门槛为
200.05=0.0025,
连最小值也没有通过。Holm 从同一个门槛开始,第一步便停止;BH 的二十条排序边界同样没有一条被满足。三个程序都得到零项发现。
造假动作留下的影子
展示出来的 0.003 是原表中的真实计算,删除的是它从二十次机会中胜出的选择过程。实验方案、指标字典、宽表列名、分析脚本和日志会留下完整家族;恢复这些记录后,最小值的 Bonferroni、Holm 与 BH 校正 p 值都为 0.06。
第一章把 p 值定义在一套固定分析方案 A 上。本章多出一个步骤:先执行二十套检验,再由结果决定展示哪一项。这个选择规则也属于方案,必须进入重复抽样计算。
有效 p 值承诺的错误概率是什么
对第 j 个原假设 Hj,先固定抽样、清洗、统计量、单侧或双侧方向、样本量和停止规则,记为 Aj。若观测统计量为 Tj,obs,p 值是零假设参照分布中“至少同样极端”的尾部概率。其形式可写为
pj=Hj,AjPr{Tj∈Ej(Tj,obs)},
其中 Ej 由预先确定的极端方向定义。
一个有效 p 值至少满足:对任意 u∈[0,1],
HjPr(pj≤u)≤u.
这项性质称为超均匀性。若检验统计量连续、参照分布完全正确且没有随机化或离散台阶,真原假设下常有
pj∼U(0,1).
离散检验和复合原假设常产生严格小于号,p 值会偏保守。无论等号是否成立,门槛 u 的含义都相同:真原假设下,长期误拒绝概率至多为 u。
这项保证仍以单项方案 Aj 为条件。若二十个 p 值都分别有效,再从中挑最小值,入选结果的分布已经改变。p(1)=0.003 也不表示 Hj 为真的概率是 0.3%;它度量的是指定零假设与指定检验方案下的尾部位置。
方法来路:p 值为何从固定实验方案出发
Fisher 在 1925 年面向实验研究者系统整理显著性检验,目标是用参照分布衡量观测结果在零假设下有多反常。抽样、统计量和极端方向共同决定参照分布。现代分析又加入数据清洗、停止规则与结果选择;这些步骤一旦随结果变化,原先的尾部面积就不再概括完整程序。
最小 p 值本身有一条概率分布
先建立可以精确计算的基准。假设 m 个原假设全部成立,p 值连续、有效且相互独立,于是
p1,…,pm∼iidU(0,1).
令
Pmin=1≤j≤mminpj.
对 0≤x≤1,
Pr(Pmin>x)=Pr(p1>x,…,pm>x)=(1−x)m.
因此
FPmin(x)fPmin(x)=Pr(Pmin≤x)=1−(1−x)m,=m(1−x)m−1.
换用常见分布名称,这就是 Pmin∼Beta(1,m)。
利用非负随机变量的尾积分公式,
E(Pmin)=∫01Pr(Pmin>x)dx=∫01(1−x)mdx=m+11.
中位数 x0.5 满足 1−(1−x0.5)m=1/2,解得 x0.5=1−2−1/m。
当 m=20 时,
E(Pmin)=211≈0.0476,Median(Pmin)≈0.0341.
二十个真零假设的最小 p 值通常就会比 0.05 小。两个常用门槛的过线概率为
Pr(Pmin≤0.05)Pr(Pmin≤0.01)=1−0.9520≈0.6415,=1−0.9920≈0.1821.
本章观察到 Pmin=0.003。在独立全零基准下,选择后的精确尾概率是
Pr(Pmin≤0.003)=1−0.99720≈0.0583.
单独展示时的 0.003 很醒目;放回“二十取一”的统计量后,它没有越过 0.05。
在上述独立全零基准下,若要让家族错误率精确等于 α,每项可用 Šidák 门槛
αSˇidaˊk=1−(1−α)1/m.
本章取 α=0.05,m=20,得到
αSˇidaˊk≈0.002561.
0.003 仍未通过。
适用边界:独立性决定乘法公式能否使用
若二十个检验完全相同,二十个 p 值也相同,至少一次 p≤0.05 的概率仍为 0.05。相互独立时,这个概率是 0.6415;其他依赖结构会给出其他数值。Šidák 公式需要联合独立性,产品指标共享样本时通常只能把它作为基准。下一节的 Bonferroni 上界不需要独立性。
Bonferroni 用并集上界控制 FWER
令 H0 表示真实原假设的下标集合,数量为 m0。再令
V=被错误拒绝的真原假设数量.
家族错误率定义为
FWER=Pr(V≥1).
Bonferroni 对全部 m 项统一使用门槛
mα.
若每个真原假设的 p 值都有效,则由并集上界,
Pr(V≥1)=Prj∈H0⋃{pj≤mα}≤j∈H0∑Pr(pj≤mα)≤m0mα≤α.
证明只使用每个 p 值的边缘有效性,没有要求它们独立。它还允许一部分原假设为假,因此给出强 FWER 控制:无论真假原假设怎样组合,至少一个真原假设被错拒的概率都不超过 α。
单步 Bonferroni 校正 p 值为
pjBonf=min(mpj,1).
它可解释为该原假设刚好会被 Bonferroni 拒绝的最小家族水平。
本章最小项给出
p(1)Bonf=20(0.003)=0.06.
独立基准的精确选择后 p 值 0.0583 小于并集上界 0.06;在 p 值很小时,两者通常接近。Bonferroni 的优势是依赖条件弱,代价是检验很多或高度相关时可能损失功效。
Holm 逐步释放尚未使用的门槛
单步 Bonferroni 从头到尾都除以 m。Holm 程序先排序
p(1)≤⋯≤p(m),
再依次比较
p(i)与m−i+1α.
第一项面对 α/m。若它通过,第二项只需为剩余的 m−1 个原假设分配错误预算。遇到第一项未通过的 p 值便停止,并保留该项及全部更大 p 值。
推导:Holm 为什么在任意依赖下控制 FWER
设真实原假设共有 m0 个,p(i∗) 是排序后最先出现的真实原假设 p 值。若 Holm 错拒了任何真实原假设,它必然已经拒绝 p(i∗),从而
p(i∗)≤m−i∗+1α.
从第 i∗ 位到末位至少还包含全部 m0 个真实原假设,所以
m−i∗+1≥m0.
于是
j∈H0minpj=p(i∗)≤m0α.
再用并集上界:
Pr(V≥1)≤Pr(j∈H0minpj≤m0α)≤m0m0α=α.
本章第一步为
0.003>0.0025,
所以程序立即停止,拒绝数为 0。Holm 校正 p 值由前缀最大值保持单调:
p(i)Holm=min[1, j≤imax{(m−j+1)p(j)}].
前五项为
| i | p(i) | α/(21−i) | (21−i)p(i) | Holm 校正 p |
|---|
| 1 | 0.003 | 0.0025 | 0.060 | 0.060 |
| 2 | 0.009 | 0.0026 | 0.171 | 0.171 |
| 3 | 0.018 | 0.0028 | 0.324 | 0.324 |
| 4 | 0.041 | 0.0029 | 0.697 | 0.697 |
| 5 | 0.067 | 0.0031 | 1.072 | 1.000 |
后续校正值都为 1。当前数据在第一步便停止,尚未体现 Holm 相对单步 Bonferroni 的功效优势。
方法来路:Holm 为什么设计逐步拒绝程序
Holm 在 1979 年提出逐步拒绝式 Bonferroni 程序。它保留并集上界带来的任意依赖强控制,同时在已经拒绝若干原假设后缩小剩余家族的分母。由此得到的门槛不会比单步 Bonferroni 更严,并且无需预先知道哪些原假设为真。
FDR 衡量发现列表的平均污染
确认性研究常把“至少错报一次”视为关键风险;大规模筛选还会关心发现列表中的错误比例。令
R=拒绝总数,V=错误拒绝数.
假发现比例定义为
FDP=max(R,1)V,
并约定 R=0 时 FDP=0。假发现率是重复研究中的期望:
FDR=E(FDP).
它没有保证每一次实现的 FDP 都低于目标水平。若一次研究恰有 20 个发现,其中 5 个错误,则本次 FDP=0.25;FDR 描述同一程序长期重复时这类比例的平均值。
FWER 与 FDR 之间有一条直接关系。对每次实现及其重复抽样期望,分别有
FDPFDR≤1{V≥1},≤FWER.
若全部原假设都为真,则 V=R,只要出现发现就有 FDP=1,于是
FDR=Pr(R>0)=FWER.
在真假原假设并存时,FDR 允许发现列表包含一部分错误,通常可以换取更高发现能力。
适用边界:FDR 是无条件期望
当 Pr(R>0)>0 时,可定义
pFDR=E(RVR>0).
由全期望公式,
FDR=Pr(R>0)pFDR.
发现很少出现时,两者可能差异明显。报告“控制 FDR”时,应说明采用的定义、程序和重复抽样条件,避免把目标水平解释成当前列表中错误项的确定比例。
BH 通过向后寻找最大次序控制 FDR
Benjamini–Hochberg(BH)程序在目标水平 q 下寻找最大的
k=max{i:p(i)≤miq},
然后拒绝
p(1),…,p(k).
这是一个逐步上升程序。它必须检查全部排序位置,不能在第一处失败时停止。举例说,若 m=20,q=0.05,且
p(1)=0.003,p(2)=0.004,
第一项不满足 0.003≤0.0025,第二项却满足 0.004≤0.005;此时 k=2,前两项都被拒绝。
本章边界为
20i0.05=0.0025i.
检查全部二十项,等价于检查
ip(i)≤0.0025.
前五个比值依次为
0.003,0.0045,0.006,0.01025,0.0134.
对 i≥6,由 p(i)≥0.09 且 i≤20 可得
ip(i)≥200.09=0.0045.
所以本章的最小比值确为第一项的
iminip(i)=0.003,
仍高于 0.0025,所以不存在可选的 k,BH 拒绝数为 0。
BH 校正 p 值从后向前取后缀最小值:
p(i)BH=min[1, j≥imin{jmp(j)}].
前五项为
0.060,0.090,0.120,0.205,0.268.
最小项仍校正为 0.06。Bonferroni、Holm 与 BH 在这一个最小项上恰好相同,属于本组数据的巧合;三种程序的控制目标和其他校正值仍有明显差别。
BH 的控制结论依赖哪些联合分布条件
BH 的经典结论在真原假设 p 值相互独立,并且与其他 p 值独立时最容易证明。令 R(j) 表示把第 j 个 p 值替换为 0 后,BH 得到的拒绝总数。它至少为 1,并且只由其余 p 值决定。若第 j 项原来已被拒绝,把它降到 0 不会改变最大通过次序;反过来,若 pj≤qR(j)/m,把 0 还原为 pj 后第 R(j) 条边界仍然通过。由此可得下面的逐点恒等式。
推导:独立条件下的 BH FDR 上界
对真实原假设 j∈H0,BH 的逐步上升结构给出
max(R,1)1{j 被拒绝}=R(j)1{pj≤qR(j)/m}.
给定其余 p 值后,R(j) 是常数。由独立性和真原假设 p 值的有效性,
E[R(j)1{pj≤qR(j)/m}p−j]≤R(j)qR(j)/m=mq.
把所有真实原假设的贡献相加:
FDR=j∈H0∑E[max(R,1)1{j 被拒绝}]≤mm0q≤q.
Benjamini 与 Yekutieli 后来证明,标准 BH 在一类称为 PRDS 的正依赖结构下也保持控制。任意依赖下,令
Hm=r=1∑mr1,p(i)≤miHmq,
便得到 Benjamini–Yekutieli(BY)程序。这里相当于把 BH 的目标水平 q 缩为 q/Hm。本章有
H20≈3.5977,20H200.05≈0.000695,
后一个数就是第一条 BY 边界。
BY 在缺乏依赖信息时提供通用保证,往往也更保守。工程指标共享原始信号、约束和预处理时,依赖结构应由设计知识、联合模型或重抽样方案说明;给软件传入一列 p 值并不能自动验证 BH 的条件。
方法来路:为什么从 FWER 转向 FDR
Benjamini 与 Hochberg 在 1995 年提出 FDR 及 BH 程序,为大量同时检验分配另一种错误预算;Benjamini 与 Yekutieli 在 2001 年研究依赖结构,给出 PRDS 条件与任意依赖修正。方法的目标从“整个家族零错报”转向“限制发现列表的长期平均污染”,适合探索性筛选,确认性结论仍需与研究后果相匹配。
检验家族由共同选择机会决定
“二十项指标”只是最容易看见的家族。只要分析者能从多条路径中选择最终结论,机会还可能来自:
-
多个结局、时间点、剂量和亚组;
-
多种变量变换、删点规则和控制变量集合;
-
多个模型、交互项、超参数和随机种子;
-
同一分析在多个停止时点反复查看;
-
多个团队或版本对同一问题重复搜索。
第十一章只省略一次控制变量;若分析者看过许多控制集合后才选中正斜率,这些模型也属于同一选择机会。家族应围绕共同决策目标和实际选择机制定义。把一次搜索拆成许多文件或许多“单独问题”,仍会保留从中选取最小 p 值的规则。
有些研究具有预先规定的层级结构。例如主要终点通过后才检验次要终点,或先做总体检验再进入亚组。此时可以采用门控、闭合检验或层级 FDR 等与结构相符的程序;把所有问题机械地压成一个平坦家族也可能浪费信息。
适用边界:校正需要看见搜索范围
只拿最终入选的 0.003 做“一个检验”的校正,隐藏的十九次机会不会自动出现。对难以枚举的分析路径,冻结方案、保存版本化代码、保留完整结果和使用独立确认数据,通常比事后猜测一个检验数更可靠。校正能够处理已定义的家族,无法替缺失的搜索日志补写历史。
p 值分布可以提示什么
连续、校准正确的真原假设 p 值服从均匀分布;真实效应通常会让一部分 p 值向 0 集中。若大量 p 值来自同一类检验,可以把总体形状粗略看成
真零假设的近均匀成分+真实效应的近零成分.
这项图形判断有多重边界:
-
离散检验会产生台阶和大量相同值;
-
共享样本的相关检验会让直方图柱高一起波动;
-
复合原假设、低功效与效应异质性会改变近零形状;
-
只收集已发表结果会把未入选 p 值从图中删去;
-
大量数值挤在 0.05 左侧只能提出选择性报告线索。
因此,p 值直方图适合定位异常范围,无法单独证明操纵。注册记录、完整结果表、时间戳、效应量、区间估计和分析日志提供更直接的核查证据。
把二十项搜索放回确认流程
探索数据可以提出候选指标和模型。确认阶段需要新数据或事先冻结的分析:
探索集:提出假设⟶确认集:检验冻结假设.
若确认集反复参与选择,它也会逐渐失去新鲜性。第十三章会把同一原则放进超参数选择、交叉验证与测试集评估。
本章最终卡片只展示 p=0.003,通过了原始 p 值不超过 0.01 的机械目标。恢复二十项家族以后,对最小项有
pBonf=pHolm=pBH=0.06,
三种程序都得到零项发现。完整报告至少需要:
-
列出全部原假设、效应量、区间和原始 p 值;
-
说明家族边界、主要与探索性标签及其确定时间;
-
预先选择 FWER、FDR 或层级错误控制目标;
-
写明校正程序、目标水平、依赖假设与软件版本;
-
报告原始和校正 p 值、拒绝数及未入选结果;
-
保存停止规则、分析日志、代码、随机种子和数据版本;
-
对探索结果使用独立样本或后续实验确认。
| 准则 | FWER | FDR |
|---|
| 随机错误量 | 1{V≥1} | V/max(R,1) |
| 控制对象 | 至少一次错报的概率 | 假发现比例的期望 |
| 典型程序 | Bonferroni、Holm | BH、BY |
| 常见用途 | 少量关键确认性结论 | 大规模探索性发现 |
| 主要代价 | 检验多时功效下降 | 允许实现中出现较高 FDP |
本章知识链
-
有效 p 值满足 PrHj(pj≤u)≤u;连续精确检验在真原假设下常给出均匀分布。
-
独立全零家族的最小值服从 Beta(1,m),均值为 1/(m+1);二十次搜索的最小值天然偏小。
-
本章 pmin=0.003 的独立选择后尾概率约为 0.0583;Šidák 门槛约为 0.002561。
-
Bonferroni 由并集上界在任意依赖下强控制 FWER,最小项校正为 0.06。
-
Holm 用逐步缩小的剩余家族分母提高功效,并以第一个未通过位置停止;本章第一步即停止。
-
FDR 是 FDP 的期望,满足 FDR≤FWER;全零家族中二者相等。
-
BH 向后寻找最大满足次序,不能在第一处失败时停止;本章没有满足边界的次序。
-
独立条件下 BH 控制 FDR≤(m0/m)q;PRDS 与任意依赖分别需要相应理论或 BY 修正。
-
最小项在 Bonferroni、Holm 与 BH 下都为 0.06,这项相等不代表三种程序拥有相同目标。
-
家族定义、搜索日志、完整结果和独立确认共同决定隐藏机会能否重新进入推断。
思考与练习
-
证明有效 p 值使用门槛 u 时,单项第一类错误概率不超过 u;说明离散检验为何可能给出严格不等号。
-
推导 Pmin 的分布、密度、均值和中位数,并复算 m=20 时的两个位置量。
-
复算 1−0.9520、1−0.9920、1−0.99720 与 Šidák 门槛,解释每个概率对应的重复抽样规则。
-
从有效 p 值的超均匀性出发证明 Bonferroni 的强 FWER 控制,并指出证明中没有使用哪一项联合分布假设。
-
用前五个 p 值复算 Holm 门槛、乘数、前缀最大校正值和停止位置。
-
按推导框证明 Holm 控制 FWER;重点说明 m−i∗+1≥m0 的计数含义。
-
证明 FDR≤FWER,再证明全零家族中二者相等。
-
若前两个 p 值改为 (0.001,0.003),其余不变,分别执行 Bonferroni、Holm 和 BH,并解释为何 BH 拒绝两项。
-
计算全部二十个 p(i)/i 与 BH 校正 p 值,验证本章拒绝数为 0。
-
计算 H20 和前五条 BY 边界;比较 BH、BY 对依赖条件与功效的要求。
-
构造二十个完全相同的均匀 p 值,再构造二十个独立均匀 p 值;比较两种依赖结构下至少一次 p≤0.05 的概率。
-
为包含 3 个指标、4 个时间点、2 个亚组和两次中期查看的研究定义检验家族,说明主要层级、错误控制目标、日志字段和独立确认方案。
专题导航