第十二章:把二十次搜索缩成一个 p 值

本章造假目标

同一次产品实验同时检验 20 个指标。完整结果中最小原始 pp 值为 0.0030.003;按总水平 0.050.05 进行 Bonferroni、Holm 或 BH 校正,三个程序都没有发现,当前结论是“尚无通过多重性控制的指标”。结果卡片只检查一项:展示的原始双侧 pp 值不超过 0.010.01。允许的操作只有从二十项中挑一项展示并隐藏其余结果,不得重算、修改或新增检验。本章将先完成这项选择,再把十九次隐藏机会放回有效 p 值、最小值分布、FWER、FDR、依赖条件和确认流程中。

完整家族无发现,最小原始值却能过线

二十个原始双侧 p 值已经按从小到大排列:

0.0030.0030.0090.0090.0180.0180.0410.0410.0670.067
0.0900.0900.1200.1200.1500.1500.1800.1800.2200.220
0.2700.2700.3100.3100.3600.3600.4100.4100.4600.460
0.5200.5200.5800.5800.6400.6400.7300.7300.8800.880

结果卡片的机械条件是

pshown0.01.p_{\mathrm{shown}}\le0.01.

选择最小值便得到

pshown=p(1)=0.003.p_{\mathrm{shown}}=p_{(1)}=0.003.

第二小的 0.0090.009 也能过线;只展示 0.0030.003 会让结果显得更强。完整家族给出另一项判断。Bonferroni 的单项门槛为

0.0520=0.0025,\frac{0.05}{20}=0.0025,

连最小值也没有通过。Holm 从同一个门槛开始,第一步便停止;BH 的二十条排序边界同样没有一条被满足。三个程序都得到零项发现。

造假动作留下的影子

展示出来的 0.0030.003 是原表中的真实计算,删除的是它从二十次机会中胜出的选择过程。实验方案、指标字典、宽表列名、分析脚本和日志会留下完整家族;恢复这些记录后,最小值的 Bonferroni、Holm 与 BH 校正 p 值都为 0.060.06

第一章把 p 值定义在一套固定分析方案 AA 上。本章多出一个步骤:先执行二十套检验,再由结果决定展示哪一项。这个选择规则也属于方案,必须进入重复抽样计算。

有效 pp 值承诺的错误概率是什么

对第 jj 个原假设 HjH_j,先固定抽样、清洗、统计量、单侧或双侧方向、样本量和停止规则,记为 AjA_j。若观测统计量为 Tj,obsT_{j,\mathrm{obs}},p 值是零假设参照分布中“至少同样极端”的尾部概率。其形式可写为

pj=PrHj,Aj{TjEj(Tj,obs)},p_j = \Pr_{H_j,A_j} \left\{ T_j\in\mathcal E_j(T_{j,\mathrm{obs}}) \right\},

其中 Ej\mathcal E_j 由预先确定的极端方向定义。

一个有效 p 值至少满足:对任意 u[0,1]u\in[0,1]

PrHj(pju)u.\Pr_{H_j}(p_j\le u)\le u.

这项性质称为超均匀性。若检验统计量连续、参照分布完全正确且没有随机化或离散台阶,真原假设下常有

pjU(0,1).p_j\sim U(0,1).

离散检验和复合原假设常产生严格小于号,p 值会偏保守。无论等号是否成立,门槛 uu 的含义都相同:真原假设下,长期误拒绝概率至多为 uu

这项保证仍以单项方案 AjA_j 为条件。若二十个 p 值都分别有效,再从中挑最小值,入选结果的分布已经改变。p(1)=0.003p_{(1)}=0.003 也不表示 HjH_j 为真的概率是 0.3%0.3\%;它度量的是指定零假设与指定检验方案下的尾部位置。

方法来路:p 值为何从固定实验方案出发

Fisher 在 1925 年面向实验研究者系统整理显著性检验,目标是用参照分布衡量观测结果在零假设下有多反常。抽样、统计量和极端方向共同决定参照分布。现代分析又加入数据清洗、停止规则与结果选择;这些步骤一旦随结果变化,原先的尾部面积就不再概括完整程序。

最小 pp 值本身有一条概率分布

先建立可以精确计算的基准。假设 mm 个原假设全部成立,p 值连续、有效且相互独立,于是

p1,,pmiidU(0,1).p_1,\ldots,p_m \overset{\mathrm{iid}}{\sim}U(0,1).

Pmin=min1jmpj.P_{\min}=\min_{1\le j\le m}p_j.

0x10\le x\le1

Pr(Pmin>x)=Pr(p1>x,,pm>x)=(1x)m.\begin{aligned} \Pr(P_{\min}>x) &=\Pr(p_1>x,\ldots,p_m>x)\\ &=(1-x)^m. \end{aligned}

因此

FPmin(x)=Pr(Pminx)=1(1x)m,fPmin(x)=m(1x)m1.\begin{aligned} F_{P_{\min}}(x) &=\Pr(P_{\min}\le x) =1-(1-x)^m,\\ f_{P_{\min}}(x) &=m(1-x)^{m-1}. \end{aligned}

换用常见分布名称,这就是 PminBeta(1,m)P_{\min}\sim\operatorname{Beta}(1,m)

利用非负随机变量的尾积分公式,

E(Pmin)=01Pr(Pmin>x)dx=01(1x)mdx=1m+1.\mathbb{E}(P_{\min}) =\int_0^1\Pr(P_{\min}>x)\,dx =\int_0^1(1-x)^m\,dx =\frac1{m+1}.

中位数 x0.5x_{0.5} 满足 1(1x0.5)m=1/21-(1-x_{0.5})^m=1/2,解得 x0.5=121/mx_{0.5}=1-2^{-1/m}

m=20m=20 时,

E(Pmin)=1210.0476,Median(Pmin)0.0341.\mathbb{E}(P_{\min})=\frac1{21}\approx0.0476, \qquad \operatorname{Median}(P_{\min})\approx0.0341.

二十个真零假设的最小 p 值通常就会比 0.050.05 小。两个常用门槛的过线概率为

Pr(Pmin0.05)=10.95200.6415,Pr(Pmin0.01)=10.99200.1821.\begin{aligned} \Pr(P_{\min}\le0.05) &=1-0.95^{20} \approx0.6415,\\ \Pr(P_{\min}\le0.01) &=1-0.99^{20} \approx0.1821. \end{aligned}

本章观察到 Pmin=0.003P_{\min}=0.003。在独立全零基准下,选择后的精确尾概率是

Pr(Pmin0.003)=10.997200.0583.\Pr(P_{\min}\le0.003) =1-0.997^{20} \approx0.0583.

单独展示时的 0.0030.003 很醒目;放回“二十取一”的统计量后,它没有越过 0.050.05

在上述独立全零基准下,若要让家族错误率精确等于 α\alpha,每项可用 Šidák 门槛

αSˇidaˊk=1(1α)1/m.\alpha_{\text{Šidák}} =1-(1-\alpha)^{1/m}.

本章取 α=0.05,m=20\alpha=0.05,m=20,得到

αSˇidaˊk0.002561.\alpha_{\text{Šidák}} \approx0.002561.

0.0030.003 仍未通过。

适用边界:独立性决定乘法公式能否使用

若二十个检验完全相同,二十个 p 值也相同,至少一次 p0.05p\le0.05 的概率仍为 0.050.05。相互独立时,这个概率是 0.64150.6415;其他依赖结构会给出其他数值。Šidák 公式需要联合独立性,产品指标共享样本时通常只能把它作为基准。下一节的 Bonferroni 上界不需要独立性。

Bonferroni 用并集上界控制 FWER

H0\mathcal H_0 表示真实原假设的下标集合,数量为 m0m_0。再令

V=被错误拒绝的真原假设数量.V=\text{被错误拒绝的真原假设数量}.

家族错误率定义为

FWER=Pr(V1).\operatorname{FWER}=\Pr(V\ge1).

Bonferroni 对全部 mm 项统一使用门槛

αm.\frac{\alpha}{m}.

若每个真原假设的 p 值都有效,则由并集上界,

Pr(V1)=Pr(jH0{pjαm})jH0Pr(pjαm)m0αmα.\begin{aligned} \Pr(V\ge1) &= \Pr\left( \bigcup_{j\in\mathcal H_0} \left\{ p_j\le\frac{\alpha}{m} \right\} \right)\\ &\le \sum_{j\in\mathcal H_0} \Pr\left( p_j\le\frac{\alpha}{m} \right)\\ &\le m_0\frac{\alpha}{m}\\ &\le\alpha. \end{aligned}

证明只使用每个 p 值的边缘有效性,没有要求它们独立。它还允许一部分原假设为假,因此给出强 FWER 控制:无论真假原假设怎样组合,至少一个真原假设被错拒的概率都不超过 α\alpha

单步 Bonferroni 校正 p 值为

p~jBonf=min(mpj,1).\widetilde p_j^{\mathrm{Bonf}} =\min(mp_j,1).

它可解释为该原假设刚好会被 Bonferroni 拒绝的最小家族水平。

本章最小项给出

p~(1)Bonf=20(0.003)=0.06.\widetilde p_{(1)}^{\mathrm{Bonf}} =20(0.003) =0.06.

独立基准的精确选择后 p 值 0.05830.0583 小于并集上界 0.060.06;在 p 值很小时,两者通常接近。Bonferroni 的优势是依赖条件弱,代价是检验很多或高度相关时可能损失功效。

Holm 逐步释放尚未使用的门槛

单步 Bonferroni 从头到尾都除以 mm。Holm 程序先排序

p(1)p(m),p_{(1)}\le\cdots\le p_{(m)},

再依次比较

p(i)αmi+1.p_{(i)} \quad\text{与}\quad \frac{\alpha}{m-i+1}.

第一项面对 α/m\alpha/m。若它通过,第二项只需为剩余的 m1m-1 个原假设分配错误预算。遇到第一项未通过的 p 值便停止,并保留该项及全部更大 p 值。

推导:Holm 为什么在任意依赖下控制 FWER

设真实原假设共有 m0m_0 个,p(i)p_{(i_*)} 是排序后最先出现的真实原假设 p 值。若 Holm 错拒了任何真实原假设,它必然已经拒绝 p(i)p_{(i_*)},从而

p(i)αmi+1.p_{(i_*)} \le \frac{\alpha}{m-i_*+1}.

从第 ii_* 位到末位至少还包含全部 m0m_0 个真实原假设,所以

mi+1m0.m-i_*+1\ge m_0.

于是

minjH0pj=p(i)αm0.\min_{j\in\mathcal H_0}p_j =p_{(i_*)} \le\frac{\alpha}{m_0}.

再用并集上界:

Pr(V1)Pr(minjH0pjαm0)m0αm0=α.\Pr(V\ge1) \le \Pr\left( \min_{j\in\mathcal H_0}p_j \le\frac{\alpha}{m_0} \right) \le m_0\frac{\alpha}{m_0} =\alpha.

本章第一步为

0.003>0.0025,0.003>0.0025,

所以程序立即停止,拒绝数为 0。Holm 校正 p 值由前缀最大值保持单调:

p~(i)Holm=min[1, maxji{(mj+1)p(j)}].\widetilde p_{(i)}^{\mathrm{Holm}} = \min\left[ 1,\ \max_{j\le i} \{(m-j+1)p_{(j)}\} \right].

前五项为

iip(i)p_{(i)}α/(21i)\alpha/(21-i)(21i)p(i)(21-i)p_{(i)}Holm 校正 p
10.0030.0030.00250.00250.0600.0600.0600.060
20.0090.0090.00260.00260.1710.1710.1710.171
30.0180.0180.00280.00280.3240.3240.3240.324
40.0410.0410.00290.00290.6970.6970.6970.697
50.0670.0670.00310.00311.0721.0721.0001.000

后续校正值都为 1。当前数据在第一步便停止,尚未体现 Holm 相对单步 Bonferroni 的功效优势。

方法来路:Holm 为什么设计逐步拒绝程序

Holm 在 1979 年提出逐步拒绝式 Bonferroni 程序。它保留并集上界带来的任意依赖强控制,同时在已经拒绝若干原假设后缩小剩余家族的分母。由此得到的门槛不会比单步 Bonferroni 更严,并且无需预先知道哪些原假设为真。

FDR 衡量发现列表的平均污染

确认性研究常把“至少错报一次”视为关键风险;大规模筛选还会关心发现列表中的错误比例。令

R=拒绝总数,V=错误拒绝数.R=\text{拒绝总数}, \qquad V=\text{错误拒绝数}.

假发现比例定义为

FDP=Vmax(R,1),\operatorname{FDP} =\frac{V}{\max(R,1)},

并约定 R=0R=0FDP=0\operatorname{FDP}=0。假发现率是重复研究中的期望:

FDR=E(FDP).\operatorname{FDR} =\mathbb{E}(\operatorname{FDP}).

它没有保证每一次实现的 FDP 都低于目标水平。若一次研究恰有 20 个发现,其中 5 个错误,则本次 FDP=0.25\operatorname{FDP}=0.25;FDR 描述同一程序长期重复时这类比例的平均值。

FWER 与 FDR 之间有一条直接关系。对每次实现及其重复抽样期望,分别有

FDP1{V1},FDRFWER.\begin{aligned} \operatorname{FDP} &\le \mathbf1\{V\ge1\},\\ \operatorname{FDR} &\le \operatorname{FWER}. \end{aligned}

若全部原假设都为真,则 V=RV=R,只要出现发现就有 FDP=1\operatorname{FDP}=1,于是

FDR=Pr(R>0)=FWER.\operatorname{FDR} =\Pr(R>0) =\operatorname{FWER}.

在真假原假设并存时,FDR 允许发现列表包含一部分错误,通常可以换取更高发现能力。

适用边界:FDR 是无条件期望

Pr(R>0)>0\Pr(R>0)>0 时,可定义

pFDR=E(VR|R>0).\operatorname{pFDR} =\mathbb{E}\left(\frac VR\,\middle|\, R>0\right).

由全期望公式,

FDR=Pr(R>0)pFDR.\operatorname{FDR} =\Pr(R>0)\operatorname{pFDR}.

发现很少出现时,两者可能差异明显。报告“控制 FDR”时,应说明采用的定义、程序和重复抽样条件,避免把目标水平解释成当前列表中错误项的确定比例。

BH 通过向后寻找最大次序控制 FDR

Benjamini–Hochberg(BH)程序在目标水平 qq 下寻找最大的

k=max{i:p(i)imq},k =\max\left\{ i: p_{(i)}\le\frac{i}{m}q \right\},

然后拒绝

p(1),,p(k).p_{(1)},\ldots,p_{(k)}.

这是一个逐步上升程序。它必须检查全部排序位置,不能在第一处失败时停止。举例说,若 m=20,q=0.05m=20,q=0.05,且

p(1)=0.003,p(2)=0.004,p_{(1)}=0.003,\qquad p_{(2)}=0.004,

第一项不满足 0.0030.00250.003\le0.0025,第二项却满足 0.0040.0050.004\le0.005;此时 k=2k=2,前两项都被拒绝。

本章边界为

i200.05=0.0025i.\frac{i}{20}0.05=0.0025i.

检查全部二十项,等价于检查

p(i)i0.0025.\frac{p_{(i)}}i\le0.0025.

前五个比值依次为

0.003,0.0045,0.006,0.01025,0.0134.0.003,\quad 0.0045,\quad 0.006,\quad 0.01025,\quad 0.0134.

i6i\ge6,由 p(i)0.09p_{(i)}\ge0.09i20i\le20 可得

p(i)i0.0920=0.0045.\frac{p_{(i)}}i \ge \frac{0.09}{20} =0.0045.

所以本章的最小比值确为第一项的

minip(i)i=0.003,\min_i\frac{p_{(i)}}i=0.003,

仍高于 0.00250.0025,所以不存在可选的 kk,BH 拒绝数为 0。

BH 校正 p 值从后向前取后缀最小值:

p~(i)BH=min[1, minji{mjp(j)}].\widetilde p_{(i)}^{\mathrm{BH}} = \min\left[ 1,\ \min_{j\ge i} \left\{ \frac{m}{j}p_{(j)} \right\} \right].

前五项为

0.060,0.090,0.120,0.205,0.268.0.060,\quad 0.090,\quad 0.120,\quad 0.205,\quad 0.268.

最小项仍校正为 0.060.06。Bonferroni、Holm 与 BH 在这一个最小项上恰好相同,属于本组数据的巧合;三种程序的控制目标和其他校正值仍有明显差别。

BH 的控制结论依赖哪些联合分布条件

BH 的经典结论在真原假设 p 值相互独立,并且与其他 p 值独立时最容易证明。令 R(j)R^{(j)} 表示把第 jj 个 p 值替换为 0 后,BH 得到的拒绝总数。它至少为 1,并且只由其余 p 值决定。若第 jj 项原来已被拒绝,把它降到 0 不会改变最大通过次序;反过来,若 pjqR(j)/mp_j\le qR^{(j)}/m,把 0 还原为 pjp_j 后第 R(j)R^{(j)} 条边界仍然通过。由此可得下面的逐点恒等式。

推导:独立条件下的 BH FDR 上界

对真实原假设 jH0j\in\mathcal H_0,BH 的逐步上升结构给出

1{j 被拒绝}max(R,1)=1{pjqR(j)/m}R(j).\frac{\mathbf1\{j\text{ 被拒绝}\}}{\max(R,1)} = \frac{ \mathbf1\left\{ p_j\le qR^{(j)}/m \right\}} {R^{(j)}}.

给定其余 p 值后,R(j)R^{(j)} 是常数。由独立性和真原假设 p 值的有效性,

E[1{pjqR(j)/m}R(j)|pj]qR(j)/mR(j)=qm.\begin{aligned} \mathbb{E}\left[ \frac{ \mathbf1\left\{ p_j\le qR^{(j)}/m \right\}} {R^{(j)}} \,\middle|\, \mathbf p_{-j} \right] &\le \frac{qR^{(j)}/m}{R^{(j)}}\\ &=\frac qm. \end{aligned}

把所有真实原假设的贡献相加:

FDR=jH0E[1{j 被拒绝}max(R,1)]m0mqq.\begin{aligned} \operatorname{FDR} &= \sum_{j\in\mathcal H_0} \mathbb{E}\left[ \frac{\mathbf1\{j\text{ 被拒绝}\}} {\max(R,1)} \right]\\ &\le \frac{m_0}{m}q\\ &\le q. \end{aligned}

Benjamini 与 Yekutieli 后来证明,标准 BH 在一类称为 PRDS 的正依赖结构下也保持控制。任意依赖下,令

Hm=r=1m1r,p(i)imqHm,H_m=\sum_{r=1}^m\frac1r, \qquad p_{(i)}\le\frac{i}{m}\frac{q}{H_m},

便得到 Benjamini–Yekutieli(BY)程序。这里相当于把 BH 的目标水平 qq 缩为 q/Hmq/H_m。本章有

H203.5977,0.0520H200.000695,H_{20}\approx3.5977, \qquad \frac{0.05}{20H_{20}} \approx0.000695,

后一个数就是第一条 BY 边界。

BY 在缺乏依赖信息时提供通用保证,往往也更保守。工程指标共享原始信号、约束和预处理时,依赖结构应由设计知识、联合模型或重抽样方案说明;给软件传入一列 p 值并不能自动验证 BH 的条件。

方法来路:为什么从 FWER 转向 FDR

Benjamini 与 Hochberg 在 1995 年提出 FDR 及 BH 程序,为大量同时检验分配另一种错误预算;Benjamini 与 Yekutieli 在 2001 年研究依赖结构,给出 PRDS 条件与任意依赖修正。方法的目标从“整个家族零错报”转向“限制发现列表的长期平均污染”,适合探索性筛选,确认性结论仍需与研究后果相匹配。

检验家族由共同选择机会决定

“二十项指标”只是最容易看见的家族。只要分析者能从多条路径中选择最终结论,机会还可能来自:

  • 多个结局、时间点、剂量和亚组;

  • 多种变量变换、删点规则和控制变量集合;

  • 多个模型、交互项、超参数和随机种子;

  • 同一分析在多个停止时点反复查看;

  • 多个团队或版本对同一问题重复搜索。

第十一章只省略一次控制变量;若分析者看过许多控制集合后才选中正斜率,这些模型也属于同一选择机会。家族应围绕共同决策目标和实际选择机制定义。把一次搜索拆成许多文件或许多“单独问题”,仍会保留从中选取最小 p 值的规则。

有些研究具有预先规定的层级结构。例如主要终点通过后才检验次要终点,或先做总体检验再进入亚组。此时可以采用门控、闭合检验或层级 FDR 等与结构相符的程序;把所有问题机械地压成一个平坦家族也可能浪费信息。

适用边界:校正需要看见搜索范围

只拿最终入选的 0.0030.003 做“一个检验”的校正,隐藏的十九次机会不会自动出现。对难以枚举的分析路径,冻结方案、保存版本化代码、保留完整结果和使用独立确认数据,通常比事后猜测一个检验数更可靠。校正能够处理已定义的家族,无法替缺失的搜索日志补写历史。

pp 值分布可以提示什么

连续、校准正确的真原假设 p 值服从均匀分布;真实效应通常会让一部分 p 值向 0 集中。若大量 p 值来自同一类检验,可以把总体形状粗略看成

真零假设的近均匀成分+真实效应的近零成分.\text{真零假设的近均匀成分} \quad+\quad \text{真实效应的近零成分}.

这项图形判断有多重边界:

  1. 离散检验会产生台阶和大量相同值;

  2. 共享样本的相关检验会让直方图柱高一起波动;

  3. 复合原假设、低功效与效应异质性会改变近零形状;

  4. 只收集已发表结果会把未入选 p 值从图中删去;

  5. 大量数值挤在 0.050.05 左侧只能提出选择性报告线索。

因此,p 值直方图适合定位异常范围,无法单独证明操纵。注册记录、完整结果表、时间戳、效应量、区间估计和分析日志提供更直接的核查证据。

把二十项搜索放回确认流程

探索数据可以提出候选指标和模型。确认阶段需要新数据或事先冻结的分析:

探索集:提出假设确认集:检验冻结假设.\text{探索集:提出假设} \quad\longrightarrow\quad \text{确认集:检验冻结假设}.

若确认集反复参与选择,它也会逐渐失去新鲜性。第十三章会把同一原则放进超参数选择、交叉验证与测试集评估。

本章最终卡片只展示 p=0.003p=0.003,通过了原始 p 值不超过 0.010.01 的机械目标。恢复二十项家族以后,对最小项有

p~Bonf=p~Holm=p~BH=0.06,\widetilde p_{\mathrm{Bonf}} = \widetilde p_{\mathrm{Holm}} = \widetilde p_{\mathrm{BH}} =0.06,

三种程序都得到零项发现。完整报告至少需要:

  1. 列出全部原假设、效应量、区间和原始 p 值;

  2. 说明家族边界、主要与探索性标签及其确定时间;

  3. 预先选择 FWER、FDR 或层级错误控制目标;

  4. 写明校正程序、目标水平、依赖假设与软件版本;

  5. 报告原始和校正 p 值、拒绝数及未入选结果;

  6. 保存停止规则、分析日志、代码、随机种子和数据版本;

  7. 对探索结果使用独立样本或后续实验确认。

准则FWERFDR
随机错误量1{V1}\mathbf1\{V\ge1\}V/max(R,1)V/\max(R,1)
控制对象至少一次错报的概率假发现比例的期望
典型程序Bonferroni、HolmBH、BY
常见用途少量关键确认性结论大规模探索性发现
主要代价检验多时功效下降允许实现中出现较高 FDP

本章知识链

  1. 有效 p 值满足 PrHj(pju)u\Pr_{H_j}(p_j\le u)\le u;连续精确检验在真原假设下常给出均匀分布。

  2. 独立全零家族的最小值服从 Beta(1,m)\operatorname{Beta}(1,m),均值为 1/(m+1)1/(m+1);二十次搜索的最小值天然偏小。

  3. 本章 pmin=0.003p_{\min}=0.003 的独立选择后尾概率约为 0.05830.0583;Šidák 门槛约为 0.0025610.002561

  4. Bonferroni 由并集上界在任意依赖下强控制 FWER,最小项校正为 0.060.06

  5. Holm 用逐步缩小的剩余家族分母提高功效,并以第一个未通过位置停止;本章第一步即停止。

  6. FDR 是 FDP 的期望,满足 FDRFWER\operatorname{FDR}\le\operatorname{FWER};全零家族中二者相等。

  7. BH 向后寻找最大满足次序,不能在第一处失败时停止;本章没有满足边界的次序。

  8. 独立条件下 BH 控制 FDR(m0/m)q\operatorname{FDR}\le(m_0/m)q;PRDS 与任意依赖分别需要相应理论或 BY 修正。

  9. 最小项在 Bonferroni、Holm 与 BH 下都为 0.060.06,这项相等不代表三种程序拥有相同目标。

  10. 家族定义、搜索日志、完整结果和独立确认共同决定隐藏机会能否重新进入推断。

思考与练习

  1. 证明有效 p 值使用门槛 uu 时,单项第一类错误概率不超过 uu;说明离散检验为何可能给出严格不等号。

  2. 推导 PminP_{\min} 的分布、密度、均值和中位数,并复算 m=20m=20 时的两个位置量。

  3. 复算 10.95201-0.95^{20}10.99201-0.99^{20}10.997201-0.997^{20} 与 Šidák 门槛,解释每个概率对应的重复抽样规则。

  4. 从有效 p 值的超均匀性出发证明 Bonferroni 的强 FWER 控制,并指出证明中没有使用哪一项联合分布假设。

  5. 用前五个 p 值复算 Holm 门槛、乘数、前缀最大校正值和停止位置。

  6. 按推导框证明 Holm 控制 FWER;重点说明 mi+1m0m-i_*+1\ge m_0 的计数含义。

  7. 证明 FDRFWER\operatorname{FDR}\le\operatorname{FWER},再证明全零家族中二者相等。

  8. 若前两个 p 值改为 (0.001,0.003)(0.001,0.003),其余不变,分别执行 Bonferroni、Holm 和 BH,并解释为何 BH 拒绝两项。

  9. 计算全部二十个 p(i)/ip_{(i)}/i 与 BH 校正 p 值,验证本章拒绝数为 0。

  10. 计算 H20H_{20} 和前五条 BY 边界;比较 BH、BY 对依赖条件与功效的要求。

  11. 构造二十个完全相同的均匀 p 值,再构造二十个独立均匀 p 值;比较两种依赖结构下至少一次 p0.05p\le0.05 的概率。

  12. 为包含 3 个指标、4 个时间点、2 个亚组和两次中期查看的研究定义检验家族,说明主要层级、错误控制目标、日志字段和独立确认方案。

专题导航