第五章:把停止时点选在显著那一天

本章造假目标

某产品 A 方案的转化率约为 10%10\%;试验原计划每天每组增加 500500 人,第八天达到每组 40004000 人。

当前结论:最新的第四天结果显示,B 方案估计提升 1.81.8 个百分点,按固定样本公式计算的双侧 p=0.068p=0.068,业务表应写“尚未胜出”;第三天曾出现 2.672.67 个百分点与 p=0.021p=0.021

验收目标:B 方案的样本转化率至少高出 22 个百分点,针对零差异的双侧 p0.05p\le0.05,两项同时成立时业务表写“胜出”。

可动范围:只能从真实累计快照中选择报告终点,不得更改转化记录和分组。

本章任务:把报告终点回溯到第三天,再计算这种选择怎样改变假阳性机会,并检查预先设计的八次序贯边界是否允许第三天停止。功效设计所需的每组约 38413841 人也将在本章推导。

四个累计时点中只有第三天同时过线

累计数据如下:

累计天数每组样本量A 组转化B 组转化固定样本双侧近似 pp
150050  (10.0%)50\;(10.0\%)60  (12.0%)60\;(12.0\%)0.3120.312
21000100  (10.0%)100\;(10.0\%)124  (12.4%)124\;(12.4\%)0.0890.089
31500150  (10.0%)150\;(10.0\%)190  (12.7%)190\;(12.7\%)0.0210.021
42000200  (10.0%)200\;(10.0\%)236  (11.8%)236\;(11.8\%)0.0680.068

表中 p 值均由每个时点的合并比例 z 检验计算,暂时把该时点当作唯一一次预定分析。

业务表检查两个报告字段:

δ^=p^Bp^A0.02,\widehat\delta =\widehat p_B-\widehat p_A \ge0.02, pH0:pA=pB0.05.p_{H_0:\,p_A=p_B}\le0.05.

第一天只有点估计达到 2%2\%,p 值未过线;第二天点估计达到 2.4%2.4\%,p 值仍未过线;第三天两项同时通过;第四天两项又同时失败。现在回溯性地把停止规则写成“第一次两项通过就停”,便可把第四天已经存在的数据排除在报告之外。

所有转化记录都保持原样,选择发生在时间轴上:同一条累计轨迹只截取最有利的前缀。规则若在试验前写定,可以作为序贯设计的一部分接受错误率评价;看完第四天再回溯规则,还增加了结果选择。两种情形都要求把“可能查看并选择多个时点”计入误报概率。要理解第三天的 p=0.021p=0.021 如何得到,以及固定样本解释为何失效,先从单个用户的 0011 结果建立抽样模型。

造假动作留下的影子

第三天没有一条转化记录遭到修改,选择痕迹位于报告边界:原计划为每组 40004000 人,结果页只报告每组 15001500 人;完整轨迹还显示第四天显著性消失。固定样本 p 值把分析时点视为事先唯一确定;分析时点一旦由正在波动的结果决定,第三天的尾部概率就遗漏了其他查看机会。回溯性终点还必须保留第四天已经存在的审计记录。

用户转化为什么产生二项波动

把第 ii 个用户是否转化记为

Yi={1,转化,0,未转化.Y_i= \begin{cases} 1,&\text{转化},\\ 0,&\text{未转化}. \end{cases}

若每位用户转化概率相同且用户之间独立,

Pr(Yi=1)=p,Pr(Yi=0)=1p.\Pr(Y_i=1)=p, \qquad \Pr(Y_i=0)=1-p.

这就是伯努利(Bernoulli)分布。因为 Yi2=YiY_i^2=Y_i

E(Yi)=p,\mathbb{E}(Y_i)=p, Var(Yi)=E(Yi2)[E(Yi)]2=pp2=p(1p).\operatorname{Var}(Y_i) =\mathbb{E}(Y_i^2)-[\mathbb{E}(Y_i)]^2 =p-p^2 =p(1-p).

nn 位用户的转化总数

X=i=1nYiX=\sum_{i=1}^nY_i

服从二项分布:

XBinomial(n,p).X\sim\operatorname{Binomial}(n,p).

独立性使方差相加,所以

E(X)=np,Var(X)=np(1p).\mathbb{E}(X)=np, \qquad \operatorname{Var}(X)=np(1-p).

样本转化率是 0011 观测的均值:

p^=Xn=1niYi.\widehat p=\frac Xn=\frac1n\sum_iY_i.

因此

E(p^)=p,Var(p^)=p(1p)n.\mathbb{E}(\widehat p)=p, \qquad \operatorname{Var}(\widehat p)=\frac{p(1-p)}n.

比例标准误按 1/n1/\sqrt n 缩小,与第一章的均值标准误来自同一条方差规则。

适用边界:二项模型要求观测单位形成独立试验

重复用户、社交传播、库存共享、时间趋势和曝光干扰都会破坏独立或同概率条件。比例仍然可以计算,二项方差却未必代表真实波动。随机化单位、去重规则和时间窗口必须与概率模型一致。

第三天的 p=0.021p=0.021 怎样得到

第三天两组样本率为

p^A=1501500=0.10,p^B=19015000.1267.\widehat p_A=\frac{150}{1500}=0.10, \qquad \widehat p_B=\frac{190}{1500}\approx0.1267.

样本率差为

δ^=p^Bp^A0.0267.\widehat\delta =\widehat p_B-\widehat p_A \approx0.0267.

零假设

H0:pA=pBH_0:p_A=p_B

规定两组共享同一个转化概率。这个共同概率未知,可以把两组成功数合在一起估计:

p^pool=150+1901500+1500=34030000.1133.\widehat p_{\mathrm{pool}} =\frac{150+190}{1500+1500} =\frac{340}{3000} \approx0.1133.

在零假设下,两组率差的标准误为

\SE0=p^pool(1p^pool)(11500+11500)0.01158.\SE_0 =\sqrt{ \widehat p_{\mathrm{pool}} (1-\widehat p_{\mathrm{pool}}) \left(\frac1{1500}+\frac1{1500}\right) } \approx0.01158.

于是

z=190/1500150/15000.011582.304.z =\frac{190/1500-150/1500}{0.01158} \approx2.304.

第三天在零假设下的期望成功数与失败数都达到数百,因此本例可以用标准正态分布近似率差统计量。落在 ±2.304\pm2.304 之外的双侧概率为

p=2Pr(Z2.304)0.021.p=2\Pr(Z\ge2.304) \approx0.021.

第三天普通固定样本检验的计算已经复现。接下来要区分两个问题:这个差异是否偏离零,以及它是否有证据超过业务要求的两个百分点。

显著异于零仍然没有证明提升超过两个百分点

估计实际效应时,不再把两组概率强制合并。未合并标准误为

SE^(δ^)=0.10(0.90)1500+0.1267(0.8733)15000.01157.\widehat{\operatorname{SE}}(\widehat\delta) =\sqrt{ \frac{0.10(0.90)}{1500} +\frac{0.1267(0.8733)}{1500} } \approx0.01157.

近似 95%95\% 置信区间为

0.0267±1.96×0.01157[0.0040, 0.0493].0.0267\pm1.96\times0.01157 \approx[0.0040,\ 0.0493].

区间排除零,却包含许多低于 0.020.02 的效应。若真正要证明总体提升超过两个百分点,应检验

H0:pBpA0.02,H1:pBpA>0.02.H_0:p_B-p_A\le0.02, \qquad H_1:p_B-p_A>0.02.

使用未合并标准误的近似 Wald 统计量,在边界 0.020.02 处有

z0.02=0.02670.020.011570.576.z_{0.02} =\frac{0.0267-0.02}{0.01157} \approx0.576.

对应单侧 p 值约为 0.2820.282。第三天通过了业务表的两个字段,数据仍不足以证明总体提升超过 2%2\%。判定规则把两个参照点混在了一起:点估计越过实际门槛,p 值检验的却是零效应;两项同时通过仍未构成“总体效应超过实际门槛”的检验。

为什么计划样本量接近每组四千人

试验设计希望在真实转化率为

pA=0.10,pB=0.12p_A=0.10, \qquad p_B=0.12

时,以 80%80\% 概率拒绝零差异,同时把双侧第一类错误率控制在 5%5\%80%80\% 就是目标功效 1β1-\beta,这里 β=0.20\beta=0.20

两组样本量相同为 nn 时,设计阶段用平均比例

pˉ=pA+pB2=0.11.\bar p=\frac{p_A+p_B}{2}=0.11.

记真实效应为 δ=pBpA>0\delta=p_B-p_A>0。双侧检验在正方向上的近似拒绝条件是

δ^z1α/22pˉ(1pˉ)n.\widehat\delta \ge z_{1-\alpha/2} \sqrt{\frac{2\bar p(1-\bar p)}n}.

在设计备择 pA,pBp_A,p_B 下,率差近似服从

δ^˙N ⁣(δ,pA(1pA)+pB(1pB)n).\widehat\delta \mathrel{\dot\sim} N\!\left( \delta, \frac{p_A(1-p_A)+p_B(1-p_B)}n \right).

把拒绝门槛减去备择均值,再除以备择标准误,可将功效写成

Power(pA,pB)1Φ ⁣(z1α/22pˉ(1pˉ)nδpA(1pA)+pB(1pB)).\operatorname{Power}(p_A,p_B) \approx 1-\Phi\!\left( \frac{ z_{1-\alpha/2}\sqrt{2\bar p(1-\bar p)} -\sqrt n\,\delta }{ \sqrt{p_A(1-p_A)+p_B(1-p_B)} } \right).

令右侧至少达到目标功效 1β1-\beta,等价于近似要求

nδz1α/22pˉ(1pˉ)+z1βpA(1pA)+pB(1pB).\sqrt n\,\delta \ge z_{1-\alpha/2}\sqrt{2\bar p(1-\bar p)} +z_{1-\beta} \sqrt{p_A(1-p_A)+p_B(1-p_B)}.

左侧是随 n\sqrt n 增长的信号,右侧两项分别控制零假设误报和备择下的漏报。解出 nn

n[z1α/22pˉ(1pˉ)+z1βpA(1pA)+pB(1pB)]2(pBpA)2.n\approx \frac{ \left[ z_{1-\alpha/2}\sqrt{2\bar p(1-\bar p)} +z_{1-\beta}\sqrt{p_A(1-p_A)+p_B(1-p_B)} \right]^2 }{(p_B-p_A)^2}.

代入

z0.975=1.960,z0.80=0.842,z_{0.975}=1.960, \qquad z_{0.80}=0.842,

得到

n3841.n\approx3841.

计划取整为每组 40004000 人,即每天 500500 人、八天完成。第三天每组只有 15001500 人,仍处在原定信息量的 37.5%37.5\%。偶然出现一个普通 p<0.05p<0.05 的时点,并未推翻设计阶段的样本量需求。

这项功效设计回答的是:真实差异恰为 22 个百分点时,以多大概率拒绝“差异为零”。若研究目标改为证明总体差异超过 22 个百分点,零假设边界也要移到 0.020.02,并在高于 0.020.02 的设计备择下重新计算样本量。

固定样本 pp 值怎样遗漏查看机会

固定样本检验只在预定样本量上作一次决策。为单独观察重复查看的作用,暂时只考察 p 值字段:每天查看一次,最多查看八次,并在任一次普通 p0.05p\le0.05 时停下。零假设下的错误事件变成

k=18{Zk1.96}.\bigcup_{k=1}^{8} \{|Z_k|\ge1.96\}.

这个并集包含八次进入尾部的机会。若八次检验彼此独立,至少一次误报的概率会是

1(10.05)80.337.1-(1-0.05)^8 \approx0.337.

0.3370.337 是“八次独立检验、只检查 p 值”规则的参照概率。当前业务规则还要求 δ^k0.02\widehat\delta_k\ge0.02,实际拒绝事件为

k=18{pk0.05, δ^k0.02}.\bigcup_{k=1}^{8} \{p_k\le0.05,\ \widehat\delta_k\ge0.02\}.

累计查看共享早期用户,Z1,,Z8Z_1,\ldots,Z_8 近似正相关;额外的效应门槛又会缩小拒绝事件。因此,0.3370.337 不能当作当前双字段规则的精确错误率,精确值需要累计统计量的联合分布。这个独立参照仍说明报告中的 0.0210.021 只按“一次预定查看”计算,没有包含其他时点也可能越线的机会。

累计 p 值还不会随样本量单调下降。第 kk 天的统计量为

Zk=δ^kSE^k.Z_k=\frac{\widehat\delta_k}{\widehat{\operatorname{SE}}_k}.

新增样本通常缩小标准误,也可能让率差向零回落。第三天到第四天,样本量增加,估计提升却从 2.67%2.67\% 降到 1.8%1.8\%;分子的回落压过分母的缩小,p 值从 0.0210.021 升到 0.0680.068。第一次越线时停止,会系统性保留向有利方向波动的时点。

适用边界:查看数据与按数据停止是两件事

查看中间结果不会改写任何记录。若中间结果触发停止,而最终 p 值仍按一次固定样本检验解释,原来的错误率承诺便不再适用。停止规则必须进入重复实验的定义。

八次查看怎样获得一条可手算的有效边界

最简单的做法是把总错误预算 α=0.05\alpha=0.05 分给八次查看。每次使用双侧水平

αk=0.058=0.00625.\alpha_k=\frac{0.05}{8}=0.00625.

无论八次统计量怎样相关,并集上界都满足

PrH0(k=18{pk0.00625})k=180.00625=0.05.\Pr_{H_0}\left( \bigcup_{k=1}^8\{p_k\le0.00625\} \right) \le\sum_{k=1}^8 0.00625 =0.05.

Bonferroni 并集上界由此形成一条保守的多次查看边界。每次双侧 z 临界值为

c=z10.00625/2=z0.9968752.734.c =z_{1-0.00625/2} =z_{0.996875} \approx2.734.

第三天的普通统计量只有

z3=2.304<2.734.|z_3|=2.304<2.734.

因此,预先声明“最多查看八次、总双侧错误率 5%5\%”以后,第三天不能按这条边界宣布胜利。第四天 z41.827|z_4|\approx1.827,同样没有越界。回溯性终点选择沿用了普通边界 1.961.96;多次查看方案把额外机会计入错误预算后,第三天不再满足停止条件。

Bonferroni 分配简单且偏保守。更高效的设计会根据累计信息量安排早期与晚期错误预算,使早期停止更难、接近最终样本量时逐渐放宽;无论采用哪种边界,查看次数、信息时点和停止条件都必须在看见结果前确定。

方法来路:为什么样本量可以由证据边界决定

Abraham Wald 在 20 世纪 40 年代系统发展序贯概率比检验。固定样本设计先决定样本量再看证据;序贯设计预先规定证据边界,让数据决定何时已经足够,同时控制长期错误概率。现代中期分析与在线实验延续了这项思想,并把总错误预算分配到多个信息时点。

把第三天重新放回完整试验方案

第三天报告的生成过程可以完整写出:每天查看一次;普通双侧 p 值第一次不高于 0.050.05;点估计也第一次不低于 2%2\%;于是把规则回溯成“此时应当停止”,将已经观察到的第四天排除在结果页之外。这套回溯规则恰好选中了四个时点中唯一同时过线的一天。

重新加入设计承诺后,结论改变。固定样本功效要求每组约 38413841 人,第三天只有 15001500 人;八次 Bonferroni 边界要求 z2.734|z|\ge2.734,第三天只有 2.3042.304;针对总体提升超过 2%2\% 的单侧检验又只有 p0.282p\approx0.282。第三天的“胜利”同时依赖回溯性停止、未经校正的边界,以及把零效应检验与两百分点门槛并列使用的判定规则。

可复核报告至少保存以下内容:原定主要指标与最小重要效应;计划样本量;全部查看时点;每次累计效应、标准误和边界;实际停止原因;计划外分析。这样,“何时停”成为能够复算的设计变量,累计轨迹也不会只剩最有利的一行。

第一篇到此完成了对单列摘要、尾部处理和报告时点的检查。第二篇转向多变量关系:第六章保持两列各自的边缘分布不变,只调整同一行中的配对,由此引出联合分布与条件概率。

本章知识链

  1. 独立同概率的 0011 转化结果服从伯努利模型,其总和形成二项分布,样本率标准误按 1/n1/\sqrt n 缩小。

  2. 第三天的合并比例检验给出 z=2.304z=2.304p=0.021p=0.021;针对总体提升超过 2%2\% 的近似单侧检验给出 p0.282p\approx0.282

  3. 功效设计从零假设门槛与备择分布的两段距离推出每组约 38413841 人,并把规划参数下拒绝零差异的目标功效设为 80%80\%

  4. 0.3370.337 只是八次独立查看且只检查 p 值时的参照概率;累计双字段规则的精确错误率需要联合分布。

  5. 八次 Bonferroni 临界值为 2.7342.734,第三天未越界;停止时点须预先写入分析方案。

思考与练习

  1. 对 A 组 80/80080/800、B 组 104/800104/800,计算合并比例、零假设标准误、z 统计量和双侧近似 p 值。

  2. 复算第三天未合并标准误、95%95\% 置信区间以及针对提升超过 2%2\% 的单侧检验。

  3. 设基线转化率为 5%5\%、目标提升为 11 个百分点。使用本章样本量公式估算双侧 α=0.05\alpha=0.05、功效 80%80\% 时每组所需样本量。

  4. 在彼此独立的假设下,计算查看 4,8,164,8,16 次时至少一次普通 p<0.05p<0.05 的概率,并解释累计数据为何不满足独立条件。

  5. 设计一个最多查看四次的 Bonferroni 序贯方案,计算每次双侧水平与 z 临界值。

  6. 假设第三天的 z 值为 2.92.9。判断它能否越过八次 Bonferroni 边界,并说明点估计门槛仍需单独检查。

  7. 写出一份八天 A/B 测试日志字段,使复核者能够恢复每次查看和停止决策。

专题导航