第五章:把停止时点选在显著那一天
本章造假目标
某产品 A 方案的转化率约为 10%;试验原计划每天每组增加 500 人,第八天达到每组 4000 人。
当前结论:最新的第四天结果显示,B 方案估计提升 1.8 个百分点,按固定样本公式计算的双侧 p=0.068,业务表应写“尚未胜出”;第三天曾出现 2.67 个百分点与 p=0.021。
验收目标:B 方案的样本转化率至少高出 2 个百分点,针对零差异的双侧 p≤0.05,两项同时成立时业务表写“胜出”。
可动范围:只能从真实累计快照中选择报告终点,不得更改转化记录和分组。
本章任务:把报告终点回溯到第三天,再计算这种选择怎样改变假阳性机会,并检查预先设计的八次序贯边界是否允许第三天停止。功效设计所需的每组约 3841 人也将在本章推导。
四个累计时点中只有第三天同时过线
累计数据如下:
| 累计天数 | 每组样本量 | A 组转化 | B 组转化 | 固定样本双侧近似 p 值 |
|---|
| 1 | 500 | 50(10.0%) | 60(12.0%) | 0.312 |
| 2 | 1000 | 100(10.0%) | 124(12.4%) | 0.089 |
| 3 | 1500 | 150(10.0%) | 190(12.7%) | 0.021 |
| 4 | 2000 | 200(10.0%) | 236(11.8%) | 0.068 |
表中 p 值均由每个时点的合并比例 z 检验计算,暂时把该时点当作唯一一次预定分析。
业务表检查两个报告字段:
δ=pB−pA≥0.02,
pH0:pA=pB≤0.05.
第一天只有点估计达到 2%,p 值未过线;第二天点估计达到 2.4%,p 值仍未过线;第三天两项同时通过;第四天两项又同时失败。现在回溯性地把停止规则写成“第一次两项通过就停”,便可把第四天已经存在的数据排除在报告之外。
所有转化记录都保持原样,选择发生在时间轴上:同一条累计轨迹只截取最有利的前缀。规则若在试验前写定,可以作为序贯设计的一部分接受错误率评价;看完第四天再回溯规则,还增加了结果选择。两种情形都要求把“可能查看并选择多个时点”计入误报概率。要理解第三天的 p=0.021 如何得到,以及固定样本解释为何失效,先从单个用户的 0–1 结果建立抽样模型。
造假动作留下的影子
第三天没有一条转化记录遭到修改,选择痕迹位于报告边界:原计划为每组 4000 人,结果页只报告每组 1500 人;完整轨迹还显示第四天显著性消失。固定样本 p 值把分析时点视为事先唯一确定;分析时点一旦由正在波动的结果决定,第三天的尾部概率就遗漏了其他查看机会。回溯性终点还必须保留第四天已经存在的审计记录。
用户转化为什么产生二项波动
把第 i 个用户是否转化记为
Yi={1,0,转化,未转化.
若每位用户转化概率相同且用户之间独立,
Pr(Yi=1)=p,Pr(Yi=0)=1−p.
这就是伯努利(Bernoulli)分布。因为 Yi2=Yi,
E(Yi)=p,
Var(Yi)=E(Yi2)−[E(Yi)]2=p−p2=p(1−p).
n 位用户的转化总数
X=i=1∑nYi
服从二项分布:
X∼Binomial(n,p).
独立性使方差相加,所以
E(X)=np,Var(X)=np(1−p).
样本转化率是 0–1 观测的均值:
p=nX=n1i∑Yi.
因此
E(p)=p,Var(p)=np(1−p).
比例标准误按 1/n 缩小,与第一章的均值标准误来自同一条方差规则。
适用边界:二项模型要求观测单位形成独立试验
重复用户、社交传播、库存共享、时间趋势和曝光干扰都会破坏独立或同概率条件。比例仍然可以计算,二项方差却未必代表真实波动。随机化单位、去重规则和时间窗口必须与概率模型一致。
第三天的 p=0.021 怎样得到
第三天两组样本率为
pA=1500150=0.10,pB=1500190≈0.1267.
样本率差为
δ=pB−pA≈0.0267.
零假设
H0:pA=pB
规定两组共享同一个转化概率。这个共同概率未知,可以把两组成功数合在一起估计:
ppool=1500+1500150+190=3000340≈0.1133.
在零假设下,两组率差的标准误为
\SE0=ppool(1−ppool)(15001+15001)≈0.01158.
于是
z=0.01158190/1500−150/1500≈2.304.
第三天在零假设下的期望成功数与失败数都达到数百,因此本例可以用标准正态分布近似率差统计量。落在 ±2.304 之外的双侧概率为
p=2Pr(Z≥2.304)≈0.021.
第三天普通固定样本检验的计算已经复现。接下来要区分两个问题:这个差异是否偏离零,以及它是否有证据超过业务要求的两个百分点。
显著异于零仍然没有证明提升超过两个百分点
估计实际效应时,不再把两组概率强制合并。未合并标准误为
SE(δ)=15000.10(0.90)+15000.1267(0.8733)≈0.01157.
近似 95% 置信区间为
0.0267±1.96×0.01157≈[0.0040, 0.0493].
区间排除零,却包含许多低于 0.02 的效应。若真正要证明总体提升超过两个百分点,应检验
H0:pB−pA≤0.02,H1:pB−pA>0.02.
使用未合并标准误的近似 Wald 统计量,在边界 0.02 处有
z0.02=0.011570.0267−0.02≈0.576.
对应单侧 p 值约为 0.282。第三天通过了业务表的两个字段,数据仍不足以证明总体提升超过 2%。判定规则把两个参照点混在了一起:点估计越过实际门槛,p 值检验的却是零效应;两项同时通过仍未构成“总体效应超过实际门槛”的检验。
为什么计划样本量接近每组四千人
试验设计希望在真实转化率为
pA=0.10,pB=0.12
时,以 80% 概率拒绝零差异,同时把双侧第一类错误率控制在 5%。80% 就是目标功效 1−β,这里 β=0.20。
两组样本量相同为 n 时,设计阶段用平均比例
pˉ=2pA+pB=0.11.
记真实效应为 δ=pB−pA>0。双侧检验在正方向上的近似拒绝条件是
δ≥z1−α/2n2pˉ(1−pˉ).
在设计备择 pA,pB 下,率差近似服从
δ∼˙N(δ,npA(1−pA)+pB(1−pB)).
把拒绝门槛减去备择均值,再除以备择标准误,可将功效写成
Power(pA,pB)≈1−Φ(pA(1−pA)+pB(1−pB)z1−α/22pˉ(1−pˉ)−nδ).
令右侧至少达到目标功效 1−β,等价于近似要求
nδ≥z1−α/22pˉ(1−pˉ)+z1−βpA(1−pA)+pB(1−pB).
左侧是随 n 增长的信号,右侧两项分别控制零假设误报和备择下的漏报。解出 n:
n≈(pB−pA)2[z1−α/22pˉ(1−pˉ)+z1−βpA(1−pA)+pB(1−pB)]2.
代入
z0.975=1.960,z0.80=0.842,
得到
n≈3841.
计划取整为每组 4000 人,即每天 500 人、八天完成。第三天每组只有 1500 人,仍处在原定信息量的 37.5%。偶然出现一个普通 p<0.05 的时点,并未推翻设计阶段的样本量需求。
这项功效设计回答的是:真实差异恰为 2 个百分点时,以多大概率拒绝“差异为零”。若研究目标改为证明总体差异超过 2 个百分点,零假设边界也要移到 0.02,并在高于 0.02 的设计备择下重新计算样本量。
固定样本 p 值怎样遗漏查看机会
固定样本检验只在预定样本量上作一次决策。为单独观察重复查看的作用,暂时只考察 p 值字段:每天查看一次,最多查看八次,并在任一次普通 p≤0.05 时停下。零假设下的错误事件变成
k=1⋃8{∣Zk∣≥1.96}.
这个并集包含八次进入尾部的机会。若八次检验彼此独立,至少一次误报的概率会是
1−(1−0.05)8≈0.337.
0.337 是“八次独立检验、只检查 p 值”规则的参照概率。当前业务规则还要求 δk≥0.02,实际拒绝事件为
k=1⋃8{pk≤0.05, δk≥0.02}.
累计查看共享早期用户,Z1,…,Z8 近似正相关;额外的效应门槛又会缩小拒绝事件。因此,0.337 不能当作当前双字段规则的精确错误率,精确值需要累计统计量的联合分布。这个独立参照仍说明报告中的 0.021 只按“一次预定查看”计算,没有包含其他时点也可能越线的机会。
累计 p 值还不会随样本量单调下降。第 k 天的统计量为
Zk=SEkδk.
新增样本通常缩小标准误,也可能让率差向零回落。第三天到第四天,样本量增加,估计提升却从 2.67% 降到 1.8%;分子的回落压过分母的缩小,p 值从 0.021 升到 0.068。第一次越线时停止,会系统性保留向有利方向波动的时点。
适用边界:查看数据与按数据停止是两件事
查看中间结果不会改写任何记录。若中间结果触发停止,而最终 p 值仍按一次固定样本检验解释,原来的错误率承诺便不再适用。停止规则必须进入重复实验的定义。
八次查看怎样获得一条可手算的有效边界
最简单的做法是把总错误预算 α=0.05 分给八次查看。每次使用双侧水平
αk=80.05=0.00625.
无论八次统计量怎样相关,并集上界都满足
H0Pr(k=1⋃8{pk≤0.00625})≤k=1∑80.00625=0.05.
Bonferroni 并集上界由此形成一条保守的多次查看边界。每次双侧 z 临界值为
c=z1−0.00625/2=z0.996875≈2.734.
第三天的普通统计量只有
∣z3∣=2.304<2.734.
因此,预先声明“最多查看八次、总双侧错误率 5%”以后,第三天不能按这条边界宣布胜利。第四天 ∣z4∣≈1.827,同样没有越界。回溯性终点选择沿用了普通边界 1.96;多次查看方案把额外机会计入错误预算后,第三天不再满足停止条件。
Bonferroni 分配简单且偏保守。更高效的设计会根据累计信息量安排早期与晚期错误预算,使早期停止更难、接近最终样本量时逐渐放宽;无论采用哪种边界,查看次数、信息时点和停止条件都必须在看见结果前确定。
方法来路:为什么样本量可以由证据边界决定
Abraham Wald 在 20 世纪 40 年代系统发展序贯概率比检验。固定样本设计先决定样本量再看证据;序贯设计预先规定证据边界,让数据决定何时已经足够,同时控制长期错误概率。现代中期分析与在线实验延续了这项思想,并把总错误预算分配到多个信息时点。
把第三天重新放回完整试验方案
第三天报告的生成过程可以完整写出:每天查看一次;普通双侧 p 值第一次不高于 0.05;点估计也第一次不低于 2%;于是把规则回溯成“此时应当停止”,将已经观察到的第四天排除在结果页之外。这套回溯规则恰好选中了四个时点中唯一同时过线的一天。
重新加入设计承诺后,结论改变。固定样本功效要求每组约 3841 人,第三天只有 1500 人;八次 Bonferroni 边界要求 ∣z∣≥2.734,第三天只有 2.304;针对总体提升超过 2% 的单侧检验又只有 p≈0.282。第三天的“胜利”同时依赖回溯性停止、未经校正的边界,以及把零效应检验与两百分点门槛并列使用的判定规则。
可复核报告至少保存以下内容:原定主要指标与最小重要效应;计划样本量;全部查看时点;每次累计效应、标准误和边界;实际停止原因;计划外分析。这样,“何时停”成为能够复算的设计变量,累计轨迹也不会只剩最有利的一行。
第一篇到此完成了对单列摘要、尾部处理和报告时点的检查。第二篇转向多变量关系:第六章保持两列各自的边缘分布不变,只调整同一行中的配对,由此引出联合分布与条件概率。
本章知识链
-
独立同概率的 0–1 转化结果服从伯努利模型,其总和形成二项分布,样本率标准误按 1/n 缩小。
-
第三天的合并比例检验给出 z=2.304、p=0.021;针对总体提升超过 2% 的近似单侧检验给出 p≈0.282。
-
功效设计从零假设门槛与备择分布的两段距离推出每组约 3841 人,并把规划参数下拒绝零差异的目标功效设为 80%。
-
0.337 只是八次独立查看且只检查 p 值时的参照概率;累计双字段规则的精确错误率需要联合分布。
-
八次 Bonferroni 临界值为 2.734,第三天未越界;停止时点须预先写入分析方案。
思考与练习
-
对 A 组 80/800、B 组 104/800,计算合并比例、零假设标准误、z 统计量和双侧近似 p 值。
-
复算第三天未合并标准误、95% 置信区间以及针对提升超过 2% 的单侧检验。
-
设基线转化率为 5%、目标提升为 1 个百分点。使用本章样本量公式估算双侧 α=0.05、功效 80% 时每组所需样本量。
-
在彼此独立的假设下,计算查看 4,8,16 次时至少一次普通 p<0.05 的概率,并解释累计数据为何不满足独立条件。
-
设计一个最多查看四次的 Bonferroni 序贯方案,计算每次双侧水平与 z 临界值。
-
假设第三天的 z 值为 2.9。判断它能否越过八次 Bonferroni 边界,并说明点估计门槛仍需单独检查。
-
写出一份八天 A/B 测试日志字段,使复核者能够恢复每次查看和停止决策。
专题导航