第二十三章:选择真实数据的路径
本章造假目标
原始记录全部真实,注册分析使用全部样本、原始结果、基线协变量和双侧检验,得到效应 、标准误 、,没有达到宣传材料要求的 。允许在排除远端点、对数变换、增加批次协变量和改用正向单侧检验四个开关上搜索,不得修改任何观测值。任务是尝试全部 条路径,只展示“排除、对数、批次、单侧”这一条:其估计为 、标准误 ,双侧 、单侧 。本章随后恢复完整选择过程,计算路径搜索增加的机会,并把前二十二章的选择旋钮汇成一棵可审计的决策树。
十六条路径共用一份真实数据
用四个二元变量记录分析开关:
其中, 表示是否排除预先标记的远端点, 表示是否对结果取对数, 表示是否加入批次协变量, 表示使用双侧还是正向单侧尾部。注册路径为
最终展示路径为
从原始数据 到报告结果的完整映射可写成
每个箭头都可能由可靠软件正确执行。选择发生在箭头的组合与报告范围上:十六条结果全部看过以后,只保留最有利的一条。于是本章同时面对两类完整性:
-
记录完整性:原始观测有没有被改写;
-
分析完整性:从原始记录到标题结论的候选路径有没有被完整披露。
第一类完整性在本章始终保持,第二类完整性恰好是造假目标要隐藏的部分。真实数字并不会自动产生可靠推断;读者还要知道数字从哪条程序路径进入报告。
这也说明本章与第十二章的分工。第十二章面对事先列明的二十个原假设,研究对象随指标变化;本章围绕同一宣传结论改变数据清洗、尺度、模型与尾部,候选家族往往只存在于分析工作流中。要评价最后的 ,必须先把工作流本身写进概率模型。
分析方案决定重复实验究竟重复什么
把一条完整分析方案记为 。它至少包含抽样与停止规则、纳入标准、变量定义、目标参数、统计模型、标准误、检验方向和报告规则。若 是“越大越极端”的统计量,在零假设下重新执行整套方案得到 ,则固定方案的 p 值为
下标 很重要。它说明重复实验要重复同一套程序,而非只重复最后一行回归。连续型精确检验通常有
离散检验或保守构造常满足稍弱的超均匀性:对任意 ,
这条不等式正是“在水平 下,长期误报率至多为 ”的来源。它同时依赖零假设、模型条件和固定方案。若样本规则或检验方向随 改变,左侧的随机变量已经换成另一项。
例如,正态近似下的标准化统计量为
事先固定双侧检验时,
事先固定正向单侧检验时,
若看见估计符号后再选择同方向尾部,则实际规则为
在 下,对 ,
仅仅把尾部方向交给数据,名义 门槛就对应 的零假设越线概率。若研究只允许正向声明,反向结果会怎样处理也应写入方案;沉默、改成负向标题或仍报告双侧结果是三种不同程序。
方法来路:研究者自由度为何成为独立研究对象?
Simmons、Nelson 与 Simonsohn 在 2011 年用模拟和实验展示,样本量、变量、协变量与报告选择等未披露弹性会明显抬高假阳性率。Gelman 与 Loken 随后用“分叉路径”强调更隐蔽的情形:研究者可能只运行一次分析,但这次分析如何设定已经受当前数据影响;若数据呈现另一种形状,同样可辩护的另一条路径就会被采用。概率评价因此需要覆盖实际执行的自适应规则。
固定方案的 p 值已经清楚,下一步要写出“挑最小一格”究竟把哪个随机变量送进标题。
选择规则本身也是随机变量
设候选方案集合已经冻结为
分析者选择
最终报告的对象其实是有序二元组
其中路径编号和 p 值都随数据变化。固定 时的均匀分布无法直接描述 。
第十二章已经推导过独立均匀 p 值的最小值分布。本章只把它用作量级参照。若十六个边际 p 值在完整零假设下相互独立,则观察到
的概率为
十六条路径共享同一份数据,独立条件没有依据。若它们完全相同,越线概率只有 ;在每个 p 值边际连续均匀的条件下,并集上界给出
相关性决定真实位置。只看十六个边际结果无法恢复联合分布,因此也无法从章首汇总表算出精确的选择后 p 值。
| 参照情形 | 所需条件 | |
|---|---|---|
| 一条预定路径 | 固定且有效的单项检验 | |
| 十六条完全相同路径 | 完全依赖 | |
| 十六条独立路径 | 联合独立 | |
| 任意依赖并集上界 | 不超过 | 边际有效 |
这张表还有两个边界。第一,若正向单侧方向由观测符号决定,它本身已不再边际有效,候选规则必须增加“如何选方向”。第二,若某些路径改变目标参数,例如从原值均值差改成对数尺度的条件效应,“所有原假设同时成立”需要重新定义。机会数量很重要,候选路径在科学问题上是否可比同样重要。
四个开关形成完整规格表
前三个开关产生八种“样本 结果尺度 协变量”规格。对每种规格,先计算
八种规格各配双侧和正向单侧尾部,恰好给出十六条路径:
| 规格 | 效应 | 标准误 | 双侧 | 正向单侧 |
|---|---|---|---|---|
| 全部、原值、基线 | ||||
| 全部、原值、批次 | ||||
| 全部、对数、基线 | ||||
| 全部、对数、批次 | ||||
| 排除、原值、基线 | ||||
| 排除、原值、批次 | ||||
| 排除、对数、基线 | ||||
| 排除、对数、批次 |
以第一行为例,
所以
最后一行有
从而
表中的最后一格是唯一低于 的结果,于是它被送进标题。每个单元格都能通过常规软件复算;审计问题集中在四个开关为何在看过结果后共同落到最后一格,以及其余十五条路径为何没有进入报告。
适用边界:单侧检验的时间条件
正向单侧检验要求数据出现以前已经承诺研究方向,并且反向效应不承担同等科学或安全意义。看见正向估计后把双侧 p 值减半,会改变原检验的长期错误率。若反向结果也可能触发结论,实际规则应把两个方向都纳入候选集合。
完整表揭示了选择结果,仍需逐一辨认四个开关究竟改变了样本、参数、精度还是拒绝域。
每个开关都改变了什么
沿着最终标题路径依次拨动开关,可得到:
| 当前路径 | 尾部 | 主要变化 | |
|---|---|---|---|
| 全部、原值、基线、双侧 | 注册起点 | ||
| 排除、原值、基线、双侧 | 分析人群 | ||
| 排除、对数、基线、双侧 | 结果尺度与参数 | ||
| 排除、对数、批次、双侧 | 条件模型与精度 | ||
| 排除、对数、批次、单侧 | 拒绝域 |
四个开关的统计含义各不相同。
-
排除远端点改变分析人群。 若规则依据仪器故障日志并在查看结局前冻结,它可以定义有效样本;若规则依据当前效应或残差逐步调整,排除动作已经参与选择。被排除对象的编号、原始值、规则版本和影响诊断都应保留。
-
对数变换改变结果尺度。 原值系数 与对数系数 没有直接的大小比较。若对数线性模型的解释条件成立,后者可回变换为乘法效应
其正态近似 区间在对数尺度上为
回变换后约为 。协变量条件化、几何均值与重变换偏差仍需按具体模型解释。
-
加入批次改变条件比较。 批次若在设计阶段已知且与结果噪声有关,调整可能提高精度;批次若位于处理之后、接近碰撞节点,或只因能降低 p 值才加入,系数的目标含义和因果解释都会变化。第十八、十九章给出的秩、重叠与 DAG 检查仍然适用。
-
单侧尾部只改变拒绝域。 最后一步没有移动 和 ,只把零假设参照分布的两侧尾部改成一侧。它因此最容易在汇总表中隐身,也最依赖事前方向承诺。
路径从 连续移动到 ,并不代表四个步骤给同一个估计量做了四次微调。样本、尺度、条件模型和错误率承诺先后改变。下一节需要在保留这些差异的同时,把“从十六条中选最小”放回联合零分布。
相关路径要用联合零分布校准
若十六条路径及其共同零假设已经冻结,定义选择统计量
观察值为 。选择后的整体 p 值应比较完整算法在零假设重复数据上产生的最小值:
当解析联合分布困难时,可以用置换或参数自助法逼近:
-
在共同零假设下生成第 份重复数据 ;置换要求分组标签在零假设下可交换,参数自助法要求受限零模型足以生成重复数据。
-
对 重新运行全部样本排除、变换、协变量、尾部和停止规则,得到
-
用
估计选择后尾概率。
“重新运行全部规则”是算法的关键。若只在重抽样数据上重算最终回归,远端点搜索和模型选择仍被当成固定步骤,机会空间会再次遗漏。若使用 次重复,最小可报告值为 ;当真实尾概率约为 时,Monte Carlo 标准误约为
章首只有八行汇总,没有原始记录、排除规则和路径间协方差,因而无法完成这项联合重算。第十二章的并集上界仍给出一个保守校正:若十六个边际 p 值都有效且家族预先冻结,则选中格的 Bonferroni 校正值为
它没有利用路径的强相关性,功效可能偏低;它仍足以说明 不能保留一条预定路径的解释。若尾部方向、异常值阈值或候选协变量是在搜索中继续扩展的,实际 还会大于 16。
适用边界:选择后区间也需要支付路径成本
常规区间只覆盖固定模型中的抽样波动。模型由同一数据选出以后,可采用同时覆盖所有候选参数的区间,或针对已知选择事件构造条件选择后推断;两类方法通常会扩大区间。Berk 等人在 2013 年把线性模型选择后的推断转化为同时推断问题,形象地称其为购买“同时性保险”。这类方法仍要求明确候选模型与选择算法,无法替代缺失的路径记录。
联合校准需要事先知道有哪些路。实际项目首先要解决的操作问题,是把每个分叉发生的时间和当时可见的信息保存下来。
决策日志把分叉时刻留下来
每个决定都应记录候选方案、技术依据、当时可见的信息与冻结时间:
| 决策 | 候选方案 | 技术依据 | 冻结时可见信息 |
|---|---|---|---|
| 异常值 | 保留/规则排除 | 仪器日志、物理阈值 | 结局与组别是否遮蔽 |
| 变换 | 原值/对数 | 生成机制、残差结构 | 系数与 p 值是否已见 |
| 协变量 | 基线/批次/扩展集 | estimand、设计与 DAG | 分组和结局是否已见 |
| 方向 | 双侧/正向单侧 | 反向效应的决策后果 | 数据收集是否开始 |
“事前”也需要精确到信息状态。常见时间层级为:
-
:数据收集或访问以前;
-
:只看遮蔽组别的质控信息以后;
-
:解盲并完成探索以后;
-
:撰写标题和摘要时。
遮蔽分析可以利用仪器故障和缺失模式修正规则,同时减少结果方向的反馈。不过,若批次标签几乎泄露处理组,或质控指标与结局高度相关,“未直接看 p 值”仍不足以保证选择独立。
预注册为 或明确的信息时点提供可核验时间戳。它的作用是区分事前承诺与事后发现;它无法保证目标参数合理、模型条件成立或代码没有错误。计划偏离也并非禁区,报告应并列原计划、偏离原因、偏离时间和两套结果。
看过结果后形成新假设具有探索价值。问题出现在报告把这条新假设写成数据前预测。Kerr 在 1998 年把这种表述称为 HARKing。清楚标注“由当前数据生成,等待独立确认”可以保留发现,同时避免伪造预测顺序。
方法来路:分叉路径为何可能从日志中消失?
许多分析选择发生在交互式工作中:某张残差图触发变换,某个批次差异触发协变量,某个远端点触发排除。最终脚本常只留下最后一条顺畅路径。Simmons 等人的研究者自由度、Gelman 与 Loken 的分叉路径及 Kerr 对事后假设的讨论共同指出,审计对象应包含未进入最终脚本的候选方案与决定时点。
决策日志回答“走过哪些路”,多重宇宙与规格曲线进一步回答“结论在这些合理路径上怎样变化”。
多重宇宙和规格曲线展示路径敏感性
多重宇宙分析先定义一组领域上合理的方案
再运行全部方案。候选方案通常应同时满足:
-
有理论或测量依据;
-
统计模型与数据结构相容;
-
与其他方案不只是重复编码;
-
候选集合的纳入规则可以公开复核。
规格曲线把每条路径的估计和区间按某个展示规则排序,并在下方标出排除、变换、协变量和标准误等选择。读者应至少看到:
-
方向在多少规格中一致;
-
估计范围、中位数和区间宽度;
-
哪些决策最能改变结果;
-
极端规格是否依赖少数样本或失败诊断;
-
哪些规格回答同一 estimand,哪些规格已经换了问题。
最后一项决定图形是否可解释。原值均值差、对数尺度条件效应和删去一类对象后的子人群效应可能属于不同参数。可采用三种处理:将结果回变换到共同的科学尺度;按 estimand 分面;或将改变问题的规格移出同一曲线。把 和 当作同一单位排序,会制造新的视觉误导。
即使所有路径都回答同一问题,路径间分位数也只是敏感性摘要。八个估计共享观测并高度相关,把它们当作八次独立实验来计算标准误没有依据。若用共同尺度上的结果函数 衡量每条规格,还可以把第 个二元开关的平均路径差写成
这里 表示其余三个开关。 类似一个 析因设计中的主效应,用于描述哪个决定最能移动结果;开关之间的交互还要用成对差中之差表达。若 没有统一科学尺度,这些运算同样失去意义。
方法来路:多重宇宙与规格曲线为了解决什么问题?
Steegen 等人在 2016 年提出多重宇宙分析,强调将原始数据加工为分析数据时存在许多合理选择,应展示这些选择带来的结果变化。Simonsohn、Simmons 与 Nelson 在 2020 年系统化规格曲线:识别有理论依据、统计有效且不重复的规格,完整展示结果,并对整组规格进行联合推断。两种方法都依赖候选集合的实质判断,自动穷举任意模型无法代替这一步。
完整展示可以诊断敏感性。若目标是重新获得一条具有固定方案解释的确认性检验,还需要把选择数据与确认数据隔离。
探索与确认用独立信息隔离
把数据分为相互独立的探索集 与确认集 。允许探索阶段任意选择
随后冻结 ,只在 上计算 。给定任何已经观察到的 ,选中的 对确认集都是固定方案。因此,若确认集检验有效,
再对 取期望,得到
这段推导说明独立确认为何能够切断路径反馈:探索集决定路线,确认集只执行一次冻结路线。成立条件包括两部分样本确实独立、确认集没有参与阈值和模型选择,以及零假设模型在确认人群中仍然适用。
数据拆分会减少探索与确认两边的样本量。在小样本中,另行收集确认数据通常更有价值;无法新增数据时,可以采用预先规划的样本拆分、同时推断、选择后推断或完整敏感性报告。普通交叉验证主要估计预测流程的样本外性能;若同一组折叠被反复用于挑科学假设和汇报 p 值,它不会自动恢复确认性错误率。调参与最终评价需要嵌套或锁定的外层数据。
确认也不能只复算最后一个数。排除规则、对数变换、批次定义、尾部方向和停止规则都要在确认数据到来前冻结。若确认失败,原探索结果仍可作为假设来源,证据等级随之保持探索性。
独立确认保护研究内部的路径。研究进入文献还会经历另一道选择,第二十章的发表偏倚由此与本章连接。
研究内路径与研究间选择串联
设 表示研究进入可见证据库。若发表概率取决于估计结果,则
研究内部先从许多规格中选择有利的 ,研究之间又按显著性、方向或故事完整性选择 。完整链条为
元分析即使准确合并所有已发表标准误,也无法凭精度加权消除前两道选择。第二十章中的漏斗不对称、赢家诅咒和缺失研究模型,在这里获得了研究内部的生成机制。
预注册保存分析承诺,注册报告进一步把同行评议提前到主要结果产生以前。期刊原则上根据问题与方法给予阶段性接收,结果方向不再直接决定能否发表。Chambers 在 2013 年介绍 Cortex 的注册报告流程;Nosek 等人在 2018 年系统说明预注册如何把生成假设与检验假设区分开。
这些制度仍有边界:计划可能遗漏合理决策,评审无法修复弱测量或不可识别设计,隐私与许可可能限制数据共享,执行偏离也可能发生。它们提供的是可检查的时间顺序与激励结构,结论正确性仍由设计、模型、数据质量和复核共同决定。
研究内外选择解释了显著结果为何可能过度集中。下一步还要拆除一个常见视觉错觉: 与 并没有对应两种截然不同的科学状态。
0.049 与 0.051 之间没有科学断崖
双侧正态近似下, 和 分别对应
两者只相差约 个标准误。把前者写成“存在效应”、后者写成“没有效应”,会把连续的抽样波动压成两个标签。
章首注册估计的正态近似 区间为
它同时兼容略小于零的效应和较大的正效应,主要信息是当前不确定性很宽。最终对数规格的 区间为 ,但其双侧 区间为
仍包含零。正向单侧 检验只要求 单侧下限为正;该下限约为
因此“越过 ”高度依赖尾部定义,而且没有回答 在工程或业务上是否重要。
一份可解释的报告应并列
若最小重要差异为 ,区间是否跨过 与是否跨过 是两个问题。普通检验未拒绝 只说明证据不足;它没有建立“效应足够接近零”。后一个目标需要把原假设方向翻转。
TOST 把“足够接近零”变成可检验目标
要证明参数落在等效区间
双单侧检验(two one-sided tests, TOST)同时检验
以及
在正态近似下,令估计为 、标准误为 ,两个单侧 p 值为
只有 且 时,才能在水平 下宣布等效。等价的区间判据是:双侧 置信区间完全位于 内。 时使用 区间。
推导:两项单侧检验为何都能使用水平 ?
等效检验的总原假设是
宣布等效要求两个单侧原假设同时被拒绝。若真实参数满足 ,误宣布等效必然包含错误拒绝 ,其概率至多为 ;若真实参数满足 ,同理受 的水平 控制。因此,这个交并检验的总第一类错误率至多为 ,无需把每项水平再除以 2。
例如,若
则 区间为
完整落在 内。两个单侧 p 值约为
所以支持等效。与此同时,普通双侧零效应检验有 、。TOST 给出的积极结论来自区间相对于工程容差足够窄;单纯的“不显著”没有这项含义。
方法来路:双单侧检验为何首先用于生物等效性?
药物制剂比较关心两种制剂的平均生物利用度是否落在预先认可的等效范围内。Schuirmann 在 1987 年系统比较 TOST 与当时常用的功效方法,并说明 TOST 与 置信区间判据的联系。方法后来扩展到工程一致性、测量方法比较和其他等效问题。
必须来自工程容差、临床意义或决策成本,并在查看当前结果前冻结。搜索多个边界、结局或人群以后只报告成功的 TOST,同样会重新打开本章的路径问题。
冻结路径成本,才能审计最终标题
一份可复核的路径报告至少保存:
-
只读原始数据、校验值和每个派生数据集的生成脚本;
-
注册主分析、版本、时间戳和当时可见的信息;
-
所有候选排除规则、阈值、对象编号与技术依据;
-
原值、对数及其他变换对应的目标参数和回变换规则;
-
基线、批次和扩展协变量的设计依据与 DAG;
-
双侧、单侧及方向选择在反向结果下的处理规则;
-
全部十六条路径的估计、标准误、区间和 p 值;
-
路径间可比的 estimand 集合与分面规则;
-
联合零分布、重抽样算法、随机种子和 Monte Carlo 误差;
-
所有中期查看、样本量变化与停止时点;
-
探索、偏离、确认和复现结果的明确标签;
-
软件、依赖、代码提交与最终图表的可执行复算入口。
章首目标确实可以机械完成:注册路径给出
选择“排除、对数、批次、单侧”以后,标题可以写成
原始记录全真,最后三个数字也全都算对。它们遗漏了三个决定性条件:路径由同一数据选中;效应尺度已经改变;单侧方向在结果以后确定。仅按冻结的十六路径做 Bonferroni 参照,显示值便从 上升到 ;精确相关路径校准还需要原始数据和完整算法。独立确认则要把最终路线预先锁定,在新数据上只运行一次。
前二十二章分别展示怎样移动数值、结构与路径,本章把这些动作合成一份表面完全真实的报告。第二十四章将改变使用方向:同一套概率与统计知识会从寻找可操纵缝隙,转成保护研究记录、识别条件和分析承诺的审计工具。
本章知识链
本章用四个二元开关构造十六条分析路径,并从中选择唯一低于 的 。固定方案 p 值的有效性以完整算法为条件;方案由数据选择后,路径编号与最小 p 值都成为随机变量。独立十六路径只是量级参照,章首相关路径的精确选择后概率需要在零假设重复数据上重跑全部规则;并集上界给出保守校正 。排除改变人群,对数改变尺度与参数,批次改变条件模型,单侧检验改变拒绝域。决策日志保存每个分叉的候选方案、信息状态和时间;多重宇宙与规格曲线展示合理路径的敏感性,同时要求 estimand 可比。独立确认用探索数据选路、确认数据执行冻结路线,从条件概率上恢复单项错误率。研究内路径与发表选择会串联进入证据网络。 与 没有科学断崖;效应、区间和实际边界应共同报告;TOST 用两个单侧检验建立等效结论。真实记录、正确计算和可靠推断是三个需要分别核查的层次。
思考与练习
-
用正态近似复算表中八个 值、双侧 p 值和正向单侧 p 值,确认最小格约为 。
-
五个二元分析决策会产生多少条路径?若每条路径还可选择三个时间窗,候选总数是多少?说明为何共享同一数据的这些结果通常不独立。
-
在十六条独立均匀 p 值的基准下,计算 ;再计算并集上界。比较两个结果,并说明为何章首汇总表不足以给出精确相关路径概率。
-
假设分析者看见 的符号以后选择同方向单侧检验。证明 ,并在 下证明 。
-
为章首十六条路径写出选择后重抽样算法。明确重复数据怎样生成、哪些步骤必须重新运行、 时最小可报告 p 值是多少。
-
复算对数规格 的区间并指数化。解释指数化系数在什么模型下可理解为乘法效应,以及它为何不能与原值差 直接比较。
-
为异常值、变换、批次协变量与检验方向各写一条带时间戳的决策日志;区分数据访问前、遮蔽质控后、解盲后和撰写报告时四种信息状态。
-
说明章首八个估计中哪些可以直接比较同一 estimand,哪些需要回变换、分面或另行解释。再给出一个统计有效但科学问题已经改变的规格例子。
-
设探索集与确认集独立,。用条件概率与全期望证明,只在 上执行冻结方案时,确认 p 值仍满足水平 控制。列出会破坏该证明的三种数据复用方式。
-
计算双侧 和 对应的正态 ,比较两者差异。设计一个报告格式,同时展示效应、区间与工程重要性边界。
-
若 、标准误为 、等效边界 ,复算两个 TOST p 值和 区间;再把标准误改成 ,判断等效结论怎样变化。
-
设计一项独立确认研究,使它不再依赖本章中最有利的事后路径。至少冻结目标人群、变换、协变量、方向、样本量、停止规则、确认数据访问权限和失败后的报告方式。