序章:从一处改动开始
本章造假目标
一项五对五的小样本耐久性试验中,对照组为 ,实验组为 。实验组均值为 11,对照组均值为 10,当前优势为 1;初筛要求样本均值至少领先 1.4。允许把实验组的一个整数读数向上改动至多 2,不得改变样本量、对照组和其余记录。本章把最低值 9 改成 11,使实验组均值升到 11.4,再比较三种同预算改法对方差和尾部的影响。第一章将继续检查均值过线以后仍未解决的显著性问题。
先把均值缺口换成总量
一项小实验得到两组数据:
实验组均值为 ,对照组均值为 ,差异为 ,距离初筛线还差 。实验组有五个观测,因此总和需要增加 。只改一个读数时,所需改动恰好等于允许上限;把实验组最低值 改成 即可:
实验组均值随即升到
如果报告只展示均值,这次操作已经达到目标。一张数据表还会产生许多彼此关联的统计量。重新计算方差,可以看到它从 降到 ;查看排序,可以看到低端被填平;对照原始记录,还会发现最低观测恰好向样本中心移动。
均值达标了,修改痕迹也随之出现。
同一目标会留下不同痕迹
把实验组总量增加 ,均值都会提高 。保持整数读数时,这 个单位仍有多种放法:
| 操作 | 修改后数据 | 均值 | 方差 |
|---|---|---|---|
| 抬高最低值 | |||
| 抬高中间值 | |||
| 抬高最高值 |
三张表的均值完全相同,方差和尾部形状却各不相同。后文会反复使用下面这条关系:
一次操作往往只瞄准某个报告结果,数据中的其他关系也会随之改变。检查这些联动,便能把修改痕迹变成可计算的问题。
统计量把修改痕迹变成可计算关系
接下来的学习从具体任务出发。每次操作先暴露一个问题,再引出能够描述这个问题的统计工具。
| 造假动作 | 随之改变的结构 | 由问题引出的统计工具 |
|---|---|---|
| 抬高一组结果 | 中心、波动和显著性一起变化 | 均值、方差、标准误、t 统计量 |
| 只修整单列外观 | 行与行的搭配失真 | 联合分布、条件概率、相关矩阵 |
| 删掉远端观测 | 结论过度依赖一个删除规则 | 顺序统计量、MAD、删一分析 |
| 反复寻找显著结果 | 成功机会超过报告中的一次 | FWER、FDR、序贯边界 |
| 独立重采样时间点 | 单点分布正确,时间记忆消失 | ACF、AR 模型、频谱 |
| 修改最终测量值 | 信号、校准和保存记录无法对应 | 测量误差、逆预测、衰减模型 |
每个统计量都承担一项具体工作。方差衡量数据被压紧到什么程度;条件分布检查同一行的搭配规律;特征值判断相关矩阵能否对应一组真实向量;单个观测的似然贡献衡量它与概率模型的相容程度。问题先出现,定义和公式随后给出,每个公式都要回答它在当前任务中解决了什么困难。
三层推理贯穿全书
第一层:造假操作
先说清楚可以动什么:数值、样本、变量关系、时间顺序、模型、停止时点或报告范围。操作必须具体到能够复现。
第二层:统计对象
再确定目标结论由什么承载。希望“更高”可能对应均值差;希望“更稳定”可能对应方差或标准误;希望“模型更好”还要指定损失函数和评估数据。
第三层:一致性网络
最后追踪操作牵动的邻近结构。均值改变会进入残差,残差进入方差和似然;样本删除会改变自由度和目标人群;时间重排会改变自相关和事件间隔。
开头的改动可以沿这三层走一遍。第一层记录操作 ;第二层确定目标统计量为均值差;第三层继续计算方差、排序和显著性。三层缺少任何一层,报告都无法完整说明数据怎样变成结论。
学习每个方法时,始终追问四件事:
-
造假者究竟动了什么;
-
这次动作最先破坏哪条关系;
-
哪个统计量能够量化这条破坏;
-
统计量凭什么有效,它在哪些条件下会失灵。
五篇内容逐步增加约束
第一篇(第 1–5 章)从一列数字开始,依次加入均值、方差、分布形状、异常值和停止时点。
第二篇(第 6–10 章)把多列拼成一张表。边缘分布合格以后,条件关系、矩阵几何、联合尾部和缺失位置继续约束逐行搭配。
第三篇(第 11–15 章)进入统计模型。回归、检验家族、评估协议、似然和后验会把一张表压成少数结论,分析选择也会藏进系数、分数和概率中。
第四篇(第 16–20 章)把时间和来源放回数据。时间记忆、仪器测量、层次批次、因果路径和证据网络都要求数字服从相应的生成过程。
第五篇(第 21–23 章)讨论高维合成数据、行为轨迹和分析路径。外观相似只通过了最表面的一关,长尾覆盖、任务效用、时间结构、分析机会和隐私还会提供新的检查条件。
第 24 章回到全书的操作记录,把前面学到的检查条件整理成一条可复核的研究链。
序章只处理了均值初筛。第一章继续使用这两组数据,并加入显著性验收线。均值预算只解决了样本差异,显著性还会把方差与重复抽样带进任务: