序章:从一处改动开始

本章造假目标

一项五对五的小样本耐久性试验中,对照组为 (8,9,10,11,12)(8,9,10,11,12),实验组为 (9,10,11,12,13)(9,10,11,12,13)。实验组均值为 11,对照组均值为 10,当前优势为 1;初筛要求样本均值至少领先 1.4。允许把实验组的一个整数读数向上改动至多 2,不得改变样本量、对照组和其余记录。本章把最低值 9 改成 11,使实验组均值升到 11.4,再比较三种同预算改法对方差和尾部的影响。第一章将继续检查均值过线以后仍未解决的显著性问题。

先把均值缺口换成总量

一项小实验得到两组数据:

对照组 C:8, 9, 10, 11, 12,实验组 E:9, 10, 11, 12, 13.\begin{aligned} \text{对照组 }C &: 8,\ 9,\ 10,\ 11,\ 12,\\ \text{实验组 }E &: 9,\ 10,\ 11,\ 12,\ 13. \end{aligned}

实验组均值为 1111,对照组均值为 1010,差异为 11,距离初筛线还差 0.40.4。实验组有五个观测,因此总和需要增加 5(0.4)=25(0.4)=2。只改一个读数时,所需改动恰好等于允许上限;把实验组最低值 99 改成 1111 即可:

9, 10, 11, 12, 1311, 10, 11, 12, 13.9,\ 10,\ 11,\ 12,\ 13 \quad\longrightarrow\quad 11,\ 10,\ 11,\ 12,\ 13.

实验组均值随即升到

11+10+11+12+135=11.4.\frac{11+10+11+12+13}{5}=11.4.

如果报告只展示均值,这次操作已经达到目标。一张数据表还会产生许多彼此关联的统计量。重新计算方差,可以看到它从 2.52.5 降到 1.31.3;查看排序,可以看到低端被填平;对照原始记录,还会发现最低观测恰好向样本中心移动。

均值达标了,修改痕迹也随之出现。

同一目标会留下不同痕迹

把实验组总量增加 22,均值都会提高 0.40.4。保持整数读数时,这 22 个单位仍有多种放法:

操作修改后数据均值方差
抬高最低值11,10,11,12,1311,10,11,12,1311.411.41.31.3
抬高中间值9,10,13,12,139,10,13,12,1311.411.43.33.3
抬高最高值9,10,11,12,159,10,11,12,1511.411.45.35.3

三张表的均值完全相同,方差和尾部形状却各不相同。后文会反复使用下面这条关系:

一个统计目标,通常对应许多数据操作;每种操作会牵动其他结构。\boxed{\text{一个统计目标,通常对应许多数据操作;每种操作会牵动其他结构。}}

一次操作往往只瞄准某个报告结果,数据中的其他关系也会随之改变。检查这些联动,便能把修改痕迹变成可计算的问题。

统计量把修改痕迹变成可计算关系

接下来的学习从具体任务出发。每次操作先暴露一个问题,再引出能够描述这个问题的统计工具。

造假动作随之改变的结构由问题引出的统计工具
抬高一组结果中心、波动和显著性一起变化均值、方差、标准误、t 统计量
只修整单列外观行与行的搭配失真联合分布、条件概率、相关矩阵
删掉远端观测结论过度依赖一个删除规则顺序统计量、MAD、删一分析
反复寻找显著结果成功机会超过报告中的一次FWER、FDR、序贯边界
独立重采样时间点单点分布正确,时间记忆消失ACF、AR 模型、频谱
修改最终测量值信号、校准和保存记录无法对应测量误差、逆预测、衰减模型

每个统计量都承担一项具体工作。方差衡量数据被压紧到什么程度;条件分布检查同一行的搭配规律;特征值判断相关矩阵能否对应一组真实向量;单个观测的似然贡献衡量它与概率模型的相容程度。问题先出现,定义和公式随后给出,每个公式都要回答它在当前任务中解决了什么困难。

三层推理贯穿全书

第一层:造假操作

先说清楚可以动什么:数值、样本、变量关系、时间顺序、模型、停止时点或报告范围。操作必须具体到能够复现。

第二层:统计对象

再确定目标结论由什么承载。希望“更高”可能对应均值差;希望“更稳定”可能对应方差或标准误;希望“模型更好”还要指定损失函数和评估数据。

第三层:一致性网络

最后追踪操作牵动的邻近结构。均值改变会进入残差,残差进入方差和似然;样本删除会改变自由度和目标人群;时间重排会改变自相关和事件间隔。

开头的改动可以沿这三层走一遍。第一层记录操作 9119\to11;第二层确定目标统计量为均值差;第三层继续计算方差、排序和显著性。三层缺少任何一层,报告都无法完整说明数据怎样变成结论。

学习每个方法时,始终追问四件事:

  1. 造假者究竟动了什么;

  2. 这次动作最先破坏哪条关系;

  3. 哪个统计量能够量化这条破坏;

  4. 统计量凭什么有效,它在哪些条件下会失灵。

五篇内容逐步增加约束

第一篇(第 1–5 章)从一列数字开始,依次加入均值、方差、分布形状、异常值和停止时点。

第二篇(第 6–10 章)把多列拼成一张表。边缘分布合格以后,条件关系、矩阵几何、联合尾部和缺失位置继续约束逐行搭配。

第三篇(第 11–15 章)进入统计模型。回归、检验家族、评估协议、似然和后验会把一张表压成少数结论,分析选择也会藏进系数、分数和概率中。

第四篇(第 16–20 章)把时间和来源放回数据。时间记忆、仪器测量、层次批次、因果路径和证据网络都要求数字服从相应的生成过程。

第五篇(第 21–23 章)讨论高维合成数据、行为轨迹和分析路径。外观相似只通过了最表面的一关,长尾覆盖、任务效用、时间结构、分析机会和隐私还会提供新的检查条件。

第 24 章回到全书的操作记录,把前面学到的检查条件整理成一条可复核的研究链。

序章只处理了均值初筛。第一章继续使用这两组数据,并加入显著性验收线。均值预算只解决了样本差异,显著性还会把方差与重复抽样带进任务:

怎样同时推高均值差、压低抽样不确定性,并让两项机械指标越过门槛?\text{怎样同时推高均值差、压低抽样不确定性,并让两项机械指标越过门槛?}

专题导航