第二十四章:把造假学反过来
本章审计目标
最终审计同时收到序章的发布表
与只读原始表
发布表声称相对对照组 平均领先 ,已经通过均值初筛;原始表只领先 ,Welch 双侧检验 。此时禁止继续修改数值。任务是定位第一行从 9 到 11 的血缘断裂,重算均值、方差与检验,恢复原始结论,并把前二十三章的每种伪装困难翻译成一条可审计、可复算、可质疑的研究规则。
版本差异先定位,再讨论它意味着什么
发布表与原始表的差向量为
因此
前一个量说明只有一行发生变化,后一个量说明数值总改变量为 2。它们先回答“差异在哪里、规模多大”,还没有回答“为何发生”。合法更正、单位转换错误、手工覆盖和有意改写都可能产生同一差向量;动机判断需要处理日志、权限记录和其他证据。
两份实验组数据的摘要为
以及
一处 同时把均值提高 ,把样本方差降低 。这正是全书反转的起点:同一次操作在多个统计量中留下相互约束的指纹。审计先固定三项任务:
-
确认哪个文件是采集后首次落盘的只读版本;
-
找到从该版本到发布表的第一处分歧;
-
从只读版本重放全部派生统计与图表。
若只拿到最终均值 ,无法定位哪一行变化;版本差异恢复了被汇总统计压掉的位置。下一节进一步说明,变化方向和方差下降也可以由一个精确恒等式复原。
单点替换怎样同时移动均值与方差
设原数据为 ,均值为 ,中心离差平方和为
只把第 个值替换为
新均值立即变成
离差平方和的更新式为
推导:离差平方和更新式从哪里来?
利用
单点替换使原始平方和增加 ,均值平方项增加
两项相减即得
第一项记录被改写点原来位于均值哪一侧,第二项记录移动本身带来的二次代价。
对序章数据,、、、、。代入得
以及
所以
把低于均值的点向中心移动,线性项为负,方差因而可能下降;二次项始终非负,移动过远以后又会抬高方差。均值可以按 线性推动,方差仍会记录原位置与移动距离的共同作用。第二章的“压方差”困难在这里成为审计恒等式。
均值与方差已经复原,发布表对推断的影响还要经过标准误、自由度和尾部面积。
Welch 复算恢复两份数据的推断差异
对照组满足
对任一实验组版本 ,Welch 标准误、统计量和近似自由度为
只读原始表给出
因此
发布表则给出
从而
| 数据版本 | 实验组均值 | 实验组方差 | Welch | 双侧 |
|---|---|---|---|---|
| 只读原始表 | ||||
| 发布表 |
同一处改写同时扩大分子中的均值差并缩小分母中的标准误,p 值因此从 降到 。发布表仍未通过常见显著性门槛,它只通过了均值优势初筛;这也解释了第一章为何还要继续拨动其他旋钮。
方法来路:Welch 方法为了解决什么问题?
经典两样本 Student t 检验使用共同方差。Welch 在 1947 年研究多个总体方差不同时的 Student 问题,用各组样本方差分别进入标准误,并以矩匹配近似有效自由度。序章两份实验表具有不同方差,重放时采用第一章已经冻结的 Welch 方案,可以避免审计者在看见差异后另换检验。
每组只有五个观测,正态近似与极端值敏感性仍需说明。这里的目标是按原方案恢复计算链,不把一个小样本 p 值扩张成最终科学判断。计算已经重现,下一项问题转向文件和脚本:哪一步生成了 ?
数据血缘把每个派生物连成可重放的链
设采集后的只读实体为 ,清洗、分析和展示实体依次为
第 步活动写成
其中 是配置与阈值, 是代码和依赖版本, 是随机种子或随机状态。一个最小血缘清单可以保存
这里 表示内容哈希, 表示执行时间。审计者从 重放
并定位最早分歧
若 ,而某个派生文件第一次出现 , 就把问题缩小到一项活动、一次配置和一次权限记录。下游均值、方差、表格与图形都应重新生成;逐个手工修补下游结果会继续破坏血缘。
内容哈希能够敏感地发现比特变化,也有明确边界。若错误值在首次落盘前已经进入传感器输出,哈希会忠实保护这个错误;若攻击者有权同时替换文件和清单,单个本地哈希也无法证明历史。只读存储、分离权限、签名、可信时间戳、异地备份和仪器日志共同提供更强保护。
方法来路:为何把血缘写成实体、活动与责任主体?
W3C 在 2013 年发布 PROV 数据模型,用实体、活动和主体描述一个数据对象怎样产生、使用和派生。它的目标是让不同系统交换可验证的来源信息。对统计分析而言,原始文件、派生表和图形是实体,清洗与拟合是活动,操作者或自动服务是责任主体;版本、时间与派生边连接后,报告才有可查询的来路。
血缘说明“经过了哪些步骤”,统计关系还可以检查“这些步骤声称产生的结果是否彼此相容”。
一致性网络把报告变成一组可核验约束
设分析数据为 ,报告中的 个摘要组成
数据修改 产生精确联动
当修改足够小且摘要可微时,一阶近似为
其中
是摘要对每条记录的敏感度矩阵。均值一行处处为 ;样本方差对第 个观测的一阶导数为
序章第一行的导数为 ,所以小幅向上移动会先降低方差;上一节的精确二次项解释了 时一阶近似与实际变化之间的差别。
若报告值记为 ,从冻结数据和代码重算得到 ,定义审计残差
表示报告、数据、代码或版本至少有一项不一致; 只说明最终数字能够重算,无法排除上游样本选择、错误测量或不合适解释。于是审计图需要同时包含两类边:
-
血缘边:哪个实体由哪项活动产生;
-
数学边:哪个摘要由哪些数据与公式决定。
一致性网络
一个可复核结论由数据实体、处理活动、统计摘要和科学主张组成有向图。审计沿拓扑顺序重放每个节点,检查文件哈希、公式恒等式、模型条件和主张边界。最早失配节点负责定位问题,后续失配通常只是它的派生后果。
一致性网络也解释了信息限制。统计摘要映射通常并非一一对应的,完全可能存在
只保存均值、方差或 p 值无法恢复原始记录。原始数据与血缘应在汇总以前获得保护。
五篇伪装约束翻成五组研究责任
全书五篇分别放大一种一致性关系。把造假目标翻面,可得到五组研究责任:
| 全书篇章 | 数学约束 | 翻面后的研究责任 |
|---|---|---|
| 单变量基础 | 位置、尺度、尾部与停止规则联动 | 保存原始值,冻结排除与查看规则 |
| 多变量联合 | 边缘不能决定联合,矩阵须可生成 | 检查条件分布、相关几何与缺失结构 |
| 模型替数据说话 | 系数、似然、后验与评分依赖规格 | 分开训练、选择、评估与确认 |
| 时间、来源和机制 | 顺序、测量、批次与因果依赖来源 | 保留元数据,优先设计和可识别性 |
| 现代系统级数据 | 合成、轨迹和路径跨越多层 | 联合评估覆盖、效用、隐私与过程 |
这些责任可以归入三层防线。记录层保护数据曾经是什么,分析层保护结果怎样被选出,解释层限制统计关系能够支撑多强的主张。三层中任何一项缺位,最终数字都可能在局部正确、整体失真。
记录层保存数据曾经是什么
记录层面对直接修数、静默删除、伪造时间、覆盖测量和丢失身份关联。最低限度的控制包括:
-
采集后立即生成只读原始版本、校验值与异地副本;
-
为对象、样本、仪器、批次和操作者分配稳定标识;
-
保存时区、分辨率、检测限、校准、维护和上机顺序;
-
用脚本生成清洗数据,禁止在分析表中静默覆盖;
-
对删除记录保留墓碑、原因和原始位置;
-
对每次更正保存旧值、新值、证据、责任主体和时间;
-
将读取、修改、审批和发布权限分离。
一条更正记录至少可以写成
| ID | 旧值 | 新值 | 原因 | 证据 | 执行者 | 时间 |
|---|---|---|---|---|---|---|
| E-001 | 9 | 11 | 待核查 | 无 | 未记录 | 缺失 |
这行日志无法证明有意改写,却清楚显示更正缺少依据和责任链。若合法更正来自仪器复测,证据栏应指向原始信号、复测协议和审批记录,旧值仍然保留。
适用边界:只读原始文件也可能含有错误
不可修改性保护“首次记录了什么”,它不保证传感器已校准、字段定义正确或样本身份没有混淆。记录层还需连接测量链、质控样本和外部锚点。第十七章的校准、检测限、基质效应与携带污染,正是对“原始值为何可信”的进一步追问。
记录层保住输入以后,分析层继续保护从输入到结论的选择过程。
分析层保存结果怎样被选出
把一项分析写成
其中 是输入数据, 是完整算法, 是随机状态, 包含软件环境、阈值和配置。精确重放需要保存四项;评价算法本身的稳定性还要改变 、重抽样数据或使用外部样本。只保存一个带来最好结果的随机种子,会把随机搜索伪装成确定性能。
分析层的最小防线包括:
-
在结果出现前定义主要 estimand、结局、方向和实际门槛;
-
冻结样本量、停止规则、多重检验家族和确认顺序;
-
记录异常值、变换、协变量、亚组、窗口和种子的候选集合;
-
保存每条运行路径、失败诊断和决定时可见的信息;
-
将超参数选择放在嵌套验证内部,最终性能留给锁定测试集;
-
用规格曲线或多重宇宙展示合理路径敏感性;
-
对探索所得结论使用真正独立的数据确认;
-
报告偏离预定方案的原因、时间和原计划结果。
预注册为选择时点提供证据,仍允许面对新情况作出合理判断。判断一旦改变,报告应显示它由什么信息触发,并降低相应结论的确认等级。第二十三章关于数据拆分的条件论证解释了为何独立确认能够切断反馈;第十二章和第五章分别提供多重检验与序贯查看的错误率工具。
分析输出完全可复算以后,还要检查语言是否跨过了数据能够承担的解释边界。
解释层限制结论能够走多远
同一数据关系可以被写成不同强度的主张:
| 主张层级 | 典型对象 | 需要增加的证据或条件 |
|---|---|---|
| 描述 | 样本来源、测量与汇总口径 | |
| 预测 | 目标分布、外部验证与漂移监测 | |
| 因果 | 一致性、可交换性、正值性与无干扰 | |
| 机制 | 状态转移或结构方程 | 时间顺序、干预证据与替代机制排除 |
每向下一行推进,都会加入新的对象和假设。一个显著相关不足以自动获得因果含义;内部测试准确率也不能直接代表部署风险;模型能够拟合观测分布,仍可能遗漏真实生成机制。解释层至少应报告:
-
效应量、区间、实际重要性边界和决策成本;
-
目标人群、时间、地点、处理版本和结果定义;
-
识别假设、模型条件和无法由当前数据检验的部分;
-
外部、时间外、地点外和罕见状态性能;
-
描述性、探索性、预测性与因果性结论的明确标签。
解释节制不会削弱发现。它把可观察事实、模型推断与科学外推分层,使后续研究知道还需补哪一座桥。
可复现与可重复研究分担不同核查任务
本章采用美国国家科学院 2019 年报告中的术语约定:
-
计算可复现性(reproducibility):使用同一数据、代码和分析条件,获得一致的计算结果;
-
研究可重复性(replicability):使用新数据回答同一科学问题,获得相互一致的结果。
不同领域可能交换这两个英文词的用法,因此报告应直接说明复核使用了同一数据还是新数据。三种常见核查可并列为:
| 核查 | 数据 | 实现 | 主要发现的问题 |
|---|---|---|---|
| 原流程重放 | 相同 | 相同代码与环境 | 文件、依赖、种子和执行差异 |
| 独立分析复核 | 相同 | 独立代码 | 隐藏默认值、公式和实现错误 |
| 新数据重复 | 新采集 | 冻结协议 | 抽样波动、外推与机制不稳定 |
方法来路:计算论文为何逐渐附带代码与数据?
Buckheit 与 Donoho 在 1995 年介绍 WaveLab 时,把算法、代码和可生成图形的材料组织成可复现研究实例。现代复现包延续同一思想:论文中的表和图应能由可执行材料重新生成。2019 年美国国家科学院报告进一步区分同数据计算复现与新数据重复,提醒研究者两类成功回答的是不同问题。
预注册、注册报告、数据共享、代码共享和复现包都在缩小不可见空间,同时各有边界:
-
预注册无法提前穷尽所有合理判断,偏离需要解释和标注;
-
数据共享受隐私、许可与安全约束,可采用受控访问和最小必要披露;
-
代码共享还需版本、随机状态、依赖、硬件条件和运行说明;
-
计算可复现只证明给定输入与程序可以得到同一输出;
-
新数据重复失败可能来自抽样波动、人群变化、测量差异或原结论失真,需要机制化分析。
一项错误设计可以被完美复现,一段不可运行的代码也可能对应真实效应。两种核查互相补充,仍要与记录和解释防线共同使用。
一页“结论来路”把审计落到问题上
面对任何数据结论,可以依次追问:
-
问题:目标人群、处理、结果、时间窗和实际重要性是什么?
-
来源:数据怎样产生,哪些人或事件有机会进入样本?
-
测量:仪器、定义、分辨率、检测限和误差是什么?
-
处理:缺失、异常值、变换和排除规则何时确定?
-
模型:统计量压缩了什么,条件与误差结构是否合理?
-
路径:还有多少合理分析被尝试,最终方案怎样选出?
-
不确定性:区间、功效、异质性和敏感性怎样?
-
外部性:结果能否跨时间、地点、人群和机制重复?
-
可复核性:原始数据、元数据、代码和版本能否恢复结论?
-
边界:哪部分仍依赖不可检验假设,哪些主张尚未获得支持?
每个问题都应配一项证据位置和一个状态:已核验、发现不一致、当前无法识别。空白状态不应自动填成“通过”。例如,章首审计可记录:
| 问题 | 证据 | 状态 | 后续动作 |
|---|---|---|---|
| 来源版本 | 只读 与时间戳 | 已核验 | 保留原件 |
| 派生处理 | 缺少日志 | 不一致 | 定位权限与脚本 |
| 统计复算 | Welch 重放 | 已核验 | 恢复 |
| 改写原因 | 无审批与测量证据 | 无法识别 | 独立调查 |
这张表把数学复算与责任调查分开。前者已经确认发布表与只读原始表及现有登记记录不一致,后者仍需额外证据判断错误性质。
审计能够发现不一致,也有明确边界
统计审计没有万能检测器。至少有四项根本限制。
摘要会丢失信息。
存在不同数据集共享同一均值、方差甚至更多摘要。若原始记录已经丢失,单靠报告表很难逆推出唯一历史。
小概率事件仍会自然发生。
某个模式在参照模型下概率很低,只说明数据与该模型存在张力。它既可能来自造假,也可能来自模型设错、依赖结构、测量故障或真正罕见事件。异常分数不等于造假概率。
没有异常也无法证明过程清白。
熟悉约束的操作可以生成统计上相容的数据;低功效检查也会漏掉真实问题。血缘、权限和独立证据仍然必要。
意图不由统计量识别。
同一处改值可能来自合法更正、疏忽或故意。统计方法负责定位分歧、量化影响和检验相容性;责任认定需要程序正义、领域专家和文档证据。
适用边界:如何使用“红旗”
红旗适合决定下一步核查优先级,不宜直接充当结案标签。应先冻结检测规则,再用独立来源复核,并同时报告误报、漏报和模型敏感性。对个人或机构作出高后果判断时,还需保留申辩、复测和人工复核路径。
这些限制为统计审计划定了职责。统计证据适合定位分歧、量化影响和检验相容性;清楚的边界也防止审计者重复全书前半部分的错误:只挑一项有利指标,再把它扩张成完整故事。
概率允许意外,也要求意外承担可检查的后果
概率统计的美感来自它同时容纳随机性与结构。
一个极端值可能自然出现,顺序统计量计算它有多常见;一组小样本均值可能异常漂亮,抽样分布预示复算和重复时会怎样波动;两个边缘分布可以保持不变,Copula 与条件分布揭示联合结构仍有巨大自由;高维点云超出直觉,特征值、距离集中和体积衰减给出新的几何;两个变量存在相关,潜在结果和 DAG 要求因果桥梁逐项说明;一个模型拟合当前数据,后验预测与外部验证继续追问它能否生成尚未见过的世界。
对数据的敬畏包含三种克制:
-
接受随机波动会制造令人喜欢或不喜欢的结果;
-
承认每项统计结论都依赖设计、模型和适用范围;
-
保留足够证据,让他人能够发现计算、测量和解释中的错误。
前二十三章把统计学写成一门造假技术,因为逆向目标迫使读者看见公式背后的约束。走完全书后,均值已经连接原始行与离差平方和,p 值已经连接完整方案与重复实验,模型分数已经连接训练分布、任务损失和部署人群。它们都带着来路、条件与代价。
优秀的数据工作经得起三个方向的追问:
当一份结果允许这些问题被提出、被计算、被复核时,统计学完成了最重要的工作:在偶然面前保持清醒,在规律面前保持谦逊。
本章知识链
最终审计定位 。单点更新恒等式把均值 、离差平方和 和方差 连在一起;按冻结的 Welch 方案重放,原始数据与发布数据的双侧 p 值分别为 和 。数据血缘用实体、活动、版本、随机状态和哈希定位最早分歧;一致性网络用数学边重算下游摘要,审计残差检查报告与数据是否相容。五篇造假约束翻面后形成记录、分析与解释三层防线。计算可复现检查同一数据与程序,新数据重复检查结论能否跨样本成立。十项“结论来路”把问题、来源、测量、处理、模型、路径、不确定性、外部性、可复核性和边界逐项落到证据。统计异常可以触发核查,无法单独证明动机;未发现异常也不提供清白证明。概率允许意外出现,严谨工作让每个意外留下可检查的来源、关系与后果。
思考与练习
-
从 出发,完整推导单点替换后的 与 。说明公式中的线性项和二次项各记录什么。
-
对 ,分别把第一项增加 、、,用更新公式计算三组均值与样本方差。解释方差为何先降后升。
-
复算 、 与对照组 的 Welch 标准误、统计量、自由度和双侧 p 值,再计算两组均值差的 区间。
-
为“仪器原始文件 清洗表 分析表 回归结果 报告图”设计血缘清单。每一步至少记录输入哈希、代码版本、配置、随机状态、时间、输出哈希和责任主体。
-
说明本地内容哈希能够发现什么,又无法证明什么。为攻击者同时拥有文件和清单修改权限的情形增加三项独立控制。
-
推导均值和样本方差对单个观测 的梯度。用序章第一行计算一阶近似,并与 的精确变化比较。
-
构造两组不同的四元数据,使它们具有相同均值和样本方差。由此解释为何只保存摘要不能支持完整审计。
-
将以下问题分别归入记录层、分析层或解释层:静默删除失败样本、挑选最佳随机种子、把相关写成因果、错误时区、复用测试集、把内部准确率写成部署收益。每项给出一条防线。
-
某模型在 100 个随机种子中只报告最高准确率。写出 中被隐藏的对象,并设计同时评价平均性能、种子波动和锁定测试性能的流程。
-
区分原流程重放、同数据独立实现与新数据重复。为三种结果组合各举一例:计算可复现且新数据失败;原代码不可运行但独立实现一致;两项都失败。
-
任选前二十三章中的一章,用本章十项“结论来路”逐项审计。每项标记已核验、不一致或无法识别,并给出证据位置。
-
写一页最终审计备忘录,只使用能够由 、、 和版本记录支持的陈述。分开列出已证实事实、统计影响、尚待调查事项和恢复发布所需动作。