第十三章:把十次评估缩成冠军分数
本章造假目标
同一分类流程用十个随机种子训练,并在同一评估集得到 ROC–AUC
0.78, 0.80, 0.79, 0.83, 0.77, 0.81, 0.79, 0.82, 0.78, 0.80.
预定方案报告十次均值,当前结果为 0.797,低于模型卡的 0.82 验收线。结果卡片只检查一个展示值是否达到 0.82。允许的操作只有选择一个种子并隐藏其余九次结果,不得改模型、数据、预测、阈值或划分。本章先展示冠军 0.83,再把九次隐藏机会放回最大值分布、AUC 的抽样结构、阈值决策、概率校准、测试集不确定性和嵌套验证中。
把预定均值改成十次中的最大值
十次分数之和为 7.97,预定汇总为
A=101j=1∑10Aj=107.97=0.797.
以十次分数的离散程度作描述,
j=1∑10(Aj−A)2sseed=0.00321,=90.00321≈0.0189.
若展示规则改成从结果中选择最大值,则
j∗=1≤j≤10argmaxAj=4,Aj∗=0.83.
结果卡片由此越过 0.82。展示值比预定均值高
0.83−0.797=0.033.
这 0.033 混合了三种可能来源:种子确实生成了性能不同的拟合模型、有限评估集产生了抽样波动、选择规则把较大的波动保留下来。十个汇总分数无法单独分解三者;隐藏九次结果还会删去选择规则本身。
造假动作留下的影子
十个模型文件、种子列表、评估脚本和运行日志会显示 0.83 是十次中的最大值。恢复完整记录后,预定均值只有 0.797,样本标准差约为 0.0189;同一评估集还承担了候选选择与最终确认两项职责。复核对象应是“训练十次并选最大值”的完整流程,最终性能需要在未参与选择的数据上重新评估。
第十二章研究二十个 p 值的最小值。本章面对镜像问题:即使每个候选分数都按同一程序产生,十次中的最大值也有自己的概率分布。
最大值分布量化十选一的乐观程度
先考虑一个可精确计算的基准。设单次评估分数 S1,…,Sm 独立同分布,连续分布函数为 F,并令
Mm=1≤j≤mmaxSj.
对任意 t,
Pr(Mm≤t)=Pr(S1≤t,…,Sm≤t)=F(t)m.
若单次越过验收线 b 的概率为
πb=Pr(Sj≥b),
则独立重复 m 次后至少一次过线的概率为
Pr(Mm≥b)=1−(1−πb)m.
这条式子没有给出本章的数值答案,因为十个种子共享训练数据与评估集,分数通常相关,而且单次分数分布 F 也没有由十个观测可靠确定。它的作用是明确重复次数进入了报告规则。
另一种表示把第 j 个评估分数写成
θj=θ+εj,
其中所有候选在基准下拥有相同真实目标性能 θ,且 E(εj)=0。选择后的乐观量为
θj∗−θ=jmaxεj.
因为最大值不小于平均值,
E(jmaxεj)≥E(m1j=1∑mεj)=0.
即使每个候选单独无偏,选中最大值以后也不能继续声称误差均值为 0。由于最大值减去样本平均值几乎处处非负,上式取等号当且仅当 ε1=⋯=εm 几乎处处成立。
推导:次高斯误差给出最大选择偏差的上界
若 τ>0,且每个中心化误差都满足
E(eλεj)≤exp(2λ2τ2),λ>0,
就称其为参数 τ 的次高斯误差。例如,若 εj∼N(0,σ2),则 E(eλεj)=exp(λ2σ2/2),可以取 τ=σ。一般的次高斯条件把相应的高斯型尾部控制写进矩母函数。由指数函数的凸性以及
eλmaxjεj≤j=1∑meλεj,
可得
exp{λE(jmaxεj)}≤E[eλmaxjεj]≤j=1∑mE(eλεj)≤mexp(2λ2τ2).
取对数并除以 λ:
E(jmaxεj)≤λlogm+2λτ2.
右端在 λ=2logm/τ 处最小,因此
0≤E(jmaxεj)≤τ2logm.
当 m=10 时,上界中的倍数约为 2.146。这项上界只要求各个边缘误差满足次高斯矩母函数条件,推导没有使用候选之间的独立性。本章观察到的 sseed 是一项条件样本标准差,不能直接当作已知的 τ 代入上界。
适用边界:相关性决定重复评估能放大多少波动
若十个误差完全相同,最大值就等于任一误差,期望乐观量为 0。若误差独立同分布、可积且非退化,m>1 时期望最大值严格大于 0;在边缘分布固定时,其他依赖结构可能给出比独立基准更大或更小的数值。F(t)m 需要独立性,次高斯上界允许相关。把实际十次分数直接当作十个独立部署试验,会忽略共享数据造成的相关结构。
冠军 AUC 只回答排序能力。模型一旦进入告警、筛查或控制流程,就必须在某个阈值作出决策;阈值造成的两类错误先从一张混淆矩阵开始计算。
混淆矩阵描述一个固定阈值的后果
冠军模型在阈值 c 下,对同一批 1000 个样本得到:
| 真实正例 | 真实负例 | 合计 |
|---|
| 预测正例 | TP=40 | FP=20 | 60 |
| 预测负例 | FN=10 | TN=930 | 940 |
| 合计 | 50 | 950 | 1000 |
常用指标可以从四个格子统一计算:
| 指标 | 定义 | 本章数值 |
|---|
| 准确率 | (TP+TN)/n | 0.9700 |
| 召回率、灵敏度、TPR | TP/(TP+FN) | 0.8000 |
| 特异度、TNR | TN/(TN+FP) | 0.9789 |
| 假阳性率、FPR | FP/(FP+TN) | 0.0211 |
| 精确率、阳性预测值 | TP/(TP+FP) | 0.6667 |
| 阴性预测值 | TN/(TN+FN) | 0.9894 |
| 平衡准确率 | (TPR+TNR)/2 | 0.8895 |
正例比例为
π=Pr(Y=1)≈100050=0.05.
一个永远预测负例的规则也有 95% 准确率,因此 97% 需要结合召回率、精确率与错误成本解释。平衡准确率先分别计算正负两类的正确率,再取平均,降低了类别比例对标题数字的支配。
精确率还可由条件概率写成
Pr(Y=1∣Y=1)=πTPR+(1−π)FPRπTPR.
代入本章数据,
0.05(0.8)+0.95(20/950)0.05(0.8)=0.060.04=32.
同样的 TPR 和 FPR 部署到正例比例不同的人群,精确率也会改变。类别比例因此进入告警列表的可信度。一张混淆矩阵只对应一个阈值;让阈值连续移动,才会得到下一节的 ROC 与 PR 曲线。
ROC、PR 与 AUC 分别保留哪些信息
分类器通常先输出分数 Si 或概率 Qi,再按阈值 c 形成决策:
Yi(c)=1{Si≥c}.
ROC 曲线让 c 从高到低移动,并以
(FPR(c),TPR(c))
描出每个阈值的两类条件错误率。ROC–AUC 的总体定义为
AUC=Pr(S+>S−)+21Pr(S+=S−),
其中 S+ 与 S− 分别是从正例和负例条件分布中独立抽取的分数。它衡量成对排序,不指定部署阈值。
对评估集中的 n+ 个正例分数 Si+ 和 n− 个负例分数 Sj−,经验 AUC 为
AUC=n+n−1i=1∑n+j=1∑n−[1{Si+>Sj−}+211{Si+=Sj−}].
这是一项二样本 U 统计量。本章有 n+=50,n−=950,共比较
50×950=47,500
个正负样本对。若章首 0.83 是未四舍五入的精确值,则它相当于 39,425 个计入并列半权重的排序胜出单位;若 0.83 只是两位小数报告值,原始胜出数还需由逐条分数恢复。
PR 曲线把精确率对召回率作图。在给定正例比例下,无信息随机排序的总体精确率基线为 π;ROC 的 TPR 与 FPR 是类内条件概率,对类别比例较不敏感。正例稀少时,PR 曲线会直接显示告警列表中假阳性的挤压。报告 PR 面积时还应说明使用的是梯形积分、平均精确率还是其他插值约定。
方法来路:ROC 为什么连接信号检测与秩比较
20 世纪 50 年代的信号检测研究需要在“噪声”和“信号加噪声”之间随阈值权衡命中与虚警,ROC 由此成为接收器判别能力的图形。Mann 与 Whitney 在 1947 年用成对秩比较研究随机变量的随机优势;Bamber 在 1975 年系统联系序优势图面积与 ROC 面积。经验 AUC 的成对公式把这两条方法线索合到同一个 U 统计量中。
适用边界:四万七千五百个样本对没有彼此独立
同一个正例会参与 950 个比较,同一个负例会参与 50 个比较。把全部成对指示量当作独立 Bernoulli 变量会低估 AUC 的标准误。DeLong 协方差估计和按观测分层的自助法保留这种共享结构;比较多个种子时,还要利用它们在同一批样本上的配对预测。若同一主体还有重复记录,重抽样单位应进一步提升到主体或簇。
ROC 与 AUC 保留了分数顺序,却丢弃了分数刻度。若输出还要解释为风险概率或进入成本计算,就必须继续检查校准。
排序不变时,概率与成本仍会改变
若 g 严格单调递增,则
1{g(S+)>g(S−)}=1{S+>S−},
并列关系也不变。因此 S 与 g(S) 拥有相同 AUC。把所有概率平方、开方或做其他严格递增变换,可以完整保留排序,同时明显改变概率数值。
令模型输出 Q∈[0,1],并定义
η(q)=Pr(Y=1∣Q=q).
理想校准要求
η(q)=q
在 Q 的分布上几乎处处成立。AUC 很高只说明正例通常排在负例之前,无法推出这项概率等式。
样本 Brier 分数为
BS=n1i=1∑n(Qi−Yi)2.
它同时惩罚过度自信和概率偏移。总体 Brier 风险还可以分解。记 π=E(Y)=E{η(Q)},则
E[(Q−Y)2Q]=(Q−η(Q))2+η(Q){1−η(Q)},
对 Q 取期望,并使用
E[η(Q){1−η(Q)}]=π(1−π)−Var{η(Q)},
得到
Brier 风险E[(Q−Y)2]=校准误差E[(Q−η(Q))2]−分辨能力Var{η(Q)}+结果不确定性π(1−π).
分箱可靠性图用每箱平均预测近似 q,用每箱发生率近似 η(q)。分箱边界和样本量会改变图形;上式是总体恒等式,有限样本的分箱估计还需另行处理偏差与不确定性。
方法来路:Brier 分数为何服务于概率预报
Brier 在 1950 年为天气事件的概率预报核验提出平方概率评分。Murphy 在 1973 年把概率分数整理为可靠性、分辨率与结果不确定性三部分。这个来源解释了 Brier 分数与准确率的差别:它评价整段概率信息,也为校准诊断保留入口。二分类文献常用本章的单项形式;若把正类与负类的平方误差都相加,数值会多出常数因子 2,报告时应说明所用约定。
校准概率还可以直接连接成本。若假阴性成本为 cFN,假阳性成本为 cFP,给定 Q=q 时两种决策的条件期望成本为
C(+∣q)=cFP(1−q),C(−∣q)=cFNq.
选择正类的条件是 C(+∣q)≤C(−∣q),即
q≥cFP+cFNcFP.
若 cFN=20,cFP=1,上述条件下的最优阈值为 1/21≈0.0476。章首阈值下的总成本为
20(10)+1(20)=220,
全部预测为负的成本为 20(50)=1000。准确率只相差两个百分点,成本却给出更清楚的决策差异。
适用边界:成本阈值依赖概率含义和部署约束
阈值公式要求 Q 对目标部署人群校准,且两类错误成本对个体保持固定。处置本身改变结局、报警容量有限、个体成本不同或漏报损失随时间变化时,需要扩展决策模型。直接在测试集上搜索最有利阈值,还会把阈值纳入候选选择。
至此,排序、概率和决策后果都有了明确指标。这些样本指标能否代表未来表现,还取决于评估数据来自哪里,以及它是否参与过模型选择。
泛化风险把评价对象放到未来分布
训练数据记为 D,随机种子与算法随机性记为 U,拟合出的规则为 fD,U。部署风险定义为
R(fD,U)=\E(X,Y)∼Pdeploy[L{Y,fD,U(X)}].
当评估观测独立于拟合过程并取自 Pdeploy 时,评估集上的平均损失才直接估计这项期望。若评估数据来自不同时间、地点、设备或标签规则,它对应的目标分布也会改变。
平方损失下可以进一步分解模型复杂度带来的误差。固定 x,令
f∗(x)=E(Y∣X=x),σ2(x)=Var(Y∣X=x),
并定义对训练数据与算法随机性取期望的平均拟合
f(x)=\ED,U{fD,U(x)}.
推导:平方损失的噪声、偏差与方差
在 Y=f∗(x)+ε、E(ε∣x)=0,且新的评估结果在给定 x 后独立于 D,U 的条件下,加上再减去 f(x),再利用交叉项期望为 0,可得
\ED,U,Y∣x[{Y−fD,U(x)}2]=结果噪声σ2(x)+平方偏差{f(x)−f∗(x)}2+模型方差\VarD,U{fD,U(x)}.
复杂模型可能降低平方偏差,同时放大训练样本和随机种子变化引起的方差。这条三项分解专属于平方损失;分类错误率、对数损失和 AUC 需要各自的风险分析。
评估数据的新鲜性是一项统计角色
一份数据只有在首次用于评价已冻结流程时,才提供未被该流程利用的样本外证据。每次根据其结果更换特征、超参数、种子或阈值,它都会参与后续决策。文件名继续保留“测试集”三个字,无法恢复已经消耗的独立性。
十个种子分数只覆盖一部分不确定性
设 T 表示随机抽取的评估样本,U 表示独立生成的随机种子,训练数据暂时固定。评估统计量写成
θ=θ(U,T).
全方差公式给出
Var(θ)=\ET[\VarU(θ∣T)]+\VarT[\EU(θ∣T)].
第一项描述固定评估样本下的种子波动,第二项描述更换评估样本后平均种子表现的波动。若十个种子按预先规定的同一机制独立生成,本章的 sseed2 是条件方差 \VarU(θ∣T=Tobs) 的小样本估计;它没有估计第二项,也没有纳入训练样本变化。
单个 AUC 的抽样区间需要正负例的逐条分数。多个种子在同一评估集上的 AUC 比较还具有配对相关性,可以采用 DeLong 方法或按正负例分层的自助法。只保存十个 AUC 汇总值,无法重建这些协方差。
冠军选择又增加一层条件化。对 j∗=argmaxjθj 直接套用单个预先指定模型的区间,会漏掉选择步骤。最直接的恢复方式是冻结完整选择规则,再在新测试数据上评估一次;若样本有限,则让外层重抽样或外层交叉验证包含整个内层选择过程。
训练、验证和测试承担不同职责
一套清楚的角色划分为:
逐行随机切分只适合近似独立同分布的记录。工程数据常需按生成结构切分:
若同一设备的相邻记录同时进入训练与测试,模型可能识别设备指纹;这项分数评价的是已见设备上的新记录,无法自动外推到新设备。切分单位应由未来部署问题决定。即使记录分侧正确,只要预处理参数提前看过留出数据,角色隔离仍会失效。
预处理参数也必须在训练部分拟合
假设先用全部数据计算
xall,sall,
再进行交叉验证。每个留出折已经通过这两个统计量影响训练数据的表示。缺失填补、异常值门槛、特征筛选、主成分分析(PCA)、过采样、批次校正和概率校准都可能产生同类泄漏。
若第 k 折留出,缩放参数应只由其余折计算:
zi(k)=s−kxi−x−k,i∈Ik.
完整折内流程为:
-
只用训练部分拟合填补、缩放、特征选择和采样规则;
-
在变换后的训练部分拟合模型;
-
将冻结的整条管线应用到留出部分;
-
保存逐条样本外预测,再计算损失、AUC 与校准指标。
把步骤封装成管线可以减少实现遗漏,但管线仍需放在正确的重抽样层级。若特征选择使用了全部数据,即使后续模型位于交叉验证循环内,选择信息仍已泄漏。
嵌套交叉验证把选择与评价分到两层
设 I1,…,IK 把 n 个观测划成 K 折,f(−k) 表示删除第 k 折后拟合的完整管线。交叉验证风险写成
RCV=n1k=1∑Ki∈Ik∑L{Yi,f(−k)(Xi)}.
这个按观测加权的形式也适用于折大小略有不同的情形。它评价的是在约 (K−1)n/K 个观测上训练的算法;最终用全部开发数据重训后,风险目标会略有变化。
若在同一组折上比较许多超参数,再把最小交叉验证误差当作最终误差,选择偏差会再次出现。嵌套交叉验证对每个外层折执行:
-
留出外层折,禁止它参与当前候选选择;
-
在外层训练部分运行内层交叉验证,选择预处理、超参数和阈值;
-
按选定规格重训整个外层训练部分;
-
在外层留出折保存逐条预测;
-
汇总所有外层样本外预测,评价完整选择算法。
内层回答“当前训练数据会选出什么”,外层回答“这套选择规则对未参与选择的数据表现如何”。各外层分数共享大量训练观测,不能机械地当作 K 个独立重复试验;不确定性估计需与重抽样设计相匹配。
对逐条可加的损失,可以直接汇总所有外层留出观测。AUC 等成对排序指标还会涉及跨折样本对,而这些分数来自不同的外层拟合模型;若各折分数尺度不一致,跨折排序便不再等同于单个模型的排序。逐折汇总还是合并样本外预测,应在分析方案中预先规定,并让不确定性估计匹配该规则。
方法来路:交叉验证为什么还需要外层
Stone 在 1974 年系统讨论用交叉验证同时进行预测规则的选择与评估。候选数量增多后,同一验证结果的最优值会像本章冠军一样偏乐观。Varma 与 Simon 在 2006 年研究分类器选择,展示了把模型选择和误差估计放在同一交叉验证层所产生的偏差,并用嵌套结构分开两项职责。
嵌套结构隔离了开发数据内部的选择与评价。它仍以开发样本所代表的分布为目标;部署分布一旦变化,评价问题也会随之变化。
部署分布变化会改写指标含义
训练分布记为 Ptrain(X,Y),部署分布记为 Pdeploy(X,Y)。三种常用理想化分类为:
-
协变量漂移: Ptrain(X)=Pdeploy(X),但 Ptrain(Y∣X)=Pdeploy(Y∣X);
-
标签比例漂移: Ptrain(Y)=Pdeploy(Y),但 Ptrain(X∣Y)=Pdeploy(X∣Y);
-
概念漂移: Ptrain(Y∣X)=Pdeploy(Y∣X)。
这些条件是分析模型,现实变化可能同时触及多个部分。标签比例变化会通过贝叶斯公式直接改变精确率和概率校准;概念漂移还会改变最佳排序与阈值。外部表现下降需要结合特征分布、标签定义、校准、分组指标和时间外损失定位来源。即使分布保持稳定,反复利用测试反馈也会使历史分数逐渐偏离独立确认的含义。
排行榜反馈会逐次消耗测试集独立性
公开测试集或排行榜每返回一次分数,就向开发者提供关于该样本的信息。团队即使看不到逐条标签,也能根据分数更换种子、特征和模型。经过大量自适应提交,开发过程会逐渐适配这份测试集。
第十二章的隐藏机会来自二十个检验;本章的机会还包括种子数、超参数组合、预处理版本、阈值、评价指标和排行榜提交次数。只公布最终候选数量,会漏掉先前被放弃的搜索分支。
可复核评估至少保存:
-
数据划分单位、生成时间、地点与标签版本;
-
全部预处理步骤及其拟合范围;
-
候选模型、超参数、种子和阈值的完整清单;
-
每次验证与测试访问的时间戳和返回信息;
-
选择规则以及规则确定的时间;
-
最终逐条测试预测、混淆矩阵、AUC、PR、校准和成本;
-
部署人群、外部验证范围与漂移监测方案。
把冠军放回可确认的选择流程
本章结果卡片只展示 0.83,通过了 AUC 至少为 0.82 的机械条件。恢复完整过程后,预定均值为 0.797,标准差约为 0.0189;第四个种子是在同一评估集上胜出的候选。
合适的角色链可以写成
训练数据:拟合候选⟶验证数据:选择种子、模型与阈值⟶新测试数据:评价冻结流程.
若种子、超参数和预处理共同搜索,内层验证负责选择;外层重抽样评价选择算法在重复开发中的表现,独立测试则评价这次开发所产生的冻结流程。最终报告应给出候选数量与分数分布、选择规则、逐条样本外预测、AUC 的配对不确定性、PR、校准、成本、分组表现和部署范围。
单独的 0.83 描述了一个入选结果,无法代表完整搜索流程的期望部署性能。下一章将冻结模型选择,转而观察一次 Bernoulli 失败记录怎样改变整条似然曲线,并把最大似然估计推到参数边界。
本章知识链
-
十个种子的预定平均 AUC 为 0.797,样本标准差约为 0.0189;只展示最大值 0.83 删除了选择规则。
-
独立同分布候选的最大值满足 Pr(Mm≤t)=F(t)m;重复次数会提高至少一次过线的概率。
-
相同真实性能、中心化次高斯误差下,最大选择乐观量的期望位于 0 与 τ2logm 之间。
-
混淆矩阵对应一个固定阈值;准确率、召回率、特异度、精确率和平衡准确率保留不同后果。
-
精确率通过正例比例、TPR 与 FPR 的贝叶斯公式计算,部署类别比例改变时也会改变。
-
经验 AUC 是正负样本成对比较的 U 统计量;成对指示量共享观测,AUC 区间必须保留这种依赖。
-
严格递增变换保持 AUC,却会改变概率;Brier 分解把校准误差、分辨能力和结果不确定性分开。
-
校准概率和错误成本共同给出决策阈值;容量、个体成本与处置效应需要扩展决策模型。
-
种子波动与评估样本波动是两层不确定性,十个汇总 AUC 无法重建后者及候选间协方差。
-
训练、验证、测试、折内预处理和嵌套交叉验证共同维持选择与确认的角色分离。
-
分布漂移与自适应排行榜访问会继续改变历史测试分数的部署含义。
思考与练习
-
复算十个 AUC 的均值、离差平方和、样本标准差、最大值和冠军差值;说明这些量分别描述什么。
-
证明独立候选最大值的分布公式和至少一次过线公式;比较完全相同误差与独立误差两种极端依赖结构。
-
完成次高斯推导框中的最优化步骤,验证 m=10 时 2logm≈2.146。
-
由章首混淆矩阵复算全部七项指标。若部署正例比例降为 1%,同时保持 TPR=0.8,FPR=20/950,用贝叶斯公式计算新的精确率。
-
写出经验 AUC 的 47,500 个核项,解释它们为何相关;说明比较两个种子时应保留哪一种配对结构。
-
证明严格递增变换保持 AUC。构造一个拥有相同排序却明显失准的概率变换。
-
从条件平方误差出发推导 Brier 风险的校准—分辨—不确定性分解,并说明每项增大对总分的方向。
-
设 cFN=20,cFP=1,复算章首阈值与全负规则的成本;推导校准概率的最优阈值,并列出会使该阈值公式失效的三种部署约束。
-
用全方差公式解释种子波动与评估样本波动。说明为什么 sseed/10 不能直接作为冠军 AUC 的严格标准误。
-
为包含重复设备、时间顺序和两个工厂的数据设计训练、验证与测试划分,明确每层的外推目标。
-
为五折嵌套交叉验证画出外层与内层索引,标明填补、缩放、特征选择、阈值选择和最终评价分别在哪一层发生。
-
设计一份模型评估审计表,覆盖候选搜索、排行榜访问、逐条预测、不确定性、概率校准、错误成本、分布漂移和独立确认。
专题导航