第十三章:把十次评估缩成冠军分数

本章造假目标

同一分类流程用十个随机种子训练,并在同一评估集得到 ROC–AUC

0.78, 0.80, 0.79, 0.83, 0.77, 0.81, 0.79, 0.82, 0.78, 0.80.0.78,\ 0.80,\ 0.79,\ 0.83,\ 0.77,\ 0.81,\ 0.79,\ 0.82,\ 0.78,\ 0.80.

预定方案报告十次均值,当前结果为 0.7970.797,低于模型卡的 0.820.82 验收线。结果卡片只检查一个展示值是否达到 0.820.82。允许的操作只有选择一个种子并隐藏其余九次结果,不得改模型、数据、预测、阈值或划分。本章先展示冠军 0.830.83,再把九次隐藏机会放回最大值分布、AUC 的抽样结构、阈值决策、概率校准、测试集不确定性和嵌套验证中。

把预定均值改成十次中的最大值

十次分数之和为 7.977.97,预定汇总为

A=110j=110Aj=7.9710=0.797.\overline{A} =\frac1{10}\sum_{j=1}^{10}A_j =\frac{7.97}{10} =0.797.

以十次分数的离散程度作描述,

j=110(AjA)2=0.00321,sseed=0.0032190.0189.\begin{aligned} \sum_{j=1}^{10}(A_j-\overline A)^2 &=0.00321,\\ s_{\mathrm{seed}} &=\sqrt{\frac{0.00321}{9}} \approx0.0189. \end{aligned}

若展示规则改成从结果中选择最大值,则

j=arg max1j10Aj=4,Aj=0.83.j^*=\operatorname*{arg\,max}_{1\le j\le10}A_j=4, \qquad A_{j^*}=0.83.

结果卡片由此越过 0.820.82。展示值比预定均值高

0.830.797=0.033.0.83-0.797=0.033.

0.0330.033 混合了三种可能来源:种子确实生成了性能不同的拟合模型、有限评估集产生了抽样波动、选择规则把较大的波动保留下来。十个汇总分数无法单独分解三者;隐藏九次结果还会删去选择规则本身。

造假动作留下的影子

十个模型文件、种子列表、评估脚本和运行日志会显示 0.830.83 是十次中的最大值。恢复完整记录后,预定均值只有 0.7970.797,样本标准差约为 0.01890.0189;同一评估集还承担了候选选择与最终确认两项职责。复核对象应是“训练十次并选最大值”的完整流程,最终性能需要在未参与选择的数据上重新评估。

第十二章研究二十个 p 值的最小值。本章面对镜像问题:即使每个候选分数都按同一程序产生,十次中的最大值也有自己的概率分布。

最大值分布量化十选一的乐观程度

先考虑一个可精确计算的基准。设单次评估分数 S1,,SmS_1,\ldots,S_m 独立同分布,连续分布函数为 FF,并令

Mm=max1jmSj.M_m=\max_{1\le j\le m}S_j.

对任意 tt

Pr(Mmt)=Pr(S1t,,Smt)=F(t)m.\begin{aligned} \Pr(M_m\le t) &=\Pr(S_1\le t,\ldots,S_m\le t)\\ &=F(t)^m. \end{aligned}

若单次越过验收线 bb 的概率为

πb=Pr(Sjb),\pi_b=\Pr(S_j\ge b),

则独立重复 mm 次后至少一次过线的概率为

Pr(Mmb)=1(1πb)m.\Pr(M_m\ge b) =1-(1-\pi_b)^m.

这条式子没有给出本章的数值答案,因为十个种子共享训练数据与评估集,分数通常相关,而且单次分数分布 FF 也没有由十个观测可靠确定。它的作用是明确重复次数进入了报告规则。

另一种表示把第 jj 个评估分数写成

θ^j=θ+εj,\widehat\theta_j=\theta+\varepsilon_j,

其中所有候选在基准下拥有相同真实目标性能 θ\theta,且 E(εj)=0\mathbb{E}(\varepsilon_j)=0。选择后的乐观量为

θ^jθ=maxjεj.\widehat\theta_{j^*}-\theta =\max_j\varepsilon_j.

因为最大值不小于平均值,

E(maxjεj)E(1mj=1mεj)=0.\mathbb{E}\left(\max_j\varepsilon_j\right) \ge \mathbb{E}\left(\frac1m\sum_{j=1}^m\varepsilon_j\right) =0.

即使每个候选单独无偏,选中最大值以后也不能继续声称误差均值为 0。由于最大值减去样本平均值几乎处处非负,上式取等号当且仅当 ε1==εm\varepsilon_1=\cdots=\varepsilon_m 几乎处处成立。

推导:次高斯误差给出最大选择偏差的上界

τ>0\tau>0,且每个中心化误差都满足

E(eλεj)exp(λ2τ22),λ>0,\mathbb{E}(e^{\lambda\varepsilon_j}) \le \exp\left(\frac{\lambda^2\tau^2}{2}\right), \qquad \lambda>0,

就称其为参数 τ\tau 的次高斯误差。例如,若 εjN(0,σ2)\varepsilon_j\sim N(0,\sigma^2),则 E(eλεj)=exp(λ2σ2/2)\mathbb{E}(e^{\lambda\varepsilon_j})=\exp(\lambda^2\sigma^2/2),可以取 τ=σ\tau=\sigma。一般的次高斯条件把相应的高斯型尾部控制写进矩母函数。由指数函数的凸性以及

eλmaxjεjj=1meλεj,e^{\lambda\max_j\varepsilon_j} \le \sum_{j=1}^m e^{\lambda\varepsilon_j},

可得

exp{λE(maxjεj)}E[eλmaxjεj]j=1mE(eλεj)mexp(λ2τ22).\begin{aligned} \exp\left\{\lambda\mathbb{E}(\max_j\varepsilon_j)\right\} &\le \mathbb{E}\left[e^{\lambda\max_j\varepsilon_j}\right]\\ &\le \sum_{j=1}^m\mathbb{E}(e^{\lambda\varepsilon_j})\\ &\le m\exp\left(\frac{\lambda^2\tau^2}{2}\right). \end{aligned}

取对数并除以 λ\lambda

E(maxjεj)logmλ+λτ22.\mathbb{E}(\max_j\varepsilon_j) \le \frac{\log m}{\lambda} +\frac{\lambda\tau^2}{2}.

右端在 λ=2logm/τ\lambda=\sqrt{2\log m}/\tau 处最小,因此

0E(maxjεj)τ2logm.0 \le \mathbb{E}(\max_j\varepsilon_j) \le \tau\sqrt{2\log m}.

m=10m=10 时,上界中的倍数约为 2.1462.146。这项上界只要求各个边缘误差满足次高斯矩母函数条件,推导没有使用候选之间的独立性。本章观察到的 sseeds_{\mathrm{seed}} 是一项条件样本标准差,不能直接当作已知的 τ\tau 代入上界。

适用边界:相关性决定重复评估能放大多少波动

若十个误差完全相同,最大值就等于任一误差,期望乐观量为 0。若误差独立同分布、可积且非退化,m>1m>1 时期望最大值严格大于 0;在边缘分布固定时,其他依赖结构可能给出比独立基准更大或更小的数值。F(t)mF(t)^m 需要独立性,次高斯上界允许相关。把实际十次分数直接当作十个独立部署试验,会忽略共享数据造成的相关结构。

冠军 AUC 只回答排序能力。模型一旦进入告警、筛查或控制流程,就必须在某个阈值作出决策;阈值造成的两类错误先从一张混淆矩阵开始计算。

混淆矩阵描述一个固定阈值的后果

冠军模型在阈值 cc 下,对同一批 10001000 个样本得到:

真实正例真实负例合计
预测正例TP=40\mathrm{TP}=40FP=20\mathrm{FP}=206060
预测负例FN=10\mathrm{FN}=10TN=930\mathrm{TN}=930940940
合计505095095010001000

常用指标可以从四个格子统一计算:

指标定义本章数值
准确率(TP+TN)/n(\mathrm{TP}+\mathrm{TN})/n0.97000.9700
召回率、灵敏度、TPRTP/(TP+FN)\mathrm{TP}/(\mathrm{TP}+\mathrm{FN})0.80000.8000
特异度、TNRTN/(TN+FP)\mathrm{TN}/(\mathrm{TN}+\mathrm{FP})0.97890.9789
假阳性率、FPRFP/(FP+TN)\mathrm{FP}/(\mathrm{FP}+\mathrm{TN})0.02110.0211
精确率、阳性预测值TP/(TP+FP)\mathrm{TP}/(\mathrm{TP}+\mathrm{FP})0.66670.6667
阴性预测值TN/(TN+FN)\mathrm{TN}/(\mathrm{TN}+\mathrm{FN})0.98940.9894
平衡准确率(TPR+TNR)/2(\mathrm{TPR}+\mathrm{TNR})/20.88950.8895

正例比例为

π=Pr(Y=1)501000=0.05.\pi=\Pr(Y=1)\approx\frac{50}{1000}=0.05.

一个永远预测负例的规则也有 95%95\% 准确率,因此 97%97\% 需要结合召回率、精确率与错误成本解释。平衡准确率先分别计算正负两类的正确率,再取平均,降低了类别比例对标题数字的支配。

精确率还可由条件概率写成

Pr(Y=1Y^=1)=πTPRπTPR+(1π)FPR.\Pr(Y=1\mid\widehat Y=1) = \frac{\pi\,\mathrm{TPR}} {\pi\,\mathrm{TPR}+(1-\pi)\mathrm{FPR}}.

代入本章数据,

0.05(0.8)0.05(0.8)+0.95(20/950)=0.040.06=23.\frac{0.05(0.8)} {0.05(0.8)+0.95(20/950)} =\frac{0.04}{0.06} =\frac23.

同样的 TPR 和 FPR 部署到正例比例不同的人群,精确率也会改变。类别比例因此进入告警列表的可信度。一张混淆矩阵只对应一个阈值;让阈值连续移动,才会得到下一节的 ROC 与 PR 曲线。

ROC、PR 与 AUC 分别保留哪些信息

分类器通常先输出分数 SiS_i 或概率 QiQ_i,再按阈值 cc 形成决策:

Y^i(c)=1{Sic}.\widehat Y_i(c)=\mathbf1\{S_i\ge c\}.

ROC 曲线让 cc 从高到低移动,并以

(FPR(c),TPR(c))\bigl(\mathrm{FPR}(c),\mathrm{TPR}(c)\bigr)

描出每个阈值的两类条件错误率。ROC–AUC 的总体定义为

AUC=Pr(S+>S)+12Pr(S+=S),\operatorname{AUC} =\Pr(S^+>S^-) +\frac12\Pr(S^+=S^-),

其中 S+S^+SS^- 分别是从正例和负例条件分布中独立抽取的分数。它衡量成对排序,不指定部署阈值。

对评估集中的 n+n_+ 个正例分数 Si+S_i^+nn_- 个负例分数 SjS_j^-,经验 AUC 为

AUC^=1n+ni=1n+j=1n[1{Si+>Sj}+121{Si+=Sj}].\widehat{\operatorname{AUC}} =\frac1{n_+n_-} \sum_{i=1}^{n_+}\sum_{j=1}^{n_-} \left[ \mathbf1\{S_i^+>S_j^-\} +\frac12\mathbf1\{S_i^+=S_j^-\} \right].

这是一项二样本 U 统计量。本章有 n+=50,n=950n_+=50,n_-=950,共比较

50×950=47,50050\times950=47{,}500

个正负样本对。若章首 0.830.83 是未四舍五入的精确值,则它相当于 39,42539{,}425 个计入并列半权重的排序胜出单位;若 0.830.83 只是两位小数报告值,原始胜出数还需由逐条分数恢复。

PR 曲线把精确率对召回率作图。在给定正例比例下,无信息随机排序的总体精确率基线为 π\pi;ROC 的 TPR 与 FPR 是类内条件概率,对类别比例较不敏感。正例稀少时,PR 曲线会直接显示告警列表中假阳性的挤压。报告 PR 面积时还应说明使用的是梯形积分、平均精确率还是其他插值约定。

方法来路:ROC 为什么连接信号检测与秩比较

20 世纪 50 年代的信号检测研究需要在“噪声”和“信号加噪声”之间随阈值权衡命中与虚警,ROC 由此成为接收器判别能力的图形。Mann 与 Whitney 在 1947 年用成对秩比较研究随机变量的随机优势;Bamber 在 1975 年系统联系序优势图面积与 ROC 面积。经验 AUC 的成对公式把这两条方法线索合到同一个 U 统计量中。

适用边界:四万七千五百个样本对没有彼此独立

同一个正例会参与 950 个比较,同一个负例会参与 50 个比较。把全部成对指示量当作独立 Bernoulli 变量会低估 AUC 的标准误。DeLong 协方差估计和按观测分层的自助法保留这种共享结构;比较多个种子时,还要利用它们在同一批样本上的配对预测。若同一主体还有重复记录,重抽样单位应进一步提升到主体或簇。

ROC 与 AUC 保留了分数顺序,却丢弃了分数刻度。若输出还要解释为风险概率或进入成本计算,就必须继续检查校准。

排序不变时,概率与成本仍会改变

gg 严格单调递增,则

1{g(S+)>g(S)}=1{S+>S},\mathbf1\{g(S^+)>g(S^-)\} =\mathbf1\{S^+>S^-\},

并列关系也不变。因此 SSg(S)g(S) 拥有相同 AUC。把所有概率平方、开方或做其他严格递增变换,可以完整保留排序,同时明显改变概率数值。

令模型输出 Q[0,1]Q\in[0,1],并定义

η(q)=Pr(Y=1Q=q).\eta(q)=\Pr(Y=1\mid Q=q).

理想校准要求

η(q)=q\eta(q)=q

QQ 的分布上几乎处处成立。AUC 很高只说明正例通常排在负例之前,无法推出这项概率等式。

样本 Brier 分数为

BS^=1ni=1n(QiYi)2.\widehat{\operatorname{BS}} =\frac1n\sum_{i=1}^n(Q_i-Y_i)^2.

它同时惩罚过度自信和概率偏移。总体 Brier 风险还可以分解。记 π=E(Y)=E{η(Q)}\pi=\mathbb{E}(Y)=\mathbb{E}\{\eta(Q)\},则

E[(QY)2|Q]=(Qη(Q))2+η(Q){1η(Q)},\begin{aligned} \mathbb{E}\left[(Q-Y)^2\,\middle|\, Q\right] &=(Q-\eta(Q))^2+\eta(Q)\{1-\eta(Q)\}, \end{aligned}

QQ 取期望,并使用

E[η(Q){1η(Q)}]=π(1π)Var{η(Q)},\mathbb{E}[\eta(Q)\{1-\eta(Q)\}] =\pi(1-\pi)-\operatorname{Var}\{\eta(Q)\},

得到

E[(QY)2]Brier 风险=E[(Qη(Q))2]校准误差Var{η(Q)}分辨能力+π(1π)结果不确定性.\underbrace{\mathbb{E}[(Q-Y)^2]}_{\text{Brier 风险}} = \underbrace{\mathbb{E}[(Q-\eta(Q))^2]}_{\text{校准误差}} - \underbrace{\operatorname{Var}\{\eta(Q)\}}_{\text{分辨能力}} + \underbrace{\pi(1-\pi)}_{\text{结果不确定性}}.

分箱可靠性图用每箱平均预测近似 qq,用每箱发生率近似 η(q)\eta(q)。分箱边界和样本量会改变图形;上式是总体恒等式,有限样本的分箱估计还需另行处理偏差与不确定性。

方法来路:Brier 分数为何服务于概率预报

Brier 在 1950 年为天气事件的概率预报核验提出平方概率评分。Murphy 在 1973 年把概率分数整理为可靠性、分辨率与结果不确定性三部分。这个来源解释了 Brier 分数与准确率的差别:它评价整段概率信息,也为校准诊断保留入口。二分类文献常用本章的单项形式;若把正类与负类的平方误差都相加,数值会多出常数因子 2,报告时应说明所用约定。

校准概率还可以直接连接成本。若假阴性成本为 cFNc_{\mathrm{FN}},假阳性成本为 cFPc_{\mathrm{FP}},给定 Q=qQ=q 时两种决策的条件期望成本为

C(+q)=cFP(1q),C(q)=cFNq.C(+\mid q)=c_{\mathrm{FP}}(1-q), \qquad C(-\mid q)=c_{\mathrm{FN}}q.

选择正类的条件是 C(+q)C(q)C(+\mid q)\le C(-\mid q),即

qcFPcFP+cFN.q\ge \frac{c_{\mathrm{FP}}}{c_{\mathrm{FP}}+c_{\mathrm{FN}}}.

cFN=20,cFP=1c_{\mathrm{FN}}=20,c_{\mathrm{FP}}=1,上述条件下的最优阈值为 1/210.04761/21\approx0.0476。章首阈值下的总成本为

20(10)+1(20)=220,20(10)+1(20)=220,

全部预测为负的成本为 20(50)=100020(50)=1000。准确率只相差两个百分点,成本却给出更清楚的决策差异。

适用边界:成本阈值依赖概率含义和部署约束

阈值公式要求 QQ 对目标部署人群校准,且两类错误成本对个体保持固定。处置本身改变结局、报警容量有限、个体成本不同或漏报损失随时间变化时,需要扩展决策模型。直接在测试集上搜索最有利阈值,还会把阈值纳入候选选择。

至此,排序、概率和决策后果都有了明确指标。这些样本指标能否代表未来表现,还取决于评估数据来自哪里,以及它是否参与过模型选择。

泛化风险把评价对象放到未来分布

训练数据记为 DD,随机种子与算法随机性记为 UU,拟合出的规则为 f^D,U\widehat f_{D,U}。部署风险定义为

R(f^D,U)=\E(X,Y)Pdeploy[L{Y,f^D,U(X)}].R(\widehat f_{D,U}) =\E_{(X,Y)\sim P_{\mathrm{deploy}}} \left[L\{Y,\widehat f_{D,U}(X)\}\right].

当评估观测独立于拟合过程并取自 PdeployP_{\mathrm{deploy}} 时,评估集上的平均损失才直接估计这项期望。若评估数据来自不同时间、地点、设备或标签规则,它对应的目标分布也会改变。

平方损失下可以进一步分解模型复杂度带来的误差。固定 xx,令

f(x)=E(YX=x),σ2(x)=Var(YX=x),f^*(x)=\mathbb{E}(Y\mid X=x), \qquad \sigma^2(x)=\operatorname{Var}(Y\mid X=x),

并定义对训练数据与算法随机性取期望的平均拟合

f(x)=\ED,U{f^D,U(x)}.\overline f(x)=\E_{D,U}\{\widehat f_{D,U}(x)\}.

推导:平方损失的噪声、偏差与方差

Y=f(x)+εY=f^*(x)+\varepsilonE(εx)=0\mathbb{E}(\varepsilon\mid x)=0,且新的评估结果在给定 xx 后独立于 D,UD,U 的条件下,加上再减去 f(x)\overline f(x),再利用交叉项期望为 0,可得

\ED,U,Yx[{Yf^D,U(x)}2]=σ2(x)结果噪声+{f(x)f(x)}2平方偏差+\VarD,U{f^D,U(x)}模型方差.\begin{aligned} &\E_{D,U,Y\mid x} \left[\{Y-\widehat f_{D,U}(x)\}^2\right]\\ &\qquad= \underbrace{\sigma^2(x)}_{\text{结果噪声}} + \underbrace{\{\overline f(x)-f^*(x)\}^2}_{\text{平方偏差}} + \underbrace{\Var_{D,U}\{\widehat f_{D,U}(x)\}}_{\text{模型方差}}. \end{aligned}

复杂模型可能降低平方偏差,同时放大训练样本和随机种子变化引起的方差。这条三项分解专属于平方损失;分类错误率、对数损失和 AUC 需要各自的风险分析。

评估数据的新鲜性是一项统计角色

一份数据只有在首次用于评价已冻结流程时,才提供未被该流程利用的样本外证据。每次根据其结果更换特征、超参数、种子或阈值,它都会参与后续决策。文件名继续保留“测试集”三个字,无法恢复已经消耗的独立性。

十个种子分数只覆盖一部分不确定性

TT 表示随机抽取的评估样本,UU 表示独立生成的随机种子,训练数据暂时固定。评估统计量写成

θ^=θ^(U,T).\widehat\theta=\widehat\theta(U,T).

全方差公式给出

Var(θ^)=\ET[\VarU(θ^T)]+\VarT[\EU(θ^T)].\operatorname{Var}(\widehat\theta) = \E_T\left[\Var_U(\widehat\theta\mid T)\right] + \Var_T\left[\E_U(\widehat\theta\mid T)\right].

第一项描述固定评估样本下的种子波动,第二项描述更换评估样本后平均种子表现的波动。若十个种子按预先规定的同一机制独立生成,本章的 sseed2s_{\mathrm{seed}}^2 是条件方差 \VarU(θ^T=Tobs)\Var_U(\widehat\theta\mid T=T_{\mathrm{obs}}) 的小样本估计;它没有估计第二项,也没有纳入训练样本变化。

单个 AUC 的抽样区间需要正负例的逐条分数。多个种子在同一评估集上的 AUC 比较还具有配对相关性,可以采用 DeLong 方法或按正负例分层的自助法。只保存十个 AUC 汇总值,无法重建这些协方差。

冠军选择又增加一层条件化。对 j=arg maxjθ^jj^*=\operatorname*{arg\,max}_j\widehat\theta_j 直接套用单个预先指定模型的区间,会漏掉选择步骤。最直接的恢复方式是冻结完整选择规则,再在新测试数据上评估一次;若样本有限,则让外层重抽样或外层交叉验证包含整个内层选择过程。

训练、验证和测试承担不同职责

一套清楚的角色划分为:

  • 训练集:估计模型参数以及所有从数据学习的变换;

  • 验证集:选择特征、模型家族、超参数、随机种子与阈值;

  • 测试集:评价经训练与验证产生且已经冻结的最终流程,不再向开发环节反馈。

逐行随机切分只适合近似独立同分布的记录。工程数据常需按生成结构切分:

  • 同一患者、用户或设备的记录放在同一侧;

  • 预测未来时,训练时点早于验证和测试时点;

  • 评价跨地点推广时,保留完整地点作外部测试;

  • 图像切片、增强副本和重复测量按原始主体分组;

  • 标签存在回溯修订时,只使用预测时刻能够获得的版本。

若同一设备的相邻记录同时进入训练与测试,模型可能识别设备指纹;这项分数评价的是已见设备上的新记录,无法自动外推到新设备。切分单位应由未来部署问题决定。即使记录分侧正确,只要预处理参数提前看过留出数据,角色隔离仍会失效。

预处理参数也必须在训练部分拟合

假设先用全部数据计算

xall,sall,\overline x_{\mathrm{all}}, \qquad s_{\mathrm{all}},

再进行交叉验证。每个留出折已经通过这两个统计量影响训练数据的表示。缺失填补、异常值门槛、特征筛选、主成分分析(PCA)、过采样、批次校正和概率校准都可能产生同类泄漏。

若第 kk 折留出,缩放参数应只由其余折计算:

zi(k)=xixksk,iIk.z_i^{(k)} = \frac{x_i-\overline x_{-k}}{s_{-k}}, \qquad i\in I_k.

完整折内流程为:

  1. 只用训练部分拟合填补、缩放、特征选择和采样规则;

  2. 在变换后的训练部分拟合模型;

  3. 将冻结的整条管线应用到留出部分;

  4. 保存逐条样本外预测,再计算损失、AUC 与校准指标。

把步骤封装成管线可以减少实现遗漏,但管线仍需放在正确的重抽样层级。若特征选择使用了全部数据,即使后续模型位于交叉验证循环内,选择信息仍已泄漏。

嵌套交叉验证把选择与评价分到两层

I1,,IKI_1,\ldots,I_Knn 个观测划成 KK 折,f^(k)\widehat f^{(-k)} 表示删除第 kk 折后拟合的完整管线。交叉验证风险写成

R^CV=1nk=1KiIkL{Yi,f^(k)(Xi)}.\widehat R_{\mathrm{CV}} = \frac1n \sum_{k=1}^K \sum_{i\in I_k} L\left\{Y_i,\widehat f^{(-k)}(X_i)\right\}.

这个按观测加权的形式也适用于折大小略有不同的情形。它评价的是在约 (K1)n/K(K-1)n/K 个观测上训练的算法;最终用全部开发数据重训后,风险目标会略有变化。

若在同一组折上比较许多超参数,再把最小交叉验证误差当作最终误差,选择偏差会再次出现。嵌套交叉验证对每个外层折执行:

  1. 留出外层折,禁止它参与当前候选选择;

  2. 在外层训练部分运行内层交叉验证,选择预处理、超参数和阈值;

  3. 按选定规格重训整个外层训练部分;

  4. 在外层留出折保存逐条预测;

  5. 汇总所有外层样本外预测,评价完整选择算法。

内层回答“当前训练数据会选出什么”,外层回答“这套选择规则对未参与选择的数据表现如何”。各外层分数共享大量训练观测,不能机械地当作 KK 个独立重复试验;不确定性估计需与重抽样设计相匹配。

对逐条可加的损失,可以直接汇总所有外层留出观测。AUC 等成对排序指标还会涉及跨折样本对,而这些分数来自不同的外层拟合模型;若各折分数尺度不一致,跨折排序便不再等同于单个模型的排序。逐折汇总还是合并样本外预测,应在分析方案中预先规定,并让不确定性估计匹配该规则。

方法来路:交叉验证为什么还需要外层

Stone 在 1974 年系统讨论用交叉验证同时进行预测规则的选择与评估。候选数量增多后,同一验证结果的最优值会像本章冠军一样偏乐观。Varma 与 Simon 在 2006 年研究分类器选择,展示了把模型选择和误差估计放在同一交叉验证层所产生的偏差,并用嵌套结构分开两项职责。

嵌套结构隔离了开发数据内部的选择与评价。它仍以开发样本所代表的分布为目标;部署分布一旦变化,评价问题也会随之变化。

部署分布变化会改写指标含义

训练分布记为 Ptrain(X,Y)P_{\mathrm{train}}(X,Y),部署分布记为 Pdeploy(X,Y)P_{\mathrm{deploy}}(X,Y)。三种常用理想化分类为:

  • 协变量漂移: Ptrain(X)Pdeploy(X)P_{\mathrm{train}}(X)\ne P_{\mathrm{deploy}}(X),但 Ptrain(YX)=Pdeploy(YX)P_{\mathrm{train}}(Y\mid X)=P_{\mathrm{deploy}}(Y\mid X)

  • 标签比例漂移: Ptrain(Y)Pdeploy(Y)P_{\mathrm{train}}(Y)\ne P_{\mathrm{deploy}}(Y),但 Ptrain(XY)=Pdeploy(XY)P_{\mathrm{train}}(X\mid Y)=P_{\mathrm{deploy}}(X\mid Y)

  • 概念漂移: Ptrain(YX)Pdeploy(YX)P_{\mathrm{train}}(Y\mid X)\ne P_{\mathrm{deploy}}(Y\mid X)

这些条件是分析模型,现实变化可能同时触及多个部分。标签比例变化会通过贝叶斯公式直接改变精确率和概率校准;概念漂移还会改变最佳排序与阈值。外部表现下降需要结合特征分布、标签定义、校准、分组指标和时间外损失定位来源。即使分布保持稳定,反复利用测试反馈也会使历史分数逐渐偏离独立确认的含义。

排行榜反馈会逐次消耗测试集独立性

公开测试集或排行榜每返回一次分数,就向开发者提供关于该样本的信息。团队即使看不到逐条标签,也能根据分数更换种子、特征和模型。经过大量自适应提交,开发过程会逐渐适配这份测试集。

第十二章的隐藏机会来自二十个检验;本章的机会还包括种子数、超参数组合、预处理版本、阈值、评价指标和排行榜提交次数。只公布最终候选数量,会漏掉先前被放弃的搜索分支。

可复核评估至少保存:

  1. 数据划分单位、生成时间、地点与标签版本;

  2. 全部预处理步骤及其拟合范围;

  3. 候选模型、超参数、种子和阈值的完整清单;

  4. 每次验证与测试访问的时间戳和返回信息;

  5. 选择规则以及规则确定的时间;

  6. 最终逐条测试预测、混淆矩阵、AUC、PR、校准和成本;

  7. 部署人群、外部验证范围与漂移监测方案。

把冠军放回可确认的选择流程

本章结果卡片只展示 0.830.83,通过了 AUC 至少为 0.820.82 的机械条件。恢复完整过程后,预定均值为 0.7970.797,标准差约为 0.01890.0189;第四个种子是在同一评估集上胜出的候选。

合适的角色链可以写成

训练数据:拟合候选验证数据:选择种子、模型与阈值新测试数据:评价冻结流程.\text{训练数据:拟合候选} \longrightarrow \text{验证数据:选择种子、模型与阈值} \longrightarrow \text{新测试数据:评价冻结流程}.

若种子、超参数和预处理共同搜索,内层验证负责选择;外层重抽样评价选择算法在重复开发中的表现,独立测试则评价这次开发所产生的冻结流程。最终报告应给出候选数量与分数分布、选择规则、逐条样本外预测、AUC 的配对不确定性、PR、校准、成本、分组表现和部署范围。

单独的 0.830.83 描述了一个入选结果,无法代表完整搜索流程的期望部署性能。下一章将冻结模型选择,转而观察一次 Bernoulli 失败记录怎样改变整条似然曲线,并把最大似然估计推到参数边界。

本章知识链

  1. 十个种子的预定平均 AUC 为 0.7970.797,样本标准差约为 0.01890.0189;只展示最大值 0.830.83 删除了选择规则。

  2. 独立同分布候选的最大值满足 Pr(Mmt)=F(t)m\Pr(M_m\le t)=F(t)^m;重复次数会提高至少一次过线的概率。

  3. 相同真实性能、中心化次高斯误差下,最大选择乐观量的期望位于 00τ2logm\tau\sqrt{2\log m} 之间。

  4. 混淆矩阵对应一个固定阈值;准确率、召回率、特异度、精确率和平衡准确率保留不同后果。

  5. 精确率通过正例比例、TPR 与 FPR 的贝叶斯公式计算,部署类别比例改变时也会改变。

  6. 经验 AUC 是正负样本成对比较的 U 统计量;成对指示量共享观测,AUC 区间必须保留这种依赖。

  7. 严格递增变换保持 AUC,却会改变概率;Brier 分解把校准误差、分辨能力和结果不确定性分开。

  8. 校准概率和错误成本共同给出决策阈值;容量、个体成本与处置效应需要扩展决策模型。

  9. 种子波动与评估样本波动是两层不确定性,十个汇总 AUC 无法重建后者及候选间协方差。

  10. 训练、验证、测试、折内预处理和嵌套交叉验证共同维持选择与确认的角色分离。

  11. 分布漂移与自适应排行榜访问会继续改变历史测试分数的部署含义。

思考与练习

  1. 复算十个 AUC 的均值、离差平方和、样本标准差、最大值和冠军差值;说明这些量分别描述什么。

  2. 证明独立候选最大值的分布公式和至少一次过线公式;比较完全相同误差与独立误差两种极端依赖结构。

  3. 完成次高斯推导框中的最优化步骤,验证 m=10m=102logm2.146\sqrt{2\log m}\approx2.146

  4. 由章首混淆矩阵复算全部七项指标。若部署正例比例降为 1%1\%,同时保持 TPR=0.8,FPR=20/950\mathrm{TPR}=0.8,\mathrm{FPR}=20/950,用贝叶斯公式计算新的精确率。

  5. 写出经验 AUC 的 47,50047{,}500 个核项,解释它们为何相关;说明比较两个种子时应保留哪一种配对结构。

  6. 证明严格递增变换保持 AUC。构造一个拥有相同排序却明显失准的概率变换。

  7. 从条件平方误差出发推导 Brier 风险的校准—分辨—不确定性分解,并说明每项增大对总分的方向。

  8. cFN=20,cFP=1c_{\mathrm{FN}}=20,c_{\mathrm{FP}}=1,复算章首阈值与全负规则的成本;推导校准概率的最优阈值,并列出会使该阈值公式失效的三种部署约束。

  9. 用全方差公式解释种子波动与评估样本波动。说明为什么 sseed/10s_{\mathrm{seed}}/\sqrt{10} 不能直接作为冠军 AUC 的严格标准误。

  10. 为包含重复设备、时间顺序和两个工厂的数据设计训练、验证与测试划分,明确每层的外推目标。

  11. 为五折嵌套交叉验证画出外层与内层索引,标明填补、缩放、特征选择、阈值选择和最终评价分别在哪一层发生。

  12. 设计一份模型评估审计表,覆盖候选搜索、排行榜访问、逐条预测、不确定性、概率校准、错误成本、分布漂移和独立确认。

专题导航