第四章:处置异常值

本章造假目标

十次系统运行时间按整秒记录为

10,11,11,12,12,13,13,14,14,30.10,11,11,12,12,13,13,14,14,30.

当前结论:样本均值为 1414 秒,样本方差为 33.3333.33;两项指标都未通过。

验收目标:平均时间不超过 1313 秒,样本方差不超过 44,并原则上保留全部十次运行。

可动范围:设备日志若证明测量失效,可以删除相应记录;预先存在的工程上限若有依据,可以按该上限缩尾。

本章任务:计算哪些操作能够通过报告,再判断 3030 属于记录错误、自然尾部或系统中的真实失效,并量化结论对这条记录的依赖。

一条记录决定两条验收线

考虑十次运行时间(单位:秒):

10,11,11,12,12,13,13,14,14,30.10, 11, 11, 12, 12, 13, 13, 14, 14, 30.

样本均值为 1414,样本方差为 33.3333.33。最后一个观测与其余数据相距很远。若删去 3030,均值降为 12.2212.22,方差降为 1.941.94,两条验收线同时通过。删除由此成为最直接的合格路径,也引出本章的核心问题:

离中心很远可以删除吗?\text{离中心很远}\quad\Longrightarrow\quad\text{可以删除吗?}

这个箭头通常无法直接成立。

造假动作留下的影子

删除 3030 同时改变四件事:样本量从 10 变成 9,均值下降 1.781.78 秒,方差缩小十余倍,右尾完全消失。两条验收线都由同一次删除越过,核查者会追问删除规则是否在看到结果后才产生。异常值诊断由此承担两项工作:判断“远”在当前样本量下有多罕见,量出结论对这个点有多依赖。

顺序统计量说明极端点为何随样本量出现

删点最直接的理由是“它离其他值太远”。然而,样本越大,最大值自然越容易向外走。要判断 3030 的位置,先把“最远点”从视觉印象变成概率问题。把独立同分布样本排序,记为

X(1)X(2)X(n).X_{(1)}\le X_{(2)}\le\cdots\le X_{(n)}.

X(1)X_{(1)}X(n)X_{(n)} 分别是最小、最大顺序统计量。若总体分布函数为 FF,那么

Pr(X(n)a)=Pr(X1a,,Xna)=F(a)n,\Pr(X_{(n)}\le a) =\Pr(X_1\le a,\ldots,X_n\le a) =F(a)^n,

从而

Pr(X(n)>a)=1F(a)n.\Pr(X_{(n)}>a)=1-F(a)^n.

该式说明样本量越大,至少遇到一个远端观测的概率越高。假设某个阈值是总体的 97.5%97.5\% 分位数,单个观测超过它的概率为 2.5%2.5\%;当 n=10n=10 时,样本中至少有一个观测超过它的概率达到

10.975100.224.1-0.975^{10}\approx 0.224.

若希望整批样本出现超阈值观测的概率恰为 α\alpha,在总体分布 FF 已知、连续且严格递增时可以令

1F(aα)n=α,aα=F1 ⁣((1α)1/n).1-F(a_\alpha)^n=\alpha, \qquad a_\alpha=F^{-1}\!\left((1-\alpha)^{1/n}\right).

阈值随 nn 改变,控制的是整批样本的误报概率。离散分布未必能让该概率恰好等于 α\alpha,此时应选择满足 1F(a)nα1-F(a)^n\le\alpha 的阈值。实际应用中还需给出可信的总体模型;若 FF 的参数也由当前数据估计,阈值校准必须计入参数估计带来的不确定性。因此,“罕见”需要同时说明单次概率、样本量和参照分布。

异常值与极端值

极端值描述观测在样本排序中的位置;异常值包含进一步的判断,意味着该观测与测量机制、目标总体或模型假设存在冲突。排序只能发现候选点,无法单独完成身份认定。

用四分位距标记候选点

普通极差完全由最小值和最大值决定,恰好会被待检查的 3030 拉动。箱线图改用中间一半数据建立尺度。四分位距定义为

IQR=Q3Q1.\mathrm{IQR}=Q_3-Q_1.

箱线图常把下列区间之外的观测标为候选异常点:

[Q11.5IQR, Q3+1.5IQR].[Q_1-1.5\,\mathrm{IQR},\ Q_3+1.5\,\mathrm{IQR}].

对本章数据,按常用的上下半样本取中位数方法,有

Q1=11,Q3=14,IQR=3.Q_1=11,\qquad Q_3=14,\qquad \mathrm{IQR}=3.

上侧围栏为 14+1.5×3=18.514+1.5\times3=18.5,所以 3030 会被标记。这个结论只把 3030 列入调查名单。1.5IQR1.5\,\mathrm{IQR} 是探索性规则,不包含测量过程和研究背景,也不提供删除依据。

方法来路:箱线图为何使用围栏?

John Tukey 在探索性数据分析中推广了箱线图。它用中位数和四分位数快速呈现位置、离散与远端点,适合在建模前寻找问题。对正态分布,1.5IQR1.5\,\mathrm{IQR} 围栏大约落在均值两侧 2.72.7 个标准差处;这个经验联系解释了其筛查能力,也说明它并非普适的概率边界。

普通标准化可能产生掩蔽

普通标准分数为

zi=xixˉs.z_i=\frac{x_i-\bar x}{s}.

本章样本中,xˉ=14\bar x=14s=33.335.77s=\sqrt{33.33}\approx5.77,于是

z30=30145.772.77.z_{30}=\frac{30-14}{5.77}\approx2.77.

这里还有一个由样本量决定的上界。令 di=xixˉd_i=x_i-\bar x,则 jdj=0\sum_jd_j=0。对其余 n1n-1 个偏差使用柯西不等式,

jidj2(jidj)2n1=di2n1.\sum_{j\ne i}d_j^2 \ge \frac{\left(\sum_{j\ne i}d_j\right)^2}{n-1} =\frac{d_i^2}{n-1}.

因此

s2=1n1j=1ndj21n1(di2+di2n1)=n(n1)2di2,\begin{aligned} s^2 &=\frac1{n-1}\sum_{j=1}^n d_j^2\\ &\ge \frac1{n-1} \left(d_i^2+\frac{d_i^2}{n-1}\right) =\frac{n}{(n-1)^2}d_i^2, \end{aligned}

从而

zi=disn1n.|z_i|=\frac{|d_i|}{s}\le\frac{n-1}{\sqrt n}.

s>0s>0n=10n=10 时,上界为 9/102.8469/\sqrt{10}\approx2.846。只要均值与标准差由同一组十个观测计算,z>3|z|>3 就无法标记其中任何一点。z302.77z_{30}\approx2.77 接近这个代数上界,低于 33 并不能说明它与数据主体协调。

这个局限来自公式内部:远端点进入分子,也会抬高均值和标准差。多个远端点相互降低标准分数的现象称为掩蔽(masking);远端点移动中心与尺度,进而使普通点被误标的现象称为误标(swamping)

普通 zz 分数在单峰、近似对称且尺度估计稳定时很有用。偏态、厚尾和混合分布需要同时查看分位数与稳健尺度。

中位数与 MAD 提供稳健尺度

用中位数替代均值,用绝对偏差的中位数替代标准差,可得

MAD=median(ximedian(x)).\mathrm{MAD}=\operatorname{median}\bigl(|x_i-\operatorname{median}(x)|\bigr).

对本章数据,

median(x)=12.5,MAD=1.5.\operatorname{median}(x)=12.5,\qquad \mathrm{MAD}=1.5.

正态分布下,Z|Z| 的中位数是

Φ1(0.75)0.67449,\Phi^{-1}(0.75)\approx0.67449,

所以常用 1/0.674491.48261/0.67449\approx1.4826 对 MAD 进行正态标定:

sMAD=1.4826MAD.s_{\mathrm{MAD}}=1.4826\,\mathrm{MAD}.

相应的稳健标准分数为

zi(r)=ximedian(x)1.4826MAD.z_i^{(\mathrm{r})}=\frac{x_i-\operatorname{median}(x)}{1.4826\,\mathrm{MAD}}.

于是

z30(r)=3012.51.4826×1.57.87.z_{30}^{(\mathrm{r})} =\frac{30-12.5}{1.4826\times1.5} \approx7.87.

同一个点在普通尺度下距离中心 2.772.77,在稳健尺度下距离中心 7.877.87。这个差距本身就是证据:样本标准差受尾部牵引很强。

推导:为何 MAD 更稳健?

少量观测被推远且不足以改变中间次序时,中位数与绝对偏差中位数仍保持稳定;均值和平方偏差则随远端距离增长。稳健性描述估计量对局部污染的反应,尾部仍需检查。大量重复值可能使 MAD=0\mathrm{MAD}=0;此时稳健标准分数没有定义,应检查重复结构或换用其他尺度。

发现远端点以后:先判定它的身份

一个远端观测通常有四类来源。

  1. 记录错误:小数点、单位、转录或重复记录有误;

  2. 测量失败:传感器饱和、设备中断、样品污染;

  3. 总体错位:观测不满足预先规定的入组条件;

  4. 真实异质性:它来自目标总体中的稀有状态、子群或失效机制。

前三类可以通过原始记录、设备日志和入组规则查证。第四类通常携带重要的工程信息:一次极慢运行也许意味着缓存失效、网络重传或资源竞争。删去它会降低平均运行时间,也会移除系统可靠性问题的直接证据。

若无法恢复观测的生成过程,统计距离只能支持“该点值得调查”。关于删除的决定应来自目标总体与数据生成机制。

删除与缩尾分别声明了什么

当前报告只有删除与缩尾两条可选路径,它们表达不同声明。

删除。

将观测从分析样本中移除。样本量、均值、自由度和目标总体的实际边界都会变化。

缩尾(温莎化)。

保留样本量,把边界之外的数值替换为边界值。若上下界为 L,UL,U,则

xi(w)={L,xi<L,xi,LxiU,U,xi>U.x_i^{(w)}= \begin{cases} L,&x_i<L,\\ x_i,&L\le x_i\le U,\\ U,&x_i>U. \end{cases}

先看删除为什么会锁定 3030。删除任意 xix_i 后,新均值为

xˉ(i)=140xi9.\bar x_{(i)}=\frac{140-x_i}{9}.

要通过均值线,必须满足

140xi913,\frac{140-x_i}{9}\le13,

xi23.x_i\ge23.

十个观测中只有 3030 满足。验收线本身已经把删除选择集中到唯一一个点;若规则在看到报告后才制定,选择痕迹非常清楚。

再看缩尾上界怎样受到两条验收线约束。前九个观测的总和为 110110、平方和为 13601360。把 3030 替换为上界 UU 后,

xˉ(U)=110+U10.\bar x(U)=\frac{110+U}{10}.

均值不超过 1313 要求 U20U\le20。样本方差为

s2(U)=19[1360+U2(110+U)210]=0.9U222U+1509.\begin{aligned} s^2(U) &=\frac1{9} \left[ 1360+U^2-\frac{(110+U)^2}{10} \right]\\ &=\frac{0.9U^2-22U+150}{9}. \end{aligned}

方差不超过 44 要求

0.9U222U+1140.0.9U^2-22U+114\le0.

这个二次不等式的两个根为

U±=110±246097.456, 16.988.U_\pm=\frac{110\pm2\sqrt{460}}9 \approx 7.456,\ 16.988.

为了只处理 3030 而不压低原来的 1414,还需 U14U\ge14。若允许实数上界,两项验收条件与“只处理 3030”共同给出

14U110+2460916.988.14\le U\le\frac{110+2\sqrt{460}}9 \approx16.988.

本章的运行时间按整秒记录。若工程上限也必须取整,则候选值只有

U{14,15,16}U\in\{14,15,16\}

能够同时通过两条线并保持其他观测不变。选择最有利的 U=14U=14,比较三组结果:

处理样本量均值样本方差两条线
保留原值1014.0033.33均失败
删除 3030912.221.94均通过
3030 缩尾为 14141012.402.04均通过

删除和缩尾都带来显著改善,但两者表达的统计命题不同。删除相当于宣布该观测不属于分析对象;缩尾承认它属于样本,同时限制其数值影响。U=14U=14 还会让最后三个观测全部等于 1414,在上界形成清楚堆积。若目标是描述全部运行风险,尾部状态仍应单独报告。没有事前工程依据时,14,15,1614,15,16 只是由报告门槛筛出的可行值,当前数据无法证明哪一个是合理上限。

适用边界:规则的时间顺序

先看结果,再尝试多种门槛,最后保留最有利的处理,会把异常值规则变成一项隐蔽的模型选择。合理流程应在主要结论之前确定规则,并同时报告保留与处理后的敏感性结果。

单点影响:删一分析量化结论的脆弱性

设完整样本估计量为 θ^\hat\theta,删除第 ii 个观测后的估计量为 θ^(i)\hat\theta_{(i)}。逐点计算

Δi=θ^(i)θ^\Delta_i=\hat\theta_{(i)}-\hat\theta

就能看到每个观测对结论的影响。本章若令 θ^=xˉ\hat\theta=\bar x,删除 xix_i 后有

xˉ(i)=nxˉxin1,\bar x_{(i)}=\frac{n\bar x-x_i}{n-1},

因此

xˉ(i)xˉ=xˉxin1.\bar x_{(i)}-\bar x=\frac{\bar x-x_i}{n-1}.

删除 3030 使均值下降 16/91.7816/9\approx1.78 秒;删除一个恰好等于均值的 1414,均值完全不变。该公式把“哪个点重要”化成了可计算的影响量。

Jackknife(刀切法)使用这组删一重复值估计偏差和标准误。本章沿用相同计算做敏感性诊断:若结论方向、效应大小或显著性由单个观测决定,报告中应明确呈现这种依赖。用于预测误差评估的留一交叉验证使用相似的数据拆分,目标与汇总公式另有区别。

指标通过以后,身份问题仍未解决

删除 3030 与把它缩尾到 1414 都能让报告合格。现有数值证据只完成了三项判断:3030 被 IQR 围栏标记;普通 z 分数受到自身抬高尺度的影响;稳健 z 分数显示它离样本中部很远。三项结果都不能决定 3030 是否错误。

若设备日志显示该次运行计时器在中途暂停,删除或按可恢复记录修正具有来源证据。若日志显示缓存失效导致真实的 3030 秒运行,它属于系统可靠性的一部分;删除会把研究对象从“全部运行”改成“未发生缓存失效的运行”。若日志已经丢失,主分析应保留原值,同时并列呈现删除和缩尾敏感性,避免让最有利结果冒充唯一结果。

一条可复核的异常值处理链

本章的远端点处理可以整理为五步。

  1. 标记:用排序图、箱线图、普通尺度与稳健尺度找到候选点;

  2. 追源:查原始记录、单位、设备日志、入组条件与运行环境;

  3. 定规则:写明删除、修正或缩尾的阈值与理由;

  4. 并列分析:至少保留原始结果和规则处理后的结果;

  5. 解释对象:说明每个结果对应的总体、时间范围和风险含义。

这条链条也构成审计路线。审查者可以逐项检查规则何时制定、身份如何确认、结论对该点有多敏感,以及尾部信息是否得到保留。

本章的选择发生在观测记录和处理门槛上。第五章把选择轴移到时间:保留每条真实记录,通过挑选最有利的累计分析时点改变结论,并由此进入序贯检验。

本章知识链

  1. 顺序统计量把单次尾概率换算为整批样本出现极端值的概率,阈值必须随样本量调整。

  2. 四分位距负责初步标记;同样本均值与标准差构成的 zz 分数会产生掩蔽,MAD 提供较稳定的中心与尺度。

  3. 验收约束反推出只有删除 3030 才能通过均值线;缩尾上界允许实数时为 [14,16.988][14,16.988\ldots],限于整秒时为 14,15,1614,15,16

  4. 删除改变分析对象,缩尾保留对象并限制数值影响;两种操作都需要事前规则和来源证据。

  5. 删一分析量化结论对单点的依赖。影响大只能说明结果脆弱,观测身份仍需日志、入组规则与失效机制确认。

思考与练习

  1. 若单个观测超过阈值 aa 的概率为 0.010.01,计算 n=10,50,100n=10,50,100 时样本中至少出现一个超阈值观测的概率。描述样本量带来的变化。

  2. 证明使用同一样本的均值与样本标准差时,zi(n1)/n|z_i|\le(n-1)/\sqrt n。求最小的 nn,使某个样本标准分数有可能超过 33

  3. 对数据 2,3,3,4,4,5,5,6,182,3,3,4,4,5,5,6,18,分别计算均值、样本标准差、中位数、MAD、普通标准分数与稳健标准分数。

  4. 对本章数据分别采用上界 18.518.5 和上界 1414 进行缩尾。比较两种规则的均值与样本方差,并解释选择门槛时需要哪些外部依据。

  5. 设某性能指标的极慢运行来自真实的缓存失效。分别讨论删除该点对“典型速度”与“可靠性风险”两类研究问题的影响。

  6. 写一段异常值处理方案,要求任何复核者只凭方案文本就能重现标记、调查、处理与敏感性分析的全过程。

专题导航