第四章:处置异常值
本章造假目标
十次系统运行时间按整秒记录为
10,11,11,12,12,13,13,14,14,30.
当前结论:样本均值为 14 秒,样本方差为 33.33;两项指标都未通过。
验收目标:平均时间不超过 13 秒,样本方差不超过 4,并原则上保留全部十次运行。
可动范围:设备日志若证明测量失效,可以删除相应记录;预先存在的工程上限若有依据,可以按该上限缩尾。
本章任务:计算哪些操作能够通过报告,再判断 30 属于记录错误、自然尾部或系统中的真实失效,并量化结论对这条记录的依赖。
一条记录决定两条验收线
考虑十次运行时间(单位:秒):
10,11,11,12,12,13,13,14,14,30.
样本均值为 14,样本方差为 33.33。最后一个观测与其余数据相距很远。若删去 30,均值降为 12.22,方差降为 1.94,两条验收线同时通过。删除由此成为最直接的合格路径,也引出本章的核心问题:
离中心很远⟹可以删除吗?
这个箭头通常无法直接成立。
造假动作留下的影子
删除 30 同时改变四件事:样本量从 10 变成 9,均值下降 1.78 秒,方差缩小十余倍,右尾完全消失。两条验收线都由同一次删除越过,核查者会追问删除规则是否在看到结果后才产生。异常值诊断由此承担两项工作:判断“远”在当前样本量下有多罕见,量出结论对这个点有多依赖。
顺序统计量说明极端点为何随样本量出现
删点最直接的理由是“它离其他值太远”。然而,样本越大,最大值自然越容易向外走。要判断 30 的位置,先把“最远点”从视觉印象变成概率问题。把独立同分布样本排序,记为
X(1)≤X(2)≤⋯≤X(n).
X(1) 与 X(n) 分别是最小、最大顺序统计量。若总体分布函数为 F,那么
Pr(X(n)≤a)=Pr(X1≤a,…,Xn≤a)=F(a)n,
从而
Pr(X(n)>a)=1−F(a)n.
该式说明样本量越大,至少遇到一个远端观测的概率越高。假设某个阈值是总体的 97.5% 分位数,单个观测超过它的概率为 2.5%;当 n=10 时,样本中至少有一个观测超过它的概率达到
1−0.97510≈0.224.
若希望整批样本出现超阈值观测的概率恰为 α,在总体分布 F 已知、连续且严格递增时可以令
1−F(aα)n=α,aα=F−1((1−α)1/n).
阈值随 n 改变,控制的是整批样本的误报概率。离散分布未必能让该概率恰好等于 α,此时应选择满足 1−F(a)n≤α 的阈值。实际应用中还需给出可信的总体模型;若 F 的参数也由当前数据估计,阈值校准必须计入参数估计带来的不确定性。因此,“罕见”需要同时说明单次概率、样本量和参照分布。
异常值与极端值
极端值描述观测在样本排序中的位置;异常值包含进一步的判断,意味着该观测与测量机制、目标总体或模型假设存在冲突。排序只能发现候选点,无法单独完成身份认定。
用四分位距标记候选点
普通极差完全由最小值和最大值决定,恰好会被待检查的 30 拉动。箱线图改用中间一半数据建立尺度。四分位距定义为
IQR=Q3−Q1.
箱线图常把下列区间之外的观测标为候选异常点:
[Q1−1.5IQR, Q3+1.5IQR].
对本章数据,按常用的上下半样本取中位数方法,有
Q1=11,Q3=14,IQR=3.
上侧围栏为 14+1.5×3=18.5,所以 30 会被标记。这个结论只把 30 列入调查名单。1.5IQR 是探索性规则,不包含测量过程和研究背景,也不提供删除依据。
方法来路:箱线图为何使用围栏?
John Tukey 在探索性数据分析中推广了箱线图。它用中位数和四分位数快速呈现位置、离散与远端点,适合在建模前寻找问题。对正态分布,1.5IQR 围栏大约落在均值两侧 2.7 个标准差处;这个经验联系解释了其筛查能力,也说明它并非普适的概率边界。
普通标准化可能产生掩蔽
普通标准分数为
zi=sxi−xˉ.
本章样本中,xˉ=14,s=33.33≈5.77,于是
z30=5.7730−14≈2.77.
这里还有一个由样本量决定的上界。令 di=xi−xˉ,则 ∑jdj=0。对其余 n−1 个偏差使用柯西不等式,
j=i∑dj2≥n−1(∑j=idj)2=n−1di2.
因此
s2=n−11j=1∑ndj2≥n−11(di2+n−1di2)=(n−1)2ndi2,
从而
∣zi∣=s∣di∣≤nn−1.
当 s>0 且 n=10 时,上界为 9/10≈2.846。只要均值与标准差由同一组十个观测计算,∣z∣>3 就无法标记其中任何一点。z30≈2.77 接近这个代数上界,低于 3 并不能说明它与数据主体协调。
这个局限来自公式内部:远端点进入分子,也会抬高均值和标准差。多个远端点相互降低标准分数的现象称为掩蔽(masking);远端点移动中心与尺度,进而使普通点被误标的现象称为误标(swamping)。
普通 z 分数在单峰、近似对称且尺度估计稳定时很有用。偏态、厚尾和混合分布需要同时查看分位数与稳健尺度。
中位数与 MAD 提供稳健尺度
用中位数替代均值,用绝对偏差的中位数替代标准差,可得
MAD=median(∣xi−median(x)∣).
对本章数据,
median(x)=12.5,MAD=1.5.
正态分布下,∣Z∣ 的中位数是
Φ−1(0.75)≈0.67449,
所以常用 1/0.67449≈1.4826 对 MAD 进行正态标定:
sMAD=1.4826MAD.
相应的稳健标准分数为
zi(r)=1.4826MADxi−median(x).
于是
z30(r)=1.4826×1.530−12.5≈7.87.
同一个点在普通尺度下距离中心 2.77,在稳健尺度下距离中心 7.87。这个差距本身就是证据:样本标准差受尾部牵引很强。
推导:为何 MAD 更稳健?
少量观测被推远且不足以改变中间次序时,中位数与绝对偏差中位数仍保持稳定;均值和平方偏差则随远端距离增长。稳健性描述估计量对局部污染的反应,尾部仍需检查。大量重复值可能使 MAD=0;此时稳健标准分数没有定义,应检查重复结构或换用其他尺度。
发现远端点以后:先判定它的身份
一个远端观测通常有四类来源。
-
记录错误:小数点、单位、转录或重复记录有误;
-
测量失败:传感器饱和、设备中断、样品污染;
-
总体错位:观测不满足预先规定的入组条件;
-
真实异质性:它来自目标总体中的稀有状态、子群或失效机制。
前三类可以通过原始记录、设备日志和入组规则查证。第四类通常携带重要的工程信息:一次极慢运行也许意味着缓存失效、网络重传或资源竞争。删去它会降低平均运行时间,也会移除系统可靠性问题的直接证据。
若无法恢复观测的生成过程,统计距离只能支持“该点值得调查”。关于删除的决定应来自目标总体与数据生成机制。
删除与缩尾分别声明了什么
当前报告只有删除与缩尾两条可选路径,它们表达不同声明。
删除。
将观测从分析样本中移除。样本量、均值、自由度和目标总体的实际边界都会变化。
缩尾(温莎化)。
保留样本量,把边界之外的数值替换为边界值。若上下界为 L,U,则
xi(w)=⎩⎨⎧L,xi,U,xi<L,L≤xi≤U,xi>U.
先看删除为什么会锁定 30。删除任意 xi 后,新均值为
xˉ(i)=9140−xi.
要通过均值线,必须满足
9140−xi≤13,
即
xi≥23.
十个观测中只有 30 满足。验收线本身已经把删除选择集中到唯一一个点;若规则在看到报告后才制定,选择痕迹非常清楚。
再看缩尾上界怎样受到两条验收线约束。前九个观测的总和为 110、平方和为 1360。把 30 替换为上界 U 后,
xˉ(U)=10110+U.
均值不超过 13 要求 U≤20。样本方差为
s2(U)=91[1360+U2−10(110+U)2]=90.9U2−22U+150.
方差不超过 4 要求
0.9U2−22U+114≤0.
这个二次不等式的两个根为
U±=9110±2460≈7.456, 16.988.
为了只处理 30 而不压低原来的 14,还需 U≥14。若允许实数上界,两项验收条件与“只处理 30”共同给出
14≤U≤9110+2460≈16.988.
本章的运行时间按整秒记录。若工程上限也必须取整,则候选值只有
U∈{14,15,16}
能够同时通过两条线并保持其他观测不变。选择最有利的 U=14,比较三组结果:
| 处理 | 样本量 | 均值 | 样本方差 | 两条线 |
|---|
| 保留原值 | 10 | 14.00 | 33.33 | 均失败 |
| 删除 30 | 9 | 12.22 | 1.94 | 均通过 |
| 将 30 缩尾为 14 | 10 | 12.40 | 2.04 | 均通过 |
删除和缩尾都带来显著改善,但两者表达的统计命题不同。删除相当于宣布该观测不属于分析对象;缩尾承认它属于样本,同时限制其数值影响。U=14 还会让最后三个观测全部等于 14,在上界形成清楚堆积。若目标是描述全部运行风险,尾部状态仍应单独报告。没有事前工程依据时,14,15,16 只是由报告门槛筛出的可行值,当前数据无法证明哪一个是合理上限。
适用边界:规则的时间顺序
先看结果,再尝试多种门槛,最后保留最有利的处理,会把异常值规则变成一项隐蔽的模型选择。合理流程应在主要结论之前确定规则,并同时报告保留与处理后的敏感性结果。
单点影响:删一分析量化结论的脆弱性
设完整样本估计量为 θ^,删除第 i 个观测后的估计量为 θ^(i)。逐点计算
Δi=θ^(i)−θ^
就能看到每个观测对结论的影响。本章若令 θ^=xˉ,删除 xi 后有
xˉ(i)=n−1nxˉ−xi,
因此
xˉ(i)−xˉ=n−1xˉ−xi.
删除 30 使均值下降 16/9≈1.78 秒;删除一个恰好等于均值的 14,均值完全不变。该公式把“哪个点重要”化成了可计算的影响量。
Jackknife(刀切法)使用这组删一重复值估计偏差和标准误。本章沿用相同计算做敏感性诊断:若结论方向、效应大小或显著性由单个观测决定,报告中应明确呈现这种依赖。用于预测误差评估的留一交叉验证使用相似的数据拆分,目标与汇总公式另有区别。
指标通过以后,身份问题仍未解决
删除 30 与把它缩尾到 14 都能让报告合格。现有数值证据只完成了三项判断:30 被 IQR 围栏标记;普通 z 分数受到自身抬高尺度的影响;稳健 z 分数显示它离样本中部很远。三项结果都不能决定 30 是否错误。
若设备日志显示该次运行计时器在中途暂停,删除或按可恢复记录修正具有来源证据。若日志显示缓存失效导致真实的 30 秒运行,它属于系统可靠性的一部分;删除会把研究对象从“全部运行”改成“未发生缓存失效的运行”。若日志已经丢失,主分析应保留原值,同时并列呈现删除和缩尾敏感性,避免让最有利结果冒充唯一结果。
一条可复核的异常值处理链
本章的远端点处理可以整理为五步。
-
标记:用排序图、箱线图、普通尺度与稳健尺度找到候选点;
-
追源:查原始记录、单位、设备日志、入组条件与运行环境;
-
定规则:写明删除、修正或缩尾的阈值与理由;
-
并列分析:至少保留原始结果和规则处理后的结果;
-
解释对象:说明每个结果对应的总体、时间范围和风险含义。
这条链条也构成审计路线。审查者可以逐项检查规则何时制定、身份如何确认、结论对该点有多敏感,以及尾部信息是否得到保留。
本章的选择发生在观测记录和处理门槛上。第五章把选择轴移到时间:保留每条真实记录,通过挑选最有利的累计分析时点改变结论,并由此进入序贯检验。
本章知识链
-
顺序统计量把单次尾概率换算为整批样本出现极端值的概率,阈值必须随样本量调整。
-
四分位距负责初步标记;同样本均值与标准差构成的 z 分数会产生掩蔽,MAD 提供较稳定的中心与尺度。
-
验收约束反推出只有删除 30 才能通过均值线;缩尾上界允许实数时为 [14,16.988…],限于整秒时为 14,15,16。
-
删除改变分析对象,缩尾保留对象并限制数值影响;两种操作都需要事前规则和来源证据。
-
删一分析量化结论对单点的依赖。影响大只能说明结果脆弱,观测身份仍需日志、入组规则与失效机制确认。
思考与练习
-
若单个观测超过阈值 a 的概率为 0.01,计算 n=10,50,100 时样本中至少出现一个超阈值观测的概率。描述样本量带来的变化。
-
证明使用同一样本的均值与样本标准差时,∣zi∣≤(n−1)/n。求最小的 n,使某个样本标准分数有可能超过 3。
-
对数据 2,3,3,4,4,5,5,6,18,分别计算均值、样本标准差、中位数、MAD、普通标准分数与稳健标准分数。
-
对本章数据分别采用上界 18.5 和上界 14 进行缩尾。比较两种规则的均值与样本方差,并解释选择门槛时需要哪些外部依据。
-
设某性能指标的极慢运行来自真实的缓存失效。分别讨论删除该点对“典型速度”与“可靠性风险”两类研究问题的影响。
-
写一段异常值处理方案,要求任何复核者只凭方案文本就能重现标记、调查、处理与敏感性分析的全过程。
专题导航