第九章:把共同极端从右上角移走
本章造假目标
同一批 10 个事件各有两类损失记录。把第一列的秩固定为 1,…,10,当前第二列的秩排列为
A=(4,8,3,5,1,2,6,10,9,7).
两列的 Spearman 秩相关为 73/165≈0.4424。第一列位于最高 20% 的两条记录中,有一条的第二列也位于最高 20%,条件共现率为 1/2。验收要求两列的秩集合完全不变、Spearman 秩相关保持精确值 73/165,同时把条件共现率降到不超过 10%。允许的基本操作只有交换第二列在两行之间的配对。任务是求出最少交换次数,构造通过验收的排列,再用 Copula、尾相依和压力切片说明整体秩相关为何无法概括右上角的联合极端。
整体秩相关把十组配对压缩成一个数。风险分析还会单独询问:已知第一类损失进入高分位区间,第二类损失也进入该区间的概率有多大。本章先完成秩交换,再从分布函数和条件概率出发,引出 Copula、尾相依与有限样本压力指标。
先把 Spearman 秩相关写成可计算约束
Spearman 秩相关是两列秩的 Pearson 相关。暂取一般样本量 n,记两列无并列秩为 Ri,Si,它们都是 1,…,n 的一个排列,均值均为
Rˉ=Sˉ=2n+1.
每列秩的离均差平方和相同:
Q=i=1∑n(Ri−Rˉ)2=i=1∑n(Si−Sˉ)2=12n(n2−1).
令平方秩差和
D=i=1∑n(Ri−Si)2.
把 Ri−Si 写成两个中心化秩之差,可得
D=i=1∑n[(Ri−Rˉ)−(Si−Sˉ)]2=2Q−2i=1∑n(Ri−Rˉ)(Si−Sˉ).
因此
ρS=Q∑i(Ri−Rˉ)(Si−Sˉ)=1−n(n2−1)6D.
这说明常用公式来自 Pearson 相关的代数展开,其中“无并列秩”是必要条件;存在并列秩时,应先给并列值分配平均秩,再直接计算秩的 Pearson 相关。
章首数据取 Ri=i、Si=Ai,平方秩差和为
DA=i=1∑10(i−Ai)2=92.
所以
ρS(A)=1−10(102−1)6×92=16573≈0.4424.
再看第一列最高 20% 的两条记录,即 Ri≥9 的第 9、10 行。对应的第二列秩为
(A9,A10)=(9,7).
用 pU(0.8) 表示“第一列进入最高 20% 后,第二列也进入最高 20%”的样本条件共现率,则
pU(0.8)=21(A9≥9)+1(A10≥9)=21.
分母只有 2,可实现的比例只有 0,1/2,1。验收上限 10% 在这组数据上等价于把共同极端条数降到 0。
方法来路:秩相关最初要解决什么
Spearman 在 1904 年讨论两个量之间的关联测量,并给出用秩差计算相关的方法。秩相关允许顺序信息直接进入相关分析:变量经过严格单调递增变换后,数值尺度会改变,秩及其 Spearman 相关保持不变。
造假动作留下的影子
交换不会更改任何损失数值,只会更改“高值与谁配对”。两列边缘分布和整体 Spearman 秩相关可以保持原样,秩散点图右上角却会失去观测。原始行号、事件时间和两类损失的共同事故编号能够恢复被交换的配对。
两次交换怎样保持整体秩相关
设第 i,j 行的第二列秩原为 a,b。交换这两个秩后,平方秩差和的变化为
ΔD=(i−b)2+(j−a)2−(i−a)2−(j−b)2=2(i−j)(a−b).
这里 i=j,而排列中的秩互不相同,所以 a=b,进而 ΔD=0。任何一次有效交换都会改变 D,也就会改变 Spearman 秩相关。要移走第 9 行的尾部秩并保持精确相关,至少需要两次交换,让两次 ΔD 互相抵消。
先交换第 2、4 行的秩 8 与 5:
ΔD1=2(2−4)(8−5)=−12.
得到
A(1)=(4,5,3,8,1,2,6,10,9,7),DA(1)=80.
再交换第 7、9 行的秩 6 与 9:
ΔD2=2(7−9)(6−9)=12.
两项变化之和为 0。完整的两步操作为
A=(4,8,3,5,1,2,6,10,9,7)⟶(4,5,3,8,1,2,6,10,9,7)⟶(4,5,3,8,1,2,9,10,6,7)=B.
最终排列满足
DB=80+12=92,ρS(B)=16573.
第 9、10 行的第二列秩变成
(B9,B10)=(6,7),
所以
pU(0.8)=0.
两次交换通过全部验收。前面的 ΔD=0 已经排除单次交换,因此两次也是最少操作。

两组排列拥有相同 Spearman 秩相关。阴影区表示两列秩都不低于 9;排列 A 有一个点落入该区,排列 B 没有。
下图 把标量相关与局部尾部的差别直接画了出来。这个十点例子用于证明构造与最少操作;尾部只含两条记录,条件共现率本身十分不稳定,后文还要单独处理有限样本不确定性。
不同量纲怎样统一到分位尺度
金额、百分比和持续时间没有共同的数值阈值。分位位置提供了无量纲尺度:各自超过第 95 百分位,都表示进入本变量最高 5% 的区域。
先假设随机变量 X 的分布函数 FX 连续且严格递增,并定义
U=FX(X).
对 0<u<1,
Pr(U≤u)=Pr(FX(X)≤u)=Pr(X≤FX−1(u))=u.
因此
U∼Uniform(0,1).
这称为概率积分变换。正态、对数正态和连续厚尾分布经过各自的分布函数后都会变成 (0,1) 上的均匀变量。变换删除了量纲与边缘形状,保留每个观测在本变量中的分位位置。连续但不严格递增时,可把 FX−1 理解为广义逆;结论仍成立。
真实分布函数未知时,经验分布函数为
Fn(x)=n1j=1∑n1(Xj≤x).
样本没有并列值时,Fn(Xi)=Ri/n。Copula 建模还常使用伪观测
Ui=n+1Ri.
分母 n+1 使伪观测避开端点 0 和 1,后续使用正态或 t 分位数变换时不会得到无穷值。Ri/n 是经验分布函数在样本点上的取值,Ri/(n+1) 是一种绘图位置约定。二者之差为
nRi−n+1Ri=n(n+1)Ri≤n+11,
数值接近,承担的任务不同。
秩空间保留什么
严格单调递增变换会改变数值距离和边缘形状,却不会改变排序。秩空间保留“高分位与谁配对、低分位与谁配对”的结构。章首交换只改动这种配对结构。
边缘分布与配对结构怎样分开
令
U=FX(X),V=FY(Y).
在连续边缘下,二者都服从 Uniform(0,1)。定义
C(u,v)=Pr(U≤u,V≤v)
并称 C 为 (X,Y) 的 Copula。它是一张定义在单位正方形上的二维分布函数,两个边缘均为均匀分布。
Sklar 定理从一般联合分布出发。若 H 是 (X,Y) 的联合分布函数,边缘分布函数为 FX,FY,则存在 Copula C,使
H(x,y)=C(FX(x),FY(y)),
对所有 x,y 成立。两个边缘连续时,C 唯一;给定任意 Copula 与两个一维分布函数,右侧也会构成一个合法的联合分布函数。
这条分解把联合建模分成两部分:FX,FY 决定各变量的单位、偏度、厚尾和其他边缘特征;C 决定两个分位位置怎样配对。
若要生成数据,可先从 C 生成 (U,V),再令
X=FX−1(U),Y=FY−1(V).
因此,改变 Copula 可以保留两个边缘分布,同时改变联合极端。
样本中的对应对象是经验 Copula。用两列伪观测 Ui,Vi 定义
Cn(u,v)=n1i=1∑n1(Ui≤u,Vi≤v).
排列 A 与 B 的两列伪观测集合完全相同,经验边缘也相同;行内配对发生变化,所以两张经验 Copula 在单位正方形的局部区域并不相同。
方法来路:为什么需要 Copula?
Abe Sklar 在 1959 年研究多维分布函数与其边缘分布的关系,并给出后来以他命名的分解定理。该定理允许研究者分别选择边缘模型和依赖模型;当变量量纲不同、边缘尾部形状不同或联合极端需要单独控制时,这种分工尤其有用。
适用边界:离散边缘需要额外约定
若 X 离散,FX(X) 通常不服从连续均匀分布,Copula 在边缘分布取值范围之外也不唯一。引入独立的 W∼Uniform(0,1) 后,随机化变换
U=FX(X−)+W[FX(X)−FX(X−)]
可以在每个概率跳跃内均匀铺开,其中 FX(x−) 表示 x 左侧的分布函数极限。实际秩似然与离散 Copula 估计还需明确并列值和随机化规则。
Spearman 秩相关为何看不见局部尾部
在连续总体中,Spearman 秩相关可写成
ρS=Corr(U,V).
由于 U,V∼Uniform(0,1),均值为 1/2,方差为 1/12,所以
ρS=12E(UV)−3.
对 0≤U,V≤1,有逐点恒等式
UV=∫01∫011(U>u,V>v)dudv.
两边取期望并交换期望与积分,得到
E(UV)=∫01∫01Pr(U>u,V>v)dudv=∫01∫01[1−u−v+C(u,v)]dudv=∫01∫01C(u,v)dudv,
便得到
ρS=12∫01∫01[C(u,v)−uv]dudv.
这个公式把 Spearman 秩相关解释为整张 Copula 曲面相对独立 Copula uv 的平均偏离。单位正方形右上角的变化可以由中部或其他区域的反向变化抵消。章首两次交换给出了有限样本中的对应现象:平方秩差总和保持 92,右上角的配对却已经改变。
尾相依怎样把极端共现写成极限
先在固定阈值 q 定义上尾条件共现概率
pU(q)=Pr(V>q∣U>q).
上尾相依系数考察阈值逼近端点时,这个条件概率是否仍保持正值:
λU=q→1−limPr(V>q∣U>q),
其中极限存在时才定义 λU。由于
Pr(U>q,V>q)=1−2q+C(q,q),Pr(U>q)=1−q,
也可写成
λU=q→1−lim1−q1−2q+C(q,q).
下尾条件共现概率与相依系数相应为
pL(q)=Pr(V≤q∣U≤q)=qC(q,q),λL=q→0+limpL(q).
若 U,V 独立,C(u,v)=uv。于是
Pr(V>q∣U>q)=1−q→0,
并且
Pr(V≤q∣U≤q)=q→0.
所以独立 Copula 满足 λU=λL=0。另一个参照点是完全同向依赖 V=U:只要 U>q,V 就同时超过 q,因此上下尾相依系数都为 1。
尾相依系数描述阈值无限逼近端点时的极限。λU=0 仍允许 pU(0.95) 或 pU(0.99) 明显大于 0;工程数据能够直接估计的通常也是这些有限阈值概率。
有限样本能够估计哪一个尾部量
给定伪观测 Ui,Vi,令
mq=i=1∑n1(Ui>q),Kq=i=1∑n1(Ui>q,Vi>q).
只要 mq>0,有限阈值条件共现概率的经验估计为
pU(q)=mqKq.
章首取 n=10,q=0.8。因为 Ri/11>0.8 等价于 Ri≥9,原排列有 mq=2,Kq=1,所以 pU(0.8)=1/2;最终排列仍有 mq=2,但 Kq=0。
若 n=1000,q=0.99,样本没有并列秩,并使用 Ri/(n+1) 作为伪观测,则恰有 10 个秩超过阈值。即使其中 5 个与第二列共同超阈,pU(0.99)=0.5 也只建立在 10 条记录上。按独立伯努利近似,插入式标准误为
SE=100.5(1−0.5)≈0.158.
只有 10 个条件观测时,估计标准误已经接近 0.16,正态近似区间本身也很粗糙。
固定 q 时,pU(q) 的目标量是有限阈值概率 pU(q)。要从数据估计极限 λU,通常让阈值 qn 随样本量上升,并同时满足
qn→1,n(1−qn)→∞.
第一项让阈值接近尾部极限,第二项保证用于估计的超阈值记录数仍然增长。二者体现尾部估计的偏差–方差权衡。
实际报告应同时给出多个预先规定的 q、相应的 mq,Kq 和不确定性区间。查看结果后再挑选最有利阈值,会增加一条结果选择路径。
适用边界:事件聚集会进一步减少有效信息
上面的标准误把条件观测近似看成独立伯努利试验。风暴、故障或市场冲击往往成簇出现,同一簇内记录相关时,有效样本量会低于 mq。时间序列或空间数据需要使用分块重抽样、簇级分析或相应的极值模型。
三类 Copula 怎样产生不同尾部结构
Copula 家族给出 C(u,v) 的具体函数形式。下面只比较三类典型结构,并说明它们的尾部差异从何而来。
Gaussian Copula(高斯 Copula)定义为
CρG(u,v)=Φρ(Φ−1(u),Φ−1(v)),−1<ρ<1,
其中 Φ 是标准正态分布函数,Φρ 是相关参数为 ρ 的二元标准正态分布函数。这里的 ρ 是潜在正态变量的相关参数,不等于原始量纲下任意边缘变量的 Pearson 相关。只要 ∣ρ∣<1,Gaussian Copula 的上下尾相依系数都为 0。
t Copula 用二元 t 分布替换二元正态分布:
Cρ,νt(u,v)=Tρ,ν(Tν−1(u),Tν−1(v)),
其中 ν>0 是自由度。它的上下尾相依相同,且
λU=λL=2Tν+1(−1+ρ(ν+1)(1−ρ)).
t Copula 的共同极端可以从尺度混合表示看出。令
Rρ=(1ρρ1),Z∼N2(0,Rρ),W∼χν2,T=W/νZ,
并令 Z 与 W 独立。同一个随机分母同时缩放两个坐标;W 偶尔很小时,两个坐标会一起被放大。固定 ρ 时,较小的 ν 通常产生更强的对称尾部共现。
Gumbel–Hougaard Copula(下文简称 Gumbel Copula)定义为
CθGu(u,v)=exp{−[(−logu)θ+(−logv)θ]1/θ},θ≥1.
当 θ=1 时得到独立 Copula。它的下尾相依为 0,上尾相依为
λU=2−21/θ,
因此能够表达“大值共同出现强于小值共同出现”的非对称结构。
为了在相近的整体依赖强度下比较三个家族,可使用 Kendall 秩相关。取两组独立同分布观测 (X1,Y1) 与 (X2,Y2),连续情形下定义
τ=Pr[(X1−X2)(Y1−Y2)>0]−Pr[(X1−X2)(Y1−Y2)<0].
这里的 τ 只用于把三个家族放在可比较的整体依赖水平,章首验收仍使用 Spearman 秩相关。Gaussian 与 t Copula 满足 τ=2arcsin(ρ)/π,Gumbel Copula 满足 τ=1−1/θ。把三者都校准到 τ=0.5,可得到:
| 家族 | 对应参数 | λL | λU |
|---|
| Gaussian | ρ=2/2 | 0 | 0 |
| t | ρ=2/2, ν=4 | 0.397 | 0.397 |
| Gumbel | θ=2 | 0 | 0.586 |
三行拥有相同的 Kendall 秩相关,渐近尾部却完全不同。家族选择应结合生成机制、秩空间图形、多个阈值的共现率和压力情景表现;行业名称只能提供初始建模线索。
压力切片怎样检验联合风险
令 QX(q)=FX−1(q)、QY(q)=FY−1(q)。连续且严格递增的边缘下,联合超阈概率满足
Pr(X>QX(q),Y>QY(q))=(1−q)pU(q).
因此,整体依赖模型至少应检查以下三类压力量:
Pr(Y>QY(q)∣X>QX(q)),
E(X+Y∣X>QX(q)),
QX+Y(q).
第一项只用分位位置,直接检查共同极端;后两项还保留原始损失量纲,衡量条件总损失与总损失分位数。若模型能复现整体秩相关,却在高分位条件切片上持续低估共同损失,依赖结构的尾部需要重新建模。比较边缘模型、Copula 家族或参数时,应一次只改变一个组成部分,并保持其他部分固定。
章首的交换会在三类证据中留下差异:
-
秩散点图右上角的点数减少;
-
多个预先规定的高分位阈值下,mq,Kq 与条件共现率出现异常变化;
-
重新连接原始损失数值后,联合压力损失可能与历史极端或机制模拟不符。
把尾部配对放回审计链
当前排列 A 的平方秩差和为 92,Spearman 秩相关为 73/165≈0.4424,最高 20% 条件切片中的共同极端率为 1/2。两次交换产生排列 B;两列的秩集合与平方秩差和都保持不变,第 9、10 行的配对秩改成 (6,7),条件共现率降为 0。本章规定的造假目标已经完成。
这些验收指标只覆盖指定报表。整体秩相关平均了十条记录的单调关系,第二次交换用中部的秩差变化抵消了尾部变化。复核时应绘制秩散点图,并在预先规定的多个阈值下同时报告 mq、Kq、pU(q) 与不确定性区间。
事件身份提供了更直接的审计证据。同一次风暴、设备故障或市场冲击产生的两类损失应保留共同事件编号;时间戳、原始行号和数据血缘能够检验配对是否被重写。统计图形负责定位异常区域,事件记录负责判断配对是否合理。
本章操纵了完整记录之间的配对。下一章转向观测资格:把治疗组的低结果留成空白,研究缺失位置怎样改变进入报表的样本。
本章知识链
-
无并列秩时,Spearman 秩相关等于秩的 Pearson 相关,也等于 1−6D/[n(n2−1)]。
-
一次有效交换必然改变平方秩差和;两次交换可让两项变化抵消,同时改变右上角的尾部配对。
-
概率积分变换把连续边缘映射为均匀分位位置;经验分布值 Ri/n 与伪观测 Ri/(n+1) 用途不同。
-
Sklar 定理把联合分布分成边缘与 Copula;Spearman 秩相关是整张 Copula 曲面相对独立情形的平均偏离。
-
尾相依系数是极端条件概率的极限;固定阈值样本直接估计的是 pU(q),分母计数决定估计精度。
-
Gaussian、t 与 Gumbel Copula 可以拥有相近的整体秩依赖,却分别呈现零尾相依、对称尾相依与上尾相依。
思考与练习
-
从秩的 Pearson 相关出发,推导无并列秩时的公式 ρS=1−6D/[n(n2−1)]。
-
验证排列 A,B 的平方秩差和都为 92,并分别计算最高 20% 条件共现率。
-
使用 ΔD=2(i−j)(a−b),为排列 A 找出一组与正文不同的两次交换,使 Spearman 秩相关保持不变、最高 20% 条件共现率降到 0。
-
若 X 服从指数分布 F(x)=1−e−x,证明 U=F(X) 在 (0,1) 上均匀。
-
令 X∼Bernoulli(p)。列出 FX(X) 的可能取值,说明它为何不服从连续均匀分布,并验证随机化概率积分变换。
-
从 ρS=Corr(U,V) 推导 ρS=12∬[C(u,v)−uv]dudv。
-
对独立 Copula C(u,v)=uv 与完全同向情形 V=U,分别求 pU(q)、λU 和 λL。
-
在 n=500 的样本中,U 超过 0.98 的观测有 10 个,其中 4 个的 V 也超过 0.98。计算 pU(0.98) 及独立伯努利近似下的插入式标准误,并讨论估计稳定性。
-
验证 τ=0.5 时,Gaussian 与 t Copula 的 ρ=2/2,Gumbel Copula 的 θ=2;结合表中尾相依系数比较三者的压力风险。
-
为一个具有共同故障原因的双传感器系统设计三项审计输出,使边缘分布、整体秩相关和联合尾部都能被检查。
专题导航