第九章:把共同极端从右上角移走

本章造假目标

同一批 10 个事件各有两类损失记录。把第一列的秩固定为 1,,101,\ldots,10,当前第二列的秩排列为

A=(4,8,3,5,1,2,6,10,9,7).A=(4,8,3,5,1,2,6,10,9,7).

两列的 Spearman 秩相关为 73/1650.442473/165\approx0.4424。第一列位于最高 20%20\% 的两条记录中,有一条的第二列也位于最高 20%20\%,条件共现率为 1/21/2。验收要求两列的秩集合完全不变、Spearman 秩相关保持精确值 73/16573/165,同时把条件共现率降到不超过 10%10\%。允许的基本操作只有交换第二列在两行之间的配对。任务是求出最少交换次数,构造通过验收的排列,再用 Copula、尾相依和压力切片说明整体秩相关为何无法概括右上角的联合极端。

整体秩相关把十组配对压缩成一个数。风险分析还会单独询问:已知第一类损失进入高分位区间,第二类损失也进入该区间的概率有多大。本章先完成秩交换,再从分布函数和条件概率出发,引出 Copula、尾相依与有限样本压力指标。

先把 Spearman 秩相关写成可计算约束

Spearman 秩相关是两列秩的 Pearson 相关。暂取一般样本量 nn,记两列无并列秩为 Ri,SiR_i,S_i,它们都是 1,,n1,\ldots,n 的一个排列,均值均为

Rˉ=Sˉ=n+12.\bar R=\bar S=\frac{n+1}{2}.

每列秩的离均差平方和相同:

Q=i=1n(RiRˉ)2=i=1n(SiSˉ)2=n(n21)12.Q=\sum_{i=1}^n(R_i-\bar R)^2 =\sum_{i=1}^n(S_i-\bar S)^2 =\frac{n(n^2-1)}{12}.

令平方秩差和

D=i=1n(RiSi)2.D=\sum_{i=1}^n(R_i-S_i)^2.

RiSiR_i-S_i 写成两个中心化秩之差,可得

D=i=1n[(RiRˉ)(SiSˉ)]2=2Q2i=1n(RiRˉ)(SiSˉ).\begin{aligned} D &=\sum_{i=1}^n\bigl[(R_i-\bar R)-(S_i-\bar S)\bigr]^2\\ &=2Q-2\sum_{i=1}^n(R_i-\bar R)(S_i-\bar S). \end{aligned}

因此

ρS=i(RiRˉ)(SiSˉ)Q=16Dn(n21).\rho_S =\frac{\sum_i(R_i-\bar R)(S_i-\bar S)}{Q} =1-\frac{6D}{n(n^2-1)}.

这说明常用公式来自 Pearson 相关的代数展开,其中“无并列秩”是必要条件;存在并列秩时,应先给并列值分配平均秩,再直接计算秩的 Pearson 相关。

章首数据取 Ri=iR_i=iSi=AiS_i=A_i,平方秩差和为

DA=i=110(iAi)2=92.D_A=\sum_{i=1}^{10}(i-A_i)^2=92.

所以

ρS(A)=16×9210(1021)=731650.4424.\rho_S(A) =1-\frac{6\times92}{10(10^2-1)} =\frac{73}{165} \approx0.4424.

再看第一列最高 20%20\% 的两条记录,即 Ri9R_i\ge9 的第 9、10 行。对应的第二列秩为

(A9,A10)=(9,7).(A_9,A_{10})=(9,7).

p^U(0.8)\widehat p_U(0.8) 表示“第一列进入最高 20%20\% 后,第二列也进入最高 20%20\%”的样本条件共现率,则

p^U(0.8)=1(A99)+1(A109)2=12.\widehat p_U(0.8) =\frac{\mathbf 1(A_9\ge9)+\mathbf 1(A_{10}\ge9)}{2} =\frac12.

分母只有 2,可实现的比例只有 0,1/2,10,1/2,1。验收上限 10%10\% 在这组数据上等价于把共同极端条数降到 0。

方法来路:秩相关最初要解决什么

Spearman 在 1904 年讨论两个量之间的关联测量,并给出用秩差计算相关的方法。秩相关允许顺序信息直接进入相关分析:变量经过严格单调递增变换后,数值尺度会改变,秩及其 Spearman 相关保持不变。

造假动作留下的影子

交换不会更改任何损失数值,只会更改“高值与谁配对”。两列边缘分布和整体 Spearman 秩相关可以保持原样,秩散点图右上角却会失去观测。原始行号、事件时间和两类损失的共同事故编号能够恢复被交换的配对。

两次交换怎样保持整体秩相关

设第 i,ji,j 行的第二列秩原为 a,ba,b。交换这两个秩后,平方秩差和的变化为

ΔD=(ib)2+(ja)2(ia)2(jb)2=2(ij)(ab).\begin{aligned} \Delta D &=(i-b)^2+(j-a)^2-(i-a)^2-(j-b)^2\\ &=2(i-j)(a-b). \end{aligned}

这里 iji\ne j,而排列中的秩互不相同,所以 aba\ne b,进而 ΔD0\Delta D\ne0。任何一次有效交换都会改变 DD,也就会改变 Spearman 秩相关。要移走第 9 行的尾部秩并保持精确相关,至少需要两次交换,让两次 ΔD\Delta D 互相抵消。

先交换第 2、4 行的秩 8855

ΔD1=2(24)(85)=12.\Delta D_1 =2(2-4)(8-5) =-12.

得到

A(1)=(4,5,3,8,1,2,6,10,9,7),DA(1)=80.A^{(1)}=(4,5,3,8,1,2,6,10,9,7), \qquad D_{A^{(1)}}=80.

再交换第 7、9 行的秩 6699

ΔD2=2(79)(69)=12.\Delta D_2 =2(7-9)(6-9) =12.

两项变化之和为 0。完整的两步操作为

A=(4,8,3,5,1,2,6,10,9,7)(4,5,3,8,1,2,6,10,9,7)(4,5,3,8,1,2,9,10,6,7)=B.\begin{aligned} A &=(4,8,3,5,1,2,6,10,9,7)\\ &\longrightarrow(4,5,3,8,1,2,6,10,9,7)\\ &\longrightarrow(4,5,3,8,1,2,9,10,6,7)=B. \end{aligned}

最终排列满足

DB=80+12=92,ρS(B)=73165.D_B=80+12=92, \qquad \rho_S(B)=\frac{73}{165}.

第 9、10 行的第二列秩变成

(B9,B10)=(6,7),(B_9,B_{10})=(6,7),

所以

p^U(0.8)=0.\widehat p_U(0.8)=0.

两次交换通过全部验收。前面的 ΔD0\Delta D\ne0 已经排除单次交换,因此两次也是最少操作。

两组排列拥有相同 Spearman 秩相关。阴影区表示两列秩都不低于 9;排列 A 有一个点落入该区,排列 B 没有。

两组排列拥有相同 Spearman 秩相关。阴影区表示两列秩都不低于 9;排列 AA 有一个点落入该区,排列 BB 没有。

下图 把标量相关与局部尾部的差别直接画了出来。这个十点例子用于证明构造与最少操作;尾部只含两条记录,条件共现率本身十分不稳定,后文还要单独处理有限样本不确定性。

不同量纲怎样统一到分位尺度

金额、百分比和持续时间没有共同的数值阈值。分位位置提供了无量纲尺度:各自超过第 9595 百分位,都表示进入本变量最高 5%5\% 的区域。

先假设随机变量 XX 的分布函数 FXF_X 连续且严格递增,并定义

U=FX(X).U=F_X(X).

0<u<10<u<1

Pr(Uu)=Pr(FX(X)u)=Pr(XFX1(u))=u.\begin{aligned} \Pr(U\le u) &=\Pr(F_X(X)\le u)\\ &=\Pr(X\le F_X^{-1}(u))\\ &=u. \end{aligned}

因此

UUniform(0,1).U\sim \operatorname{Uniform}(0,1).

这称为概率积分变换。正态、对数正态和连续厚尾分布经过各自的分布函数后都会变成 (0,1)(0,1) 上的均匀变量。变换删除了量纲与边缘形状,保留每个观测在本变量中的分位位置。连续但不严格递增时,可把 FX1F_X^{-1} 理解为广义逆;结论仍成立。

真实分布函数未知时,经验分布函数为

F^n(x)=1nj=1n1(Xjx).\widehat F_n(x) =\frac1n\sum_{j=1}^n\mathbf 1(X_j\le x).

样本没有并列值时,F^n(Xi)=Ri/n\widehat F_n(X_i)=R_i/n。Copula 建模还常使用伪观测

U^i=Rin+1.\widehat U_i=\frac{R_i}{n+1}.

分母 n+1n+1 使伪观测避开端点 0 和 1,后续使用正态或 t 分位数变换时不会得到无穷值。Ri/nR_i/n 是经验分布函数在样本点上的取值,Ri/(n+1)R_i/(n+1) 是一种绘图位置约定。二者之差为

RinRin+1=Rin(n+1)1n+1,\frac{R_i}{n}-\frac{R_i}{n+1} =\frac{R_i}{n(n+1)} \le\frac1{n+1},

数值接近,承担的任务不同。

秩空间保留什么

严格单调递增变换会改变数值距离和边缘形状,却不会改变排序。秩空间保留“高分位与谁配对、低分位与谁配对”的结构。章首交换只改动这种配对结构。

边缘分布与配对结构怎样分开

U=FX(X),V=FY(Y).U=F_X(X),\qquad V=F_Y(Y).

在连续边缘下,二者都服从 Uniform(0,1)\operatorname{Uniform}(0,1)。定义

C(u,v)=Pr(Uu,Vv)C(u,v)=\Pr(U\le u,V\le v)

并称 CC(X,Y)(X,Y) 的 Copula。它是一张定义在单位正方形上的二维分布函数,两个边缘均为均匀分布。

Sklar 定理从一般联合分布出发。若 HH(X,Y)(X,Y) 的联合分布函数,边缘分布函数为 FX,FYF_X,F_Y,则存在 Copula CC,使

H(x,y)=C(FX(x),FY(y)),H(x,y)=C\bigl(F_X(x),F_Y(y)\bigr),

对所有 x,yx,y 成立。两个边缘连续时,CC 唯一;给定任意 Copula 与两个一维分布函数,右侧也会构成一个合法的联合分布函数。

这条分解把联合建模分成两部分:FX,FYF_X,F_Y 决定各变量的单位、偏度、厚尾和其他边缘特征;CC 决定两个分位位置怎样配对。

若要生成数据,可先从 CC 生成 (U,V)(U,V),再令

X=FX1(U),Y=FY1(V).X=F_X^{-1}(U),\qquad Y=F_Y^{-1}(V).

因此,改变 Copula 可以保留两个边缘分布,同时改变联合极端。

样本中的对应对象是经验 Copula。用两列伪观测 U^i,V^i\widehat U_i,\widehat V_i 定义

C^n(u,v)=1ni=1n1(U^iu,V^iv).\widehat C_n(u,v) =\frac1n\sum_{i=1}^n \mathbf 1(\widehat U_i\le u,\widehat V_i\le v).

排列 AABB 的两列伪观测集合完全相同,经验边缘也相同;行内配对发生变化,所以两张经验 Copula 在单位正方形的局部区域并不相同。

方法来路:为什么需要 Copula?

Abe Sklar 在 1959 年研究多维分布函数与其边缘分布的关系,并给出后来以他命名的分解定理。该定理允许研究者分别选择边缘模型和依赖模型;当变量量纲不同、边缘尾部形状不同或联合极端需要单独控制时,这种分工尤其有用。

适用边界:离散边缘需要额外约定

XX 离散,FX(X)F_X(X) 通常不服从连续均匀分布,Copula 在边缘分布取值范围之外也不唯一。引入独立的 WUniform(0,1)W\sim\operatorname{Uniform}(0,1) 后,随机化变换

U=FX(X)+W[FX(X)FX(X)]U=F_X(X^-)+W\bigl[F_X(X)-F_X(X^-)\bigr]

可以在每个概率跳跃内均匀铺开,其中 FX(x)F_X(x^-) 表示 xx 左侧的分布函数极限。实际秩似然与离散 Copula 估计还需明确并列值和随机化规则。

Spearman 秩相关为何看不见局部尾部

在连续总体中,Spearman 秩相关可写成

ρS=Corr(U,V).\rho_S=\operatorname{Corr}(U,V).

由于 U,VUniform(0,1)U,V\sim\operatorname{Uniform}(0,1),均值为 1/21/2,方差为 1/121/12,所以

ρS=12E(UV)3.\rho_S=12\mathbb{E}(UV)-3.

0U,V10\le U,V\le1,有逐点恒等式

UV=01011(U>u,V>v)dudv.UV =\int_0^1\int_0^1 \mathbf 1(U>u,V>v)\,\mathrm du\,\mathrm dv.

两边取期望并交换期望与积分,得到

E(UV)=0101Pr(U>u,V>v)dudv=0101[1uv+C(u,v)]dudv=0101C(u,v)dudv,\begin{aligned} \mathbb{E}(UV) &=\int_0^1\int_0^1\Pr(U>u,V>v)\,\mathrm du\,\mathrm dv\\ &=\int_0^1\int_0^1\bigl[1-u-v+C(u,v)\bigr]\,\mathrm du\,\mathrm dv\\ &=\int_0^1\int_0^1 C(u,v)\,\mathrm du\,\mathrm dv, \end{aligned}

便得到

ρS=120101[C(u,v)uv]dudv.\rho_S =12\int_0^1\int_0^1\bigl[C(u,v)-uv\bigr]\,\mathrm du\,\mathrm dv.

这个公式把 Spearman 秩相关解释为整张 Copula 曲面相对独立 Copula uvuv 的平均偏离。单位正方形右上角的变化可以由中部或其他区域的反向变化抵消。章首两次交换给出了有限样本中的对应现象:平方秩差总和保持 92,右上角的配对却已经改变。

尾相依怎样把极端共现写成极限

先在固定阈值 qq 定义上尾条件共现概率

pU(q)=Pr(V>qU>q).p_U(q)=\Pr(V>q\mid U>q).

上尾相依系数考察阈值逼近端点时,这个条件概率是否仍保持正值:

λU=limq1Pr(V>qU>q),\lambda_U =\lim_{q\to1^-} \Pr(V>q\mid U>q),

其中极限存在时才定义 λU\lambda_U。由于

Pr(U>q,V>q)=12q+C(q,q),Pr(U>q)=1q,\Pr(U>q,V>q)=1-2q+C(q,q), \qquad \Pr(U>q)=1-q,

也可写成

λU=limq112q+C(q,q)1q.\lambda_U =\lim_{q\to1^-} \frac{1-2q+C(q,q)}{1-q}.

下尾条件共现概率与相依系数相应为

pL(q)=Pr(VqUq)=C(q,q)q,λL=limq0+pL(q).p_L(q)=\Pr(V\le q\mid U\le q)=\frac{C(q,q)}q, \qquad \lambda_L=\lim_{q\to0^+}p_L(q).

U,VU,V 独立,C(u,v)=uvC(u,v)=uv。于是

Pr(V>qU>q)=1q0,\Pr(V>q\mid U>q)=1-q\to0,

并且

Pr(VqUq)=q0.\Pr(V\le q\mid U\le q)=q\to0.

所以独立 Copula 满足 λU=λL=0\lambda_U=\lambda_L=0。另一个参照点是完全同向依赖 V=UV=U:只要 U>qU>qVV 就同时超过 qq,因此上下尾相依系数都为 1。

尾相依系数描述阈值无限逼近端点时的极限。λU=0\lambda_U=0 仍允许 pU(0.95)p_U(0.95)pU(0.99)p_U(0.99) 明显大于 0;工程数据能够直接估计的通常也是这些有限阈值概率。

有限样本能够估计哪一个尾部量

给定伪观测 U^i,V^i\widehat U_i,\widehat V_i,令

mq=i=1n1(U^i>q),Kq=i=1n1(U^i>q,V^i>q).m_q=\sum_{i=1}^n\mathbf 1(\widehat U_i>q), \qquad K_q=\sum_{i=1}^n \mathbf 1(\widehat U_i>q,\widehat V_i>q).

只要 mq>0m_q>0,有限阈值条件共现概率的经验估计为

p^U(q)=Kqmq.\widehat p_U(q)=\frac{K_q}{m_q}.

章首取 n=10,q=0.8n=10,q=0.8。因为 Ri/11>0.8R_i/11>0.8 等价于 Ri9R_i\ge9,原排列有 mq=2,Kq=1m_q=2,K_q=1,所以 p^U(0.8)=1/2\widehat p_U(0.8)=1/2;最终排列仍有 mq=2m_q=2,但 Kq=0K_q=0

n=1000,q=0.99n=1000,q=0.99,样本没有并列秩,并使用 Ri/(n+1)R_i/(n+1) 作为伪观测,则恰有 10 个秩超过阈值。即使其中 5 个与第二列共同超阈,p^U(0.99)=0.5\widehat p_U(0.99)=0.5 也只建立在 10 条记录上。按独立伯努利近似,插入式标准误为

SE^=0.5(10.5)100.158.\widehat{\operatorname{SE}} =\sqrt{\frac{0.5(1-0.5)}{10}} \approx0.158.

只有 10 个条件观测时,估计标准误已经接近 0.16,正态近似区间本身也很粗糙。

固定 qq 时,p^U(q)\widehat p_U(q) 的目标量是有限阈值概率 pU(q)p_U(q)。要从数据估计极限 λU\lambda_U,通常让阈值 qnq_n 随样本量上升,并同时满足

qn1,n(1qn).q_n\to1, \qquad n(1-q_n)\to\infty.

第一项让阈值接近尾部极限,第二项保证用于估计的超阈值记录数仍然增长。二者体现尾部估计的偏差–方差权衡。

实际报告应同时给出多个预先规定的 qq、相应的 mq,Kqm_q,K_q 和不确定性区间。查看结果后再挑选最有利阈值,会增加一条结果选择路径。

适用边界:事件聚集会进一步减少有效信息

上面的标准误把条件观测近似看成独立伯努利试验。风暴、故障或市场冲击往往成簇出现,同一簇内记录相关时,有效样本量会低于 mqm_q。时间序列或空间数据需要使用分块重抽样、簇级分析或相应的极值模型。

三类 Copula 怎样产生不同尾部结构

Copula 家族给出 C(u,v)C(u,v) 的具体函数形式。下面只比较三类典型结构,并说明它们的尾部差异从何而来。

Gaussian Copula(高斯 Copula)定义为

CρG(u,v)=Φρ ⁣(Φ1(u),Φ1(v)),1<ρ<1,C_{\rho}^{\mathrm G}(u,v) =\Phi_{\rho}\!\left(\Phi^{-1}(u),\Phi^{-1}(v)\right), \qquad -1<\rho<1,

其中 Φ\Phi 是标准正态分布函数,Φρ\Phi_\rho 是相关参数为 ρ\rho 的二元标准正态分布函数。这里的 ρ\rho 是潜在正态变量的相关参数,不等于原始量纲下任意边缘变量的 Pearson 相关。只要 ρ<1|\rho|<1,Gaussian Copula 的上下尾相依系数都为 0。

tt Copula 用二元 t 分布替换二元正态分布:

Cρ,νt(u,v)=Tρ,ν ⁣(Tν1(u),Tν1(v)),C_{\rho,\nu}^{t}(u,v) =T_{\rho,\nu}\!\left(T_{\nu}^{-1}(u),T_{\nu}^{-1}(v)\right),

其中 ν>0\nu>0 是自由度。它的上下尾相依相同,且

λU=λL=2Tν+1 ⁣((ν+1)(1ρ)1+ρ).\lambda_U=\lambda_L =2T_{\nu+1}\!\left( -\sqrt{\frac{(\nu+1)(1-\rho)}{1+\rho}} \right).

tt Copula 的共同极端可以从尺度混合表示看出。令

Rρ=(1ρρ1),ZN2(0,Rρ),Wχν2,T=ZW/ν,R_\rho= \begin{pmatrix} 1&\rho\\ \rho&1 \end{pmatrix}, \qquad \mathbf Z\sim N_2(\mathbf 0,R_\rho), \qquad W\sim\chi_\nu^2, \qquad \mathbf T=\frac{\mathbf Z}{\sqrt{W/\nu}},

并令 Z\mathbf ZWW 独立。同一个随机分母同时缩放两个坐标;WW 偶尔很小时,两个坐标会一起被放大。固定 ρ\rho 时,较小的 ν\nu 通常产生更强的对称尾部共现。

Gumbel–Hougaard Copula(下文简称 Gumbel Copula)定义为

CθGu(u,v)=exp ⁣{[(logu)θ+(logv)θ]1/θ},θ1.C_\theta^{\mathrm{Gu}}(u,v) =\exp\!\left\{-\left[ (-\log u)^\theta+(-\log v)^\theta \right]^{1/\theta}\right\}, \qquad \theta\ge1.

θ=1\theta=1 时得到独立 Copula。它的下尾相依为 0,上尾相依为

λU=221/θ,\lambda_U=2-2^{1/\theta},

因此能够表达“大值共同出现强于小值共同出现”的非对称结构。

为了在相近的整体依赖强度下比较三个家族,可使用 Kendall 秩相关。取两组独立同分布观测 (X1,Y1)(X_1,Y_1)(X2,Y2)(X_2,Y_2),连续情形下定义

τ=Pr[(X1X2)(Y1Y2)>0]Pr[(X1X2)(Y1Y2)<0].\tau =\Pr\bigl[(X_1-X_2)(Y_1-Y_2)>0\bigr] -\Pr\bigl[(X_1-X_2)(Y_1-Y_2)<0\bigr].

这里的 τ\tau 只用于把三个家族放在可比较的整体依赖水平,章首验收仍使用 Spearman 秩相关。Gaussian 与 tt Copula 满足 τ=2arcsin(ρ)/π\tau=2\arcsin(\rho)/\pi,Gumbel Copula 满足 τ=11/θ\tau=1-1/\theta。把三者都校准到 τ=0.5\tau=0.5,可得到:

家族对应参数λL\lambda_LλU\lambda_U
Gaussianρ=2/2\rho=\sqrt2/20000
ttρ=2/2, ν=4\rho=\sqrt2/2,\ \nu=40.3970.3970.3970.397
Gumbelθ=2\theta=2000.5860.586

三行拥有相同的 Kendall 秩相关,渐近尾部却完全不同。家族选择应结合生成机制、秩空间图形、多个阈值的共现率和压力情景表现;行业名称只能提供初始建模线索。

压力切片怎样检验联合风险

QX(q)=FX1(q)Q_X(q)=F_X^{-1}(q)QY(q)=FY1(q)Q_Y(q)=F_Y^{-1}(q)。连续且严格递增的边缘下,联合超阈概率满足

Pr(X>QX(q),Y>QY(q))=(1q)pU(q).\Pr\bigl(X>Q_X(q),Y>Q_Y(q)\bigr) =(1-q)p_U(q).

因此,整体依赖模型至少应检查以下三类压力量:

Pr(Y>QY(q)X>QX(q)),\Pr\bigl(Y>Q_Y(q)\mid X>Q_X(q)\bigr), E(X+YX>QX(q)),\mathbb{E}\bigl(X+Y\mid X>Q_X(q)\bigr), QX+Y(q).Q_{X+Y}(q).

第一项只用分位位置,直接检查共同极端;后两项还保留原始损失量纲,衡量条件总损失与总损失分位数。若模型能复现整体秩相关,却在高分位条件切片上持续低估共同损失,依赖结构的尾部需要重新建模。比较边缘模型、Copula 家族或参数时,应一次只改变一个组成部分,并保持其他部分固定。

章首的交换会在三类证据中留下差异:

  1. 秩散点图右上角的点数减少;

  2. 多个预先规定的高分位阈值下,mq,Kqm_q,K_q 与条件共现率出现异常变化;

  3. 重新连接原始损失数值后,联合压力损失可能与历史极端或机制模拟不符。

把尾部配对放回审计链

当前排列 AA 的平方秩差和为 92,Spearman 秩相关为 73/1650.442473/165\approx0.4424,最高 20%20\% 条件切片中的共同极端率为 1/21/2。两次交换产生排列 BB;两列的秩集合与平方秩差和都保持不变,第 9、10 行的配对秩改成 (6,7)(6,7),条件共现率降为 0。本章规定的造假目标已经完成。

这些验收指标只覆盖指定报表。整体秩相关平均了十条记录的单调关系,第二次交换用中部的秩差变化抵消了尾部变化。复核时应绘制秩散点图,并在预先规定的多个阈值下同时报告 mqm_qKqK_qp^U(q)\widehat p_U(q) 与不确定性区间。

事件身份提供了更直接的审计证据。同一次风暴、设备故障或市场冲击产生的两类损失应保留共同事件编号;时间戳、原始行号和数据血缘能够检验配对是否被重写。统计图形负责定位异常区域,事件记录负责判断配对是否合理。

本章操纵了完整记录之间的配对。下一章转向观测资格:把治疗组的低结果留成空白,研究缺失位置怎样改变进入报表的样本。

本章知识链

  1. 无并列秩时,Spearman 秩相关等于秩的 Pearson 相关,也等于 16D/[n(n21)]1-6D/[n(n^2-1)]

  2. 一次有效交换必然改变平方秩差和;两次交换可让两项变化抵消,同时改变右上角的尾部配对。

  3. 概率积分变换把连续边缘映射为均匀分位位置;经验分布值 Ri/nR_i/n 与伪观测 Ri/(n+1)R_i/(n+1) 用途不同。

  4. Sklar 定理把联合分布分成边缘与 Copula;Spearman 秩相关是整张 Copula 曲面相对独立情形的平均偏离。

  5. 尾相依系数是极端条件概率的极限;固定阈值样本直接估计的是 pU(q)p_U(q),分母计数决定估计精度。

  6. Gaussian、tt 与 Gumbel Copula 可以拥有相近的整体秩依赖,却分别呈现零尾相依、对称尾相依与上尾相依。

思考与练习

  1. 从秩的 Pearson 相关出发,推导无并列秩时的公式 ρS=16D/[n(n21)]\rho_S=1-6D/[n(n^2-1)]

  2. 验证排列 A,BA,B 的平方秩差和都为 92,并分别计算最高 20%20\% 条件共现率。

  3. 使用 ΔD=2(ij)(ab)\Delta D=2(i-j)(a-b),为排列 AA 找出一组与正文不同的两次交换,使 Spearman 秩相关保持不变、最高 20%20\% 条件共现率降到 0。

  4. XX 服从指数分布 F(x)=1exF(x)=1-e^{-x},证明 U=F(X)U=F(X)(0,1)(0,1) 上均匀。

  5. XBernoulli(p)X\sim\operatorname{Bernoulli}(p)。列出 FX(X)F_X(X) 的可能取值,说明它为何不服从连续均匀分布,并验证随机化概率积分变换。

  6. ρS=Corr(U,V)\rho_S=\operatorname{Corr}(U,V) 推导 ρS=12[C(u,v)uv]dudv\rho_S=12\iint[C(u,v)-uv]\,\mathrm du\,\mathrm dv

  7. 对独立 Copula C(u,v)=uvC(u,v)=uv 与完全同向情形 V=UV=U,分别求 pU(q)p_U(q)λU\lambda_UλL\lambda_L

  8. n=500n=500 的样本中,UU 超过 0.980.98 的观测有 10 个,其中 4 个的 VV 也超过 0.980.98。计算 p^U(0.98)\widehat p_U(0.98) 及独立伯努利近似下的插入式标准误,并讨论估计稳定性。

  9. 验证 τ=0.5\tau=0.5 时,Gaussian 与 tt Copula 的 ρ=2/2\rho=\sqrt2/2,Gumbel Copula 的 θ=2\theta=2;结合表中尾相依系数比较三者的压力风险。

  10. 为一个具有共同故障原因的双传感器系统设计三项审计输出,使边缘分布、整体秩相关和联合尾部都能被检查。

专题导航