第十六章:把上升序列排成无趋势报表

本章造假目标

六期传感器读数按真实时间排列为

A=(1,2,3,4,5,6).A=(1,2,3,4,5,6).

它的均值为 3.53.5,样本方差为 3.53.5,对时间的 OLS 斜率为 1,当前结论是“读数持续上升,需要触发告警”。验收表要求保留六个原始读数及所有只依赖取值集合的统计量,同时把时间斜率压到

β^t0.3.|\widehat\beta_t|\le 0.3.

允许的操作只有重排时间标签,不得修改、复制或删除读数。

本章选取

B=(1,6,2,5,3,4)B=(1,6,2,5,3,4)

作为贯穿示例。它把斜率降到 9/350.2579/35\approx0.257,机械条件随即通过。前半章从置换搜索进入相邻配对、自相关、差分和 AR(1),追踪一步记忆怎样被改写;后半章再用平稳性、单位根、残差白噪声、频域、变点和另一条传感器序列检查同一排列的跨期后果。

时间索引把取值集合变成有序数据

先比较两条序列:

A=(1,2,3,4,5,6),B=(1,6,2,5,3,4).A=(1,2,3,4,5,6), \qquad B=(1,6,2,5,3,4).

二者包含同一个多重集合

{1,2,3,4,5,6}.\{1,2,3,4,5,6\}.

因此,均值、样本方差、最小值、最大值、经验分布函数、分位数和直方图全部相同。凡是只读取单个取值及其出现次数的统计量,都无法区分 AABB。折线、相邻差分、连续运行长度和滞后配对则会改变,因为这些量同时读取数值和位置。

把随机过程记为

(X1,,XT).(X_1,\ldots,X_T).

若对任意置换 π\pi 都有

(X1,,XT)=d(Xπ(1),,Xπ(T)),(X_1,\ldots,X_T) \overset{d}{=} (X_{\pi(1)},\ldots,X_{\pi(T)}),

则这组随机变量具有可交换性。独立同分布观测满足这一性质。第十五章的 Bernoulli 试验在给定共同成功概率后独立且可交换;积分掉随机成功概率后,它们失去边际独立性,仍然保持可交换性。一般时间过程的联合分布可以按时间分解为

f(x1,,xT)=f(x1)t=2Tf(xtx1,,xt1).f(x_1,\ldots,x_T) =f(x_1)\prod_{t=2}^{T} f(x_t\mid x_1,\ldots,x_{t-1}).

一旦条件分布依赖过去,置换就会改写联合结构。时间戳、采样间隔和先后顺序由此成为观测的一部分。

适用边界:一条序列与一个随机过程

AABB 是两条已经观察到的有限序列。平稳性、自相关模型和预测分布描述生成这些序列的随机过程。仅凭六个点无法确认某个过程模型;本章用六点例子展示代数变化,推断结论必须依靠更长记录、预先规定的分析和采集机制。

趋势斜率是数据在时间方向上的投影

令时间索引为

t=(1,2,3,4,5,6).t=(1,2,3,4,5,6).

含截距的线性趋势通过最小化

Q(α,β)=j=16(xjαβtj)2Q(\alpha,\beta) =\sum_{j=1}^{6}(x_j-\alpha-\beta t_j)^2

得到。对 α\alpha 求导可得 α^=xˉβ^ttˉ\widehat\alpha=\bar x-\widehat\beta_t\bar t;代回第二条正规方程,便有

β^t=StxStt,\widehat\beta_t =\frac{S_{tx}}{S_{tt}},

其中

Stx=j=16(tjtˉ)(xjxˉ),Stt=j=16(tjtˉ)2.S_{tx}=\sum_{j=1}^{6}(t_j-\bar t)(x_j-\bar x), \qquad S_{tt}=\sum_{j=1}^{6}(t_j-\bar t)^2.

本例 tˉ=xˉ=7/2\bar t=\bar x=7/2,并且

Stt=(52)2+(32)2+(12)2+(12)2+(32)2+(52)2=352.S_{tt} =\left(-\frac52\right)^2 +\left(-\frac32\right)^2 +\left(-\frac12\right)^2 +\left(\frac12\right)^2 +\left(\frac32\right)^2 +\left(\frac52\right)^2 =\frac{35}{2}.

对原序列 AA,读数恰好等于时间索引,所以

StA=352,β^t,A=1.S_{tA}=\frac{35}{2}, \qquad \widehat\beta_{t,A}=1.

对重排序列 BB

StB=92,β^t,B=9/235/2=9350.257.S_{tB}=\frac92, \qquad \widehat\beta_{t,B} =\frac{9/2}{35/2} =\frac9{35} \approx0.257.

它通过了 β^t0.3|\widehat\beta_t|\le0.3。由于 xx 仍是 1,,61,\ldots,6 的一个排列,Sxx=SttS_{xx}=S_{tt},本例还满足

rt,x=StxSttSxx=β^t.r_{t,x} =\frac{S_{tx}}{\sqrt{S_{tt}S_{xx}}} =\widehat\beta_t.

这个等式依赖时间与读数具有相同离散尺度。一般数据中,相关系数没有量纲,斜率会随时间单位和测量单位改变。

指标原序列 AA重排序列 BB
均值3.53.53.53.5
样本方差3.53.53.53.5
StxS_{tx}35/235/29/29/2
时间斜率119/359/35

验收表只检查数据在一条时间方向上的投影。投影变小说明线性上升分量变弱,尚未说明整条序列失去时间结构。

置换搜索使时间标签成为分析路径

任意重排都保持 xˉ\bar xSxxS_{xx},只会改变内积 StxS_{tx}。若交换位置 iijj 的两个读数,交换后的内积 StxS_{tx}' 满足

StxStx=(titj)(xjxi).S_{tx}'-S_{tx} =(t_i-t_j)(x_j-x_i).

这个恒等式只需比较交换前后两项的贡献。对原序列 AA,有 xi=tix_i=t_i,因此

StxStx=(ji)2.S_{tx}'-S_{tx}=-(j-i)^2.

相距越远的时间标签,对调后越能压低上升斜率。交换第 1 与第 5 个位置可得到

C=(5,2,3,4,1,6),C=(5,2,3,4,1,6),

并且

StC=35216=32,β^t,C=3350.086.S_{tC}=\frac{35}{2}-16=\frac32, \qquad \widehat\beta_{t,C}=\frac3{35}\approx0.086.

原序列不满足验收线,一次交换已经足够,所以按“任意两位置换次数”计量时,最少操作数为 1。贯穿本章的 BB 在位置 2,,62,\ldots,6 上对应循环 (2 6 4 5 3)(2\ 6\ 4\ 5\ 3);一个长度为 5 的循环至少需要 4 次两位置换。选择 BB 的教学用途在于展示强烈交替留下的多尺度痕迹。

“最少改动”必须先指定成本。交换次数、改动时间戳的条数、时间位移总和与数据库写入次数会给出不同最优解。没有成本函数,最优性没有确定含义。

本例共有 6!=7206!=720 个排列。直接枚举可得,其中 314 个满足

β^t0.3.|\widehat\beta_t|\le0.3.

验收线因此留下了大量可选择路径。若在“读数相对于时间标签可交换”的零假设下,把 720 个排列视为等可能,则原序列的双侧精确置换概率为

PrH0(β^t1)=2720=1360,\Pr_{H_0} \left(|\widehat\beta_t|\ge1\right) =\frac2{720} =\frac1{360},

因为只有完全升序和完全降序达到绝对斜率 1。对 BB 的观测绝对斜率 9/359/35,相应计数为

PrH0(β^t935)=474720=791200.658.\Pr_{H_0} \left(|\widehat\beta_t|\ge\frac9{35}\right) =\frac{474}{720} =\frac{79}{120} \approx0.658.

这项检验只问线性时间投影在可交换零假设下是否极端。若排列已经根据验收线搜索过,搜索规则属于数据生成过程,不能再把选中的排列当作预先固定的随机结果来解释。斜率搜索留下的代价要从时间方向以外寻找,相邻配对给出最直接的下一项检查。

样本自相关重新配对相邻时点

对弱平稳过程,滞后 kk 的自协方差和自相关定义为

γ(k)=Cov(Xt,Xtk),ρ(k)=γ(k)γ(0).\gamma(k)=\operatorname{Cov}(X_t,X_{t-k}), \qquad \rho(k)=\frac{\gamma(k)}{\gamma(0)}.

平稳性保证它们只依赖间隔 kk;一般非平稳过程中,协方差还可能随具体时点 tt 改变。第七节将给出平稳性的完整定义,本节先固定样本计算口径。

有限序列常用下面的样本口径:

γ^(k)=1Tt=k+1T(xtxˉ)(xtkxˉ),\widehat\gamma(k) =\frac1T\sum_{t=k+1}^{T} (x_t-\bar x)(x_{t-k}-\bar x), ρ^(k)=γ^(k)γ^(0)=t=k+1T(xtxˉ)(xtkxˉ)t=1T(xtxˉ)2.\widehat\rho(k) =\frac{\widehat\gamma(k)}{\widehat\gamma(0)} =\frac{\sum_{t=k+1}^{T}(x_t-\bar x)(x_{t-k}-\bar x)} {\sum_{t=1}^{T}(x_t-\bar x)^2}.

本章所有样本自相关都采用这一口径。另一些软件用 TkT-k 计算滞后协方差,有限样本数值会不同;报告结果时应写明定义和软件选项。

两条序列都有

t=16(xtxˉ)2=352.\sum_{t=1}^{6}(x_t-\bar x)^2=\frac{35}{2}.

AA,相邻乘积之和为

t=26(AtAˉ)(At1Aˉ)=354,\sum_{t=2}^{6}(A_t-\bar A)(A_{t-1}-\bar A) =\frac{35}{4},

所以

ρ^A(1)=12.\widehat\rho_A(1)=\frac12.

BB,中心化序列为

(52,52,32,32,12,12),\left(-\frac52,\frac52,-\frac32,\frac32,-\frac12,\frac12\right),

相邻乘积之和为

254154943414=534.-\frac{25}{4}-\frac{15}{4}-\frac94-\frac34-\frac14 =-\frac{53}{4}.

因此

ρ^B(1)=53700.757.\widehat\rho_B(1) =-\frac{53}{70} \approx-0.757.

同一批取值从正相邻关联变成强烈负相邻关联。六点样本的 ρ^(1)\widehat\rho(1) 波动很大,且 BB 经过目标导向选择;这里的数值承担描述和追踪功能,不承担显著性结论。自相关使用标准化乘积,下一节把同一折返改写为保留原测量单位的相邻差分。

相邻差分把折返写成粗糙度

一阶差分为

Δxt=xtxt1,t=2,,T.\Delta x_t=x_t-x_{t-1}, \qquad t=2,\ldots,T.

原序列和重排序列分别给出

ΔA=(1,1,1,1,1),\Delta A=(1,1,1,1,1), ΔB=(5,4,3,2,1).\Delta B=(5,-4,3,-2,1).

两条序列的水平样本方差相同,差分平方和却从

t=26(ΔAt)2=5\sum_{t=2}^{6}(\Delta A_t)^2=5

升到

t=26(ΔBt)2=55.\sum_{t=2}^{6}(\Delta B_t)^2=55.

差分粗糙度与一阶自相关由同一组相邻乘积联系。令 zt=xtxˉz_t=x_t-\bar x,则

t=2T(xtxt1)2=t=2T(ztzt1)2=2t=1Tzt2z12zT22t=2Tztzt1=2Sxx{1ρ^(1)}z12zT2.\begin{aligned} \sum_{t=2}^{T}(x_t-x_{t-1})^2 &=\sum_{t=2}^{T}(z_t-z_{t-1})^2\\ &=2\sum_{t=1}^{T}z_t^2-z_1^2-z_T^2 -2\sum_{t=2}^{T}z_tz_{t-1}\\ &=2S_{xx}\{1-\widehat\rho(1)\}-z_1^2-z_T^2. \end{aligned}

在总离差平方和固定时,更负的一阶自相关通常对应更大的相邻跳动;两个端点提供校正项。

还可以只记录每个点位于均值上方还是下方。AA 的符号序列为

(,,,+,+,+),(-,-,-,+,+,+),

只有 2 个连续运行;BB

(,+,,+,,+),(-,+,-,+,-,+),

共有 6 个连续运行。在三个正号、三个负号的 (63)=20\binom{6}{3}=20 种排列中,恰有 2 种达到 2 个运行,也恰有 2 种达到 6 个运行。重排把“过于持续”推到了“过于交替”的另一端。

造假动作留下的影子

章首操作保留了每个单点和所有边缘统计量,也让指定趋势字段过线。它同时把一阶自相关从 1/21/2 改为 53/70-53/70,把差分平方和从 5 推到 55,并把均值上下方的运行数从 2 推到 6。时间造假的约束存在于多种相互关联的时序量中。

自相关、差分和运行数已经说明结构发生了什么变化。要解释一步关系怎样传播到更远时点,还需要一个动态生成模型。

AR(1) 把一步记忆传播到所有滞后

自相关描述记忆,动态模型进一步说明记忆怎样生成观测。带均值的 AR(1) 写成

Xtμ=ϕ(Xt1μ)+εt,X_t-\mu =\phi(X_{t-1}-\mu)+\varepsilon_t,

其中创新 εt\varepsilon_t 相对于过去信息 Ft1\mathcal F_{t-1} 满足

E(εtFt1)=0,Var(εtFt1)=σε2,\mathbb{E}(\varepsilon_t\mid\mathcal F_{t-1})=0, \qquad \operatorname{Var}(\varepsilon_t\mid\mathcal F_{t-1})=\sigma_\varepsilon^2,

并假定不同时点的创新互不相关。这些条件足以支持下面的二阶矩与已知参数预测公式。若要建立高斯似然和相应的精确条件分布,还需指定 εt\varepsilon_t 独立同分布为正态。

向后迭代 mm 步可得

Xtμ=ϕm(Xtmμ)+j=0m1ϕjεtj.X_t-\mu =\phi^m(X_{t-m}-\mu) +\sum_{j=0}^{m-1}\phi^j\varepsilon_{t-j}.

ϕ<1|\phi|<1 且初始项的影响随回溯距离消失时,令 mm\to\infty 可得到唯一的因果弱平稳解

Xtμ=j=0ϕjεtj.X_t-\mu =\sum_{j=0}^{\infty}\phi^j\varepsilon_{t-j}.

于是

γ(0)=Var(Xt)=σε2j=0ϕ2j=σε21ϕ2.\gamma(0) =\operatorname{Var}(X_t) =\sigma_\varepsilon^2\sum_{j=0}^{\infty}\phi^{2j} =\frac{\sigma_\varepsilon^2}{1-\phi^2}.

k1k\ge1,创新 εt\varepsilon_t 与过去不相关,因此

γ(k)=Cov(Xtμ,Xtkμ)=Cov ⁣(ϕ(Xt1μ)+εt,Xtkμ)=ϕγ(k1).\begin{aligned} \gamma(k) &=\operatorname{Cov}(X_t-\mu,X_{t-k}-\mu)\\ &=\operatorname{Cov}\!\left(\phi(X_{t-1}-\mu)+\varepsilon_t, X_{t-k}-\mu\right)\\ &=\phi\gamma(k-1). \end{aligned}

递推给出

γ(k)=ϕkγ(0),ρ(k)=ϕk.\gamma(k)=\phi^k\gamma(0), \qquad \rho(k)=\phi^k.

ϕ>0\phi>0 产生同向持续,ϕ<0\phi<0 产生正负交替,ϕ|\phi| 控制记忆衰减速度。BB 的负一阶样本自相关与负 ϕ\phi 的形态相似;六个经过选择的点不足以支持一个可靠的 AR 参数估计。

AR(1) 的主要用途之一是预测。参数已知时,给定截至 TT 时刻的信息 FT\mathcal F_T

E(XT+hFT)=μ+ϕh(XTμ),\mathbb{E}(X_{T+h}\mid\mathcal F_T) =\mu+\phi^h(X_T-\mu), Var(XT+hFT)=σε2j=0h1ϕ2j=σε21ϕ2h1ϕ2.\operatorname{Var}(X_{T+h}\mid\mathcal F_T) =\sigma_\varepsilon^2 \sum_{j=0}^{h-1}\phi^{2j} =\sigma_\varepsilon^2 \frac{1-\phi^{2h}}{1-\phi^2}.

点预测以 ϕh\phi^h 的速度回到长期均值,预测方差逐步趋近无条件方差。h=1h=1 时只有下一期创新尚未观察,条件方差为 σε2\sigma_\varepsilon^2;预测步长增加后,更多未来创新依次进入误差。实际应用还要传播参数估计误差,并检查创新模型。

方法来路:AR 模型为何从受扰周期中产生

Yule 在 1927 年研究 Wolfer 太阳黑子数的受扰周期。他把当前值写成过去值与随机扰动的组合,使看似周期的波动可以由随机递推维持。自回归模型由此提供了与“固定正弦波加测量误差”不同的动态解释:扰动会进入后续状态,并沿递推逐渐衰减。

ACF、PACF 与模型阶数

ACF 同时包含直接联系和经中间时点传递的联系。滞后 kk 的偏自相关分别从 XtX_tXtkX_{t-k} 中线性移除中间 k1k-1 个滞后的作用,再计算两组残差的相关。理想 AR(pp) 的 PACF 在 pp 阶后为零,理想 MA(qq) 的 ACF 在 qq 阶后为零。有限样本、趋势、季节、变点和模型错设都会模糊这种截尾,图形适合提出候选模型,仍需结合残差和预测检验。

ρ(k)=ϕk\rho(k)=\phi^k 的推导默认同一均值和协方差规律可沿时间平移。这个默认条件正是平稳性要说明的内容。

平稳性决定同一规律能否沿时间平移

严格平稳要求任意时点组的联合分布在整体平移后保持不变:对任意 mm、任意 t1,,tmt_1,\ldots,t_m 和整数 hh

(Xt1,,Xtm)=d(Xt1+h,,Xtm+h).(X_{t_1},\ldots,X_{t_m}) \overset d= (X_{t_1+h},\ldots,X_{t_m+h}).

弱平稳只约束前两阶矩:

E(Xt)=μ,Var(Xt)=γ(0),Cov(Xt,Xtk)=γ(k).\mathbb{E}(X_t)=\mu, \qquad \operatorname{Var}(X_t)=\gamma(0), \qquad \operatorname{Cov}(X_t,X_{t-k})=\gamma(k).

严格平稳在二阶矩存在时可推出弱平稳;弱平稳只保证均值与协方差结构,不决定完整联合分布。高斯过程的均值和协方差已经决定所有有限维分布,因此高斯过程的弱平稳还能推出严格平稳。

白噪声 {εt}\{\varepsilon_t\} 通常满足

E(εt)=0,Var(εt)=σ2,Cov(εt,εtk)=0(k0).\mathbb{E}(\varepsilon_t)=0, \qquad \operatorname{Var}(\varepsilon_t)=\sigma^2, \qquad \operatorname{Cov}(\varepsilon_t,\varepsilon_{t-k})=0\quad(k\ne0).

零自相关没有自动给出独立性;高斯白噪声中,联合正态和零协方差才把它提升为独立。

三类常见过程展示了平稳性差异:

过程水平的矩结构冲击的作用
$\phi<1$ 的 AR(1)
Xt=a+bt+UtX_t=a+bt+U_tUtU_t 平稳水平均值随 tt 改变;去掉确定性趋势后平稳单次冲击不改变确定性趋势;持续时间由 UtU_t 决定
Xt=Xt1+εtX_t=X_{t-1}+\varepsilon_tX0X_0 固定,则 Var(Xt)=tσ2\operatorname{Var}(X_t)=t\sigma^2冲击永久进入后续水平

随机游走的一阶差分为

ΔXt=XtXt1=εt.\Delta X_t=X_t-X_{t-1}=\varepsilon_t.

它把非平稳水平变成平稳增量。差分也改变了研究问题:水平预测、累计风险与长期均衡被转换为逐期变化。对已经平稳的过程继续差分还可能引入额外的负自相关。

工程序列常写成

Xt=mt+st+rt,X_t=m_t+s_t+r_t,

其中 mtm_t 表示趋势,sts_t 表示季节或已知周期,rtr_t 表示剩余动态。去趋势、季节调整和差分应对应生成机制与预测目标。采样间隔若改变,同一个“滞后 1”也会代表不同物理时长;不规则采样还需要显式记录实际时间差。AR(1) 在 ϕ<1|\phi|<1 时平稳,ϕ=1\phi=1 时落到随机游走边界;靠近这条边界的推断需要专门处理。

单位根检验处理接近随机游走的边界

在带截距的 AR(1)

Xt=c+ϕXt1+εtX_t=c+\phi X_{t-1}+\varepsilon_t

中,两边减去 Xt1X_{t-1} 可得

ΔXt=c+δXt1+εt,δ=ϕ1.\Delta X_t =c+\delta X_{t-1}+\varepsilon_t, \qquad \delta=\phi-1.

Dickey–Fuller 检验考察

H0:δ=0ϕ=1,H_0:\delta=0 \quad\Longleftrightarrow\quad \phi=1,

对抗均值回归方向的备择 H1:δ<0H_1:\delta<0。在零假设下,Xt1X_{t-1} 是随机游走水平,回归量与误差的累计结构使通常的 Student tt 参照失效;检验统计量需要专门的 Dickey–Fuller 极限分布和临界值。

若创新仍有短期相关,可加入滞后差分得到增广形式

ΔXt=c+δXt1+j=1pψjΔXtj+εt.\Delta X_t =c+\delta X_{t-1} +\sum_{j=1}^{p}\psi_j\Delta X_{t-j} +\varepsilon_t.

截距、确定性时间趋势和滞后阶数必须在检验中明确,因为它们会改变零假设下的分布与功效。结构突变也可能使单位根检验难以区分一次永久跳变和持续随机漂移。

KPSS 检验把平稳性放在零假设。先从水平或趋势回归中取得残差 ete_t,再构造累积和

St=i=1tei.S_t=\sum_{i=1}^{t}e_i.

一种常见统计量为

KPSS=T2t=1TSt2ω^2,\operatorname{KPSS} =\frac{T^{-2}\sum_{t=1}^{T}S_t^2} {\widehat\omega^2},

其中 ω^2\widehat\omega^2 估计残差的长期方差。在绝对可和条件下,长期方差为

ω2=γe(0)+2k=1γe(k).\omega^2 =\gamma_e(0)+2\sum_{k=1}^{\infty}\gamma_e(k).

平稳残差的累积漂移应受控制;统计量过大时拒绝平稳零假设。带宽与长期方差估计会影响有限样本结果。

两类检验的零假设方向相反。Dickey–Fuller 拒绝且 KPSS 未拒绝时,数据与所设定的平稳模型较相容;Dickey–Fuller 未拒绝且 KPSS 拒绝时,单位根解释较相容;两者都未拒绝通常表示区分能力不足;两者都拒绝则提示确定性项、结构突变、长期记忆或其他模型部分需要重查。任何一项未拒绝都没有证明对应零假设成立。

方法来路:为什么单位根需要专用参照分布

Dickey 与 Fuller 在 1979 年推导了自回归系数位于单位根边界时估计量和回归检验统计量的非标准极限分布。Kwiatkowski、Phillips、Schmidt 与 Shin 在 1992 年把平稳性设为零假设,用相反方向的问题补充低功效的单位根检验。两项工作共同提醒读者:未拒绝某个零假设只表示当前证据不足以推翻它。

本章只有六个经过选择的点,无法承担单位根检验、长期方差估计或滞后阶数选择。这里的公式说明平稳判断为何需要专门推断,也说明一项斜率验收无法替代动态模型检查。即使平稳性规格已经选定,拟合后的残差仍要接受“记忆是否已被吸收”的检验。

残差白噪声检验模型是否吸收了记忆

拟合时间序列模型的目标包含一项可检验要求:模型解释趋势、季节和可预测动态后,剩余创新应不再保留线性时间记忆。若一步预测为

X^tt1=E(XtFt1;θ^),\widehat X_{t\mid t-1} =\mathbb{E}(X_t\mid\mathcal F_{t-1};\widehat\theta),

则预测残差为

et=XtX^tt1.e_t=X_t-\widehat X_{t\mid t-1}.

逐个查看 ρ^e(k)\widehat\rho_e(k) 会产生多重比较。Ljung–Box 统计量把前 hh 个残差自相关合成一个整体检查:

QLB=T(T+2)k=1hρ^e(k)2Tk.Q_{\mathrm{LB}} =T(T+2)\sum_{k=1}^{h} \frac{\widehat\rho_e(k)^2}{T-k}.

ARMA(p,qp,q) 用 pp 个滞后水平和 qq 个过去创新描述线性动态,过去创新在拟合后由残差近似。在模型正确、样本足够大且正则条件成立时,若拟合的是 ARMA(p,qp,q),常用近似参照为

QLBχhpq2.Q_{\mathrm{LB}} \overset{\cdot}{\sim} \chi^2_{h-p-q}.

原假设检查前 hh 个残差自相关同时为零。hh 的选择、参数估计、季节结构、小样本和条件异方差都会影响参照分布。拒绝说明模型遗漏了某种线性记忆;未拒绝仍允许非线性依赖、波动聚集和分布尾部错设。

方法来路:为什么要一次检查一组残差相关

Box 与 Pierce 在 1970 年把时间序列模型理解为将数据转换成白噪声,并用一组残差自相关构造整体拟合检验。Ljung 与 Box 在 1978 年修改权重,改善有限样本下的卡方近似。该类统计量的原始用途是模型诊断;直接对尚未建模的原序列使用时,所回答的问题会改变。

六点序列没有足够自由度同时拟合动态模型、选择 hh 并使用卡方近似。对 AABB,折线、差分和描述性 ACF 已足以展示重排代价;正式残差诊断需要更长的原始运行记录。ACF 按滞后列出记忆,频域则按振荡速度重新组织同一二阶结构。

Fourier 分解显示波动能量被移到哪里

时域检查比较相邻值,频域检查把同一序列投影到不同振荡速度。令

zt=xtxˉ,t=1,,T,z_t=x_t-\bar x, \qquad t=1,\ldots,T,

离散 Fourier 变换为

Zj=t=1Tztexp ⁣{i2πj(t1)T},j=0,,T1.Z_j =\sum_{t=1}^{T}z_t \exp\!\left\{-\mathrm i\frac{2\pi j(t-1)}{T}\right\}, \qquad j=0,\ldots,T-1.

周期图在 Fourier 频率 ωj=2πj/T\omega_j=2\pi j/T 处定义为

Ij=1TZj2.I_j=\frac1T|Z_j|^2.

指数基向量的正交性给出

j=0T1exp ⁣{i2πj(ts)T}={T,t=s,0,ts,\sum_{j=0}^{T-1} \exp\!\left\{-\mathrm i\frac{2\pi j(t-s)}{T}\right\} = \begin{cases} T,&t=s,\\ 0,&t\ne s, \end{cases}

进而得到 Parseval 恒等式

j=0T1Ij=t=1Tzt2.\sum_{j=0}^{T-1}I_j =\sum_{t=1}^{T}z_t^2.

时间重排保持右侧总离差平方和,却可以彻底改变左侧能量在频率之间的分配。这正是均值和方差检查遗漏的结构。

对长度 T=6T=6 的实序列,I6j=IjI_{6-j}=I_j,只需列出三个非零独立频率:

jj角频率 ωj\omega_j对应周期 T/jT/jIj,AI_{j,A}Ij,BI_{j,B}
1π/3\pi/36661/21/2
22π/32\pi/33223/23/2
3π\pi23/23/227/227/2

因为 j=1,2j=1,2 各有一个镜像频率,

2(6)+2(2)+32=3522(6)+2(2)+\frac32 =\frac{35}{2}

2(12)+2(32)+272=3522\left(\frac12\right) +2\left(\frac32\right) +\frac{27}{2} =\frac{35}{2}

都等于原来的总离差平方和。BB27/227/2 的能量放在周期 2 的最高可辨频率上,正对应相邻点反复高低交替。总离差能量保持不变,主要位置从低频方向移到了高频方向。

自协方差与频谱是一对 Fourier 表示

若弱平稳过程的自协方差绝对可和,则谱密度可写为

f(ω)=12πk=γ(k)eikω,f(\omega) =\frac1{2\pi} \sum_{k=-\infty}^{\infty} \gamma(k)e^{-\mathrm i k\omega},

逆变换为

γ(k)=ππeikωf(ω)dω.\gamma(k) =\int_{-\pi}^{\pi} e^{\mathrm i k\omega}f(\omega)\,\mathrm d\omega.

时域的“相隔 kk 步怎样共同变化”和频域的“不同振荡速度贡献多少方差”是同一二阶结构的两种坐标。

周期图还带有明确边界。有限观察窗会造成谱泄漏;线性趋势经周期延拓后在端点产生跳跃,会向多个低频分量分配能量;采样频率限制可辨认的最高频率,过慢采样会产生混叠;缺失和不规则间隔也会改变普通 DFT 的解释。AA 的低频能量不能直接解释为真实周期,BB 的六点峰值也不能支持频谱推断。这里可靠的结论是代数性的:重排在保持总能量时改变了能量位置。稳定周期和一次结构变化都可能改变低频能量,下一节转向参数随时间失效的情形。

变点检查同一参数何时失效

趋势、随机游走和结构突变都可能产生长时间同向变化。若设备更换使参数在未知时刻 τ\tau 改变,可写成分段模型

Xtμr=ϕr(Xt1μr)+εt,r={1,tτ,2,t>τ.X_t-\mu_r =\phi_r(X_{t-1}-\mu_r)+\varepsilon_t, \qquad r= \begin{cases} 1,&t\le\tau,\\ 2,&t>\tau. \end{cases}

全时段只拟合一组 μ\muϕ\phi,可能把均值跳变误作缓慢衰减的长记忆,也可能把两个阶段平均成没有物理对应的参数。

一个简单的回顾性均值检查使用中心化累积和

Ck=t=1k(xtxˉ),k=1,,T.C_k=\sum_{t=1}^{k}(x_t-\bar x), \qquad k=1,\ldots,T.

总和中心化后必有 CT=0C_T=0。稳定均值下,累积和应围绕零波动;一段持续偏低后转为持续偏高,会形成较大的系统偏离。两条示例的累积和为

CA=(2.5,4,4.5,4,2.5,0),C_A=(-2.5,-4,-4.5,-4,-2.5,0), CB=(2.5,0,1.5,0,0.5,0).C_B=(-2.5,0,-1.5,0,-0.5,0).

AA 的最大绝对偏离为 4.54.5BB2.52.5。这项描述能看见均值随时间变化,却不能单独区分平滑趋势、突变和选择性重排。正式变点推断还要处理对 τ\tau 的搜索、多个候选断点、误差相关和断点不确定性。

方法来路:CUSUM 为持续生产监控而设计

Page 在 1954 年提出连续检验方案,把逐次偏差累积起来监测生产过程变化。单个观测可能落在正常波动内,连续同向的小偏差会在累积和中逐步放大。正文的中心化累积和用于回顾性描述,与 Page 的顺序告警共享累积偏差思想,检验边界和运行方式有所不同。现代离线变点分析扩展了这一思想;断点的物理解释仍需设备维护、配方、政策或环境日志提供锚点。

重排时间标签还会移动候选断点与外部事件的相对位置。只保存排序后的结果表,会同时破坏趋势、动态参数和事件对齐。外部事件日志提供一类旁证;另一条同步测量序列的过去能否改善预测,提供第二类动态比较。

Granger 关系比较另一序列的增量预测

单变量模型只使用 YY 自身的过去。若同时记录环境温度 XtX_t 与设备读数 YtY_t,可以比较受限模型

Yt=c+j=1pajYtj+εtY_t =c+\sum_{j=1}^{p}a_jY_{t-j}+\varepsilon_t

和非受限模型

Yt=c+j=1pajYtj+j=1qbjXtj+ut.Y_t =c+\sum_{j=1}^{p}a_jY_{t-j} +\sum_{j=1}^{q}b_jX_{t-j}+u_t.

检验的联合零假设为

H0:b1==bq=0.H_0:b_1=\cdots=b_q=0.

在线性同方差模型及相应正则条件下,可用

F=(RSSRRSSU)/qRSSU/(nkU)F =\frac{(\operatorname{RSS}_R-\operatorname{RSS}_U)/q} {\operatorname{RSS}_U/(n-k_U)}

比较两组残差平方和;kUk_U 是非受限模型估计的参数数目。也可以冻结滞后阶数后比较样本外预测损失。显著的联合检验和更好的样本外预测是两种证据,评价层与假设条件应分别写清。

若加入 XX 的过去后,YY 的条件预测分布得到稳定改善,就说 XX 相对于当前信息集对 YY 具有 Granger 预测性。结论依赖采样频率、滞后范围、预处理和纳入的信息。共同驱动、遗漏变量、同步测量误差、非平稳趋势、结构突变与事后选择滞后都可能产生预测领先。干预因果仍需第十九章的识别条件。

方法来路:Granger 把时间先后写成可检验的预测问题

Granger 在 1969 年用“加入一个序列的过去能否改善另一个序列的预测”组织动态关系。这个定义把信息集和时间先后写进模型,适合检验增量预测。名称中的因果含义受到信息集、稳定性和遗漏变量限制,不能直接替代随机干预或因果图识别。

时间标签一旦重排,XtjX_{t-j}YtY_t 的配对也会改变。单列趋势验收看似只修改一张报表,跨传感器的滞后关系和预测模型会同步受损。

把无趋势序列放回时间审计链

重排序列 BB 完成了机械目标:六个读数、均值、样本方差和直方图全部保留,时间斜率从 1 降到

9350.257.\frac9{35}\approx0.257.

同一操作还产生一组连锁变化:

ρ^(1):125370,\widehat\rho(1):\quad \frac12\longrightarrow-\frac{53}{70}, t=26(Δxt)2:555,\sum_{t=2}^{6}(\Delta x_t)^2:\quad 5\longrightarrow55, I周期 2:32272.I_{\text{周期 }2}:\quad \frac32\longrightarrow\frac{27}{2}.

斜率只读一条线性方向;自相关重新配对相邻点;差分量化局部粗糙度;频谱说明同一总方差落在哪些振荡速度上。四项结果来自同一序列的不同坐标,不能通过分别修饰报表字段来保持一致。

一份可复核的时间序列分析至少保存:

  1. 原始时间戳、时区、时钟来源、采样间隔和允许的时间误差;

  2. 原始到分析数据的排序规则、重复时间、缺失时点与补点记录;

  3. 每次标签交换、批量重排、聚合和重采样的代码、版本与执行时间;

  4. 预先规定的趋势指标、验收线、候选排列数和选择规则;

  5. 水平折线、相邻差分、运行长度、ACF 与不同时间尺度的汇总;

  6. 趋势、季节、差分和平稳假设的选择理由及替代规格;

  7. 动态模型的一步预测、残差 ACF、整体白噪声检查和样本外误差;

  8. 频谱所用的采样频率、去趋势、窗函数、缺失处理和频率分辨率;

  9. 候选变点、断点不确定性及设备、维护、政策和环境日志;

  10. 多传感器的时钟同步、滞后范围、信息集与 Granger 分析边界。

统计量可以说明顺序改写造成了哪些不协调,无法单独确认某次标签交换真实发生。原始时钟、只追加日志、设备文件与版本差异提供来源证据。下一章继续沿传感器链向前追溯:即使时间戳真实,报告浓度仍要与原始信号、校准曲线、检测限和仪器记忆共同相容。

本章知识链

  1. 时间序列是有序随机向量;均值、方差和直方图只读取取值集合,无法保存相邻关系和条件分布。

  2. 含截距的时间斜率是中心化读数在中心化时间方向上的投影。本例把斜率从 1 压到 9/359/35

  3. 交换两个位置对趋势内积的改变量为 (titj)(xjxi)(t_i-t_j)(x_j-x_i);最少操作结论依赖预先指定的成本函数。

  4. 720 个排列中有 314 个通过给定斜率线,候选排列和选择规则都属于分析路径。

  5. 本章样本自相关采用分子、分母都基于 TT 的口径;重排使一阶值从 1/21/2 变为 53/70-53/70

  6. 差分平方和、自相关和端点通过恒等式相连;重排把差分平方和从 5 推到 55。

  7. 平稳 AR(1) 在 ϕ<1|\phi|<1 时具有方差 σε2/(1ϕ2)\sigma_\varepsilon^2/(1-\phi^2)、自相关 ϕk\phi^k 和逐步回归均值的预测。

  8. 严格平稳约束联合分布,弱平稳约束均值和协方差;白噪声的零相关没有自动给出独立性。

  9. 确定性趋势与随机游走都使水平非平稳,去趋势和差分对应不同生成机制与研究目标。

  10. Dickey–Fuller 把单位根放在零假设,KPSS 把平稳性放在零假设;二者都依赖专门参照与足够长度。

  11. Ljung–Box 统计量联合检查多阶残差自相关;它服务于模型诊断,小样本和模型估计会影响卡方近似。

  12. Parseval 恒等式保证总离差能量守恒;重排仍可把能量从低频方向移动到周期 2 的高频方向。

  13. 变点分析定位参数失效,物理原因仍需外部事件日志;Granger 关系表达给定信息集下的增量预测。

  14. 完整时间审计链同时保留原始时钟、排序版本、动态诊断、频率设置、变点证据和跨序列同步信息。

思考与练习

  1. 复算 AABBStxS_{tx}、时间斜率、样本方差和时间相关系数,说明本例中斜率为何恰好等于相关系数,并给出该等式在一般数据中失效的原因。

  2. 推导交换位置 i,ji,j 后的 StxStxS_{tx}'-S_{tx}。从 AA 出发,验证交换第 1 与第 5 个位置得到 CC 的斜率 3/353/35,并证明按两位置换次数计量时最少操作数为 1。

  3. 编写程序枚举 1,,61,\ldots,6 的全部排列,复核 314 个排列通过 β^t0.3|\widehat\beta_t|\le0.3,再复核 AABB 的双侧精确置换概率。说明看见结果后选择排列怎样改变解释条件。

  4. 按本章口径复算 A,BA,B 的一至五阶样本自相关。若滞后协方差改用分母 TkT-k,一阶数值会怎样变化?报告 ACF 时为什么需要说明口径?

  5. 证明差分平方和与一阶样本自相关之间的恒等式,并分别代入 A,BA,B 验证结果为 5 和 55。再计算两序列相对均值的运行数。

  6. 对平稳 AR(1) 推导均值、方差、ρ(k)\rho(k)hh 步条件均值和条件方差。取 ϕ=0.8\phi=0.8σε2=4\sigma_\varepsilon^2=4,计算无条件方差以及 h=1,2,5h=1,2,5 时的相关。

  7. ϕ=0.5\phi=-0.5。写出前六阶理论 ACF,解释负号怎样产生交替、绝对值怎样控制衰减;再说明六点样本为何难以区分真实负反馈与目标导向重排。

  8. 分别判断 iid 白噪声、Xt=a+bt+UtX_t=a+bt+U_tb0b\ne0)、随机游走和 ϕ<1|\phi|<1 的 AR(1) 是否弱平稳。对每项写出均值与方差随时间的变化,并说明去趋势或差分后研究对象发生了什么变化。

  9. Xt=c+ϕXt1+εtX_t=c+\phi X_{t-1}+\varepsilon_t 推出 Dickey–Fuller 回归,写出单位根零假设。说明通常的 Student tt 临界值为何不适用,并比较 Dickey–Fuller 与 KPSS 的零假设方向。

  10. 某个长度 T=100T=100 的 AR(1) 拟合残差在前三阶的样本自相关为 0.12,0.08,0.050.12,-0.08,0.05。计算 h=3h=3 的 Ljung–Box 统计量,并写出常用近似自由度;列出两项会破坏该近似的条件。

  11. 直接计算 A,BA,Bj=1,2,3j=1,2,3 的 DFT 与周期图,验证表中六个能量值和 Parseval 恒等式。解释 BBj=3j=3 的峰怎样对应相邻交替,以及六点峰值为何不能证明稳定周期。

  12. 计算 A,BA,B 的中心化累积和。再为“温度是否对设备读数具有 Granger 预测性”写出受限与非受限模型、联合零假设和三项无法据此建立干预因果的原因。

专题导航