第二十二章:编造行为流水

本章造假目标

在观察窗 [0,40][0,40] 分钟内,某账号的五次点击发生于 A=(1,2,3,20,40)A=(1,2,3,20,40)。点击总数合格,四个相邻点击间隔 (1,1,17,20)(1,1,17,20) 的样本变异系数约为 1.0441.044,营销卡据此判定互动“忽冷忽热”;验收要求间隔变异系数不超过 0.100.10。只允许移动中间三个时间戳,不得增加或删除点击,也要保持第一次点击在第 1 分钟、最后一次点击在第 40 分钟。任务是把流水改成 B=(1,10,20,30,40)B=(1,10,20,30,40),使间隔变成 (9,10,10,10)(9,10,10,10)、变异系数降到 0.0510.051。随后固定事件数与首末时刻,计算这种规则性在 Poisson 条件参照下有多罕见,再把同一模板放回非齐次强度、Hawkes 事件簇、HMM 状态持续、生存时间、跨账号对齐和外部时间锚点中复核。

五次点击都保留,时间结构已经改写

原流水与改写流水为

A=(1,2,3,20,40),B=(1,10,20,30,40).A=(1,2,3,20,40), \qquad B=(1,10,20,30,40).

对连续五个事件时刻,定义四个内部间隔

Wi=TiTi1,i=2,,5.W_i=T_i-T_{i-1}, \qquad i=2,\ldots,5.

两组间隔分别为

WA=(1,1,17,20),WB=(9,10,10,10).W_A=(1,1,17,20), \qquad W_B=(9,10,10,10).

它们的和都等于首末跨度 401=3940-1=39,均值也同为

Wˉ=394=9.75.\bar W=\frac{39}{4}=9.75.

章首验收采用样本标准差与样本变异系数

sW=141i=14(WiWˉ)2,CVW=sWWˉ.s_W =\sqrt{ \frac{1}{4-1} \sum_{i=1}^4(W_i-\bar W)^2 }, \qquad CV_W=\frac{s_W}{\bar W}.

对 A,离差平方和为

2(19.75)2+(179.75)2+(209.75)2=310.75,2(1-9.75)^2 +(17-9.75)^2 +(20-9.75)^2 =310.75,

所以

sW,A=310.75310.178,CVW,A1.044.s_{W,A} =\sqrt{\frac{310.75}{3}} \approx10.178, \qquad CV_{W,A} \approx1.044.

对 B,离差为 0.75,0.25,0.25,0.25-0.75,0.25,0.25,0.25,故

sW,B=0.753=0.5,CVW,B=0.59.750.051.s_{W,B} =\sqrt{\frac{0.75}{3}} =0.5, \qquad CV_{W,B} =\frac{0.5}{9.75} \approx0.051.

移动第 2、3、4 次点击以后,BB 通过 CVW0.10CV_W\le0.10 的验收。总点击数、首末时刻和内部间隔均值全部保持不变;A 在开头形成事件簇,随后经历两段长空档,B 接近每十分钟点击一次。总数压缩了“发生多少”,时间戳保留了“何时发生”。

造假动作留下的影子

改写把间隔变异系数从 1.0441.044 压到 0.0510.051,同时保留五次点击与 39 分钟首末跨度。营销卡奖励低波动,因而会把机械规则性当作稳定互动。固定事件数与首末时刻后,连续时间 Poisson 条件参照中 CVW0.10CV_W\le0.10 的概率约为 0.001020.00102;按整数分钟记录时,精确条件概率约为 0.001900.00190。一项通过值由此转化为模板证据。

要理解这项反转,先把一条事件流水拆成计数、内部间隔、边界暴露和跨账号重复四层,再逐层建立参照模型。

计数、内部间隔与边界空档回答不同问题

设观察窗为 [0,T][0,T],其中有

0<T1<<TnT0<T_1<\cdots<T_n\le T

个事件。计数过程定义为

N(t)=i=1n1{Tit}.N(t)=\sum_{i=1}^n\mathbf 1\{T_i\le t\}.

一条完整窗口至少包含三类时间量:

  • 事件总数 N(T)=nN(T)=n

  • 内部间隔 Wi=TiTi1W_i=T_i-T_{i-1}i=2,,ni=2,\ldots,n

  • 左、右边界空档 GL=T1G_L=T_1GR=TTnG_R=T-T_n

章首两条流水都有

N(40)=5,GL=1,GR=0.N(40)=5, \qquad G_L=1, \qquad G_R=0.

按完整观察窗估计的事件率为

λ^window=N(40)40=0.125\widehat\lambda_{\mathrm{window}} =\frac{N(40)}{40} =0.125

次/分钟。内部间隔均值 9.759.75 则来自四段首末事件之间的等待。1/0.125=81/0.125=8 分钟与 9.759.75 分钟没有代数矛盾:前者用完整 40 分钟暴露和五次事件估计长期平均等待,后者只平均四个已完成的内部间隔。

边界处理取决于观察设计。若过程在第 0 分钟以前已经运行,GLG_L 是从窗口起点到下一事件的前向等待;对一般更新过程,它未必服从完整间隔分布。GRG_R 通常是一段尚未等到下一事件的右删失等待。章首验收明确只用四个内部间隔,因此不应临时把边界空档混入 CVWCV_W;建立概率模型时仍要把完整暴露窗写进似然。

时间戳分辨率也属于数据定义。分钟取整会制造并列时间和整数间隔;系统时区、夏令时、离线缓存和批量上报还会改变表面顺序。原始时间、显示时间、服务器接收时间和取整规则应分别保存。

齐次 Poisson 过程把恒定速率变成计数分布

齐次 Poisson 过程用一个常数强度 λ>0\lambda>0 描述独立到达。对很短的时间段 hh,假定:

  • 发生一次事件的概率为 λh+o(h)\lambda h+o(h)

  • 发生两次以上事件的概率为 o(h)o(h)

  • 不相交时间段的事件数相互独立;

  • 规律不随绝对时刻平移而改变。

这里 o(h)o(h) 表示比 hh 更高阶的小量,即 o(h)/h0o(h)/h\to0。它把“极短时间内同时出现多个事件”的概率排除在一阶近似之外。

pk(t)=Pr{N(t)=k}.p_k(t)=\Pr\{N(t)=k\}.

零事件概率满足

p0(t+h)=p0(t)(1λh)+o(h).p_0(t+h) =p_0(t)(1-\lambda h)+o(h).

两边减去 p0(t)p_0(t)、除以 hh 并令 h0h\to0,得到

p0(t)=λp0(t),p0(0)=1,p_0'(t)=-\lambda p_0(t), \qquad p_0(0)=1,

所以

p0(t)=eλt.p_0(t)=e^{-\lambda t}.

k1k\ge1,小时间段内只保留“原有 kk 次且无新事件”与“原有 k1k-1 次且来一次”两条一阶路径:

pk(t+h)=pk(t)(1λh)+pk1(t)λh+o(h).p_k(t+h) =p_k(t)(1-\lambda h) +p_{k-1}(t)\lambda h +o(h).

于是

pk(t)=λpk1(t)λpk(t).p_k'(t) =\lambda p_{k-1}(t)-\lambda p_k(t).

逐级求解可得

N(t)Poisson(λt),pk(t)=eλt(λt)kk!.N(t)\sim\operatorname{Poisson}(\lambda t), \qquad p_k(t)=e^{-\lambda t}\frac{(\lambda t)^k}{k!}.

Poisson 分布的均值与方差相同,因此

E{N(t)}=Var{N(t)}=λt.\mathbb{E}\{N(t)\} =\operatorname{Var}\{N(t)\} =\lambda t.

若在 [0,T][0,T] 中观察到按序排列的事件时刻 t1:nt_{1:n},齐次 Poisson 的点过程似然为

L(λ;t1:n)=eλTλn.L(\lambda;t_{1:n}) =e^{-\lambda T}\lambda^n.

对所有满足 0<t1<<tn<T0<t_1<\cdots<t_n<T 的位置积分,排序区域体积为 Tn/n!T^n/n!,便得到计数概率

eλTλnTnn!=eλT(λT)nn!.e^{-\lambda T}\lambda^n\frac{T^n}{n!} =e^{-\lambda T}\frac{(\lambda T)^n}{n!}.

λ\lambda 求最大似然估计:

(λ)=λT+nlogλ,(λ)=T+nλ,\ell(\lambda) =-\lambda T+n\log\lambda, \qquad \ell'(\lambda) =-T+\frac n\lambda,

从而

λ^=nT.\widehat\lambda=\frac nT.

A 与 B 都给出 5/40=0.1255/40=0.125。在齐次 Poisson 模型内部,事件总数对 λ\lambda 是充分统计量,两条流水也具有相同的 λ\lambda 似然。这个结论只负责估计恒定速率;检验“恒定、独立到达”是否合适,仍需查看条件下的时间位置。

模型内充分性与审计信息

计数对齐次 Poisson 的速率参数充分,表示给定计数后,事件位置不再提供关于 λ\lambda 的信息。事件位置仍能检验模型假设、寻找模板和比较更丰富的强度模型。参数估计所需信息可以少于模型审计所需信息。

指数间隔给出总体参照,条件化会改变样本分布

从某次事件开始等待下一次事件,令等待时间为 WW。在齐次 Poisson 过程中,W>wW>w 等价于随后 ww 个时间单位没有新事件,因此

Pr(W>w)=Pr{N(w)=0}=eλw,w0.\Pr(W>w) =\Pr\{N(w)=0\} =e^{-\lambda w}, \qquad w\ge0.

于是

WExponential(λ),fW(w)=λeλw.W\sim\operatorname{Exponential}(\lambda), \qquad f_W(w)=\lambda e^{-\lambda w}.

利用尾积分公式,

E(W)=0eλwdw=1λ,\mathbb{E}(W) =\int_0^\infty e^{-\lambda w}\,dw =\frac1\lambda, E(W2)=20weλwdw=2λ2.\mathbb{E}(W^2) =2\int_0^\infty w e^{-\lambda w}\,dw =\frac{2}{\lambda^2}.

因此

Var(W)=1λ2,CV(W)=1.\operatorname{Var}(W)=\frac1{\lambda^2}, \qquad CV(W)=1.

指数分布还具有无记忆性:

Pr(W>s+tW>s)=Pr(W>t).\Pr(W>s+t\mid W>s) =\Pr(W>t).

这里的 CV(W)=1CV(W)=1 是未条件化总体间隔的性质。章首只保留四个间隔,又固定它们的和为 39;四个间隔因此不再独立,也不再分别服从指数分布。只有四个观测时,样本 CVCV 本身还会大幅波动。把 BB0.0510.051 与理论值 1 直接相减可以形成直觉,正式条件检验需要使用下一节的固定和分布。

这一区分也解释了两个看似相反的事实:齐次 Poisson 给 A、B 相同的速率似然;在固定计数与端点后,接近等间隔的配置仍只占全部可能位置的一小块。连续数据中每一个精确配置的概率都为 0,检验应针对事前定义的极端集合,例如 {CVW0.10}\{CV_W\le0.10\}

固定首末时刻后,规则间隔落在一个小球里

条件于 N(40)=5N(40)=5,再固定第一次事件发生在 1、最后一次事件发生在 40,齐次 Poisson 下的三个中间事件等价于区间 (1,40)(1,40) 上三个独立均匀点的次序统计量。在 1<t2<t3<t4<401<t_2<t_3<t_4<40 上,它们的联合密度为常数 3!/3933!/39^3

为便于几何推导,把四个内部间隔重新编号为 W1,,W4W_1,\ldots,W_4。由中间事件位置换元,得到

Wi>0,i=14Wi=39.W_i>0, \qquad \sum_{i=1}^4W_i=39.

标准化间隔满足

(W139,,W439)Dirichlet(1,1,1,1),\left( \frac{W_1}{39},\ldots,\frac{W_4}{39} \right) \sim\operatorname{Dirichlet}(1,1,1,1),

也就是在三维单纯形上均匀分布。

由于 Wˉ=39/4\bar W=39/4 已固定,门槛 CVWcCV_W\le c 等价于

i=14(WiWˉ)23c2Wˉ2.\sum_{i=1}^4(W_i-\bar W)^2 \le 3c^2\bar W^2.

在和为 39 的三维超平面内,这是一颗以等间隔点

(9.75,9.75,9.75,9.75)(9.75,9.75,9.75,9.75)

为球心、半径

r=cWˉ3=39c34r=c\bar W\sqrt3 =\frac{39c\sqrt3}{4}

的三维球。当 c2/3c\le2/3 时,这颗球完全位于正间隔单纯形内部。单纯形三维体积为 393/339^3/3,球体积为 4πr3/34\pi r^3/3,所以

Pr(CVWcN(40)=5,T1=1,T5=40)=4πr3393=33π16c3.\begin{aligned} \Pr(CV_W\le c \mid N(40)=5,T_1=1,T_5=40) &=\frac{4\pi r^3}{39^3}\\ &=\frac{3\sqrt3\pi}{16}c^3. \end{aligned}

代入 c=0.10c=0.10

Pr(CVW0.10N(40)=5,T1=1,T5=40)0.001020.\Pr(CV_W\le0.10 \mid N(40)=5,T_1=1,T_5=40) \approx0.001020.

此时允许的离差平方和上限为

3(0.10)2(9.75)2=2.851875.3(0.10)^2(9.75)^2 =2.851875.

若时间戳只记录为严格递增的整数分钟,中间三个时刻从 2,,392,\ldots,39 中选择,共有

(383)=8436\binom{38}{3}=8436

种等可能配置。枚举和为 39 的正整数四元组,满足 CVW0.10CV_W\le0.10 的间隔只有两类排列:

(9,10,10,10)的 4 个排列,(9,10,10,10) \quad\text{的 4 个排列}, (9,9,10,11)的 12 个排列.(9,9,10,11) \quad\text{的 12 个排列}.

故整数分钟下的精确条件概率为

4+128436=1684360.001897.\frac{4+12}{8436} =\frac{16}{8436} \approx0.001897.

连续与离散参照给出相同数量级,也把记录分辨率明确纳入推断。这个概率依赖齐次强度、固定端点、预先指定的 CVCV 和未根据结果挑选统计量。若用户遵循固定日程,或强度随时段变化,齐次条件参照会把真实规律误判为模板;下一节将放松恒定强度。

条件强度统一非齐次到达、似然与残差

非齐次 Poisson 过程允许强度随绝对时间变化:

λ(t)0.\lambda(t)\ge0.

区间 (a,b](a,b] 的累计强度为

Λ(a,b)=abλ(u)du,\Lambda(a,b) =\int_a^b\lambda(u)\,du,

并满足

N(b)N(a)Poisson{Λ(a,b)}.N(b)-N(a) \sim\operatorname{Poisson}\{\Lambda(a,b)\}.

条件于 N(T)=nN(T)=n,未排序的 nn 个事件位置独立同分布,单个位置的密度与 λ(t)\lambda(t) 成正比:

f(tN(T)=n)=λ(t)Λ(0,T).f(t\mid N(T)=n) =\frac{\lambda(t)}{\Lambda(0,T)}.

班次、昼夜节律和定时任务都可能让某些时段天然更密集。均匀位置参照此时应改成拟合强度下的条件模拟。

更一般的简单点过程用条件强度

λ(tHt)\lambda(t\mid\mathcal H_t)

表示给定 tt 以前完整历史 Ht\mathcal H_t 后,下一小段时间的瞬时到达率。条件于观察窗以前的已知历史,对事件时刻 t1,,tnt_1,\ldots,t_n 的点过程对数似然为

=i=1nlogλ(tiHti)0Tλ(uHu)du.\ell =\sum_{i=1}^n \log\lambda(t_i\mid\mathcal H_{t_i}) -\int_0^T\lambda(u\mid\mathcal H_u)\,du.

第一项奖励模型在实际事件时刻给出较高强度,第二项惩罚整个窗口中过大的总预测事件数。齐次 Poisson 代入常数 λ\lambda,就回到 nlogλλTn\log\lambda-\lambda T

拟合完成后,时间重标度把每个完整间隔变成

Zi=ti1tiλ^(uHu)du.Z_i =\int_{t_{i-1}}^{t_i} \widehat\lambda(u\mid\mathcal H_u)\,du.

若观察从一个已知起点开始,可令 t0=0t_0=0;过程早已运行时,第一段还要附带窗口开始前的历史条件。

若条件强度正确且参数误差可忽略,ZiZ_i 应近似独立同分布为 Exponential(1)\operatorname{Exponential}(1);再变换

Ui=1eZiU_i=1-e^{-Z_i}

应近似独立均匀分布。Q–Q 图、均匀性检验和残差自相关分别检查分布形状与剩余依赖。用同一小批事件拟合并检验会降低检出能力,宜使用留出时段、交叉验证或参数不确定性校正。

方法来路:时间重标度为何有用?

复杂点过程的原始间隔没有统一分布,很难直接比较。时间重标度定理用模型自己的累计条件强度重画时间轴:强度高的时段被拉长,强度低的时段被压缩,正确模型最终留下单位指数间隔。Brown 等人在 2002 年为神经脉冲序列给出面向应用的推导和诊断流程,使这一定理成为点过程残差分析的通用工具。

Hawkes 过程把一次事件对后续事件的推动写进强度

真实用户可能在一次点击后短期内更容易继续点击。指数核 Hawkes 过程写成

λ(tHt)=μ+ti<tαeβ(tti),\lambda(t\mid\mathcal H_t) =\mu +\sum_{t_i<t} \alpha e^{-\beta(t-t_i)},

其中 μ\mu 是外生基线强度,α\alpha 的单位是“每单位时间”,β\beta 的单位是“每单位时间”,每个旧事件的影响按时间衰减。指数核总影响为

η=0αeβudu=αβ,\eta =\int_0^\infty\alpha e^{-\beta u}\,du =\frac\alpha\beta,

称为分支比。在简单单变量平稳情形中需要

η<1.\eta<1.

对平稳强度取期望,

λˉ=μ+ηλˉ,\bar\lambda =\mu+\eta\bar\lambda,

因此

λˉ=μ1η.\bar\lambda =\frac{\mu}{1-\eta}.

A 的前三次点击集中在前三分钟,符合“事件后短期再发生,事件簇后留出长空档”的形状;B 把每次点击的间隔拉到 9 或 10 分钟,几乎清除了短期自激。两条流水可以匹配同一个 λˉ\bar\lambda,条件强度、簇大小和重标度残差却会不同。

只有五次点击无法稳定区分 Hawkes、非齐次 Poisson 或一次偶然事件簇。合理评估应汇集多天或多个可比账号,报告基线、核函数、分支比、参数区间、时间重标度诊断和外部事件协变量。若把同一模板复制到很多账号,低估的账号间相关还会让参数区间过窄。

方法来路:自激点过程为何出现?

Alan Hawkes 在 1971 年系统研究事件如何提高后续事件强度,以及多类事件怎样互相激发。地震余震、交易到达、社交转发和故障连锁都带有“发生一次以后,短期内更容易再发生”的结构;独立 Poisson 增量无法表达这种传播。

更新过程用间隔形状区分聚集与过度规则

Poisson 过程是指数间隔更新过程。若相邻间隔独立同分布为更一般的分布,事件过程仍可按每次到达后重新计时。一个常用参照是

WGamma(k,θ),θ=1kλ.W\sim\operatorname{Gamma}(k,\theta), \qquad \theta=\frac{1}{k\lambda}.

于是

E(W)=kθ=1λ,\mathbb{E}(W)=k\theta=\frac1\lambda, Var(W)=kθ2=1kλ2,CV(W)=1k.\operatorname{Var}(W)=k\theta^2 =\frac{1}{k\lambda^2}, \qquad CV(W)=\frac1{\sqrt k}.

k=1k=1 回到指数间隔;k>1k>1 产生较规则的等待,k<1k<1 同时增加短间隔和长尾。若把四个条件间隔暂时当作独立 Gamma 样本,只作量级诊断,则矩估计

k^mom1CVW2\widehat k_{\mathrm{mom}} \approx\frac1{CV_W^2}

给出

k^A0.918,k^B380.25.\widehat k_A\approx0.918, \qquad \widehat k_B\approx380.25.

B 对应极强的规则性。四个间隔、固定总和和事后构造均违反这项矩估计的常规条件,因此 380.25380.25 只是一把诊断刻度,不能当作可靠参数估计。

跨多个等长窗口还可比较计数的 Fano 因子:

F=Var{N(T)}E{N(T)}.F =\frac{\operatorname{Var}\{N(T)\}}{\mathbb{E}\{N(T)\}}.

齐次 Poisson 有 F=1F=1;事件簇常产生 F>1F>1,过度规则或容量限制可能产生 F<1F<1。间隔 CVCV 与计数 Fano 因子观察的是不同统计量,有限窗口下没有简单恒等关系。它们都需要多个独立窗口或账号估计;一条五点击流水只能提供线索。

HMM 把点击序列解释为隐状态切换

若账号在“休眠”和“活跃”状态之间切换,可先把时间划成固定宽度的离散格。令

St{D,A}S_t\in\{D,A\}

表示隐状态,Yt{0,1}Y_t\in\{0,1\} 表示该格是否点击。状态满足一阶 Markov 性:

Pr(StS1:t1)=Pr(StSt1).\Pr(S_t\mid S_{1:t-1}) =\Pr(S_t\mid S_{t-1}).

取转移矩阵

P=(0.80.20.30.7),P= \begin{pmatrix} 0.8&0.2\\ 0.3&0.7 \end{pmatrix},

行表示当前状态 D,AD,A,列表示下一状态。发射概率为

Pr(Yt=1St=D)=0.1,Pr(Yt=1St=A)=0.8,\Pr(Y_t=1\mid S_t=D)=0.1, \qquad \Pr(Y_t=1\mid S_t=A)=0.8,

bs(y)=Pr(Yt=ySt=s).b_s(y)=\Pr(Y_t=y\mid S_t=s).

初始分布为

π=(0.6,0.4).\pi=(0.6,0.4).

前向量定义为

αt(s)=Pr(Y1:t=y1:t,St=s).\alpha_t(s) =\Pr(Y_{1:t}=y_{1:t},S_t=s).

递推式为

α1(s)=πsbs(y1),\alpha_1(s)=\pi_s b_s(y_1), αt(s)=bs(yt)rαt1(r)Prs,\alpha_t(s) =b_s(y_t) \sum_r\alpha_{t-1}(r)P_{rs},

最终序列概率为

Pr(Y1:T=y1:T)=sαT(s).\Pr(Y_{1:T}=y_{1:T}) =\sum_s\alpha_T(s).

对观测序列 (0,1,1)(0,1,1)

α1=(0.6×0.9, 0.4×0.2)=(0.54,0.08),\alpha_1 =(0.6\times0.9,\ 0.4\times0.2) =(0.54,0.08), α2=(0.54,0.08)P(0.1000.8)=(0.0456,0.1312),\alpha_2 =(0.54,0.08)P \begin{pmatrix} 0.1&0\\ 0&0.8 \end{pmatrix} =(0.0456,0.1312),

其中状态预测为 (0.54,0.08)P=(0.456,0.164)(0.54,0.08)P=(0.456,0.164),再分别乘上观测 Y2=1Y_2=1 在两种状态下的发射概率 0.10.10.80.8

α3=(0.007584,0.080768),\alpha_3=(0.007584,0.080768),

Pr{Y1:3=(0,1,1)}=0.088352.\Pr\{Y_{1:3}=(0,1,1)\} =0.088352.

普通 HMM 还隐含几何状态持续时间。活跃状态每格保持活跃的概率为 0.70.7,若持续长度为 LAL_A,则

Pr(LA=)=0.71(10.7),E(LA)=110.7=103.\Pr(L_A=\ell) =0.7^{\ell-1}(1-0.7), \qquad \mathbb{E}(L_A)=\frac1{1-0.7}=\frac{10}{3}.

模板生成若让许多账号在相同分钟转为活跃、持续相同格数并同时退出,会造成转移时刻与持续时间的异常重合。时间格宽会改变发射概率和持续长度;持续时间明显偏离几何分布时,可使用隐半 Markov 模型直接建模。

方法来路:看不见的状态怎样进入统计模型?

Baum 与 Petrie 在 1966 年研究有限状态 Markov 链经过随机观测以后怎样进行统计推断,奠定了 HMM 的前向计算与可识别性基础。后来语音识别把“发音状态不可直接观察、声学信号可以观察”的结构推向大规模应用。行为分析沿用同一思想,把活跃、休眠等状态当作解释序列相关性的潜在机制。

生存分析利用尚未发生的终止时间

重复点击描述一串事件,账号流失、设备失效或首次故障通常只记录一个终止时间。设终止时间为 TT,生存函数为

S(t)=Pr(T>t).S(t)=\Pr(T>t).

TT 连续且有密度 ff,危险率定义为

h(t)=limΔt0Pr(tT<t+ΔtTt)Δt=f(t)S(t).h(t) =\lim_{\Delta t\to0} \frac{ \Pr(t\le T<t+\Delta t\mid T\ge t) }{\Delta t} =\frac{f(t)}{S(t)}.

h(t)h(t) 的单位是“每单位时间”。小时间段内的条件事件概率近似为 h(t)Δth(t)\Delta t,危险率本身没有 [0,1][0,1] 的概率上界。累计危险

H(t)=0th(u)duH(t)=\int_0^th(u)\,du

满足

S(t)=eH(t),f(t)=h(t)S(t).S(t)=e^{-H(t)}, \qquad f(t)=h(t)S(t).

研究结束时仍活跃的账号只知道真实终止时间超过当前随访。设删失时间为 CC,实际观察到

U=min(T,C),δ=1{TC}.U=\min(T,C), \qquad \delta=\mathbf 1\{T\le C\}.

单个对象的似然贡献为

f(U)δS(U)1δ=h(U)δS(U).f(U)^\delta S(U)^{1-\delta} =h(U)^\delta S(U).

发生终止的对象贡献密度,右删失对象贡献“至少活到 UU”的概率。若对象只有在已经存活到进入时刻 LL 后才会入样,便出现左截断。似然贡献要改成条件于 T>LT>L 的形式:

h(U)δS(U)S(L).\frac{h(U)^\delta S(U)}{S(L)}.

删失影响可见终点,截断改变入样机会。常规生存方法要求删失在给定协变量后不再携带额外终止风险信息;高风险账号恰好更容易失联时,直接应用会产生偏差。把模板 B 复制到许多账号并设置相同退出日,还会让生存曲线出现缺少个体差异的集中跳跃。

Kaplan–Meier 乘积极限保留每段风险集

在每个不同终止时刻 tjt_j,设终止前仍处于风险集的人数为 njn_j,该时刻发生终止的人数为 djd_j。条件存活比例估计为

1djnj.1-\frac{d_j}{n_j}.

从时间 0 逐段相乘,得到 Kaplan–Meier 估计:

S^(t)=tjt(1djnj).\widehat S(t) =\prod_{t_j\le t} \left(1-\frac{d_j}{n_j}\right).

例如 4 个账号中,第 2 天 1 个流失,第 3 天 1 个删失,第 5 天 1 个流失,最后 1 个继续活跃。第 2 天

n1=4,d1=1,S^(2)=34.n_1=4, \qquad d_1=1, \qquad \widehat S(2)=\frac34.

第 3 天删失者在离开前已经贡献了三天存活信息;它退出风险集后,第 5 天有 n2=2,d2=1n_2=2,d_2=1,所以

S^(5)=34(112)=38.\widehat S(5) =\frac34\left(1-\frac12\right) =\frac38.

Greenwood 方差估计为

Var^{S^(t)}=S^(t)2tjtdjnj(njdj).\widehat{\operatorname{Var}}\{\widehat S(t)\} =\widehat S(t)^2 \sum_{t_j\le t} \frac{d_j}{n_j(n_j-d_j)}.

本例在第 5 天得到

Var^{S^(5)}=(38)2(14×3+12×1)=0.08203,\widehat{\operatorname{Var}}\{\widehat S(5)\} =\left(\frac38\right)^2 \left( \frac1{4\times3} +\frac1{2\times1} \right) =0.08203,

标准误约为 0.2860.286。四个对象带来的不确定性很大,简单正态区间还可能越出 [0,1][0,1];实际报告常在对数累计危险等变换尺度上构造区间。

直接删除所有删失账号会浪费其已知存活时段,并改变各时刻风险集。若删失依赖尚未观察到的终止风险,Kaplan–Meier 乘积也无法自行修复,应补充删失机制模型和敏感性分析。

方法来路:乘积极限估计为了解决什么困难?

随访研究结束时,许多对象仍未发生终点;把他们当作失败或完整成功都会丢失信息。Kaplan 与 Meier 在 1958 年把每个事件时刻的条件存活比例相乘,使不同随访长度和右删失记录共同进入一条非参数生存曲线。风险集由此成为生存分析的基本记账单位。

轨迹对齐、模板重复与外部锚点需要一起看

两个账号可能经历相同阶段,时间快慢却不同。对规则采样序列 x1:px_{1:p}y1:qy_{1:q},动态时间规整(dynamic time warping, DTW)定义局部代价 d(xi,yj)d(x_i,y_j),并递推

D(i,j)=d(xi,yj)+min{D(i1,j),D(i,j1),D(i1,j1)}.D(i,j) =d(x_i,y_j) +\min\{D(i-1,j),D(i,j-1),D(i-1,j-1)\}.

边界可设为

D(0,0)=0,D(i,0)=D(0,j)=+.D(0,0)=0, \qquad D(i,0)=D(0,j)=+\infty.

对齐路径必须保持时间顺序,并可限制在

ijw|i-j|\le w

的窗口内。约束过松时,无关轨迹也能通过反复拉伸取得低代价;还应报告原始时间差、路径长度、归一化代价和允许窗口。事件型数据若先分箱再做 DTW,结果会依赖箱宽。直接比较时间戳时,还可使用间隔向量、编辑距离或最优传输距离。

固定首末时刻和整数分钟后,一条账号流水有 8436 种中间时间配置。若两个账号在均匀、独立条件参照下生成,恰好采用同一配置的概率为

184360.0001185.\frac1{8436} \approx0.0001185.

100 个独立账号共有 (1002)=4950\binom{100}{2}=4950 对,完全相同配置的期望配对数为

495084360.587.\frac{4950}{8436} \approx0.587.

若几十个账号都复制 B,重复量将远超这把简单参照尺。真实用户可能共享班次、定时提醒和系统限流,独立均匀假设常需按账号类型、时区和使用机会分层,再用拟合模型模拟重复分布。

促销、系统故障、节假日和版本发布还提供外部时间锚点。可定义账号 ii 对锚点 aa 的首次响应延迟

Lia=min{Tija:Tija}.L_{ia} =\min\{T_{ij}-a:T_{ij}\ge a\}.

真实延迟会随状态、地区和暴露机会变化。观察窗结束仍未响应的账号提供右删失延迟,不能直接删除。大量账号在锚点后以相同延迟、相同次数和相同持续时间响应,会把单条规则性升级为批量模板证据。

方法来路:DTW 为什么首先服务于语音识别?

同一个词由不同说话者读出时,声学形状相近,局部语速却会伸缩。Sakoe 与 Chiba 在 1978 年系统比较动态规划时间归一化,并用斜率约束减少错误对齐。行为轨迹继承了同一问题:允许有限速度差可以找到共同阶段,过大的对齐自由会抹掉真正差异。

冻结时间口径,才能审计整条生命周期

回到章首,两条流水的直接核查为

检查量原流水 A改写流水 B
点击总数55
观察窗[0,40][0,40][0,40][0,40]
首末时刻(1,40)(1,40)(1,40)(1,40)
内部间隔(1,1,17,20)(1,1,17,20)(9,10,10,10)(9,10,10,10)
间隔均值9.759.759.759.75
间隔样本标准差10.17810.1780.50.5
间隔变异系数1.0441.0440.0510.051
CVW0.10CV_W\le0.10未通过通过

一份可复核的行为流水报告至少保存:

  1. 原始时间、显示时间、时区、取整与批量上报规则;

  2. 观察窗、暴露时长、边界空档和删失定义;

  3. 事件总数、内部间隔、窗口计数与预定统计量;

  4. 齐次、非齐次或条件强度模型的选择依据;

  5. 点过程似然、参数不确定性和时间重标度残差;

  6. 事件簇、更新间隔、Fano 因子与窗口长度;

  7. HMM 时间格、状态数、发射、转移和持续时间;

  8. 终止事件、删失、截断、风险集与生存曲线;

  9. 原始轨迹距离、DTW 约束和精确模板重复数;

  10. 外部锚点、响应延迟、账号分层和跨账号相关;

  11. 所有移动、补录、去重和重算操作的版本日志;

  12. 指标、门槛、模型与停止规则的冻结时间。

章首改写通过了机械门槛,也在条件位置参照、更新形状、HMM 同步、退出时间和批量重复中留下新的异常。单一 CVCV 无法证明篡改;多个与生成机制相容的检查共同指向同一模板时,证据才逐渐累积。

到这里,前两章分别处理了“挑哪一个合成指标”和“改哪几个时间戳”。下一章将保留全部真实记录,只在排除、变换、协变量和检验方向之间选择路径,继续研究软件输出全部正确时,结论怎样被分析机会塑造。

本章知识链

章首把 A=(1,2,3,20,40)A=(1,2,3,20,40) 改成 B=(1,10,20,30,40)B=(1,10,20,30,40),保留五次点击、观察窗和首末时刻,并把内部间隔变异系数从 1.0441.044 降到 0.0510.051。齐次 Poisson 过程由短区间到达假设推出 Poisson 计数,事件数对恒定速率充分;指数间隔的总体 CVCV 为 1,固定计数与端点后应改用条件分布。四个标准化间隔服从 Dirichlet(1,1,1,1)\operatorname{Dirichlet}(1,1,1,1),连续参照下 CV0.10CV\le0.10 的概率为 0.0010200.001020,整数分钟下为 16/8436=0.00189716/8436=0.001897。条件强度与点过程似然允许时变规律,时间重标度把正确模型的间隔化为单位指数;Hawkes 分支比描述自激事件簇,Gamma 更新过程区分规则与聚集,HMM 用前向递推和几何持续时间表达隐状态,生存似然与 Kaplan–Meier 乘积保留右删失信息,DTW、模板重复和外部锚点检查跨账号同步。总量正确只覆盖了生命周期结构中的第一层。

思考与练习

  1. 复算 A、B 的四个内部间隔、样本标准差和变异系数。再说明观察窗事件率、内部间隔均值与边界空档各自使用了哪些分母。

  2. 若齐次 Poisson 强度为 λ=2\lambda=2/小时,计算 3 小时内恰有 4 个事件的概率、平均等待时间、等待时间标准差和总体变异系数。

  3. 证明齐次 Poisson 事件时刻似然对 λ\lambda 只通过 nn 发生变化,并解释事件位置仍可用于哪些模型检查。

  4. 固定四个正间隔之和为 LL,推导 CVWcCV_W\le c 对应球的半径 r=cL3/4r=cL\sqrt3/4;在球不碰到单纯形边界时,验证条件概率为 33πc3/163\sqrt3\pi c^3/16

  5. 非齐次 Poisson 强度为 λ(t)=2t\lambda(t)=2t0t10\le t\le1。计算 Λ(0,t)\Lambda(0,t);若事件发生在 0.20.20.80.8,计算两个从窗口起点开始的重标度完整间隔。

  6. Hawkes 参数为 μ=1,α=0.6,β=1\mu=1,\alpha=0.6,\beta=1,计算分支比与平稳平均强度,并说明 α\alphaβ\beta 的单位。

  7. Gamma 更新间隔的均值要求为 2 分钟、总体 CVCV 要求为 0.250.25。求形状 kk 与尺度 θ\theta,并与指数间隔比较规则性。

  8. 使用本章 HMM,计算观测序列 (1,0)(1,0) 的概率。

  9. 本章活跃状态保持概率为 0.70.7。计算活跃持续长度的均值以及 Pr(LA5)\Pr(L_A\ge5)

  10. 五个对象的终止/删失时间为 2E,3C,4E,6C,7E2E,3C,4E,6C,7E,其中 EE 表示终止、CC 表示右删失。手算 Kaplan–Meier 曲线,并写出每个事件时刻的风险集。

  11. 解释 DTW 窗口过宽怎样让两条不同轨迹取得过低距离,并为分钟级点击序列提出一项原始时间差补充指标。

  12. 为 1000 个账号设计批量流水审计,至少包含条件强度残差、状态持续、删失处理、精确模板计数和外部锚点响应;说明哪些参照需要按时区或班次分层。

专题导航