第二十二章:编造行为流水
本章造假目标
在观察窗 [0,40] 分钟内,某账号的五次点击发生于 A=(1,2,3,20,40)。点击总数合格,四个相邻点击间隔 (1,1,17,20) 的样本变异系数约为 1.044,营销卡据此判定互动“忽冷忽热”;验收要求间隔变异系数不超过 0.10。只允许移动中间三个时间戳,不得增加或删除点击,也要保持第一次点击在第 1 分钟、最后一次点击在第 40 分钟。任务是把流水改成 B=(1,10,20,30,40),使间隔变成 (9,10,10,10)、变异系数降到 0.051。随后固定事件数与首末时刻,计算这种规则性在 Poisson 条件参照下有多罕见,再把同一模板放回非齐次强度、Hawkes 事件簇、HMM 状态持续、生存时间、跨账号对齐和外部时间锚点中复核。
五次点击都保留,时间结构已经改写
原流水与改写流水为
A=(1,2,3,20,40),B=(1,10,20,30,40).
对连续五个事件时刻,定义四个内部间隔
Wi=Ti−Ti−1,i=2,…,5.
两组间隔分别为
WA=(1,1,17,20),WB=(9,10,10,10).
它们的和都等于首末跨度 40−1=39,均值也同为
Wˉ=439=9.75.
章首验收采用样本标准差与样本变异系数
sW=4−11i=1∑4(Wi−Wˉ)2,CVW=WˉsW.
对 A,离差平方和为
2(1−9.75)2+(17−9.75)2+(20−9.75)2=310.75,
所以
sW,A=3310.75≈10.178,CVW,A≈1.044.
对 B,离差为 −0.75,0.25,0.25,0.25,故
sW,B=30.75=0.5,CVW,B=9.750.5≈0.051.
移动第 2、3、4 次点击以后,B 通过 CVW≤0.10 的验收。总点击数、首末时刻和内部间隔均值全部保持不变;A 在开头形成事件簇,随后经历两段长空档,B 接近每十分钟点击一次。总数压缩了“发生多少”,时间戳保留了“何时发生”。
造假动作留下的影子
改写把间隔变异系数从 1.044 压到 0.051,同时保留五次点击与 39 分钟首末跨度。营销卡奖励低波动,因而会把机械规则性当作稳定互动。固定事件数与首末时刻后,连续时间 Poisson 条件参照中 CVW≤0.10 的概率约为 0.00102;按整数分钟记录时,精确条件概率约为 0.00190。一项通过值由此转化为模板证据。
要理解这项反转,先把一条事件流水拆成计数、内部间隔、边界暴露和跨账号重复四层,再逐层建立参照模型。
计数、内部间隔与边界空档回答不同问题
设观察窗为 [0,T],其中有
0<T1<⋯<Tn≤T
个事件。计数过程定义为
N(t)=i=1∑n1{Ti≤t}.
一条完整窗口至少包含三类时间量:
-
事件总数 N(T)=n;
-
内部间隔 Wi=Ti−Ti−1,i=2,…,n;
-
左、右边界空档 GL=T1 与 GR=T−Tn。
章首两条流水都有
N(40)=5,GL=1,GR=0.
按完整观察窗估计的事件率为
λwindow=40N(40)=0.125
次/分钟。内部间隔均值 9.75 则来自四段首末事件之间的等待。1/0.125=8 分钟与 9.75 分钟没有代数矛盾:前者用完整 40 分钟暴露和五次事件估计长期平均等待,后者只平均四个已完成的内部间隔。
边界处理取决于观察设计。若过程在第 0 分钟以前已经运行,GL 是从窗口起点到下一事件的前向等待;对一般更新过程,它未必服从完整间隔分布。GR 通常是一段尚未等到下一事件的右删失等待。章首验收明确只用四个内部间隔,因此不应临时把边界空档混入 CVW;建立概率模型时仍要把完整暴露窗写进似然。
时间戳分辨率也属于数据定义。分钟取整会制造并列时间和整数间隔;系统时区、夏令时、离线缓存和批量上报还会改变表面顺序。原始时间、显示时间、服务器接收时间和取整规则应分别保存。
齐次 Poisson 过程把恒定速率变成计数分布
齐次 Poisson 过程用一个常数强度 λ>0 描述独立到达。对很短的时间段 h,假定:
这里 o(h) 表示比 h 更高阶的小量,即 o(h)/h→0。它把“极短时间内同时出现多个事件”的概率排除在一阶近似之外。
令
pk(t)=Pr{N(t)=k}.
零事件概率满足
p0(t+h)=p0(t)(1−λh)+o(h).
两边减去 p0(t)、除以 h 并令 h→0,得到
p0′(t)=−λp0(t),p0(0)=1,
所以
p0(t)=e−λt.
对 k≥1,小时间段内只保留“原有 k 次且无新事件”与“原有 k−1 次且来一次”两条一阶路径:
pk(t+h)=pk(t)(1−λh)+pk−1(t)λh+o(h).
于是
pk′(t)=λpk−1(t)−λpk(t).
逐级求解可得
N(t)∼Poisson(λt),pk(t)=e−λtk!(λt)k.
Poisson 分布的均值与方差相同,因此
E{N(t)}=Var{N(t)}=λt.
若在 [0,T] 中观察到按序排列的事件时刻 t1:n,齐次 Poisson 的点过程似然为
L(λ;t1:n)=e−λTλn.
对所有满足 0<t1<⋯<tn<T 的位置积分,排序区域体积为 Tn/n!,便得到计数概率
e−λTλnn!Tn=e−λTn!(λT)n.
对 λ 求最大似然估计:
ℓ(λ)=−λT+nlogλ,ℓ′(λ)=−T+λn,
从而
λ=Tn.
A 与 B 都给出 5/40=0.125。在齐次 Poisson 模型内部,事件总数对 λ 是充分统计量,两条流水也具有相同的 λ 似然。这个结论只负责估计恒定速率;检验“恒定、独立到达”是否合适,仍需查看条件下的时间位置。
模型内充分性与审计信息
计数对齐次 Poisson 的速率参数充分,表示给定计数后,事件位置不再提供关于 λ 的信息。事件位置仍能检验模型假设、寻找模板和比较更丰富的强度模型。参数估计所需信息可以少于模型审计所需信息。
指数间隔给出总体参照,条件化会改变样本分布
从某次事件开始等待下一次事件,令等待时间为 W。在齐次 Poisson 过程中,W>w 等价于随后 w 个时间单位没有新事件,因此
Pr(W>w)=Pr{N(w)=0}=e−λw,w≥0.
于是
W∼Exponential(λ),fW(w)=λe−λw.
利用尾积分公式,
E(W)=∫0∞e−λwdw=λ1,
E(W2)=2∫0∞we−λwdw=λ22.
因此
Var(W)=λ21,CV(W)=1.
指数分布还具有无记忆性:
Pr(W>s+t∣W>s)=Pr(W>t).
这里的 CV(W)=1 是未条件化总体间隔的性质。章首只保留四个间隔,又固定它们的和为 39;四个间隔因此不再独立,也不再分别服从指数分布。只有四个观测时,样本 CV 本身还会大幅波动。把 B 的 0.051 与理论值 1 直接相减可以形成直觉,正式条件检验需要使用下一节的固定和分布。
这一区分也解释了两个看似相反的事实:齐次 Poisson 给 A、B 相同的速率似然;在固定计数与端点后,接近等间隔的配置仍只占全部可能位置的一小块。连续数据中每一个精确配置的概率都为 0,检验应针对事前定义的极端集合,例如 {CVW≤0.10}。
固定首末时刻后,规则间隔落在一个小球里
条件于 N(40)=5,再固定第一次事件发生在 1、最后一次事件发生在 40,齐次 Poisson 下的三个中间事件等价于区间 (1,40) 上三个独立均匀点的次序统计量。在 1<t2<t3<t4<40 上,它们的联合密度为常数 3!/393。
为便于几何推导,把四个内部间隔重新编号为 W1,…,W4。由中间事件位置换元,得到
Wi>0,i=1∑4Wi=39.
标准化间隔满足
(39W1,…,39W4)∼Dirichlet(1,1,1,1),
也就是在三维单纯形上均匀分布。
由于 Wˉ=39/4 已固定,门槛 CVW≤c 等价于
i=1∑4(Wi−Wˉ)2≤3c2Wˉ2.
在和为 39 的三维超平面内,这是一颗以等间隔点
(9.75,9.75,9.75,9.75)
为球心、半径
r=cWˉ3=439c3
的三维球。当 c≤2/3 时,这颗球完全位于正间隔单纯形内部。单纯形三维体积为 393/3,球体积为 4πr3/3,所以
Pr(CVW≤c∣N(40)=5,T1=1,T5=40)=3934πr3=1633πc3.
代入 c=0.10:
Pr(CVW≤0.10∣N(40)=5,T1=1,T5=40)≈0.001020.
此时允许的离差平方和上限为
3(0.10)2(9.75)2=2.851875.
若时间戳只记录为严格递增的整数分钟,中间三个时刻从 2,…,39 中选择,共有
(338)=8436
种等可能配置。枚举和为 39 的正整数四元组,满足 CVW≤0.10 的间隔只有两类排列:
(9,10,10,10)的 4 个排列,
(9,9,10,11)的 12 个排列.
故整数分钟下的精确条件概率为
84364+12=843616≈0.001897.
连续与离散参照给出相同数量级,也把记录分辨率明确纳入推断。这个概率依赖齐次强度、固定端点、预先指定的 CV 和未根据结果挑选统计量。若用户遵循固定日程,或强度随时段变化,齐次条件参照会把真实规律误判为模板;下一节将放松恒定强度。
条件强度统一非齐次到达、似然与残差
非齐次 Poisson 过程允许强度随绝对时间变化:
λ(t)≥0.
区间 (a,b] 的累计强度为
Λ(a,b)=∫abλ(u)du,
并满足
N(b)−N(a)∼Poisson{Λ(a,b)}.
条件于 N(T)=n,未排序的 n 个事件位置独立同分布,单个位置的密度与 λ(t) 成正比:
f(t∣N(T)=n)=Λ(0,T)λ(t).
班次、昼夜节律和定时任务都可能让某些时段天然更密集。均匀位置参照此时应改成拟合强度下的条件模拟。
更一般的简单点过程用条件强度
λ(t∣Ht)
表示给定 t 以前完整历史 Ht 后,下一小段时间的瞬时到达率。条件于观察窗以前的已知历史,对事件时刻 t1,…,tn 的点过程对数似然为
ℓ=i=1∑nlogλ(ti∣Hti)−∫0Tλ(u∣Hu)du.
第一项奖励模型在实际事件时刻给出较高强度,第二项惩罚整个窗口中过大的总预测事件数。齐次 Poisson 代入常数 λ,就回到 nlogλ−λT。
拟合完成后,时间重标度把每个完整间隔变成
Zi=∫ti−1tiλ(u∣Hu)du.
若观察从一个已知起点开始,可令 t0=0;过程早已运行时,第一段还要附带窗口开始前的历史条件。
若条件强度正确且参数误差可忽略,Zi 应近似独立同分布为 Exponential(1);再变换
Ui=1−e−Zi
应近似独立均匀分布。Q–Q 图、均匀性检验和残差自相关分别检查分布形状与剩余依赖。用同一小批事件拟合并检验会降低检出能力,宜使用留出时段、交叉验证或参数不确定性校正。
方法来路:时间重标度为何有用?
复杂点过程的原始间隔没有统一分布,很难直接比较。时间重标度定理用模型自己的累计条件强度重画时间轴:强度高的时段被拉长,强度低的时段被压缩,正确模型最终留下单位指数间隔。Brown 等人在 2002 年为神经脉冲序列给出面向应用的推导和诊断流程,使这一定理成为点过程残差分析的通用工具。
Hawkes 过程把一次事件对后续事件的推动写进强度
真实用户可能在一次点击后短期内更容易继续点击。指数核 Hawkes 过程写成
λ(t∣Ht)=μ+ti<t∑αe−β(t−ti),
其中 μ 是外生基线强度,α 的单位是“每单位时间”,β 的单位是“每单位时间”,每个旧事件的影响按时间衰减。指数核总影响为
η=∫0∞αe−βudu=βα,
称为分支比。在简单单变量平稳情形中需要
η<1.
对平稳强度取期望,
λˉ=μ+ηλˉ,
因此
λˉ=1−ημ.
A 的前三次点击集中在前三分钟,符合“事件后短期再发生,事件簇后留出长空档”的形状;B 把每次点击的间隔拉到 9 或 10 分钟,几乎清除了短期自激。两条流水可以匹配同一个 λˉ,条件强度、簇大小和重标度残差却会不同。
只有五次点击无法稳定区分 Hawkes、非齐次 Poisson 或一次偶然事件簇。合理评估应汇集多天或多个可比账号,报告基线、核函数、分支比、参数区间、时间重标度诊断和外部事件协变量。若把同一模板复制到很多账号,低估的账号间相关还会让参数区间过窄。
方法来路:自激点过程为何出现?
Alan Hawkes 在 1971 年系统研究事件如何提高后续事件强度,以及多类事件怎样互相激发。地震余震、交易到达、社交转发和故障连锁都带有“发生一次以后,短期内更容易再发生”的结构;独立 Poisson 增量无法表达这种传播。
更新过程用间隔形状区分聚集与过度规则
Poisson 过程是指数间隔更新过程。若相邻间隔独立同分布为更一般的分布,事件过程仍可按每次到达后重新计时。一个常用参照是
W∼Gamma(k,θ),θ=kλ1.
于是
E(W)=kθ=λ1,
Var(W)=kθ2=kλ21,CV(W)=k1.
k=1 回到指数间隔;k>1 产生较规则的等待,k<1 同时增加短间隔和长尾。若把四个条件间隔暂时当作独立 Gamma 样本,只作量级诊断,则矩估计
kmom≈CVW21
给出
kA≈0.918,kB≈380.25.
B 对应极强的规则性。四个间隔、固定总和和事后构造均违反这项矩估计的常规条件,因此 380.25 只是一把诊断刻度,不能当作可靠参数估计。
跨多个等长窗口还可比较计数的 Fano 因子:
F=E{N(T)}Var{N(T)}.
齐次 Poisson 有 F=1;事件簇常产生 F>1,过度规则或容量限制可能产生 F<1。间隔 CV 与计数 Fano 因子观察的是不同统计量,有限窗口下没有简单恒等关系。它们都需要多个独立窗口或账号估计;一条五点击流水只能提供线索。
HMM 把点击序列解释为隐状态切换
若账号在“休眠”和“活跃”状态之间切换,可先把时间划成固定宽度的离散格。令
St∈{D,A}
表示隐状态,Yt∈{0,1} 表示该格是否点击。状态满足一阶 Markov 性:
Pr(St∣S1:t−1)=Pr(St∣St−1).
取转移矩阵
P=(0.80.30.20.7),
行表示当前状态 D,A,列表示下一状态。发射概率为
Pr(Yt=1∣St=D)=0.1,Pr(Yt=1∣St=A)=0.8,
记
bs(y)=Pr(Yt=y∣St=s).
初始分布为
π=(0.6,0.4).
前向量定义为
αt(s)=Pr(Y1:t=y1:t,St=s).
递推式为
α1(s)=πsbs(y1),
αt(s)=bs(yt)r∑αt−1(r)Prs,
最终序列概率为
Pr(Y1:T=y1:T)=s∑αT(s).
对观测序列 (0,1,1),
α1=(0.6×0.9, 0.4×0.2)=(0.54,0.08),
α2=(0.54,0.08)P(0.1000.8)=(0.0456,0.1312),
其中状态预测为 (0.54,0.08)P=(0.456,0.164),再分别乘上观测 Y2=1 在两种状态下的发射概率 0.1 与 0.8。
α3=(0.007584,0.080768),
故
Pr{Y1:3=(0,1,1)}=0.088352.
普通 HMM 还隐含几何状态持续时间。活跃状态每格保持活跃的概率为 0.7,若持续长度为 LA,则
Pr(LA=ℓ)=0.7ℓ−1(1−0.7),E(LA)=1−0.71=310.
模板生成若让许多账号在相同分钟转为活跃、持续相同格数并同时退出,会造成转移时刻与持续时间的异常重合。时间格宽会改变发射概率和持续长度;持续时间明显偏离几何分布时,可使用隐半 Markov 模型直接建模。
方法来路:看不见的状态怎样进入统计模型?
Baum 与 Petrie 在 1966 年研究有限状态 Markov 链经过随机观测以后怎样进行统计推断,奠定了 HMM 的前向计算与可识别性基础。后来语音识别把“发音状态不可直接观察、声学信号可以观察”的结构推向大规模应用。行为分析沿用同一思想,把活跃、休眠等状态当作解释序列相关性的潜在机制。
生存分析利用尚未发生的终止时间
重复点击描述一串事件,账号流失、设备失效或首次故障通常只记录一个终止时间。设终止时间为 T,生存函数为
S(t)=Pr(T>t).
若 T 连续且有密度 f,危险率定义为
h(t)=Δt→0limΔtPr(t≤T<t+Δt∣T≥t)=S(t)f(t).
h(t) 的单位是“每单位时间”。小时间段内的条件事件概率近似为 h(t)Δt,危险率本身没有 [0,1] 的概率上界。累计危险
H(t)=∫0th(u)du
满足
S(t)=e−H(t),f(t)=h(t)S(t).
研究结束时仍活跃的账号只知道真实终止时间超过当前随访。设删失时间为 C,实际观察到
U=min(T,C),δ=1{T≤C}.
单个对象的似然贡献为
f(U)δS(U)1−δ=h(U)δS(U).
发生终止的对象贡献密度,右删失对象贡献“至少活到 U”的概率。若对象只有在已经存活到进入时刻 L 后才会入样,便出现左截断。似然贡献要改成条件于 T>L 的形式:
S(L)h(U)δS(U).
删失影响可见终点,截断改变入样机会。常规生存方法要求删失在给定协变量后不再携带额外终止风险信息;高风险账号恰好更容易失联时,直接应用会产生偏差。把模板 B 复制到许多账号并设置相同退出日,还会让生存曲线出现缺少个体差异的集中跳跃。
Kaplan–Meier 乘积极限保留每段风险集
在每个不同终止时刻 tj,设终止前仍处于风险集的人数为 nj,该时刻发生终止的人数为 dj。条件存活比例估计为
1−njdj.
从时间 0 逐段相乘,得到 Kaplan–Meier 估计:
S(t)=tj≤t∏(1−njdj).
例如 4 个账号中,第 2 天 1 个流失,第 3 天 1 个删失,第 5 天 1 个流失,最后 1 个继续活跃。第 2 天
n1=4,d1=1,S(2)=43.
第 3 天删失者在离开前已经贡献了三天存活信息;它退出风险集后,第 5 天有 n2=2,d2=1,所以
S(5)=43(1−21)=83.
Greenwood 方差估计为
Var{S(t)}=S(t)2tj≤t∑nj(nj−dj)dj.
本例在第 5 天得到
Var{S(5)}=(83)2(4×31+2×11)=0.08203,
标准误约为 0.286。四个对象带来的不确定性很大,简单正态区间还可能越出 [0,1];实际报告常在对数累计危险等变换尺度上构造区间。
直接删除所有删失账号会浪费其已知存活时段,并改变各时刻风险集。若删失依赖尚未观察到的终止风险,Kaplan–Meier 乘积也无法自行修复,应补充删失机制模型和敏感性分析。
方法来路:乘积极限估计为了解决什么困难?
随访研究结束时,许多对象仍未发生终点;把他们当作失败或完整成功都会丢失信息。Kaplan 与 Meier 在 1958 年把每个事件时刻的条件存活比例相乘,使不同随访长度和右删失记录共同进入一条非参数生存曲线。风险集由此成为生存分析的基本记账单位。
轨迹对齐、模板重复与外部锚点需要一起看
两个账号可能经历相同阶段,时间快慢却不同。对规则采样序列 x1:p 与 y1:q,动态时间规整(dynamic time warping, DTW)定义局部代价 d(xi,yj),并递推
D(i,j)=d(xi,yj)+min{D(i−1,j),D(i,j−1),D(i−1,j−1)}.
边界可设为
D(0,0)=0,D(i,0)=D(0,j)=+∞.
对齐路径必须保持时间顺序,并可限制在
∣i−j∣≤w
的窗口内。约束过松时,无关轨迹也能通过反复拉伸取得低代价;还应报告原始时间差、路径长度、归一化代价和允许窗口。事件型数据若先分箱再做 DTW,结果会依赖箱宽。直接比较时间戳时,还可使用间隔向量、编辑距离或最优传输距离。
固定首末时刻和整数分钟后,一条账号流水有 8436 种中间时间配置。若两个账号在均匀、独立条件参照下生成,恰好采用同一配置的概率为
84361≈0.0001185.
100 个独立账号共有 (2100)=4950 对,完全相同配置的期望配对数为
84364950≈0.587.
若几十个账号都复制 B,重复量将远超这把简单参照尺。真实用户可能共享班次、定时提醒和系统限流,独立均匀假设常需按账号类型、时区和使用机会分层,再用拟合模型模拟重复分布。
促销、系统故障、节假日和版本发布还提供外部时间锚点。可定义账号 i 对锚点 a 的首次响应延迟
Lia=min{Tij−a:Tij≥a}.
真实延迟会随状态、地区和暴露机会变化。观察窗结束仍未响应的账号提供右删失延迟,不能直接删除。大量账号在锚点后以相同延迟、相同次数和相同持续时间响应,会把单条规则性升级为批量模板证据。
方法来路:DTW 为什么首先服务于语音识别?
同一个词由不同说话者读出时,声学形状相近,局部语速却会伸缩。Sakoe 与 Chiba 在 1978 年系统比较动态规划时间归一化,并用斜率约束减少错误对齐。行为轨迹继承了同一问题:允许有限速度差可以找到共同阶段,过大的对齐自由会抹掉真正差异。
冻结时间口径,才能审计整条生命周期
回到章首,两条流水的直接核查为
| 检查量 | 原流水 A | 改写流水 B |
|---|
| 点击总数 | 5 | 5 |
| 观察窗 | [0,40] | [0,40] |
| 首末时刻 | (1,40) | (1,40) |
| 内部间隔 | (1,1,17,20) | (9,10,10,10) |
| 间隔均值 | 9.75 | 9.75 |
| 间隔样本标准差 | 10.178 | 0.5 |
| 间隔变异系数 | 1.044 | 0.051 |
| CVW≤0.10 | 未通过 | 通过 |
一份可复核的行为流水报告至少保存:
-
原始时间、显示时间、时区、取整与批量上报规则;
-
观察窗、暴露时长、边界空档和删失定义;
-
事件总数、内部间隔、窗口计数与预定统计量;
-
齐次、非齐次或条件强度模型的选择依据;
-
点过程似然、参数不确定性和时间重标度残差;
-
事件簇、更新间隔、Fano 因子与窗口长度;
-
HMM 时间格、状态数、发射、转移和持续时间;
-
终止事件、删失、截断、风险集与生存曲线;
-
原始轨迹距离、DTW 约束和精确模板重复数;
-
外部锚点、响应延迟、账号分层和跨账号相关;
-
所有移动、补录、去重和重算操作的版本日志;
-
指标、门槛、模型与停止规则的冻结时间。
章首改写通过了机械门槛,也在条件位置参照、更新形状、HMM 同步、退出时间和批量重复中留下新的异常。单一 CV 无法证明篡改;多个与生成机制相容的检查共同指向同一模板时,证据才逐渐累积。
到这里,前两章分别处理了“挑哪一个合成指标”和“改哪几个时间戳”。下一章将保留全部真实记录,只在排除、变换、协变量和检验方向之间选择路径,继续研究软件输出全部正确时,结论怎样被分析机会塑造。
本章知识链
章首把 A=(1,2,3,20,40) 改成 B=(1,10,20,30,40),保留五次点击、观察窗和首末时刻,并把内部间隔变异系数从 1.044 降到 0.051。齐次 Poisson 过程由短区间到达假设推出 Poisson 计数,事件数对恒定速率充分;指数间隔的总体 CV 为 1,固定计数与端点后应改用条件分布。四个标准化间隔服从 Dirichlet(1,1,1,1),连续参照下 CV≤0.10 的概率为 0.001020,整数分钟下为 16/8436=0.001897。条件强度与点过程似然允许时变规律,时间重标度把正确模型的间隔化为单位指数;Hawkes 分支比描述自激事件簇,Gamma 更新过程区分规则与聚集,HMM 用前向递推和几何持续时间表达隐状态,生存似然与 Kaplan–Meier 乘积保留右删失信息,DTW、模板重复和外部锚点检查跨账号同步。总量正确只覆盖了生命周期结构中的第一层。
思考与练习
-
复算 A、B 的四个内部间隔、样本标准差和变异系数。再说明观察窗事件率、内部间隔均值与边界空档各自使用了哪些分母。
-
若齐次 Poisson 强度为 λ=2/小时,计算 3 小时内恰有 4 个事件的概率、平均等待时间、等待时间标准差和总体变异系数。
-
证明齐次 Poisson 事件时刻似然对 λ 只通过 n 发生变化,并解释事件位置仍可用于哪些模型检查。
-
固定四个正间隔之和为 L,推导 CVW≤c 对应球的半径 r=cL3/4;在球不碰到单纯形边界时,验证条件概率为 33πc3/16。
-
非齐次 Poisson 强度为 λ(t)=2t,0≤t≤1。计算 Λ(0,t);若事件发生在 0.2 与 0.8,计算两个从窗口起点开始的重标度完整间隔。
-
Hawkes 参数为 μ=1,α=0.6,β=1,计算分支比与平稳平均强度,并说明 α、β 的单位。
-
Gamma 更新间隔的均值要求为 2 分钟、总体 CV 要求为 0.25。求形状 k 与尺度 θ,并与指数间隔比较规则性。
-
使用本章 HMM,计算观测序列 (1,0) 的概率。
-
本章活跃状态保持概率为 0.7。计算活跃持续长度的均值以及 Pr(LA≥5)。
-
五个对象的终止/删失时间为 2E,3C,4E,6C,7E,其中 E 表示终止、C 表示右删失。手算 Kaplan–Meier 曲线,并写出每个事件时刻的风险集。
-
解释 DTW 窗口过宽怎样让两条不同轨迹取得过低距离,并为分钟级点击序列提出一项原始时间差补充指标。
-
为 1000 个账号设计批量流水审计,至少包含条件强度残差、状态持续、删失处理、精确模板计数和外部锚点响应;说明哪些参照需要按时区或班次分层。
专题导航