第十四章:改写一次失败,得到边界估计

本章造假目标

某元件接受五次通断试验。试验相互独立,并具有相同的成功概率;结果为四次成功和一次失败。Bernoulli 成功概率的最大似然估计为 4/5=0.84/5=0.8,低于认证表要求的 0.950.95。允许的操作只有把至多一条失败改成成功,不得增加试验、改变概率模型、验收线或报告指标。

本章将唯一失败改成成功,使最大似然估计达到 1;随后沿整条似然曲线检查相对支持、精确区间、门槛检验、边界正则性和优化日志。五次全成功也可能由诚实试验产生,统计分析只能量化证据的强弱;确定记录曾被改写仍需原始日志与版本链。

概率固定参数,似然固定数据

把成功记为 Yi=1Y_i=1,失败记为 Yi=0Y_i=0。在共同成功概率 pp 下,

YiiidBernoulli(p),0p1.Y_i\overset{\mathrm{iid}}{\sim}\operatorname{Bernoulli}(p), \qquad 0\le p\le1.

若观察到完整序列 y=(y1,,yn)\mathbf y=(y_1,\ldots,y_n),令

x=i=1nyi,x=\sum_{i=1}^n y_i,

则联合概率质量函数为

fp(y)=i=1npyi(1p)1yi=px(1p)nx.f_p(\mathbf y) =\prod_{i=1}^n p^{y_i}(1-p)^{1-y_i} =p^x(1-p)^{n-x}.

在参数 pp 已知、数据尚未出现时,fp(y)f_p(\mathbf y) 描述不同数据的概率。数据固定为 y\mathbf y 后,同一表达式随 pp 变化,得到似然

L(py)=px(1p)nx.L(p\mid\mathbf y)=p^x(1-p)^{n-x}.

若只保存成功总数 X=xX=x,则

XBinomial(n,p),Prp(X=x)=(nx)px(1p)nx.X\sim\operatorname{Binomial}(n,p), \qquad \Pr_p(X=x)=\binom nx p^x(1-p)^{n-x}.

组合常数 (nx)\binom nxpp 无关,因此完整序列和成功总数给出相同形状的似然曲线,也给出相同的最大点。

本章原数据满足 n=5,x=4n=5,x=4。三个候选参数的似然核为

候选 ppp4(1p)p^4(1-p)相对于 p=0.8p=0.8 的比值
0.20.20.001280.001280.0156250.015625
0.50.50.031250.031250.3814700.381470
0.80.80.081920.0819211

这份数据在三个候选中对 p=0.8p=0.8 给出最高相对支持。似然只确定到一个与参数无关的正的常数;参数间的似然比和最大化位置不受这类常数影响。似然也无需对 pp 积分为 1,它不能直接解释为参数的概率分布。

适用边界:连续数据中的密度

连续模型用密度 f(xθ)f(x\mid\theta) 构造似然,单点概率仍为 0。密度高度会随测量单位改变;对数据作不依赖参数的一一变换时,雅可比因子对所有候选参数相同,似然比与最大点保持不变。直接比较不同数据表示下的裸密度数值没有统一含义。

对数把乘积拆成逐条贡献

若各观测在给定参数 θ\theta 后条件独立,则

L(θ)=i=1nf(xiθ),L(\theta) =\prod_{i=1}^n f(x_i\mid\theta),

对数似然为

(θ)=logL(θ)=i=1nlogf(xiθ).\ell(\theta) =\log L(\theta) =\sum_{i=1}^n\log f(x_i\mid\theta).

对数函数严格递增,最大化位置不变。乘积改写为加和可以减轻小数连乘造成的数值下溢,也使每条记录的贡献

i(θ)=logf(xiθ)\ell_i(\theta)=\log f(x_i\mid\theta)

能够单独检查。Bernoulli 记录的贡献为

i(p)=yilogp+(1yi)log(1p).\ell_i(p) =y_i\log p+(1-y_i)\log(1-p).

四次成功贡献四项 logp\log p,一次失败贡献一项 log(1p)\log(1-p)。将失败改成成功以后,后者从最终数据中消失。

充分统计量是模型内的数据压缩

若联合分布可以分解为

fθ(x)=gθ{T(x)}h(x),f_\theta(\mathbf x) =g_\theta\{T(\mathbf x)\}h(\mathbf x),

其中 hhθ\theta 无关,则因子分解准则说明 TTθ\theta 充分。共同成功概率的 iid Bernoulli 模型只通过 x=iyix=\sum_i y_i 依赖数据,所以成功总数对 pp 充分。这个结论以共同概率、独立性和固定试验规则为前提;时间顺序、设备编号和改写痕迹仍属于审计与模型检查所需的信息。

造假动作留下的影子

原始设备日志若保存了四次成功和一次失败,结果表中的五次成功便与版本链冲突。只看最终五条记录,统计模型无法区分“诚实得到五次成功”和“把一次失败改成成功”:二者拥有同一个 Bernoulli 似然。似然揭示边界结果的脆弱程度,原始记录负责确定数据是否被改写。

某条记录的 i\ell_i 很低,只说明它在当前模型和参数下少见。厚尾、混合、异方差或时间变化模型可能给它完全不同的贡献;个体对数似然不能单独判定记录真伪。

得分方程确定内部最大值

一般 Bernoulli 样本有 xx 次成功,对数似然为

(p)=xlogp+(nx)log(1p),0<p<1.\ell(p) =x\log p+(n-x)\log(1-p), \qquad 0<p<1.

一阶导数称为得分:

U(p)=d(p)dp=xpnx1p=xnpp(1p).\begin{aligned} U(p) &=\frac{d\ell(p)}{dp}\\ &=\frac{x}{p}-\frac{n-x}{1-p}\\ &=\frac{x-np}{p(1-p)}. \end{aligned}

0<x<n0<x<n,令 U(p)=0U(p)=0

p^=xn.\widehat p=\frac xn.

二阶导数

(p)=xp2nx(1p)2<0\ell''(p) =-\frac{x}{p^2} -\frac{n-x}{(1-p)^2} <0

说明对数似然严格凹,内部驻点是唯一最大点。最大似然估计可统一写为

p^=arg max0p1L(p).\widehat p =\operatorname*{arg\,max}_{0\le p\le1}L(p).

本章 x=4,n=5x=4,n=5,所以

p^old=45=0.8.\widehat p_{\mathrm{old}}=\frac45=0.8.

x=0x=0x=nx=n 时,得分方程在参数内部没有根,最大点只能从闭区间的边界寻找。这正是一次记录改写将要触发的情形。

一次改写把最大点推到边界

只允许改写一条记录时,提高成功比例的唯一可行动作是把那次失败改成成功。成功数从 x=4x=4 变为 x=5x=5,似然核由

Lold(p)=p4(1p)L_{\mathrm{old}}(p)=p^4(1-p)

变为

Lnew(p)=p5.L_{\mathrm{new}}(p)=p^5.

新对数似然和得分为

new(p)=5logp,Unew(p)=5p>0(0<p1).\ell_{\mathrm{new}}(p)=5\log p, \qquad U_{\mathrm{new}}(p)=\frac5p>0 \quad(0<p\le1).

似然在整个参数区间单调上升,于是

p^new=1.\widehat p_{\mathrm{new}}=1.

把两条曲线各自除以最大值,可以直接比较形状:

四次成功、一次失败与五次成功的相对似然曲线。

四次成功、一次失败与五次成功的相对似然曲线。

原曲线在 p=0.8p=0.8 处形成内部峰值;新曲线一路升到 p=1p=1。认证表只检查点估计是否至少为 0.950.95,因此机械目标已经完成。曲线的位置变化同时说明:这条结论完全依赖唯一失败的去留。

相对似然显示门槛仍靠近峰顶

五次全成功时,以最大值 Lnew(1)=1L_{\mathrm{new}}(1)=1 归一化,得到相对似然

R(p)=Lnew(p)Lnew(1)=p5.\mathcal R(p) =\frac{L_{\mathrm{new}}(p)}{L_{\mathrm{new}}(1)} =p^5.
ppR(p)\mathcal R(p)
0.500.500.0312500.031250
0.800.800.3276800.327680
0.950.950.7737810.773781
1.001.001.0000001.000000

p=0.95p=0.95 的似然仍是峰值的约 77.4%77.4\%。数据把 p=0.5p=0.5 与峰顶明显分开,却没有把 0.950.9511 清楚分开。将 MLE 报成 1 容易掩盖这条曲线仍很平缓。

相对似然只比较同一数据在候选参数下的相对拟合。R(0.95)=0.773781\mathcal R(0.95)=0.773781 不表示“p=0.95p=0.95 的概率为 77.4%77.4\%”,也没有自动给出第一类错误率。下一节需要回到重复抽样概率,才能回答认证门槛是否获得足够证据。

精确二项推断检验门槛证据

Clopper–Pearson 区间通过反演二项尾概率构造。记 Bq1(a,b)B_q^{-1}(a,b)Beta(a,b)\operatorname{Beta}(a,b) 分布的 qq 分位数;当 0<x<n0<x<n 时,双侧 1α1-\alpha 区间为

[Bα/21(x,nx+1), B1α/21(x+1,nx)].\left[ B_{\alpha/2}^{-1}(x,n-x+1),\ B_{1-\alpha/2}^{-1}(x+1,n-x) \right].

端点情形按相应尾概率单独处理。若 x=nx=n,双侧区间上限为 1,下限满足

pLn=α2.p_L^n=\frac{\alpha}{2}.

五次全成功、α=0.05\alpha=0.05 时,

pL=0.0251/50.47818,p_L=0.025^{1/5}\approx0.47818,

所以双侧 95%95\% 精确区间约为

[0.478,1].[0.478,1].

若认证使用单侧 95%95\% 下限,则

pL,one=0.051/50.54928.p_{L,\mathrm{one}} =0.05^{1/5} \approx0.54928.

两个下限都远低于 0.950.95。对

H0:p0.95H1:p>0.95H_0:p\le0.95 \qquad\text{对}\qquad H_1:p>0.95

作单侧精确检验,五次全成功已经是最极端的可能结果,p 值为

supp0.95Prp(X5)=0.9550.77378.\sup_{p\le0.95}\Pr_p(X\ge5) =0.95^5 \approx0.77378.

5%5\% 显著性水平下,五条记录无法拒绝 p0.95p\le0.95。若要求在全成功时单侧 95%95\% 精确下限至少达到 0.950.95,样本量必须满足

0.051/n0.95,0.05^{1/n}\ge0.95,

nlog0.05log0.95=59.n \ge \left\lceil\frac{\log0.05}{\log0.95}\right\rceil =59.

这项计算把“点估计过线”改成了可设计、可复核的证据要求。在同一尾部构造和等号约定下,单侧 1α1-\alpha 置信下限不低于 p0p_0,等价于在水平 α\alpha 拒绝 H0:pp0H_0:p\le p_0;置信限与检验正是通过尾概率反演联系起来的。

方法来路:精确二项区间从哪里来

Clopper 与 E. S. Pearson 在 1934 年用二项尾概率展示置信限的构造。离散分布无法让每个参数值都恰好达到名义覆盖率,反演尾概率得到的区间通常保守;“精确”表示覆盖保证由二项分布直接计算,不表示区间必然短。

适用边界:同一个数值可以来自不同统计对象

五次全成功时,0.9550.95^5 同时等于 p=0.95p=0.95 对峰顶 p=1p=1 的似然比,也等于上述单侧精确检验的 p 值。这是端点事件 X=nX=n 带来的特殊重合。一般数据中的似然比与尾概率具有不同定义,数值不会这样一致。

得分与信息描述似然峰的局部几何

一般参数 θ\theta 的得分、观测信息和期望 Fisher 信息分别定义为

U(θ)=(θ)θ,U(\theta) =\frac{\partial\ell(\theta)}{\partial\theta}, J(θ)=2(θ)θ2,I(θ)=\Eθ{J(θ)}.J(\theta) =-\frac{\partial^2\ell(\theta)}{\partial\theta^2}, \qquad I(\theta) =\E_\theta\{J(\theta)\}.

对 Bernoulli 样本,得分与观测信息分别为

U(p)=Xnpp(1p),J(p)=Xp2+nX(1p)2.\begin{aligned} U(p) &=\frac{X-np}{p(1-p)},\\ J(p) &=\frac{X}{p^2} +\frac{n-X}{(1-p)^2}. \end{aligned}

0<p<10<p<1 时,\Ep(X)=np\E_p(X)=np,因此

\Ep{U(p)}=0\E_p\{U(p)\}=0

以及

In(p)=\Ep{J(p)}=np(1p).\begin{aligned} I_n(p) &=\E_p\{J(p)\}\\ &=\frac{n}{p(1-p)}. \end{aligned}

又由 \Varp(X)=np(1p)\Var_p(X)=np(1-p)

\Varp{U(p)}=np(1p)=In(p).\Var_p\{U(p)\} =\frac{n}{p(1-p)} =I_n(p).

最后一个等式称为信息等式。它依赖可微性、参数位于内部、支持集适当稳定以及期望与求导可以交换等正则条件。

似然峰越尖,局部曲率通常越大;在正则大样本条件下,

n(θ^θ0)dN(0,I1(θ0)1).\sqrt n(\widehat\theta-\theta_0) \xrightarrow{d} N\left(0,I_1(\theta_0)^{-1}\right).

信息随独立样本量线性累积,标准误因此常按 1/n1/\sqrt n 缩小。

观测信息与期望信息

观测信息使用当前样本的实际似然曲率;期望信息在假定参数下对所有可能样本取平均。二者在正则大样本中常接近,有限样本、边界参数、弱识别和模型错设下可能相差明显。

方法来路:似然、充分性与信息为什么进入同一框架

Fisher 在 1922 年的估计理论中系统讨论似然、充分统计量、效率与信息。最大点给出参数位置,曲率描述数据把候选参数压缩到多窄的范围;两者合在一起,才形成点估计与大样本精度之间的联系。

边界点破坏常规 Wald 近似

对固定的内部参数 0<p<10<p<1

n(p^p)dN{0,p(1p)}.\sqrt n(\widehat p-p) \xrightarrow{d} N\{0,p(1-p)\}.

常见的 Wald 标准误把未知 pp 换成 p^\widehat p

se^W(p^)=p^(1p^)n.\widehat{\operatorname{se}}_{\mathrm W}(\widehat p) =\sqrt{\frac{\widehat p(1-\widehat p)}{n}}.

五次全成功给出 p^=1\widehat p=1,代入后标准误变成 0,Wald 区间退化为 [1,1][1,1]。它与精确区间 [0.478,1][0.478,1] 的冲突来自边界正则性失效。

信息的坐标变换进一步揭示这一点。令

η=logp1p,dpdη=p(1p).\eta=\log\frac{p}{1-p}, \qquad \frac{dp}{d\eta}=p(1-p).

pp 坐标中,

In(p)=np(1p)(p1),I_n(p)=\frac{n}{p(1-p)} \longrightarrow\infty \qquad(p\to1),

而在 logit 坐标中,

In(η)=In(p)(dpdη)2=np(1p)0.\begin{aligned} I_n(\eta) &=I_n(p)\left(\frac{dp}{d\eta}\right)^2\\ &=np(1-p) \longrightarrow0. \end{aligned}

Fisher 信息的数值依赖参数坐标;局部二次量

In(p)(dp)2=In(η)(dη)2I_n(p)\,(dp)^2=I_n(\eta)\,(d\eta)^2

在光滑的一一重参数化下保持一致。这里一个坐标中的信息发散,另一个坐标中的信息消失,边界 p=1p=1 还对应 η=+\eta=+\infty,说明坐标变换在极限处已经退化。因此“把 p^=1\widehat p=1 代入内部公式”无法解释为无限精度。

适用边界:常规渐近正态需要哪些条件

常见条件包括真实参数位于参数空间内部、模型可识别、对数似然足够光滑、信息矩阵有限且非奇异,以及样本量增长时数据仍来自同一局部机制。边界、混合模型、完全分离和改变支持集的参数都可能产生不同极限分布。

似然比比较约束模型与完整模型

设零假设参数空间 Θ0\Theta_0 包含于完整参数空间 Θ\Theta。似然比定义为

Λ=supθΘ0L(θ)supθΘL(θ),0Λ1,\Lambda = \frac{\sup_{\theta\in\Theta_0}L(\theta)} {\sup_{\theta\in\Theta}L(\theta)}, \qquad 0\le\Lambda\le1,

常用对数尺度统计量为

D=2logΛ.D=-2\log\Lambda.

Λ\Lambda 越小,约束模型相对于完整模型损失的拟合越多。在零假设成立且正则条件满足时,若两模型相差 rr 个自由参数,Wilks 结果给出

Ddχr2.D\xrightarrow{d}\chi_r^2.

本章五次全成功时,完整空间的最大点为 p=1p=1。对约束

H0:p0.95,H_0:p\le0.95,

约束空间中的最大点为 p=0.95p=0.95,所以

Λ0=0.9550.77378\Lambda_0=0.95^5\approx0.77378

以及

D0=10log0.950.51293.D_0=-10\log0.95\approx0.51293.

这里的零假设带有不等式约束,p=0.95p=0.95 是零假设空间的边界;同时样本极小,完整模型的估计又落在 p=1p=1。这些情形都超出常规 Wilks 结论的直接适用范围,不能套用通常的 χ12\chi_1^2 参照。第六节的精确二项尾概率保留了有限样本保证。

Wald 方法用不受约束估计与零假设之间的标准化距离,得分方法在受约束点检查局部斜率,似然比方法比较两处最大高度。在正则大样本下,三者通常一阶等价;边界问题会让它们产生明显差别。

方法来路:似然比为什么出现卡方参照

Wilks 在 1938 年研究复合假设的似然比,得到正则大样本下 2logΛ-2\log\Lambda 的卡方极限。这个结果把不同模型的似然高度差转换为统一参照尺度;自由参数位于边界时,极限分布通常需要重新推导。

正态模型区分最大似然与无偏目标

Bernoulli 例子中的似然最大值仍然存在,只是落在闭区间的端点。转向常用的正态模型,可以同时看清另一个问题:最大似然与无偏性是两种估计准则,特殊数据还可能使似然根本没有有限最大值。

XiiidN(μ,σ2),v=σ2>0.X_i\overset{\mathrm{iid}}{\sim}N(\mu,\sigma^2), \qquad v=\sigma^2>0.

对数似然为

(μ,v)=n2log(2πv)12vi=1n(xiμ)2.\ell(\mu,v) =-\frac n2\log(2\pi v) -\frac1{2v}\sum_{i=1}^n(x_i-\mu)^2.

μ\mu 求导:

μ=1vi=1n(xiμ).\frac{\partial\ell}{\partial\mu} =\frac1v\sum_{i=1}^n(x_i-\mu).

令其为 0,得到

μ^=x.\widehat\mu=\overline x.

再对 vv 求导,并代入 x\overline x

v=n2v+12v2i=1n(xix)2.\frac{\partial\ell}{\partial v} =-\frac n{2v} +\frac1{2v^2} \sum_{i=1}^n(x_i-\overline x)^2.

只要残差平方和为正,唯一最大点为

σ^MLE2=v^=1ni=1n(xix)2.\widehat\sigma_{\mathrm{MLE}}^2 =\widehat v =\frac1n \sum_{i=1}^n(x_i-\overline x)^2.

最大似然估计的函数不变性还给出

σ^MLE=v^.\widehat\sigma_{\mathrm{MLE}} =\sqrt{\widehat v}.

无偏样本方差及其期望为

s2=1n1i=1n(xix)2,E(s2)=σ2.\begin{aligned} s^2 &=\frac1{n-1} \sum_{i=1}^n(x_i-\overline x)^2,\\ \mathbb{E}(s^2)&=\sigma^2. \end{aligned}

相应地,

E(v^)=n1nσ2.\mathbb{E}(\widehat v) =\frac{n-1}{n}\sigma^2.

最大似然优化当前样本的似然,无偏估计控制重复抽样偏差;两种准则可以给出不同分母。

适用边界:完全相同的正态观测没有内部方差 MLE

x1==xn=ax_1=\cdots=x_n=a,取 μ=a\mu=a 后有

(a,v)=n2log(2πv)+(v0).\ell(a,v)=-\frac n2\log(2\pi v)\longrightarrow+\infty \qquad(v\downarrow0).

非退化正态模型要求 v>0v>0,因此似然无界,上确界为 ++\infty,参数空间内没有最大点。Bernoulli 全成功在闭区间 [0,1][0,1] 上取得有限边界最大值;正态零残差则把密度峰推向无界,两类边界需要分别处理。

优化器把得分和曲率变成迭代

简单模型可以手算,多参数模型通常从初值 θ(0)\theta^{(0)} 出发迭代。Newton 法的更新为

θ(k+1)=θ(k)[2{θ(k)}]1{θ(k)}.\theta^{(k+1)} =\theta^{(k)} -\left[\nabla^2\ell\{\theta^{(k)}\}\right]^{-1} \nabla\ell\{\theta^{(k)}\}.

其中 \nabla\ell 是梯度向量,2\nabla^2\ell 是 Hessian 矩阵。该更新要求 Hessian 可逆;实际实现常加入步长控制或阻尼,以免一步跨出参数空间或降低对数似然。Fisher 评分法(Fisher scoring)用期望信息替代负 Hessian 矩阵:

θ(k+1)=θ(k)+I{θ(k)}1U{θ(k)}.\theta^{(k+1)} =\theta^{(k)} +I\{\theta^{(k)}\}^{-1} U\{\theta^{(k)}\}.

对 Bernoulli 成功概率,

p(k+1)=p(k)+p(k){1p(k)}nxnp(k)p(k){1p(k)}=xn.\begin{aligned} p^{(k+1)} &=p^{(k)} +\frac{p^{(k)}\{1-p^{(k)}\}}{n} \frac{x-np^{(k)}}{p^{(k)}\{1-p^{(k)}\}}\\ &=\frac xn. \end{aligned}

只要初值在 (0,1)(0,1) 内,Fisher 评分法一步便到达样本比例;当 x=nx=n 时,这一步直接落到边界 1。

约束参数常通过变换实现,例如

p=eη1+eη,v=eϕ.p=\frac{e^\eta}{1+e^\eta}, \qquad v=e^\phi.

这能保证 0<p<10<p<1v>0v>0,却也意味着精确边界 p=1p=1 需要 η+\eta\to+\infty。优化器中的巨大系数或持续上升方向可能是在报告边界,而非单纯的软件故障。

收敛检查至少包括:

  • 最终得分或梯度范数;

  • Hessian 或信息矩阵的特征值;

  • 参数边界与约束告警;

  • 多个初值是否到达同一解;

  • 目标函数是否单调改善并保持有限;

  • 参数和变量尺度是否导致病态计算。

“算法已经收敛”只说明某套停止条件得到满足,仍需确认所得点是所需最大值、参数可识别且模型与数据相容。删除导致告警的记录会同时改变估计对象。

低对数似然贡献也可能提示模型错设

正态模型对标准化残差 r=(xμ)/σr=(x-\mu)/\sigma 的负对数贡献按 r2/2r^2/2 增长。自由度 ν>0\nu>0 固定时,Student tt 模型的密度可以写成

fν(xμ,σ)=Γ{(ν+1)/2}Γ(ν/2)νπσ(1+r2ν)(ν+1)/2.f_\nu(x\mid\mu,\sigma) = \frac{\Gamma\{(\nu+1)/2\}} {\Gamma(\nu/2)\sqrt{\nu\pi}\,\sigma} \left( 1+\frac{r^2}{\nu} \right)^{-(\nu+1)/2}.

这里的 σ\sigma 是尺度参数;当 ν>2\nu>2 时,标准差为 σν/(ν2)\sigma\sqrt{\nu/(\nu-2)}。忽略与 rr 无关的常数后,该模型的负对数密度包含尾部项

ν+12log(1+r2ν)\frac{\nu+1}{2} \log\left(1+\frac{r^2}{\nu}\right)

这个量随 r|r| 增长,速度低于正态模型的二次惩罚。一个正态模型下贡献极低的观测,在厚尾模型下可能并不罕见。

模型检查需要同时考虑:

  1. 数据生成机制能否支持独立性、共同参数和分布家族;

  2. 个体对数似然、残差、边界和关键分组;

  3. 拟合模型能否模拟出相近的尾部、零值与多峰结构;

  4. 候选模型是否在查看异常记录之前确定;

  5. 留出数据上的平均对数得分

    1mi=1mlogfθ^train(yi)\frac1m\sum_{i=1}^m \log f_{\widehat\theta_{\mathrm{train}}}(y_i)

    是否改善。

在同一留出集上,平均对数得分越大,表示模型对实际观测分配的预测密度越高。

在嵌套模型中增加自由参数不会降低训练数据上的最大似然,因此裸的训练似然不能单独完成复杂度选择。第十三章的数据角色同样适用:候选选择留在开发层,冻结后的比较交给未参与选择的数据。

把边界成功率放回可复核流程

四次成功、一次失败给出 p^=0.8\widehat p=0.8。改写唯一失败以后,似然从 p4(1p)p^4(1-p) 变为 p5p^5,最大点到达边界 1,认证表的机械条件通过。完整证据链同时保留:

  1. 五次试验的逐条结果、顺序、设备编号和原始时间戳;

  2. 原始数据、清洗数据与认证表之间的版本差异;

  3. 预先规定的 Bernoulli 模型、独立性和共同成功概率假设;

  4. 完整似然或对数似然、MLE、相对似然和边界状态;

  5. 双侧区间、单侧下限和针对 0.950.95 门槛的精确检验;

  6. 样本量依据、停止规则和失败后的复测规则;

  7. 优化日志、模型诊断以及任何替代分布的选择时间。

若认证目标真正是“总体成功率至少为 0.950.95”,报告应以预先规定的单侧下限或检验为依据。五次全成功只有 0.5490.549 的单侧 95%95\% 精确下限;连续 59 次成功才刚把该下限推到 0.950.95

似然负责说明固定数据怎样区分参数,无法为参数本身分配概率。下一章保持十次试验结果与二项似然不变,只更换 Beta 先验;由此进入先验、后验和先验预测的完整贝叶斯更新。

本章知识链

  1. 概率在参数固定时比较可能数据;似然在数据固定时比较候选参数。

  2. 与参数无关的乘法常数不改变似然比和 MLE;似然无需对参数积分为 1。

  3. 条件独立使联合似然成为乘积,对数似然再把它拆成逐条贡献之和。

  4. iid Bernoulli 模型中,成功总数对共同成功概率充分;审计仍需逐条原始记录和版本链。

  5. 0<x<n0<x<n 时,Bernoulli MLE 为 x/nx/n;全失败与全成功把最大点推到参数边界。

  6. 五次全成功使 MLE 达到 1,但 p=0.95p=0.95 的相对似然仍约为 0.7740.774

  7. 五次全成功的双侧 95%95\% 精确区间约为 [0.478,1][0.478,1],单侧下限约为 0.5490.549

  8. 若全成功时要让单侧 95%95\% 精确下限达到 0.950.95,至少需要 59 次试验。

  9. 得分描述局部斜率,观测信息与期望信息描述曲率;信息等式依赖正则条件。

  10. 参数边界会使常规 Wald 与 Wilks 近似失去保证,有限样本应采用精确或边界专用方法。

  11. 正态方差 MLE 使用分母 nn,无偏样本方差使用 n1n-1;完全相同的观测还会使非退化正态似然无界。

  12. Newton 法与 Fisher 评分法把得分和曲率变成迭代,收敛日志属于统计证据。

  13. 极低的个体对数似然贡献可能来自记录问题,也可能来自尾部、异方差、混合或时间结构错设。

思考与练习

  1. 对十次独立 Bernoulli 试验得到七次成功,分别从完整序列和成功总数写出似然;说明两式为什么给出同一 MLE。

  2. 推导一般 0<x<n0<x<n 时的 Bernoulli 得分、二阶导数和 MLE;再单独处理 x=0x=0x=nx=n

  3. 用因子分解准则证明成功总数对共同成功概率充分;列出三项仍必须保留的逐条审计信息。

  4. 复算章首三个候选参数的似然核与相对比值,再复算五次全成功时 p=0.5,0.8,0.95,1p=0.5,0.8,0.95,1 的相对似然。

  5. 推导五次全成功的双侧 95%95\% 精确下限和单侧 95%95\% 精确下限,解释两者使用 0.0250.0250.050.05 的原因。

  6. H0:p0.95H_0:p\le0.95 计算五次全成功的单侧精确 p 值;推导全成功时让单侧 95%95\% 下限达到 0.950.95 所需的最小样本量。

  7. Var(X)=np(1p)\operatorname{Var}(X)=np(1-p) 推导 Bernoulli 得分的信息等式,再用链式法则证明 logit 参数的信息为 np(1p)np(1-p)

  8. 说明 p^=1\widehat p=1 时 Wald 标准误为何退化;列出常规渐近正态所需的四项正则条件。

  9. 计算约束 p0.95p\le0.95 与完整空间之间的似然比及 D=2logΛD=-2\log\Lambda;从不等式约束、样本量和边界估计中选出两个方面,说明本例不能直接使用常规 χ12\chi_1^2 参照的原因。

  10. 对数据 1,2,31,2,3 推导正态模型的 μ^\widehat\mu、方差 MLE 和无偏样本方差;再证明数据 2,2,22,2,2v>0v>0 的正态模型中没有有限 MLE。

  11. 从任意 p(0)(0,1)p^{(0)}\in(0,1) 出发,验证 Bernoulli Fisher 评分法一步到达 x/nx/n;讨论 x=nx=n 时 logit 参数会怎样变化。

  12. 为一次元件可靠性认证设计审计表,覆盖原始记录、版本差异、模型假设、门槛推断、样本量、停止规则、优化证据和替代模型检查。

专题导航