第十四章:改写一次失败,得到边界估计
本章造假目标
某元件接受五次通断试验。试验相互独立,并具有相同的成功概率;结果为四次成功和一次失败。Bernoulli 成功概率的最大似然估计为 4/5=0.8,低于认证表要求的 0.95。允许的操作只有把至多一条失败改成成功,不得增加试验、改变概率模型、验收线或报告指标。
本章将唯一失败改成成功,使最大似然估计达到 1;随后沿整条似然曲线检查相对支持、精确区间、门槛检验、边界正则性和优化日志。五次全成功也可能由诚实试验产生,统计分析只能量化证据的强弱;确定记录曾被改写仍需原始日志与版本链。
概率固定参数,似然固定数据
把成功记为 Yi=1,失败记为 Yi=0。在共同成功概率 p 下,
Yi∼iidBernoulli(p),0≤p≤1.
若观察到完整序列 y=(y1,…,yn),令
x=i=1∑nyi,
则联合概率质量函数为
fp(y)=i=1∏npyi(1−p)1−yi=px(1−p)n−x.
在参数 p 已知、数据尚未出现时,fp(y) 描述不同数据的概率。数据固定为 y 后,同一表达式随 p 变化,得到似然
L(p∣y)=px(1−p)n−x.
若只保存成功总数 X=x,则
X∼Binomial(n,p),pPr(X=x)=(xn)px(1−p)n−x.
组合常数 (xn) 与 p 无关,因此完整序列和成功总数给出相同形状的似然曲线,也给出相同的最大点。
本章原数据满足 n=5,x=4。三个候选参数的似然核为
| 候选 p | p4(1−p) | 相对于 p=0.8 的比值 |
|---|
| 0.2 | 0.00128 | 0.015625 |
| 0.5 | 0.03125 | 0.381470 |
| 0.8 | 0.08192 | 1 |
这份数据在三个候选中对 p=0.8 给出最高相对支持。似然只确定到一个与参数无关的正的常数;参数间的似然比和最大化位置不受这类常数影响。似然也无需对 p 积分为 1,它不能直接解释为参数的概率分布。
适用边界:连续数据中的密度
连续模型用密度 f(x∣θ) 构造似然,单点概率仍为 0。密度高度会随测量单位改变;对数据作不依赖参数的一一变换时,雅可比因子对所有候选参数相同,似然比与最大点保持不变。直接比较不同数据表示下的裸密度数值没有统一含义。
对数把乘积拆成逐条贡献
若各观测在给定参数 θ 后条件独立,则
L(θ)=i=1∏nf(xi∣θ),
对数似然为
ℓ(θ)=logL(θ)=i=1∑nlogf(xi∣θ).
对数函数严格递增,最大化位置不变。乘积改写为加和可以减轻小数连乘造成的数值下溢,也使每条记录的贡献
ℓi(θ)=logf(xi∣θ)
能够单独检查。Bernoulli 记录的贡献为
ℓi(p)=yilogp+(1−yi)log(1−p).
四次成功贡献四项 logp,一次失败贡献一项 log(1−p)。将失败改成成功以后,后者从最终数据中消失。
充分统计量是模型内的数据压缩
若联合分布可以分解为
fθ(x)=gθ{T(x)}h(x),
其中 h 与 θ 无关,则因子分解准则说明 T 对 θ 充分。共同成功概率的 iid Bernoulli 模型只通过 x=∑iyi 依赖数据,所以成功总数对 p 充分。这个结论以共同概率、独立性和固定试验规则为前提;时间顺序、设备编号和改写痕迹仍属于审计与模型检查所需的信息。
造假动作留下的影子
原始设备日志若保存了四次成功和一次失败,结果表中的五次成功便与版本链冲突。只看最终五条记录,统计模型无法区分“诚实得到五次成功”和“把一次失败改成成功”:二者拥有同一个 Bernoulli 似然。似然揭示边界结果的脆弱程度,原始记录负责确定数据是否被改写。
某条记录的 ℓi 很低,只说明它在当前模型和参数下少见。厚尾、混合、异方差或时间变化模型可能给它完全不同的贡献;个体对数似然不能单独判定记录真伪。
得分方程确定内部最大值
一般 Bernoulli 样本有 x 次成功,对数似然为
ℓ(p)=xlogp+(n−x)log(1−p),0<p<1.
一阶导数称为得分:
U(p)=dpdℓ(p)=px−1−pn−x=p(1−p)x−np.
若 0<x<n,令 U(p)=0 得
p=nx.
二阶导数
ℓ′′(p)=−p2x−(1−p)2n−x<0
说明对数似然严格凹,内部驻点是唯一最大点。最大似然估计可统一写为
p=0≤p≤1argmaxL(p).
本章 x=4,n=5,所以
pold=54=0.8.
当 x=0 或 x=n 时,得分方程在参数内部没有根,最大点只能从闭区间的边界寻找。这正是一次记录改写将要触发的情形。
一次改写把最大点推到边界
只允许改写一条记录时,提高成功比例的唯一可行动作是把那次失败改成成功。成功数从 x=4 变为 x=5,似然核由
Lold(p)=p4(1−p)
变为
Lnew(p)=p5.
新对数似然和得分为
ℓnew(p)=5logp,Unew(p)=p5>0(0<p≤1).
似然在整个参数区间单调上升,于是
pnew=1.
把两条曲线各自除以最大值,可以直接比较形状:

四次成功、一次失败与五次成功的相对似然曲线。
原曲线在 p=0.8 处形成内部峰值;新曲线一路升到 p=1。认证表只检查点估计是否至少为 0.95,因此机械目标已经完成。曲线的位置变化同时说明:这条结论完全依赖唯一失败的去留。
相对似然显示门槛仍靠近峰顶
五次全成功时,以最大值 Lnew(1)=1 归一化,得到相对似然
R(p)=Lnew(1)Lnew(p)=p5.
| p | R(p) |
|---|
| 0.50 | 0.031250 |
| 0.80 | 0.327680 |
| 0.95 | 0.773781 |
| 1.00 | 1.000000 |
p=0.95 的似然仍是峰值的约 77.4%。数据把 p=0.5 与峰顶明显分开,却没有把 0.95 和 1 清楚分开。将 MLE 报成 1 容易掩盖这条曲线仍很平缓。
相对似然只比较同一数据在候选参数下的相对拟合。R(0.95)=0.773781 不表示“p=0.95 的概率为 77.4%”,也没有自动给出第一类错误率。下一节需要回到重复抽样概率,才能回答认证门槛是否获得足够证据。
精确二项推断检验门槛证据
Clopper–Pearson 区间通过反演二项尾概率构造。记 Bq−1(a,b) 为 Beta(a,b) 分布的 q 分位数;当 0<x<n 时,双侧 1−α 区间为
[Bα/2−1(x,n−x+1), B1−α/2−1(x+1,n−x)].
端点情形按相应尾概率单独处理。若 x=n,双侧区间上限为 1,下限满足
pLn=2α.
五次全成功、α=0.05 时,
pL=0.0251/5≈0.47818,
所以双侧 95% 精确区间约为
[0.478,1].
若认证使用单侧 95% 下限,则
pL,one=0.051/5≈0.54928.
两个下限都远低于 0.95。对
H0:p≤0.95对H1:p>0.95
作单侧精确检验,五次全成功已经是最极端的可能结果,p 值为
p≤0.95suppPr(X≥5)=0.955≈0.77378.
在 5% 显著性水平下,五条记录无法拒绝 p≤0.95。若要求在全成功时单侧 95% 精确下限至少达到 0.95,样本量必须满足
0.051/n≥0.95,
即
n≥⌈log0.95log0.05⌉=59.
这项计算把“点估计过线”改成了可设计、可复核的证据要求。在同一尾部构造和等号约定下,单侧 1−α 置信下限不低于 p0,等价于在水平 α 拒绝 H0:p≤p0;置信限与检验正是通过尾概率反演联系起来的。
方法来路:精确二项区间从哪里来
Clopper 与 E. S. Pearson 在 1934 年用二项尾概率展示置信限的构造。离散分布无法让每个参数值都恰好达到名义覆盖率,反演尾概率得到的区间通常保守;“精确”表示覆盖保证由二项分布直接计算,不表示区间必然短。
适用边界:同一个数值可以来自不同统计对象
五次全成功时,0.955 同时等于 p=0.95 对峰顶 p=1 的似然比,也等于上述单侧精确检验的 p 值。这是端点事件 X=n 带来的特殊重合。一般数据中的似然比与尾概率具有不同定义,数值不会这样一致。
得分与信息描述似然峰的局部几何
一般参数 θ 的得分、观测信息和期望 Fisher 信息分别定义为
U(θ)=∂θ∂ℓ(θ),
J(θ)=−∂θ2∂2ℓ(θ),I(θ)=\Eθ{J(θ)}.
对 Bernoulli 样本,得分与观测信息分别为
U(p)J(p)=p(1−p)X−np,=p2X+(1−p)2n−X.
在 0<p<1 时,\Ep(X)=np,因此
\Ep{U(p)}=0
以及
In(p)=\Ep{J(p)}=p(1−p)n.
又由 \Varp(X)=np(1−p) 得
\Varp{U(p)}=p(1−p)n=In(p).
最后一个等式称为信息等式。它依赖可微性、参数位于内部、支持集适当稳定以及期望与求导可以交换等正则条件。
似然峰越尖,局部曲率通常越大;在正则大样本条件下,
n(θ−θ0)dN(0,I1(θ0)−1).
信息随独立样本量线性累积,标准误因此常按 1/n 缩小。
观测信息与期望信息
观测信息使用当前样本的实际似然曲率;期望信息在假定参数下对所有可能样本取平均。二者在正则大样本中常接近,有限样本、边界参数、弱识别和模型错设下可能相差明显。
方法来路:似然、充分性与信息为什么进入同一框架
Fisher 在 1922 年的估计理论中系统讨论似然、充分统计量、效率与信息。最大点给出参数位置,曲率描述数据把候选参数压缩到多窄的范围;两者合在一起,才形成点估计与大样本精度之间的联系。
边界点破坏常规 Wald 近似
对固定的内部参数 0<p<1,
n(p−p)dN{0,p(1−p)}.
常见的 Wald 标准误把未知 p 换成 p:
seW(p)=np(1−p).
五次全成功给出 p=1,代入后标准误变成 0,Wald 区间退化为 [1,1]。它与精确区间 [0.478,1] 的冲突来自边界正则性失效。
信息的坐标变换进一步揭示这一点。令
η=log1−pp,dηdp=p(1−p).
在 p 坐标中,
In(p)=p(1−p)n⟶∞(p→1),
而在 logit 坐标中,
In(η)=In(p)(dηdp)2=np(1−p)⟶0.
Fisher 信息的数值依赖参数坐标;局部二次量
In(p)(dp)2=In(η)(dη)2
在光滑的一一重参数化下保持一致。这里一个坐标中的信息发散,另一个坐标中的信息消失,边界 p=1 还对应 η=+∞,说明坐标变换在极限处已经退化。因此“把 p=1 代入内部公式”无法解释为无限精度。
适用边界:常规渐近正态需要哪些条件
常见条件包括真实参数位于参数空间内部、模型可识别、对数似然足够光滑、信息矩阵有限且非奇异,以及样本量增长时数据仍来自同一局部机制。边界、混合模型、完全分离和改变支持集的参数都可能产生不同极限分布。
似然比比较约束模型与完整模型
设零假设参数空间 Θ0 包含于完整参数空间 Θ。似然比定义为
Λ=supθ∈ΘL(θ)supθ∈Θ0L(θ),0≤Λ≤1,
常用对数尺度统计量为
D=−2logΛ.
Λ 越小,约束模型相对于完整模型损失的拟合越多。在零假设成立且正则条件满足时,若两模型相差 r 个自由参数,Wilks 结果给出
Ddχr2.
本章五次全成功时,完整空间的最大点为 p=1。对约束
H0:p≤0.95,
约束空间中的最大点为 p=0.95,所以
Λ0=0.955≈0.77378
以及
D0=−10log0.95≈0.51293.
这里的零假设带有不等式约束,p=0.95 是零假设空间的边界;同时样本极小,完整模型的估计又落在 p=1。这些情形都超出常规 Wilks 结论的直接适用范围,不能套用通常的 χ12 参照。第六节的精确二项尾概率保留了有限样本保证。
Wald 方法用不受约束估计与零假设之间的标准化距离,得分方法在受约束点检查局部斜率,似然比方法比较两处最大高度。在正则大样本下,三者通常一阶等价;边界问题会让它们产生明显差别。
方法来路:似然比为什么出现卡方参照
Wilks 在 1938 年研究复合假设的似然比,得到正则大样本下 −2logΛ 的卡方极限。这个结果把不同模型的似然高度差转换为统一参照尺度;自由参数位于边界时,极限分布通常需要重新推导。
正态模型区分最大似然与无偏目标
Bernoulli 例子中的似然最大值仍然存在,只是落在闭区间的端点。转向常用的正态模型,可以同时看清另一个问题:最大似然与无偏性是两种估计准则,特殊数据还可能使似然根本没有有限最大值。
设
Xi∼iidN(μ,σ2),v=σ2>0.
对数似然为
ℓ(μ,v)=−2nlog(2πv)−2v1i=1∑n(xi−μ)2.
对 μ 求导:
∂μ∂ℓ=v1i=1∑n(xi−μ).
令其为 0,得到
μ=x.
再对 v 求导,并代入 x:
∂v∂ℓ=−2vn+2v21i=1∑n(xi−x)2.
只要残差平方和为正,唯一最大点为
σMLE2=v=n1i=1∑n(xi−x)2.
最大似然估计的函数不变性还给出
σMLE=v.
无偏样本方差及其期望为
s2E(s2)=n−11i=1∑n(xi−x)2,=σ2.
相应地,
E(v)=nn−1σ2.
最大似然优化当前样本的似然,无偏估计控制重复抽样偏差;两种准则可以给出不同分母。
适用边界:完全相同的正态观测没有内部方差 MLE
若 x1=⋯=xn=a,取 μ=a 后有
ℓ(a,v)=−2nlog(2πv)⟶+∞(v↓0).
非退化正态模型要求 v>0,因此似然无界,上确界为 +∞,参数空间内没有最大点。Bernoulli 全成功在闭区间 [0,1] 上取得有限边界最大值;正态零残差则把密度峰推向无界,两类边界需要分别处理。
优化器把得分和曲率变成迭代
简单模型可以手算,多参数模型通常从初值 θ(0) 出发迭代。Newton 法的更新为
θ(k+1)=θ(k)−[∇2ℓ{θ(k)}]−1∇ℓ{θ(k)}.
其中 ∇ℓ 是梯度向量,∇2ℓ 是 Hessian 矩阵。该更新要求 Hessian 可逆;实际实现常加入步长控制或阻尼,以免一步跨出参数空间或降低对数似然。Fisher 评分法(Fisher scoring)用期望信息替代负 Hessian 矩阵:
θ(k+1)=θ(k)+I{θ(k)}−1U{θ(k)}.
对 Bernoulli 成功概率,
p(k+1)=p(k)+np(k){1−p(k)}p(k){1−p(k)}x−np(k)=nx.
只要初值在 (0,1) 内,Fisher 评分法一步便到达样本比例;当 x=n 时,这一步直接落到边界 1。
约束参数常通过变换实现,例如
p=1+eηeη,v=eϕ.
这能保证 0<p<1 和 v>0,却也意味着精确边界 p=1 需要 η→+∞。优化器中的巨大系数或持续上升方向可能是在报告边界,而非单纯的软件故障。
收敛检查至少包括:
-
最终得分或梯度范数;
-
Hessian 或信息矩阵的特征值;
-
参数边界与约束告警;
-
多个初值是否到达同一解;
-
目标函数是否单调改善并保持有限;
-
参数和变量尺度是否导致病态计算。
“算法已经收敛”只说明某套停止条件得到满足,仍需确认所得点是所需最大值、参数可识别且模型与数据相容。删除导致告警的记录会同时改变估计对象。
低对数似然贡献也可能提示模型错设
正态模型对标准化残差 r=(x−μ)/σ 的负对数贡献按 r2/2 增长。自由度 ν>0 固定时,Student t 模型的密度可以写成
fν(x∣μ,σ)=Γ(ν/2)νπσΓ{(ν+1)/2}(1+νr2)−(ν+1)/2.
这里的 σ 是尺度参数;当 ν>2 时,标准差为 σν/(ν−2)。忽略与 r 无关的常数后,该模型的负对数密度包含尾部项
2ν+1log(1+νr2)
这个量随 ∣r∣ 增长,速度低于正态模型的二次惩罚。一个正态模型下贡献极低的观测,在厚尾模型下可能并不罕见。
模型检查需要同时考虑:
-
数据生成机制能否支持独立性、共同参数和分布家族;
-
个体对数似然、残差、边界和关键分组;
-
拟合模型能否模拟出相近的尾部、零值与多峰结构;
-
候选模型是否在查看异常记录之前确定;
-
留出数据上的平均对数得分
m1i=1∑mlogfθtrain(yi)
是否改善。
在同一留出集上,平均对数得分越大,表示模型对实际观测分配的预测密度越高。
在嵌套模型中增加自由参数不会降低训练数据上的最大似然,因此裸的训练似然不能单独完成复杂度选择。第十三章的数据角色同样适用:候选选择留在开发层,冻结后的比较交给未参与选择的数据。
把边界成功率放回可复核流程
四次成功、一次失败给出 p=0.8。改写唯一失败以后,似然从 p4(1−p) 变为 p5,最大点到达边界 1,认证表的机械条件通过。完整证据链同时保留:
-
五次试验的逐条结果、顺序、设备编号和原始时间戳;
-
原始数据、清洗数据与认证表之间的版本差异;
-
预先规定的 Bernoulli 模型、独立性和共同成功概率假设;
-
完整似然或对数似然、MLE、相对似然和边界状态;
-
双侧区间、单侧下限和针对 0.95 门槛的精确检验;
-
样本量依据、停止规则和失败后的复测规则;
-
优化日志、模型诊断以及任何替代分布的选择时间。
若认证目标真正是“总体成功率至少为 0.95”,报告应以预先规定的单侧下限或检验为依据。五次全成功只有 0.549 的单侧 95% 精确下限;连续 59 次成功才刚把该下限推到 0.95。
似然负责说明固定数据怎样区分参数,无法为参数本身分配概率。下一章保持十次试验结果与二项似然不变,只更换 Beta 先验;由此进入先验、后验和先验预测的完整贝叶斯更新。
本章知识链
-
概率在参数固定时比较可能数据;似然在数据固定时比较候选参数。
-
与参数无关的乘法常数不改变似然比和 MLE;似然无需对参数积分为 1。
-
条件独立使联合似然成为乘积,对数似然再把它拆成逐条贡献之和。
-
iid Bernoulli 模型中,成功总数对共同成功概率充分;审计仍需逐条原始记录和版本链。
-
当 0<x<n 时,Bernoulli MLE 为 x/n;全失败与全成功把最大点推到参数边界。
-
五次全成功使 MLE 达到 1,但 p=0.95 的相对似然仍约为 0.774。
-
五次全成功的双侧 95% 精确区间约为 [0.478,1],单侧下限约为 0.549。
-
若全成功时要让单侧 95% 精确下限达到 0.95,至少需要 59 次试验。
-
得分描述局部斜率,观测信息与期望信息描述曲率;信息等式依赖正则条件。
-
参数边界会使常规 Wald 与 Wilks 近似失去保证,有限样本应采用精确或边界专用方法。
-
正态方差 MLE 使用分母 n,无偏样本方差使用 n−1;完全相同的观测还会使非退化正态似然无界。
-
Newton 法与 Fisher 评分法把得分和曲率变成迭代,收敛日志属于统计证据。
-
极低的个体对数似然贡献可能来自记录问题,也可能来自尾部、异方差、混合或时间结构错设。
思考与练习
-
对十次独立 Bernoulli 试验得到七次成功,分别从完整序列和成功总数写出似然;说明两式为什么给出同一 MLE。
-
推导一般 0<x<n 时的 Bernoulli 得分、二阶导数和 MLE;再单独处理 x=0 与 x=n。
-
用因子分解准则证明成功总数对共同成功概率充分;列出三项仍必须保留的逐条审计信息。
-
复算章首三个候选参数的似然核与相对比值,再复算五次全成功时 p=0.5,0.8,0.95,1 的相对似然。
-
推导五次全成功的双侧 95% 精确下限和单侧 95% 精确下限,解释两者使用 0.025 与 0.05 的原因。
-
对 H0:p≤0.95 计算五次全成功的单侧精确 p 值;推导全成功时让单侧 95% 下限达到 0.95 所需的最小样本量。
-
由 Var(X)=np(1−p) 推导 Bernoulli 得分的信息等式,再用链式法则证明 logit 参数的信息为 np(1−p)。
-
说明 p=1 时 Wald 标准误为何退化;列出常规渐近正态所需的四项正则条件。
-
计算约束 p≤0.95 与完整空间之间的似然比及 D=−2logΛ;从不等式约束、样本量和边界估计中选出两个方面,说明本例不能直接使用常规 χ12 参照的原因。
-
对数据 1,2,3 推导正态模型的 μ、方差 MLE 和无偏样本方差;再证明数据 2,2,2 在 v>0 的正态模型中没有有限 MLE。
-
从任意 p(0)∈(0,1) 出发,验证 Bernoulli Fisher 评分法一步到达 x/n;讨论 x=n 时 logit 参数会怎样变化。
-
为一次元件可靠性认证设计审计表,覆盖原始记录、版本差异、模型假设、门槛推断、样本量、停止规则、优化证据和替代模型检查。
专题导航