点估计的任务是用样本算出一个数去猜未知参数。矩法关注“理论特征与样本特征匹配”,似然法关注“哪个参数最能解释已经发生的数据”。
矩估计的标准步骤
若有 k 个未知参数,就选 k 个总体矩方程
Eθ(Xj)=μj(θ1,…,θk),j=1,…,k,
再以样本矩 Aj=n−1∑Xij 替换总体矩并解方程。
例如 U(a,b) 有
E(X)=2a+b,Var(X)=12(b−a)2.
用 Xˉ 和样本二阶中心矩 Sn2=n−1∑(Xi−Xˉ)2 替换,得到
a^=Xˉ−3Sn,b^=Xˉ+3Sn.
矩估计通常容易算、对模型要求较低,但可能不唯一,也未必有效。
似然函数不是参数的概率
观察值 x 固定后,
L(θ;x)=i=1∏nf(xi;θ)
被看作 θ 的函数。它比较不同参数对同一份数据的解释能力,不表示“参数取某值的概率”。
计算时通常取对数:
ℓ(θ)=logL(θ)=i=1∑nlogf(xi;θ).
乘积变求和,指数变线性,极值位置不变。
例:Poisson 参数
若 Xi∼Poisson(λ),
ℓ(λ)=−nλ+(∑xi)logλ−∑log(xi!),
令导数为零得 λ^=Xˉ。二阶导数为负,确为最大值。
支持集含参数时要看边界
若 Xi∼U(0,θ),则
L(θ)=θ−nI(θ≥X(n)).
在允许区域里它随 θ 递减,所以最大值在边界:
θ^MLE=X(n).
如果直接对 −nlogθ 求导,会找不到驻点;真正的信息藏在指示函数给出的约束里。
多参数与剖面似然
正态模型中同时未知 μ,σ2,先对 μ 求极值得 μ^=Xˉ,代回后再对 σ2 求极值:
σ^MLE2=n1∑(Xi−Xˉ)2.
注意 MLE 的分母是 n,它有偏;无偏样本方差分母才是 n−1。MLE 追求似然最大,不自动保证无偏。
不变性
若 θ^ 是 θ 的 MLE,则在适当条件下,g(θ^) 是 g(θ) 的 MLE。比如指数率参数 λ 的 MLE 为 1/Xˉ,那么均值参数 1/λ 的 MLE 就是 Xˉ。
一套不漏项的检查
- 写清参数空间和支持集;
- 独立样本才可直接相乘;
- 先取对数再求导;
- 检查驻点、边界和不可导点;
- 验证得到的是全局最大值;
- 分清估计量(随机变量)与估计值(代入数据后的数)。