速成 · 数理统计

数理统计从一个很现实的限制出发:只看见一小批随机样本,怎样对看不见的总体作出有误差边界的判断。

常用分布是工具,不是复习目录。拿到样本以后,解题顺序通常是四步:

  1. 先找出统计量在重复抽样时服从什么分布;
  2. 用统计量估计未知参数;
  3. 用统计量检验一个关于总体的说法;
  4. 把同一套思想推广到多组均值和变量关系。

抽样以后做什么

问题要求的输出最常用的工具
总体参数大概是多少点估计矩估计、极大似然、Bayes 估计
参数可能落在哪区间估计枢轴量、抽样分布、分位点
一个说法能否被数据推翻假设检验拒绝域、pp 值、似然比
多组均值是否相同方差分析平方和分解、FF 检验
两个变量怎样关联回归最小二乘、t/Ft/F 检验、预测区间

1. 抽样分布:所有推断的地基

样本 X1,…,XnX_1,\ldots,X_n 是随机变量,样本均值、样本方差也是随机变量:

Xˉ=1n∑i=1nXi,S2=1n−1∑i=1n(Xi−Xˉ)2.\bar X=\frac1n\sum_{i=1}^nX_i,\qquad S^2=\frac1{n-1}\sum_{i=1}^n(X_i-\bar X)^2.

若总体为 N(μ,σ2)N(\mu,\sigma^2),需要熟到可以直接调用:

Xˉ∼N(μ,σ2n),(n−1)S2σ2∼χ2(n−1),Xˉ⊥S2,\bar X\sim N\left(\mu,\frac{\sigma^2}{n}\right), \quad \frac{(n-1)S^2}{\sigma^2}\sim\chi^2(n-1), \quad \bar X\perp S^2, Xˉ−μS/n∼t(n−1).\frac{\bar X-\mu}{S/\sqrt n}\sim t(n-1).

两份独立正态样本的方差比会产生 FF 分布。这三种分布分别解决“方差”“均值但方差未知”“方差比”问题。

2. 点估计:先造一个数,再判断它靠不靠谱

矩估计

把总体矩替换为样本矩,再解参数。例如指数分布以均值参数化为

f(x;θ)=1θe−x/θ,x>0,f(x;\theta)=\frac1\theta e^{-x/\theta},\quad x>0,

因 E(X)=θE(X)=\theta,故 θ^MOM=Xˉ\hat\theta_{\text{MOM}}=\bar X。

极大似然估计

写联合似然 L(θ)=∏if(xi;θ)L(\theta)=\prod_i f(x_i;\theta),取对数,求最大值。仍以上式为例:

ℓ(θ)=−nlog⁡θ−∑xiθ,θ^MLE=Xˉ.\ell(\theta)=-n\log\theta-\frac{\sum x_i}{\theta}, \qquad \hat\theta_{\text{MLE}}=\bar X.

遇到参数决定支持集的均匀分布,不能只机械求导,必须先看样本对参数施加了什么约束。

评价标准

  • 无偏:Eθ(θ^)=θE_\theta(\hat\theta)=\theta;
  • 均方误差:MSE⁡=Var⁡(θ^)+Bias⁡2\operatorname{MSE}=\operatorname{Var}(\hat\theta)+\operatorname{Bias}^2;
  • 相合:样本增多时依概率收敛到真值;
  • 有效:同为无偏估计时方差更小。

要找 UMVUE,常见路线是“充分完备统计量 + Rao–Blackwell/Lehmann–Scheffé”;要判断无偏估计方差还能不能再降,用 Cramér–Rao 下界。

Bayes 估计

先验 π(θ)\pi(\theta) 与似然相乘得到后验:

π(θ∣x)∝L(θ;x)π(θ).\pi(\theta\mid x)\propto L(\theta;x)\pi(\theta).

平方损失下取后验均值,绝对损失下取后验中位数,00-11 损失下取后验众数。所谓“共轭”只是后验仍落在同一分布族,方便计算。

3. 区间估计:把不确定性也报出来

标准流程只有三步:

  1. 构造含参数但分布不依赖参数的枢轴量;
  2. 用分位点夹住它,概率为 1−α1-\alpha;
  3. 解不等式,把参数留在中间。

例如正态总体方差未知时,μ\mu 的区间是

Xˉ±t1−α/2(n−1)Sn.\bar X\pm t_{1-\alpha/2}(n-1)\frac{S}{\sqrt n}.

这里“置信度 1−α1-\alpha”说的是反复抽样构造出的区间有 1−α1-\alpha 会覆盖固定参数,不是参数以这个概率落入已经算出的区间。

4. 假设检验:控制误判后决定是否推翻 H0H_0

先写 H0H_0、H1H_1 和显著性水平 α\alpha。在 H0H_0 成立时,构造已知分布的统计量,把概率不超过 α\alpha 的极端区域设为拒绝域。

  • 第一类错误:H0H_0 为真却拒绝,概率受 α\alpha 控制;
  • 第二类错误:H0H_0 为假却没拒绝,概率记为 β\beta;
  • 功效:1−β1-\beta;
  • pp 值:在 H0H_0 下,得到“当前或更极端数据”的概率。

p<αp<\alpha 才拒绝 H0H_0。不拒绝不等于证明 H0H_0 正确,只表示当前样本证据不够强。

似然比检验把“H0H_0 内能达到的最大似然”与“整个参数空间内的最大似然”相比:

Λ(x)=sup⁡θ∈Θ0L(θ;x)sup⁡θ∈ΘL(θ;x).\Lambda(x)=\frac{\sup_{\theta\in\Theta_0}L(\theta;x)} {\sup_{\theta\in\Theta}L(\theta;x)}.

Λ\Lambda 太小说明约束 H0H_0 让数据变得很难解释,应拒绝。

5. 方差分析:把总波动拆开

单因子、rr 组、每组 mm 次重复的模型为

Xij=μ+αi+εij,εij∼i.i.d.N(0,σ2),X_{ij}=\mu+\alpha_i+\varepsilon_{ij},\qquad \varepsilon_{ij}\overset{\text{i.i.d.}}\sim N(0,\sigma^2),

检验 H0:α1=⋯=αr=0H_0:\alpha_1=\cdots=\alpha_r=0。核心恒等式是

SST=SSA+SSE.SS_T=SS_A+SS_E.

总波动被拆成“组间差异”和“组内噪声”,于是

F=MSAMSE∼F(r−1,r(m−1))(H0).F=\frac{MS_A}{MS_E}\sim F(r-1,r(m-1))\quad(H_0).

ANOVA 显著只说明至少有一组不同;究竟哪几组不同,要继续做多重比较。使用前还要检查独立性、正态性和方差齐性。

6. 回归:把关系写成可估计的模型

简单线性回归为

Yi=β0+β1xi+εi,εi∼i.i.d.N(0,σ2).Y_i=\beta_0+\beta_1x_i+\varepsilon_i,\qquad \varepsilon_i\overset{\text{i.i.d.}}\sim N(0,\sigma^2).

最小二乘令残差平方和最小,得到

β^1=SxySxx,β^0=yˉ−β^1xˉ.\hat\beta_1=\frac{S_{xy}}{S_{xx}},\qquad \hat\beta_0=\bar y-\hat\beta_1\bar x.

随后分别做三件事:检验 β1=0\beta_1=0、估计某个 x0x_0 处的平均响应、预测一个新的个体响应。预测区间比均值响应区间宽,因为它额外包含新个体自身的随机误差。

考场识别表

题目条件先想到
正态总体,均值,方差未知tt
正态总体,单个方差χ2\chi^2
两正态总体方差比FF
两正态总体均值差、等方差合并方差 tt
分布给定、求参数矩法与似然
“充分统计量”因子分解定理
“最小方差无偏”完备充分 + Rao–Blackwell
拟合优度或列联表χ2\chi^2
多组均值ANOVA 的 FF

最后检查三件事:自由度有没有写错,单侧/双侧分位点有没有写反,模型前提有没有说明。数理统计最容易失分的地方通常不是大思路,而是这三处。

评论