第 9 讲:假设检验、两类错误、功效与 p 值

假设检验不是证明哪个命题为真,而是在预先控制误判概率的前提下,看数据是否与 H0H_0 冲突到足以拒绝它。

六步模板

  1. 写参数与模型前提;
  2. 写 H0H_0、H1H_1,确定单侧或双侧;
  3. 选显著性水平 α\alpha;
  4. 在 H0H_0 下找分布已知的检验统计量;
  5. 构造总概率不超过 α\alpha 的拒绝域;
  6. 代入数据,给出“拒绝”或“不拒绝”及语境结论。

若 H1:θ>θ0H_1:\theta>\theta_0,证据在右尾;若 H1:θ<θ0H_1:\theta<\theta_0,在左尾;若 H1:θ≠θ0H_1:\theta\ne\theta_0,通常把 α\alpha 分到两端。

两类错误

实际情况不拒绝 H0H_0拒绝 H0H_0
H0H_0 为真正确第一类错误,概率 α\alpha
H0H_0 为假第二类错误,概率 β(θ)\beta(\theta)正确,功效 1−β(θ)1-\beta(\theta)

固定样本量时,压低 α\alpha 往往会抬高 β\beta。同时降低两者通常需要增加样本量或降低噪声。

功效函数

检验的功效函数

π(θ)=Pθ{拒绝 H0}\pi(\theta)=P_\theta\{\text{拒绝 }H_0\}

描述不同真实参数下发现差异的概率。在 H0H_0 区域应不超过 α\alpha;参数离原假设越远,理想检验的功效越高。

“结果不显著”可能只是样本太小、功效不足,不能直接当作“没有差异”的证据。

p 值

pp 值是在 H0H_0 成立时,检验统计量取得当前观察值或更极端结果的概率。它是数据与 H0H_0 冲突程度的刻度:

p≤α⟺在水平 α 下拒绝 H0.p\le\alpha\Longleftrightarrow\text{在水平 }\alpha\text{ 下拒绝 }H_0.

pp 值不是 P(H0∣x)P(H_0\mid x),也不是结果由偶然造成的概率。它的定义仍以假设 H0H_0 为真为条件。

单侧与双侧不能看完数据再选

方向必须由研究问题预先决定。看到样本均值偏大后临时把双侧改成右侧,会把第一类错误概率放大。若反方向的差异也重要,就应使用双侧检验。

统计显著不等于实际重要

样本非常大时,微小差异也可能有很小的 pp 值。结论还应报告效应量和置信区间:前者说明差异多大,后者说明不确定性多大。

Neyman–Pearson 思想

对简单假设 H0:θ=θ0H_0:\theta=\theta_0 与 H1:θ=θ1H_1:\theta=\theta_1,固定第一类错误概率后,似然比

L(θ1;x)L(θ0;x)\frac{L(\theta_1;x)}{L(\theta_0;x)}

大的样本最支持 H1H_1。Neyman–Pearson 引理说明由此构造的检验具有最大功效,是似然比检验思想的起点。

评论