第 9 讲:假设检验、两类错误、功效与 p 值
假设检验不是证明哪个命题为真,而是在预先控制误判概率的前提下,看数据是否与 冲突到足以拒绝它。
六步模板
- 写参数与模型前提;
- 写 、,确定单侧或双侧;
- 选显著性水平 ;
- 在 下找分布已知的检验统计量;
- 构造总概率不超过 的拒绝域;
- 代入数据,给出“拒绝”或“不拒绝”及语境结论。
若 ,证据在右尾;若 ,在左尾;若 ,通常把 分到两端。
两类错误
| 实际情况 | 不拒绝 | 拒绝 |
|---|---|---|
| 为真 | 正确 | 第一类错误,概率 |
| 为假 | 第二类错误,概率 | 正确,功效 |
固定样本量时,压低 往往会抬高 。同时降低两者通常需要增加样本量或降低噪声。
功效函数
检验的功效函数
描述不同真实参数下发现差异的概率。在 区域应不超过 ;参数离原假设越远,理想检验的功效越高。
“结果不显著”可能只是样本太小、功效不足,不能直接当作“没有差异”的证据。
p 值
值是在 成立时,检验统计量取得当前观察值或更极端结果的概率。它是数据与 冲突程度的刻度:
值不是 ,也不是结果由偶然造成的概率。它的定义仍以假设 为真为条件。
单侧与双侧不能看完数据再选
方向必须由研究问题预先决定。看到样本均值偏大后临时把双侧改成右侧,会把第一类错误概率放大。若反方向的差异也重要,就应使用双侧检验。
统计显著不等于实际重要
样本非常大时,微小差异也可能有很小的 值。结论还应报告效应量和置信区间:前者说明差异多大,后者说明不确定性多大。
Neyman–Pearson 思想
对简单假设 与 ,固定第一类错误概率后,似然比
大的样本最支持 。Neyman–Pearson 引理说明由此构造的检验具有最大功效,是似然比检验思想的起点。