第 8 讲:两总体与大样本置信区间

两样本问题最难的不是公式,而是先认清数据结构。两组互不相关的对象是独立样本;同一对象前后测或按特征配成一对,则应先做差,转成单样本问题。

两个正态均值之差:方差已知

独立样本来自

N(μ1,σ12),N(μ2,σ22),N(\mu_1,\sigma_1^2),\qquad N(\mu_2,\sigma_2^2),

且两方差已知时,

Z=(Xˉ−Yˉ)−(μ1−μ2)σ12/n1+σ22/n2∼N(0,1).Z=\frac{(\bar X-\bar Y)-(\mu_1-\mu_2)} {\sqrt{\sigma_1^2/n_1+\sigma_2^2/n_2}} \sim N(0,1).

所以区间中心是 Xˉ−Yˉ\bar X-\bar Y,半宽是正态分位点乘联合标准误。

方差未知但相等:合并方差

若 σ12=σ22=σ2\sigma_1^2=\sigma_2^2=\sigma^2 未知,使用

Sp2=(n1−1)S12+(n2−1)S22n1+n2−2,S_p^2= \frac{(n_1-1)S_1^2+(n_2-1)S_2^2} {n_1+n_2-2}, T=(Xˉ−Yˉ)−(μ1−μ2)Sp1/n1+1/n2∼t(n1+n2−2).T=\frac{(\bar X-\bar Y)-(\mu_1-\mu_2)} {S_p\sqrt{1/n_1+1/n_2}} \sim t(n_1+n_2-2).

“合并”成立是因为两份样本在估计同一个 σ2\sigma^2。没有等方差前提就不该硬合并。

方差未知且不等:Welch 区间

(Xˉ−Yˉ)−(μ1−μ2)S12/n1+S22/n2≈t(ν),\frac{(\bar X-\bar Y)-(\mu_1-\mu_2)} {\sqrt{S_1^2/n_1+S_2^2/n_2}} \approx t(\nu),

其中 Welch–Satterthwaite 自由度

ν=(S12/n1+S22/n2)2(S12/n1)2/(n1−1)+(S22/n2)2/(n2−1).\nu= \frac{(S_1^2/n_1+S_2^2/n_2)^2} {(S_1^2/n_1)^2/(n_1-1)+(S_2^2/n_2)^2/(n_2-1)}.

实践中不确信等方差时,Welch 方法通常比先做一次方差齐性检验再决定更稳健。

配对样本

令每一对差值 Di=Xi−YiD_i=X_i-Y_i,问题变成对 D1,…,DnD_1,\ldots,D_n 的单样本均值区间:

μD∈Dˉ±t1−α/2(n−1)SDn.\mu_D\in \bar D\pm t_{1-\alpha/2}(n-1)\frac{S_D}{\sqrt n}.

配对的好处是消除个体间差异。若把配对数据误当成两组独立样本,会丢掉相关性信息。

两个正态方差之比

F=S12/σ12S22/σ22=S12/S22σ12/σ22∼F(n1−1,n2−1).F=\frac{S_1^2/\sigma_1^2}{S_2^2/\sigma_2^2} =\frac{S_1^2/S_2^2}{\sigma_1^2/\sigma_2^2} \sim F(n_1-1,n_2-1).

解出 σ12/σ22\sigma_1^2/\sigma_2^2:

[S12/S22F1−α/2(n1−1,n2−1),S12/S22Fα/2(n1−1,n2−1)].\left[ \frac{S_1^2/S_2^2}{F_{1-\alpha/2}(n_1-1,n_2-1)}, \frac{S_1^2/S_2^2}{F_{\alpha/2}(n_1-1,n_2-1)} \right].

大样本差值

两个样本足够大时,均值差近似正态,未知方差可用样本方差替换。两个比例差同理:

(p^1−p^2)±z1−α/2p^1(1−p^1)n1+p^2(1−p^2)n2.(\hat p_1-\hat p_2)\pm z_{1-\alpha/2} \sqrt{\frac{\hat p_1(1-\hat p_1)}{n_1} +\frac{\hat p_2(1-\hat p_2)}{n_2}}.

区间估计使用各组自己的比例;检验 p1=p2p_1=p_2 时,H0H_0 下两组共享同一比例,标准误通常使用合并比例。二者不要混用。

评论