两样本问题最难的不是公式,而是先认清数据结构。两组互不相关的对象是独立样本;同一对象前后测或按特征配成一对,则应先做差,转成单样本问题。
两个正态均值之差:方差已知
独立样本来自
N(μ1,σ12),N(μ2,σ22),
且两方差已知时,
Z=σ12/n1+σ22/n2(Xˉ−Yˉ)−(μ1−μ2)∼N(0,1).
所以区间中心是 Xˉ−Yˉ,半宽是正态分位点乘联合标准误。
方差未知但相等:合并方差
若 σ12=σ22=σ2 未知,使用
Sp2=n1+n2−2(n1−1)S12+(n2−1)S22,
T=Sp1/n1+1/n2(Xˉ−Yˉ)−(μ1−μ2)∼t(n1+n2−2).
“合并”成立是因为两份样本在估计同一个 σ2。没有等方差前提就不该硬合并。
方差未知且不等:Welch 区间
S12/n1+S22/n2(Xˉ−Yˉ)−(μ1−μ2)≈t(ν),
其中 Welch–Satterthwaite 自由度
ν=(S12/n1)2/(n1−1)+(S22/n2)2/(n2−1)(S12/n1+S22/n2)2.
实践中不确信等方差时,Welch 方法通常比先做一次方差齐性检验再决定更稳健。
配对样本
令每一对差值 Di=Xi−Yi,问题变成对 D1,…,Dn 的单样本均值区间:
μD∈Dˉ±t1−α/2(n−1)nSD.
配对的好处是消除个体间差异。若把配对数据误当成两组独立样本,会丢掉相关性信息。
两个正态方差之比
F=S22/σ22S12/σ12=σ12/σ22S12/S22∼F(n1−1,n2−1).
解出 σ12/σ22:
[F1−α/2(n1−1,n2−1)S12/S22,Fα/2(n1−1,n2−1)S12/S22].
大样本差值
两个样本足够大时,均值差近似正态,未知方差可用样本方差替换。两个比例差同理:
(p^1−p^2)±z1−α/2n1p^1(1−p^1)+n2p^2(1−p^2).
区间估计使用各组自己的比例;检验 p1=p2 时,H0 下两组共享同一比例,标准误通常使用合并比例。二者不要混用。