第 10 讲 · 收敛、特征函数与极限定理

前面研究单个变量或有限多个变量,这一讲研究 X1,X2,…X_1,X_2,\ldots 组成的序列。大数定律解释平均为什么稳定,中心极限定理解释稳定值附近的误差为什么常近似正态。2021 版课件单列的特征函数,是连接“独立和”与“极限分布”的工具。

1. 依概率收敛

若对任意 ε>0\varepsilon>0,

P(∣Xn−X∣≥ε)⟶0,P(|X_n-X|\ge\varepsilon)\longrightarrow0,

则称 XnX_n 依概率收敛到 XX,记作

Xn→PX.X_n\xrightarrow{P}X.

它允许每个 nn 都有误差,只要求固定误差带外的概率趋于零。

若 Xn→PaX_n\xrightarrow P a、Yn→PbY_n\xrightarrow P b,连续函数运算保持收敛:

Xn+Yn→Pa+b,X_n+Y_n\xrightarrow P a+b, XnYn→Pab,X_nY_n\xrightarrow P ab,

若 b≠0b\ne0,还有 Xn/Yn→Pa/bX_n/Y_n\xrightarrow P a/b。

一个等价判据

令

Zn=∣Xn−X∣1+∣Xn−X∣.Z_n=\frac{|X_n-X|}{1+|X_n-X|}.

则 0≤Zn<10\le Z_n<1,并且

Xn→PX⟺E(Zn)→0.X_n\xrightarrow P X \quad\Longleftrightarrow\quad E(Z_n)\to0.

正向可用有界变量分段估计,反向可用 Markov 不等式。这一判据把概率收敛转成期望收敛。

2. 依分布收敛

若在极限分布函数 FF 的每个连续点 xx 上,

FXn(x)⟶FX(x),F_{X_n}(x)\longrightarrow F_X(x),

则称 XnX_n 依分布收敛到 XX,记作

Xn→dX.X_n\xrightarrow d X.

依概率收敛推出依分布收敛。反向一般不成立,因为依分布只比较边际分布,不要求 XnX_n 和 XX 在同一个样本点上接近。

特殊地,若极限是常数 cc,则

Xn→dc⟺Xn→Pc.X_n\xrightarrow d c \quad\Longleftrightarrow\quad X_n\xrightarrow P c.

3. 特征函数

随机变量 XX 的特征函数定义为

φX(t)=E(eitX),t∈R.\varphi_X(t)=E(e^{itX}), \qquad t\in\mathbb R.

由 Euler 公式 eitX=cos⁡(tX)+isin⁡(tX)e^{itX}=\cos(tX)+i\sin(tX)。因为 ∣eitX∣=1|e^{itX}|=1,特征函数对任何分布都存在,这是它比矩生成函数更稳的地方。

离散型:

φX(t)=∑kpkeitxk.\varphi_X(t)=\sum_kp_ke^{itx_k}.

连续型:

φX(t)=∫−∞∞eitxfX(x) dx.\varphi_X(t)=\int_{-\infty}^{\infty} e^{itx}f_X(x)\,dx.

基本性质

φX(0)=1,∣φX(t)∣≤1,\varphi_X(0)=1, \qquad |\varphi_X(t)|\le1, φX(−t)=φX(t)‾,\varphi_X(-t)=\overline{\varphi_X(t)}, φaX+b(t)=eibtφX(at).\varphi_{aX+b}(t)=e^{ibt}\varphi_X(at).

若 X,YX,Y 独立,

φX+Y(t)=φX(t)φY(t).\varphi_{X+Y}(t)=\varphi_X(t)\varphi_Y(t).

卷积因此变成普通乘法。若 E∣X∣k<∞E|X|^k<\infty,

φX(k)(0)=ikE(Xk).\varphi_X^{(k)}(0)=i^kE(X^k).

特征函数一致连续、正定,并且唯一决定概率分布。在适当可积条件下还能通过 Fourier 逆变换恢复密度:

fX(x)=12π∫−∞∞e−itxφX(t) dt.f_X(x)=\frac1{2\pi} \int_{-\infty}^{\infty}e^{-itx}\varphi_X(t)\,dt.

Lévy 连续性定理给出弱收敛判据:若 φXn(t)\varphi_{X_n}(t) 逐点收敛到在 00 处连续的某个特征函数 φX(t)\varphi_X(t),则 Xn→dXX_n\xrightarrow d X;反向也成立。

常用特征函数

分布φX(t)\varphi_X(t)
P(X=a)=1P(X=a)=1eiate^{iat}
Bernoulli(p)(p)1−p+peit1-p+pe^{it}
B(n,p)B(n,p)(1−p+peit)n(1-p+pe^{it})^n
P(λ)P(\lambda)exp⁡{λ(eit−1)}\exp\{\lambda(e^{it}-1)\}
U(a,b)U(a,b)(eibt−eiat)/[it(b−a)](e^{ibt}-e^{iat})/[it(b-a)]
N(μ,σ2)N(\mu,\sigma^2)exp⁡(iμt−σ2t2/2)\exp(i\mu t-\sigma^2t^2/2)
Exp(λ)Exp(\lambda)(1−it/λ)−1(1-it/\lambda)^{-1}
Ga(α,λ)Ga(\alpha,\lambda)(1−it/λ)−α(1-it/\lambda)^{-\alpha}
χ2(n)\chi^2(n)(1−2it)−n/2(1-2it)^{-n/2}

例如独立 Xi∼P(λ)X_i\sim P(\lambda) 时,

φ∑Xi(t)=[eλ(eit−1)]n=enλ(eit−1),\varphi_{\sum X_i}(t) =\left[e^{\lambda(e^{it}-1)}\right]^n =e^{n\lambda(e^{it}-1)},

所以 ∑Xi∼P(nλ)\sum X_i\sim P(n\lambda)。

矩是否唯一决定分布

特征函数总能唯一决定分布,但一串矩未必。旧版课件列出若干充分条件,例如 Carleman 型条件

∑n=1∞1[E(X2n)]1/(2n)=∞\sum_{n=1}^{\infty} \frac1{[E(X^{2n})]^{1/(2n)}}=\infty

可保证矩唯一决定分布。正态分布满足相应增长条件。做初等题时通常只需知道:能用特征函数判定分布,不应在未检查条件时仅凭所有已算出的低阶矩判断同分布。

4. 大数定律说的是什么

设 Sn=X1+⋯+XnS_n=X_1+\cdots+X_n。若

Sn−E(Sn)n→P0,\frac{S_n-E(S_n)}{n}\xrightarrow P0,

就说这列变量服从大数定律。它关注的是平均的随机波动逐渐消失。

Bernoulli 大数定律

在独立重复试验中,成功概率为 pp,频率 νn/n\nu_n/n 满足

νnn→Pp.\frac{\nu_n}{n}\xrightarrow Pp.

这严格说明了“频率稳定在概率附近”。

Chebyshev 大数定律

若 XiX_i 相互独立且方差一致有界,即存在 CC 使

Var⁡(Xi)≤C,\operatorname{Var}(X_i)\le C,

则

1n∑i=1n[Xi−E(Xi)]→P0.\frac1n\sum_{i=1}^n[X_i-E(X_i)] \xrightarrow P0.

证明只需计算均值的方差:

Var⁡(1n∑i=1nXi)=1n2∑i=1nVar⁡(Xi)≤Cn,\operatorname{Var}\left( \frac1n\sum_{i=1}^nX_i \right) =\frac1{n^2}\sum_{i=1}^n\operatorname{Var}(X_i) \le\frac Cn,

再用 Chebyshev 不等式。

Markov 大数定律

独立并非唯一条件。只要

Var⁡(Sn)n2→0,\frac{\operatorname{Var}(S_n)}{n^2}\to0,

Chebyshev 不等式同样推出

Sn−E(Sn)n→P0.\frac{S_n-E(S_n)}n\xrightarrow P0.

这允许一定相关性,只要总和的方差增长慢于 n2n^2。

Khinchin 大数定律

若 XiX_i 独立同分布且 E∣X1∣<∞E|X_1|<\infty,则

Xˉn=1n∑i=1nXi→PE(X1).\bar X_n=\frac1n\sum_{i=1}^nX_i \xrightarrow P E(X_1).

它不要求方差存在,只要求一阶绝对矩有限。

5. 中心极限定理

大数定律只说 Xˉn\bar X_n 靠近 μ\mu,没有给误差的形状。若 XiX_i 独立同分布,

E(Xi)=μ,Var⁡(Xi)=σ2∈(0,∞),E(X_i)=\mu, \qquad \operatorname{Var}(X_i)=\sigma^2\in(0,\infty),

Lindeberg–Lévy 中心极限定理给出

Sn−nμσn→dN(0,1).\frac{S_n-n\mu}{\sigma\sqrt n} \xrightarrow dN(0,1).

等价地,大样本下

Sn≈N(nμ,nσ2),S_n\approx N(n\mu,n\sigma^2), Xˉn≈N(μ,σ2n).\bar X_n\approx N\left(\mu,\frac{\sigma^2}{n}\right).

这不是说每个 XiX_i 必须正态,而是标准化后的大样本和趋近正态。

6. de Moivre–Laplace 与连续性修正

若 X∼B(n,p)X\sim B(n,p) 且 npnp、n(1−p)n(1-p) 足够大,

X−npnp(1−p)≈N(0,1).\frac{X-np}{\sqrt{np(1-p)}} \approx N(0,1).

由于 XX 是整数而正态变量连续,应作连续性修正:

P(a≤X≤b)≈Φ(b+0.5−npnp(1−p))−Φ(a−0.5−npnp(1−p)).P(a\le X\le b) \approx \Phi\left(\frac{b+0.5-np}{\sqrt{np(1-p)}}\right) -\Phi\left(\frac{a-0.5-np}{\sqrt{np(1-p)}}\right).

对应关系:

  • P(X≤k)P(X\le k) 用边界 k+0.5k+0.5;
  • P(X≥k)P(X\ge k) 用边界 k−0.5k-0.5;
  • P(X=k)P(X=k) 用区间 (k−0.5,k+0.5)(k-0.5,k+0.5)。

例:收入超过阈值

单件售价 XX 取 1,1.2,1.51,1.2,1.5,概率分别为 0.3,0.2,0.50.3,0.2,0.5。先算

E(X)=1.29,E(X)=1.29, E(X2)=1.713,E(X^2)=1.713, Var⁡(X)=1.713−1.292=0.0489.\operatorname{Var}(X)=1.713-1.29^2=0.0489.

300 件总收入 SS 近似

S∼N(387,14.67).S\sim N(387,14.67).

因此

P(S≥400)≈1−Φ(400−38714.67)≈1−Φ(3.39).P(S\ge400) \approx1-\Phi\left( \frac{400-387}{\sqrt{14.67}} \right) \approx1-\Phi(3.39).

这里单件收入本身不是计数,阈值不需要二项式的 0.50.5 连续性修正。

7. 独立但不同分布的中心极限定理

设独立变量 XiX_i 的均值为 μi\mu_i、方差为 σi2\sigma_i^2,记

Bn2=∑i=1nσi2.B_n^2=\sum_{i=1}^n\sigma_i^2.

Lindeberg 条件要求对每个 ε>0\varepsilon>0,

1Bn2∑i=1nE[(Xi−μi)21{∣Xi−μi∣>εBn}]→0.\frac1{B_n^2} \sum_{i=1}^n E\left[ (X_i-\mu_i)^2 \mathbf1_{\{|X_i-\mu_i|>\varepsilon B_n\}} \right] \to0.

直觉是:超过总标准差尺度的单项贡献可以忽略。

更易验证的 Lyapunov 条件是存在 δ>0\delta>0 使

1Bn2+δ∑i=1nE∣Xi−μi∣2+δ→0.\frac1{B_n^{2+\delta}} \sum_{i=1}^nE|X_i-\mu_i|^{2+\delta} \to0.

满足这些条件时,

∑i=1n(Xi−μi)Bn→dN(0,1).\frac{\sum_{i=1}^n(X_i-\mu_i)}{B_n} \xrightarrow dN(0,1).

Lyapunov 条件推出 Lindeberg 条件;两者都在排除某个变量单独主宰总和。

8. 大数定律和中心极限定理别混

问题大数定律中心极限定理
研究对象样本均值是否靠近真均值标准化误差的分布
典型结论Xˉn→Pμ\bar X_n\xrightarrow P\mun(Xˉn−μ)/σ→dN(0,1)\sqrt n(\bar X_n-\mu)/\sigma\xrightarrow dN(0,1)
能否算近似概率通常不能给精细近似可以用 Φ\Phi 近似
误差尺度只说趋于 0明确为 1/n1/\sqrt n 量级

9. 检查清单

  • 依概率收敛比依分布收敛强;极限为常数时二者等价。
  • 特征函数中的 ii 是虚数单位,导数求矩时别漏 iki^k。
  • 独立和的特征函数才能直接相乘。
  • 大数定律关心平均稳定,中心极限定理关心标准化误差形状。
  • 标准化分母是标准差 σn\sigma\sqrt n,不是方差 nσ2n\sigma^2。
  • 二项正态近似要看连续性修正;一般连续收入之和不需要机械加减 0.50.5。
  • 非同分布中心极限定理的条件在防止“大项支配”,不是只检查变量个数很多。

评论