第 4 讲 · 期望、方差与分布特征

分布给出了随机变量的全部信息,但实际问题往往只需要几个摘要:平均在哪里、波动多大、尾部朝哪边、极端偏差有多大概率。

1. 期望:概率加权的长期平均

离散变量 XX 取值 xkx_k、概率 pkp_k 时,若级数绝对收敛,定义

E(X)=∑kxkpk.E(X)=\sum_kx_kp_k.

连续变量密度为 fXf_X 时,若积分绝对收敛,定义

E(X)=∫−∞∞xfX(x) dx.E(X)=\int_{-\infty}^{\infty}xf_X(x)\,dx.

绝对收敛不是装饰。柯西分布虽然关于原点对称,但 ∫∣x∣f(x) dx=∞\int |x|f(x)\,dx=\infty,所以不能用“正负抵消”宣布期望为零。

期望也不一定是随机变量可能取得的值。公平骰子的期望是 3.53.5,但一次不可能掷出 3.53.5。

直接计算函数的期望

若 Y=g(X)Y=g(X),无需先求 YY 的分布:

E[g(X)]=∑kg(xk)pkE[g(X)]=\sum_kg(x_k)p_k

或

E[g(X)]=∫−∞∞g(x)fX(x) dx.E[g(X)]=\int_{-\infty}^{\infty}g(x)f_X(x)\,dx.

这就是无意识统计学家法则(LOTUS)。

例:奖金的期望

某彩票售价 5 元,以概率 10−410^{-4} 获得 20000 元,否则奖金为 0。若 XX 表示净收益,

E(X)=10−4(20000−5)+(1−10−4)(−5)=−3.E(X)=10^{-4}(20000-5)+(1-10^{-4})(-5)=-3.

期望为 −3-3 元不表示每次都亏 3 元,而表示大量独立购买后的平均净收益趋近 −3-3 元。

2. 期望的运算性质

只要相关期望存在:

E(c)=c,E(c)=c, E(aX+bY+c)=aE(X)+bE(Y)+c.E(aX+bY+c)=aE(X)+bE(Y)+c.

线性性不要求 X,YX,Y 独立。若 X,YX,Y 独立且 E∣XY∣<∞E|XY|<\infty,才有

E(XY)=E(X)E(Y).E(XY)=E(X)E(Y).

对非负整数变量,还有尾和公式:

E(X)=∑k=1∞P(X≥k).E(X)=\sum_{k=1}^{\infty}P(X\ge k).

对非负连续变量:

E(X)=∫0∞P(X>x) dx,E(X)=\int_0^\infty P(X>x)\,dx,

更一般地,若 E(Xn)<∞E(X^n)<\infty,

E(Xn)=∫0∞nxn−1P(X>x) dx.E(X^n)=\int_0^\infty n x^{n-1}P(X>x)\,dx.

尾和公式在“等待到首次成功”“检查到首件次品”这类题里很省事。

3. 方差与标准差

方差定义为

Var⁡(X)=E[(X−EX)2].\operatorname{Var}(X)=E[(X-E X)^2].

常用计算式是

Var⁡(X)=E(X2)−[E(X)]2.\operatorname{Var}(X)=E(X^2)-[E(X)]^2.

标准差 σX=Var⁡(X)\sigma_X=\sqrt{\operatorname{Var}(X)} 与 XX 量纲相同,更便于解释。

基本性质:

Var⁡(X)≥0,\operatorname{Var}(X)\ge0, Var⁡(aX+b)=a2Var⁡(X).\operatorname{Var}(aX+b)=a^2\operatorname{Var}(X).

常数平移改变中心,不改变离散程度;放大 aa 倍则方差放大 a2a^2 倍。

均值是最佳平方误差中心

对任意常数 cc,

E[(X−c)2]=Var⁡(X)+[E(X)−c]2.E[(X-c)^2] =\operatorname{Var}(X)+[E(X)-c]^2.

因此 c=E(X)c=E(X) 时均方误差最小;若 c≠E(X)c\ne E(X),误差严格大于方差。

有界变量的方差上界

若 a≤X≤ba\le X\le b,Popoviciu 不等式给出

Var⁡(X)≤(b−a)24.\operatorname{Var}(X)\le\frac{(b-a)^2}{4}.

取中点 m=(a+b)/2m=(a+b)/2,利用

Var⁡(X)≤E[(X−m)2]≤(b−a)24\operatorname{Var}(X) \le E[(X-m)^2] \le\frac{(b-a)^2}{4}

即可证明。

4. 标准化与变异系数

若 Var⁡(X)=σ2>0\operatorname{Var}(X)=\sigma^2>0,标准化变量

Z=X−E(X)σZ=\frac{X-E(X)}{\sigma}

满足 E(Z)=0E(Z)=0、Var⁡(Z)=1\operatorname{Var}(Z)=1。

不同量纲或不同均值尺度下,可用变异系数

CV=σ∣μ∣,μ≠0,CV=\frac{\sigma}{|\mu|},\qquad \mu\ne0,

比较相对波动。它没有量纲,但均值接近 0 时会失去稳定解释。

5. 矩

kk 阶原点矩和中心矩分别为

μk′=E(Xk),μk=E[(X−EX)k].\mu_k'=E(X^k), \qquad \mu_k=E[(X-E X)^k].

其中 μ1′=E(X)\mu_1'=E(X),μ2=Var⁡(X)\mu_2=\operatorname{Var}(X)。矩不一定存在;高阶矩存在通常意味着尾部衰减得更快。

6. 分位数、中位数与众数

连续严格单调 CDF 下,pp 分位数 xpx_p 满足

F(xp)=p.F(x_p)=p.

更一般地可定义为使 F(xp)≥pF(x_p)\ge p 的最小点。离散分布可能没有满足严格等式 F(x)=pF(x)=p 的点,所以必须用这个广义定义。

中位数是 p=0.5p=0.5 的分位数。对 X∼Exp(λ)X\sim Exp(\lambda),

1−e−λx0.5=0.5,1-e^{-\lambda x_{0.5}}=0.5,

故

x0.5=ln⁡2λ.x_{0.5}=\frac{\ln2}{\lambda}.

众数是概率质量或密度达到最大的位置。均值、中位数、众数从不同角度描述“中心”,偏态分布中通常不相等。

上侧 pp 分位数常记作 xp′x_p',满足 P(X≥xp′)=pP(X\ge x_p')=p。统计表中的 zαz_\alpha、χα2\chi^2_\alpha 等通常采用上侧尾概率,使用前要看清表的约定。

7. 偏度与峰度

若三阶矩存在,偏度为

γ1=E[(X−μ)3]σ3.\gamma_1= \frac{E[(X-\mu)^3]}{\sigma^3}.
  • γ1>0\gamma_1>0:右尾较长,称右偏或正偏;
  • γ1<0\gamma_1<0:左尾较长,称左偏或负偏;
  • 对称分布在三阶矩存在时偏度为 0,但偏度为 0 不必然完全对称。

超额峰度为

γ2=E[(X−μ)4]σ4−3.\gamma_2= \frac{E[(X-\mu)^4]}{\sigma^4}-3.

减去 3 是以正态分布为基准。正值通常表示更尖或尾更重,负值通常表示更平或尾更轻。峰度同时受中心和尾部影响,不能只按图形尖不尖机械解释。

8. Markov 与 Chebyshev 不等式

若 X≥0X\ge0 且 a>0a>0,

P(X≥a)≤E(X)a.P(X\ge a)\le\frac{E(X)}{a}.

若 E(X)=μE(X)=\mu、Var⁡(X)=σ2\operatorname{Var}(X)=\sigma^2,则对 ε>0\varepsilon>0,

P(∣X−μ∣≥ε)≤σ2ε2.P(|X-\mu|\ge\varepsilon) \le\frac{\sigma^2}{\varepsilon^2}.

等价地,

P(∣X−μ∣<ε)≥1−σ2ε2.P(|X-\mu|<\varepsilon) \ge1-\frac{\sigma^2}{\varepsilon^2}.

Chebyshev 只用均值和方差,所以普适但常较松。若题目给出完整分布,直接算通常更准;若只给矩,它就很有用。

还可把 Markov 推广到非负单调函数 gg:若 g(ε)>0g(\varepsilon)>0,

P(X>ε)≤E[g(X)]g(ε).P(X>\varepsilon) \le\frac{E[g(X)]}{g(\varepsilon)}.

9. 这一讲的检查清单

  • 先确认期望绝对收敛,不用对称性掩盖不存在。
  • 计算方差优先用 E(X2)−[E(X)]2E(X^2)-[E(X)]^2。
  • E(X+Y)E(X+Y) 不要求独立,E(XY)=E(X)E(Y)E(XY)=E(X)E(Y) 才需要独立。
  • 方差不随平移变,但随缩放系数的平方变。
  • 离散分位数用广义定义,不强求 F(x)=pF(x)=p。
  • 峰度不是单纯“峰有多高”,它也反映尾部。

评论