第 9 讲 · 协方差、相关与条件期望

联合分布保存了变量之间的全部关系,但常常太复杂。协方差和相关系数提取线性关系,条件分布与条件期望则回答“知道一个变量以后,另一个变量怎样变化”。

1. 随机向量函数的期望

离散型 (X,Y)(X,Y) 的联合分布列为 pijp_{ij} 时,

E[g(X,Y)]=∑i∑jg(xi,yj)pij.E[g(X,Y)]=\sum_i\sum_jg(x_i,y_j)p_{ij}.

连续型联合密度为 f(x,y)f(x,y) 时,

E[g(X,Y)]=∬g(x,y)f(x,y) dx dy.E[g(X,Y)]=\iint g(x,y)f(x,y)\,dx\,dy.

无需先求 g(X,Y)g(X,Y) 的分布。这是多维 LOTUS。

例:单位线段上两点的平均距离

若 X,YX,Y 独立且都服从 U(0,1)U(0,1),则

E∣X−Y∣=2∫01∫0x(x−y) dy dx=13.E|X-Y| =2\int_0^1\int_0^x(x-y)\,dy\,dx =\frac13.

乘 2 是利用主对角线两侧对称。

2. 协方差

定义

Cov⁡(X,Y)=E[(X−EX)(Y−EY)]=E(XY)−E(X)E(Y).\operatorname{Cov}(X,Y) =E[(X-E X)(Y-E Y)] =E(XY)-E(X)E(Y).

它表示两个变量相对各自均值是否倾向于同方向变化。

基本性质:

Cov⁡(X,X)=Var⁡(X),\operatorname{Cov}(X,X)=\operatorname{Var}(X), Cov⁡(X,Y)=Cov⁡(Y,X),\operatorname{Cov}(X,Y)=\operatorname{Cov}(Y,X), Cov⁡(aX+b,cY+d)=acCov⁡(X,Y).\operatorname{Cov}(aX+b,cY+d)=ac\operatorname{Cov}(X,Y).

线性组合方差:

Var⁡(aX+bY)=a2Var⁡(X)+b2Var⁡(Y)+2abCov⁡(X,Y).\operatorname{Var}(aX+bY) =a^2\operatorname{Var}(X)+b^2\operatorname{Var}(Y) +2ab\operatorname{Cov}(X,Y).

更一般地,

Var⁡(∑iXi)=∑iVar⁡(Xi)+2∑i<jCov⁡(Xi,Xj).\operatorname{Var}\left(\sum_iX_i\right) =\sum_i\operatorname{Var}(X_i) +2\sum_{i<j}\operatorname{Cov}(X_i,X_j).

若变量两两不相关,交叉项才消失。独立推出不相关(在二阶矩存在时),反向一般不成立。

3. 相关系数

若 σX,σY>0\sigma_X,\sigma_Y>0,定义

ρXY=Cov⁡(X,Y)σXσY.\rho_{XY}= \frac{\operatorname{Cov}(X,Y)}{\sigma_X\sigma_Y}.

Cauchy–Schwarz 不等式给出

∣E(XY)∣≤E(X2)E(Y2),|E(XY)|\le\sqrt{E(X^2)E(Y^2)},

从而 ∣ρXY∣≤1|\rho_{XY}|\le1。等号成立当且仅当两个中心化变量几乎处处线性相关:

Y−E(Y)=c[X−E(X)].Y-E(Y)=c[X-E(X)].

相关系数没有量纲,只衡量线性关系。ρ=0\rho=0 仍可能有很强的非线性关系。例如 X∼U(−1,1)X\sim U(-1,1)、Y=X2Y=X^2,则 YY 完全由 XX 决定,但由对称性 E(XY)=E(X3)=0E(XY)=E(X^3)=0,所以不相关。

4. 协方差矩阵与相关矩阵

对随机向量

X=(X1,…,Xn)T,\boldsymbol X=(X_1,\ldots,X_n)^\mathsf T,

协方差矩阵定义为

Σ=E[(X−EX)(X−EX)T].\Sigma= E[(\boldsymbol X-E\boldsymbol X) (\boldsymbol X-E\boldsymbol X)^\mathsf T].

第 (i,j)(i,j) 个元素是 Cov⁡(Xi,Xj)\operatorname{Cov}(X_i,X_j)。它是对称半正定矩阵,因为对任意向量 a\boldsymbol a,

aTΣa=Var⁡(aTX)≥0.\boldsymbol a^\mathsf T\Sigma\boldsymbol a =\operatorname{Var}(\boldsymbol a^\mathsf T\boldsymbol X) \ge0.

相关矩阵把对角线标准化为 1,第 (i,j)(i,j) 项为 ρij\rho_{ij}。

5. 条件分布

离散型

若 P(Y=yj)>0P(Y=y_j)>0,

P(X=xi∣Y=yj)=P(X=xi,Y=yj)P(Y=yj).P(X=x_i\mid Y=y_j) =\frac{P(X=x_i,Y=y_j)}{P(Y=y_j)}.

连续型

若 fY(y)>0f_Y(y)>0,

fX∣Y(x∣y)=fX,Y(x,y)fY(y).f_{X\mid Y}(x\mid y) =\frac{f_{X,Y}(x,y)}{f_Y(y)}.

对固定的 yy,它关于 xx 是一个正规化后的密度。虽然连续变量满足 P(Y=y)=0P(Y=y)=0,条件密度仍可由联合密度与边际密度之比严格定义。

联合密度可重新分解为

fX,Y(x,y)=fX∣Y(x∣y)fY(y).f_{X,Y}(x,y)=f_{X\mid Y}(x\mid y)f_Y(y).

连续型全概率公式为

fX(x)=∫fX∣Y(x∣y)fY(y) dy,f_X(x)=\int f_{X\mid Y}(x\mid y)f_Y(y)\,dy,

Bayes 公式为

fY∣X(y∣x)=fX∣Y(x∣y)fY(y)fX(x).f_{Y\mid X}(y\mid x) =\frac{f_{X\mid Y}(x\mid y)f_Y(y)}{f_X(x)}.

6. 条件期望

离散情形下

E(X∣Y=y)=∑xxP(X=x∣Y=y),E(X\mid Y=y) =\sum_xxP(X=x\mid Y=y),

连续情形下

E(X∣Y=y)=∫xfX∣Y(x∣y) dx.E(X\mid Y=y) =\int x f_{X\mid Y}(x\mid y)\,dx.

当 yy 变化时,它形成随机变量 E(X∣Y)E(X\mid Y),并且是 YY 的函数。

条件期望的关键性质

若相关期望存在:

E[aX+bZ∣Y]=aE(X∣Y)+bE(Z∣Y),E[aX+bZ\mid Y] =aE(X\mid Y)+bE(Z\mid Y), E[h(Y)∣Y]=h(Y),E[h(Y)\mid Y]=h(Y), E[h(Y)X∣Y]=h(Y)E(X∣Y),E[h(Y)X\mid Y]=h(Y)E(X\mid Y), E[E(X∣Y)]=E(X).E[E(X\mid Y)]=E(X).

最后一条称为塔式法则或全期望公式。它的直觉是:先在每个 Y=yY=y 的小组中求平均,再对各小组加权,仍得到总体平均。

还有一个常用恒等式:

E(XY)=E[XE(Y∣X)],E(XY)=E[XE(Y\mid X)],

从而

Cov⁡(X,E(Y∣X))=Cov⁡(X,Y).\operatorname{Cov}(X,E(Y\mid X)) =\operatorname{Cov}(X,Y).

7. 例:三角形支持域上的条件密度

设

fX,Y(x,y)=3x,0<y<x<1.f_{X,Y}(x,y)=3x, \qquad 0<y<x<1.

边际密度为

fX(x)=∫0x3x dy=3x2,0<x<1.f_X(x)=\int_0^x3x\,dy=3x^2, \qquad 0<x<1.

所以

fY∣X(y∣x)=3x3x2=1x,0<y<x.f_{Y\mid X}(y\mid x)=\frac{3x}{3x^2}=\frac1x, \qquad 0<y<x.

给定 X=xX=x 后,YY 在 (0,x)(0,x) 上均匀。于是

E(Y∣X=x)=x2.E(Y\mid X=x)=\frac x2.

再用塔式法则:

E(Y)=E(X2)=12E(X)=38.E(Y)=E\left(\frac X2\right)=\frac12E(X)=\frac38.

8. 随机和

设 NN 是非负整数变量,X1,X2,…X_1,X_2,\ldots 独立同分布,并与 NN 独立。令

SN=∑i=1NXi,S_N=\sum_{i=1}^NX_i,

约定 S0=0S_0=0。给定 N=nN=n 后,

E(SN∣N=n)=nE(X1),E(S_N\mid N=n)=nE(X_1),

所以

E(SN)=E(N)E(X1).E(S_N)=E(N)E(X_1).

利用全方差公式

Var⁡(Y)=E[Var⁡(Y∣X)]+Var⁡[E(Y∣X)],\operatorname{Var}(Y) =E[\operatorname{Var}(Y\mid X)] +\operatorname{Var}[E(Y\mid X)],

得到

Var⁡(SN)=E(N)Var⁡(X1)+Var⁡(N)[E(X1)]2.\operatorname{Var}(S_N) =E(N)\operatorname{Var}(X_1) +\operatorname{Var}(N)[E(X_1)]^2.

第一项来自每个固定样本量下的个体波动,第二项来自样本量本身的波动。

9. 检查清单

  • 求 E[g(X,Y)]E[g(X,Y)] 可直接对联合分布求和或积分。
  • 方差展开不能漏协方差项。
  • 独立推出不相关,零相关一般不推出独立。
  • 条件密度要用联合密度除以作为条件的变量的边际密度。
  • E(X∣Y)E(X\mid Y) 是随机变量,是 YY 的函数。
  • 随机和公式需要 NN 与各 XiX_i 独立;条件不满足时不能直接套。

评论