速成 · 概率论

做概率题时,最稳的顺序是:先把随机现象翻译成事件,再把事件翻译成分布,最后从分布计算关心的量。 公式很多,但都应该放回这三步里理解。

复习顺序如下:

事件与概率⟶一维随机变量⟶随机向量⟶随机变量序列的极限.\text{事件与概率} \longrightarrow \text{一维随机变量} \longrightarrow \text{随机向量} \longrightarrow \text{随机变量序列的极限}.

前两章回答“一次随机试验会怎样”;第三章研究几个随机量怎样一起变化;第四章解释重复很多次后为什么会出现稳定频率和正态分布。下面按做题顺序重建这条线。

一、先认清题目给了什么

看到题目,先给信息分类。

  1. 给事件及其概率:用集合运算、条件概率、全概率或 Bayes。
  2. 给概率质量函数、密度或分布函数:先写支持集,再求概率、期望、方差。
  3. 给 Y=g(X)Y=g(X):离散型合并同值,连续型优先用分布函数法或变量变换。
  4. 给 (X,Y)(X,Y) 的联合分布:先画支持域,再积分或求和;不能默认独立。
  5. 给很多独立同分布变量之和:先问能否直接认分布,再考虑大数定律或中心极限定理。

最常见的低级错误不是算错积分,而是漏掉支持集、把密度当概率、或者没验证独立就把联合分布拆成乘积。

二、事件与概率:从集合开始

样本空间记作 Ω\Omega,事件是 Ω\Omega 的子集。并、交、差、补分别对应“至少一个发生”“同时发生”“前者发生而后者不发生”“没有发生”。De Morgan 公式必须熟:

A∪B‾=Aˉ∩Bˉ,A∩B‾=Aˉ∪Bˉ.\overline{A\cup B}=\bar A\cap\bar B, \qquad \overline{A\cap B}=\bar A\cup\bar B.

概率由非负性、规范性和可列可加性定义。直接可用的结论包括

P(A∪B)=P(A)+P(B)−P(AB),P(A\cup B)=P(A)+P(B)-P(AB),

以及容斥公式、单调性和连续性。遇到“至少一次”通常先算补集:

P(至少一次成功)=1−P(一次也没成功).P(\text{至少一次成功})=1-P(\text{一次也没成功}).

古典概型的核心是等可能:

P(A)=∣A∣∣Ω∣.P(A)=\frac{|A|}{|\Omega|}.

放回抽样通常出现二项分布;不放回抽样通常出现超几何分布。若样本点连续且按长度、面积或体积均匀,改用几何概型。频率方法、主观概率、Buffon 投针和 Bertrand 悖论的共同提醒是:“概率是多少”必须连同随机试验怎样定义一起说。

三、条件概率、全概率与 Bayes

已知 BB 已发生后,样本空间缩小到 BB:

P(A∣B)=P(AB)P(B),P(B)>0.P(A\mid B)=\frac{P(AB)}{P(B)},\qquad P(B)>0.

由此得到乘法公式

P(A1⋯An)=P(A1)P(A2∣A1)⋯P(An∣A1⋯An−1).P(A_1\cdots A_n) =P(A_1)P(A_2\mid A_1)\cdots P(A_n\mid A_1\cdots A_{n-1}).

若 B1,…,BnB_1,\ldots,B_n 构成样本空间的一个划分,则

P(A)=∑i=1nP(Bi)P(A∣Bi),P(A)=\sum_{i=1}^nP(B_i)P(A\mid B_i), P(Bj∣A)=P(Bj)P(A∣Bj)∑iP(Bi)P(A∣Bi).P(B_j\mid A)= \frac{P(B_j)P(A\mid B_j)} {\sum_iP(B_i)P(A\mid B_i)}.

一句人话:全概率是“按来源拆开算结果”,Bayes 是“看到结果后倒推来源”。做 Bayes 题时先画“来源 →\to 观测”的树,分母就是所有能产生该观测的路径之和。

独立的定义是

P(AB)=P(A)P(B).P(AB)=P(A)P(B).

它比互不相容完全不同:两个正概率事件若互不相容,就不可能独立。两两独立也不推出相互独立;三个事件相互独立还要满足 P(ABC)=P(A)P(B)P(C)P(ABC)=P(A)P(B)P(C)。

四、一维分布:CDF 是统一语言

随机变量把样本点映成实数。无论离散、连续还是混合分布,都有分布函数

FX(x)=P(X≤x).F_X(x)=P(X\le x).

FXF_X 单调不减、右连续,并且从 00 走到 11。离散型由概率质量函数 pk=P(X=xk)p_k=P(X=x_k) 描述;连续型由密度 fXf_X 描述:

FX(x)=∫−∞xfX(t) dt.F_X(x)=\int_{-\infty}^x f_X(t)\,dt.

连续型中 P(X=x)=0P(X=x)=0,所以端点开闭不影响区间概率;离散型中端点往往会改变答案。密度值 fX(x)f_X(x) 可以大于 11,但积分必须为 11。

期望、方差与矩

期望是按概率加权的平均:

E(X)=∑kxkpk或E(X)=∫−∞∞xfX(x) dx.E(X)=\sum_kx_kp_k \quad\text{或}\quad E(X)=\int_{-\infty}^{\infty}xf_X(x)\,dx.

计算函数期望不必先求函数的分布:

E[g(X)]=∑kg(xk)pk或E[g(X)]=∫g(x)fX(x) dx.E[g(X)]=\sum_kg(x_k)p_k \quad\text{或}\quad E[g(X)]=\int g(x)f_X(x)\,dx.

方差的两种写法要能随时切换:

Var⁡(X)=E[(X−EX)2]=E(X2)−[E(X)]2.\operatorname{Var}(X) =E[(X-E X)^2] =E(X^2)-[E(X)]^2.

并且

E(aX+b)=aE(X)+b,Var⁡(aX+b)=a2Var⁡(X).E(aX+b)=aE(X)+b, \qquad \operatorname{Var}(aX+b)=a^2\operatorname{Var}(X).

矩、变异系数、分位数、中位数、偏度和峰度都在从不同方向概括分布。Markov 与 Chebyshev 不要求知道完整分布:

P(X≥a)≤EXa(X≥0),P(X\ge a)\le \frac{E X}{a}\quad(X\ge0), P(∣X−EX∣≥ε)≤Var⁡(X)ε2.P(|X-E X|\ge\varepsilon) \le\frac{\operatorname{Var}(X)}{\varepsilon^2}.

五、常用分布:先认模型,再背参数

我在这里统一采用以下参数化。

分布支持集与参数期望方差
Bernoulli(p)(p)0,10,1ppp(1−p)p(1-p)
B(n,p)B(n,p)0,…,n0,\ldots,nnpnpnp(1−p)np(1-p)
P(λ)P(\lambda)0,1,…0,1,\ldotsλ\lambdaλ\lambda
Ge(p)Ge(p)首次成功的次数 1,2,…1,2,\ldots1/p1/p(1−p)/p2(1-p)/p^2
H(N,M,n)H(N,M,n)NN 件中 MM 件成功,不放回抽 nn 件nM/NnM/NnMN(1−MN)N−nN−1n\frac MN(1-\frac MN)\frac{N-n}{N-1}
U(a,b)U(a,b)a<x<ba<x<b(a+b)/2(a+b)/2(b−a)2/12(b-a)^2/12
Exp(λ)Exp(\lambda)率参数 λ\lambda1/λ1/\lambda1/λ21/\lambda^2
Ga(α,λ)Ga(\alpha,\lambda)形状 α\alpha、率 λ\lambdaα/λ\alpha/\lambdaα/λ2\alpha/\lambda^2
Be(a,b)Be(a,b)0<x<10<x<1a/(a+b)a/(a+b)ab/[(a+b)2(a+b+1)]ab/[(a+b)^2(a+b+1)]
N(μ,σ2)N(\mu,\sigma^2)均值、方差μ\muσ2\sigma^2

二项是固定次数中成功的个数;几何是等到第一次成功用了几次;负二项是等到第 rr 次成功用了几次;泊松描述单位区间的稀有事件计数;指数描述 Poisson 过程中下一次事件的等待时间;Gamma 描述等到第若干次事件的总等待时间。几何与指数都有无记忆性。

正态变量标准化:

X∼N(μ,σ2)⟹Z=X−μσ∼N(0,1).X\sim N(\mu,\sigma^2) \quad\Longrightarrow\quad Z=\frac{X-\mu}{\sigma}\sim N(0,1).

六、变量变换:先写值域

若 Y=g(X)Y=g(X) 为离散型,把所有映到同一 yy 的概率相加。连续型最稳妥的是先求

FY(y)=P(g(X)≤y),F_Y(y)=P(g(X)\le y),

再对 yy 求导。若 gg 单调、反函数为 x=h(y)x=h(y),则

fY(y)=fX(h(y))∣h′(y)∣.f_Y(y)=f_X(h(y))|h'(y)|.

不单调时必须把所有反函数分支相加。例如 Y=X2Y=X^2 对 y>0y>0 有两条分支:

fY(y)=fX(y)+fX(−y)2y.f_Y(y)=\frac{f_X(\sqrt y)+f_X(-\sqrt y)}{2\sqrt y}.

一个重要结论是:若 FXF_X 连续且严格单调,则 FX(X)∼U(0,1)F_X(X)\sim U(0,1)。它既能证明分布结论,也解释了如何由均匀随机数生成其他分布。

七、二维分布:先画支持域,再积分

联合分布函数为

FX,Y(x,y)=P(X≤x,Y≤y).F_{X,Y}(x,y)=P(X\le x,Y\le y).

连续型的边际密度由联合密度积分得到:

fX(x)=∫−∞∞fX,Y(x,y) dy,fY(y)=∫−∞∞fX,Y(x,y) dx.f_X(x)=\int_{-\infty}^{\infty}f_{X,Y}(x,y)\,dy, \qquad f_Y(y)=\int_{-\infty}^{\infty}f_{X,Y}(x,y)\,dx.

若且唯若联合分布能拆成边际分布乘积,X,YX,Y 才独立。二维正态中 ρ=0\rho=0 等价于独立,但一般分布里“不相关”只说明协方差为零,不能推出独立。

和、极值与二维变换

独立连续变量的和用卷积:

fX+Y(z)=∫−∞∞fX(x)fY(z−x) dx.f_{X+Y}(z)=\int_{-\infty}^{\infty}f_X(x)f_Y(z-x)\,dx.

独立变量的最大值、最小值分别满足

Fmax⁡(z)=FX(z)FY(z),F_{\max}(z)=F_X(z)F_Y(z), P(min⁡>z)=[1−FX(z)][1−FY(z)].P(\min>z)=[1-F_X(z)][1-F_Y(z)].

二维变换 (U,V)=T(X,Y)(U,V)=T(X,Y) 的固定流程是:求值域,解反变换,算 Jacobian,再把所有反解分支相加:

fU,V(u,v)=fX,Y(x(u,v),y(u,v))∣∂(x,y)∂(u,v)∣.f_{U,V}(u,v)=f_{X,Y}(x(u,v),y(u,v)) \left|\frac{\partial(x,y)}{\partial(u,v)}\right|.

八、协方差、相关与条件期望

Cov⁡(X,Y)=E(XY)−E(X)E(Y),\operatorname{Cov}(X,Y)=E(XY)-E(X)E(Y), ρXY=Cov⁡(X,Y)σXσY.\rho_{XY}=\frac{\operatorname{Cov}(X,Y)}{\sigma_X\sigma_Y}.

计算线性组合方差时别漏协方差:

Var⁡(aX+bY)=a2Var⁡(X)+b2Var⁡(Y)+2abCov⁡(X,Y).\operatorname{Var}(aX+bY) =a^2\operatorname{Var}(X)+b^2\operatorname{Var}(Y) +2ab\operatorname{Cov}(X,Y).

条件密度是“固定一个变量后重新归一化”:

fX∣Y(x∣y)=fX,Y(x,y)fY(y).f_{X\mid Y}(x\mid y)=\frac{f_{X,Y}(x,y)}{f_Y(y)}.

条件期望 E(X∣Y)E(X\mid Y) 是 YY 的函数,塔式法则为

E[E(X∣Y)]=E(X).E[E(X\mid Y)]=E(X).

随机和 SN=X1+⋯+XNS_N=X_1+\cdots+X_N 在 NN 与 XiX_i 独立时满足

E(SN)=E(N)E(X1),E(S_N)=E(N)E(X_1), Var⁡(SN)=E(N)Var⁡(X1)+Var⁡(N)[E(X1)]2.\operatorname{Var}(S_N) =E(N)\operatorname{Var}(X_1) +\operatorname{Var}(N)[E(X_1)]^2.

九、收敛、特征函数、大数定律与中心极限定理

依概率收敛写作 Xn→PXX_n\xrightarrow{P}X,意思是任意固定误差外的概率趋于零。依分布收敛写作 Xn→dXX_n\xrightarrow{d}X,意思是分布函数在极限分布的连续点收敛。依概率收敛推出依分布收敛;极限为常数时,二者等价。

特征函数

φX(t)=E(eitX)\varphi_X(t)=E(e^{itX})

总是存在。独立和对应特征函数相乘:

φX+Y(t)=φX(t)φY(t).\varphi_{X+Y}(t)=\varphi_X(t)\varphi_Y(t).

它唯一决定分布,并能用导数求矩:φX(k)(0)=ikE(Xk)\varphi_X^{(k)}(0)=i^kE(X^k)。因此证明 Poisson、二项或 Gamma 的可加性时,特征函数常比卷积省事。

大数定律说样本均值靠近总体均值:在独立同分布且 E∣X1∣<∞E|X_1|<\infty 时,

Xˉn→PE(X1).\bar X_n\xrightarrow{P}E(X_1).

中心极限定理则给出误差的形状。若 XiX_i 独立同分布,均值 μ\mu、方差 0<σ2<∞0<\sigma^2<\infty,则

∑i=1nXi−nμσn→dN(0,1).\frac{\sum_{i=1}^nX_i-n\mu}{\sigma\sqrt n} \xrightarrow{d}N(0,1).

二项分布正态近似时,X∼B(n,p)X\sim B(n,p) 可近似为 N(np,np(1−p))N(np,np(1-p)),离散到连续要做连续性修正:

P(a≤X≤b)≈P(a−0.5<Y<b+0.5).P(a\le X\le b) \approx P(a-0.5<Y<b+0.5).

课件还给出独立但不同分布变量的 Lindeberg 与 Lyapunov 条件;它们的作用都是排除“某一项独自支配总和”,从而仍可得到正态极限。

十、考试中的固定计算路线

Bayes 题

  1. 列所有来源 BiB_i 的先验概率。
  2. 写每个来源产生观测 AA 的条件概率。
  3. 用全概率求 P(A)P(A)。
  4. 用 P(Bj∣A)=P(Bj)P(A∣Bj)/P(A)P(B_j\mid A)=P(B_j)P(A\mid B_j)/P(A)。

一维变量变换

  1. 先求 YY 的值域。
  2. 单调时用反函数;不单调时用 CDF 法或列出全部分支。
  3. 检查新密度非负且积分为 11。

二维联合密度

  1. 画支持域并确定积分上下限。
  2. 归一化求常数。
  3. 积掉另一个变量求边际。
  4. 比较 fX,Yf_{X,Y} 与 fXfYf_Xf_Y 判断独立。
  5. 期望直接对联合密度积分,别绕远路。

二维变量变换

  1. 写反变换和新变量值域。
  2. 算绝对 Jacobian。
  3. 若反变换不唯一,分支密度相加。
  4. 若联合密度能拆成两个边际密度,才宣布独立。

正态近似

  1. 写总和的均值和方差。
  2. 标准化为 ZZ。
  3. 二项计数先做 ±0.5\pm0.5 连续性修正。
  4. 最后查 Φ\Phi,注意题目要左尾、右尾还是双尾。

十一、最容易丢分的十件事

  1. 把 P(AB)=0P(AB)=0 当成独立;正概率下它恰好说明不独立。
  2. 把 fX(x)f_X(x) 当作 P(X=x)P(X=x);连续变量单点概率为零。
  3. 忘记 CDF 是右连续,离散端点随意改成开区间。
  4. 把 Exp(λ)Exp(\lambda) 的 λ\lambda 当均值;我在这里使用率参数,均值是 1/λ1/\lambda。
  5. 求 Y=g(X)Y=g(X) 时没写值域,导致密度在错误区间非零。
  6. 非单调变换只保留一个反函数分支。
  7. 看到联合密度就默认 X,YX,Y 独立。
  8. 把“相关系数为零”写成“独立”,二维正态之外一般不成立。
  9. 线性组合方差漏掉 2abCov⁡(X,Y)2ab\operatorname{Cov}(X,Y)。
  10. 用中心极限定理近似离散计数时忘记连续性修正,或标准化分母写成方差而不是标准差。

如果时间很紧,优先掌握 Bayes、常用分布、变量变换、联合密度、条件期望和正态近似;再用真题检查自己是否能在没有提示时选对路线。

评论