做概率题时,最稳的顺序是:先把随机现象翻译成事件,再把事件翻译成分布,最后从分布计算关心的量。 公式很多,但都应该放回这三步里理解。
复习顺序如下:
事件与概率⟶一维随机变量⟶随机向量⟶随机变量序列的极限.
前两章回答“一次随机试验会怎样”;第三章研究几个随机量怎样一起变化;第四章解释重复很多次后为什么会出现稳定频率和正态分布。下面按做题顺序重建这条线。
一、先认清题目给了什么
看到题目,先给信息分类。
- 给事件及其概率:用集合运算、条件概率、全概率或 Bayes。
- 给概率质量函数、密度或分布函数:先写支持集,再求概率、期望、方差。
- 给 Y=g(X):离散型合并同值,连续型优先用分布函数法或变量变换。
- 给 (X,Y) 的联合分布:先画支持域,再积分或求和;不能默认独立。
- 给很多独立同分布变量之和:先问能否直接认分布,再考虑大数定律或中心极限定理。
最常见的低级错误不是算错积分,而是漏掉支持集、把密度当概率、或者没验证独立就把联合分布拆成乘积。
二、事件与概率:从集合开始
样本空间记作 Ω,事件是 Ω 的子集。并、交、差、补分别对应“至少一个发生”“同时发生”“前者发生而后者不发生”“没有发生”。De Morgan 公式必须熟:
A∪B=Aˉ∩Bˉ,A∩B=Aˉ∪Bˉ.
概率由非负性、规范性和可列可加性定义。直接可用的结论包括
P(A∪B)=P(A)+P(B)−P(AB),
以及容斥公式、单调性和连续性。遇到“至少一次”通常先算补集:
P(至少一次成功)=1−P(一次也没成功).
古典概型的核心是等可能:
P(A)=∣Ω∣∣A∣.
放回抽样通常出现二项分布;不放回抽样通常出现超几何分布。若样本点连续且按长度、面积或体积均匀,改用几何概型。频率方法、主观概率、Buffon 投针和 Bertrand 悖论的共同提醒是:“概率是多少”必须连同随机试验怎样定义一起说。
三、条件概率、全概率与 Bayes
已知 B 已发生后,样本空间缩小到 B:
P(A∣B)=P(B)P(AB),P(B)>0.
由此得到乘法公式
P(A1⋯An)=P(A1)P(A2∣A1)⋯P(An∣A1⋯An−1).
若 B1,…,Bn 构成样本空间的一个划分,则
P(A)=i=1∑nP(Bi)P(A∣Bi),
P(Bj∣A)=∑iP(Bi)P(A∣Bi)P(Bj)P(A∣Bj).
一句人话:全概率是“按来源拆开算结果”,Bayes 是“看到结果后倒推来源”。做 Bayes 题时先画“来源 → 观测”的树,分母就是所有能产生该观测的路径之和。
独立的定义是
P(AB)=P(A)P(B).
它比互不相容完全不同:两个正概率事件若互不相容,就不可能独立。两两独立也不推出相互独立;三个事件相互独立还要满足 P(ABC)=P(A)P(B)P(C)。
四、一维分布:CDF 是统一语言
随机变量把样本点映成实数。无论离散、连续还是混合分布,都有分布函数
FX(x)=P(X≤x).
FX 单调不减、右连续,并且从 0 走到 1。离散型由概率质量函数 pk=P(X=xk) 描述;连续型由密度 fX 描述:
FX(x)=∫−∞xfX(t)dt.
连续型中 P(X=x)=0,所以端点开闭不影响区间概率;离散型中端点往往会改变答案。密度值 fX(x) 可以大于 1,但积分必须为 1。
期望、方差与矩
期望是按概率加权的平均:
E(X)=k∑xkpk或E(X)=∫−∞∞xfX(x)dx.
计算函数期望不必先求函数的分布:
E[g(X)]=k∑g(xk)pk或E[g(X)]=∫g(x)fX(x)dx.
方差的两种写法要能随时切换:
Var(X)=E[(X−EX)2]=E(X2)−[E(X)]2.
并且
E(aX+b)=aE(X)+b,Var(aX+b)=a2Var(X).
矩、变异系数、分位数、中位数、偏度和峰度都在从不同方向概括分布。Markov 与 Chebyshev 不要求知道完整分布:
P(X≥a)≤aEX(X≥0),
P(∣X−EX∣≥ε)≤ε2Var(X).
五、常用分布:先认模型,再背参数
我在这里统一采用以下参数化。
| 分布 | 支持集与参数 | 期望 | 方差 |
|---|
| Bernoulli(p) | 0,1 | p | p(1−p) |
| B(n,p) | 0,…,n | np | np(1−p) |
| P(λ) | 0,1,… | λ | λ |
| Ge(p) | 首次成功的次数 1,2,… | 1/p | (1−p)/p2 |
| H(N,M,n) | N 件中 M 件成功,不放回抽 n 件 | nM/N | nNM(1−NM)N−1N−n |
| U(a,b) | a<x<b | (a+b)/2 | (b−a)2/12 |
| Exp(λ) | 率参数 λ | 1/λ | 1/λ2 |
| Ga(α,λ) | 形状 α、率 λ | α/λ | α/λ2 |
| Be(a,b) | 0<x<1 | a/(a+b) | ab/[(a+b)2(a+b+1)] |
| N(μ,σ2) | 均值、方差 | μ | σ2 |
二项是固定次数中成功的个数;几何是等到第一次成功用了几次;负二项是等到第 r 次成功用了几次;泊松描述单位区间的稀有事件计数;指数描述 Poisson 过程中下一次事件的等待时间;Gamma 描述等到第若干次事件的总等待时间。几何与指数都有无记忆性。
正态变量标准化:
X∼N(μ,σ2)⟹Z=σX−μ∼N(0,1).
六、变量变换:先写值域
若 Y=g(X) 为离散型,把所有映到同一 y 的概率相加。连续型最稳妥的是先求
FY(y)=P(g(X)≤y),
再对 y 求导。若 g 单调、反函数为 x=h(y),则
fY(y)=fX(h(y))∣h′(y)∣.
不单调时必须把所有反函数分支相加。例如 Y=X2 对 y>0 有两条分支:
fY(y)=2yfX(y)+fX(−y).
一个重要结论是:若 FX 连续且严格单调,则 FX(X)∼U(0,1)。它既能证明分布结论,也解释了如何由均匀随机数生成其他分布。
七、二维分布:先画支持域,再积分
联合分布函数为
FX,Y(x,y)=P(X≤x,Y≤y).
连续型的边际密度由联合密度积分得到:
fX(x)=∫−∞∞fX,Y(x,y)dy,fY(y)=∫−∞∞fX,Y(x,y)dx.
若且唯若联合分布能拆成边际分布乘积,X,Y 才独立。二维正态中 ρ=0 等价于独立,但一般分布里“不相关”只说明协方差为零,不能推出独立。
和、极值与二维变换
独立连续变量的和用卷积:
fX+Y(z)=∫−∞∞fX(x)fY(z−x)dx.
独立变量的最大值、最小值分别满足
Fmax(z)=FX(z)FY(z),
P(min>z)=[1−FX(z)][1−FY(z)].
二维变换 (U,V)=T(X,Y) 的固定流程是:求值域,解反变换,算 Jacobian,再把所有反解分支相加:
fU,V(u,v)=fX,Y(x(u,v),y(u,v))∂(u,v)∂(x,y).
八、协方差、相关与条件期望
Cov(X,Y)=E(XY)−E(X)E(Y),
ρXY=σXσYCov(X,Y).
计算线性组合方差时别漏协方差:
Var(aX+bY)=a2Var(X)+b2Var(Y)+2abCov(X,Y).
条件密度是“固定一个变量后重新归一化”:
fX∣Y(x∣y)=fY(y)fX,Y(x,y).
条件期望 E(X∣Y) 是 Y 的函数,塔式法则为
E[E(X∣Y)]=E(X).
随机和 SN=X1+⋯+XN 在 N 与 Xi 独立时满足
E(SN)=E(N)E(X1),
Var(SN)=E(N)Var(X1)+Var(N)[E(X1)]2.
九、收敛、特征函数、大数定律与中心极限定理
依概率收敛写作 XnPX,意思是任意固定误差外的概率趋于零。依分布收敛写作 XndX,意思是分布函数在极限分布的连续点收敛。依概率收敛推出依分布收敛;极限为常数时,二者等价。
特征函数
φX(t)=E(eitX)
总是存在。独立和对应特征函数相乘:
φX+Y(t)=φX(t)φY(t).
它唯一决定分布,并能用导数求矩:φX(k)(0)=ikE(Xk)。因此证明 Poisson、二项或 Gamma 的可加性时,特征函数常比卷积省事。
大数定律说样本均值靠近总体均值:在独立同分布且 E∣X1∣<∞ 时,
XˉnPE(X1).
中心极限定理则给出误差的形状。若 Xi 独立同分布,均值 μ、方差 0<σ2<∞,则
σn∑i=1nXi−nμdN(0,1).
二项分布正态近似时,X∼B(n,p) 可近似为 N(np,np(1−p)),离散到连续要做连续性修正:
P(a≤X≤b)≈P(a−0.5<Y<b+0.5).
课件还给出独立但不同分布变量的 Lindeberg 与 Lyapunov 条件;它们的作用都是排除“某一项独自支配总和”,从而仍可得到正态极限。
十、考试中的固定计算路线
Bayes 题
- 列所有来源 Bi 的先验概率。
- 写每个来源产生观测 A 的条件概率。
- 用全概率求 P(A)。
- 用 P(Bj∣A)=P(Bj)P(A∣Bj)/P(A)。
一维变量变换
- 先求 Y 的值域。
- 单调时用反函数;不单调时用 CDF 法或列出全部分支。
- 检查新密度非负且积分为 1。
二维联合密度
- 画支持域并确定积分上下限。
- 归一化求常数。
- 积掉另一个变量求边际。
- 比较 fX,Y 与 fXfY 判断独立。
- 期望直接对联合密度积分,别绕远路。
二维变量变换
- 写反变换和新变量值域。
- 算绝对 Jacobian。
- 若反变换不唯一,分支密度相加。
- 若联合密度能拆成两个边际密度,才宣布独立。
正态近似
- 写总和的均值和方差。
- 标准化为 Z。
- 二项计数先做 ±0.5 连续性修正。
- 最后查 Φ,注意题目要左尾、右尾还是双尾。
十一、最容易丢分的十件事
- 把 P(AB)=0 当成独立;正概率下它恰好说明不独立。
- 把 fX(x) 当作 P(X=x);连续变量单点概率为零。
- 忘记 CDF 是右连续,离散端点随意改成开区间。
- 把 Exp(λ) 的 λ 当均值;我在这里使用率参数,均值是 1/λ。
- 求 Y=g(X) 时没写值域,导致密度在错误区间非零。
- 非单调变换只保留一个反函数分支。
- 看到联合密度就默认 X,Y 独立。
- 把“相关系数为零”写成“独立”,二维正态之外一般不成立。
- 线性组合方差漏掉 2abCov(X,Y)。
- 用中心极限定理近似离散计数时忘记连续性修正,或标准化分母写成方差而不是标准差。
如果时间很紧,优先掌握 Bayes、常用分布、变量变换、联合密度、条件期望和正态近似;再用真题检查自己是否能在没有提示时选对路线。