这篇只收临场推不出来、做题却要用的东西:要背的结论、固定公式、容易记反的方向、解题套路。能现场推的过程(完整对偶推导、各分布 MLE 求导)不在这里——那些靠理解,这些靠记。考前过一遍,进考场。
一、贝叶斯决策
贝叶斯公式(闭眼能写):
P(ωi∣x)=p(x)p(x∣ωi)P(ωi),p(x)=∑jp(x∣ωj)P(ωj)
最小错误率:选后验最大的类。等价于选 p(x∣ωi)P(ωi) 最大(分母相同可省)。
最小错误率似然比阈值(要背,方向别反):
l(x)=p(x∣ω2)p(x∣ω1)>P(ω1)P(ω2)⟹判 ω1
记法:似然比是「1 比 2」,阈值先验是「2 比 1」,上下颠倒。
最小风险——三步法(做题主流程):
- 算后验 P(ωj∣x);
- 算每个决策的条件风险 R(αi∣x)=∑jλijP(ωj∣x);
- 取风险最小的决策(是 min,不是 max!)。
易错点:损失下标 λij = 真实为 ωj、却判成 αi 的损失。算 R(α1∣x) 时用第一行 λ11,λ12 配后验。
最小风险两类似然比阈值(带损失因子,容易写错):
p(x∣ω2)p(x∣ω1)>P(ω1)P(ω2)⋅λ21−λ11λ12−λ22⟹判 ω1
两者关系(必考简答):0-1 损失(λii=0,λij=1)下,最小风险退化为最小错误率。即最小错误率是最小风险的特例。
结论会反转:同一题,最小错误率判 A、最小风险可能判 B——因为代价不对称(漏诊比误诊贵)。记住”宁可误诊不可漏诊”这个方向。
二、最大似然估计(MLE)
直接背结果(做题不必每次推):
| 分布 | MLE | 备注 |
|---|
| 高斯 μ | μ^=N1∑xi | 样本均值 |
| 高斯 σ2 | σ^2=N1∑(xi−μ^)2 | 分母 N,有偏偏小 |
| 伯努利 | p^=k/N | 频率 |
| 指数 λe−λx | λ^=1/xˉ | 均值倒数 |
| 泊松 | λ^=xˉ | 就是均值 |
| 均匀 U(0,θ) | θ^=maxixi | 不能求导! |
均匀分布陷阱(高频):似然 θ−N 求导无零点。理由背熟:θ−N 递减想要 θ 小,约束 θ≥maxxi,夹逼得 θ^=maxixi。
有偏无偏(必考结论):
- 高斯方差 MLE 有偏、偏小,E[σ^2]=NN−1σ2;
- 无偏修正用 N−1:s2=N−11∑(xi−xˉ)2;
- 原因一句话:用 xˉ 顶替真 μ,消耗 1 个自由度。
多维高斯:μ^ = 样本均值;Σ^=N1∑(xk−μ^)(xk−μ^)T。μ^ 与 Σ 是否已知无关。
三、SVM
±1 标签:tn∈{+1,−1},正确分类 ⟺tny(xn)>0。
基本型(背):
min21∥w∥2s.t.tn(wTxn+b)≥1
间隔 = ∥w∥1;最大化间隔 = 最小化 21∥w∥2。
两个必背关系(对偶求导结果,做题直接用):
w=∑nantnxn,∑nantn=0
KKT 互补松弛(支持向量的判据):
an(tny(xn)−1)=0
- an=0 → 非支持向量(间隔外,没用);
- an>0 → 支持向量,恰在间隔边界 tny(xn)=1。
手算套路(两三个点的题,照走):
- 用 ∑nantn=0 减少未知数;
- 写 w=∑nantnxn;
- 对每个支持向量列 tn(wTxn+b)=1;
- 解方程组得 a,w,b;b 可由支持向量反解(多个取平均)。
软间隔:约束放成 tny(xn)≥1−ξn,目标加 C∑ξn。
- 对偶唯一变化:0≤an≤C(外加 ∑nantn=0);
- C 方向别记反:C 大 → 重罚违规、间隔窄、易过拟合;C 小 → 容忍违规、间隔宽、泛化好;
- 口诀:只有 an=C 的点才越界(0<an<C 恰在边界)。
四、PCA / LDA
协方差矩阵:S=N1∑(xn−xˉ)(xn−xˉ)T。
核心结论:主成分 = S 的最大特征值对应的特征向量;投影后方差 = 该特征值 λ。降到 M 维取前 M 大。
失真度(最小误差视角):J=∑i=M+1Dλi = 丢掉的特征值之和。
2×2 求特征值套路(计算题必用):解 det(S−λI)=0 → 得 λ → 回代 (S−λI)u=0 求特征向量。
PCA 三条局限(简答):假设线性、假设大方差=主成分(高信噪比)、假设近高斯分布。
PCA vs LDA(高频对比):
| PCA | LDA |
|---|
| 目标 | 方差最大、保信息 | 类别分得最开 |
| 标签 | 无监督 | 有监督 |
- LDA = Fisher 判别;准则 JF(w)=wTSwwwTSbw(类间/类内);
- 最优方向背:w∗=Sw−1(m1−m2);
- Sb=(m1−m2)(m1−m2)T,Sw=S1+S2。
五、K 均值
准则函数:J=∑n∑krnk∥xn−μk∥2(硬分配 rnk∈{0,1})。
两步(E/M 对应,必考):
- E 步(分配):每点归最近中心,rnk=1 当 k=argminj∥xn−μj∥2;
- M 步(更新):μk=∑nrnk∑nrnkxn = 该类均值。
与 GMM/EM 关系(高频简答):K 均值 = 硬分配;GMM+EM = 软分配(按概率部分归属)。K 均值是 GMM 的硬分配特例。
肘部法则:J-K 曲线由陡变缓的拐点定 K。
六、零散硬记点(容易问、推不出)
- 三大流派:① 类条件密度(参数法 / 非参数法)② 判别函数(感知机/Fisher/SVM)③ 相似度。
- 非参数估计三件套:直方图、k 近邻、Parzen(核)窗。
- 监督 vs 非监督:有没有标签 y。聚类是非监督。
- 生成式 vs 判别式:生成式建模 p(x∣ω)(贝叶斯);判别式直接学边界(SVM、Logistic)。
- 一致最优 / 贝叶斯错误率:贝叶斯决策逐点条件错误率 P(e∣x)=1−maxiP(ωi∣x) 最小,是错误率理论下界。
CNN 三个理由:局部连接减少参数、权重共享让同一特征可出现在任意位置、下采样降低空间分辨率。
卷积输出尺寸:
Hout=⌊SH+2P−K⌋+1.
转置卷积用于上采样;空洞卷积不显著增加参数却能扩大感受野。
Self-Attention 必背:
Q=XWQ,K=XWK,V=XWV,
Attention(Q,K,V)=softmax(dkQKT)V.
- Query 和 Key 算匹配,权重再对 Value 求和;
- dk 防止点积过大让 softmax 饱和;
- 多头注意力并行学习多种关系;
- Self-Attention 不认识顺序,必须加入位置编码;
- RNN 顺序计算、难并行;Transformer 能并行并直接建立长距离关系。
八、ViT、Swin 与 SAM
ViT 流程:图像切 patch → 展平并线性投影 → 加位置编码与 [CLS] token → Transformer Encoder → 取 [CLS] 分类。
Patch 数量:
N=P2HW.
Swin 四件套:分层结构、Patch Merging、窗口注意力 W-MSA、移位窗口 SW-MSA。固定窗口省计算,移位窗口负责跨窗口通信。
三类分割:
- 语义分割:像素分类,不区分同类实例;
- 实例分割:每个对象单独掩码;
- 全景分割:覆盖整图并区分实例。
SAM 三组件:image encoder(ViT 图像特征)+ prompt encoder(点/框/文字/掩码)+ mask decoder。多掩码输出用于处理提示歧义。
SAM 数据引擎:模型辅助手动 → 半自动 → 全自动;SA-1B 约 1100 万图、11 亿掩码。
九、目标检测
总纲:两阶段先候选框再精修,准但慢;一阶段一次前向直接预测,快但细粒度定位通常较弱。
IoU 与 NMS:
IoU=并集面积交集面积.
NMS = 按类别、按置信度排序 → 留最高分框 → 删除与它 IoU 超阈值的框 → 重复。
R-CNN 演进:
- R-CNN:Selective Search 出约 2000 框,每框单独过 CNN,极慢;
- SPP-Net:整图卷一次,任意尺寸区域变固定长度;
- Fast R-CNN:共享特征 + ROI Pooling + 分类/回归联合训练;
- Faster R-CNN:RPN + Anchor 取代 Selective Search。
RPN:对每个 anchor 做前景/背景二分类 + 粗回归;检测头再做具体类别分类 + 细回归。
指标:
Precision=TP+FPTP,Recall=TP+FNTP.
Precision 看误检,Recall 看漏检;AP 针对单类,mAP 对所有类别求平均。
YOLO v1:7×7 网格,每格 2 框、20 类:
7×7×(2×5+20)=7×7×30.
物体中心落在哪格,哪格负责;confidence =P(Object)×IoU。
YOLO v2 三项改进:高分辨率分类器、Darknet-19 + passthrough 特征融合、多尺度训练。
十、GAN 与 Diffusion
GAN 组成:生成器 G + 判别器 D。
GminDmaxEx∼pdata[logD(x)]+Ez∼pz[log(1−D(G(z)))].
理想收敛时 pg=pdata、D∗(x)=1/2。训练交替更新 D 与 G;主要问题是梯度消失、模式崩溃和双方失衡。
Diffusion:前向固定加噪,反向网络去噪。
xt=1−βtxt−1+βtϵ,
xt=αˉtx0+1−αˉtϵ.
训练时随机抽 t,让 UNet 预测噪声;生成时必须按时间反复去噪。结论:Diffusion 训练稳定、质量和多样性好,但采样慢;GAN 采样快,但训练更不稳定。
十一、对比学习、CLIP 与 PEFT
对比学习:同图不同增强为正样本,其他图为负样本;嵌入空间拉近正样本、推远负样本。InfoNCE 本质是在所有候选中识别正确配对。
CLIP 训练:图像编码器 + 文本编码器;batch 内 N×N 图文相似度矩阵,对角线为正样本,非对角线为负样本。
CLIP zero-shot:类别套入 a photo of a {class} → 编码成文本向量 → 与图像向量算相似度 → 取最大类别。
PEFT 总纲:冻结大模型主体,只训练少量参数。
- Prompt Tuning:训练输入端连续 Soft Prompt;
- Adapter:每层插入下采样—激活—上采样的瓶颈模块;
- LoRA:冻结 W0,只学低秩增量 ΔW=BA,推理前可合并回原权重。
进考场前最后默背:似然比阈值上下别反;最小风险取 min;高斯方差 MLE 分母是 N;SVM 的 C 越大违规越贵;Self-Attention 用 Q/K 匹配后加权 V;Faster R-CNN 的 RPN 出候选框;YOLO 是一阶段;Diffusion 先加噪再去噪;CLIP 靠图文共享空间完成 zero-shot。