第一讲 · 模式识别系统与三大流派
我在这一节不展开计算,主要用系统流程和方法分类把后面各章放到同一个框架里。
一、模式识别系统的流水线
一个典型的模式识别系统,从拿到原始信号到给出类别,要走五步:
信息获取 → 预处理 → 特征选择 / 提取 → 分类器设计(训练)→ 分类决策。
也可以概括成 “Perceive + Process + Prediction” 三段:感知环境、学习区分模式、对类别做出合理决策。
整个系统可以分为两个阶段:
- 训练阶段:用样本(带标签或不带标签)把分类器设计 / 学习出来;
- 决策阶段:用训练好的分类器,对新来的样本判类。
二、监督 vs 非监督
这是贯穿全课的第一个分类维度:
- 监督学习:训练样本带标签,既有输入特征 ,又有输出标签 (如贝叶斯分类、SVM);
- 非监督学习:训练样本无标签,只有 ,要自己发现数据结构(如 K 均值聚类)。
二者的区别在于训练数据是否带有标签 。
三、三大方法流派
按“靠什么做判别”,课件将模式识别方法分为三类:
- 基于类条件概率密度 :先估计每类的密度,再套贝叶斯决策。又分两支——
- 参数法:假设密度形式已知(如高斯密度、混合密度),只估参数;
- 非参数法:不假设形式,直接估密度数值(直方图、 近邻、核 / Parzen 窗法)。
- 基于判别函数:直接学一个把特征映射到类别的函数。线性判别(感知机、Fisher、Logistic)、非线性判别、支持向量机都属此类。
- 基于与存储样本的相似度:靠”新样本和哪些已存样本最像”来判类(最近邻思想)。
课程大致按“从概率完全已知,到只有样本”的顺序展开。先讲概率已知时的贝叶斯决策,再讲从样本估计分布或聚类,之后转向 SVM 这类判别式方法以及 PCA 降维。
复习要点
- 模式识别系统五步流水线 + 训练 / 决策两阶段。
- 监督与非监督的判定标准(有无标签 )。
- 三大流派:类条件密度(参数 / 非参数)、判别函数、相似度,能各举一两个代表方法。