绪论 · 机器学习概览与研究进展
传统程序把规则直接写进代码:输入满足什么条件,就执行什么动作。机器学习换了一种分工:人不再穷举全部规则,而是给出任务、数据和评价标准,让系统从经验中形成可复用的模型。
课件引用 H. A. Simon 的观点:学习是系统对环境产生适应性变化,使它再次遇到相同情形时能更有效地行动。R. S. Michalski 则从表示角度强调,学习是在构造或修改对经历事物的表示。
两种说法合起来,机器学习关心的就是:
系统怎样把经验压缩成一种表示,并让这种表示改善未来任务的表现。
一、用任务、经验和性能定义学习
课件给出一个非常实用的判定方式。对算法 ,若它执行任务 时,随着经验 增加,性能度量 得到改善,就说 从经验 中学习。
这三个字母能阻止许多含糊讨论:
| 场景 | 任务 | 性能 | 经验 |
|---|---|---|---|
| 房屋判断 | 根据房屋属性预测价格或类别 | 均方误差、正确率 | 已知属性与结果的房屋样本 |
| 自动驾驶 | 根据道路状态作出驾驶决策 | 无差错里程比例等 | 人类驾驶录像、控制指令与交互数据 |
| 围棋 | 从局面选择落子 | 胜率 | 专家棋谱与自我对弈 |
只说“让模型更智能”还不是完整学习问题。必须说明它要完成什么任务、看过什么经验,以及用什么量判断真的变好了。
二、机器学习与人工智能的关系
人工智能希望系统具有感知、推理、规划、决策和行动能力。机器学习提供从数据与交互中获得这些能力的方法,因此处在人工智能研究的核心位置。
一个完全没有学习和发现能力的系统,很难在开放环境里持续适应。机器学习也并不等于整个人工智能:规划、搜索、知识表示和推理仍然有各自的问题,只是越来越多系统会把它们与学习结合起来。
课件列出的应用横跨多个方向:
- 数据挖掘、文本分析与搜索引擎;
- 语音识别、目标识别与智能感知;
- 控制学习与机器人;
- 面向科学研究的 AI for Science;
- 从蛋白质折叠等任务中学习复杂规律。
从学习对象看,还可以把任务细分为分类、关系发现、时序建模、程序与规划、事实推断、语言、感知、个性化建议和情景记忆。这些应用表面差异很大,底层却都需要从有限观测中估计某种未知依赖关系。
三、一个学习系统到底在做什么
把监督学习先抽象成最小框架:
-
输入空间为 ;
-
输出空间为 ;
-
训练集为
-
假设空间为
-
学习算法从 中选出一个模型 。
通常可以写成
其中 衡量预测误差, 表达对模型复杂度或参数的约束。这个式子已经包含四个核心选择:
- 用什么特征表示状态;
- 允许什么形式的模型;
- 怎样评价模型在样本上的好坏;
- 用什么优化算法找到较好的参数。
学习也可以被看作假设空间搜索:训练样本提供证据,优化算法在候选假设中寻找与样本匹配、又有希望推广到新数据的模型。
四、线性价值函数展示最小学习闭环
课件用一个线性价值函数说明模型如何从样本更新:
每个训练样本给出
平方误差为
逐样本的 LMS 更新可以写成
若预测偏低,括号为正,参数沿当前特征方向增大;若预测偏高,则反向调整。这个小闭环已经具备现代模型训练的基本结构:前向计算、比较目标、得到误差、沿梯度更新。
五、模型记住训练集还不够
训练样本来自某个分布,而未来任务也有自己的分布。若二者不匹配,或者模型只记住训练集中的偶然细节,即使训练误差为零也可能表现很差。
泛化能力就是模型把样本中学到的规律推广到新数据的能力。它引出三个基本问题:
- 给定有限样本,模型的真实错误可以有多大;
- 需要多少样本,才足以把不可靠的假设排除;
- 模型容量、样本规模与泛化之间怎样平衡。
课件把泛化理论的演进概括为:从大样本极限下“以概率 成立”的渐近讨论,走向有限样本下“以至少 的概率、误差不超过 ”的 PAC 描述,再到 VC 维和最大间隔等可以影响算法设计的容量刻画。
最大间隔方法给出了特别直观的设计方向:在样本可分且间隔 时,其他条件相同,间隔越大,泛化误差上界越小。它不只解释现有模型,还直接告诉算法应该优化什么。
这也是本课程为什么不只讲“怎样拟合”,还会讲概率不等式、PAC、VC 维、正则化和支持向量机。
六、主要学习范式
“机器学习”不是单一算法,而是许多不同反馈条件下的问题族。
监督学习
每个样本带有目标值。分类预测离散类别,回归预测连续数值。线性回归、决策树、神经网络和支持向量机都可以在这个框架下训练。
无监督学习
样本没有标签,目标是发现数据中的结构,例如聚类、低维表示或概率分布。它回答的不是“标签是什么”,而是“数据内部怎样组织”。
半监督学习
只有少量样本带标签,大量样本没有标签。课件以医学影像为例:医生不可能把每张影像的每个病灶都完整标注,问题是怎样让未标记数据也帮助建模。
强化学习
智能体与变化的环境交互,根据延迟奖励学习行动策略。它最初常用于机器人规划、避障与环境适应,后来也用于围棋、推荐和搜索等需要连续决策的问题。
主动学习与交互学习
学习器不只是被动接收样本,而是选择最值得询问的样本或与环境交互,以更少标注获得更多信息。
这些范式并不互斥。AlphaGo 就同时使用专家棋谱的监督学习、基于自我对弈的强化学习和搜索。
七、从“主义竞争”到多种方法协作
课件用研究变迁说明,机器学习经历过按思想路线划分阵营的阶段:
- 符号主义强调规则、逻辑与可读表示,典型方向包括归纳逻辑程序设计;
- 连接主义用大量简单计算单元及其连接表示知识,神经网络是代表;
- 行为与强化路线强调系统根据反馈适应环境;
- 统计学习从数据分布、函数空间和泛化界出发设计模型。
20 世纪 80 年代,R. S. Michalski 等人的《机器学习:通往人工智能的途径》出版,《Machine Learning》期刊创刊。到 90 年代,统计学习与支持向量机成为重要路线。
课件也用两次图灵奖展示机器学习的两端:Leslie Valiant 因计算学习理论等工作获得 2010 年图灵奖;Geoffrey Hinton、Yoshua Bengio 与 Yann LeCun 则因深度神经网络方面的贡献共同获得图灵奖,课件以 2019 年的颁奖消息呈现这件事。
当时还存在一条依赖大量背景知识的“分析学习”路线,包括类比与解释等问题。课件认为,在表示和学习所需的新理论基础尚不成熟时,它逐渐淡出主流视野。这也说明研究路线的变化不只是算法胜负,还受可用知识、表示方式与计算条件约束。
研究后来逐渐从“哪一种主义统一天下”,转向“什么方法适合当前问题”。现实任务同时要求表示、泛化、优化、可扩展计算和领域知识,很少有单一范式包办全部环节。
八、统计学习革命带来了什么
课件把 20 世纪 60 至 80 年代的统计学习变化归纳为四类基础:
- Tikhonov、Ivanov、Phillips 等发展的正则化原则,用于处理不适定问题;
- Parzen、Rosenblatt 等推动的非参数统计;
- Vapnik、Chervonenkis 关于泛函空间大数定律及其与学习过程的联系;
- Kolmogorov、Solomonoff、Chaitin 等关于算法复杂性与归纳推理的研究。
传统统计推断常要求较强的分布先验。统计学习提出更数据驱动的问题:只知道未知函数所属函数集的一般性质时,能否从观测估计依赖关系?
由此形成三层研究目标:
- 什么条件下可以估计未知依赖关系;
- 什么原则能得到较好的估计;
- 怎样把原则变成有效算法。
这三层分别对应可学习理论、学习准则与优化实现。
九、表示问题:把非线性变成可处理的形式
课件把统计学习的重点压缩为两个词:表示与泛化。
非线性问题往往计算困难。一个常用策略不是直接硬解,而是寻找映射
使原空间中的非线性关系,在特征空间 中变得线性。
XOR 例子
异或在原始二维输入 上不能由一条直线分开。课件给出映射
在新特征中,判别函数可以写为
对四种输入:
| XOR | |||
|---|---|---|---|
只需用阈值 就能线性区分两类。真正发挥作用的是新特征 。
核方法与分段线性
课件列出两条主要路线:
- 在 Hilbert 特征空间中进行整体线性表示,核函数允许算法不显式写出高维映射;
- 用多个局部模型或弱分类器形成类似分段线性的整体决策。
显式选择多项式基、三角函数基会遇到维数灾难。核方法把特征空间中的内积改写成样本空间里的核函数计算,并允许借助领域知识选择相似性。它解决了“怎样算”,但“选择什么核”仍然是模型设计问题。
十、集成学习为什么有效
集成学习把多个模型合成一个更强的模型。课件从四条线索追溯它的来源:
- Hebb 关于神经细胞集合加工信息的思想;
- 把复杂非线性边界分成多个局部片段;
- Widrow 的 Madaline 模型;
- PAC 框架中的弱可学习理论。
Schapire 在相应学习框架中证明,弱可学习与强可学习之间可以通过构造性方法连接。所谓弱分类器,只需比随机猜测稍好;许多弱分类器经过适当组合,可以形成误差很低的强分类器。
这给出了一个重要设计思想:与其强迫单个模型一次解决全部结构,不如让多个互补模型各自处理一部分,再把证据汇总。后续的 AdaBoost、随机森林都会具体实现这条路线。
课件同时提醒,集成方法在实践中非常有效,但“为什么某些组合具有特别好的泛化能力”仍不能只靠一句“人多力量大”解释,模型差异、相关性、间隔与数据分布都可能影响结果。
十一、符号学习与数据分析的不同目标
符号学习不应只被理解为“与统计学习竞争的旧路线”。课件强调,它逐渐转向不同目标:从结构化符号数据中得到简短、可读的规则或描述。
课件回顾的早期线索包括 Solomonoff 在 1959 年提出的文法归纳、Gold 在 1967 年给出的不可学习性结果,以及 Samuel 把学习限制在结构化符号数据上的约简路线。无限制地从任意数据恢复文法并不可行,所以必须通过问题结构和归纳偏置缩小搜索范围。
在一个预先定义的等价关系
下,符号学习可以约简样本集合,寻找无矛盾且较短的规则。规则越短,通常覆盖对象越多,因此信息长度可被用作一种泛化或摘要标准。
但从实值数据映射到符号域,以及在符号域中寻找最小规则或树,都可能是计算困难的,只能使用近似算法。
课件还区分了传统机器学习与面向用户的数据分析:
- 传统学习常假设目标函数固定,数据分析的目标可能随用户需求改变;
- 预测模型可以是黑箱,数据分析结果往往必须可读;
- 传统建模常把例外视为噪声,数据分析可能认为例外比多数规律更值得关注。
在统计学中,不能被模型概括的观察常称为 outlier;在认知或知识发现语境中,有意义的 outlier 可以被称为 exception。删除例外能让规则更简洁,但保留例外也可能揭示新事件或新知识。
十二、应用驱动产生的新问题
课件列出多种由真实任务推动的学习范式。它们常借用传统机器学习方法,但问题结构各不相同。
流形学习
高维表示可能十分稀疏,PCA 只能处理线性低维结构。流形学习尝试利用数据位于低维非线性流形附近这一结构,以分段线性的局部关系恢复更紧凑的表示。
多示例学习
传统监督学习通常是一条样本对应一个描述和一个标签。多示例学习中,一个对象有一组描述,却只知道整组的标签,形成 的关系。模型必须判断哪些实例真正决定了对象性质。
排序学习
信息检索中的需求不总能压成“喜欢”或“不喜欢”。排序学习直接学习对象之间的偏好顺序,为搜索结果和推荐结果建立排名模型。
数据流学习
数据持续高速到来,无法全部保存后再离线训练。学习器必须快速判断当前数据是否有用,并增量更新模型,以适应用户需求或数据分布变化。
深度学习
真实世界的数据复杂度推动大量数学与计算方法进入机器学习。深度模型用多层表示逐级转换输入,减少完全依赖人工特征设计的程度;它并没有取消表示和泛化问题,而是把表示本身也纳入数据驱动优化。
十三、机器学习仍然面对哪些挑战
课件把挑战列得很具体。
泛化
训练集表现好不等于未来数据可靠。理论需要给出误差界,实践需要模型选择、验证与正则化。
训练速度与测试速度
两者常有权衡。K 近邻训练几乎只保存数据,但预测时要与大量样本比较;神经网络训练昂贵,训练完成后一次前向计算却相对直接。
可解释性
不仅要问“预测是什么”,还要问模型学到了什么、为何这样判断。深层网络的黑箱性质使这个问题更突出。
未标记数据与坏数据
遥感、网页和其他系统产生大量未标记数据;噪声污染、属性缺失和相互不一致的数据也很常见。简单丢弃会损失信息,半监督和无监督方法尝试更充分地利用它们。
代价敏感
所有错误不一定代价相同。漏警与虚警虽然都计为一次错误,业务后果却可能完全不同。目标不应只追求最低平均错误率,还要让决策符合实际收益与风险。
高维、结构与领域知识
成千上万个属性会带来统计和计算困难;图、序列、树等结构数据包含普通向量没有表达的关系;特定领域的先验知识又可能显著改善学习器。如何把知识内嵌到模型中,是通用方法与领域最优之间的桥梁。
课件把集成学习、知识内嵌与因果学习列为重要趋势。它们分别尝试组合多个模型、利用领域结构,以及从相关性进一步走向干预与因果机制。
十四、怎样进入机器学习研究共同体
课件列出的代表性期刊包括:
- Artificial Intelligence;
- Journal of Machine Learning Research;
- IEEE Transactions on Pattern Analysis and Machine Intelligence;
- International Journal of Computer Vision。
代表性会议包括 AAAI、COLT、ICML、IJCAI、NeurIPS,以及面向计算机视觉的 CVPR、ICCV、ECCV。课件也列举了 MIT、CMU、Toronto、INRIA 等长期参与相关研究的机构。
这份清单的价值不是背缩写,而是区分研究侧重点:COLT 更偏学习理论,ICML 与 NeurIPS 覆盖广泛机器学习,CVPR、ICCV、ECCV 更聚焦视觉问题。
十五、本课程的内容地图
课件把后续内容分成两条相互连接的路线。
第一条是传统机器学习与理论基础:
- 常用概率不等式、PAC 与 VC 维;
- 贝叶斯学习、HMM 与 EM;
- 决策树与归纳学习;
- 线性判别、神经网络、支持向量机;
- AdaBoost、随机森林、PCA 与稀疏表示;
- 强化学习与 AlphaGo。
第二条是深度学习:
- 多层感知机、梯度下降与反向传播;
- 卷积、池化与 CNN;
- RNN、LSTM 与序列生成;
- 自动微分、损失函数、检测和分割;
- 优化器、初始化、归一化和网络架构;
- Transformer、BERT 与 Vision Transformer。
课程考核在课件中列为平时大作业 、笔试 。推荐教材为张宝昌等的《机器学习与智能感知》。课件还安排了用梯度下降优化 Beale 函数的作业。课件原文另将“协同梯度下降(CoGradient Descent)”列为自学且不作要求;这不是常见的标准术语,结合上下文疑似指共轭梯度法(Conjugate Gradient),这里保留原文并标出疑点,不把它当作规范名称。
十六、一张自检清单
面对一个新机器学习问题,可以按下面顺序提问:
- 任务 、经验 、性能 分别是什么;
- 训练数据和未来数据来自什么分布,是否匹配;
- 输入怎样表示,假设空间允许哪些函数;
- 监督信号来自标签、奖励、交互还是数据结构本身;
- 目标函数是否真正对应业务代价;
- 用什么算法优化,训练与预测成本怎样;
- 如何控制容量并验证泛化;
- 输出是否需要可解释,例外应当删除还是重点研究。
机器学习不是“把数据丢给模型就会得到智能”。它是一组关于表示、证据、归纳、优化和泛化的选择。后面的每一种算法,都可以放回这张清单中理解。