监督学习每个样本都有答案,强化学习却只有奖励。智能体选动作后,环境进入新状态;新状态又决定下一次看到的数据。奖励还可能延迟:棋局中某步的好坏,要到很久以后才知道。

先区分规划和强化学习
规划知道环境转移和奖励规则,可以在内部模型里搜索或计算;强化学习通常不知道完整模型,要从实际或模拟交互中估计。二者都在选择行动序列,但信息条件不同。
强化学习的基本对象:状态 s、动作 a、奖励 r、策略 π(a∣s)、价值函数,以及可选的环境模型。
Markov 性、MRP 与 MDP
Markov 性表示:给定当前状态,未来与更早历史条件独立。它不要求世界真的没有历史,而要求“状态”已经包含预测未来所需的信息。
Markov Reward Process 可写成 (S,P,R,γ)。从时刻 t 开始的折扣回报:
Gt=Rt+1+γRt+2+γ2Rt+3+⋯
0≤γ<1 让远期奖励权重逐步降低,并使无限和稳定。状态价值是预期回报:
V(s)=E[Gt∣St=s]
利用 Gt=Rt+1+γGt+1,得到 Bellman 方程:
V(s)=E[Rt+1+γV(St+1)∣St=s]
MDP 再加入动作,写作 (S,A,P,R,γ)。给定策略 π:
Vπ(s)=a∑π(a∣s)Qπ(s,a)
Qπ(s,a)=s′,r∑p(s′,r∣s,a)[r+γVπ(s′)]
最优动作价值满足 Bellman 最优方程:
Q∗(s,a)=s′,r∑p(s′,r∣s,a)[r+γa′maxQ∗(s′,a′)]
已知模型:动态规划
若 p(s′,r∣s,a) 已知,可以反复做完整期望备份。
策略迭代:
- 策略评估:计算当前 Vπ;
- 策略改进:每个状态改选使一步回报加后继价值最大的动作;
- 重复直到策略稳定。
价值迭代把评估和改进压进一次最优备份:
Vk+1(s)=amaxs′,r∑p(s′,r∣s,a)[r+γVk(s′)]
价值估计和策略相互促进的思想称为广义策略迭代。
不知道模型:蒙特卡洛
蒙特卡洛方法跑完一条完整 episode,再用实际回报 Gt 更新访问过的状态或状态—动作对。
- first-visit MC:每个 episode 只用某状态第一次访问后的回报;
- every-visit MC:每次访问都计入平均。
它不需要环境模型,也不自举,但必须等回合结束,回报方差可能很大。为了学习所有动作,需要探索起点,或使用 ε-soft 策略:大部分时间选当前最佳动作,小概率随机探索。
TD:走一步就学一步
TD(0) 使用一步奖励和下一状态的当前估计:
V(St)←V(St)+αδt
δt=Rt+1+γV(St+1)−V(St)
δt 是 TD error。TD 不等 episode 结束,并通过已有估计更新已有估计,这叫 bootstrapping。
| 方法 | 需要模型 | 等完整回合 | 自举 |
|---|
| 动态规划 | 是 | 否 | 是 |
| 蒙特卡洛 | 否 | 是 | 否 |
| TD | 否 | 否 | 是 |
SARSA 与 Q-learning
SARSA 的名字来自更新使用的五元组 (St,At,Rt+1,St+1,At+1):
Q(St,At)←Q(St,At)+α[Rt+1+γQ(St+1,At+1)−Q(St,At)]
它按当前行为策略实际选出的下一动作更新,是 on-policy。若 ε-greedy 还会探索危险动作,这个风险也会进入价值估计。
Q-learning 改用下一状态中的最大值:
Q(St,At)←Q(St,At)+α[Rt+1+γamaxQ(St+1,a)−Q(St,At)]
行为可以继续探索,更新目标却假设下一步采取贪心动作,因此是 off-policy。表格型例子会为每个“网格位置—动作”存一个 Q 值,再通过交互逐步传播终点奖励。
从 Q 表到 DQN
状态很多或连续时,Q 表存不下。DQN 用神经网络 Q(s,a;θ) 近似所有动作价值,并让当前预测靠近 TD 目标:
y=r+γa′maxQ(s′,a′;θ−)
L(θ)=[y−Q(s,a;θ)]2
课件重点是“用网络代替表格”和“构造目标值”。实践中通常让目标参数 θ− 暂时固定,以减少目标随着当前网络同时移动造成的不稳定;这里只保留课件涉及的基本思路,不扩展完整工程算法族。
一条贯穿全讲的理解线
价值函数做的是信用分配:把后面得到的奖励逐步传回较早状态和动作。动态规划用已知模型做期望,MC 用完整实际回报,TD 混合一步真实奖励和后继估计;SARSA 与 Q-learning 再把状态价值扩展为动作价值。
到这里,课程的三条路线闭环:知识图谱显式存知识,机器学习从样本拟合函数,搜索和强化学习则把函数用于一连串行动。