第 3 次作业:Bayes 与 minimax 序贯决策阅读报告

能从源目录确认的任务边界

源目录没有单独保存教师发布的作业通知,只有两份大作业材料:

  1. K. J. Arrow、D. Blackwell、M. A. Girshick 的 1949 年论文 Bayes and Minimax Solutions of Sequential Decision Problems;
  2. 我当时提交的一份标题为“数理统计大作业—应用部分”的 Markdown 稿件。

因此这里只把它整理为一次论文阅读与应用讨论,不反推篇幅、分工、评分点等没有证据的要求。

阅读时要回答的核心问题

传统统计决策要求在未知自然状态下选择动作,并为错误动作承担损失。论文再加入一个选择:现在停止并作决定,还是付出抽样成本继续收集信息?

阅读可以抓住五个问题:

  • 状态、动作、损失、抽样规则与决策函数分别是什么;
  • Bayes 风险怎样同时包含决策损失和抽样成本;
  • 何时应该继续抽样,何时应该停止;
  • 有限多个假设时,后验概率空间怎样被划分为“停止并选某动作”与“继续”的区域;
  • Bayes 解怎样进一步连接 minimax 解和博弈论。
展开课程提交内容整理

一、论文讲了什么

论文讨论序贯选择:在每一阶段,统计者可以立即停止并选择动作,也可以继续观察一个样本。选错动作产生损失,继续观察产生费用,所以“信息越多越好”并不免费成立。

设自然状态为 uu,最终动作是 aa,损失为 L(u,a)L(u,a)。一个完整策略由两部分组成:

  • 抽样规则 TT:根据已经观察到的数据决定何时停止;
  • 决策函数 DD:停止后根据数据选择动作。

总风险可写成

R(T,D)=E[L(u,D)]+E[CT],R(T,D)=E[L(u,D)]+E[C_T],

即最终误判的期望损失与抽样成本之和。Bayes 解是在给定先验后使该风险最小的 (T,D)(T,D)。

动态地看,每一步都比较两个数:

  • 现在停止时可达到的最小后验风险;
  • 再采一个样本并在未来最优行动时的期望风险,加上抽样成本。

只有后者更小时才值得继续。这就是最优停止思想。

二、有限假设时的几何图景

若只有 kk 个假设,观察数据后得到后验概率向量

(π1,…,πk),πi≥0,∑iπi=1.(\pi_1,\ldots,\pi_k),\qquad \pi_i\ge0,\quad \sum_i\pi_i=1.

它位于一个 (k−1)(k-1) 维单纯形中。论文证明:对每个可能动作,都存在一个凸的停止区域;后验落入该区域时,立即选择相应动作最优。其余部分是继续抽样区域。

二元假设时,单纯形退化成区间,最优规则通常表现为两个阈值:

  • 后验或似然比低于下阈值,停止并接受一侧;
  • 高于上阈值,停止并接受另一侧;
  • 位于两阈值之间,继续抽样。

在线性抽样成本等条件下,这与 Wald 的序贯概率比检验相联系。

三、Bayes 与 minimax

Bayes 规则在给定先验下最小化平均风险;minimax 规则最小化最坏自然状态下的风险:

inf⁡δsup⁡uR(u,δ).\inf_\delta\sup_u R(u,\delta).

论文借助统计决策与零和博弈的联系讨论 minimax 解。直观上,自然选择最不利状态,统计者选择策略;合适的最不利先验可把一个 minimax 问题转化为 Bayes 问题。

四、我在提交稿中讨论的应用

我当时的提交稿把“序贯状态—行动—反馈”的思想延伸到四类应用:

  1. 强化学习:用状态、动作、转移、奖励和策略描述连续决策;
  2. 自动驾驶:在不确定交通环境中持续观察并更新动作;
  3. 医疗健康:根据患者状态动态调整治疗;
  4. 游戏 AI:通过多阶段反馈改进策略。

其中强化学习部分进一步介绍了 MDP、价值函数、Bellman 方程、有模型与无模型方法,以及 Q-learning、DQN、Actor–Critic 等算法。

五、核对材料后应保留的限定

1949 年论文的直接主题是有抽样成本的序贯统计决策,不是现代强化学习中的马尔可夫决策过程。二者确实共享“多阶段决策”和“权衡未来信息”的语言,但从该论文不能直接推出 Bellman 方程、Q-learning 或现代自动驾驶系统。

我当时的提交稿还列举了若干企业项目和效果百分比,但没有附参考文献。为了不把未经核验的数字当成课程事实,这里只保留应用方向,不把那些百分比当作已经证实的结论。若要把这部分扩成正式综述,需要逐条补可靠来源。

一句话复盘

这篇论文最值得带走的不是某个孤立公式,而是一个决策原则:信息有价值,也有成本;最优策略要同时决定“看多少”与“怎么选”。

评论