第 3 次作业:Bayes 与 minimax 序贯决策阅读报告
能从源目录确认的任务边界
源目录没有单独保存教师发布的作业通知,只有两份大作业材料:
- K. J. Arrow、D. Blackwell、M. A. Girshick 的 1949 年论文 Bayes and Minimax Solutions of Sequential Decision Problems;
- 我当时提交的一份标题为“数理统计大作业—应用部分”的 Markdown 稿件。
因此这里只把它整理为一次论文阅读与应用讨论,不反推篇幅、分工、评分点等没有证据的要求。
阅读时要回答的核心问题
传统统计决策要求在未知自然状态下选择动作,并为错误动作承担损失。论文再加入一个选择:现在停止并作决定,还是付出抽样成本继续收集信息?
阅读可以抓住五个问题:
- 状态、动作、损失、抽样规则与决策函数分别是什么;
- Bayes 风险怎样同时包含决策损失和抽样成本;
- 何时应该继续抽样,何时应该停止;
- 有限多个假设时,后验概率空间怎样被划分为“停止并选某动作”与“继续”的区域;
- Bayes 解怎样进一步连接 minimax 解和博弈论。
展开课程提交内容整理
一、论文讲了什么
论文讨论序贯选择:在每一阶段,统计者可以立即停止并选择动作,也可以继续观察一个样本。选错动作产生损失,继续观察产生费用,所以“信息越多越好”并不免费成立。
设自然状态为 ,最终动作是 ,损失为 。一个完整策略由两部分组成:
- 抽样规则 :根据已经观察到的数据决定何时停止;
- 决策函数 :停止后根据数据选择动作。
总风险可写成
即最终误判的期望损失与抽样成本之和。Bayes 解是在给定先验后使该风险最小的 。
动态地看,每一步都比较两个数:
- 现在停止时可达到的最小后验风险;
- 再采一个样本并在未来最优行动时的期望风险,加上抽样成本。
只有后者更小时才值得继续。这就是最优停止思想。
二、有限假设时的几何图景
若只有 个假设,观察数据后得到后验概率向量
它位于一个 维单纯形中。论文证明:对每个可能动作,都存在一个凸的停止区域;后验落入该区域时,立即选择相应动作最优。其余部分是继续抽样区域。
二元假设时,单纯形退化成区间,最优规则通常表现为两个阈值:
- 后验或似然比低于下阈值,停止并接受一侧;
- 高于上阈值,停止并接受另一侧;
- 位于两阈值之间,继续抽样。
在线性抽样成本等条件下,这与 Wald 的序贯概率比检验相联系。
三、Bayes 与 minimax
Bayes 规则在给定先验下最小化平均风险;minimax 规则最小化最坏自然状态下的风险:
论文借助统计决策与零和博弈的联系讨论 minimax 解。直观上,自然选择最不利状态,统计者选择策略;合适的最不利先验可把一个 minimax 问题转化为 Bayes 问题。
四、我在提交稿中讨论的应用
我当时的提交稿把“序贯状态—行动—反馈”的思想延伸到四类应用:
- 强化学习:用状态、动作、转移、奖励和策略描述连续决策;
- 自动驾驶:在不确定交通环境中持续观察并更新动作;
- 医疗健康:根据患者状态动态调整治疗;
- 游戏 AI:通过多阶段反馈改进策略。
其中强化学习部分进一步介绍了 MDP、价值函数、Bellman 方程、有模型与无模型方法,以及 Q-learning、DQN、Actor–Critic 等算法。
五、核对材料后应保留的限定
1949 年论文的直接主题是有抽样成本的序贯统计决策,不是现代强化学习中的马尔可夫决策过程。二者确实共享“多阶段决策”和“权衡未来信息”的语言,但从该论文不能直接推出 Bellman 方程、Q-learning 或现代自动驾驶系统。
我当时的提交稿还列举了若干企业项目和效果百分比,但没有附参考文献。为了不把未经核验的数字当成课程事实,这里只保留应用方向,不把那些百分比当作已经证实的结论。若要把这部分扩成正式综述,需要逐条补可靠来源。
一句话复盘
这篇论文最值得带走的不是某个孤立公式,而是一个决策原则:信息有价值,也有成本;最优策略要同时决定“看多少”与“怎么选”。