第二讲 · 占优策略、劣策略与纯策略 Nash 均衡
把博弈写成收益矩阵后,求解通常按三层推进:先找占优策略,再删除严格劣策略,最后寻找互为最优反应的策略组合。三个概念逐渐变弱,因此能覆盖的博弈越来越多。
1. 囚徒困境:个人理性为什么带来集体坏结果
两个嫌疑人被分开审讯,选择坦白或抵赖。把刑期取负数作为收益:
| 玩家 1 \ 玩家 2 | 坦白 | 抵赖 |
|---|---|---|
| 坦白 | ||
| 抵赖 |

固定玩家 2 的选择,比较玩家 1:
- 玩家 2 坦白时,玩家 1 坦白得 ,抵赖得 ;
- 玩家 2 抵赖时,玩家 1 坦白得 ,抵赖得 。
所以无论对方怎样选,坦白都更好。博弈对称,玩家 2 也会坦白,最终得到 。
但双方抵赖可以得到 ,两个人都更好。这里要区分两件事:
- 均衡回答“有没有人愿意单独改变”;
- Pareto 效率回答“能不能让至少一人更好且没人更差”。
Nash 均衡可能没有效率。
2. 占优策略与占优策略均衡
若策略 面对对手的所有可能选择都不差于其他策略,它是玩家 的弱占优策略:
若所有比较都严格大于,则称为严格占优策略。
当每个玩家都有占优策略时,这些策略组成占优策略均衡。它很容易预测,但也非常罕见;多数现实博弈不存在一个“无论别人做什么都最好”的行动。
3. 严格劣策略与迭代删除
若存在另一个策略 ,使它面对所有 都严格优于 :
那么 是严格劣策略。理性玩家不会使用它,因此可以从策略集中删除。
删除后,原来不是劣策略的行动可能在缩小后的矩阵中变成劣策略,于是可以继续删除。这就是迭代删除严格劣策略。
3.1 为什么每删一轮都需要更多共同知识
- 第一轮删除只要求玩家自己理性;
- 第二轮还要求他相信别人会删除第一轮劣策略;
- 第三轮要求他相信别人也相信自己理性;
- 轮数越深,对理性共同知识的要求越高。
3.2 严格劣和弱劣不能混用
删除严格劣策略的最终存活集合与删除顺序无关,而且不会删除 Nash 均衡中实际使用的策略。
弱劣策略只要求“所有情况下都不差,至少一种情况下更好”。删除弱劣策略可能依赖顺序,也可能删掉某些 Nash 均衡。因此题目没有明确许可时,不要用弱劣删除冒充严格劣删除。
4. 最优反应
给定对手策略 ,玩家 能获得最高收益的策略集合叫最优反应:
占优策略要求面对所有 都是最优反应;普通最优反应只针对某个给定的 。Nash 均衡不要求玩家拥有占优策略,只要求实际选择在均衡点上互为最优反应。
5. 纯策略 Nash 均衡
策略组合 是 Nash 均衡,当且仅当
它有两个完全等价的直觉:
- 每个人都在对别人的实际策略做最优反应;
- 给定别人不变,没有人能通过单独改变策略提高收益。
Nash 均衡不表示大家合作、不表示收益相等,也不表示社会福利最大;它只表示策略预测不会被任何一个人的单方行动推翻。
6. 矩阵题的划线法

两人矩阵按下面三步做:
- 固定玩家 2 的每一列,比较该列中玩家 1 的收益,也就是每格第一个数,把最大值全部标出;
- 固定玩家 1 的每一行,比较该行中玩家 2 的收益,也就是每格第二个数,把最大值全部标出;
- 同一格里的两个收益都被标记时,该策略组合就是纯策略 Nash 均衡。
若最大值并列,必须全部标记,否则会漏掉均衡。
7. 箭头法是同一件事的反面
也可以从每个格子出发,检查哪位玩家能够通过单方改变策略提高收益,并朝更好的格子画箭头。
- 没有箭头指出去的格子是 Nash 均衡;
- 每个格子都有箭头指出去,则不存在纯策略 Nash 均衡;
- 多个格子没有出箭头,则存在多个纯策略 Nash 均衡。
划线法在找“留下来的最优反应”,箭头法在找“离开的有利偏离”,二者完全等价。
8. 三种解概念的关系
- 占优策略均衡一定是 Nash 均衡;
- Nash 均衡使用的策略不会被严格劣策略迭代删除;
- 仅仅在删除后存活,不代表一定组成 Nash 均衡;
- 一个博弈可能没有纯策略 Nash 均衡,也可能有多个。
9. 考试速成模板
面对有限矩阵题:
- 先检查是否存在占优策略;
- 再检查并迭代删除严格劣策略;
- 即使已经删除,也用最优反应法检查 Nash 均衡;
- 分别逐列标玩家 1、逐行标玩家 2;
- 汇总所有双标格子;
- 若没有双标格子,进入下一讲的混合策略求解。
最关键的动作始终是:固定别人,只比较自己。