第四讲 · Nash 均衡的性质、选择与静态博弈应用
前三讲已经解决了“博弈怎样表示、纯策略均衡怎样找、没有纯策略均衡时怎样混合”。这一讲继续追问:为什么 Nash 均衡能作为预测、为什么它一定存在、找到多个时应该相信哪一个? 随后把同一套最优反应方法放进 Cournot、Bertrand、Hotelling、公共资源和监督模型。
1. Nash 均衡是一种自洽预测
策略组合 是 Nash 均衡,意味着
这条式子不只是在说“没人想跑”,更是在说预测具有自我肯定性:
- 每个人都预测别人会执行 ;
- 在这个预测下,自己的最优选择正好是 ;
- 所有人真的这样做以后,观察到的结果不会推翻原来的预测。
若一个策略组合不是 Nash 均衡,至少有一人会发现单方改策略能获利。只要他理性,预测就会被自己的行动破坏,因此不能稳定地作为结果。
Nash 均衡只保证“给定别人不动,我也不想单独动”,不保证结果公平、有效率或使总收益最大。囚徒困境正是最直接的反例。
2. 存在性不等于唯一性
Nash 的存在性定理说明:
每个有限标准式博弈至少存在一个 Nash 均衡,允许它是混合策略均衡。
把纯策略扩充为概率分布后,有限博弈总能得到一个固定点。不过“存在”不等于“唯一”,也不等于“容易求”:参与人和策略一多,枚举支集、求非线性方程都会迅速变得困难。
3. 多重均衡:理论找到了,现实会选哪个
性别战有两个纯策略均衡和一个混合策略均衡。理论若只回答“它们都是均衡”,仍没有告诉我们现实究竟落在哪一个。课件给出三类思路。
1. 焦点效应
参与人可能借助文化、历史、地点、显眼数字或共同经历,把某个均衡视作“自然答案”。这些没有改变收益矩阵,却改变了大家对别人会怎样预测的预测。
焦点不是万能规则。它依赖具体背景,换一个群体或环境,焦点也可能改变。
2. 事前沟通
参与人可以先表达意图,再进入真正的博弈。若沟通没有约束力、说谎也没有成本,它被称为廉价磋商或空谈。沟通有时能帮助协调,但不能自动保证承诺可信:说“我一定选 ”和真正有动机选 是两回事。
3. 相关均衡
混合策略假设每个人独立随机化;相关均衡允许大家观察同一个相关信号,再根据自己的信号行动。例如天气同时影响夫妻双方的建议,信号就能把行动相关起来。
相关均衡要求:给定自己收到的建议,服从建议的期望收益不低于违背建议。它扩大了可解释的均衡集合,也把“共同信号如何协调行动”纳入模型。
4. Cournot:同时选择产量
两家企业生产同质产品,同时选择产量 。设
则企业 的利润是
给定对手产量 ,对 求一阶条件:
所以反应函数为
两条反应函数的交点就是 Nash 均衡:

图:交点处双方同时处在自己的反应函数上,因此谁都不愿单独改变产量。
若两企业能够联合垄断,总产量只会是 。Cournot 均衡的总产量更高、价格更低、总利润更少,说明各自追求利润最大化会侵蚀共同利润。
5. Bertrand:同时选择价格
Bertrand 模型把决策变量从产量换成价格。企业生产同质产品、边际成本相同且没有容量约束时:
- 定价更高的企业没有需求;
- 定价更低的企业获得全部需求;
- 两家同价则平分需求。
只要共同价格高于边际成本,一家企业就能稍微降一点价、夺走整个市场。因此均衡会一路压到
仅有两家企业,均衡却像完全竞争一样价格等于边际成本,这就是 Bertrand 悖论。它强烈依赖“产品完全同质、没有容量约束、消费者只看价格”等假设。
6. Hotelling:产品差异为什么缓和价格战
把消费者均匀放在区间 上,两家企业位于两端。消费者除了支付价格,还要承担距离成本。位于 的消费者在两家之间无差异时满足
于是临界消费者位置为
价格更低仍能抢顾客,但距离差异使企业拥有一部分“偏爱自己”的消费者,不必像同质 Bertrand 模型那样把价格压到成本。这里的核心不是记公式,而是理解:差异化降低了替代性,替代性降低就会减弱价格竞争。
7. Hardin 公共资源:为什么会被过度使用
公共草地允许每位村民自由放羊。多放一只羊的收益主要归自己,但拥挤和草地损耗由所有人承担。个人决策只计算自己的边际损失,社会最优则计算对所有人的总损失,所以
这与囚徒困境同源:个体最优反应组合成一个稳定均衡,却不是集体最优。产权、配额、收费和合作协议,本质上都是把外部成本重新放回个人收益函数。
8. 监督博弈:混合概率改变的是对手
小偷在“偷/不偷”之间选择,守卫在“睡/不睡”之间选择:
- 守卫睡觉时,小偷愿意偷;
- 小偷偷时,守卫愿意不睡;
- 守卫不睡时,小偷不愿偷;
- 小偷不偷时,守卫又愿意睡。
四个格子形成循环,没有纯策略 Nash 均衡,只能由双方随机化。

图:每个纯策略组合都能触发一方改变行动,均衡只能落在概率上。
最容易混淆的结论是:小偷的均衡偷窃概率由守卫的收益决定;守卫不睡的概率由小偷的收益决定。 因为自己的概率要把对手调到无差异。
这也解释了某些政策的反直觉效果。提高偷窃惩罚首先会改变守卫需要多高的巡逻概率才能让小偷无差异;均衡中的实际偷窃概率是否下降,还要看守卫一侧的成本和收益结构,不能只盯着单个惩罚数字。
9. 本讲怎样速成
看到完全信息静态模型时,按这条顺序做:
- 先确认策略变量是离散选择、产量、价格还是位置;
- 离散矩阵找双方最优反应,连续策略求反应函数;
- 纯策略均衡不存在时,再用无差异条件求混合策略;
- 找到多个均衡后,讨论焦点、沟通或相关信号;
- 最后检查均衡是否有效率,以及低效率来自什么外部性。
真正要掌握的不是模型名字,而是把“互为最优反应”翻译成矩阵标记、反应函数交点或无差异方程。