第一讲 · 博弈论概述与标准式
博弈论研究的不是“怎样赢一场游戏”,而是:当我的最优选择取决于别人怎样选,别人也在反过来推测我时,结果会怎样形成。
价格战、投票、谈判、拍卖、公共资源、平台竞争和多智能体协作看起来完全不同,但都包含同一个骨架:参与者的收益由所有人的行动共同决定。
1. 什么叫战略互动
普通决策只需要比较自己的不同方案。例如固定票价下选择坐高铁还是飞机,结果主要由自己的偏好决定。
战略决策还必须预测别人:
- 企业是否降价,取决于竞争者会不会跟进;
- 投标多少,取决于其他竞标者可能报多少;
- 是否合作,取决于对方会不会利用自己的合作;
- 是否发送某个信号,取决于接收者会怎样理解它。
因此,博弈论不是单向的“我预测你”,而是递归推理:
均衡就是让这种相互预测最终自洽的策略组合。
2. 建模时必须回答的五个问题
面对一个现实故事,先不要急着套均衡概念。依次回答:
- 谁在决策:参与人可以是个人、企业、政府、国家或算法;
- 每个人能做什么:行动或策略集合是什么;
- 谁知道什么:收益、类型、历史行动是否被观察;
- 谁先谁后:同时行动还是依次行动;
- 各自想要什么:每种结果给每个人多少收益。
同一个现实问题,只要信息结构或行动顺序改变,就可能变成完全不同的博弈。例如两家企业同时选产量是 Cournot 模型,一家先选、另一家观察后再选就变成 Stackelberg 模型。
3. 理性与共同知识
课程中的“理性”通常表示:玩家会在可选方案中最大化自己的收益。它不等于自私,也不等于信息完美;一个关心公平的人,公平本身可以进入其收益函数。
很多推理还需要更强的“共同知识”:
- 每个人都理性;
- 每个人都知道别人理性;
- 每个人都知道别人知道自己理性;
- 这种层层知道无限延伸。
迭代删除劣策略之所以能一轮轮继续,正是因为玩家不只相信自己理性,还相信别人也会排除不理性的选择。
4. 两个维度切出整门课

博弈可以沿“信息是否完全”和“行动是否有可观察的先后”分成四类:
| 完全信息 | 不完全信息 | |
|---|---|---|
| 静态 | Nash 均衡 | 贝叶斯 Nash 均衡 |
| 动态 | 子博弈精炼 Nash 均衡 | 精炼贝叶斯 Nash 均衡 |
4.1 静态和动态
“静态”并不要求两个人在物理时间上同时按按钮。只要后行动者做决定时看不到前者已经做了什么,在战略上就相当于同时行动。
动态博弈则存在可观察的行动顺序。后手会根据前面的行动调整策略,先手也会提前预判这种回应。
4.2 完全信息和不完全信息
完全信息表示参与人、策略空间和收益函数都是共同知识。不完全信息中,至少有一部分私人信息,例如企业不知道竞争者的成本,竞标者不知道别人对商品的估值。
记忆方法:
- 不完全信息要求对未知类型建立概率判断,所以均衡名称中出现“贝叶斯”;
- 动态博弈不仅要问整体上是否稳定,还要检查每一步的后续行动是否可信。
5. 标准式博弈的三个组成部分
完全信息静态博弈最适合写成标准式,也叫战略式。它由三部分组成:
- 参与人集合 ;
- 玩家 的策略集合 ;
- 玩家 的收益函数 。
整个博弈可以写成
一个策略组合写成
把除玩家 以外所有人的策略记为 ,就可以把他的收益写成
这个记号直接表达了战略互动:我的收益既取决于自己的策略 ,也取决于别人的策略 。
6. 怎样读收益矩阵
两人有限博弈通常用矩阵表示:
| 玩家 1 \ 玩家 2 | 左 | 右 |
|---|---|---|
| 上 | ||
| 下 |
- 行是玩家 1 的策略;
- 列是玩家 2 的策略;
- 每个格子的第一个数属于玩家 1,第二个数属于玩家 2;
- 一个格子是策略组合产生的结果,不是某位玩家的单个策略。
读矩阵时要固定对手再比较自己的收益。分析玩家 1,就逐列比较每一列中的第一个数;分析玩家 2,就逐行比较每一行中的第二个数。
7. 常见的其他分类
7.1 零和与非零和
零和博弈中,一方所得等于另一方所失,总收益固定。猜硬币就是典型零和博弈。
非零和博弈中,双方可能同时变好或同时变坏。囚徒困境的矛盾正来自:稳定结果并不是双方共同最好的结果。
7.2 合作与非合作
合作博弈关心联盟可以形成什么约束性协议以及联盟收益怎样分配;非合作博弈从每个参与人的具体策略与激励出发。本课程的主体是非合作博弈。
8. 从文字题到模型的翻译模板
遇到一道新题,按下面顺序写:
- 列出参与人;
- 给每个人写完整策略集合;
- 判断信息是否完全、行动是否有可观察顺序;
- 写出每个策略组合的收益;
- 选择对应的均衡概念;
- 最后才开始计算。
这一讲完成的是“把现实问题翻译成博弈”。下一讲开始回答:写成收益矩阵以后,理性玩家会把结果推向哪里。