这篇按课程目录中的三次作业整理。每题都先说明应该从哪里下手,再给出完整推导;重点不是记住最后的均衡,而是学会把博弈树、重复博弈和类型依赖策略翻译成可以逐项检查的条件。
作业一:完整策略与 Nash 均衡

题目问:如果 [L,(A,C)] 是 Nash 均衡,[L,(A,D)] 是否一定也是 Nash 均衡?
图中玩家 1 先选择 L 或 R。选择 L 后,玩家 2 在左侧节点选择 A 或 B;选择 R 后,玩家 2 在右侧节点选择 C 或 D。四个终点收益依次记为
a=(a1,a2),b=(b1,b2),c=(c1,c2),d=(d1,d2).
1. 先读懂策略写法
玩家 1 只有一个决策点,纯策略为 L 或 R。玩家 2 有两个可能到达的决策点,因此一个完整策略必须同时规定:玩家 1 选择 L 后做什么,以及玩家 1 选择 R 后做什么。
所以玩家 2 的纯策略为
(A,C), (A,D), (B,C), (B,D).
[L,(A,C)] 表示玩家 1 选择 L,玩家 2 在左侧节点选择 A、在右侧节点选择 C。同理,[L,(A,D)] 只改变了玩家 2 在右侧路径外节点的行动。
2. 检查 [L,(A,C)]
在该策略组合下,结果停在 L,收益为 a。
玩家 1 若单独改选 R,玩家 2 按完整策略在右侧选择 C,结果到达 c。所以玩家 1 不偏离要求
a1≥c1.
玩家 2 若把左侧行动从 A 改成 B,结果会从 a 变成 b,因此玩家 2 不偏离要求
a2≥b2.
所以 [L,(A,C)] 是 Nash 均衡的条件为
a1≥c1,qquada2≥b2.
3. 检查 [L,(A,D)]
现在玩家 1 偏离到 R 后,玩家 2 会在右侧选择 D,所以玩家 1 不偏离的条件变为
a1≥d1.
玩家 2 一侧仍需要
a2≥b2.
因此两组策略的条件并不相同:已知 a1≥c1,不能推出 a1≥d1。
4. 结论与反例
答案是:不一定。
例如取
a=(2,2),b=(0,1),c=(1,0),d=(3,0).
此时 a1=2≥c1=1,但 a1=2<d1=3。于是 [L,(A,C)] 可以满足条件,[L,(A,D)] 却不能。
如果改成 d=(0,0),则 a1≥c1 和 a1≥d1 同时成立,两者都可能是 Nash 均衡。
这道题真正考的是:动态博弈中的策略必须写出路径外行动,而路径外行动可能改变另一位玩家偏离后的结果,因此不能把两个看起来走出同一路径的策略当成同一个策略。
若题目进一步要求子博弈精炼 Nash 均衡,还必须从最后的决策节点开始逆向归纳,检查路径外行动本身是否可信。
作业二:两阶段重复博弈中的合作

1. 找出一次博弈的纯策略 Nash 均衡
逐列找玩家 1 的最优反应、逐行找玩家 2 的最优反应,可以得到四个纯策略 Nash 均衡:
X=(1,1),Z=(3,3),P=(4,21),Q=(21,4).
矩阵中的 Y=(4,4) 对双方都很好,却不是一次博弈的 Nash 均衡。若对手选择 Y,单方改选 X 可以把当期收益从 4 提高到 5。
2. 为什么最后一轮仍然可以选择不同均衡
两阶段博弈的第二轮是最后一轮,所以每段历史之后都必须选择一次博弈的某个 Nash 均衡。这里一次博弈恰好有多个均衡,而且它们对两位玩家的收益分配不同,因此可以用来设计可信的奖励和惩罚。
构造如下纯策略:
- 第一轮双方都选择 Y;
- 若第一轮双方都遵守 Y,第二轮选择 Z;
- 若第一轮只有玩家 2 偏离,第二轮选择 P,让玩家 2 只得 1/2;
- 若第一轮只有玩家 1 偏离,第二轮选择 Q,让玩家 1 只得 1/2;
- 若第一轮双方都偏离,第二轮选择 X。
第二轮安排的 X、Z、P、Q 全是一次博弈的 Nash 均衡,所以这些奖惩在相应子博弈中都是可信的。
3. 检查第一轮偏离
双方合作时,两轮总收益为
4+3=7.
若某位玩家第一轮单独偏离,他最多先得到 5,第二轮受到定向惩罚,只得到 1/2,总收益为
5+21=211<7.
因此没有人愿意在第一轮单独偏离,这组策略构成子博弈精炼 Nash 均衡,并在第一轮实现了非一次博弈均衡的结果 Y=(4,4)。
4. 加入折现因子
若第二轮收益乘以折现因子 δ,合作收益为
4+3δ,
偏离收益为
5+21δ.
合作可持续的条件是
4+3δ≥5+21δ,
即
δ≥52.
这道题说明:有限重复不等于一定无法合作。若一次博弈有多个 Nash 均衡,就可能用不同均衡构造可信的续局奖惩。
作业三:把贝叶斯博弈转成战略式

两位玩家都可能是强类型 s 或弱类型 w。联合类型概率为
pss=0.3,psw=0.3,pws=0.2,pww=0.2.
每位玩家知道自己的类型,但不知道对方类型;每种类型都要选择 U 或 D。
1. 为什么每位玩家有四个纯策略
纯策略必须规定该玩家在每一种可能类型下做什么。因此可以写成
UU, UD, DU, DD.
第一个字母表示强类型的行动,第二个字母表示弱类型的行动。例如 UD 表示强类型选择 U,弱类型选择 D。
2. 计算战略式收益
对任意策略组合,都要遍历四种类型状态,用联合概率加权。例如,先根据两人的策略确定在 (s,s)、(s,w)、(w,s)、(w,w) 下各自采取什么行动,再把四个状态的收益求期望。
完整的期望收益矩阵为:
| 玩家 1 \ 玩家 2 | UU | UD | DU | DD |
|---|
| UU | (−4,−4) | (−1.4,−2) | (−1.4,−3) | (1.2,−1) |
| UD | (−2.4,−2) | (−0.4,−0.6) | (−0.4,−1.8) | (1.6,−0.4) |
| DU | (−2.8,−1) | (−1.4,0.1) | (−1.4,−1.2) | (0,−0.1) |
| DD | (−1.2,1) | (−0.4,1.5) | (−0.4,0) | (0.4,0.5) |
3. 找最优反应与贝叶斯 Nash 均衡
在这个转换后的战略式矩阵中,按普通 Nash 均衡的方法找互为最优反应的格子,得到两个纯策略贝叶斯 Nash 均衡:
(UD,DD),
其期望收益为
(1.6,−0.4),
以及
(DD,UD),
其期望收益为
(−0.4,1.5).
这道题最容易错的地方,是把“行动”当成“策略”。在贝叶斯博弈中,玩家在行动时已经知道自己的类型,所以策略必须是从类型到行动的完整映射。
三次作业对应的三条主线
- 动态博弈:完整策略包含路径外行动,均衡检查要比较完整策略偏离;
- 重复博弈:可信惩罚必须是续局中的均衡,多重阶段均衡能支撑有限期合作;
- 贝叶斯博弈:先把每种类型的行动写成一张策略表,再对类型概率求期望收益。
把这三种翻译做对,后面的均衡计算就只是最优反应比较。