我在下面把课程目录中的春季学期真题转写成便于作答的版本。题目与解析放在同一页;我把收益矩阵重排成 Markdown,并从原卷单独裁出了第 6 题必须使用的博弈树。
建议先独立完成每道题,再手动展开题目下方的答案。折叠内容不是课程提供的官方标准答案,而是我根据原卷独立推导的解析。
第 1 题:策略式博弈
考虑如下博弈:
| 玩家 1 \ 玩家 2 | B1 | B2 | B3 |
|---|
| A1 | (0,8) | (8,0) | (10,6) |
| A2 | (8,8) | (0,4) | (10,6) |
| A3 | (6,10) | (6,8) | (12,12) |
- 通过严格劣策略的迭代删除化简该博弈。
- 用在收益下画线的方法找出所有纯策略 Nash 均衡。
- 求该博弈的混合策略 Nash 均衡。
查看第 1 题答案与解析
1. 严格劣策略的迭代删除
先看玩家 2。逐行比较 B1 与 B2 的收益:
8>0,8>4,10>8.
所以 B2 被 B1 严格支配,可以删除。
在只剩 B1、B3 后,玩家 1 的收益为:
| 玩家 1 | B1 | B3 |
|---|
| A1 | 0 | 10 |
| A2 | 8 | 10 |
| A3 | 6 | 12 |
A3 在两列下的收益都严格高于 A1,所以继续删除 A1。最终化简为
| 玩家 1 \ 玩家 2 | B1 | B3 |
|---|
| A2 | (8,8) | (10,6) |
| A3 | (6,10) | (12,12) |
2. 纯策略 Nash 均衡
在化简后的矩阵中:
- 面对 B1,玩家 1 的最优反应是 A2;面对 A2,玩家 2 的最优反应是 B1;
- 面对 B3,玩家 1 的最优反应是 A3;面对 A3,玩家 2 的最优反应是 B3。
所以两个纯策略 Nash 均衡为
(A2,B1),(A3,B3).
3. 混合策略 Nash 均衡
设玩家 1 以概率 p 选择 A2,以概率 1−p 选择 A3;玩家 2 以概率 q 选择 B1,以概率 1−q 选择 B3。
为了让玩家 1 混合,玩家 2 的 q 必须使玩家 1 无差异:
U1(A2)=8q+10(1−q)=10−2q,
U1(A3)=6q+12(1−q)=12−6q.
令二者相等,得到
q=21.
同理,为了让玩家 2 混合:
U2(B1)=8p+10(1−p)=10−2p,
U2(B3)=6p+12(1−p)=12−6p.
令二者相等,得到
p=21.
因此,写回原博弈的三维概率分布,混合策略均衡为
σ1=(0,21,21),σ2=(21,0,21).
第 2 题:n 家厂商的 Cournot 竞争
市场中有 n 家厂商生产同质产品。市场反需求函数为
P(Q)=a−Q,Q=i=1∑nqi,
厂商 i 的成本函数为
Ci(qi)=cqi.
- 求该博弈的 Nash 均衡产量、市场总产量、价格和各厂商利润。
- 讨论 n→∞ 时这些变量的极限。
查看第 2 题答案与解析
厂商 i 的利润为
πi=a−qi−j=i∑qj−cqi.
对 qi 求一阶条件:
∂qi∂πi=a−c−2qi−j=i∑qj=0.
对称均衡中 qi=q,所以
a−c−(n+1)q=0,
得到每家厂商产量
qi∗=n+1a−c.
于是
Q∗=n+1n(a−c),
P∗=a−Q∗=n+1a+nc,
πi∗=(P∗−c)qi∗=(n+1a−c)2.
当 n→∞ 时,
qi∗→0,Q∗→a−c,P∗→c,πi∗→0.
厂商数量增加把市场推向完全竞争结果:价格趋近边际成本,单个厂商的产量和利润趋近于零。
第 3 题:两阶段重复博弈
考虑下面的一次博弈,并将它重复两次。第一阶段结束后,双方都能观察到第一阶段的行动;不考虑折现。
| 玩家 1 \ 玩家 2 | B1 | B2 | B3 |
|---|
| A1 | (3,1) | (0,0) | (5,0) |
| A2 | (2,1) | (1,2) | (3,1) |
| A3 | (1,2) | (0,1) | (4,4) |
是否存在一个纯策略子博弈精炼 Nash 均衡,使第一阶段实现 (A3,B3),也就是当期收益 (4,4)?若存在,请写出完整策略并说明理由;若不存在,请说明原因。
查看第 3 题答案与解析
先找一次博弈的纯策略 Nash 均衡:
(A1,B1),收益 (3,1),
(A2,B2),收益 (1,2).
目标结果 (A3,B3) 的收益是 (4,4),但它不是一次博弈的 Nash 均衡:面对 B3,玩家 1 改选 A1 可得 5。
尽管如此,下面的两阶段策略可以在第一阶段实现它:
- 第一阶段选择 (A3,B3);
- 若第一阶段双方都遵守,第二阶段选择 (A1,B1);
- 若第一阶段出现任何其他历史,第二阶段选择 (A2,B2)。
第二阶段每段历史之后安排的都是一次博弈 Nash 均衡,因此续局行为可信。
玩家 1 遵守时,两阶段总收益为
4+3=7.
他第一阶段单独偏离时,最高当期收益为 5,随后在惩罚均衡中得到 1,总计
5+1=6<7.
玩家 2 遵守时总收益为
4+1=5.
他在玩家 1 选择 A3 时单独偏离,第一阶段最高只能得到 2,随后在惩罚均衡中得到 2,总计
2+2=4<5.
所以双方都不愿意偏离。答案是:存在这样的纯策略子博弈精炼 Nash 均衡。
第 4 题:无限重复 Bertrand 竞争
两家厂商进行无限重复的 Bertrand 价格竞争。双方在合作阶段都制定垄断价格
pm=2a+c.
若任何一方偏离,则从下一期开始双方永远制定 p=c。已知单方偏离能够获得的当期利润为
4(a−c)2.
求使上述冷酷触发策略能够维持合作的折现因子 δ 范围。
查看第 4 题答案与解析
垄断总利润为
4(a−c)2.
合作时两家平分市场,因此每家每期利润为
πC=8(a−c)2.
偏离者略微降价后独占市场,当期利润为
πD=4(a−c)2.
偏离后永远制定 p=c,后续利润为零。合作的贴现总收益为
1−δπC,
偏离收益只有 πD。无偏离条件为
1−δ(a−c)2/8≥4(a−c)2.
约去公共项后得到
δ≥21.
因此折现因子范围为
δ∈[21,1).
第 5 题:带私人扰动的硬币匹配
玩家 1 和玩家 2 分别观察自己的私人类型
t1,t2∼U[0,x],
二者相互独立。然后双方同时选择正面 F 或反面 B,收益矩阵为:
| 玩家 1 \ 玩家 2 | F | B |
|---|
| F | (1+t1,−1) | (−1,1+t2) |
| B | (−1,1) | (1,−1) |
求该不完全信息博弈的纯策略贝叶斯 Nash 均衡,并说明当 x→0 时,它如何逼近原硬币匹配博弈中双方各以 1/2 概率随机化的混合策略均衡。
查看第 5 题答案与解析
设玩家 1 选择 F 的总体概率为 p,玩家 2 选择 F 的总体概率为 q。
1. 玩家 1 的阈值策略
类型为 t1 的玩家 1 选择 F 的期望收益为
q(1+t1)+(1−q)(−1),
选择 B 的期望收益为
q(−1)+(1−q)(1).
选择 F 当且仅当
q(4+t1)≥2.
因此存在阈值
α=q2−4,
使玩家 1 在 t1≥α 时选择 F,在 t1<α 时选择 B。
2. 玩家 2 的阈值策略
同理,类型为 t2 的玩家 2 选择 B 当且仅当
p(4+t2)≥2.
令
β=p2−4,
则玩家 2 在 t2≤β 时选择 F,在 t2>β 时选择 B。
由于类型在 [0,x] 上均匀分布,
p=xx−α,q=xβ.
代入两条阈值关系,得到
(α+4)β=2x,
(β+4)(x−α)=2x.
解得
α=−2+2x2+4x+8,
β=α+42x.
因此纯策略贝叶斯 Nash 均衡可以写成:
s1(t1)={B,F,t1<α,t1≥α,
s2(t2)={F,B,t2≤β,t2>β.
边界类型无差异,单个点的选择不影响总体概率。
当 x→0 时,
xα→21,xβ→21.
所以
p=xx−α→21,q=xβ→21.
每个类型都采用确定性行动,但总体行动概率收敛到原完全信息硬币匹配博弈的 1/2—1/2 混合均衡。这就是混合策略的“纯化”。
第 6 题:混同信号博弈

根据原题图中的收益,求一个两种发送者类型都选择 R 的混同精炼贝叶斯 Nash 均衡。答案应完整写出:
- 两种发送者类型的策略;
- 接收者看到 L 和 R 后的行动;
- 接收者在两个信息集上的信念;
- 支撑该均衡的信念范围。
查看第 6 题答案与解析
设接收者看到 L 后认为发送者是类型 t1 的概率为
p=Pr(t1∣L),
看到 R 后的相应概率为
q=Pr(t1∣R).
候选混同策略是两种类型都选择 R。由于 R 在均衡路径上,且两种类型的先验概率都是 1/2,Bayes 法则给出
q=21.
接收者看到 R 后,选择 u 的期望收益为
21⋅1+21⋅0=21,
选择 d 的期望收益为
21⋅0+21⋅2=1.
所以接收者在 R 后选择 d。
L 位于均衡路径外。接收者看到 L 后,选择 u 的期望收益为
2p,
选择 d 的期望收益为
1−p.
因此接收者在
2p≥1−p
也就是
p≥31
时选择 u。
在接收者采取“看到 L 选 u,看到 R 选 d”时:
- 类型 t1 留在 R 得到 3,偏离到 L 只得到 1;
- 类型 t2 留在 R 得到 2,偏离到 L 只得到 0。
两种类型都不愿意偏离。因此一族混同 PBE 为:
s1(t1)=s1(t2)=R,
s2(L)=u,s2(R)=d,
Pr(t1∣R)=21,Pr(t1∣L)=p≥31.
当 p=1/3 时,接收者在 L 后对 u、d 无差异,选择 u 仍然是最优反应。