作业 · 汇总与完整解答

Views: --

这篇按课程目录中的三次作业整理。每题都先说明应该从哪里下手,再给出完整推导;重点不是记住最后的均衡,而是学会把博弈树、重复博弈和类型依赖策略翻译成可以逐项检查的条件。

作业一:完整策略与 Nash 均衡

作业一的动态博弈树

题目问:如果 [L,(A,C)][L,(A,C)] 是 Nash 均衡,[L,(A,D)][L,(A,D)] 是否一定也是 Nash 均衡?

图中玩家 1 先选择 LLRR。选择 LL 后,玩家 2 在左侧节点选择 AABB;选择 RR 后,玩家 2 在右侧节点选择 CCDD。四个终点收益依次记为

a=(a1,a2),b=(b1,b2),c=(c1,c2),d=(d1,d2).a=(a_1,a_2),\quad b=(b_1,b_2),\quad c=(c_1,c_2),\quad d=(d_1,d_2).

1. 先读懂策略写法

玩家 1 只有一个决策点,纯策略为 LLRR。玩家 2 有两个可能到达的决策点,因此一个完整策略必须同时规定:玩家 1 选择 LL 后做什么,以及玩家 1 选择 RR 后做什么。

所以玩家 2 的纯策略为

(A,C), (A,D), (B,C), (B,D).(A,C),\ (A,D),\ (B,C),\ (B,D).

[L,(A,C)][L,(A,C)] 表示玩家 1 选择 LL,玩家 2 在左侧节点选择 AA、在右侧节点选择 CC。同理,[L,(A,D)][L,(A,D)] 只改变了玩家 2 在右侧路径外节点的行动。

2. 检查 [L,(A,C)][L,(A,C)]

在该策略组合下,结果停在 LL,收益为 aa

玩家 1 若单独改选 RR,玩家 2 按完整策略在右侧选择 CC,结果到达 cc。所以玩家 1 不偏离要求

a1c1.a_1\ge c_1.

玩家 2 若把左侧行动从 AA 改成 BB,结果会从 aa 变成 bb,因此玩家 2 不偏离要求

a2b2.a_2\ge b_2.

所以 [L,(A,C)][L,(A,C)] 是 Nash 均衡的条件为

a1c1,qquada2b2.a_1\ge c_1,qquad a_2\ge b_2.

3. 检查 [L,(A,D)][L,(A,D)]

现在玩家 1 偏离到 RR 后,玩家 2 会在右侧选择 DD,所以玩家 1 不偏离的条件变为

a1d1.a_1\ge d_1.

玩家 2 一侧仍需要

a2b2.a_2\ge b_2.

因此两组策略的条件并不相同:已知 a1c1a_1\ge c_1,不能推出 a1d1a_1\ge d_1

4. 结论与反例

答案是:不一定。

例如取

a=(2,2),b=(0,1),c=(1,0),d=(3,0).a=(2,2),\quad b=(0,1),\quad c=(1,0),\quad d=(3,0).

此时 a1=2c1=1a_1=2\ge c_1=1,但 a1=2<d1=3a_1=2<d_1=3。于是 [L,(A,C)][L,(A,C)] 可以满足条件,[L,(A,D)][L,(A,D)] 却不能。

如果改成 d=(0,0)d=(0,0),则 a1c1a_1\ge c_1a1d1a_1\ge d_1 同时成立,两者都可能是 Nash 均衡。

这道题真正考的是:动态博弈中的策略必须写出路径外行动,而路径外行动可能改变另一位玩家偏离后的结果,因此不能把两个看起来走出同一路径的策略当成同一个策略。

若题目进一步要求子博弈精炼 Nash 均衡,还必须从最后的决策节点开始逆向归纳,检查路径外行动本身是否可信。

作业二:两阶段重复博弈中的合作

作业二的一次博弈收益矩阵

1. 找出一次博弈的纯策略 Nash 均衡

逐列找玩家 1 的最优反应、逐行找玩家 2 的最优反应,可以得到四个纯策略 Nash 均衡:

X=(1,1),Z=(3,3),P=(4,12),Q=(12,4).X=(1,1),\quad Z=(3,3),\quad P=\left(4,\frac12\right),\quad Q=\left(\frac12,4\right).

矩阵中的 Y=(4,4)Y=(4,4) 对双方都很好,却不是一次博弈的 Nash 均衡。若对手选择 YY,单方改选 XX 可以把当期收益从 44 提高到 55

2. 为什么最后一轮仍然可以选择不同均衡

两阶段博弈的第二轮是最后一轮,所以每段历史之后都必须选择一次博弈的某个 Nash 均衡。这里一次博弈恰好有多个均衡,而且它们对两位玩家的收益分配不同,因此可以用来设计可信的奖励和惩罚。

构造如下纯策略:

  • 第一轮双方都选择 YY
  • 若第一轮双方都遵守 YY,第二轮选择 ZZ
  • 若第一轮只有玩家 2 偏离,第二轮选择 PP,让玩家 2 只得 1/21/2
  • 若第一轮只有玩家 1 偏离,第二轮选择 QQ,让玩家 1 只得 1/21/2
  • 若第一轮双方都偏离,第二轮选择 XX

第二轮安排的 XXZZPPQQ 全是一次博弈的 Nash 均衡,所以这些奖惩在相应子博弈中都是可信的。

3. 检查第一轮偏离

双方合作时,两轮总收益为

4+3=7.4+3=7.

若某位玩家第一轮单独偏离,他最多先得到 55,第二轮受到定向惩罚,只得到 1/21/2,总收益为

5+12=112<7.5+\frac12=\frac{11}{2}<7.

因此没有人愿意在第一轮单独偏离,这组策略构成子博弈精炼 Nash 均衡,并在第一轮实现了非一次博弈均衡的结果 Y=(4,4)Y=(4,4)

4. 加入折现因子

若第二轮收益乘以折现因子 δ\delta,合作收益为

4+3δ,4+3\delta,

偏离收益为

5+12δ.5+\frac12\delta.

合作可持续的条件是

4+3δ5+12δ,4+3\delta \ge 5+\frac12\delta,

δ25.\delta\ge\frac25.

这道题说明:有限重复不等于一定无法合作。若一次博弈有多个 Nash 均衡,就可能用不同均衡构造可信的续局奖惩。

作业三:把贝叶斯博弈转成战略式

作业三的贝叶斯博弈树

两位玩家都可能是强类型 ss 或弱类型 ww。联合类型概率为

pss=0.3,psw=0.3,pws=0.2,pww=0.2.p_{ss}=0.3,\quad p_{sw}=0.3,\quad p_{ws}=0.2,\quad p_{ww}=0.2.

每位玩家知道自己的类型,但不知道对方类型;每种类型都要选择 UUDD

1. 为什么每位玩家有四个纯策略

纯策略必须规定该玩家在每一种可能类型下做什么。因此可以写成

UU, UD, DU, DD.UU,\ UD,\ DU,\ DD.

第一个字母表示强类型的行动,第二个字母表示弱类型的行动。例如 UDUD 表示强类型选择 UU,弱类型选择 DD

2. 计算战略式收益

对任意策略组合,都要遍历四种类型状态,用联合概率加权。例如,先根据两人的策略确定在 (s,s)(s,s)(s,w)(s,w)(w,s)(w,s)(w,w)(w,w) 下各自采取什么行动,再把四个状态的收益求期望。

完整的期望收益矩阵为:

玩家 1 \ 玩家 2UUUUUDUDDUDUDDDD
UUUU(4,4)(-4,-4)(1.4,2)(-1.4,-2)(1.4,3)(-1.4,-3)(1.2,1)(1.2,-1)
UDUD(2.4,2)(-2.4,-2)(0.4,0.6)(-0.4,-0.6)(0.4,1.8)(-0.4,-1.8)(1.6,0.4)(1.6,-0.4)
DUDU(2.8,1)(-2.8,-1)(1.4,0.1)(-1.4,0.1)(1.4,1.2)(-1.4,-1.2)(0,0.1)(0,-0.1)
DDDD(1.2,1)(-1.2,1)(0.4,1.5)(-0.4,1.5)(0.4,0)(-0.4,0)(0.4,0.5)(0.4,0.5)

3. 找最优反应与贝叶斯 Nash 均衡

在这个转换后的战略式矩阵中,按普通 Nash 均衡的方法找互为最优反应的格子,得到两个纯策略贝叶斯 Nash 均衡:

(UD,DD),(UD,DD),

其期望收益为

(1.6,0.4),(1.6,-0.4),

以及

(DD,UD),(DD,UD),

其期望收益为

(0.4,1.5).(-0.4,1.5).

这道题最容易错的地方,是把“行动”当成“策略”。在贝叶斯博弈中,玩家在行动时已经知道自己的类型,所以策略必须是从类型到行动的完整映射。

三次作业对应的三条主线

  1. 动态博弈:完整策略包含路径外行动,均衡检查要比较完整策略偏离;
  2. 重复博弈:可信惩罚必须是续局中的均衡,多重阶段均衡能支撑有限期合作;
  3. 贝叶斯博弈:先把每种类型的行动写成一张策略表,再对类型概率求期望收益。

把这三种翻译做对,后面的均衡计算就只是最优反应比较。

评论