第二讲 · 占优策略、劣策略与纯策略 Nash 均衡

Views: --

把博弈写成收益矩阵后,求解通常按三层推进:先找占优策略,再删除严格劣策略,最后寻找互为最优反应的策略组合。三个概念逐渐变弱,因此能覆盖的博弈越来越多。

1. 囚徒困境:个人理性为什么带来集体坏结果

两个嫌疑人被分开审讯,选择坦白或抵赖。把刑期取负数作为收益:

玩家 1 \ 玩家 2坦白抵赖
坦白(4,4)(-4,-4)(0,6)(0,-6)
抵赖(6,0)(-6,0)(1,1)(-1,-1)

课件中的囚徒困境收益矩阵

固定玩家 2 的选择,比较玩家 1:

  • 玩家 2 坦白时,玩家 1 坦白得 4-4,抵赖得 6-6
  • 玩家 2 抵赖时,玩家 1 坦白得 00,抵赖得 1-1

所以无论对方怎样选,坦白都更好。博弈对称,玩家 2 也会坦白,最终得到 (4,4)(-4,-4)

但双方抵赖可以得到 (1,1)(-1,-1),两个人都更好。这里要区分两件事:

  • 均衡回答“有没有人愿意单独改变”;
  • Pareto 效率回答“能不能让至少一人更好且没人更差”。

Nash 均衡可能没有效率。

2. 占优策略与占优策略均衡

若策略 sis_i^* 面对对手的所有可能选择都不差于其他策略,它是玩家 ii 的弱占优策略:

ui(si,si)ui(si,si),si, si.u_i(s_i^*,s_{-i}) \ge u_i(s_i,s_{-i}), \qquad \forall s_i,\ \forall s_{-i}.

若所有比较都严格大于,则称为严格占优策略。

当每个玩家都有占优策略时,这些策略组成占优策略均衡。它很容易预测,但也非常罕见;多数现实博弈不存在一个“无论别人做什么都最好”的行动。

3. 严格劣策略与迭代删除

若存在另一个策略 sis_i',使它面对所有 sis_{-i} 都严格优于 sis_i

ui(si,si)>ui(si,si),si,u_i(s_i',s_{-i}) > u_i(s_i,s_{-i}), \qquad \forall s_{-i},

那么 sis_i 是严格劣策略。理性玩家不会使用它,因此可以从策略集中删除。

删除后,原来不是劣策略的行动可能在缩小后的矩阵中变成劣策略,于是可以继续删除。这就是迭代删除严格劣策略。

3.1 为什么每删一轮都需要更多共同知识

  • 第一轮删除只要求玩家自己理性;
  • 第二轮还要求他相信别人会删除第一轮劣策略;
  • 第三轮要求他相信别人也相信自己理性;
  • 轮数越深,对理性共同知识的要求越高。

3.2 严格劣和弱劣不能混用

删除严格劣策略的最终存活集合与删除顺序无关,而且不会删除 Nash 均衡中实际使用的策略。

弱劣策略只要求“所有情况下都不差,至少一种情况下更好”。删除弱劣策略可能依赖顺序,也可能删掉某些 Nash 均衡。因此题目没有明确许可时,不要用弱劣删除冒充严格劣删除。

4. 最优反应

给定对手策略 sis_{-i},玩家 ii 能获得最高收益的策略集合叫最优反应:

BRi(si)={siSi:ui(si,si)ui(si,si), siSi}.BR_i(s_{-i}) = \left\{ s_i\in S_i: u_i(s_i,s_{-i}) \ge u_i(s_i',s_{-i}),\ \forall s_i'\in S_i \right\}.

占优策略要求面对所有 sis_{-i} 都是最优反应;普通最优反应只针对某个给定的 sis_{-i}。Nash 均衡不要求玩家拥有占优策略,只要求实际选择在均衡点上互为最优反应。

5. 纯策略 Nash 均衡

策略组合 s=(s1,,sn)s^*=(s_1^*,\dots,s_n^*) 是 Nash 均衡,当且仅当

ui(si,si)ui(si,si),i, si.u_i(s_i^*,s_{-i}^*) \ge u_i(s_i,s_{-i}^*), \qquad \forall i,\ \forall s_i.

它有两个完全等价的直觉:

  • 每个人都在对别人的实际策略做最优反应;
  • 给定别人不变,没有人能通过单独改变策略提高收益。

Nash 均衡不表示大家合作、不表示收益相等,也不表示社会福利最大;它只表示策略预测不会被任何一个人的单方行动推翻。

6. 矩阵题的划线法

课件用划线法寻找相互最优反应

两人矩阵按下面三步做:

  1. 固定玩家 2 的每一列,比较该列中玩家 1 的收益,也就是每格第一个数,把最大值全部标出;
  2. 固定玩家 1 的每一行,比较该行中玩家 2 的收益,也就是每格第二个数,把最大值全部标出;
  3. 同一格里的两个收益都被标记时,该策略组合就是纯策略 Nash 均衡。

若最大值并列,必须全部标记,否则会漏掉均衡。

7. 箭头法是同一件事的反面

也可以从每个格子出发,检查哪位玩家能够通过单方改变策略提高收益,并朝更好的格子画箭头。

  • 没有箭头指出去的格子是 Nash 均衡;
  • 每个格子都有箭头指出去,则不存在纯策略 Nash 均衡;
  • 多个格子没有出箭头,则存在多个纯策略 Nash 均衡。

划线法在找“留下来的最优反应”,箭头法在找“离开的有利偏离”,二者完全等价。

8. 三种解概念的关系

占优策略均衡迭代删除严格劣策略可解的均衡Nash 均衡.\text{占优策略均衡} \subseteq \text{迭代删除严格劣策略可解的均衡} \subseteq \text{Nash 均衡}.
  • 占优策略均衡一定是 Nash 均衡;
  • Nash 均衡使用的策略不会被严格劣策略迭代删除;
  • 仅仅在删除后存活,不代表一定组成 Nash 均衡;
  • 一个博弈可能没有纯策略 Nash 均衡,也可能有多个。

9. 考试速成模板

面对有限矩阵题:

  1. 先检查是否存在占优策略;
  2. 再检查并迭代删除严格劣策略;
  3. 即使已经删除,也用最优反应法检查 Nash 均衡;
  4. 分别逐列标玩家 1、逐行标玩家 2;
  5. 汇总所有双标格子;
  6. 若没有双标格子,进入下一讲的混合策略求解。

最关键的动作始终是:固定别人,只比较自己。

评论