第一讲 · 博弈论概述与标准式

Views: --

博弈论研究的不是“怎样赢一场游戏”,而是:当我的最优选择取决于别人怎样选,别人也在反过来推测我时,结果会怎样形成。

价格战、投票、谈判、拍卖、公共资源、平台竞争和多智能体协作看起来完全不同,但都包含同一个骨架:参与者的收益由所有人的行动共同决定。

1. 什么叫战略互动

普通决策只需要比较自己的不同方案。例如固定票价下选择坐高铁还是飞机,结果主要由自己的偏好决定。

战略决策还必须预测别人:

  • 企业是否降价,取决于竞争者会不会跟进;
  • 投标多少,取决于其他竞标者可能报多少;
  • 是否合作,取决于对方会不会利用自己的合作;
  • 是否发送某个信号,取决于接收者会怎样理解它。

因此,博弈论不是单向的“我预测你”,而是递归推理:

我选择什么我认为你会怎样回应你认为我会怎样选择.\text{我选择什么} \leftarrow \text{我认为你会怎样回应} \leftarrow \text{你认为我会怎样选择}.

均衡就是让这种相互预测最终自洽的策略组合。

2. 建模时必须回答的五个问题

面对一个现实故事,先不要急着套均衡概念。依次回答:

  1. 谁在决策:参与人可以是个人、企业、政府、国家或算法;
  2. 每个人能做什么:行动或策略集合是什么;
  3. 谁知道什么:收益、类型、历史行动是否被观察;
  4. 谁先谁后:同时行动还是依次行动;
  5. 各自想要什么:每种结果给每个人多少收益。

同一个现实问题,只要信息结构或行动顺序改变,就可能变成完全不同的博弈。例如两家企业同时选产量是 Cournot 模型,一家先选、另一家观察后再选就变成 Stackelberg 模型。

3. 理性与共同知识

课程中的“理性”通常表示:玩家会在可选方案中最大化自己的收益。它不等于自私,也不等于信息完美;一个关心公平的人,公平本身可以进入其收益函数。

很多推理还需要更强的“共同知识”:

  1. 每个人都理性;
  2. 每个人都知道别人理性;
  3. 每个人都知道别人知道自己理性;
  4. 这种层层知道无限延伸。

迭代删除劣策略之所以能一轮轮继续,正是因为玩家不只相信自己理性,还相信别人也会排除不理性的选择。

4. 两个维度切出整门课

课程课件中的四类博弈与均衡概念

博弈可以沿“信息是否完全”和“行动是否有可观察的先后”分成四类:

完全信息不完全信息
静态Nash 均衡贝叶斯 Nash 均衡
动态子博弈精炼 Nash 均衡精炼贝叶斯 Nash 均衡

4.1 静态和动态

“静态”并不要求两个人在物理时间上同时按按钮。只要后行动者做决定时看不到前者已经做了什么,在战略上就相当于同时行动。

动态博弈则存在可观察的行动顺序。后手会根据前面的行动调整策略,先手也会提前预判这种回应。

4.2 完全信息和不完全信息

完全信息表示参与人、策略空间和收益函数都是共同知识。不完全信息中,至少有一部分私人信息,例如企业不知道竞争者的成本,竞标者不知道别人对商品的估值。

记忆方法:

  • 不完全信息要求对未知类型建立概率判断,所以均衡名称中出现“贝叶斯”;
  • 动态博弈不仅要问整体上是否稳定,还要检查每一步的后续行动是否可信。

5. 标准式博弈的三个组成部分

完全信息静态博弈最适合写成标准式,也叫战略式。它由三部分组成:

  1. 参与人集合 N={1,,n}N=\{1,\dots,n\}
  2. 玩家 ii 的策略集合 SiS_i
  3. 玩家 ii 的收益函数 uiu_i

整个博弈可以写成

G={S1,,Sn;u1,,un}.G=\{S_1,\dots,S_n;u_1,\dots,u_n\}.

一个策略组合写成

s=(s1,,sn).s=(s_1,\dots,s_n).

把除玩家 ii 以外所有人的策略记为 sis_{-i},就可以把他的收益写成

ui(si,si).u_i(s_i,s_{-i}).

这个记号直接表达了战略互动:我的收益既取决于自己的策略 sis_i,也取决于别人的策略 sis_{-i}

6. 怎样读收益矩阵

两人有限博弈通常用矩阵表示:

玩家 1 \ 玩家 2
(a1,a2)(a_1,a_2)(b1,b2)(b_1,b_2)
(c1,c2)(c_1,c_2)(d1,d2)(d_1,d_2)
  • 行是玩家 1 的策略;
  • 列是玩家 2 的策略;
  • 每个格子的第一个数属于玩家 1,第二个数属于玩家 2;
  • 一个格子是策略组合产生的结果,不是某位玩家的单个策略。

读矩阵时要固定对手再比较自己的收益。分析玩家 1,就逐列比较每一列中的第一个数;分析玩家 2,就逐行比较每一行中的第二个数。

7. 常见的其他分类

7.1 零和与非零和

零和博弈中,一方所得等于另一方所失,总收益固定。猜硬币就是典型零和博弈。

非零和博弈中,双方可能同时变好或同时变坏。囚徒困境的矛盾正来自:稳定结果并不是双方共同最好的结果。

7.2 合作与非合作

合作博弈关心联盟可以形成什么约束性协议以及联盟收益怎样分配;非合作博弈从每个参与人的具体策略与激励出发。本课程的主体是非合作博弈。

8. 从文字题到模型的翻译模板

遇到一道新题,按下面顺序写:

  1. 列出参与人;
  2. 给每个人写完整策略集合;
  3. 判断信息是否完全、行动是否有可观察顺序;
  4. 写出每个策略组合的收益;
  5. 选择对应的均衡概念;
  6. 最后才开始计算。

这一讲完成的是“把现实问题翻译成博弈”。下一讲开始回答:写成收益矩阵以后,理性玩家会把结果推向哪里。

评论