第五讲 · 完全信息动态博弈:扩展式与子博弈精炼

Views: --

静态博弈只问“大家分别选什么”。动态博弈还要问:谁先行动、后来者看到了什么、如果走到另一个历史会怎么办。行动顺序一旦进入模型,策略就不再等于眼前的一步动作,普通 Nash 均衡也可能被走不到的威胁“撑住”。

一、扩展式博弈描述的是过程

一个扩展式博弈至少需要说明:

  1. 参与人;
  2. 谁在什么时点行动;
  3. 每次行动有哪些选项;
  4. 行动者当时知道什么;
  5. 每条完整路径最终给各方什么收益。

博弈树把这些信息画出来:

  • 根节点是博弈起点;
  • 决策节点表示轮到某位参与人;
  • 边表示可选行动;
  • 终点写收益;
  • 信息集把行动者无法区分的节点连在一起。

一个扩展式博弈的决策树

图:同一参与人可能在多个节点行动。读树时先沿路径看行动,再回头确认信息集。

二、信息集表示“行动时能分辨到哪一步”

参与人行动时未必知道自己具体位于哪个节点。若几个节点属于同一个信息集,他只能知道“我在这个集合中的某处”,不能针对不同节点选不同动作。

因此,同一信息集中的节点必须满足:

  • 都轮到同一个参与人;
  • 可选行动完全相同;
  • 参与人不能观察到把这些节点区分开的历史。

若每个信息集都只有一个节点,博弈是完美信息博弈。象棋在棋盘状态完全可见的理想化模型里属于完美信息;同时出拳的石头剪刀布不是。

注意“完全信息”和“完美信息”不是一回事:

  • 完全信息:每个人知道参与人类型、策略空间和收益结构;
  • 完美信息:轮到行动时,知道此前发生的全部相关行动。

一个博弈可以完全信息但不完美信息,例如双方同时选择的收益矩阵。

三、策略必须是一份完整预案

在动态博弈里,参与人的纯策略要回答:

对我的每一个信息集,如果它真的到达,我分别选什么?

即使某个节点按当前策略不会走到,也必须先写好动作。若参与人 2 有两个信息集,第一个可选 A/BA/B,第二个可选 C/DC/D,那么他的策略不是单独的 AACC,而是

(A,C), (A,D), (B,C), (B,D).(A,C),\ (A,D),\ (B,C),\ (B,D).

这就是“行动”和“策略”最重要的区别。一个策略决定整棵树上的相机行动方案;实际路径上通常只会执行其中一小部分。

四、扩展式如何转成标准式

转换步骤很机械:

  1. 为每位参与人列出所有完整策略;
  2. 对每个策略组合,从根节点沿树执行;
  3. 把到达终点的收益填入矩阵;
  4. 在矩阵中寻找 Nash 均衡。

这样做能复用静态博弈的方法,却会丢失树的时序结构。两个策略组合可能走到同一个终点,却在未到达节点上规定了不同动作;标准式矩阵会把它们当成不同策略,但不直接告诉你哪些威胁可信。

五、普通 Nash 均衡为什么不够

假设参与人 1 先选“进入”或“不进入”,参与人 2 只在进入后选“打击”或“容忍”。参与人 2 可以事前宣称:

只要你进入,我就打击,即使打击也会让我自己亏得更多。

如果参与人 1 相信这个威胁,他可能选择不进入。对应的完整策略组合甚至可能是 Nash 均衡,因为真正路径停在“不进入”,参与人 2 的打击动作从未执行,单独改掉这个离轨动作也不改变收益。

问题在于:一旦进入真的发生,参与人 2 会选择对自己更好的“容忍”。原来的威胁不是序贯理性的,因而不应被理性参与人相信。

Nash 均衡只检查整套策略是否存在有利的单方替换;它不保证策略在每一个可能到达的后续局面里仍然最优。

六、什么是子博弈

子博弈是原博弈从某个节点开始的完整“后半局”。它必须:

  1. 从单节点信息集中的决策节点开始;
  2. 包含该节点之后的所有后继节点;
  3. 不能切断任何信息集。

课件中的子博弈识别示例

图:从符合条件的节点向下保留完整分支,才能形成一个子博弈。

多节点信息集中的某一个节点不能单独作为子博弈起点,因为行动者连自己位于哪个节点都分不清,不能把其中一条历史独立拿出来求解。

七、子博弈精炼 Nash 均衡

一个策略组合是子博弈精炼 Nash 均衡(SPNE),当且仅当它在原博弈的每一个子博弈中都构成 Nash 均衡。

因此

SPNENash 均衡.\text{SPNE}\subseteq\text{Nash 均衡}.

“精炼”不是发明另一种行为逻辑,而是在 Nash 均衡集合里继续筛选:凡是依赖某个后续子博弈中的非最优行动才能成立的均衡,都被剔除。

八、逆向归纳法

有限完美信息博弈可以从最后一步倒着求:

  1. 找离终点最近的决策节点;
  2. 在每个节点选择该行动者收益最高的分支;
  3. 用选中分支的收益替换整个后续子树;
  4. 向前重复,直到根节点;
  5. 把每个节点上的选择写成完整策略。

课件中的逆向归纳求解过程

图:从最末端逐层比较收益,保留下来的分支决定前一位参与人的选择。

逆向归纳得到的不只是最终路径,还要包含所有未到达节点上的最优行动,否则还不是完整策略。

九、承诺为什么可能改变均衡

口头威胁无法改变未来收益,所以常常不可信。真正的承诺行动会改变未来可选集合或收益,例如:

  • 先购买只能用于研发的设备;
  • 预先签订不可撤销的合同;
  • 支付不可退还的律师费;
  • 把决策权交给受规则约束的代理人。

承诺的关键不是“态度坚定”,而是让将来的自己无法或不愿反悔。一个参与人甚至可能通过主动减少未来选项,换取更好的当前结果。

判断承诺是否可信时问三个问题:

  1. 它是否真的改变了未来收益或行动集合?
  2. 成本是否已经沉没、合同是否可以执行?
  3. 到达相关节点后,执行承诺是否仍是最优选择?

十、逆向归纳也有边界

连锁店悖论与蜈蚣博弈提醒我们:当博弈很长时,逆向归纳要求极强的共同理性。

蜈蚣博弈中,最后行动者会选择立即停止;前一位预见到这一点,也会更早停止。一直倒推会得到“第一步就停止”。但真人实验常出现一段合作,可能来自有限理性、利他偏好、对类型的不确定或建立信誉的动机。

这并不说明逆向归纳算错,而是说明模型的收益、信息或理性假设可能没有完整覆盖现实。

十一、动态博弈的解题模板

  1. 先画树,标清行动顺序和终点收益;
  2. 圈出信息集,判断是完美信息还是不完美信息;
  3. 为每个人写出覆盖所有信息集的完整策略;
  4. 若题目问 Nash 均衡,可转成标准式检查;
  5. 若题目问 SPNE,先找子博弈,再从后向前求;
  6. 对每个威胁单独问:真的走到这里,他还愿意执行吗?

学完这一部分,最重要的变化是:不再只盯着最终收益,而是把整个决策过程都纳入理性检查。

评论