第九讲 · 不完全信息动态博弈:PBE 与信号博弈

Views: --

静态不完全信息博弈只需要问:每种类型面对别人的策略,是否都在做最优反应?动态不完全信息博弈还多了一层:行动本身会泄露信息,后手会根据观察到的行动更新对先手类型的判断。

因此,只写策略还不够。我们还要写清楚每个信息集上的信念,以及玩家如何根据信念继续行动。

1. 为什么贝叶斯 Nash 均衡还不够

贝叶斯 Nash 均衡要求每个类型在事前意义下最优,但它不一定排除这样的策略:

  • 均衡路径上从来不会到达某个信息集;
  • 玩家事先声称,到达那里以后会做一个对自己也不利的行动;
  • 这个不可信的威胁反过来支撑了前面的选择。

这和完全信息动态博弈中 Nash 均衡的问题很像。区别在于,这里后手不仅要选择行动,还要先判断“走到这里的先手更可能是哪种类型”。

2. 均衡对象:策略加信念

在不完全信息动态博弈中,一个完整的判断对象通常写成

(σ,μ),(\sigma,\mu),

其中:

  • σ\sigma 是所有玩家的策略组合;
  • μ\mu 是信念系统,描述玩家在每个信息集上认为各个节点出现的概率。

精炼贝叶斯 Nash 均衡中的策略与信念

可以把二者理解成一个闭环:

  1. 策略决定什么行动更可能被观察到;
  2. 观察结果改变后手对类型的信念;
  3. 信念决定后手的最优行动;
  4. 后手的反应又影响先手愿不愿意执行原策略。

3. 精炼贝叶斯 Nash 均衡的三个要求

精炼贝叶斯 Nash 均衡通常简称 PBE。课件里的核心要求可以压缩成三句。

3.1 序贯理性

给定自己在当前信息集上的信念,以及其他玩家后续的策略,每个玩家在每一个信息集上的行动都必须最优。

这意味着不能只检查均衡路径。即使某个信息集在均衡中不会到达,玩家到了那里以后也不能故意做对自己不利的事。

3.2 路径内信念服从 Bayes 法则

如果一个信息集在均衡策略下以正概率到达,那么到达以后对各节点的信念必须由 Bayes 法则算出来。

例如,两种类型的先验概率分别为 Pr(tH)\Pr(t_H)Pr(tL)\Pr(t_L),观察到消息 mm 后,后验信念为

Pr(tHm)=Pr(mtH)Pr(tH)Pr(mtH)Pr(tH)+Pr(mtL)Pr(tL).\Pr(t_H\mid m) = \frac{\Pr(m\mid t_H)\Pr(t_H)} {\Pr(m\mid t_H)\Pr(t_H)+\Pr(m\mid t_L)\Pr(t_L)}.

3.3 路径外也要给出信念

如果均衡中某个行动永远不会发生,Bayes 法则的分母为零,就不能直接推出观察到该行动后的信念。但 PBE 仍然要求写出这个路径外信念,并让后续行动在该信念下最优。

这正是许多信号博弈出现多个 PBE 的原因:不同的路径外信念,可能支撑不同的威胁或反应。

4. 四种均衡概念放在一起

概念主要适用场景核心检查
Nash 均衡完全信息,静态或动态没有人愿意单独改变完整策略
子博弈精炼 Nash 均衡完全信息动态博弈每个子博弈里都是 Nash 均衡
贝叶斯 Nash 均衡不完全信息静态博弈每种类型的策略都是期望收益最优反应
精炼贝叶斯 Nash 均衡不完全信息动态博弈策略序贯理性,信念与策略一致

一句话记忆:SPNE 给动态博弈补上可信性,PBE 再给不完全信息补上信念更新。

5. 信号博弈的标准结构

最典型的不完全信息动态博弈是信号博弈。

信号博弈的标准博弈树

它的时间顺序是:

  1. 自然选择发送者的类型 tt
  2. 发送者知道自己的类型,并选择消息 mm
  3. 接收者观察消息,但不知道发送者的真实类型;
  4. 接收者形成后验信念 μ(tm)\mu(t\mid m),再选择行动 aa
  5. 双方获得收益。

发送者的纯策略不是一个孤立的消息,而是一个从类型到消息的映射:

m(t):TM.m(t):T\rightarrow M.

接收者的纯策略则规定看到每一种消息后做什么:

a(m):MA.a(m):M\rightarrow A.

6. 混同、分离与半分离

假设发送者有高、低两种类型,消息有 LLRR 两种。

6.1 混同均衡

两种类型发送同一个消息,例如

m(tH)=m(tL)=R.m(t_H)=m(t_L)=R.

接收者看到 RR 后无法进一步区分类型,路径内后验通常等于先验。另一个从未出现的消息 LL 位于路径外,它对应的信念需要单独指定。

6.2 分离均衡

两种类型发送不同消息,例如

m(tH)=R,m(tL)=L.m(t_H)=R,\qquad m(t_L)=L.

只要两种类型的先验概率都为正,接收者看到消息后就能完全识别类型:

μ(tHR)=1,μ(tHL)=0.\mu(t_H\mid R)=1, \qquad \mu(t_H\mid L)=0.

6.3 半分离均衡

至少一种类型采用混合策略。观察到某个消息后,接收者能获得部分信息,但不能完全识别类型。

考试中通常先穷举纯策略的混同、分离候选;如果都不存在,或题目明确要求,再求半分离均衡。

7. 纯策略 PBE 的标准求解法

信号博弈不要从整棵树同时硬算。按下面的顺序最稳。

第一步:猜发送者策略的形态

依次检查:

  • 两种类型都发 LL
  • 两种类型都发 RR
  • 高类型发 LL、低类型发 RR
  • 高类型发 RR、低类型发 LL

第二步:由候选策略计算路径内信念

分离候选的路径内信念通常是 0011;混同候选的路径内信念通常等于先验。

第三步:求接收者的最优反应

对每个消息分别比较接收者的期望收益。例如看到 mm 后,高类型的概率为 μ\mu,则行动 a1a_1 的期望收益为

μuR(a1,tH)+(1μ)uR(a1,tL).\mu u_R(a_1,t_H)+(1-\mu)u_R(a_1,t_L).

将它和其他行动比较,就能得到接收者在什么信念范围内选择什么。

第四步:检查发送者的激励相容

对每一种发送者类型都比较:遵守候选策略的收益,是否不低于改发另一个消息后的收益。

分离均衡通常对应两条激励相容约束:

uS(tH,mH,a(mH))uS(tH,mL,a(mL)),u_S(t_H,m_H,a(m_H)) \ge u_S(t_H,m_L,a(m_L)), uS(tL,mL,a(mL))uS(tL,mH,a(mH)).u_S(t_L,m_L,a(m_L)) \ge u_S(t_L,m_H,a(m_H)).

第五步:补齐路径外信念并再次检查

混同候选一定存在一个路径外消息。先求出接收者选择某行动所需要的信念区间,再看这个反应能否阻止两种发送者偏离。

所以答案不能只写“双方都发 RR”。完整答案至少包括:

  • 发送者每种类型发什么;
  • 接收者看到每种消息后做什么;
  • 每个信息集上的信念;
  • Bayes 更新和双方无偏离条件。

8. 为什么路径外信念这么重要

在混同均衡中,均衡路径没有告诉我们另一条消息来自哪种类型。如果接收者相信“只有坏类型才会偏离”,他可能用严厉行动回应,于是没有类型愿意偏离;如果接收者相信“只有好类型才会偏离”,同一个候选策略可能立刻崩溃。

PBE 允许一些路径外信念,因此有时仍然留下太多均衡。后面要学的直观标准、序贯均衡和颤抖手精炼,就是继续限制这些不合理信念。

9. 考试速成模板

遇到信号博弈题,可以直接写成下面六行:

  1. 候选发送者策略是混同还是分离;
  2. 用 Bayes 法则写出路径内信念;
  3. 比较接收者期望收益,得到信念阈值和最优行动;
  4. 写出每种发送者的激励相容条件;
  5. 对混同候选补路径外信念区间;
  6. 汇总完整的策略与信念系统,并声明满足序贯理性与一致性。

真正的主线只有一句话:消息改变信念,信念改变行动,预期到这种反应的发送者再决定是否发送消息。

评论