第九讲 · 不完全信息动态博弈:PBE 与信号博弈

静态不完全信息博弈只需要问:每种类型面对别人的策略,是否都在做最优反应?动态不完全信息博弈还多了一层:行动本身会泄露信息,后手会根据观察到的行动更新对先手类型的判断。

因此,只写策略还不够。我们还要写清楚每个信息集上的信念,以及玩家如何根据信念继续行动。

1. 为什么贝叶斯 Nash 均衡还不够

贝叶斯 Nash 均衡要求每个类型在事前意义下最优,但它不一定排除这样的策略:

  • 均衡路径上从来不会到达某个信息集;
  • 玩家事先声称,到达那里以后会做一个对自己也不利的行动;
  • 这个不可信的威胁反过来支撑了前面的选择。

这和完全信息动态博弈中 Nash 均衡的问题很像。区别在于,这里后手不仅要选择行动,还要先判断“走到这里的先手更可能是哪种类型”。

2. 均衡对象:策略加信念

在不完全信息动态博弈中,一个完整的判断对象通常写成

(σ,μ),(\sigma,\mu),

其中:

  • σ\sigma 是所有玩家的策略组合;
  • μ\mu 是信念系统,描述玩家在每个信息集上认为各个节点出现的概率。

精炼贝叶斯 Nash 均衡中的策略与信念

策略与信念相互约束:

  1. 策略决定什么行动更可能被观察到;
  2. 观察结果改变后手对类型的信念;
  3. 信念决定后手的最优行动;
  4. 后手的反应又影响先手愿不愿意执行原策略。

3. PBE 的策略要求与三条信念原则

精炼贝叶斯 Nash 均衡通常简称 PBE。一个 PBE 由策略组合与每个信息集上的信念共同构成,并同时满足下面两类要求。

3.1 序贯理性

给定当前信息集上的信念以及其他玩家后续的策略,每个玩家在每一个信息集上的行动都必须最优。

这意味着不能只检查均衡路径。即使某个信息集在均衡中不会到达,玩家到了那里以后也不能故意做对自己不利的事。

3.2 信念的三条一致性原则

课件把信念设定单独拆成三条原则:

  1. 与策略的一致性:对均衡策略以正概率到达的信息集,信念由 Bayes 法则和均衡策略共同确定;
  2. 结构一致性:对均衡路径外的信息集,不能直接对零概率事件应用 Bayes 法则,但信念仍要能由某个可能采用的策略与博弈结构解释;
  3. 共同信念:同一博弈结构和信息下,各参与人对相关信息集采用共同的信念系统,不能各自临时编一套相互矛盾的到达概率。

第一条用于路径内。比如两种类型的先验概率分别为 Pr⁡(tH)\Pr(t_H)、Pr⁡(tL)\Pr(t_L),观察到以正概率出现的消息 mm 后,

Pr⁡(tH∣m)=Pr⁡(m∣tH)Pr⁡(tH)Pr⁡(m∣tH)Pr⁡(tH)+Pr⁡(m∣tL)Pr⁡(tL).\Pr(t_H\mid m) = \frac{\Pr(m\mid t_H)\Pr(t_H)} {\Pr(m\mid t_H)\Pr(t_H)+\Pr(m\mid t_L)\Pr(t_L)}.

第二条用于路径外。若均衡中消息 m′m' 永远不会出现,上式分母为零,PBE 仍要求写出观察到 m′m' 后的信念,并让接收者在该信念下做最优反应。不同的可接受路径外信念可能支撑不同的 PBE,这也是后续还要用直观标准等概念继续精炼的原因。

4. 四种均衡概念放在一起

概念主要适用场景核心检查
Nash 均衡完全信息,静态或动态没有人愿意单独改变完整策略
子博弈精炼 Nash 均衡完全信息动态博弈每个子博弈里都是 Nash 均衡
贝叶斯 Nash 均衡不完全信息静态博弈每种类型的策略都是期望收益最优反应
精炼贝叶斯 Nash 均衡不完全信息动态博弈策略序贯理性,信念与策略一致

SPNE 要求动态博弈中的后续行动可信;PBE 还要在不完全信息下写出信念及其更新。

5. 信号博弈的标准结构

最典型的不完全信息动态博弈是信号博弈。

信号博弈的标准博弈树

它的时间顺序是:

  1. 自然选择发送者的类型 tt;
  2. 发送者知道自己的类型,并选择消息 mm;
  3. 接收者观察消息,但不知道发送者的真实类型;
  4. 接收者形成后验信念 μ(t∣m)\mu(t\mid m),再选择行动 aa;
  5. 双方获得收益。

发送者的纯策略不是一个孤立的消息,而是一个从类型到消息的映射:

m(t):T→M.m(t):T\rightarrow M.

接收者的纯策略则规定看到每一种消息后做什么:

a(m):M→A.a(m):M\rightarrow A.

6. 混同、分离与半分离

假设发送者有高、低两种类型,消息有 LL、RR 两种。

6.1 混同均衡

两种类型发送同一个消息,例如

m(tH)=m(tL)=R.m(t_H)=m(t_L)=R.

接收者看到 RR 后无法进一步区分类型,路径内后验通常等于先验。另一个从未出现的消息 LL 位于路径外,它对应的信念需要单独指定。

6.2 分离均衡

两种类型发送不同消息,例如

m(tH)=R,m(tL)=L.m(t_H)=R,\qquad m(t_L)=L.

只要两种类型的先验概率都为正,接收者看到消息后就能完全识别类型:

μ(tH∣R)=1,μ(tH∣L)=0.\mu(t_H\mid R)=1, \qquad \mu(t_H\mid L)=0.

6.3 半分离均衡

至少一种类型采用混合策略。观察到某个消息后,接收者能获得部分信息,但不能完全识别类型。

考试中通常先穷举纯策略的混同、分离候选;如果都不存在,或题目明确要求,再求半分离均衡。

7. 纯策略 PBE 的标准求解法

信号博弈不要从整棵树同时硬算。按下面的顺序最稳。

第一步:猜发送者策略的形态

依次检查:

  • 两种类型都发 LL;
  • 两种类型都发 RR;
  • 高类型发 LL、低类型发 RR;
  • 高类型发 RR、低类型发 LL。

第二步:由候选策略计算路径内信念

分离候选的路径内信念通常是 00 或 11;混同候选的路径内信念通常等于先验。

第三步:求接收者的最优反应

对每个消息分别比较接收者的期望收益。例如看到 mm 后,高类型的概率为 μ\mu,则行动 a1a_1 的期望收益为

μuR(a1,tH)+(1−μ)uR(a1,tL).\mu u_R(a_1,t_H)+(1-\mu)u_R(a_1,t_L).

将它和其他行动比较,就能得到接收者在什么信念范围内选择什么。

第四步:检查发送者的激励相容

对每一种发送者类型都比较:遵守候选策略的收益,是否不低于改发另一个消息后的收益。

分离均衡通常对应两条激励相容约束:

uS(tH,mH,a(mH))≥uS(tH,mL,a(mL)),u_S(t_H,m_H,a(m_H)) \ge u_S(t_H,m_L,a(m_L)), uS(tL,mL,a(mL))≥uS(tL,mH,a(mH)).u_S(t_L,m_L,a(m_L)) \ge u_S(t_L,m_H,a(m_H)).

第五步:补齐路径外信念并再次检查

混同候选一定存在一个路径外消息。先求出接收者选择某行动所需要的信念区间,再看这个反应能否阻止两种发送者偏离。

所以答案不能只写“双方都发 RR”。完整答案至少包括:

  • 发送者每种类型发什么;
  • 接收者看到每种消息后做什么;
  • 每个信息集上的信念;
  • Bayes 更新和双方无偏离条件。

8. 为什么路径外信念这么重要

在混同均衡中,均衡路径没有告诉我们另一条消息来自哪种类型。如果接收者相信“只有坏类型才会偏离”,他可能用严厉行动回应,于是没有类型愿意偏离;如果接收者相信“只有好类型才会偏离”,同一个候选策略可能立刻崩溃。

PBE 允许一些路径外信念,因此有时仍然留下太多均衡。后面要学的直观标准、序贯均衡和颤抖手精炼,就是继续限制这些不合理信念。

9. 信号博弈题的解题步骤

遇到信号博弈题,可以直接写成下面六行:

  1. 候选发送者策略是混同还是分离;
  2. 用 Bayes 法则写出路径内信念;
  3. 比较接收者期望收益,得到信念阈值和最优行动;
  4. 写出每种发送者的激励相容条件;
  5. 对混同候选补路径外信念区间;
  6. 汇总完整的策略与信念系统,并声明满足序贯理性与一致性。

求解时的因果顺序是:消息改变信念,信念改变接收者的行动,发送者再根据对这种反应的预期选择消息。

评论