第八讲 · 不完全信息静态博弈:贝叶斯 Nash 均衡

Views: --

完全信息博弈假设每个人都知道对手的收益函数。现实中,企业不知道对手成本,竞拍者不知道别人的估价,政府也不知道个人提供公共产品的成本。第九讲要解决的问题是:不知道自己正在和哪一种对手博弈时,理性策略应该怎样写?

一、把未知信息压缩成“类型”

参与人 ii 的类型 tiTit_i\in T_i 汇总了他的私人信息,例如:

  • 企业是高成本还是低成本;
  • 市场需求是高还是低;
  • 投标人对标的物的估价;
  • 决斗者是强硬还是软弱。

不同类型可以拥有不同收益函数,也可以拥有不同可行行动。每个人观察到自己的类型,但不一定观察到别人的类型。

贝叶斯博弈由以下对象组成:

G=N,(Ti),(Ai),(pi),(ui).G=\langle N,(T_i),(A_i),(p_i),(u_i)\rangle.

其中 pi(titi)p_i(t_{-i}\mid t_i) 表示参与人 ii 在知道自己类型后,对其他人类型的条件信念。

二、Harsanyi 转换

Harsanyi 的处理方法是在原博弈之前加入虚拟参与人“自然”:

  1. 自然按照共同先验选择类型组合 t=(t1,,tn)t=(t_1,\dots,t_n)
  2. 每位参与人只观察到自己的类型;
  3. 各参与人同时选择行动;
  4. 收益由行动和类型共同决定。

Harsanyi 转换后的自然节点与信息集

图:自然先决定参与人 2 是强硬还是软弱;参与人 1 看不到自然的选择,因此两个节点属于同一信息集。

转换并没有让参与人突然知道真相。它只是让建模者在一棵完整的树上表示“真实类型已经存在,但部分参与人看不到”。

三、共同先验与条件信念

设类型组合的共同先验为 p(t1,,tn)p(t_1,\dots,t_n)。参与人知道自己的类型 tit_i 后,用 Bayes 法则形成

pi(titi)=p(ti,ti)tip(ti,ti).p_i(t_{-i}\mid t_i) =\frac{p(t_i,t_{-i})} {\sum_{t_{-i}'}p(t_i,t_{-i}')}.

“共同先验”不是说大家得到相同的后验。不同的人看到不同私人类型,条件化以后自然会形成不同信念。共同的是信息出现之前对类型如何生成的概率模型。

四、策略是“类型到行动”的函数

完全信息静态博弈里,纯策略通常就是一个行动。不完全信息下,参与人在行动前会先看到自己的类型,所以必须为每种类型分别规定行动:

si:TiAi.s_i:T_i\longrightarrow A_i.

若类型为“强/弱”,行动为 U/DU/D,一位参与人就有四个纯策略:

(U,U), (U,D), (D,U), (D,D).(U,U),\ (U,D),\ (D,U),\ (D,D).

例如 (U,D)(U,D) 表示“强类型选 UU,弱类型选 DD”。它不是随机策略,而是一条依类型行动的确定规则。

这是求题时最常漏掉的一步:不能只列 U,DU,D,必须列完整的类型相依计划。

五、贝叶斯 Nash 均衡

策略组合 s=(s1,,sn)s^*=(s_1^*,\dots,s_n^*) 是纯策略贝叶斯 Nash 均衡,当且仅当对每位参与人、每一种类型,均衡行动都最大化该类型在其信念下的期望收益:

si(ti)argmaxaiAi(ti)tipi(titi)ui(ai,si(ti);ti,ti).s_i^*(t_i)\in \arg\max_{a_i\in A_i(t_i)} \sum_{t_{-i}} p_i(t_{-i}\mid t_i) u_i\bigl(a_i,s_{-i}^*(t_{-i});t_i,t_{-i}\bigr).

与普通 Nash 均衡相比,只多了两层:

  1. 对别人的未知类型求期望;
  2. 要对自己的每一种类型分别满足最优反应。

六、标准求解流程

第一步:列类型和先验

写清自然可能选什么,以及各类型组合的联合概率。

第二步:求条件信念

每位参与人观察到自己的类型后,重新计算对手类型的条件概率。

第三步:列完整策略

若每人两种类型、每种类型两个行动,每人有 22=42^2=4 个纯策略。

第四步:算期望收益

把每个策略组合在各类型状态下产生的收益,按联合概率加权。

第五步:找相互最优反应

得到的策略式矩阵可以像完全信息博弈一样划线;也可以直接逐类型写最优反应条件。

类型相依策略形成的贝叶斯标准式矩阵

图:矩阵中的一个“策略”已经包含参与人在不同类型下的完整行动规则。

七、不完全信息 Cournot

企业同时选择产量,但至少一家企业不知道对手成本或市场需求。假设企业 2 有高、低两种成本类型,企业 1 不知道具体类型。

企业 2 的策略必须分别给出

q2L,q2H,q_2^L,\qquad q_2^H,

企业 1 只选择一个产量 q1q_1,但会对企业 2 的产量取期望。求解时联立:

q2L=R2(q1;cL),q2H=R2(q1;cH),q_2^L=R_2(q_1;c_L), \qquad q_2^H=R_2(q_1;c_H),

以及企业 1 面对期望产量的反应条件。

低成本类型通常生产更多,高成本类型生产更少;不知情企业的产量则受类型概率影响。这里最重要的不是记某组数字,而是看见信息不对称如何进入反应函数。

八、私人成本下的公共产品

两位参与人同时决定是否提供公共产品,每个人只知道自己的提供成本 cic_i。一个常见纯策略均衡是阈值规则:

ai(ci)={1,cici,0,ci>ci.a_i(c_i)= \begin{cases} 1,&c_i\le c_i^*,\\ 0,&c_i>c_i^*. \end{cases}

成本低的人更愿意提供。临界类型 cic_i^* 恰好在“自己提供”和“指望对方提供”之间无差异。

求阈值时:

  1. 先用对方阈值计算对方提供的概率;
  2. 再让自己的临界类型在提供与不提供之间无差异;
  3. 对称模型中联立同一个阈值方程。

九、一级价格密封拍卖

每位投标人只知道自己的估价 viv_i,同时提交密封报价。最高报价者获胜并支付自己的报价。

假设有 nn 位风险中性投标人,估价独立且均匀分布在 [0,1][0,1]。寻找对称递增策略 b(v)b(v)。若类型为 vv 的投标人假装自己是类型 zz,报出 b(z)b(z),获胜概率为 zn1z^{n-1},期望收益为

(vb(z))zn1.(v-b(z))z^{n-1}.

在均衡中 z=vz=v 必须最优。一阶条件给出

b(v)=n1nv.b(v)=\frac{n-1}{n}v.

投标人不会报出全部估价,因为中标后还要保留正收益;参与人数越多,(n1)/n(n-1)/n 越接近 11,竞争使报价更接近真实估价。

十、用不完全信息解释混合策略

混合策略看起来像参与人主动掷骰子。Harsanyi 提供了另一种解释:每个人的收益中存在极小、对自己可见而对他人不可见的扰动。给定扰动后,每种类型都选择确定行动;对手看不到扰动,只能观察到总体行动概率。

当私人扰动趋近于零时,纯策略贝叶斯均衡产生的总体行动频率可以趋近原完全信息博弈的混合策略均衡。这被称为混合策略的净化解释

表面上的随机,可能只是观察者不知道参与人遭遇了哪一个微小私人偏好。

十一、一页速成

完全信息静态博弈不完全信息静态博弈
收益结构共同知道至少一部分收益相关信息是私人类型
策略通常是一个行动策略是类型到行动的函数
对给定对手策略求最优反应对对手类型和策略求期望后再求最优反应
解是 Nash 均衡解是贝叶斯 Nash 均衡

遇到贝叶斯博弈,先把“谁不知道什么”翻译成类型和信息,再开始计算。直接在原故事上猜行为,通常会漏掉条件信念或完整策略。

评论