第十讲 · 信号博弈的应用、均衡再精炼与信誉

信号不是“说了什么”,而是一个掌握私人信息的人做出的、会影响别人判断的可观察行动。一个行动能否传递信息,关键不在于它看起来多醒目,而在于:不同类型模仿它的成本是否不同。

1. 教育信号:能力没有变,工资为什么变了

Spence 教育信号模型中,劳动者知道自己的能力,企业只观察学历或受教育程度。教育未必直接提高生产率,但高能力者取得同样学历的成本更低,因此学历可能把两种类型分开。

教育作为能力信号

设高、低能力者分别为 HH、LL,教育程度为 ee,工资为 ww,教育成本为 c(e,t)c(e,t)。分离均衡希望高能力者选择 eHe_H,低能力者选择 eLe_L,且企业据此支付 wHw_H、wLw_L。

高能力者不模仿低教育的条件是

wH−c(eH,H)≥wL−c(eL,H).w_H-c(e_H,H) \ge w_L-c(e_L,H).

低能力者不模仿高教育的条件是

wL−c(eL,L)≥wH−c(eH,L).w_L-c(e_L,L) \ge w_H-c(e_H,L).

这两条不等式能同时成立的根本原因是:高能力者取得额外教育的成本增量更低。

教育在这里可能具有私人价值,却没有创造同等规模的社会价值。个人为了证明自己而支付成本,企业只是据此重新识别类型。这也是信号模型经常揭示的“筛选成本”。

2. 价格信号:这份课件里传递质量的是低价

课件讨论的是一个两期垄断定价模型。产品质量可能为好 GG 或差 BB;好产品给消费者带来的价值为 XX,差产品的价值为 00。单位成本满足

cG>cB.c_G>c_B.

消费者第一期只观察价格。若第一期购买,就会在使用后知道质量;第二期好产品可按 XX 定价,差产品则没有市场。若第一期不买,第二期也不再购买。

因此,这里不能用“高价暗示高质量”的日常直觉。课件给出的分离思路恰好相反:

  • 差质量厂商不生产;
  • 好质量厂商第一期定一个足够低的价格 p1p_1,诱使消费者试用;
  • 消费者把这个低价解释为好质量并购买;
  • 质量被验证后,好质量厂商在第二期获得复购利润。

若未来收益贴现因子为 δ\delta,好质量厂商采用低价时的两期利润是

p1−cG+δ(X−cG).p_1-c_G+\delta(X-c_G).

差质量厂商模仿后没有第二期市场,只能得到

p1−cB.p_1-c_B.

所以一个直观的分离价格区间由两条条件夹出:

p1−cB<0,p1−cG+δ(X−cG)≥0.p_1-c_B<0, \qquad p_1-c_G+\delta(X-c_G)\ge0.

也就是低价必须让差质量厂商模仿时亏损,同时好质量厂商能靠第二期利润覆盖第一期损失。如果未来利润不足以弥补早期亏损,好质量厂商也不会生产,这个分离均衡就不存在。

价格在这个模型里既是交易条件,也是“先亏一点让你试用”的信号。信号方向由两种类型的跨期收益差决定,并不存在“价格越高,质量越好”的通用规则。

3. 资本结构信号:为什么负债可能传递好消息

企业管理者比外部投资者更清楚企业质量。较高负债意味着更高的破产风险,但优质企业预期现金流更稳,承担相同负债的预期破产成本更低。因此,负债水平可能成为企业质量的信号。

逻辑和教育信号完全相同:

  1. 不同类型企业承担信号的成本不同;
  2. 投资者观察负债水平并更新信念;
  3. 市场估值随信念变化;
  4. 各类型企业比较估值收益和负债成本,决定是否模仿。

如果劣质企业也能无成本地复制同样的资本结构,负债就不能持续传递信息。

4. 空谈:没有直接成本的话也可能有信息

空谈指消息本身不直接改变收益,也没有直接发送成本。乍看之下,所有类型都可以随口撒谎,似乎不可能传递任何信息;但只要发送者与接收者的偏好并非完全对立,仍可能存在部分信息传递。

有效空谈通常需要三个条件:

  • 发送者不同类型希望接收者采取不同的行动;
  • 接收者的最优行动会随信念改变;
  • 双方偏好存在一定共同利益,而不是处处完全相反。

偏好越接近,消息划分通常越细,能传递的信息越多;利益冲突越大,均衡越接近毫无信息的混同。

5. 为什么还要继续精炼 PBE

PBE 要求路径内信念服从 Bayes 法则,却可能允许很牵强的路径外信念。于是,一些混同均衡完全依赖这样的故事:“如果看见均衡中没人会发的消息,我就坚信它来自最不可能获益的类型。”

均衡再精炼的目标,就是判断这种路径外故事是否合理。

6. 直观标准

直观标准的核心问题是:偏离到某个路径外消息后,哪些类型可能从偏离中获益,哪些类型无论接收者怎么合理回应都不可能获益?

如果某种类型无论如何都不可能通过偏离改善收益,那么接收者观察到该偏离时,就不应该把正概率放在这种类型上。

课件中的啤酒或热狗信号博弈

以课件中的“啤酒或热狗”信号博弈为例,检查一个混同均衡时可以这样做:

  1. 找到路径外行动;
  2. 分别计算各类型偏离后可能得到的最好结果;
  3. 排除那些即使得到最有利回应也不会偏离的类型;
  4. 把路径外信念集中到仍可能偏离的类型上;
  5. 重新检查接收者最优反应和发送者激励。

如果这样一更新,原来的混同均衡无法维持,它就被直观标准排除。

7. 序贯均衡与颤抖手精炼

7.1 序贯均衡

序贯均衡要求策略完全混合序列的极限同时生成策略与信念。直觉上,任何行动都被看作有极小概率发生,因此即使是路径外信息集,也能通过 Bayes 法则获得由“微小失误”推导出的信念。

它比一般 PBE 更强调信念与整个策略系统的一致来源。

7.2 颤抖手完美均衡

颤抖手的想法是:每个玩家都有极小概率按错按钮。一个均衡若在这些微小错误存在时仍然是最优反应的极限,才足够稳健。

它主要排除依赖弱劣策略或极端脆弱威胁的 Nash 均衡。做题时不必把定义想得神秘:先给所有纯行动一个极小正概率,再问原均衡是否能作为扰动博弈均衡的极限留下来。

8. 不完全信息谈判:拖延也能传递类型

在谈判中,一方可能不知道另一方的耐心程度、外部机会或估值。报价和拒绝不只是分配动作,也会改变对方对其类型的判断。

例如,一个更有耐心的谈判者更能承受等待,因此拒绝较低报价可能成为“我很有耐心”的信号。对方观察到拒绝后提高对耐心类型的后验概率,后续报价随之改变。

所以现实中的延迟不一定只是低效率,也可能是筛选不同类型所付出的信息成本。

9. 有限重复博弈中的信誉

完全信息下,有限次重复囚徒困境用逆向归纳会得到每一期都背叛。但如果对手有极小概率是一个“无论如何都会合作或惩罚”的承诺型玩家,结论可能改变。

不完全信息重复博弈中的信誉模型

理性玩家在早期也可能模仿承诺型玩家:

  1. 对手事先不能完全确定他的类型;
  2. 合作或强硬行动提高“他是承诺型”的后验概率;
  3. 这个信誉改变对手未来的最优反应;
  4. 理性类型为了获得未来收益,愿意暂时维持信誉;
  5. 越接近最后一期,维持信誉的价值越小,行为才逐渐回到一次博弈的结果。

这类模型的关键结论是:少量类型不确定性,可能在有限期限内制造长期的战略行为。

10. 应用题的判断顺序

看到教育、价格、负债、报价、广告、拒绝或强硬行动时,按以下顺序判断:

  1. 谁掌握私人信息,类型是什么;
  2. 什么行动能被别人观察到;
  3. 不同类型采取该行动的成本或收益是否不同;
  4. 接收者观察行动后如何更新信念;
  5. 信念变化是否真的改变接收者行动;
  6. 各类型是否愿意遵守候选信号策略;
  7. 路径外信念是否经得起直观标准等进一步精炼。

如果所有类型都能以相同成本模仿,信号就很难可信;如果行动既能区分类型,又会改变接收者反应,它才可能形成有效信号。

评论