第十讲 · 信号博弈的应用、均衡再精炼与信誉
信号不是“说了什么”,而是一个掌握私人信息的人做出的、会影响别人判断的可观察行动。一个行动能否传递信息,关键不在于它看起来多醒目,而在于:不同类型模仿它的成本是否不同。
1. 教育信号:能力没有变,工资为什么变了
Spence 教育信号模型中,劳动者知道自己的能力,企业只观察学历或受教育程度。教育未必直接提高生产率,但高能力者取得同样学历的成本更低,因此学历可能把两种类型分开。

设高、低能力者分别为 、,教育程度为 ,工资为 ,教育成本为 。分离均衡希望高能力者选择 ,低能力者选择 ,且企业据此支付 、。
高能力者不模仿低教育的条件是
低能力者不模仿高教育的条件是
这两条不等式能同时成立的根本原因是:高能力者取得额外教育的成本增量更低。
教育在这里可能具有私人价值,却没有创造同等规模的社会价值。个人为了证明自己而支付成本,企业只是据此重新识别类型。这也是信号模型经常揭示的“筛选成本”。
2. 价格信号:价格不只负责成交
在产品质量不可观察时,高质量企业有时会用价格传递质量信息。这里的价格同时承担两种功能:
- 作为市场交易条件,影响销量和利润;
- 作为信号,改变消费者对质量的判断。
高价并不会天然代表高质量。要形成分离均衡,必须让低质量企业模仿高价的收益低于模仿成本。例如高质量企业可能更有能力承受早期低销量,或能通过复购获得更大的未来收益;低质量企业则无法从同样的定价策略中获利。
求解时仍然是三步:先根据价格形成后验信念,再求消费者购买决策,最后检查高、低质量企业是否愿意遵守各自的定价策略。
3. 资本结构信号:为什么负债可能传递好消息
企业管理者比外部投资者更清楚企业质量。较高负债意味着更高的破产风险,但优质企业预期现金流更稳,承担相同负债的预期破产成本更低。因此,负债水平可能成为企业质量的信号。
逻辑和教育信号完全相同:
- 不同类型企业承担信号的成本不同;
- 投资者观察负债水平并更新信念;
- 市场估值随信念变化;
- 各类型企业比较估值收益和负债成本,决定是否模仿。
如果劣质企业也能无成本地复制同样的资本结构,负债就不能持续传递信息。
4. 空谈:没有直接成本的话也可能有信息
空谈指消息本身不直接改变收益,也没有直接发送成本。乍看之下,所有类型都可以随口撒谎,似乎不可能传递任何信息;但只要发送者与接收者的偏好并非完全对立,仍可能存在部分信息传递。
有效空谈通常需要三个条件:
- 发送者不同类型希望接收者采取不同的行动;
- 接收者的最优行动会随信念改变;
- 双方偏好存在一定共同利益,而不是处处完全相反。
偏好越接近,消息划分通常越细,能传递的信息越多;利益冲突越大,均衡越接近毫无信息的混同。
5. 为什么还要继续精炼 PBE
PBE 要求路径内信念服从 Bayes 法则,却可能允许很牵强的路径外信念。于是,一些混同均衡完全依赖这样的故事:“如果看见均衡中没人会发的消息,我就坚信它来自最不可能获益的类型。”
均衡再精炼的目标,就是判断这种路径外故事是否合理。
6. 直观标准
直观标准的核心问题是:偏离到某个路径外消息后,哪些类型可能从偏离中获益,哪些类型无论接收者怎么合理回应都不可能获益?
如果某种类型无论如何都不可能通过偏离改善收益,那么接收者观察到该偏离时,就不应该把正概率放在这种类型上。

以课件中的“啤酒或热狗”信号博弈为例,检查一个混同均衡时可以这样做:
- 找到路径外行动;
- 分别计算各类型偏离后可能得到的最好结果;
- 排除那些即使得到最有利回应也不会偏离的类型;
- 把路径外信念集中到仍可能偏离的类型上;
- 重新检查接收者最优反应和发送者激励。
如果这样一更新,原来的混同均衡无法维持,它就被直观标准排除。
7. 序贯均衡与颤抖手精炼
7.1 序贯均衡
序贯均衡要求策略完全混合序列的极限同时生成策略与信念。直觉上,任何行动都被看作有极小概率发生,因此即使是路径外信息集,也能通过 Bayes 法则获得由“微小失误”推导出的信念。
它比一般 PBE 更强调信念与整个策略系统的一致来源。
7.2 颤抖手完美均衡
颤抖手的想法是:每个玩家都有极小概率按错按钮。一个均衡若在这些微小错误存在时仍然是最优反应的极限,才足够稳健。
它主要排除依赖弱劣策略或极端脆弱威胁的 Nash 均衡。做题时不必把定义想得神秘:先给所有纯行动一个极小正概率,再问原均衡是否能作为扰动博弈均衡的极限留下来。
8. 不完全信息谈判:拖延也能传递类型
在谈判中,一方可能不知道另一方的耐心程度、外部机会或估值。报价和拒绝不只是分配动作,也会改变对方对其类型的判断。
例如,一个更有耐心的谈判者更能承受等待,因此拒绝较低报价可能成为“我很有耐心”的信号。对方观察到拒绝后提高对耐心类型的后验概率,后续报价随之改变。
所以现实中的延迟不一定只是低效率,也可能是筛选不同类型所付出的信息成本。
9. 有限重复博弈中的信誉
完全信息下,有限次重复囚徒困境用逆向归纳会得到每一期都背叛。但如果对手有极小概率是一个“无论如何都会合作或惩罚”的承诺型玩家,结论可能改变。

理性玩家在早期也可能模仿承诺型玩家:
- 对手事先不能完全确定他的类型;
- 合作或强硬行动提高“他是承诺型”的后验概率;
- 这个信誉改变对手未来的最优反应;
- 理性类型为了获得未来收益,愿意暂时维持信誉;
- 越接近最后一期,维持信誉的价值越小,行为才逐渐回到一次博弈的结果。
这类模型的重要 insight 是:少量类型不确定性,可能在有限期限内制造长期的战略行为。
10. 把所有应用压缩成一个判断框架
看到教育、价格、负债、报价、广告、拒绝或强硬行动时,按以下顺序判断:
- 谁掌握私人信息,类型是什么;
- 什么行动能被别人观察到;
- 不同类型采取该行动的成本或收益是否不同;
- 接收者观察行动后如何更新信念;
- 信念变化是否真的改变接收者行动;
- 各类型是否愿意遵守候选信号策略;
- 路径外信念是否经得起直观标准等进一步精炼。
如果所有类型都能以相同成本模仿,信号就很难可信;如果行动既能区分类型,又会改变接收者反应,信号才真正有战略价值。