第六讲 · 重复博弈与讨价还价
一次性囚徒困境里,背叛是占优策略;现实中的企业、国家和个人却经常合作。关键差别是:大家知道今天之后还会再见,未来的奖励和惩罚会进入今天的收益计算。
一、重复的不是矩阵,而是关系
给定阶段博弈 ,把它进行 次得到有限重复博弈 ;无限进行并以贴现因子 折算未来收益,得到 。
重复博弈中,策略不能只写“每期选 ”。它必须根据历史决定下一步:
其中 是前 期所有公开行动组成的历史。
所以重复博弈真正增加的不是新动作,而是大量以历史为条件的策略:对方合作过、背叛过、是否重新合作,都会改变下一期行动。

图:第一阶段每个结果都会开启一个新的第二阶段子博弈,完整策略必须覆盖所有历史。
二、有限重复:最后一期会把结论向前传
若阶段博弈只有唯一 Nash 均衡,最后一期没有未来可用于奖惩,只能选择阶段 Nash 均衡。倒推到倒数第二期,既然最后一期已经确定,当前偏离也改变不了后续,于是仍选择阶段均衡。一直倒推可得:
唯一阶段 Nash 均衡会在有限重复博弈的每一期重复出现。
这就是有限重复囚徒困境中合作难以维持的原因。最后一期一定背叛,倒数第二期的合作也失去价值,逻辑一路传到第一期。
三、多个阶段均衡可以提供可信奖惩
若阶段博弈有多个 Nash 均衡,结论会改变。最后一期虽然仍必须选择某个阶段均衡,但可以根据前一期历史选择不同的阶段均衡:
- 守约后进入对双方更好的均衡;
- 某人偏离后进入对偏离者更差的均衡。
只要每个续局本身都是阶段 Nash 均衡,奖惩到最后一期仍然会被执行,因此可信。这样就可能在较早阶段支撑一个本来不是阶段 Nash 均衡的合作结果。
检验方法是一次偏离原则:
- 先确认每个最后一期续局都是阶段 Nash 均衡;
- 比较第一期守约的总收益与最佳单次偏离的总收益;
- 两位参与人都没有获利偏离,完整策略就是 SPNE。
课程第二次作业正是这个结构。
四、无限重复:为什么“永远以后”有力量
无限重复没有确定的最后一期,逆向归纳找不到起点。若每期收益为 ,常用贴现总收益
越大,参与人越重视未来;越小,则越像只看眼前。
将所有收益乘以 得到归一化平均收益,不会改变策略比较,只会让量纲更直观。
五、冷酷触发策略
冷酷触发策略的规则是:
- 初始选择合作;
- 只要所有人过去一直合作,继续合作;
- 一旦任何人背叛,此后永远进入阶段 Nash 均衡作为惩罚。
设合作的单期收益为 ,当前背叛的最高收益为 ,惩罚期收益为 。一直合作得到
现在背叛得到
合作可持续当且仅当
即
这个阈值非常值得理解:
- 背叛的即时诱惑 越大,需要越有耐心;
- 合作与惩罚的差距 越大,未来威慑越强;
- 观察不到偏离或惩罚无法执行时,触发策略就失效。
六、胡萝卜加大棒与可行收益
冷酷触发不是唯一策略。还可以设计有限期惩罚、逐步恢复合作,或者按偏离者身份选择不同惩罚。
重复博弈的一般思想是:若参与人足够重视未来,许多同时满足以下条件的收益都可能被某种均衡策略支撑:
- 位于阶段收益组合的可行集合中;
- 每个人得到的收益不低于他能保证的最低水平。
这类结论常被概括为“民间定理”的方向。速成时不必背最一般的技术条件,但要知道它在说:长期关系把可持续结果从一个点扩大成一片区域。
七、一报还一报为什么直观有效
Axelrod 的重复囚徒困境竞赛中,“一报还一报”表现突出。它的规则很短:
- 第一期合作;
- 以后复制对方上一期的行动。
它同时具有四个特点:
- 友善:不首先背叛;
- 报复:对背叛立即回应;
- 宽容:对方恢复合作后也恢复;
- 清晰:对手容易理解行动后果。
它并非在所有噪声环境下都最优。若行动可能被误判,双方可能陷入轮流报复,需要加入宽容或随机修复机制。
八、轮流报价的讨价还价
两人分一单位利益。参与人 1 先报价,参与人 2 接受则结束;拒绝后轮到参与人 2 报价。等待会使收益按各自贴现因子 折损。
设参与人 1 在自己报价时最终得到的份额为 ,在参与人 2 报价时得到 。均衡中,报价人只需让对方刚好愿意接受:
联立可得
若两人同样耐心,,则第一位报价者获得
结论非常直观:
- 越有耐心,拒绝当前报价的成本越低,谈判地位越强;
- 越缺乏耐心,越愿意接受较差方案;
- 先报价通常带来优势,但当双方都接近完全耐心时,优势缩小。
九、重复博弈的解题模板
有限重复
- 先找阶段博弈的全部 Nash 均衡;
- 从最后一期开始,保证每个历史后的续局都是阶段均衡;
- 再比较前一期守约与偏离的总收益;
- 写清“每种历史后做什么”,不要只写均衡路径。
无限重复
- 明确合作收益、偏离收益和惩罚收益;
- 写合作现值;
- 写“当前偏离一次 + 以后受罚”的现值;
- 解出 的阈值;
- 检查惩罚路径本身是否可信。
重复博弈的核心不是“大家变善良”,而是未来收益改变了今天的最优反应。