第六讲 · 重复博弈与讨价还价

Views: --

一次性囚徒困境里,背叛是占优策略;现实中的企业、国家和个人却经常合作。关键差别是:大家知道今天之后还会再见,未来的奖励和惩罚会进入今天的收益计算

一、重复的不是矩阵,而是关系

给定阶段博弈 GG,把它进行 TT 次得到有限重复博弈 G(T)G(T);无限进行并以贴现因子 δ\delta 折算未来收益,得到 G(,δ)G(\infty,\delta)

重复博弈中,策略不能只写“每期选 CC”。它必须根据历史决定下一步:

sit:ht1Ai,s_i^t:h^{t-1}\longrightarrow A_i,

其中 ht1h^{t-1} 是前 t1t-1 期所有公开行动组成的历史。

所以重复博弈真正增加的不是新动作,而是大量以历史为条件的策略:对方合作过、背叛过、是否重新合作,都会改变下一期行动。

两阶段重复博弈的博弈树

图:第一阶段每个结果都会开启一个新的第二阶段子博弈,完整策略必须覆盖所有历史。

二、有限重复:最后一期会把结论向前传

若阶段博弈只有唯一 Nash 均衡,最后一期没有未来可用于奖惩,只能选择阶段 Nash 均衡。倒推到倒数第二期,既然最后一期已经确定,当前偏离也改变不了后续,于是仍选择阶段均衡。一直倒推可得:

唯一阶段 Nash 均衡会在有限重复博弈的每一期重复出现。

这就是有限重复囚徒困境中合作难以维持的原因。最后一期一定背叛,倒数第二期的合作也失去价值,逻辑一路传到第一期。

三、多个阶段均衡可以提供可信奖惩

若阶段博弈有多个 Nash 均衡,结论会改变。最后一期虽然仍必须选择某个阶段均衡,但可以根据前一期历史选择不同的阶段均衡:

  • 守约后进入对双方更好的均衡;
  • 某人偏离后进入对偏离者更差的均衡。

只要每个续局本身都是阶段 Nash 均衡,奖惩到最后一期仍然会被执行,因此可信。这样就可能在较早阶段支撑一个本来不是阶段 Nash 均衡的合作结果。

检验方法是一次偏离原则:

  1. 先确认每个最后一期续局都是阶段 Nash 均衡;
  2. 比较第一期守约的总收益与最佳单次偏离的总收益;
  3. 两位参与人都没有获利偏离,完整策略就是 SPNE。

课程第二次作业正是这个结构。

四、无限重复:为什么“永远以后”有力量

无限重复没有确定的最后一期,逆向归纳找不到起点。若每期收益为 uitu_i^t,常用贴现总收益

Ui=t=1δt1uit,0<δ<1.U_i=\sum_{t=1}^{\infty}\delta^{t-1}u_i^t, \qquad 0<\delta<1.

δ\delta 越大,参与人越重视未来;越小,则越像只看眼前。

将所有收益乘以 1δ1-\delta 得到归一化平均收益,不会改变策略比较,只会让量纲更直观。

五、冷酷触发策略

冷酷触发策略的规则是:

  1. 初始选择合作;
  2. 只要所有人过去一直合作,继续合作;
  3. 一旦任何人背叛,此后永远进入阶段 Nash 均衡作为惩罚。

设合作的单期收益为 RR,当前背叛的最高收益为 TT,惩罚期收益为 PP。一直合作得到

R1δ.\frac{R}{1-\delta}.

现在背叛得到

T+δP1δ.T+\frac{\delta P}{1-\delta}.

合作可持续当且仅当

R1δT+δP1δ,\frac{R}{1-\delta} \ge T+\frac{\delta P}{1-\delta},

δTRTP.\delta\ge\frac{T-R}{T-P}.

这个阈值非常值得理解:

  • 背叛的即时诱惑 TRT-R 越大,需要越有耐心;
  • 合作与惩罚的差距 RPR-P 越大,未来威慑越强;
  • 观察不到偏离或惩罚无法执行时,触发策略就失效。

六、胡萝卜加大棒与可行收益

冷酷触发不是唯一策略。还可以设计有限期惩罚、逐步恢复合作,或者按偏离者身份选择不同惩罚。

重复博弈的一般思想是:若参与人足够重视未来,许多同时满足以下条件的收益都可能被某种均衡策略支撑:

  • 位于阶段收益组合的可行集合中;
  • 每个人得到的收益不低于他能保证的最低水平。

这类结论常被概括为“民间定理”的方向。速成时不必背最一般的技术条件,但要知道它在说:长期关系把可持续结果从一个点扩大成一片区域

七、一报还一报为什么直观有效

Axelrod 的重复囚徒困境竞赛中,“一报还一报”表现突出。它的规则很短:

  1. 第一期合作;
  2. 以后复制对方上一期的行动。

它同时具有四个特点:

  • 友善:不首先背叛;
  • 报复:对背叛立即回应;
  • 宽容:对方恢复合作后也恢复;
  • 清晰:对手容易理解行动后果。

它并非在所有噪声环境下都最优。若行动可能被误判,双方可能陷入轮流报复,需要加入宽容或随机修复机制。

八、轮流报价的讨价还价

两人分一单位利益。参与人 1 先报价,参与人 2 接受则结束;拒绝后轮到参与人 2 报价。等待会使收益按各自贴现因子 δ1,δ2\delta_1,\delta_2 折损。

设参与人 1 在自己报价时最终得到的份额为 xx,在参与人 2 报价时得到 yy。均衡中,报价人只需让对方刚好愿意接受:

y=δ1x,y=\delta_1x, 1x=δ2(1y).1-x=\delta_2(1-y).

联立可得

x=1δ21δ1δ2,1x=δ2(1δ1)1δ1δ2.x=\frac{1-\delta_2}{1-\delta_1\delta_2}, \qquad 1-x=\frac{\delta_2(1-\delta_1)}{1-\delta_1\delta_2}.

若两人同样耐心,δ1=δ2=δ\delta_1=\delta_2=\delta,则第一位报价者获得

x=11+δ.x=\frac{1}{1+\delta}.

结论非常直观:

  • 越有耐心,拒绝当前报价的成本越低,谈判地位越强;
  • 越缺乏耐心,越愿意接受较差方案;
  • 先报价通常带来优势,但当双方都接近完全耐心时,优势缩小。

九、重复博弈的解题模板

有限重复

  1. 先找阶段博弈的全部 Nash 均衡;
  2. 从最后一期开始,保证每个历史后的续局都是阶段均衡;
  3. 再比较前一期守约与偏离的总收益;
  4. 写清“每种历史后做什么”,不要只写均衡路径。

无限重复

  1. 明确合作收益、偏离收益和惩罚收益;
  2. 写合作现值;
  3. 写“当前偏离一次 + 以后受罚”的现值;
  4. 解出 δ\delta 的阈值;
  5. 检查惩罚路径本身是否可信。

重复博弈的核心不是“大家变善良”,而是未来收益改变了今天的最优反应。

评论