第 11 讲 · Transformer、GPT 与大模型

第 10 讲已经拆过 Transformer 的机械结构。我在这一讲不再重复 Q、K、V 的计算,而是换一个尺度看问题:同一种序列建模结构,在海量文本上做自监督预训练后,如何变成可迁移到许多任务的基础模型?

自监督:文本自己提供标签

语言数据不需要人工逐句标注,就能构造训练目标。GPT 类模型按前文预测下一个 token:

L=−∑tlog⁡P(xt∣x<t)\mathcal L=-\sum_t\log P(x_t\mid x_{<t})

训练时的“答案”就是原文下一个 token。模型为了降低这项损失,需要学习语法、搭配、文体,也会吸收文本中反复出现的事实模式和任务格式。

BERT 与 GPT 的典型区别:

维度BERT 类GPT 类
主体结构Transformer EncoderTransformer Decoder
上下文双向看可见 token因果掩码,只看左侧
典型预训练遮盖词恢复下一个 token 预测
天然用途表示、理解、分类自回归生成

这只是典型范式,不表示所有后续模型都严格落在两个框里。

从预训练模型到可用助手

课程把能力适配分为几层:

  1. 预训练:在大规模文本上学习通用语言分布;
  2. 任务微调:用某个任务的输入输出调整参数;
  3. 提示学习:不改或少改参数,用指令、示例和上下文指定任务;
  4. 指令微调:用大量“指令—回答”样本,让模型学会服从任务描述;
  5. 人类反馈对齐:利用人类偏好比较训练奖励信号,再优化回答倾向。

RLHF 不是把“人类价值”完整写进模型。它通常从有限标注者、有限问题和某种奖励建模流程中得到偏好信号,因此同样会受数据和目标定义影响。

In-context Learning 和思维链

在提示中给几个示例,模型无需更新参数就能继续相同格式,这叫 in-context learning。课件尝试从“隐式贝叶斯推断”等视角解释:模型可能根据上下文猜测当前任务,再按这个任务生成。不过这是理解现象的一种研究假说,不应当作已经完整证明的内部机制。

思维链提示要求先给中间步骤再给结论,对部分多步任务有效。它能提供可检查的推导文本,却不保证这些文字就是模型内部真实因果过程,也不保证最终答案正确。判断仍要依靠外部计算、检索或事实验证。

“涌现”应该怎样谨慎理解

课件从微观、介观和宏观层次讨论规模增长后的能力变化,并把前馈网络类比为键值记忆、把隐式概念看成分布式表示。这里需要区分三件事:

  • 参数、数据和计算增加后,平均性能逐步提升;
  • 指标设有硬阈值,连续提升在图上看起来像突然出现;
  • 某些任务确实可能在足够规模后出现明显转折。

“大模型能力会不会涌现、怎样涌现”仍依赖任务、指标和实验设计。课程给出的解释是理解路线,不是对所有模型都成立的定论。

能生成,不等于能保证真实

自回归训练优化的是“下一个 token 在训练分布中是否可能”,不是“陈述是否经过事实核验”。因此模型可能生成语法顺畅但事实错误的内容,也就是常说的幻觉。其他边界还包括:

  • 对训练分布和提示措辞敏感;
  • 统计关联强不等于掌握因果机制;
  • 长链精确计算和严格逻辑可能失误;
  • 训练数据会带来偏见、版权和隐私问题;
  • 训练与推理消耗大量算力;
  • 行为对齐不能只靠一句系统提示。

比较稳妥的系统会把大模型放进一个可验证流程:检索提供来源,工具完成精确计算,结构化输出受 schema 约束,高风险动作要求人工确认,最终结果保留审计记录。

课件展望的组合路线

课件提出模块化或混合专家、神经—符号结合、知识图谱纠错、群体知识等方向。它们的共同出发点是:单纯扩大一个端到端模型并不能自然解决所有可靠性问题。

  • 稀疏专家让不同子网络处理不同输入,控制每次计算量;
  • 神经—符号方法把模式识别和明确规则结合;
  • 知识图谱或检索系统提供可更新、可追踪的外部事实;
  • 多智能体尝试分工与互检,但也会引入通信成本和错误传播。

大模型是课程中“从数据学习”路线的高点。接下来的搜索与强化学习会把视角从生成一个输出,转向选择一串会改变世界状态的行动。

评论