第 11 讲 · Transformer、GPT 与大模型
第 10 讲已经拆过 Transformer 的机械结构。我在这一讲不再重复 Q、K、V 的计算,而是换一个尺度看问题:同一种序列建模结构,在海量文本上做自监督预训练后,如何变成可迁移到许多任务的基础模型?
自监督:文本自己提供标签
语言数据不需要人工逐句标注,就能构造训练目标。GPT 类模型按前文预测下一个 token:
训练时的“答案”就是原文下一个 token。模型为了降低这项损失,需要学习语法、搭配、文体,也会吸收文本中反复出现的事实模式和任务格式。
BERT 与 GPT 的典型区别:
| 维度 | BERT 类 | GPT 类 |
|---|---|---|
| 主体结构 | Transformer Encoder | Transformer Decoder |
| 上下文 | 双向看可见 token | 因果掩码,只看左侧 |
| 典型预训练 | 遮盖词恢复 | 下一个 token 预测 |
| 天然用途 | 表示、理解、分类 | 自回归生成 |
这只是典型范式,不表示所有后续模型都严格落在两个框里。
从预训练模型到可用助手
课程把能力适配分为几层:
- 预训练:在大规模文本上学习通用语言分布;
- 任务微调:用某个任务的输入输出调整参数;
- 提示学习:不改或少改参数,用指令、示例和上下文指定任务;
- 指令微调:用大量“指令—回答”样本,让模型学会服从任务描述;
- 人类反馈对齐:利用人类偏好比较训练奖励信号,再优化回答倾向。
RLHF 不是把“人类价值”完整写进模型。它通常从有限标注者、有限问题和某种奖励建模流程中得到偏好信号,因此同样会受数据和目标定义影响。
In-context Learning 和思维链
在提示中给几个示例,模型无需更新参数就能继续相同格式,这叫 in-context learning。课件尝试从“隐式贝叶斯推断”等视角解释:模型可能根据上下文猜测当前任务,再按这个任务生成。不过这是理解现象的一种研究假说,不应当作已经完整证明的内部机制。
思维链提示要求先给中间步骤再给结论,对部分多步任务有效。它能提供可检查的推导文本,却不保证这些文字就是模型内部真实因果过程,也不保证最终答案正确。判断仍要依靠外部计算、检索或事实验证。
“涌现”应该怎样谨慎理解
课件从微观、介观和宏观层次讨论规模增长后的能力变化,并把前馈网络类比为键值记忆、把隐式概念看成分布式表示。这里需要区分三件事:
- 参数、数据和计算增加后,平均性能逐步提升;
- 指标设有硬阈值,连续提升在图上看起来像突然出现;
- 某些任务确实可能在足够规模后出现明显转折。
“大模型能力会不会涌现、怎样涌现”仍依赖任务、指标和实验设计。课程给出的解释是理解路线,不是对所有模型都成立的定论。
能生成,不等于能保证真实
自回归训练优化的是“下一个 token 在训练分布中是否可能”,不是“陈述是否经过事实核验”。因此模型可能生成语法顺畅但事实错误的内容,也就是常说的幻觉。其他边界还包括:
- 对训练分布和提示措辞敏感;
- 统计关联强不等于掌握因果机制;
- 长链精确计算和严格逻辑可能失误;
- 训练数据会带来偏见、版权和隐私问题;
- 训练与推理消耗大量算力;
- 行为对齐不能只靠一句系统提示。
比较稳妥的系统会把大模型放进一个可验证流程:检索提供来源,工具完成精确计算,结构化输出受 schema 约束,高风险动作要求人工确认,最终结果保留审计记录。
课件展望的组合路线
课件提出模块化或混合专家、神经—符号结合、知识图谱纠错、群体知识等方向。它们的共同出发点是:单纯扩大一个端到端模型并不能自然解决所有可靠性问题。
- 稀疏专家让不同子网络处理不同输入,控制每次计算量;
- 神经—符号方法把模式识别和明确规则结合;
- 知识图谱或检索系统提供可更新、可追踪的外部事实;
- 多智能体尝试分工与互检,但也会引入通信成本和错误传播。
大模型是课程中“从数据学习”路线的高点。接下来的搜索与强化学习会把视角从生成一个输出,转向选择一串会改变世界状态的行动。