第 7 讲 · 学习

学习的核心不是“经历过”,而是经验使系统发生了相对持久、可在后续任务中表现出来的变化。同一个学习现象可以在行为、内部表征、神经可塑性或算法层次上描述。

行为学派:学到刺激、反应与结果的关系

经典条件作用

原本中性的刺激与能自然引发反应的刺激反复同时出现,之后中性刺激单独出现也能引发反应。它强调刺激之间的预测关系。

操作性条件作用

行为后果改变该行为以后出现的可能性。正强化是加入有价值的结果,负强化是移除厌恶刺激;两者都在增加行为。惩罚才是为了降低行为。“负强化 = 惩罚”是最常见的概念错位。

强化时程会塑造行为:每次都给强化学得快,但停止强化后可能快速消退;不定比率强化可形成高频、难消退的反应。

认知学派:学习会改变内部结构

对行为只做刺激—反应描述,难以解释潜伏学习、顿悟、策略迁移和错误规则。认知学派强调,个体会构建地图、概念、图式和问题结构;行为是这些内部改变在当前任务中的表现。

例如老鼠在迷宫中没有奖励时也可能学到空间结构,等之后奖励出现才在行为中快速显现。这区分了“学到了”和“当前表现出来”。

人本主义:学习者的目标、意义和自我实现

人本主义路线关注学习者作为整体的需求、情绪、选择和主动性。教学不只是外部控制或信息灌输,而是提供安全、真实、能自我发现的环境。

它提醒我们,同一套强化或讲解对不同目标和自我效能感的学习者不会产生同样效果。但它中的宽泛概念也需要转成可测量变量,才能进入实证检验。

观察学习:不必亲自试遍每个后果

人可以通过观察榜样的行为和结果学习。这个过程不是简单模仿,至少需要:

  1. 注意到榜样行为的关键特征;
  2. 将行为编码并保存;
  3. 具备复现所需的动作或认知能力;
  4. 有执行动机,并根据榜样后果调整。

因此看了一次演示不代表已经学会;学习还受注意、记忆、身份认同和预期结果影响。

内省学习:对自己的学习过程再建模

课件中的内省学习关注系统如何检查已经完成的推理或行动,提取“为什么成功/失败”的解释,并将其转成新策略。

人的元认知也在做类似工作:我是否真的懂了?哪个步骤最容易错?下次应该先检查什么?有效内省需要行为证据校准,否则容易变成自信但不准确的事后故事。

强化学习:从交互中学长期价值

在状态 sts_t 选动作 ata_t,环境返回奖励 rt+1r_{t+1} 和下一状态 st+1s_{t+1}。智能体的目标不是只贪当前奖励,而是最大化折扣回报:

Gt=∑k=0∞γkrt+k+1.G_t=\sum_{k=0}^{\infty}\gamma^k r_{t+k+1}.

价值函数估计一个状态或动作对未来回报的影响。时序差分学习用“奖励 + 下一状态估值”修正当前估值。其核心难点是探索与利用、延迟奖励的责任分配、状态表征和环境变化。

深度学习:表征和任务一起学

多层神经网络通过误差反向传播调整参数,能从图像、语音和文本中学习分层表征。这降低了手工设计特征的需求,但不会自动带来因果理解、少样本学习、可解释推理和稳健迁移。

认知机器学习:把多种学习机制放进同一个体系

认知系统不只靠一种学习:统计相关帮助感知,奖励形成价值,案例支持类比,规则练习形成自动化技能,内省提取更高层策略。

因此“认知机器学习”的理想是整合多种记忆、表征和学习通路,让系统不只在固定数据集上拟合,还能持续交互、迁移、解释和自我调节。

评论