第 4 讲 · 视觉和注意
看见不是相机把世界完整拍进大脑。视网膜收到的是二维光强分布,而认知系统却要从中得到物体、边界、深度、运动和意义。这是一个从不完全证据推断原因的问题。
感觉、知觉、表象是三个层次
- 感觉是感受器对亮度、颜色、方向等局部特性的响应;
- 知觉是将这些线索组织成“一只杯子在桌上”这样的对象和关系;
- 表象是杯子不在眼前时,内部仍可重现其形状和位置。
自下而上的输入和自上而下的预期一起决定知觉。在模糊图像中,一句提示能突然让人“看出”对象,就说明视觉不只是前馈过滤。
视觉通路如何逐步改写信息
光经角膜和晶状体成像在视网膜上。感光细胞将光转成神经信号,视网膜内部回路已经在比较局部亮度而不是简单复制像素。信号经视神经、视交叉和外侧膝状体到达初级视皮层,继续提取方向、空间频率等特征。
后续处理常被概括为两条相互联系的通路:
- 腹侧“什么”通路更关联对象和类别识别;
- 背侧“哪里/如何行动”通路更关联空间、运动与动作指导。
这是功能偏重,不是两套完全独立的管道。
格式塔:知觉组织不等于局部元素相加
靠近、相似、连续、封闭、共同命运等原则,描述了人如何把散落元素分组成整体。一圈有小缺口的弧段仍会被看成圆,是封闭倾向;同方向运动的点会被当作一组,是共同命运。
这些原则给出现象规律,但不一定已经给出实现这些规律的神经或计算机制。
拓扑知觉和整体性
课件介绍的拓扑视觉理论关注对象在连续变形中仍保持的性质,例如连通性、内外关系和洞的数量。圆形和方形可以连续变形互换,但一个圆环不能在不断开/粘合的情况下变成实心圆。
这条路线强调,视觉的早期组织可能对全局和拓扑属性敏感,不只是先识别每条局部边。
Marr 的视觉计算理论
Marr 将视觉理解为从图像逐步构造对象描述:
- 初始简图:从亮度变化中得到边缘、线段、斑点等基本元;
- D 简图:以观察者为中心,组合表面方向、深度和可见部分;
- 3D 模型表示:建立更独立于观察角度的对象结构。
他还区分了计算理论(系统为何解什么问题)、表示与算法(怎么算)、硬件实现(用什么物理机制算)。这个三层次框架不只适用于视觉,也是认知建模的通用工具。
注意:在信息和计算资源之间做选择
视野中的信息远多于系统能深度处理的部分。注意可以由显著的突发刺激自下而上捕获,也可以由当前目标自上而下调节。

将手电筒比喻成注意有帮助,但不完整:注意不只增强一块空间,还可以选择某种特征或物体,并影响感知、工作记忆和行动准备。注意也不等于意识:一些注意调制可在无明确可报告体验时发生。
与计算机视觉的关系
计算机视觉同样要从像素恢复结构和意义,但“模型分类准确”不能自动证明它与人的表征或注意机制相同。一个模型若要成为认知模型,除了任务性能,还应该预测人类错误、反应时、注意分配或神经活动。