第 5 讲 · 听觉和言语
语音不是一串分界清楚的字符。空气压力连续变化,相邻音素在发音中互相影响,说话人、语速、情绪和环境噪声都在改变波形。听觉系统要从这个连续信号中恢复音高、音色、方向、语音单位和话语意图。
从空气振动到神经发放
声波 → 鼓膜 → 听小骨 → 耳蜗液体波动
→ 基底膜不同位置响应 → 毛细胞转导 → 听神经
耳蜗对频率有空间化组织:不同频率在基底膜上的最大响应位置不同。这种频率拓扑在后续听觉通路中部分保留。
听觉信号经脑干、中脑和丘脑到达听皮层。脑干层面已在比较两耳到达时间和强度差,用于声源定位。因此“中枢处理”不是声音到了大脑皮层才开始。
语音编码为什么难
同一音素在不同上下文中波形不同,相邻音素的发音动作会重叠,这是协同发音。另一方面,不同声学线索又可能被知觉为同一语音类别。
语音知觉因此同时依赖:
- 频谱、时长、基频、共振峰等自下而上线索;
- 词汇和句法预期;
- 语境与说话人模型;
- 视觉口型等多模态信息。
在噪声中,看到说话人口型可改变听到的语音,说明语音知觉不只是听觉通道的封闭处理。
韵律不是语句上的装饰
重音、节律、停顿和语调可以标记句子边界、焦点、疑问/陈述类型、说话人态度和情绪。同样的字词用不同语调说出,言语行为可能完全不同。
因此语音识别若只输出字词,会丢掉一部分意义;语音合成若只拼接音素而没有合适韵律,即使每个字发音正确,整句也会不自然或难理解。
语音识别:从波形到词序列
一个抽象的识别链路是:
波形 → 声学特征/学习表征 → 声学单元概率
→ 词典与语言模型约束 → 搜索最可能词序列
传统系统常显式区分声学模型、发音词典和语言模型;端到端系统可以联合学习波形到字符/子词的映射。两者都要处理分词边界、长程上下文、说话人变化和环境噪声。
语音合成:从语言结构到可听波形
合成系统不只要决定“读哪些音”,还要决定停顿、时长、重音、基频轨迹和音色。传统的参数合成、拼接合成与现代神经端到端方法实现不同,但共同目标是把文本和语境转成可懂、自然、符合说话人意图的声音。
对话系统的最小循环
语音/文本输入
→ 语义和意图理解
→ 对话状态更新
→ 决定下一个行动
→ 生成语句
→ 语音合成
对话不能每句都当成独立文本。“明天北京天气怎么样?”之后的“那后天呢?”依赖上一轮的地点和任务类型。对话状态就是对这些已知条件、未填槽位和当前目标的维护。
言语行为:说话本身也是做事
“我保证明天到”不只描述一个命题,它还执行了承诺。“这里有点冷”在某个语境中可能是请求关窗。
理解言语行为需要同时考虑:
- 字面命题内容;
- 说话人意图;
- 对话参与者共享的语境;
- 话语可能造成的社会行动。
这也是为什么语音识别率很高,仍不等于对话系统已经理解了人。