语音识别是通过计算将口头语言转换为书面文本的过程,通常称为自动语音识别(ASR)。它将音频处理与机器学习和自然语言处理相结合。其核心任务是确定说了什么,而不是识别说话者的身份或理解说话者的意图。因此,语音识别是口语交互界面的一个组成部分,本身未必构成完整的语言理解系统。(web.stanford.edu)
发展与范围
早期的语音识别系统只能在受控的说话条件下识别有限的词汇。IBM公司于1961年推出实验性的 Shoebox 设备,并在1962年西雅图世界博览会上展出。该设备能够识别十个数字和六个命令词的语音,让用户通过语音控制加法计算机。后来的研究从孤立词识别扩展到连续语音识别,使用户不必在词与词之间停顿。统计方法逐渐成为这一发展过程的核心,随后又出现了集成程度日益提高的神经网络系统。(ibm.com)
不同识别任务的难度差异很大。朗读语音、电话交谈、即兴会议发言和远距离麦克风录音,各有不同的声学与语言特征。词汇范围的限制也很重要:从几个命令中进行选择,与转写不受词汇限制的对话,是不同的任务。因此,识别得分反映的是特定条件下的表现,而非普遍适用的语音识别能力。(web.stanford.edu)
从音频到语言单位
语音录音以数字化波形表示。识别系统可以通过傅里叶变换,将相互重叠的短时片段转换为频域表示。常见的输入包括对数梅尔滤波器组能量和梅尔频率倒谱系数,它们概括了与语音声音相关的频谱特征。这种特征提取将原始信号转化为适合后续建模的序列;另一些神经网络系统则直接从波形采样值中学习表示。(web.stanford.edu)
声学序列与书面文本序列的长度并不相同。一个元音可能跨越许多音频帧,而一个词可能包含多个音位,且这些音位的实际发音会随相邻声音而变化。因此,系统必须同时解决声音辨识和时间对齐问题。输出可以是音位、字符、词,也可以是通过分词与词元化选定的子词单位。这些选择会影响词汇覆盖范围,以及发音与拼写之间的对应关系。(web.stanford.edu)
统计语音识别
传统的统计表述旨在寻找给定声学观测 (X) 时概率最高的词序列 (W):
[ \hat W=\arg\max_W P(W\mid X) =\arg\max_W P(X\mid W)P(W). ]
第二个表达式由贝叶斯定理推导而来,省略了对所有候选序列都相同的分母。声学模型提供音频的似然,语言模型提供词序列的概率,发音词典则将词与声音单位联系起来。(arxiv.org)
传统系统常用隐马尔可夫模型表示语音状态之间的演进,并用高斯混合模型描述声学观测。混合式系统保留基于状态的框架,同时用神经网络预测替代基于混合模型的声学部分。解码过程使用与动态规划相关的方法,包括维特比算法,搜索合理的路径。(arxiv.org)
神经网络与端到端模型
深度学习使识别系统能够学习更复杂的声学表示。端到端方法将从音频到输出符号的大部分映射整合到一个可训练的神经网络系统中,减少了对单独设计的组件的依赖。不过,这些方法在对齐假设、解码流程和外部语言模型的使用方面仍有差异。(arxiv.org)
连接时序分类(CTC)于2006年提出,是一种无需逐帧转写对齐即可从序列中学习的损失函数。它引入一个空白符号,并对所有能够生成目标转写文本的有效对齐方式的概率求和。这使系统能够利用配对的录音和转写文本进行训练,而不必人工分割语音。(cs.toronto.edu)
基于注意力的系统采用编码器—解码器架构,在生成输出符号时,通过注意力机制利用编码后的音频信息。转导器模型提供了另一种方法,将声学信息与先前的输出符号相结合。具体实现可以采用循环神经网络或Transformer架构。流式系统必须在利用后续音频信息与降低响应延迟之间取得平衡。(arxiv.org)
训练与多语言识别
监督学习使用与参考转写文本配对的录音。训练数据的构成会影响系统在不同录音条件、说话风格和语言下的表现。自监督学习还能够利用没有转写文本的音频。2020年的 wav2vec 2.0 研究展示了一种方法:通过掩蔽语音表示和对比学习目标进行预训练,再利用带转写文本的语音进行微调,其中也包括仅使用极少量标注数据的实验。(arxiv.org)
另一种方法利用大规模、监督信息不完善的音频集合来扩大训练规模。2022年的 Whisper 研究使用68万小时音频训练多语言、多任务模型,并报告了无需针对各数据集进行微调,即可迁移到多个基准测试的结果。其任务包括转写和将语音翻译成英语。转写保留源语言,而机器翻译生成另一种语言;即使由同一个模型支持,这两种任务的目标仍然不同。(arxiv.org)
评估、局限与应用
转写的主要评估指标是词错误率:
[ \mathrm{WER}=\frac{S+D+I}{N}, ]
其中,(S)、(D) 和 (I) 分别表示相对于参考文本中 (N) 个词所统计的替换、删除和插入次数。对齐采用编辑距离。得分取决于参考文本的规范和评分规则,因此,比较结果需要一致的评估条件。词错误率衡量的是转写文本的差异,而非这些差异的实际重要性:涉及姓名或否定表达的错误,可能造成格外严重的影响。(nist.gov)
准确率也可能因说话者群体而异。2020年一项针对五种商业系统的研究发现,在其抽样的美国访谈录音中,黑人说话者的平均错误率为35%,白人说话者为19%。这些结果反映的是所测试的系统和录音,而不能代表所有识别系统或其后续版本。语音识别的应用包括听写、自动化客服、语音控制界面,以及无需用手操作的计算机访问;这些应用的实用性既取决于识别准确率,也取决于配套界面。(doi.org)