语音识别的六次范式转向:从模板匹配到自监督预训练 | xkmchenmu Blog

语音识别的六次范式转向:从模板匹配到自监督预训练

语音识别并非一路把神经网络加深,而是在表示、对齐、概率建模、解码和数据利用方式上持续换挡。本文按六次范式转向解释系统为何演进及今天仍未消失的难题。

自动语音识别要把随时间变化的声学信号转成文字。说话速度、口音、噪声和上下文让同一句话拥有大量波形形态,因此技术史的主线并不是某个模型突然“听懂”语言,而是系统不断改变如何表示声音、处理长度差异和利用先验。

语音识别的六次范式转向:从模板匹配到自监督预训练 - 语音识别六次换挡

第一次转向:从频谱线索到模板匹配

1952年的英文数字识别研究面向电话带宽、单说话人和十个数字,通过频带特征与标准模式比较完成判断。它证明机器能够区分有限语音单位,也清楚暴露了说话人依赖和词表规模限制。

第二次转向:允许同一单词快慢不同

动态时间规整通过动态规划寻找两条特征序列的低代价对齐路径,使模板不必与输入逐帧等长。它在小词表和孤立词任务中有效,但每个词都保存模板难以扩展,也不擅长把声学、发音和语言规律统一建模。

第三次转向:概率模型拆分连续语音

隐马尔可夫模型把不可见的发音状态与可观察声学特征连接起来,GMM等模型估计状态输出概率。词典描述发音,N元语言模型给词序列先验,解码器在搜索图中组合多个分数。模块化让大词汇连续识别可训练、可替换,也形成复杂流水线。

第四次转向:神经网络接管声学估计

深层前馈网络、卷积与双向循环网络逐步替代GMM承担声学判别,HMM仍负责时序状态和解码。2013年的深层循环语音研究展示了长程上下文建模的潜力。这个阶段是神经与统计模块的混合,而非一夜之间端到端化。

第五次转向:模型自己学习对齐

CTC通过空白符和路径求和,在没有逐帧标签时训练序列模型;RNN-T进一步把声学编码与输出历史结合,注意力编码器-解码器则直接学习输入到输出的软对齐。端到端减少手工模块,但解码约束、流式延迟和文本先验仍需要设计。

第六次转向:先从海量无标注语音学习

Transformer/Conformer扩大上下文与并行训练能力,自监督方法则在转录前先利用原始音频。wav2vec 2.0用掩码与对比目标学习潜在表示,再以少量配对文本微调,改变了低资源场景的数据利用方式。伪标签、多语种预训练与领域适配可以继续组合。

今天不再用一个“准确率”概括系统

语音识别通常报告词错误率或字错误率,还要说明分词与文本规范。真实系统同时关心首字延迟、实时率、热词、数字实体、噪声、说话人群体与拒识。不存在一个脱离语言、数据和错误代价的通用可用阈值。

阶段 主要解决 遗留问题
模板/DTW 有限词表与速度变化 说话人与规模
HMM混合系统 连续语音和模块化解码 工程复杂、假设较强
CTC/RNN-T/注意力 弱化人工对齐 流式、搜索与数据需求
自监督预训练 利用无标注音频 算力、偏差与领域迁移

今天的识别器仍继承了早期问题:口音、远场、多说话人和新词只是以新的模型形式出现。理解每次范式转向解决了哪一层,才能在新任务中判断是换模型、补数据、改解码,还是重新定义评估。

同一个错误率背后,任务已经多次变化

早期系统常在有限词表、安静环境和孤立词条件下评测,后来逐步转向连续大词汇、自然对话、远场与多语种。比较历史数字时必须同时看词表、语料、说话人、声学条件、是否使用外部语言模型以及评测单位。一个年代更低的错误率,不一定代表它在今天开放环境中更强。

系统目标也从离线转写扩展到流式交互。流式模型要在音频尚未结束时输出,受可见未来、首字延迟和稳定性约束;离线模型可以利用完整上下文,通常更容易获得更低错误。二者应分别报告准确性、实时率、首段延迟和输出修订次数,不能只用最终文本比较。

现代语音系统仍是一条多目标链路

自监督预训练减少标签依赖,却增加无标注数据治理与计算;端到端结构简化传统模块边界,却仍要处理分词、热词、标点、数字格式和领域词汇;大模型后处理能够改善可读性,也可能改写原意。评测因此需要保留原始识别结果与后处理结果,区分听错、语言纠正和内容臆补。

真实产品还要覆盖隐私、端侧资源、网络中断、说话人公平和人工校正成本。按噪声、口音、设备、时长与关键词切片 CER,观察尾部失败;涉及重要决定时,保留音频回听与不确定状态。

未来范式可能继续变化,但研究问题仍围绕几件事:如何从更少监督学习稳健表示,如何在有限延迟和算力下解码,如何适应新领域而不遗忘,如何让错误可被发现和纠正。用这些轴理解历史,比记住一串模型名称更耐久。

评测设计也随着范式演进

词错误率或字符错误率只衡量编辑距离,不区分专名、否定词和语气词的业务影响。现代评测可在基础错误率之外统计关键词召回、数字正确、分段与标点、实时延迟和人工修订时间,并按场景给错误加权。一个平均值无法代表会议记录、语音输入和控制指令三种任务。

公开排行榜需要防止反复对测试集调参与训练数据污染。保留隐藏或定期更新的测试集,披露外部数据和后处理;业务团队则建立不进入训练的滚动现场集。模型变大后,还要验证它是否借语言先验“修正”成流畅但与音频不符的文本。

历史回顾最终应帮助选择今天的证据:模块化方法便于定位,端到端方法减少手工接口,自监督方法利用无标注规模。没有一种范式消除数据、评测和使用边界,它们只是把工程责任重新分配。

(0)
打赏 支付宝扫一扫 支付宝扫一扫

发表回复

登录后才能评论