语音技术
-
声音帧没有字符时间戳,CTC 如何仍然学会转写
CTC 面对的是一种常见但棘手的监督:只有整段音频和最终文本,没有每个字符的帧级位置。本文从折叠规则、扩展标签、前向后向递推、数值稳定到束搜索,逐层推导它怎样把指数数量的对齐压缩成可训练计算。
-
语音识别的六次范式转向:从模板匹配到自监督预训练
语音识别并非一路把神经网络加深,而是在表示、对齐、概率建模、解码和数据利用方式上持续换挡。本文按六次范式转向解释系统为何演进及今天仍未消失的难题。
-
中文语音数据集怎么选:任务、场景、许可与切分检查
语料规模不是唯一标准。本文按朗读识别、会议、多领域、众包口音和语音合成列出仍有官方入口的代表资源,并给出许可、说话人切分与质量审计清单。
-
ASRT中文语音识别系统导览:数据、声学模型、CTC与文本输出
ASRT把音频数据、声学模型、CTC解码与文本转换组织成一条中文语音识别链。本文依据当前仓库梳理模块职责、输入输出、评估方法与适用边界。
-
同一串拼音为何得到不同句子:从候选词图到可控解码
拼音输入不是逐音节查字,而是在候选词图上寻找兼顾读音、上下文与用户习惯的路径。本文拆解词典生成、N元语言模型、平滑、对数域维特比与束搜索,并给出覆盖首选率、候选质量和响应延迟的评估方法。
-
给音频注入白噪声之前,先把强度、分布与失真算清楚
音频加噪不是把随机数乘上一个固定比例后相加。可靠实验需要区分白噪声与高斯分布,按信号功率确定目标信噪比,处理多声道、随机种子和削波,并用可复现的测量确认输出确实满足设定。