语音技术
-
把离线语音模型变成稳定接口:ASRT 服务化的分层部署方案
ASRT 模型能在本机推理,并不代表已经具备可用的网络服务。可靠部署需要把依赖环境、多个推理进程、反向代理、请求校验、日志与故障恢复分开设计,再用真实 WAV 请求完成端到端验收。
-
只剩MFCC还能找回人声吗:一条分工明确的波形重建路线
MFCC主动舍弃了许多波形细节,恢复声音不能依靠单一逆变换。文章沿着基频、频谱包络、周期激励与对抗噪声四条支路,解释信息怎样被估计和重新组合。
-
从数据目录到误差样本:中文语音模型训练的可复现路线
训练中文语音识别模型不只是执行一个脚本。代码、依赖、语音与标注的对应关系、独立数据盘、训练日志和误差样本共同决定结果能否复现。本文按可验证的工程闭环讲清 ASRT 训练各阶段及其验收方法。
-
Char2Wav为什么仍保留中间声学层:端到端语音合成的两级分工
Char2Wav把文本前端与神经声码器联合到一条可训练链路,却没有直接从字符一次吐出采样点。理解Reader与条件SampleRNN的分工,才能看清早期端到端TTS的收益和限制。
-
英文语音数据别按小时数挑:十二类开放语料的任务匹配法
开放语音语料的总时长只是表面指标,真正影响训练的是任务目标、口音、说话风格、转写粒度、授权边界与切分质量。文章提供一套先筛风险、再做小样本试训的选型流程。
-
兼容层能让旧语音项目跑起来,却不能替你完成TensorFlow迁移
把Session等旧接口改到compat.v1可以恢复运行,但这只是止血步骤。文章以一次历史兼容改动为线索,给出环境矩阵、行为回归、分阶段改造和退出兼容层的路线。
-
SpecAugment不是给音频加噪:三种频谱遮挡如何训练识别器补上下文
SpecAugment直接在时频特征上做时间扭曲、频率遮挡和时间遮挡,迫使识别模型减少对局部证据的依赖。文章从几何直觉、参数比例、实现陷阱到受控消融完整拆解。
-
开源语音项目怎样走向可维护社区:以ASRT为观察样本
公开代码只是开源项目的起点。以ASRT中文语音识别仓库为观察样本,本文拆解架构说明、数据许可、复现实验、发布治理和贡献者入口如何共同决定项目寿命。
-
语音识别环境为何总装不对:把依赖清单升级为可复现契约
一份 pip list 只能证明某台机器曾安装过什么,无法保证语音识别项目可重建。本文把系统库、Python 包、GPU 运行时、模型资源与启动验证组织成可复现环境契约。
-
N-DenseNet的有限连接思路:城市声音分类论文怎么读
N-DenseNet把DenseNet的全历史连接改为有限阶依赖,试图在特征复用与连接成本之间折中。本文复原论文逻辑、实验结果和不能从准确率直接推出的结论。
-
一套声学网络跨越两种语言:重读 Deep Speech 2 的系统方法
Deep Speech 2 的启发并非只来自循环网络,而是把声学表示、CTC、训练稳定性、海量数据、多 GPU 计算与在线推理连成了一条可度量链路。本文按证据层级重建这套跨语言方法,并说明复现时不能省略的条件。
-
多路卷积真的听得更细吗:MCNN-CTC 的实验账本与复现路线
MCNN-CTC 用三条卷积分支同时观察语音的时间与频率结构,并以 CTC 完成无帧级对齐训练。本文不只解释“加宽网络”的直觉,还逐项核对建模单元、特征、优化、解码与相对错误率,给出可证伪的复现实验。