语音技术
-
先画能力地图再选教材:语音识别入门的分层学习法
语音识别横跨信号处理、概率统计、深度学习与工程实现,按书单顺序学习很容易失去目标。更有效的路线是先确定要完成的作品,再把数学、编程、声学模型、语言模型、解码与评测拆成可验证的能力层。
-
让神经网络看到更完整的声音:对数幅度语谱图的生成路线
从16kHz波形到二维时频矩阵,只需分帧、加窗、FFT、取幅度与对数变换。本文解释这条语谱图路线与MFCC、FBank的差异,并给出实现和验收边界。
-
声学前端的两条路线:从频谱到MFCC与LogFBank取舍
MFCC与LogFBank并不是两套互不相关的算法,而是从同一条短时频谱流水线分出的两种表示。理解共同前端、梅尔滤波、对数压缩与离散余弦变换的作用,才能根据模型类型、数据规模和部署条件做出可验证的选择。
-
别把VAD只做成音量开关:语音边界判定的完整设计
语音活动检测面对的并非简单的有声与无声,而是噪声变化、呼吸声、远场衰减和连续帧决策共同构成的边界问题。把特征、判别器、时序平滑和验收指标拆开设计,才能得到既灵敏又不频繁误触发的VAD。
-
少量转录如何撬动语音识别:预训练与伪标签的互补实验
一项2020年研究把wav2vec 2.0预训练与伪标签自训练组合,在极少转录数据下取得显著改进。本文拆解两阶段为何互补、关键结果如何解读,以及复现实验不能忽略的条件。
-
把 ASRT Python 客户端接进应用:从回调样例到可维护会话
ASRT Python SDK 的最小样例展示了安装、识别器、回调与启停,但真实应用还要处理服务依赖、音频契约、回调线程安全、结果落盘、超时重连和可观测性。本文给出渐进式改造路线。
-
让声谱图学会留白:SpecAugment参数设计与验收方法
SpecAugment并不是把声谱图随意涂黑,而是在频率轴与时间轴上施加受控遮挡,迫使声学模型减少对局部线索的依赖。本文从数据边界、参数尺度、实现顺序到对照实验,给出一套可复查的落地方法。
-
CTC输出为何不能逐帧直读:路径折叠、前缀搜索与语言约束
CTC声学模型输出的是每一帧上的符号分布,最终文本来自许多对齐路径的合并。本文通过空白符、重复字符和前缀概率,解释贪婪解码为何会失误,以及束搜索如何接入语言约束。
-
开放语音识别测试接口前,先写清音频契约、限流与故障语义
公共测试接口不是给模型套一层HTTP就结束。音频格式、时长、鉴权、幂等、配额、错误码、隐私与可观测性共同决定使用者能否稳定接入,也决定服务端能否承受不可预测的流量。
-
浏览器语音Demo不该只有一个按钮:录音状态机、反馈与兼容性设计
网页语音识别Demo要协调麦克风授权、录制格式、时长检测、上传等待、结果展示和失败恢复。本文从用户状态机出发,说明如何避免重复提交、空录音与无反馈等待。
-
一张显存账单如何决定跨语言语音识别的迁移方案
跨语言语音识别不是简单地把英语模型换一套标签,而是在数据、显存与适应能力之间做取舍。文章把旧实验改写成一套可执行的预算设计、解冻阶梯和验收方法。
-
并行合成不是删掉循环:FastSpeech的时长接口如何工作
FastSpeech真正改变的是文本与声学序列的连接方式:先显式预测音素时长,再并行生成整段频谱。文章从教师对齐、长度展开、速度控制到上线监控重新拆解这条链路。