-
别只盯峰值算力:深度学习GPU的工作负载匹配法
显存、精度、带宽、互联和功耗共同决定深度学习任务的真实表现。本文把庞杂的GPU参数表转换成一套可复现实验流程,帮助训练与推理项目建立候选短名单。
-
用llama.cpp本地运行大模型:选模型、量化、内存与隐私边界
本地推理能减少外部数据传输并提供离线能力,但模型许可、内存、量化质量、上下文缓存、服务暴露和日志仍需管理。本文以llama.cpp建立决策流程。
-
先画能力地图再选教材:语音识别入门的分层学习法
语音识别横跨信号处理、概率统计、深度学习与工程实现,按书单顺序学习很容易失去目标。更有效的路线是先确定要完成的作品,再把数学、编程、声学模型、语言模型、解码与评测拆成可验证的能力层。
-
让神经网络看到更完整的声音:对数幅度语谱图的生成路线
从16kHz波形到二维时频矩阵,只需分帧、加窗、FFT、取幅度与对数变换。本文解释这条语谱图路线与MFCC、FBank的差异,并给出实现和验收边界。
-
声学前端的两条路线:从频谱到MFCC与LogFBank取舍
MFCC与LogFBank并不是两套互不相关的算法,而是从同一条短时频谱流水线分出的两种表示。理解共同前端、梅尔滤波、对数压缩与离散余弦变换的作用,才能根据模型类型、数据规模和部署条件做出可验证的选择。
-
别把VAD只做成音量开关:语音边界判定的完整设计
语音活动检测面对的并非简单的有声与无声,而是噪声变化、呼吸声、远场衰减和连续帧决策共同构成的边界问题。把特征、判别器、时序平滑和验收指标拆开设计,才能得到既灵敏又不频繁误触发的VAD。
-
深度学习推理服务怎么选:HTTP只是入口,模型生命周期才是核心
没有一种模型部署方式对所有场景最佳。本文从进程内推理、通用Web服务、专用模型服务器和边缘部署比较,并设计版本、批处理、伸缩与可观测性。
-
少量转录如何撬动语音识别:预训练与伪标签的互补实验
一项2020年研究把wav2vec 2.0预训练与伪标签自训练组合,在极少转录数据下取得显著改进。本文拆解两阶段为何互补、关键结果如何解读,以及复现实验不能忽略的条件。
-
把 ASRT Python 客户端接进应用:从回调样例到可维护会话
ASRT Python SDK 的最小样例展示了安装、识别器、回调与启停,但真实应用还要处理服务依赖、音频契约、回调线程安全、结果落盘、超时重连和可观测性。本文给出渐进式改造路线。
-
让声谱图学会留白:SpecAugment参数设计与验收方法
SpecAugment并不是把声谱图随意涂黑,而是在频率轴与时间轴上施加受控遮挡,迫使声学模型减少对局部线索的依赖。本文从数据边界、参数尺度、实现顺序到对照实验,给出一套可复查的落地方法。
-
CTC输出为何不能逐帧直读:路径折叠、前缀搜索与语言约束
CTC声学模型输出的是每一帧上的符号分布,最终文本来自许多对齐路径的合并。本文通过空白符、重复字符和前缀概率,解释贪婪解码为何会失误,以及束搜索如何接入语言约束。
-
循环网络怎样压缩历史:隐藏状态、门控更新与训练边界
RNN把过去压缩进隐藏状态,并在每个时间步复用同一组参数。本文沿着信息写入、梯度回传、LSTM与GRU门控、因果方向和诊断实验,解释循环结构真正能记住什么。