先写任务卡,再打开下载页
明确目标是普通话朗读识别、远场会议、说话人验证、唤醒词还是语音合成;记录采样率、通道、说话风格、目标口音、商用可能性和存储预算。同为中文语音,安静朗读和多人重叠会议的迁移距离可能比数据规模差异更重要。

代表性官方入口
| 资源 | 更适合的起点 | 官方页标注许可 |
|---|---|---|
THCHS-30 |
小规模普通话朗读基线 | Apache-2.0 |
AISHELL-1 |
安静室内普通话识别 | Apache-2.0 |
ST-CMDS |
手机录制朗读语音 | CC BY-NC-ND 4.0 |
MAGICDATA |
较大规模移动端朗读 | CC BY-NC-ND 4.0 |
AISHELL-4 |
多通道会议、重叠语音与分离 | CC BY-SA 4.0 |
WenetSpeech |
大规模多领域识别与预训练 | 仓库标注Apache-2.0,下载前读专门条款 |
Common Voice |
众包口音与多地区覆盖 | 当前条款为CC0,个别资源另有说明 |
AISHELL-3 |
多说话人普通话语音合成 | Apache-2.0 |
许可不是表格里一个缩写
下载前保存当时的许可证全文、数据说明和版本号。带NC限制的资源不能直接按商业计划使用,ND、SA、署名与再分发条款也要结合训练产物和发布方式评估。Apache许可页面与“学术免费”描述同时出现时,仍应检查压缩包内附加文件并让实际使用方确认。
官方入口优先于第三方网盘
镜像可能缺文件、版本过旧或无法同步许可变化。记录下载URL、时间、文件大小和校验值,不在文章中传播提取码或来历不明的二次打包。Common Voice当前条款还要求通过官方数据平台提供访问,而不是自行镜像整套数据。
按说话人和原始录音切分
同一说话人的相似音色跨训练和测试会抬高结果;由长录音切出的相邻片段跨集合,背景与文本也可能泄漏。优先沿用官方划分;自建划分时按说话人、会话或原始媒体分组,并把规则和随机种子保存为清单。
先抽样听,再批量训练
- 核对音频能否解码、采样率与声道数。
- 听取安静、噪声、截断、静音和失真样本。
- 检查文本与音频是否对齐、编码是否统一。
- 统计时长、字符、说话人和领域分布。
- 识别重复音频、重复文本与异常长短。
文本规范必须成为版本化代码
数字、英文字母、标点、繁简体、儿化和非语音标记会直接改变字错误率。训练与评估使用同一规范函数,但保留原始转录。修改规则后重新生成数据清单并升级版本,不能在最终打分时手工修正个别答案。
组合数据时保留来源字段
不同语料的增益可能来自规模,也可能来自录音环境或文本域。每条样本保留source、license、speaker、recording_id和split,训练时可控制采样权重,评估时按来源拆分。这样才能发现大数据集是否压制小而重要的目标域。
关注维护通知
数据集不是发布后永远不变。WenetSpeech仓库在2026年仍提示测试集存在小范围标签修正,说明实验必须记录提交或版本,并在修订后区分旧结果与新结果。下载脚本和元数据也应进入项目锁定清单。
给每次训练附一张数据卡
数据卡列出用途、版本、许可、时长、说话人、场景、切分、清洗、已知偏差和禁止用途。模型卡再说明用了哪些数据及权重。选择语料的目标不是把小时数堆到最大,而是让授权、声音环境与评估对象尽可能一致。
下载完成后先建立数据清单
保存官方发布页、版本、许可文本、文件校验值、压缩包结构和获取日期。解压脚本应拒绝路径穿越与异常文件名,并在独立目录运行;对多卷或镜像站下载,校验完整性后再进入训练区。第三方副本若无法证明与官方制品一致,只作为候选,不直接混入语料。
抽样工具随机选择说话人、时长和目录,播放音频并并排显示转录。记录静音、截断、噪声、错字、编码和重复,估计问题比例。随后按原始录音指纹和文本近似度去重,防止同一句不同压缩版本跨越切分边界。
组合语料时保留每条样本的来历
元数据至少包含数据集版本、原始 ID、说话人、设备或场景、许可类别、文本规范步骤和切分。训练时可以统一字段,但不要丢掉这些来源维度;评测按数据集与场景分别报告,避免大数据集掩盖小而重要的退化。
若需要重新标注或修正文案,保存派生版本和变更原因,不覆盖原始发布。涉及个人语音时,确认用途、再分发限制、撤回与删除要求;“免费下载”不代表可用于任何商业或公开模型。
数据卡最后说明覆盖不足:方言、年龄、远场、重叠语音或专名是否缺失。选择数据集不是搜集越多越好,而是为目标任务建立许可清楚、切分可靠、质量可测且能持续维护的证据基础。
还要防止训练语料污染评测
大型公开语料可能被多个项目重打包,文件名变化不代表内容独立。用音频指纹、转录近似和说话人信息检查训练集与测试集交叉,尤其关注常见基准、演示句和公开试听片段。发现重叠时按原始录音成组移除,并保留污染报告。
评测集本身也应许可清楚、条件稳定。若团队持续查看同一测试集并据此调整模型,它会逐渐变成验证集;保留一个访问受限的最终集合,或定期用新场景补充滚动评测。公开数字同时说明模型是否使用了该数据或其派生版本。
数据清单、去重和独立测试看似不增加训练时长,却决定指标是否可信。没有这些证据,更多小时数只会让不确定性一起放大。
本文《中文语音数据集怎么选:任务、场景、许可与切分检查》由 xkmchenmu 发布于 xkmchenmu Blog。 转载请保留原文链接并注明出处。
支付宝扫一扫