把“学不会”拆成四层
欠拟合描述的是模型在当前设置下连训练规律都没有充分捕获,但原因并不等于参数量不足。目标噪声决定可达到的上限,输入表示决定信息是否存在,模型容量决定可表达的函数集合,优化过程决定是否找到其中较好的解。四层混在一起调参,很难知道改动为何有效。

第一层:目标真的可由输入预测吗
检查标签定义、标注一致性和输入可见信息。若两个完全相同的输入对应互相冲突的标签,或预测需要模型从未获得的上下文,增加深度无法解决。可计算标注者一致性、抽查冲突样本,并建立简单业务规则的可达基线。
第二层:预处理是否丢掉关键线索
过低图像分辨率、截断过短的文本、错误音频采样率、把类别编号当连续数值,都会形成表示瓶颈。对照原始数据与模型张量,逐步恢复被压缩的维度;先验证输入中确实保留了区分类别的证据,再讨论网络宽度。
第三层:容量被什么限制
在关闭强增强、权重衰减和Dropout后,用一小组干净样本训练。如果能够记住小样本却无法降低较大训练集误差,才有理由怀疑容量或表示的规模不足。增加通道、层数、上下文窗口或更合适的架构,每次只改一个维度,并比较参数量、计算量和训练误差。
| 实验结果 | 更合理的下一步 |
|---|---|
| 小样本也学不会 | 查数据契约、损失、梯度和优化 |
| 小样本能记住,大训练集停在高位 | 扩大有效容量或改表示 |
| 训练已好,验证较差 | 转入泛化问题,不再称欠拟合 |
| 所有模型停在相近上限 | 审计标签噪声与任务信息 |
第四层:优化器可能没走到模型上限
观察参数更新量、梯度范数和激活分布。学习率过小像静止,过大则在低谷两侧跳动;初始化与激活不匹配可能造成信号逐层衰减或放大。不要把某一种初始化或优化器奉为固定答案,应依据网络结构进行小规模扫描。
正则化也可能主动制造高偏差
强权重衰减、过高Dropout、过激数据增强和过早停止都会压低训练拟合能力。建立一个弱正则基线,再逐项加回约束;如果训练误差明显改善而验证没有恶化,原设置很可能限制过度。
用消融表而不是印象做决定
- 固定数据划分、随机种子和训练预算。
- 记录基础模型的训练/验证指标与耗时。
- 分别测试输入、容量、优化和正则变化。
- 至少重复多个种子并报告波动。
- 保留失败实验及其停止条件。
更深的模型只有在信息存在、训练链路正确且新增容量能被优化时,才可能缓解欠拟合。
停止加模型的三个信号
若标签一致性已经接近当前性能、训练误差不随容量增长下降,或新增参数只增加计算而没有稳定收益,应回到任务定义与数据质量。重新划分类别、补充上下文或允许模型输出“不确定”,有时比继续扩容更符合问题本身。
提高容量前先测模型能达到的上限
抽取极小且标签已人工核对的样本,关闭增强和大部分正则,让模型尝试完全记住。如果连这一步都做不到,瓶颈更可能是代码、损失、表示或优化,而不是数据量不够。若小样本轻易学会而完整训练集误差很高,再检查标签噪声、输入信息和样本异质性。
建立一个更简单但可解释的基线,并对相同特征训练。复杂网络若不超过线性模型或树模型,新增层数可能没有利用到额外信息。还可用人工特征、原始信号和不同预处理分别训练,确认压缩、截断、归一化或采样是否在模型之前丢掉关键线索。
用分层实验定位高偏差来源
- 固定模型,逐步减弱权重衰减、随机失活与增强;
- 固定训练设置,按小到大增加宽度、深度或输入分辨率;
- 固定容量,扫描学习率并观察梯度与有效更新步数;
- 按标签质量和场景切片,比较哪些样本始终无法拟合。
每轮只改一个轴,记录训练误差下降速度和最终平台值。若训练误差随容量持续下降,说明模型自由度曾受限;若平台几乎不动,继续堆参数往往只增加成本。对随机标签的记忆实验只能用于诊断实现能力,不能作为模型质量目标。
当输入本身无法支持目标、标签不一致或误差接近任务固有噪声时,应修改问题定义、收集新的观测或引入人工信息,而不是要求网络凭空推断。欠拟合诊断的终点,是知道下一单位资源应该投入模型、优化、数据还是任务重构。
数据上限可以通过人工小样本估计
从最困难切片抽取一批样本,让多名熟悉任务的人独立标注并讨论分歧。若人类在现有输入上也无法一致判断,模型的可达上限会受到限制;应补充信息、重新定义标签或允许“不确定”,而不是继续把分歧当成训练噪声。
学习曲线若随数据增加仍稳定改善,新增代表性数据可能比扩模型更划算;若很早进入平台,检查标签质量与特征信息。曲线应按时间和场景分层,因为总体平台可能由一个容易且占比大的群体主导,困难群体仍缺样本。
优化瓶颈与任务上限要用不同实验判断:前者会在更长训练、不同学习率或更好初始化下改变,后者在多种模型与训练设置下都保持相似错误。把这两类证据分开,才能避免把“暂时没训练好”误判为“问题不可学”,也避免在缺乏信息的任务上无限增加计算。
报告最终选择时,把未奏效的扩容、正则或调度实验一并保留。负结果能防止团队以后重复投入,也能说明当前结论来自排除过程,而不是对某种网络规模的偏好。
本文《欠拟合不只意味着模型太小:从任务上限到优化瓶颈》由 xkmchenmu 发布于 xkmchenmu Blog。 转载请保留原文链接并注明出处。
支付宝扫一扫