先验证数据

检查样本数量、标签分布、缺失值和归一化过程,并手工查看少量输入输出。很多“模型问题”最终都来自数据管线。

尝试过拟合极小数据集

如果模型连几十个样本都无法拟合,通常说明实现、损失函数或梯度传播存在问题。这比盲目调整学习率更有诊断价值。

观察中间量

记录损失的各个组成部分、梯度范数和模型输出分布。只看总损失会隐藏数值溢出、某项权重过大等细节。

固定变量做对照

每次只改变一个主要因素,并保存完整配置。调试的目标不是偶然得到一次好结果,而是建立可以解释的因果链条。