问题

网络加深后,训练误差不一定继续下降,甚至可能出现退化。这与简单的过拟合不同,更像是优化过程难以找到理想映射。

残差学习

残差块不直接学习目标映射,而是学习输入与目标之间的差值。恒等捷径为梯度传播提供了更直接的路径,也让堆叠更深网络变得可行。

实验观察

论文通过不同深度网络的对比说明残差结构能够缓解退化,并在图像分类和检测任务中验证了迁移效果。

可迁移的思路

当一个复杂目标难以直接优化时,可以思考是否存在合理的基准映射,再让模型只学习修正项。这种思想并不限于视觉网络。