让炼丹更科学一些(八):多阶段训练的学习率
上篇文章《让炼丹更科学一些(七):步长调度与权重平均》我们简单介绍了无调度(Schedule-Free)学习率的工作,它试图通过某种权重平均来替代学习率调度,实现常数学习率就可以训出最优模型的效果。然而,上文我们也提到,如果不引入额外假设,这个最优的常数学习率也是依赖于训练步数的,所以也做不到真正的无调度。
这篇文章我们从多阶段训练角度,来重新思考这个问题,主要思想是将调度目标折中为“每个阶段结束时都接近最优”,使其在实践上更为简化与可行。
评论
?
参与讨论