让炼丹更科学一些(七):步长调度与权重平均

精通炼丹的同学都知道,步长调度,或者说学习率调度(LR Schedule),对模型最终效果来说至关重要。我们在前几篇文章中已经推导过,即便只考虑SGD,终点收敛的最优学习率函数也具有Warmup...

添加评论
点赞收藏
点踩分享查看原文
评论
?
参与讨论