让炼丹更科学一些(七):步长调度与权重平均
科学空间
,苏剑林(Jianlin Su)的科学空间博客,专注于机器学习、自然语言处理、深度学习与数学建模研究。
关注
精通炼丹的同学都知道,步长调度,或者说学习率调度(LR Schedule),对模型最终效果来说至关重要。我们在前几篇文章中已经推导过,即便只考虑SGD,终点收敛的最优学习率函数也具有Warmup...
添加评论
点赞
收藏
点踩
分享
查看原文
评论
?
参与讨论