让炼丹更科学一些(十):单调性假设的拆与补

上文《让炼丹更科学一些(九):经典自适应梯度算法》中,我们为形如$\boldsymbol{\theta}_{t+1} = \boldsymbol{\theta}_t - \eta_t \boldsymbol{H}_t^{-1}\boldsymbol{g}_t$的一般更新规则建立了收敛框架,并以它为出发点重新理解了AdaGrad等经典自适应梯度算法。不过,当时的完整结论依赖于两个前提:一是学习率$\eta_t$取常数,二是预条件矩阵$\boldsymbol{H}_t$关于$t$单调不减(半正定意义下)。

前者限制了学习率策略的自由度,后者则把RMSProp、Adam这类滑动平均型算法排除在了理论之外。本文尝试逐一拆掉这两个“脚手架”,把收敛理论推广到更一般的情形。

遗留问题

先回顾上一篇文章的核心结论。对一般的更新规则
\begin{equation}\boldsymbol{\theta}_{t+1} = \boldsymbol{\theta}_t - \eta_t \boldsymbol{H}_t^{-1}\boldsymbol{g}_t\end{equation}

添加评论
点赞收藏
点踩分享查看原文
评论
?
参与讨论