Chinese blogger relaxes convergence assumptions for adaptive gradient algorithms
A Chinese machine-learning blogger extended convergence theory for adaptive gradient algorithms by removing two restrictive assumptions from a previous framework: constant learning rate and monotone preconditioner. The new analysis covers non-constant learning rate schedules and sliding-average methods like RMSProp and Adam, which were previously excluded.
Coverage timeline
科学空间 (苏剑林)苏剑林
上文 《让炼丹更科学一些(九):经典自适应梯度算法》 中,我们为形如$\boldsymbol{\theta}_{t+1} = \boldsymbol{\theta}_t - \eta_t \boldsymbol{H}_t^{-1}\boldsymbol{g}_t$的一般更新规则建立了收敛框架,并以它为出发点重新理解了AdaGrad等经典自适应梯度算法。不过,当时的完整结论依赖于两个前提:一是学习率$\eta_t$取常数,二是预条件矩阵$\boldsymbol{H}_t$关于$t$单调不减(半正定意义下)。 前者限制了学习率策略的自由度,后者则把RMSProp、Adam这类滑动平均型算法排除在了理论之外。本文尝试逐一拆掉这两个“脚手架”,把收敛理论推广到更一般的情形。 遗留问题 先回顾上一篇文章的核心结论。对一般的更新规则 \begin{equation}\boldsymbol{\theta}_{t+1} = \boldsymbol{\theta}_t - \eta_t \boldsymbol{H}_t^{-1}\boldsymbol{g}_t\end{equation} [...]