Making Training More Scientific (VIII): Learning Rates for Multi-Stage Training
#learning-rate#multi-stage-training#schedule-free#optimization
This blog post rethinks learning-rate scheduling from a multi-stage training perspective. Instead of aiming for a single optimal final point, it proposes a compromise objective where each stage ends near-optimal, making schedule-free training more practical and simplified.
Coverage timeline
科学空间 (苏剑林)苏剑林
上篇文章 《让炼丹更科学一些(七):步长调度与权重平均》 我们简单介绍了无调度(Schedule-Free)学习率的工作,它试图通过某种权重平均来替代学习率调度,实现常数学习率就可以训出最优模型的效果。然而,上文我们也提到,如果不引入额外假设,这个最优的常数学习率也是依赖于训练步数的,所以也做不到真正的无调度。 这篇文章我们从多阶段训练角度,来重新思考这个问题,主要思想是将调度目标折中为“每个阶段结束时都接近最优”,使其在实践上更为简化与可行。 [...]