Deconstructing Scaling Law: Optimization, Architecture, and Data
#scaling law#deep learning#optimization#architecture
The article deconstructs the empirical Scaling Law in deep learning, which predicts model performance based on compute, data, and parameters. It examines how optimization algorithms, model architecture, and training data independently and jointly affect scaling behavior. The analysis aims to provide a more principled understanding beyond the original OpenAI Kaplan Law.
Coverage timeline
科学空间 (苏剑林)苏剑林
训练一个大型的神经网络,最终效果会受到非常多因素的影响,换个优化器,换个模型架构,或者换一个训练集,结果都可能截然不同。在工程实践中,我们将调试这些因素的经验结果,戏称为“炼丹”。但如何从经验上升到规律,更准确、定量地描述它们之间的关系呢?如果能搞清楚这个问题,我们的炼丹将会更有底气。 “Scaling Law”便试图以一种相对定量的方式来回答这个问题。自OpenAI在2020年的奠基性工作( Kaplan Law )以来,Scaling Law已成为深度学习最可靠的经验规律之一,它可以用来预估模型性能、指导超参数选择、判断某个改动的有效性等。为此,也有不少工作,试图对Scaling Law做进一步的更贴近本质的解读。 本文也来分享笔者对Scaling Law的一些理解。 [...]