Tencent Hunyuan details RL batch-size tuning and scaling for 10K-100K GPU clusters
Tencent's Hunyuan team published a technical article on scaling reinforcement learning training for clusters of 10,000 to 100,000 GPUs, focusing on batch size tuning and scaling. They illustrate that moderately increasing batch size with adjusted learning rates improves throughput, but overly large batches can reduce efficiency. The article provides a cost example: 10,000 GPUs running 30 days at $3 per GPU-hour totals $21.6 million, and a 10% training time reduction saves about $2.16 million.
Coverage timeline
机器之心机器之心
强化学习走向规模化,效率成为关键变量 当预训练将大模型带到新的能力起点,强化学习则通过持续的探索与反馈,不断激发模型在新环境、新任务中的推理与行动能力,决定它们还能走多远。 RL 在模型开发中占的比重越大,训练效率对算力预算的影响也越直接。 算一笔示意账:假设 1 万张 GPU 连续运行 30 天,按每卡每小时 3 美元计算,总费用是 2,160 万美元。如果使用同样的卡数、达到同样的模型效果,但将训练时间缩短 10%,就能少使用 72 万 GPU 小时,按上述假设节省约 216 万美元。对租用集群的团队,这是直接减少的账单;对自建集群的团队,则意味着能更早把这些算力交给下一轮实验。 这些效率收益可以从哪里找?一个最基础、也几乎所有训练配方都无法绕开的参数,就是 Batch Size 。 在实际训练中,Batch Size 常常出现在两类决策中: Batch Size Tuning :让配方适配新条件。 模型变大了,或 GPU 卡型变了,原来的 Batch 和学习率不一定还合适。Batch 太小可能让硬件利用不充分,与之不匹配的学习率则可能让学习变慢甚至不稳定。这时需要找到一组能稳定学习、又能高效使用当前硬件的 Batch 与配套超参数。 Batch Size Scaling :把并行度变成更短的训练时间。 如果同一个模型得到了更多 GPU,Batch 能否同步扩大,让模型更早达标?即使 GPU 数量不变,如果生成并发较低、设备还没有充分工作,能否通过更大 Batch 利用这部分闲置能力? 两类决策最终都指向同一个实际问题: 如何找到最优的 Batch Size,使模型以最短的 wall-clock time 达到预期性能? 更大的 Batch,既可能是加速器,也可能成为减速带。腾讯混元团队在实验中观察到:适度增大 Batch,并同步调整学习率,可以在保持学习效率的同时提高吞吐;但 Batch 过大时,额外样本代价会反过来压过吞吐收益。图 1 把这种反差画成登山:有的路线能更快抵达同一性能「山顶」,有的看似步子更大,登顶反而更慢。 图 1|把训练比作登山:山顶代表达到同一目标性能,四条路线代表不同的 Batch Size,每个路标代表一次优化更新。配套调整学习率后,B、2B 和 4B 在累计样本维度上保持近似相同的学习进度;其中更大的 Batch 因吞吐更高而更快「
