腾讯混元给大模型强化学习装上"变速器":PPO吞吐量翻倍,GRPO省时29%
腾讯混元给大模型强化学习装上"变速器":PPO吞吐量翻倍,GRPO省时29%
大模型强化学习正在往更大的GPU集群、更厚的训练数据上狂奔,训练效率这件事,已经躲不掉了。
腾讯混元团队最近盯上了一个容易被忽略的问题:当模型自己生成训练数据,而"生成"和"训练"这两件事的规模扩张速度对不上时,批大小到底该怎么定?
从经典理论里翻出新答案
他们从经典的临界批大小(Critical Batch Size)理论出发,针对在线大语言模型强化学习这个新场景重新推导了一遍。结论很实在:在GRPO和PPO这两个主流算法里,只要在批大小增加的有限范围内同步调整学习率,就能保证"每条回答"都学到该学的东西,而不是被稀释掉。
换句话说,批大小不是越大越好,也不是一成不变——它存在一个清晰的"甜点区",可以精细调节。
真金白银的收益
落到实际硬件成本上,好处相当直观。
固定硬件配置下,把批大小调上去,PPO生成阶段的吞吐量最高能提升2.29倍;而实测到的最佳GRPO配置,达到同样验证目标的时间比原来少了29%。
对于常年烧GPU的训练团队来说,这意味着什么?要么用同样的集群和同样的目标,更快跑完;要么在同样的时间里,处理更多任务。不管哪种,都是在给强化学习里最贵的那部分——生成环节——挤水分。
为什么这件事值得关注
这项研究的意义,在于给在线强化学习的规模扩展提供了一个可操作的旋钮。
强化学习里,模型既是学生又是出题人。生成和训练的规模扩张不匹配,就是效率黑洞的来源。而临界批大小搭配学习率调整,恰好把这个缺口补上了。
当行业还在比拼谁的模型更大时,腾讯混元在磨另一把刀:让现有的硬件跑得更划算。
Key Points
- 腾讯混元将经典临界批大小理论重新推导,应用于在线大语言模型强化学习场景
- 在PPO和GRPO中,批大小增加时同步调学习率,可确保每条回答的学习不被稀释
- PPO生成阶段吞吐量最高提升2.29倍,GRPO达到相同验证目标的时间减少29%
- 批大小存在可精细调节的"甜点区",并非越大越好
- 该研究为在线强化学习的规模扩展提供了可操作的调节手段