腾讯混元新突破:PPO吞吐量翻倍,GRPO训练时间省三成
腾讯混元新突破:PPO吞吐量翻倍,GRPO训练时间省三成
大模型强化学习训练,正在变成一场烧钱的军备竞赛——更大的GPU集群、更厚的训练数据,效率成了头号难题。但腾讯混元团队最近盯上了一个被忽视的角落:当模型自己生成训练数据,而生成和训练的规模步调不一致时,批量大小到底该怎么定?
从经典理论里挖出新答案
这项研究没有另起炉灶,而是回到了经典的临界批量大小理论,针对在线大语言模型强化学习这个新场景重新推导。结论很实在:在GRPO和PPO这两个主流算法中,把批量大小增加控制在一定范围内,同时相应调整学习率,就能保证“每个回答”都学到该学的东西,不会被稀释。换句话说,批量不是越大越好,也不是一成不变——它有一个明确的甜点区,可以精细调节。
真金白银的效率提升
落到实际硬件开销上,好处立竿见影。固定硬件配置下,增大批量能让PPO生成阶段的吞吐量最高提升2.29倍;而实测的最佳GRPO配置,达到同样验证目标的时间比之前少了29%。对于整天烧GPU的训练团队来说,这意味着要么用同样的集群更快跑完任务,要么在同样时间里处理更多数据——把强化学习中最贵的生成环节的冗余成本,硬生生挤了出来。
为什么这个“旋钮”重要
在线强化学习里,模型既是学生又是出题人。生成和训练的规模不匹配,就是效率黑洞的源头。临界批量大小和学习率调整的组合,正好补上了这个缺口。当行业还在比拼谁家模型更大时,腾讯混元选择把刀磨快,让现有硬件跑得更划算。
关键点:
- 重新推导临界批量大小理论,适用于在线大模型强化学习
- PPO生成吞吐量最高提升2.29倍,GRPO训练时间节省29%
- 批量大小存在可调节的甜点区,配合学习率调整效果最佳
- 为强化学习效率瓶颈提供了可落地的解决方案