腾讯混元把临界批量理论搬进大模型RL,PPO吞吐飙升2.29倍
腾讯混元把临界批量理论搬进大模型RL,PPO吞吐飙升2.29倍
大模型强化学习正在往更大的GPU集群和更厚的训练数据方向狂奔,训练效率成了头等大事。腾讯混元团队最近盯上了一个容易被忽略的问题:当模型自己生成训练数据,而生成和训练的扩展节奏不一致时,批量大小到底该怎么定?
从经典理论里挖出新答案
这项研究从经典的临界批量大小理论出发,针对在线大语言模型强化学习这个新场景重新推导。结论很接地气:在GRPO和PPO这两个主流算法中,把学习率控制在批量增大后的有界范围内调整,就能保证“每个回答”都学到该学的东西,不被稀释。换句话说,批量不是越大越好,也不是固定不变——它存在一个可以微调的甜点区。
硬件账单上的真金白银
说到实际收益,数字很能打。在固定硬件配置下,增大批量能让PPO生成阶段的吞吐量最高提升2.29倍;而实测的最佳GRPO配置,达到相同验证目标的时间比之前少了29%。对于天天烧GPU的训练团队来说,这意味着要么用同样的集群和目标更快完成任务,要么在相同时间内处理更多数据——相当于从强化学习最烧钱的生成环节里,硬生生挤出了多余成本。
为什么这件事值得关注
这项研究的意义在于给在线RL的扩展提供了一个可操作的旋钮。在强化学习里,模型既是学生又是出题人,生成和训练的扩展不匹配就是效率黑洞的源头。临界批量大小加上学习率调整,正好补上了这个缺口。当行业还在比谁家模型更大的时候,腾讯混元选择磨刀,让现有硬件跑得更划算。
Key Points
- 理论突破:将经典临界批量理论重新推导,应用于在线大语言模型强化学习场景。
- 性能提升:PPO生成阶段吞吐量最高提升2.29倍,GRPO训练时间节省29%。
- 核心机制:在批量增大后的有界范围内调整学习率,确保每个回答的学习效果不被稀释。
- 实用价值:为训练团队提供可操作的扩展旋钮,从最昂贵的生成环节挤出成本。