跳转到主要内容

腾讯混元将临界点理论引入大模型RL,PPO吞吐量飙升2.29倍

腾讯混元将临界点理论引入大模型RL,PPO吞吐量飙升2.29倍

大模型强化学习正朝着更大的GPU集群和更厚的训练数据发展,训练效率成为首要问题。腾讯混元团队关注了一个被忽视的问题:当模型自行生成训练数据,生成与训练的规模步调不一致时,批量大小到底该如何确定?

老理论,新场景

研究从经典的临界批量大小理论出发,针对在线大语言模型强化学习这一新场景重新推导。结论很实用:在GRPO和PPO两个主流算法中,只要在批量增大的有界范围内调整学习率,就能保证“每条回答”都学到该学的东西,不被稀释。换句话说,批量不是越大越好,也不是固定不变——它存在一个清晰的甜点区,可以精细调节。

硬件账本上的真金白银

落到实际硬件成本上,收益相当可观。固定硬件配置下,增大批量能让PPO生成阶段的吞吐量最高提升2.29倍;而实测的最佳GRPO配置,达到同样验证目标的时间比之前少了29%。对于天天烧GPU的训练团队来说,这意味着要么用同样的集群和目标更快跑完,要么在同样时间里处理更多——把强化学习中最贵的生成环节的冗余成本挤出来。

为什么这事重要

这项研究的意义在于给在线强化学习的扩展提供了一个可操作的旋钮:在强化学习里,模型既是学生又是出题人。生成和训练的扩展不匹配,就是效率黑洞的源头,而临界批量大小加学习率调整的组合,正好补上这个缺口。当行业还在比拼谁家模型更大时,腾讯混元在磨刀,让现有硬件跑得更划算。

Key Points

  • 核心发现:将经典临界批量大小理论重新推导,适用于在线大语言模型强化学习场景。
  • 性能提升:PPO生成阶段吞吐量最高提升2.29倍;GRPO最佳配置节省29%训练时间。
  • 实用价值:为训练团队提供可调节的批量与学习率组合,降低最昂贵的生成环节成本。
  • 行业意义:在模型规模竞赛之外,开辟了一条提升现有硬件效率的务实路径。