字节跳动与清华新AI代理编写GPU代码速度超越编译器
在AI的世界里,编写代码是一回事,但编写运行速度快的代码又是另一回事。字节跳动的Seed团队与清华大学智能制造研究院(AIR)合作,刚刚发布了一个名为CUDA Agent的系统,旨在弥合这一差距。这是一个智能体强化学习系统,旨在教大型语言模型编写高性能GPU内核——这些底层代码驱动着从图形到机器学习的一切。
问题在于:即使是最先进的大型模型也能生成语法正确的CUDA代码,但在实际运行速度上,它们往往不如传统编译器。例如,在KernelBench基准测试中,基础模型Seed1.6的任务成功率为74.0%,但其生成的内核中只有27.2%的运行速度快于流行的编译器torch.compile。事实上,平均几何速度实际上比编译器本身还要慢。
CUDA Agent通过将模型置于真实的CUDA开发环境中来解决这个问题,该环境配备了性能分析工具、正确性验证以及具有受限权限的安全沙箱。使用近端策略优化(PPO)算法,系统进行了150步的深度训练。结果令人印象深刻:在250个任务的基准测试中,总成功率达到98.8%,96.8%的生成内核运行速度快于torch.compile。
但这在实践中意味着什么呢?对于对延迟高度敏感的行业——如AI基础设施、大型模型推理服务、自动驾驶和量化交易——这可能是一个颠覆性的改变。更快的内核意味着更快的处理速度,从而带来更快的响应和更高效的运营。
该团队尚未发布完整的模型权重,但他们已开源了一个名为CUDA-Agent-Ops-6K的数据集,包含6000个样本,以及SKILL.md规范说明和奖励与预热训练配方。这一举措可能会加速该领域的研究和开发,使其他人能够在其工作基础上继续构建。
这是AI在优化底层代码能力方面迈出的重要一步,也为使AI系统更高效、更响应式开辟了新的可能性。随着技术的成熟,我们可以期待看到更多依赖高性能计算的复杂应用。
关键要点
- CUDA Agent 是字节跳动和清华AIR联合推出的新系统,用于训练LLM编写高性能GPU内核。
- 在250个任务的基准测试中,它实现了98.8%的成功率,其中96.8%的内核速度快于torch.compile。
- 该系统使用PPO强化学习和安全沙箱环境。
- 开源资源包括CUDA-Agent-Ops-6K数据集和训练配方。
- 潜在应用涵盖AI基础设施、自动驾驶和量化交易。