字节跳动 Seed 团队与清华大学智能产业研究院(AIR)近日正式发布了全新系统——CUDA Agent。这是一个专门用于训练大型语言模型编写高性能 GPU 内核的智能体强化学习系统,标志着 AI 在底层代码优化领域取得了重要进展。
在过去的 AI 开发中,前沿大模型虽然能够生成语法正确的 CUDA 代码,但往往因为生成的代码效率较低,在实际运行速度上难以超越传统编译器。以 KernelBench 基准测试为例,基础模型 Seed1.6 的任务通过率虽已达到 74.0%,但在运行速度上超越 torch.compile 的比例仅为 27.2%,平均几何速度反而落后于编译器本身。
为了突破这一瓶颈,CUDA Agent 将大模型置于一个真实的 CUDA 开发环境中,配备了性能分析工具、正确性校验机制以及受权限保护的安全沙盒。系统通过近端策略优化(PPO)算法进行长达 150 步的深度训练,最终使模型在 250 个任务的基准测试中,整体通过率飙升至 98.8%,且有 96.8% 的生成内核运行速度超越了传统的 torch.compile。
在实际应用与开源规划方面,尽管该系统的完整模型权重暂未公开,但研究团队已面向公众开放了包含 6000 个样本的CUDA-Agent-Ops-6K数据集、相关的SKILL.md规范说明以及奖励和热身训练配方。这一成果未来有望广泛应用于 AI 基础设施、大模型推理服务、自动驾驶以及量化交易等对延迟高度敏感的行业。





