问小创
告诉我你的需求,我帮你从站内挑最合适的 AI 工具。
近日,字节跳动Seed团队联合清华大学智能产业研究院(AIR)正式推出基于大规模智能体强化学习(Agentic RL)的CUDA核生成系统CUDA Agent。实测数据显示,该系统在KernelBench测试集上96.8%的任务表现优于PyTorch官方的torch.compile工具,平均运行速度提升达2.11倍,为AI底层计算优化提供了全新技术路径。

随着大模型参数规模从十亿级向万亿级快速扩张,GPU算力的利用效率已经成为制约AI训练、推理成本下降的核心瓶颈。作为NVIDIA GPU架构下的并行计算核心,CUDA核的性能直接决定了AI任务的运行速度,但手写高性能CUDA核不仅要求开发者同时掌握硬件架构、底层编译、算法逻辑等多领域知识,还需要大量调试经验,单款模型的核优化往往需要投入数十人月的人力成本。
此前行业普遍使用的PyTorch官方自动编译工具torch.compile,虽然大幅降低了CUDA核的开发门槛,但受限于规则式优化的逻辑上限,其生成的核性能始终与人工手写的最优方案存在30%以上的差距,无法满足大模型大规模落地的成本需求。
此次发布的CUDA Agent跳出了传统编译工具的固定规则框架,首次将大规模智能体强化学习技术落地到CUDA核生成场景,实现了优化逻辑的本质升级。
不同于传统方案依赖开发者预设的编译规则,CUDA Agent可以通过智能体与GPU硬件环境的持续交互,自主探索不同运算场景下的最优核结构,不需要依赖人工标注的高性能核样本,大幅降低了复杂场景下的优化边际成本。
官方公开的测试数据显示,在面向通用CUDA核性能的KernelBench测试集中,CUDA Agent在96.8%的任务上性能超过了torch.compile,平均运行速度达到后者的2.11倍,部分矩阵运算、注意力计算等AI核心场景的性能提升甚至超过3倍,已经接近专业工程师手写优化的水平。
业内分析认为,CUDA Agent的落地不仅能直接降低AI模型部署的算力成本,更打开了智能体技术在底层硬件优化领域的应用空间,打破了过去依赖人工经验、固定规则的优化逻辑。
未来该技术还可以进一步拓展到不同硬件架构的计算核优化场景,除了适配NVIDIA的CUDA架构之外,也有望对接国产AI芯片的专用计算指令集,帮助国内AI厂商降低不同硬件平台的适配成本,突破异构计算的技术瓶颈。
据了解,字节跳动Seed团队后续将逐步开放CUDA Agent的核心调用接口,供开发者在CV、NLP、多模态等不同AI场景下测试使用。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。