问小创
告诉我你的需求,我帮你从站内挑最合适的 AI 工具。
2026年5月,英伟达正式推出面向编码类大语言模型训练的Polar框架,该框架可代理大语言模型API调用,在无需修改现有编码测试套件的前提下,还原token级真实强化学习轨迹,支持Codex、Claude Code、Qwen Code等主流编码大模型的GRPO训练,大幅降低编码类AI的定制训练门槛。

编码类大模型正在成为企业数字化转型的核心工具,而GRPO(组相对策略优化)作为当前效果最好的强化学习训练方法之一,此前始终存在落地门槛高的问题——针对闭源大模型的训练无法获取底层token输出,开源模型的训练适配也需要修改整套测试环境,单项目适配成本最高可达数十万元。
随着代码生成、自动化测试等场景的需求爆发,越来越多的企业希望基于现有成熟编码大模型做定制化训练,适配自身的业务开发规范。但现有GRPO训练流程要求训练方能够获取模型每一步的token生成数据,同时需要对编码测试套件做针对性改造,这对于没有底层模型权限的闭源API用户,以及研发能力有限的中小团队来说,几乎是难以跨越的门槛。
有行业统计数据显示,此前针对编码大模型的GRPO训练适配,平均要占整个项目研发周期的35%以上,大量资源消耗在非核心的流程适配工作上,严重拖累了编码类AI的落地速度。
本次英伟达推出的Polar框架,核心解决的就是这一适配难题。该框架作为独立中间件代理所有大模型API调用请求,不需要修改原有训练套件,也不需要获取模型底层权重,就能自动重构出符合GRPO训练要求的token级强化学习轨迹,完全兼容现有编码训练的工作流。
目前Polar已经完成了对全球主流编码大模型的适配,包括OpenAI旗下的Codex、Anthropic的Claude Code,以及阿里开源的Qwen Code,不管是调用闭源API做微调,还是基于开源模型做二次训练,都可以直接接入使用,无需额外开发工作。据初步测试,接入Polar后,编码大模型的GRPO训练适配成本可降低70%以上。
Polar的落地价值不止于编码大模型训练。当前AI智能体的核心能力之一就是代码执行与工具调用,而GRPO也是智能体训练的主流算法之一,后续英伟达计划将Polar的适配范围扩展至多模态生成、工具调用等更多训练场景,打造通用的大模型强化学习训练中间件,进一步降低整个AI行业的训练落地成本。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。