AI 问小创

你好,我是问小创 AI 助手

告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

推荐结果基于站内收录,仅供参考,请以实际工具信息为准。
猜你想问
推荐一些AI写作工具 有什么AI绘画工具? 推荐视频剪辑AI工具
AI
问小创: 告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

英伟达推出Polar框架 优化编码大模型GRPO训练效率

2026年5月,英伟达正式推出面向编码类大语言模型训练的Polar框架,该框架可代理大语言模型API调用,在无需修改现有编码测试套件的前提下,还原token级真实强化学习轨迹,支持Codex、Claude Code、Qwen Code等主流编码大模型的GRPO训练,大幅降低编码类AI的定制训练门槛。

配图

编码类大模型正在成为企业数字化转型的核心工具,而GRPO(组相对策略优化)作为当前效果最好的强化学习训练方法之一,此前始终存在落地门槛高的问题——针对闭源大模型的训练无法获取底层token输出,开源模型的训练适配也需要修改整套测试环境,单项目适配成本最高可达数十万元。

随着代码生成、自动化测试等场景的需求爆发,越来越多的企业希望基于现有成熟编码大模型做定制化训练,适配自身的业务开发规范。但现有GRPO训练流程要求训练方能够获取模型每一步的token生成数据,同时需要对编码测试套件做针对性改造,这对于没有底层模型权限的闭源API用户,以及研发能力有限的中小团队来说,几乎是难以跨越的门槛。

有行业统计数据显示,此前针对编码大模型的GRPO训练适配,平均要占整个项目研发周期的35%以上,大量资源消耗在非核心的流程适配工作上,严重拖累了编码类AI的落地速度。

本次英伟达推出的Polar框架,核心解决的就是这一适配难题。该框架作为独立中间件代理所有大模型API调用请求,不需要修改原有训练套件,也不需要获取模型底层权重,就能自动重构出符合GRPO训练要求的token级强化学习轨迹,完全兼容现有编码训练的工作流。

目前Polar已经完成了对全球主流编码大模型的适配,包括OpenAI旗下的Codex、Anthropic的Claude Code,以及阿里开源的Qwen Code,不管是调用闭源API做微调,还是基于开源模型做二次训练,都可以直接接入使用,无需额外开发工作。据初步测试,接入Polar后,编码大模型的GRPO训练适配成本可降低70%以上。

Polar的落地价值不止于编码大模型训练。当前AI智能体的核心能力之一就是代码执行与工具调用,而GRPO也是智能体训练的主流算法之一,后续英伟达计划将Polar的适配范围扩展至多模态生成、工具调用等更多训练场景,打造通用的大模型强化学习训练中间件,进一步降低整个AI行业的训练落地成本。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。