问小创
告诉我你的需求,我帮你从站内挑最合适的 AI 工具。
谷歌研究院近期发布全新大语言模型工具调用训练数据生成框架ToolGrad,采用创新的答案优先生成逻辑,在工具调用数据生成任务中实现99.8%的通过率,在BFCL基准测试中得分达83.1,大幅提升了大模型工具调用训练的数据集质量与生产效率,为AI Agent落地的核心技术瓶颈突破提供了新路径。

AI Agent被视作下一代通用人工智能的核心落地方向,但大模型的工具调用能力训练,长期被高质量训练数据供给不足的问题制约。过去行业通用的流程优先数据生成方案,普遍存在逻辑错配、结果失真的问题,仅数据校验环节就占用了近60%的研发成本。
不少中小团队受限于数据成本,只能采用公开的低质量工具调用数据集训练模型,最终落地的AI Agent普遍存在调用时机判断错误、参数传递偏差、返回结果匹配度低等问题,无法满足商用要求。
此次谷歌研究院推出的ToolGrad框架,核心创新在于推翻了行业沿用多年的“先生成调用流程、再推导结果”的逻辑,转而采用答案优先的反向生成路径:先锁定任务的正确最终答案,再反向推导匹配的工具调用步骤、参数设置和执行链路,从根源上避免了流程和结果不匹配的问题。
官方测试数据显示,ToolGrad生成的工具调用训练数据,通过率高达99.8%,在权威的伯克利函数调用基准BFCL测试中得分达83.1,较传统流程优先方案的平均得分高出近30个百分点。这也意味着生成的数据集几乎不需要人工校验,就可以直接用于大模型微调,数据生产效率可提升6倍以上,综合成本下降超70%。
ToolGrad的落地首先将利好谷歌自身的大模型产品线,预计搭载升级后工具调用能力的Gemini版本将在未来1-2个季度内上线,在办公助手、智能客服、多模态交互等场景的实用性将出现明显提升。
对于整个AI行业而言,ToolGrad的出现也降低了AI Agent的开发门槛:中小团队不需要投入大量成本标注数据,就可以基于ToolGrad生成适配垂直场景的高质量训练集,快速优化自有大模型的工具调用能力,企业级工作流助手、行业服务机器人、IoT智能交互等场景的落地速度有望加快30%以上。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。