2026年4月8日,阿里通义实验室Qwen Pilot团队正式推出全新推理优化算法FIPO,该算法突破传统强化学习在复杂逻辑推理场景的瓶颈,可将零基础训练模型的平均推理长度提升至10000Token以上,搭载该算法的32B参数大模型实测推理性能反超OpenAI o1-mini,为大模型复杂推理场景的低成本落地提供了新路径。
过去两年,大模型在常识问答、内容生成等场景的表现已经趋于成熟,但涉及多步数学推导、复杂逻辑判断、长链路代码调试等场景时,性能始终难以突破——核心瓶颈在于传统强化学习框架无法有效识别关键推理节点,常常出现推理中途终止、无效步骤循环等问题,既拉低了准确率也浪费了算力。
当前企业对大模型的需求已经从“能交互”转向“能解决实际复杂问题”:科研机构需要用大模型做基础定理推导,工业企业需要用大模型做多链路产线故障排查,金融机构需要用大模型做嵌套式风险评估,这些场景都对模型的推理深度、逻辑连贯性有极高要求。
而此前主流的强化学习优化方案,往往只以最终结果的正确性为奖励标准,无法引导模型关注推理过程的合理性,最终导致模型只会“蒙答案”,无法支撑真正的长链路深度思考,也成为限制大模型进入专业生产力场景的核心障碍。
FIPO算法针对传统强化学习的短板做了针对性重构,核心依托两套创新机制解决推理痛点:
其一是**Future-KL机制**,区别于传统方案只奖励最终正确结果的逻辑,这套机制会动态评估每个生成Token对后续推理步骤的正向贡献,只有能推动推理走向正确方向的Token才会获得高权重奖励,相当于让模型学会“走一步看三步”,避免无意义的内容生成。
其二是**符号对数概率差机制**,能够精准定位推理过程中的优化方向,大幅减少无效循环、逻辑跳步等问题的出现概率。
基于这两套设计,FIPO在零基础训练的大模型上,直接将平均推理长度提升至**10000Token**以上,彻底解决了此前模型推理深度不足的通病。
在公开的通用推理基准测试中,搭载FIPO算法的32B参数通义大模型,综合推理性能已经反超OpenAI推出的o1-mini模型。此前行业普遍认为,要达到o1-mini级别的推理能力,至少需要70B以上参数规模的大模型才能实现,FIPO的出现相当于把高推理能力模型的参数门槛直接降低了一半以上,也大幅降低了相关应用的部署算力成本。
据了解,FIPO算法接下来将逐步应用到通义全系列大模型中,面向数学科研、代码开发、工业决策等场景推出专项优化版本。业内人士分析认为,这类推理优化算法的普及,将推动大模型从“通用交互工具”向“专业生产力工具”迭代,未来更多中小团队也能用上成本可控的高推理能力大模型服务。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。