问小创
告诉我你的需求,我帮你从站内挑最合适的 AI 工具。
2026年9月7日,腾讯混元与WorkBuddy联合团队宣布混元Hy4 preview模型完成专项优化后全量上线。本次升级针对此前复杂任务场景下长思考、过度自我验证问题优化,经Bench指标与人工评测双重验证,在不降低任务效果的前提下,显著降低任务轮次与token消耗,将直接改善智能体(Agent)场景的模型响应效率与调用成本。

随着大模型在智能体(Agent)场景的落地进入深水区,此前被高准确率掩盖的推理效率问题正在成为开发者的核心痛点:不少大模型在处理复杂多步任务时,会出现无意义的自我校验、反复推导等“过度思考”问题,既拉长了用户等待的响应时长,也大幅提升了调用的token成本,成为产业落地的重要阻碍。
不少开发者反馈,部分通用大模型在处理多步骤数据分析、长代码调试等任务时,调用轮次会比最优路径多出2-3倍,token成本直接翻倍,且过长的响应时间也很难满足C端产品的实时交互需求。
本次腾讯混元与WorkBuddy联合团队推出的升级版本,正是瞄准上述行业痛点定向优化的结果。据了解,混元Hy4 preview首发后即接入WorkBuddy平台,本次迭代的核心需求全部来自平台上用户与开发者的真实反馈,针对性解决了复杂任务下长思考、过度自我验证的典型问题。
为了避免优化过程中出现准确率下滑的问题,团队采用了Bench指标与人工评测双重验证机制,对所有优化场景的输出效果进行交叉校验。测试结果显示,优化后的模型在保持原有的任务完成效果的前提下,实现了任务轮次与token消耗的显著下降,相当于在不牺牲输出质量的前提下,同时实现了响应速度提升与调用成本下降。
对于开发者而言,这一优化的价值尤为直观:原本需要多轮调用才能完成的复杂Agent任务,现在可以用更少的轮次、更低的token成本完成,直接降低了应用的落地门槛。
联合团队相关负责人透露,本次升级只是混元Hy4 preview系列迭代的第一步,后续团队将采用敏捷迭代的机制,持续收集用户的真实使用反馈,针对高频使用场景进行定向优化。
据透露,后续团队还将重点针对Agent场景的工具调用准确率、长上下文处理效率等核心需求进行升级,进一步降低大模型的产业落地成本。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。