CLUE团队最新发布SuperCLUE-Terminal中文智能体终端编程测评榜单,DeepSeek-V4-Pro-0813以51.52分位列第二,仅落后榜首Kimi K3,其调用成本仅为对手的十四分之一,性价比突出。该测评采用本土真实编程任务,统一以Claude Code为运行框架,单题需模型完成50至110轮交互,高度还原开发者日常工作流。

国内编程大模型的能力排位再添权威参考。随着AI编程在开发者群体中的渗透率快速提升,相关测评的公正性、场景贴合度越来越受行业关注,近期发布的SuperCLUE-Terminal榜单因为完全采用本土真实开发场景设计,刚一上线就引发了开发者圈层的讨论。
和以往多采用通用编程题库的测评不同,本次SuperCLUE-Terminal测评专门面向国内开发者设计,所有考题均来自本土企业、个人开发者的真实开发需求,测评过程统一以Claude Code作为运行框架,最大程度排除了环境差异带来的得分偏差。
为了还原真实开发的复杂流程,每道考题都要求模型完成50至110轮交互,单题完整运行耗时从半小时到一个半小时不等,能够完整校验模型理解中文需求、规划开发任务、调用第三方工具、排查代码错误的全链路能力,避免了传统“刷题库”式测评的水分。
本次共有十余款国内主流编程大模型参与测评,最终Kimi K3以60.61分的成绩登顶榜首,DeepSeek-V4-Pro-0813以51.52分紧随其后位列第二,两者的得分差距不到9分,均属于第一梯队的编程能力水平。
最受行业关注的是两款头部模型的成本差异:DeepSeek-V4-Pro-0813的调用成本仅为Kimi K3的十四分之一。对于需要批量调用大模型完成代码生成、测试的中小企业、个人开发者而言,这种性价比优势极具吸引力——相当于用不到十分之一的成本,就能获得头部梯队近9成的编程能力。
本次测评结果也释放出清晰的行业信号:国内编程大模型的竞争已经从单纯的跑分比拼,转向性能、成本、场景适配的综合能力较量。
一方面,以Kimi为代表的厂商仍在冲击极致性能,瞄准对代码精度要求极高的高端开发场景;另一方面,以DeepSeek为代表的厂商选择走普惠路线,通过技术优化降低调用成本,覆盖更广泛的中小开发者群体。两种路线的并行,也意味着国内AI编程工具的生态正在逐步完善,不同需求的开发者都能找到适配的产品。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。