AI小创

您好,我是AI助手

我可以帮您推荐合适的AI工具,有什么需要帮忙的吗?

我会根据您的需求,智能推荐站内收录的AI工具
猜您想问
推荐一些AI写作工具 有什么AI绘画工具? 推荐视频剪辑AI工具
AI助手: 我可以帮您推荐合适的AI工具,有什么需要帮忙的吗?

Cursor发布自研编码模型Composer 2 跑分超Claude Opus引热议

2026年3月19日,代码编辑器开发商Cursor正式上线自研编码模型Composer 2,官方公布的Terminal-Bench 2.0测试数据显示,该模型代理式终端编码任务得分达61.7%,较Anthropic旗下旗舰大模型Claude Opus 4.6同环境下的58.0%高出3.7个百分点,相关跑分结果公布后迅速在AI编码及开发者社区引发广泛讨论与争议。

3月19日Cursor的官方公告发布后不到半小时,GitHub开发者讨论区、X平台科技板块相关话题的热度就冲上了热榜前三,不少常年使用Cursor的开发者第一时间推送版本更新测试新功能,有全栈开发者晒出的实测记录显示,用Composer 2完成从需求梳理到项目部署的全流程开发任务,效率比此前调用Claude Opus 4.6接口时提升了近40%。

过去几年,AI编码工具的核心能力基本由通用大模型厂商主导,包括Cursor在内的多数IDE产品,都选择接入OpenAI GPT系列、Anthropic Claude系列的通用大模型提供编码补全、调试、代理开发等功能,垂直工具厂商很少投入资源自研底层大模型。

此次Composer 2的跑分结果,是IDE厂商自研编码模型首次在公认核心基准上超越通用大模型厂商的旗舰产品,也打破了外界对“垂直厂商自研模型能力不及通用大模型”的固有认知。

此次Cursor采用的Terminal-Bench 2.0是AI编码领域公认的高含金量基准测试,不同于常规的单代码片段补全测试,它主要考核模型理解复杂开发需求、自主调用终端工具、排查运行报错、完成全流程开发任务的综合能力,更贴近开发者的真实使用场景。

Cursor官方公布的三组核心数据显示,除了Terminal-Bench 2.0得分61.7%领先Claude Opus 4.6的58.0%之外,该模型在代码补全准确率、bug修复成功率两个细分指标上,也分别达到了92.3%和87.1%,均高于Claude Opus 4.6的同场景测试结果。针对部分开发者提出的“定向优化测试集”质疑,Cursor随后公开了完整的测试脚本和环境参数,证明测试条件与Anthropic官方公布的Claude Opus 4.6测试条件完全一致,不存在定向拟合的情况。

据了解,Composer 2的核心优势在于训练数据的高度垂直化:其训练集中超过80%的内容为高质量开源代码、官方开发文档、真实项目调试日志,而通用大模型的训练数据中,编码相关内容的占比通常不到10%。尽管目前OpenAI GPT-5.4仍以63.2%的Terminal-Bench 2.0得分保持领先,但Composer 2的参数规模仅为前者的1/20,推理成本低至后者的1/15,性价比优势十分突出。

Composer 2的问世也给整个AI工具赛道带来了新的思路:此前多数垂直场景AI工具都选择“通用大模型+场景微调”的路线,而此次Cursor的尝试证明,在垂直场景投入资源做专属预训练模型,完全有可能在能力和成本上超过通用大模型。

不少行业分析师认为,未来会有更多垂直工具厂商加入自研专属模型的行列,比如设计工具厂商自研设计大模型、办公软件厂商自研办公专属大模型,不再完全依赖通用大模型厂商的技术供给。对于普通开发者而言,这种竞争也会推动AI编码工具的能力持续升级、使用成本不断下降,甚至有望在未来1-2年内实现针对不同开发语言、不同行业场景的定制化编码模型落地。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。