腾讯发布WorkBuddy Bench 重构编码智能体多场景评测标准

2026年7月24日,腾讯正式推出面向编码智能体的多领域评测套件WorkBuddy Bench,相关研究论文已发布于预印本平台arXiv。该套件整合代码、网页、办公、安全四大工作场景共260个真实业务衍生任务,从设计根源杜绝智能体“背答案”问题,可精准衡量编码智能体的通用能力与跨场景迁移能力,填补了行业此前评测场景割裂、基准不透明的空白。

配图

随着编码智能体进入规模化落地阶段,评测失真的问题已经成为制约行业发展的核心瓶颈之一。过去业内对编码智能体的评测始终处于分散状态:测代码修复能力依赖SWE-bench,测前端生成能力参考Design2Code,面向生产环境的评测基准大多闭源不可审计,不同维度的评测结果很难交叉验证,也无法反映智能体在真实办公场景下的综合表现。不少厂商甚至专门针对公开题库做定向优化,导致评测结果和实际落地效果出现明显断层。

本次发布的WorkBuddy Bench核心优势并不在于任务规模,而在于完全独立的任务生成逻辑,相关研究成果已同步上传至预印本平台arXiv,所有评测规则完全公开可审计。
整套基准覆盖仓库级软件工程、前端制品生成、多文件办公自动化、红蓝队安全攻防四大核心工作场景,对应任务量分别为80、70、50、60个,合计260个评测任务。和传统公开题库不同,所有任务均由真实业务中的代码提交、拉取请求、企业办公需求逆向推导生成,提示词采用口语化的角色扮演形式,完全不存在公开可检索的标准答案,从设计层面就切断了智能体“背题刷分”的可能,评测结果可以直接对应智能体的实际落地能力。

此前编码智能体的评测往往只聚焦单一技术能力,企业选择落地工具时很难找到匹配自身全场景需求的参考标准。WorkBuddy Bench的出现,既可以帮助技术团队精准定位现有编码智能体的能力短板,针对性优化模型训练方向,也能为不同厂商的产品提供统一的横向对比标尺,降低企业选型的试错成本。后续随着更多场景任务的迭代,这套基准还有望延伸为通用办公智能体的通用评测框架,推动整个AGI落地进程提速。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。