问小创
告诉我你的需求,我帮你从站内挑最合适的 AI 工具。
2026年7月17日,美团LongCat正式发布全新搜索智能体评测基准LoHoSearch。此前行业通用的BrowseComp基准推出仅10个月,模型最优成绩就从30%飙升至90%,因可通过定向刷分失去参考价值。LoHoSearch基于覆盖762万实体的维基百科知识图谱自动出题,11款前沿模型测试最优成绩仅34.74%,大幅拉高评测难度上限。

搜索智能体的能力到底该怎么衡量,过去一年整个行业都在盯着BrowseComp的跑分。这个2025年推出的基准一度是公认的“黄金标尺”:它要求模型模拟真实用户的搜索路径,在多轮交互中完成信息检索、推理、整合的全流程,跑分高低直接和厂商的技术实力挂钩。
但BrowseComp很快陷入了所有AI基准都逃不开的困境:只要出题逻辑固定,模型就能通过针对性拟合快速刷高分数。推出仅10个月,行业顶尖模型在BrowseComp上的最优成绩就从最初的30%一路涨到了90%,不少厂商甚至专门针对基准的出题套路做定向优化,跑出来的高分和实际落地场景中的表现差距越来越大,基准本身的参考价值基本耗尽。
此次美团LongCat推出的LoHoSearch,核心思路就是从根源上避免被“刷分”。和过去由人工标注员设计测试题的模式不同,LoHoSearch的所有题目都由算法从覆盖762万个实体的维基百科知识图谱中自动生成:通过随机组合实体关联关系、嵌套多跳推理要求,它能生成近乎无限多的无套路考题,搜索空间和结构复杂度都抵达了人工出题根本无法达到的高度,相当于直接掀掉了评测的难度天花板。
首批11款国内外前沿搜索智能体的测试结果相当直观:行业最优成绩仅为34.74%,紧随其后的三款头部模型成绩集中在15%-16%区间,而同一批模型在BrowseComp上的成绩普遍超过80%。这种成绩跳水并非模型能力下降,而是评测标尺终于对齐了真实场景的复杂度:过去的高分本质是“应试”结果,现在的低得分才更接近搜索智能体的真实能力边界。
在业内人士看来,LoHoSearch的推出不止是换了一个评测基准,更相当于给过热的搜索智能体赛道踩了一脚“刹车”。过去很多厂商靠刷基准分制造“技术已成熟”的假象,抬高估值、快速落地,但实际产品的用户体验往往不达预期。更严格的无套路评测标尺,将倒逼行业把研发资源投入到真实能力的提升上,而非针对性的刷分技巧。
据了解,美团LongCat团队本身在本地生活搜索、智能客服等场景有大量落地需求,LoHoSearch的研发最初就是为了内部测试自研模型的真实能力,此次对外开源也将为整个行业的搜索智能体技术迭代提供统一的参考坐标系。
本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。