问小创
告诉我你的需求,我帮你从站内挑最合适的 AI 工具。
2026年7月17日,美团AI团队LongCat发布全新搜索智能体评测基准LoHoSearch。此前业内通用的BrowseComp基准上线仅10个月,前沿模型准确率已从初始的30%攀升至90%,评测区分度基本消失。新基准依托涵盖762万实体的维基百科知识图谱自动生成考题,首批11款主流前沿模型测试最高得分仅34.74%,大幅抬高了行业评测门槛。

搜索智能体作为大语言模型落地的核心场景之一,其能力评估长期依赖标准化基准测试,但技术迭代速度远超基准设计生命周期的问题,正在成为行业共同的痛点。仅在一年前,BrowseComp基准推出时的30%准确率天花板,还被视为搜索智能体难以跨越的门槛,而到2026年中,几乎所有主流模型都能在该基准上拿到90%以上的分数,高分模型的实际落地效果却参差不齐。
BrowseComp的快速失效,本质上是人工出题模式的先天缺陷导致的。该基准的所有测试用例均由专业标注人员设计,出题逻辑和难度上限都受限于标注者的认知边界,模型研发团队很容易针对固定的出题逻辑做定向优化,也就是行业俗称的“刷分”。
当所有头部模型都能拿到90分以上的成绩时,基准本身已经无法区分不同模型的真实能力差异,更无法反映模型在真实落地场景中的表现,彻底失去了标尺价值。
美团LongCat团队推出的LoHoSearch,从根源上改变了评测基准的出题逻辑:完全放弃人工出题,把考题生成权交给涵盖762万实体的维基百科知识图谱,通过实体之间的多元关联自动生成复杂搜索任务。
这种生成模式下,考题的搜索空间广度和逻辑链复杂度,都远超人脑能够稳定设计的上限,从根源上避免了定向刷分的可能。首批测试数据显示,11款业内顶尖的搜索智能体模型在LoHoSearch上的最佳成绩仅为34.74%,其余头部模型的得分普遍集中在15%-16%区间,直接将行业的能力评估水位拉回了BrowseComp刚推出时的水平。
美团推出这一基准的背后,是其自身业务场景的真实需求。作为国内最大的本地生活服务平台,美团的搜索场景需要处理千万级别的商户、商品、用户需求实体,复杂程度远超通用搜索场景,传统基准的高分模型很难适配这类复杂场景的需求。
LoHoSearch的评测逻辑更贴近真实落地场景的复杂搜索需求,不仅能为搜索智能体的技术迭代提供更准确的方向指引,也能帮企业筛选出真正具备落地价值的模型方案。据了解,LoHoSearch后续将向全行业开源开放,还会逐步纳入本地生活、电商等垂直领域的实体数据库,进一步拓展基准的适用场景。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。