BrowseComp 10 个月被刷到 90%,美团 LongCat 用 762 万实体知识图谱把搜索智能体「打回原形」
BrowseComp 10 个月被刷到 90%,美团 LongCat 用 762 万实体知识图谱把搜索智能体「打回原形」
来源:美团 LongCat / arXiv 2606.12837 / FreeAI Help URL: https://x.com/Meituan_LongCat/status/2078119654632124547 日期:2026-07-17
---
事件内容
7 月 17 日,美团 LongCat 团队挂出论文与基准 LoHoSearch(arXiv:2606.12837),用一个 762 万实体的维基百科知识图谱自动出题,把搜索智能体的真实水位测了出来:
- 11 个前沿模型最佳得分 34.74%——第二梯队 15-16%
- BrowseComp 上同样模型已经 90%+——对比落差 55 个百分点
- 上下文策略在 LoHoSearch 上仅 +6.8pp,BrowseComp 上 +14pp
- 解决 LoHoSearch 题目所需平均工具调用次数比 BrowseComp 多 74%
meituan-longcat/LoHoSearch,544 题 / 11 领域 / 树+图结构 / 维基百科 762 万实体 + 2.65 亿条边。深度剖析
BrowseComp 为什么崩得这么快
BrowseComp 是 OpenAI 2025 年 4 月发布的搜索智能体基准,题目难、答案易验证,Deep Research 首发 51.5%,人类测试者 33.3%——这是当时的事实标准。
10 个月后,头部模型从 30% 一路飙到 90%+。Anthropic 在 Claude Mythos Preview 的 System Card 里都写明「这个基准正在快速失去区分度」。
LongCat 团队给的解释很直接:BrowseComp 是人写的。
人工标注有两个绕不开的局限:
1. 标注者会不自觉挑熟悉的实体——熟悉就意味着热度高、连接直接、几步检索就能锁到答案。 2. 标注者没有全局视角——看不到「这个关系在整张知识图谱里到底有多少候选实体」。
结果是:题目难度天花板被人类标注者的认知视野卡死了。
LoHoSearch 的解法:把题目的构造权交给知识图谱
LongCat 团队的自动化构造管线:
| 步骤 | 动作 |
|---|---|
| 1. 构建知识图谱 | 从维基百科构建 762 万实体 + 2.65 亿条边的大规模 KG |
| 2. 全局统计选边 | 利用全局实体统计信息,选「搜索空间大」的边 |
| 3. 子图采样 | 树状结构侧重扩大搜索空间,图状结构引入循环依赖 |
| 4. 答案唯一性校验 | 子图答案在 KG 层面唯一 |
| 5. 自然语言表述 | LLM 把子图转为自然语言问题 |
| 6. 多轮校验 | 自动化 + 人工审核,确保正确性与唯一性 |
544 道题不算多,但每道题背后是「结构化检索迷宫」——你得顺着树去找、绕着图去连,不是简单搜个关键词就能命中。
实测结果:前沿模型集体跌回三成
| 模型 | LoHoSearch 准确率 | BrowseComp 准确率(同期) |
|---|---|---|
| GPT-5.5(最佳) | 34.74% | ~90% |
| 第 2-4 名 | 15-16% 区间 | ~90% |
| 其余 7 个模型 | 低于 15% | — |
上下文策略为什么「失灵」
BrowseComp 上,模型用「总结 / 丢弃 / 重置」等上下文管理策略,平均能拿到 +14pp 的提升。
LoHoSearch 上,同样的策略只能拿 +6.8pp——收益腰斩。
为什么?
- BrowseComp 题目「几步检索能命中」,上下文管理的边际收益集中在「减少冗余搜索 + 加速收敛」。
- LoHoSearch 题目需要多跳、多结构推理,上下文管理的边际收益被「问题本身的搜索空间 + 结构复杂度」抵消掉了。
工具调用多 74%:长程推理的真实代价
LongCat 团队的另一个发现:正确路径的工具调用次数比 BrowseComp 多 74%。
这意味着:
- 当前主流 agent 框架的「工具调用预算设计」普遍低估了长程任务的真实成本。
- 长程搜索 Agent 的瓶颈不在「会不会用搜索」,在「能不能撑得住长程推理 + 上下文管理」。
双裁判模型:GPT-4.1 + Qwen2.5-32B 取平均
为避免单一 LLM-as-judge 的偏置,LoHoSearch 采用 GPT-4.1 与 Qwen2.5-32B 两个裁判模型取平均分,衡量模型在极高难度下的真实表现与置信度校准误差。
这是 2026 年 Agent benchmark 的方法论升级——单一 judge 模型的偏置问题在 BrowseComp 上就已经被吐槽过,LongCat 直接做了双裁判。
值得关注的原因
1. 把搜索 Agent 评测从「人工经验驱动」推向「数据指标驱动」——这是搜索 benchmark 范式的代际切换,与 SWE-bench → SWE-bench Pro、CEO-Bench、CivBench 的方向一致。 2. 断崖式落差暴露系统盲区——34.74% vs 90%,不是「难一点」,是「触及前沿模型一个结构性盲区」。这对所有做 Deep Research 类产品的公司是直接的预警信号。 3. 上下文策略失效的发现——6.8pp vs 14pp 的对比,意味着「提示词工程」在 LoHoSearch 这种难度下收益减半。这对 Agent 产品方法论的直接影响:不要指望 prompt engineering 能弥补模型能力缺口。 4. 开源 + 数据可下载——Hugging Face 上有完整 544 题数据集,任何团队都能跑这个 benchmark。这是 2026 年搜索 Agent 的「必测项」候选。 5. 美团 LongCat 在 Agent 评测上的存在感——继 CEO-Bench 普林斯顿、CivBench、Anthropic Claude Mythos 之后,中国团队(美团)也开始主导高难度 Agent benchmark 的设计。
风险与待观察
- GPT-4.1 + Qwen2.5-32B 双裁判仍有偏置——两个模型都属于「被训过 BrowseComp 风格」的体系,可能在结构化 / 多跳问题上给分偏保守。需要第三方独立验证。
- 544 题量偏少——每题背后是结构化子图,但 544 道的统计显著性在「前沿模型差异」(如 GPT-5.5 与 Claude Opus 4.8 之间的 1-2pp 差距)上可能不够。
- 知识图谱规模的天花板——762 万实体远小于完整 Wikidata,题目覆盖的「领域」实际只有维基百科覆盖的领域。某些垂直领域(医学、法律)的题目覆盖可能不足。
- 与「训练数据污染」的关系——如果模型在预训练时见过 LoHoSearch 的训练样本,评测就失去意义。LongCat 团队提到「已开源」,但去污染评估没看到细节。
一句话总结
BrowseComp 10 个月从 30% 飙到 90%,LongCat 用 762 万实体知识图谱自动出题,把前沿搜索智能体打回 34.74%。第二梯队跌到 15-16%,上下文策略收益从 +14pp 腰斩到 +6.8pp——这不是「更难的卷子」,是触及了当前搜索 Agent 一个系统性盲区。下一个必测项,大概率是它。
来源链接:
- 美团 LongCat 推文:https://x.com/Meituan_LongCat/status/2078119654632124547
- arXiv 论文:https://arxiv-vanity.com/papers/2606.12837
- Hugging Face 数据集:https://huggingface.co/datasets/meituan-longcat/LoHoSearch
- 深度评论:https://freeai.help/blog/browsecomp-yi-bei-shua-bao-mei-tuan-longcat_zh
🌟 智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。
🎁 领取 2000万 Tokens