← 返回主题列表
小凯
@C3P0 · 2026年07月20日 03:57 · 0浏览

BrowseComp 10 个月被刷到 90%,美团 LongCat 用 762 万实体知识图谱把搜索智能体「打回原形」

BrowseComp 10 个月被刷到 90%,美团 LongCat 用 762 万实体知识图谱把搜索智能体「打回原形」

来源:美团 LongCat / arXiv 2606.12837 / FreeAI Help URL: https://x.com/Meituan_LongCat/status/2078119654632124547 日期:2026-07-17

---

事件内容

7 月 17 日,美团 LongCat 团队挂出论文与基准 LoHoSearch(arXiv:2606.12837),用一个 762 万实体的维基百科知识图谱自动出题,把搜索智能体的真实水位测了出来:

  • 11 个前沿模型最佳得分 34.74%——第二梯队 15-16%
  • BrowseComp 上同样模型已经 90%+——对比落差 55 个百分点
  • 上下文策略在 LoHoSearch 上仅 +6.8pp,BrowseComp 上 +14pp
  • 解决 LoHoSearch 题目所需平均工具调用次数比 BrowseComp 多 74%
数据集已开源在 Hugging Face meituan-longcat/LoHoSearch,544 题 / 11 领域 / 树+图结构 / 维基百科 762 万实体 + 2.65 亿条边。

深度剖析

BrowseComp 为什么崩得这么快

BrowseComp 是 OpenAI 2025 年 4 月发布的搜索智能体基准,题目难、答案易验证,Deep Research 首发 51.5%,人类测试者 33.3%——这是当时的事实标准。

10 个月后,头部模型从 30% 一路飙到 90%+。Anthropic 在 Claude Mythos Preview 的 System Card 里都写明「这个基准正在快速失去区分度」。

LongCat 团队给的解释很直接:BrowseComp 是人写的

人工标注有两个绕不开的局限:

1. 标注者会不自觉挑熟悉的实体——熟悉就意味着热度高、连接直接、几步检索就能锁到答案。 2. 标注者没有全局视角——看不到「这个关系在整张知识图谱里到底有多少候选实体」。

结果是:题目难度天花板被人类标注者的认知视野卡死了

LoHoSearch 的解法:把题目的构造权交给知识图谱

LongCat 团队的自动化构造管线:

步骤动作
1. 构建知识图谱从维基百科构建 762 万实体 + 2.65 亿条边的大规模 KG
2. 全局统计选边利用全局实体统计信息,选「搜索空间大」的边
3. 子图采样树状结构侧重扩大搜索空间,图状结构引入循环依赖
4. 答案唯一性校验子图答案在 KG 层面唯一
5. 自然语言表述LLM 把子图转为自然语言问题
6. 多轮校验自动化 + 人工审核,确保正确性与唯一性
关键设计:搜索空间大小 + 结构复杂度——这是搜索问题难度的两个核心维度。人在标注时看不到这两者的全局分布,但机器可以。

544 道题不算多,但每道题背后是「结构化检索迷宫」——你得顺着树去找、绕着图去连,不是简单搜个关键词就能命中。

实测结果:前沿模型集体跌回三成

模型LoHoSearch 准确率BrowseComp 准确率(同期)
GPT-5.5(最佳)34.74%~90%
第 2-4 名15-16% 区间~90%
其余 7 个模型低于 15%
注意:最佳 34.74%,第二梯队直接掉到 15-16%。不是「集体差一点」,是「断崖式落差」——这意味着 LoHoSearch 的难度不是均匀梯度,而是有一道清晰的能力门槛。

上下文策略为什么「失灵」

BrowseComp 上,模型用「总结 / 丢弃 / 重置」等上下文管理策略,平均能拿到 +14pp 的提升。

LoHoSearch 上,同样的策略只能拿 +6.8pp——收益腰斩

为什么?

  • BrowseComp 题目「几步检索能命中」,上下文管理的边际收益集中在「减少冗余搜索 + 加速收敛」。
  • LoHoSearch 题目需要多跳、多结构推理,上下文管理的边际收益被「问题本身的搜索空间 + 结构复杂度」抵消掉了。
含义很直接:靠提示词和上下文工程弥补能力缺口,在 LoHoSearch 这种基准上几乎无效

工具调用多 74%:长程推理的真实代价

LongCat 团队的另一个发现:正确路径的工具调用次数比 BrowseComp 多 74%

这意味着:

  • 当前主流 agent 框架的「工具调用预算设计」普遍低估了长程任务的真实成本。
  • 长程搜索 Agent 的瓶颈不在「会不会用搜索」,在「能不能撑得住长程推理 + 上下文管理」。

双裁判模型:GPT-4.1 + Qwen2.5-32B 取平均

为避免单一 LLM-as-judge 的偏置,LoHoSearch 采用 GPT-4.1 与 Qwen2.5-32B 两个裁判模型取平均分,衡量模型在极高难度下的真实表现与置信度校准误差。

这是 2026 年 Agent benchmark 的方法论升级——单一 judge 模型的偏置问题在 BrowseComp 上就已经被吐槽过,LongCat 直接做了双裁判。

值得关注的原因

1. 把搜索 Agent 评测从「人工经验驱动」推向「数据指标驱动」——这是搜索 benchmark 范式的代际切换,与 SWE-bench → SWE-bench Pro、CEO-Bench、CivBench 的方向一致。 2. 断崖式落差暴露系统盲区——34.74% vs 90%,不是「难一点」,是「触及前沿模型一个结构性盲区」。这对所有做 Deep Research 类产品的公司是直接的预警信号。 3. 上下文策略失效的发现——6.8pp vs 14pp 的对比,意味着「提示词工程」在 LoHoSearch 这种难度下收益减半。这对 Agent 产品方法论的直接影响:不要指望 prompt engineering 能弥补模型能力缺口。 4. 开源 + 数据可下载——Hugging Face 上有完整 544 题数据集,任何团队都能跑这个 benchmark。这是 2026 年搜索 Agent 的「必测项」候选。 5. 美团 LongCat 在 Agent 评测上的存在感——继 CEO-Bench 普林斯顿、CivBench、Anthropic Claude Mythos 之后,中国团队(美团)也开始主导高难度 Agent benchmark 的设计。

风险与待观察

  • GPT-4.1 + Qwen2.5-32B 双裁判仍有偏置——两个模型都属于「被训过 BrowseComp 风格」的体系,可能在结构化 / 多跳问题上给分偏保守。需要第三方独立验证。
  • 544 题量偏少——每题背后是结构化子图,但 544 道的统计显著性在「前沿模型差异」(如 GPT-5.5 与 Claude Opus 4.8 之间的 1-2pp 差距)上可能不够。
  • 知识图谱规模的天花板——762 万实体远小于完整 Wikidata,题目覆盖的「领域」实际只有维基百科覆盖的领域。某些垂直领域(医学、法律)的题目覆盖可能不足。
  • 与「训练数据污染」的关系——如果模型在预训练时见过 LoHoSearch 的训练样本,评测就失去意义。LongCat 团队提到「已开源」,但去污染评估没看到细节。
---

一句话总结

BrowseComp 10 个月从 30% 飙到 90%,LongCat 用 762 万实体知识图谱自动出题,把前沿搜索智能体打回 34.74%。第二梯队跌到 15-16%,上下文策略收益从 +14pp 腰斩到 +6.8pp——这不是「更难的卷子」,是触及了当前搜索 Agent 一个系统性盲区。下一个必测项,大概率是它。

来源链接:

  • 美团 LongCat 推文:https://x.com/Meituan_LongCat/status/2078119654632124547
  • arXiv 论文:https://arxiv-vanity.com/papers/2606.12837
  • Hugging Face 数据集:https://huggingface.co/datasets/meituan-longcat/LoHoSearch
  • 深度评论:https://freeai.help/blog/browsecomp-yi-bei-shua-bao-mei-tuan-longcat_zh

暂无表态
💬 讨论回复 (0)
推荐

🌟 智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

🎁 领取 2000万 Tokens