当冷知识不冷:LLM 在酒吧问答里输给人类
当冷知识不冷:LLM 在酒吧问答里输给人类
一个尴尬的场景
周末酒吧, trivia night(冷知识问答夜)开赛。主持人问:
> 2018 年 6 月,哪位名人的离婚新闻登上头条?
人类玩家——可能不记得具体是谁,但知道"大概是 2018 年夏天的某个明星"。他们能部分得分,能排除明显错的答案,能说"我不确定但大概是某某"。
把同一个问题给 LLM。模型要么答对,要么完全瞎蒙——在它不熟悉的主题上,准确率直接掉到随机基线附近,没有任何"部分知道"的过渡。
这就是 TriviaRoomQA 揭示的现象:人类和模型在"不知道"这件事上表现完全不同。
基准设计
TriviaRoomQA 是一个多语言冷知识基准:
- 288 个主题,覆盖从百科知识到流行文化
- 3300 道平行多选题,翻译成六种欧洲语言:英语、法语、意大利语、西班牙语、德语、荷兰语
- 额外 5340 道法语独有问题,用于更细粒度的案例研究
- 每题四个选项,难度分三档
核心发现
一、模型擅长百科,不擅长流行文化
历史和地理类问题准确率最高——这些是百科全书式知识,训练数据里覆盖密集。音乐、电影、人物、新闻类问题准确率最低——这些是"时效性+文化嵌入"的知识,训练数据的覆盖稀疏且时效敏感。
二、跨语言不一致
同一个问题,翻译成六种语言问模型,答案不一致。模型在英语里可能答对,换成德语就答错。这说明事实知识在模型参数里不是语言无关地存储的——不同语言的表示通路有差异,有些语言能检索到,有些不能。
更大的模型能改善绝对准确率,但不消除跨语言不一致——20B 以上参数的模型仍然有这个差距。
三、模型和人类的"不知道"模式不同
人类在陌生主题上表现优雅:准确率随难度上升逐渐下降。模型在陌生主题上表现粗暴:一旦主题超出知识边界,所有难度都掉到随机水平。
这像什么?像悬崖 vs 斜坡。人类是斜坡——越难越差,但有过渡。模型是悬崖——在边界内还行,出边界就自由落体。
四、搜索增强能救
给模型接外部搜索,一些错误就消失了。这说明部分错误不是"模型推理不行",而是"参数里没存这个信息"或"存了但检索不出来"。这和 Möbius RoPE 的发现呼应:检索可靠性是独立于模型质量的维度。
五、时间性和地域性
- 历史类、永恒类问题比近期问题容易
- 北美相关问题在大多数模型上得分最高——这反映了训练数据的地域偏差
为什么重要
一、暴露了"学术基准幻觉"。MMLU、GSM8K、AIME 这些基准测的是学术推理能力,模型表现亮眼。但"能不能回答 2018 年 6 月哪位名人离婚"这种问题,测的是参数化知识的覆盖面和检索可靠性,模型表现差得多。业界用学术基准排名模型,但模型的实际部署场景往往更接近冷知识问答——用户问的是具体的、文化的、时效性的事实。
二、"跨语言不一致"挑战了"知识在模型里是语言无关的"假设。如果你用英语问模型"巴黎是法国首都吗"它答对,换成荷兰语它答错,那它到底"知道"这个事实吗?这触及一个哲学问题:知识是否需要跨表示通路一致才算真正掌握?
三、悬崖 vs 斜坡揭示了一种新型认知差距。人类在不确定时能做部分推理、概率判断、模糊匹配;模型在知识边界外直接退化成随机。这不是"模型不够大"的问题——大模型也有这个悬崖。这是认知架构的问题:模型没有"部分知道"的中间状态。
四、和 Möbius RoPE 的呼应。Möbius RoPE 揭示检索可靠性是独立于 perplexity 的维度;TriviaRoomQA 揭示参数化知识覆盖是独立于推理能力的维度。两者都指向:模型质量是多维的,单一指标(loss、MMLU)会掩盖关键失败模式。
概念提炼
"知识边界外的悬崖效应":模型在知识边界内表现良好,出边界后直接掉到随机;人类是斜坡式下降。这个差距不是参数量能填平的,是认知架构层面的差异。
"评测盲区定律":你测什么,模型就优化什么;你不测的,就是问题藏身的地方。学术基准测推理,冷知识基准测覆盖面和检索——两者不能互相替代。
诚实的评价
亮点:
- 288 主题 × 6 语言 × 3 难度,数据规模和设计都扎实
- "人类 vs 模型"的对照实验设计精巧——不只是测模型,还测了人类在相同问题上的表现模式
- 跨语言不一致是一个被忽视的重要维度
- 搜索增强实验直接定位了错误来源(参数缺失 vs 检索失败)
- 六种都是欧洲语言,代表性有限——非洲、亚洲、南美语言完全缺席
- 5340 道法语独有问题占比大,法语被过度采样
- "人类"对照样本是同事招募的,不是代表性人群
- 没有报告不同模型家族(GPT vs Claude vs Llama)在具体主题类别上的差异模式
相关链接
- 论文:https://arxiv.org/abs/2607.21445
- HTML 全文:https://arxiv.org/html/2607.21445v1
🌟 智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。
🎁 领取 2000万 Tokens