静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
✨
✨步子哥 @steper · 2026-10-06 02:35

一个被忽视的问题

你刚读完一篇 NLP 论文的摘要,觉得很有意思。但你脑子里冒出来的问题——"这个方法在低资源语言上试过吗?""训练数据和 GPT-3 比差多少?""消融实验里去掉 attention 那一支结果是多少?"——这些问题在摘要里找不到答案,你需要翻进正文,有时甚至要跨好几个章节拼凑。

这类"读者真实信息需求"长期以来被 NLP 评测界忽视了。现有的阅读理解数据集(SQuAD、Natural Questions、HotpotQA)大多基于维基百科或网页文本,问题类型偏向事实型——"谁做了什么""什么时候发生"。但学术阅读中的信息需求远比这复杂:它涉及方法细节、实验配置、跨章节推理、甚至对图表的解读。

QASPER(Question Answering for Scientific Research Papers)就是为填补这个空白而生的。论文发表于 2021 年 NAACL,作者来自 Allen AI、CMU 和华盛顿大学。它收集了 5049 个问题,覆盖 1585 篇 NLP 论文,问题由 25 位 NLP 研究者读完标题和摘要后提出,再由 51 位 NLP 实践者阅读全文回答。这不是一个"从文本中找答案"的任务,而是一个"理解论文后回答真实疑问"的任务。

数据集的设计哲学

QASPER 的设计有两个关键决策值得拆解。

第一,问题提出和回答完全解耦。 提问者只看到标题和摘要,必须写下"摘要回答不了、但预期论文正文能回答"的问题。回答者看到完整论文(包括图表),需要判断问题是否可回答,如果可回答则提供证据片段和答案。这个解耦确保了问题不是"看着答案编的",而是真实的信息需求。

第二,证据不是可选的附加品,而是任务的核心部分。 回答者必须标注回答问题所需的最小证据集——可能是正文段落、表格、图,或它们的组合。55.5% 的可回答问题需要跨多个段落的证据,13% 需要表格或图表。论文中举了一个例子:要回答"这个模型在低资源语言上的表现如何",需要从实验设置、主结果、消融研究三个不同章节提取信息。

这两个设计决策让 QASPER 成了一个"真实"的数据集。它不是从文本中抽取事实,而是模拟了学术阅读中"带着问题找答案"的完整过程。

67% 的问题都是论文专属的

QASPER 最有意思的发现之一是问题类型的分布。作者手动分类了 200 个问题,发现 67% 是"论文专属"的——只对那篇论文有意义,比如"这个模型的 embedding 维度是多少""为什么用 BERT-base 而不是 BERT-large"。只有 33% 是"通用型"的,比如"这篇论文的主要贡献是什么""未来工作方向有哪些"。

这个发现对信息抽取(IE)范式有直接冲击。如果用 IE 思路处理学术 QA,你需要预定义一个 schema(方法、数据集、结果、未来工作……),但 67% 的问题落不进任何固定 schema。论文专属的长尾信息需求只能用开放式 QA 来处理——这也是 QASPER 被设计成生成式任务而非抽取式任务的原因。

证据分布的另一个发现也值得注意:作者统计了证据出现在哪些章节,发现没有哪个章节占主导——"实验"章节不是证据最密集的地方,"引言"和"方法"也各占相当比例。这意味着不能靠"只看实验部分"来回答问题,真正的学术 QA 需要全文理解。

人类 vs 模型的差距

QASPER 的基线实验揭示了这个任务的难度。使用当时最强的 Longformer + T5 模型:

  • 答案 F1:人类 90.1,模型 63.0,差距 27 分
  • 证据 F1:人类 90.0,模型 58.0,差距 32 分
27 分的差距在 NLP 评测里是巨大的。作为对比,SQuAD 1.1 上人类和模型的差距在 2018 年就已经缩小到 2 分以内。QASPER 的难度不在于"找到答案",而在于"理解问题需要什么类型的证据,然后跨章节定位和整合"。

作者还做了一个 oracle 实验:如果只给模型 gold evidence 段落,答案 F1 能从 63 涨到 82。这说明瓶颈主要在"找证据"而非"生成答案"。这个发现对后续工作有指导意义:提升学术 QA 的关键可能不在于更强的生成模型,而在于更精准的 evidence retrieval。

数据集的标注质量

QASPER 的标注质量在数据集论文中属于上乘。44% 的问题有多个标注答案,平均每个问题 1.6 个标注者。作者手动分析了 100 个多标注问题(平均 2.73 个答案),发现 75.8% 的答案正确,98% 的问题至少有一个正确答案。标注者对"问题是否可回答"的一致率 90%,对"证据类型(文本 vs 图表)"的一致率 84%。

这些数字说明:学术 QA 的标注确实比事实型 QA 更难(SQuAD 的标注一致率接近 95%),但只要招募领域专家(QASPER 的标注者 70% 有 NLP 经验,20% 有 5 年以上经验),质量是可以保证的。关键决策是按时薪而非按问题数付费(25 美元/小时),这避免了标注者为追求数量而降低质量。

QASPER 的遗产

QASPER 发表后,成了学术文档理解领域的标准 benchmark 之一。它催生了一系列后续工作:

  • Evidence retrieval:因为瓶颈在找证据,后续工作专门研究如何为学术 QA 检索证据段落
  • Long-context understanding:QASPER 需要跨章节推理,成了长上下文模型的评测集
  • Multi-modal QA:13% 的问题需要图表,推动了论文图表理解的研究
  • Open-domain QA over papers:QASPER 的问题模式被推广到其他领域(生物医学、物理学)
从 2021 年到 2026 年,模型在 QASPER 上的表现已经从 63 F1 提升到了 80+ F1(得益于长上下文 LLM 的进步),但人类-模型差距仍然存在。这个差距主要来自需要跨章节推理和图表理解的问题类型。

对今天的启示

QASPER 提出的核心问题在今天依然有启发:

学术阅读的评测应该模拟真实阅读过程。 现在的 LLM 评测喜欢用"读完整篇论文后回答问题"来测试长上下文能力,但很多评测集的问题是从论文中直接抽取的,不是真实阅读需求。QASPER 的"提问者只看摘要"的设计确保了问题的真实性,这个设计原则值得今天的评测集借鉴。

证据标注比答案标注更有价值。 QASPER 要求标注证据,这不仅让任务更可验证,也暴露了"找证据"才是真正的瓶颈。今天 RAG 系统的评测也越来越多地关注 evidence retrieval 的质量,QASPER 是这个方向的先驱。

长尾信息需求无法被固定 schema 覆盖。 67% 的问题论文专属——这个发现对知识图谱构建有直接启示:学术知识图谱不可能穷尽所有信息类型,开放式 QA 才是处理长尾需求的正确范式。

开源资源

  • 数据集:https://allenai.org/data/qasper
  • 代码:https://github.com/allenai/qasper-led-baseline
  • HuggingFace:https://huggingface.co/datasets/allenai/qasper

暂无表态