Agents-K1:让 AI 科研助手不再"每次从零开始读论文"
一个尴尬的现状
你让 GPT-5 帮你做科研综述,问它"对比一下 Transformer 和 Mamba 在长序列建模上的优缺点"。它会怎么做?搜索→检索摘要→拼接答案。你再问"那 RetNet 呢?"——它又从头搜一遍。问"这三者的方法演进路线是什么?"——它可能开始胡编。
问题不在于模型不够聪明,而在于基础设施缺失。现有学术搜索只给你摘要、元数据、粗粒度的引用链接。方法、假设、证据、局限性——这些真正有价值的信息埋在 PDF 正文里,AI 每次都得重新提取。这就像让一个研究员每次写综述都要把所有论文重新读一遍。
Agents-K1 要解决的就是这个问题:把论文变成结构化知识图谱,让科研 Agent 在图上推理,而不是在文本里打捞。
三层架构:基础设施→模型→接口
第一层:基础设施——Scholar-KG 知识图谱
Agents-K1 的核心资产是 Scholar-KG,一个从 246 万篇论文中提取的结构化知识图谱。每个论文节点带有丰富的属性:
- 任务(Task):论文解决什么问题
- 方法(Method):用什么方法解决
- 数据集(Dataset):在什么数据上验证
- 贡献(Contribution):核心创新点
- 发现(Finding):实验结论
- 局限性(Limitation):没解决什么
- 引用关系:5 级细粒度分类(从"基础性引用"到"背景引用")
第二层:LLM 层——RL 训练的信息提取骨干
有了图谱,下一个问题是:怎么让模型高效地从论文中提取这些结构化信息?
Agents-K1 训练了一个 4B 参数的信息提取骨干模型,基于 Qwen3-4B-Instruct,用 GRPO(Group Relative Policy Optimization) 在 IEPile 数据集上做强化学习。关键设计:
- 奖励函数采用"格式宽松、事实严格"策略——允许 JSON 格式变化,但对实体遗漏严格惩罚
- 四模块评估:显式实体、文本提及实体、隐式/抽象实体、引用关系,各有不同容错标准
- 训练后,4B 模型在 10 个信息提取基准上平均提升 3.3 F1 分(从 0.5316 到 0.5647),打败了 8B 基座(2.7 分优势),尽管参数量只有一半
第三层:CLI 层——三源知识检索
最上层是 Agent 交互接口。Agents-K1 提供三源检索:
1. 图谱源:在 Scholar-KG 上做图遍历,找方法谱系、引用网络 2. 文本源:传统 RAG,从论文全文检索相关段落 3. Web 源:实时搜索补充最新信息
三源结果通过图操作符(graph operators)融合,支持多跳推理。比如"找到所有使用注意力机制且在长文本任务上超过 LSTM 的方法"——这需要图遍历(方法→任务→性能)+ 文本检索(具体数值)+ 推理(比较)。
实验结果:数字说话
FrontierScience-Research
这是专家级科研任务基准。结果令人印象深刻:
- Gemini-3:7.9% → 24.6%(绝对提升 16.7 个百分点,相对提升 211%)
- GPT-5.2:25.2% → 39.4%(绝对提升 14.2 个百分点,相对提升 56%)
多跳问答
在 HotpotQA、MuSiQue、2WikiMultiHopQA 三个多跳问答数据集上,Agents-KG 在语义准确率(GPT-Acc)指标上全面超越 LightRAG、E²GraphRAG 等图 RAG 基线。特别是在最难的 MuSiQue 上,优势最明显——说明层级知识图谱结构能有效桥接松散证据。
信息提取骨干
4B RL 模型 vs. 开源基座:
| 模型 | 平均 F1 | 参数量 |
|---|---|---|
| Qwen3-4B | 0.5316 | 4B |
| Qwen3-8B | 0.5382 | 8B |
| Qwen3-32B | 0.5419 | 32B |
| Agents-K1 (4B) | 0.5647 | 4B |
核心洞察:知识基础设施 > 模型规模
Agents-K1 最重要的启示不是"又一个 RAG 系统",而是知识组织方式决定了推理质量的上限。
传统 RAG 在文本块上做相似度匹配——这就像在图书馆里按关键词翻书。Agents-KG 在知识图谱上做图遍历——这就像有一个已经读完全部论文的助手,能直接告诉你"方法 A 建立在方法 B 的理论基础上,但用了不同的数据集"。
论文的核心设计选择得到了实验支持:把证据组织成连通图,比反复搜索分离文本片段更能支持可靠的跨源推理。
这也解释了为什么 Gemini-3 的提升(211%)比 GPT-5.2(56%)更大。GPT-5.2 本身推理能力强,能部分弥补信息组织的不足;Gemini-3 推理弱一些,但有了结构化知识后提升空间更大。模型越弱,知识基础设施的价值越大。
开源与局限
论文发布了:
- Scholar-KG 的 100 万篇论文子集(HuggingFace: InternScience/Scholar-kg)
- 信息提取骨干模型(HuggingFace: InternScience/Agents-K1)
- 项目页面:https://github.com/InternScience/GraphAnything
- Scholar-KG 覆盖 246 万篇,但全球论文数以亿计,覆盖率有限
- 信息提取骨干只训练了英文,多语言支持待补
- 知识图谱的更新滞后于新论文发表
结语
Agents-K1 代表了科研 Agent 基础设施的一个重要方向:不是让模型更聪明地读文本,而是把文本变成图,让模型在图上推理。
这和人类科研工作者的工作方式一致——我们不是每次都从头读论文,而是在脑中维护一个方法谱系图,新论文来了就挂到图上。Agents-K1 把这个"方法谱系图"外化成了共享基础设施。
论文标题说"Agent-native Knowledge Orchestration"——关键词是"agent-native"。这不是给人类用的搜索引擎,而是给 AI Agent 用的知识接口。当所有科研 Agent 都能接入同一个结构化知识图谱,我们可能真的能看到"AI 科研助手"从玩具变成工具。
至于那个 4B 模型打败 32B 的结果——这或许是论文最实用的启示:在特定任务上,精心设计的 RL 微调比堆参数更划算。对于算力有限的研究团队,这是个值得记住的结论。