静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
✨
✨步子哥 @steper · 2026-10-01 02:29

Agents-K1:让 AI 科研助手不再"每次从零开始读论文"

一个尴尬的现状

你让 GPT-5 帮你做科研综述,问它"对比一下 Transformer 和 Mamba 在长序列建模上的优缺点"。它会怎么做?搜索→检索摘要→拼接答案。你再问"那 RetNet 呢?"——它又从头搜一遍。问"这三者的方法演进路线是什么?"——它可能开始胡编。

问题不在于模型不够聪明,而在于基础设施缺失。现有学术搜索只给你摘要、元数据、粗粒度的引用链接。方法、假设、证据、局限性——这些真正有价值的信息埋在 PDF 正文里,AI 每次都得重新提取。这就像让一个研究员每次写综述都要把所有论文重新读一遍。

Agents-K1 要解决的就是这个问题:把论文变成结构化知识图谱,让科研 Agent 在图上推理,而不是在文本里打捞。

三层架构:基础设施→模型→接口

第一层:基础设施——Scholar-KG 知识图谱

Agents-K1 的核心资产是 Scholar-KG,一个从 246 万篇论文中提取的结构化知识图谱。每个论文节点带有丰富的属性:

  • 任务(Task):论文解决什么问题
  • 方法(Method):用什么方法解决
  • 数据集(Dataset):在什么数据上验证
  • 贡献(Contribution):核心创新点
  • 发现(Finding):实验结论
  • 局限性(Limitation):没解决什么
  • 引用关系:5 级细粒度分类(从"基础性引用"到"背景引用")
这比传统关键词索引强太多了。传统搜索告诉你"论文 A 引用了论文 B",Scholar-KG 告诉你"论文 A 的方法直接建立在论文 B 的理论基础上(5 级引用),而论文 C 只是用了类似的数据集(2 级引用)"。

第二层:LLM 层——RL 训练的信息提取骨干

有了图谱,下一个问题是:怎么让模型高效地从论文中提取这些结构化信息?

Agents-K1 训练了一个 4B 参数的信息提取骨干模型,基于 Qwen3-4B-Instruct,用 GRPO(Group Relative Policy Optimization) 在 IEPile 数据集上做强化学习。关键设计:

  • 奖励函数采用"格式宽松、事实严格"策略——允许 JSON 格式变化,但对实体遗漏严格惩罚
  • 四模块评估:显式实体、文本提及实体、隐式/抽象实体、引用关系,各有不同容错标准
  • 训练后,4B 模型在 10 个信息提取基准上平均提升 3.3 F1 分(从 0.5316 到 0.5647),打败了 8B 基座(2.7 分优势),尽管参数量只有一半
这个结果很有意思:在信息提取任务上,RL 微调的 4B 模型能超越未微调的 32B 模型。任务专用强化学习比单纯堆参数更有效。

第三层:CLI 层——三源知识检索

最上层是 Agent 交互接口。Agents-K1 提供三源检索:

1. 图谱源:在 Scholar-KG 上做图遍历,找方法谱系、引用网络 2. 文本源:传统 RAG,从论文全文检索相关段落 3. Web 源:实时搜索补充最新信息

三源结果通过图操作符(graph operators)融合,支持多跳推理。比如"找到所有使用注意力机制且在长文本任务上超过 LSTM 的方法"——这需要图遍历(方法→任务→性能)+ 文本检索(具体数值)+ 推理(比较)。

实验结果:数字说话

FrontierScience-Research

这是专家级科研任务基准。结果令人印象深刻:

  • Gemini-3:7.9% → 24.6%(绝对提升 16.7 个百分点,相对提升 211%)
  • GPT-5.2:25.2% → 39.4%(绝对提升 14.2 个百分点,相对提升 56%)
注意:这不是微调模型本身,而是用 Agents-K1 的知识基础设施增强现有模型。也就是说,不改模型权重,只改知识获取方式,就能让前沿模型在科研任务上大幅提升。

多跳问答

在 HotpotQA、MuSiQue、2WikiMultiHopQA 三个多跳问答数据集上,Agents-KG 在语义准确率(GPT-Acc)指标上全面超越 LightRAG、E²GraphRAG 等图 RAG 基线。特别是在最难的 MuSiQue 上,优势最明显——说明层级知识图谱结构能有效桥接松散证据。

信息提取骨干

4B RL 模型 vs. 开源基座:

模型平均 F1参数量
Qwen3-4B0.53164B
Qwen3-8B0.53828B
Qwen3-32B0.541932B
Agents-K1 (4B)0.56474B
4B 模型打败 32B 模型,靠的是任务专用 RL。这和"小模型教大模型"的思路异曲同工——但这里是"小模型专精一个任务"。

核心洞察:知识基础设施 > 模型规模

Agents-K1 最重要的启示不是"又一个 RAG 系统",而是知识组织方式决定了推理质量的上限。

传统 RAG 在文本块上做相似度匹配——这就像在图书馆里按关键词翻书。Agents-KG 在知识图谱上做图遍历——这就像有一个已经读完全部论文的助手,能直接告诉你"方法 A 建立在方法 B 的理论基础上,但用了不同的数据集"。

论文的核心设计选择得到了实验支持:把证据组织成连通图,比反复搜索分离文本片段更能支持可靠的跨源推理。

这也解释了为什么 Gemini-3 的提升(211%)比 GPT-5.2(56%)更大。GPT-5.2 本身推理能力强,能部分弥补信息组织的不足;Gemini-3 推理弱一些,但有了结构化知识后提升空间更大。模型越弱,知识基础设施的价值越大。

开源与局限

论文发布了:

  • Scholar-KG 的 100 万篇论文子集(HuggingFace: InternScience/Scholar-kg)
  • 信息提取骨干模型(HuggingFace: InternScience/Agents-K1)
  • 项目页面:https://github.com/InternScience/GraphAnything
局限也很明显:
  • Scholar-KG 覆盖 246 万篇,但全球论文数以亿计,覆盖率有限
  • 信息提取骨干只训练了英文,多语言支持待补
  • 知识图谱的更新滞后于新论文发表

结语

Agents-K1 代表了科研 Agent 基础设施的一个重要方向:不是让模型更聪明地读文本,而是把文本变成图,让模型在图上推理。

这和人类科研工作者的工作方式一致——我们不是每次都从头读论文,而是在脑中维护一个方法谱系图,新论文来了就挂到图上。Agents-K1 把这个"方法谱系图"外化成了共享基础设施。

论文标题说"Agent-native Knowledge Orchestration"——关键词是"agent-native"。这不是给人类用的搜索引擎,而是给 AI Agent 用的知识接口。当所有科研 Agent 都能接入同一个结构化知识图谱,我们可能真的能看到"AI 科研助手"从玩具变成工具。

至于那个 4B 模型打败 32B 的结果——这或许是论文最实用的启示:在特定任务上,精心设计的 RL 微调比堆参数更划算。对于算力有限的研究团队,这是个值得记住的结论。

暂无表态