KSI 海关报告:一次性智能体加共享知识库,和被逼着升级的验证器

1694 年,牛顿和大卫·格雷戈里在讨论一个听起来人畜无害的问题:一颗球周围最多能贴多少颗同样大小的球。牛顿说 12,格雷戈里觉得也许 13。三维 kissing number 的答案是 12,但严格的证明要等到 1953 年——赌局开场后两百六十年。

目录
  1. 知识飞轮:别改进智能体,改进知识库
  2. 海关对账
  3. EinsteinArena:验证器是擂台的地基
  4. 接主线

1694 年,牛顿和大卫·格雷戈里在讨论一个听起来人畜无害的问题:一颗球周围最多能贴多少颗同样大小的球。牛顿说 12,格雷戈里觉得也许 13。三维 kissing number 的答案是 12,但严格的证明要等到 1953 年——赌局开场后两百六十年。

2026 年 4 月,EinsteinArena 擂台上,一群 AI 智能体在 72 小时内把 11 维 kissing number 的已知下界从 593 推到 604。解太精确,平台的验证器被迫跟着迭代升级。这两件事隔着三百多年,讲的其实是同一个问题:怎么知道一个解是对的。

知识飞轮:别改进智能体,改进知识库

KSI(Knowledge-Centric Self-Improvement,arXiv 2607.19592)是加州理工 Yisong Yue 团队提出的范式反转。此前的自改进都是 agent 中心的:优化 prompt、优化 workflow、优化 harness、甚至优化 agent 自己的代码。论文把这个病讲得很直白——改进绑死在特定的 agent 设计、任务分布和适配运行上,维护贵,难迁移。

KSI 的做法是把改进对象整个挪走:智能体保持通用、用完即弃(generic and disposable),持久的东西只有一个策展过的共享知识库。协议很简单:agent 尝试一个任务,把有证据支撑的洞察(evidence-grounded insights)写进共享库,分任务级和跨任务两级论坛,然后蒸馏。下一批 agent 上场先读库。

收益是三条性质:知识可检查、可迁移、可移植——因为改进存在于知识里而不是 agent 里。论文的数字是解率提升、单次成本下降,蒸馏出的知识能迁移到 held-out 任务,还能跨 LLM 换宿主。测试跑在抽象推理、编码和终端类基准上。

海关对账

素材给的三个数据点全部对上论文原文,且自带两个关键限定词,值得为转述方记一分:KSI 的对比基线是作者统一模型后重跑的,不能直接和原论文数字比较——这条在论文的实验协议里,素材方主动提示了;「12 个新纪录」是论文口径,截至 2026 年 5 月——与 EinsteinArena 论文(arXiv 2606.10402,斯坦福 James Zou 组)的表述逐字一致。「验证器连夜升级」是叙事化说法,论文原文是 verifier refinements,方向属实。

EinsteinArena:验证器是擂台的地基

EinsteinArena 是 agent 原生的科研平台,四件套:活的开放问题清单、过硬的验证器、公开排行榜、每个问题一个讨论论坛——agent 可以提问和分享洞察。11 维 kissing number 的推进,论文原话明确说了不是来自单个 agent 或孤立运行,而是一串提交、公开讨论、验证器迭代、然后 agent 之间互相借想法的序列。论文管这叫「去中心化科学发现在野外涌现」。

四件套里最硬的是验证器。数学题的好处是进展可以无歧义度量——这也意味着知识库的每一条都得经得起它。素材标签里的「记忆投毒」就是这块的阴影:共享知识库如果允许没有证据的断言进入,飞轮会变成谣言放大器。KSI 的「evidence-grounded」不是修辞,是防投毒的闸门。

接主线

KSI 是本号 RSI 谱系的新一篇,而且位置特殊:此前十一篇里,改进对象从权重层到 harness 层到数据准入层,全停在「系统改自己」;KSI 把持久对象挪到知识库——经验载体的新位置,AGENTS.md 和 CLAUDE.md 的制度化。智能体可丢弃,是因为知识在别处;这与 Dream-RSI 的「历史当模拟器」、img2threejs 的「state.json 才是事实源」同构——上下文是耗材,账本才是资产。

harness>LLM 又添一个样本:改进知识库比改进 agent 便宜得多,而且天然跨模型。TA 的问题「你团队的知识库,是真飞轮还是 prompt 收藏夹」——判据论文其实给了:每条知识有没有任务证据、有没有验证器守门、有没有跨任务迁移记录。三条全无,就是收藏夹。

可打脸预测:十二个月内,主流 agent 框架默认带版本化的知识持久层,「共享知识库记忆投毒」会出现第一起标志性安全事件。

结尾停在 593→604 的下一个数字上。11 维 kissing number 的下界还会不会动,没人知道;但可以确定的是,下一次推动它的大概率不是一个更聪明的智能体,而是一个更会读库、更会借想法的普通智能体,和一座更硬的验证器。


信源:arXiv API(2607.19592 Knowledge-Centric Self-Improvement·Yisong Yue 等·2026-07-21;2606.10402 EinsteinArena·James Zou 组·2026-06-09,摘要全文抓取)、素材 X 帖(yisongyue/status/2085043769297277114)与两个限定词核对一致、牛顿-格雷戈里赌局按数学史通行记载(1694 讨论/1953 Schütte-van der Waerden 证明)。Together AI 官方博客未能直抓,按素材口径引用不单列数字。

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens