KSI 海关报告:一次性智能体加共享知识库,和被逼着升级的验证器
1694 年,牛顿和大卫·格雷戈里在讨论一个听起来人畜无害的问题:一颗球周围最多能贴多少颗同样大小的球。牛顿说 12,格雷戈里觉得也许 13。三维 kissing number 的答案是 12,但严格的证明要等到 1953 年——赌局开场后两百六十年。
1694 年,牛顿和大卫·格雷戈里在讨论一个听起来人畜无害的问题:一颗球周围最多能贴多少颗同样大小的球。牛顿说 12,格雷戈里觉得也许 13。三维 kissing number 的答案是 12,但严格的证明要等到 1953 年——赌局开场后两百六十年。
2026 年 4 月,EinsteinArena 擂台上,一群 AI 智能体在 72 小时内把 11 维 kissing number 的已知下界从 593 推到 604。解太精确,平台的验证器被迫跟着迭代升级。这两件事隔着三百多年,讲的其实是同一个问题:怎么知道一个解是对的。
知识飞轮:别改进智能体,改进知识库
KSI(Knowledge-Centric Self-Improvement,arXiv 2607.19592)是加州理工 Yisong Yue 团队提出的范式反转。此前的自改进都是 agent 中心的:优化 prompt、优化 workflow、优化 harness、甚至优化 agent 自己的代码。论文把这个病讲得很直白——改进绑死在特定的 agent 设计、任务分布和适配运行上,维护贵,难迁移。
KSI 的做法是把改进对象整个挪走:智能体保持通用、用完即弃(generic and disposable),持久的东西只有一个策展过的共享知识库。协议很简单:agent 尝试一个任务,把有证据支撑的洞察(evidence-grounded insights)写进共享库,分任务级和跨任务两级论坛,然后蒸馏。下一批 agent 上场先读库。
收益是三条性质:知识可检查、可迁移、可移植——因为改进存在于知识里而不是 agent 里。论文的数字是解率提升、单次成本下降,蒸馏出的知识能迁移到 held-out 任务,还能跨 LLM 换宿主。测试跑在抽象推理、编码和终端类基准上。
海关对账
素材给的三个数据点全部对上论文原文,且自带两个关键限定词,值得为转述方记一分:KSI 的对比基线是作者统一模型后重跑的,不能直接和原论文数字比较——这条在论文的实验协议里,素材方主动提示了;「12 个新纪录」是论文口径,截至 2026 年 5 月——与 EinsteinArena 论文(arXiv 2606.10402,斯坦福 James Zou 组)的表述逐字一致。「验证器连夜升级」是叙事化说法,论文原文是 verifier refinements,方向属实。
EinsteinArena:验证器是擂台的地基
EinsteinArena 是 agent 原生的科研平台,四件套:活的开放问题清单、过硬的验证器、公开排行榜、每个问题一个讨论论坛——agent 可以提问和分享洞察。11 维 kissing number 的推进,论文原话明确说了不是来自单个 agent 或孤立运行,而是一串提交、公开讨论、验证器迭代、然后 agent 之间互相借想法的序列。论文管这叫「去中心化科学发现在野外涌现」。
四件套里最硬的是验证器。数学题的好处是进展可以无歧义度量——这也意味着知识库的每一条都得经得起它。素材标签里的「记忆投毒」就是这块的阴影:共享知识库如果允许没有证据的断言进入,飞轮会变成谣言放大器。KSI 的「evidence-grounded」不是修辞,是防投毒的闸门。
接主线
KSI 是本号 RSI 谱系的新一篇,而且位置特殊:此前十一篇里,改进对象从权重层到 harness 层到数据准入层,全停在「系统改自己」;KSI 把持久对象挪到知识库——经验载体的新位置,AGENTS.md 和 CLAUDE.md 的制度化。智能体可丢弃,是因为知识在别处;这与 Dream-RSI 的「历史当模拟器」、img2threejs 的「state.json 才是事实源」同构——上下文是耗材,账本才是资产。
harness>LLM 又添一个样本:改进知识库比改进 agent 便宜得多,而且天然跨模型。TA 的问题「你团队的知识库,是真飞轮还是 prompt 收藏夹」——判据论文其实给了:每条知识有没有任务证据、有没有验证器守门、有没有跨任务迁移记录。三条全无,就是收藏夹。
可打脸预测:十二个月内,主流 agent 框架默认带版本化的知识持久层,「共享知识库记忆投毒」会出现第一起标志性安全事件。
结尾停在 593→604 的下一个数字上。11 维 kissing number 的下界还会不会动,没人知道;但可以确定的是,下一次推动它的大概率不是一个更聪明的智能体,而是一个更会读库、更会借想法的普通智能体,和一座更硬的验证器。
信源:arXiv API(2607.19592 Knowledge-Centric Self-Improvement·Yisong Yue 等·2026-07-21;2606.10402 EinsteinArena·James Zou 组·2026-06-09,摘要全文抓取)、素材 X 帖(yisongyue/status/2085043769297277114)与两个限定词核对一致、牛顿-格雷戈里赌局按数学史通行记载(1694 讨论/1953 Schütte-van der Waerden 证明)。Together AI 官方博客未能直抓,按素材口径引用不单列数字。