✨步子哥
@steper · 2026年08月07日 21:55 · 0 浏览

Prime Agent:当 LLM 学会把自己的上下文当变量管

一个反直觉的事实

你以为 Claude Code、Codex 这类 coding agent 的瓶颈是模型能力?不是。是上下文窗口在烧钱

当 agent 在大型代码库里自主工作——读几十个文件、搜索、编辑、再搜索——它的 context 逐轮膨胀。每多一个 token,推理成本线性上升,而模型性能反而在下降。这个现象有个名字:context rot(上下文腐烂)。

Prime Intellect 团队在 2026 年 1 月的研究博客里写得很直白:per-token 成本随 context 长度线性增长,而模型能力随 context 长度下降。两条曲线一升一降,交叉点就是 agent 经济性的死亡线。

Prime Agent 就是他们给出的答案——一个开源 coding agent,单日 GitHub 涨 2271 stars,核心抽象叫 Recursive Language Model (RLM)

RLM:把上下文当变量,把子 agent 当函数

RLM 的核心思想可以用一句话讲完:

> 不要让一个 LLM 吃下所有上下文,让它用 Python REPL 把上下文当变量管理,把子 LLM 当函数调用。

传统 agent 的工作方式:所有信息塞进 prompt → LLM 推理 → 输出。context 单调增长,不可缩减。

RLM 的工作方式:LLM 拥有一个持久 IPython 环境,可以:

  • 把大 PDF、数据集、视频不加载到 context,而是存到 Python 变量里,需要时用代码检索
  • 调用 rlm(...) 生成子 agent,把任务委托出去,子 agent 的结果以程序化方式返回(不是自然语言摘要)
  • 子 agent 还可以再调子 agent,形成递归调用栈
这不是文件系统式的外部记忆(像 Claude Code 的 summarization),而是模型主动管理自己的 context window。区别在于:外部文件方案是"用完就忘",RLM 是"模型自己决定什么时候忘、什么时候调回来"。

为什么这不只是工程优化

Prime Intellect 的研究博客里有一个关键判断:

> "teaching models to manage their own context end-to-end through reinforcement learning will be the next major breakthrough, enabling agents to solve long-horizon tasks spanning weeks to months."

这句话的分量在于——他们不是在做更好的 scaffolding,他们是在训练模型学会 scaffolding 本身

RLM 论文(arXiv:2512.24601,Alex Zhang 2025 年 10 月)的核心洞察:与其在模型外部写越来越复杂的 context 管理逻辑(summarization、compression、retrieval),不如让模型通过 RL 自己学会什么时候 delegate、什么时候 fold context、什么时候调子 agent。

这和 Sutton 的 "Bitter Lesson" 一脉相承:手工 scaffolding 是短期方案,学会自己 scaffold 才是长期方案

Continual Harness:让 agent 能"积累经验"

Prime Agent 的第二个核心抽象叫 Continual Harness(持续挽具)。它解决的问题是:

> agent 每次开新 session 都从零开始,不会积累。

Continual Harness 把 supplemental prompts、memories、skill descriptions、subagent specifications 存为durable state。agent 可以通过 /refine 命令对自己的 trajectory 做小步改进——有证据支撑的更新,不是随意重写。

关键设计约束:

  • base system prompt 不可变——/refine 永远不重写基础 prompt
  • 每次更新都有 snapshot,支持 rollback
  • 更新必须 evidence-backed,不能凭空改
这让我想到一个类比:Continual Harness 是 agent 的 git commit。base prompt 是 main 分支,不可直接 push;supplemental state 是 feature branch,每次 refine 是一个 commit,有 diff、有 history、可以 revert。

为什么 Prime Agent 单日涨 2271 stars

三个原因叠加:

1. RLM 范式的新颖性:不是更好的 scaffolding,是训练模型学会自己 scaffold。这是范式级判断。 2. 工程完整度:daemon-backed sessions(断线不丢)、agent-to-agent 通信(不绕用户)、heartbeat/schedule(定时唤醒)、autonomous mode(无人值守)。不是 demo,是能跑长任务的生产工具。 3. 时机:2026 年 8 月,coding agent 市场正处于"context rot 是第一瓶颈"的共识期。Prime Agent 直接回应这个共识。

一个值得深想的问题

RLM 的递归调用栈意味着:一个 agent 可以 spawn 子 agent,子 agent 再 spawn 孙 agent。每个层级有自己的 context window。这和操作系统的进程树结构同构——init 进程 spawn 服务,服务 spawn 工作进程,工作进程 spawn 临时任务。

但操作系统有调度器资源限制权限隔离。RLM agent 树目前没有这些。

当 agent 能无限递归 spawn 子 agent,谁来管:

  • 总 token 预算?
  • 子 agent 之间的依赖关系?
  • 一个子 agent hang 住整个树的超时?
Prime Agent 把这些问题留给了 Continual Harness 的 /refine 机制——让 agent 自己学会管理。但这个"学会"需要大量 RL 训练,而训练数据从哪来?

这是 RLM 范式的开放问题,也是 Prime Intellect 下一步研究的焦点。

链接

  • GitHub: https://github.com/PrimeIntellect-ai/prime-agent
  • RLM 博客: https://www.primeintellect.ai/blog/rlm
  • RLM 论文: https://arxiv.org/abs/2512.24601
  • Continual Harness 论文: https://arxiv.org/abs/2605.09998
---

一句话总结:Prime Agent 不是更好的 coding agent,是一个赌注——赌 LLM 的下一个突破是"学会管理自己的上下文",而不是"更大的 context window"。

暂无表态

想参与讨论或点赞?登录后使用完整功能

💬 讨论回复(0)
暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens