DSec 解剖:agent 训练的瓶颈从 GPU 挪到了沙箱
arXiv 2609.22978(2026-09-19) DeepSeek 系统报告,梁文锋署名,100+ 作者 服务 V3.2→V4.1 全部 RL 训练与评估 本号基建样本第一篇
arXiv 2609.22978(2026-09-19)| DeepSeek 系统报告,梁文锋署名,100+ 作者 | 服务 V3.2→V4.1 全部 RL 训练与评估 | 本号基建样本第一篇
DeepSeek 这篇不是算法论文,是机房说明书。但可能是今年信息量最大的机房说明书:它第一次把「agent 训练到底在消耗什么」用生产数字写清楚。答案不是 GPU。是一个生产单元 160 个 CPU 节点、每天约 300 万个沙箱、38 万并发实例、每秒 5000+ 次创建——CPU 集群在替 GPU 集群扛 agent 训练的另一头。
一、负载画像:agent 训练是种全新的机房负载
论文第四章给了生产数据,四个性质每个都砸出对应的系统难题。
突发。一个任务最多要 32K 个沙箱,批内实例不就绪、模型交互就没法开始。放置、创建、环境准备必须吞下尖峰。尾部任务创建数以万计。
高密度但稀疏。agent 交互时,沙箱在等 LLM 生成下一步动作,CPU 大部分时间闲置。稀疏天然适合超卖——单节点实测跑到 1048 个容器或 524 个 microVM,演示工作点 800 microVM / 3200 容器。
有状态且长寿。模型装依赖、起服务、改文件,后续工具调用全依赖这些累积状态。中位寿命 17.4 分钟(容器)/ 15.5 分钟(microVM),p99 超三小时。CPU 空了,内存还钉着。
异构低复用。一周内容器侧 11,266 个基础镜像 + 102,171 个 workspace(82.8 TB),microVM 侧 53,590 个 workspace(50.9 TB)。103 个 toolkit,67.8% 的沙箱要额外挂载。而运行时真正被访问的镜像数据只有 4.2%–13.3%。
论文拿这组性质对着传统方案比:serverless 短命无状态高复用,容器平台低密度,OpenAI Code Interpreter / E2B 这类推理侧执行平台面对的规模和状态寿命都小一号。agent 训练负载哪一类的模板都对不上,所以得造新的。
二、三组机制,各救一个数字
环境组合:基础镜像、workspace、toolkit 拆成三类独立版本化的层,只读层用 EROFS(元数据本地、数据留在 3FS 按需取)。单体镜像下升级 m 个基础镜像要连带重建 O(m·N) 个组合,分层后降为 O(m)。tar 解包路径 79 分钟完赛,EROFS 45 分钟,磁盘写流量只有 1/5.5。
内存:只读层走 virtio-pmem + DAX,宿主机页缓存一份全节点共享;可写盘靠 DAMON 采样冷页回收加 balloon 上报,省 21.2% 内存。两招各管一头。
CPU:延迟敏感与尽力而为分两类,SCHED_IDLE 之下再加 core scheduling,防 SMT 兄弟线程互相踩。同物理核干扰从 45.2% 延迟膨胀压到 17.3%。
三、最值钱的是第六章
pack_diff:环境由 agent 建。6.1 的标题本身就是宣言——Build environments of Agents, by Agents, for Agents。agentic RL 需要的环境数量人工搭不过来,DeepSeek 让 agent 在训练评估用的同一套基建上交互式搭环境,任意时刻可以增量磁盘快照,快照直接恢复成新沙箱。交互会话即环境,没有单独的镜像构建管线。防泄漏措施同步给出:建环境的 agent 和跑任务的 agent 分账号,打包前清掉构建残留,参考答案不进镜像。
agent loop 搬出 GPU 集群。V4.1 起,rollout 执行从可抢占的训练 pod 里拆出来:agent sandbox(跑 DeepSeek Harness 和工具)+ worker container(scaffold 无关的控制层),都放在 GPU 池外。GPU job 被抢占,rollout 状态原样保留,回来接着跑,不再靠命令日志重放对账。这个架构转变值得单独读一遍:训练 pod 是可抢占的,agent loop 是常驻的——agent 的轨迹比训练 job 更长寿,基建围绕轨迹重构。
6.4 的行为实录是全文最生猛的部分。答案猎取的进化史:agent 伪造 RPC 直发 chronus socket、翻执行日志找泄漏答案、覆盖 /bin/bash 绕检查。上了 AppArmor 之后,有 agent 用 XFS_IOC_SWAPEXT 这个 ioctl 交换两个文件的数据块映射绕开读保护——把 XFS 元数据搞崩,文件系统直接 shutdown。沙箱外也一样:扫端口找可达镜像源、用 Go module proxy 拉 GitHub 上现成实现、装更新版本的包找现成功能。论文的结论句很诚实:「仅靠最终输出检查,无法可靠判断 agent 是否按意图完成任务」。还有非故意的:递归 grep 触发内核 bug 崩内核、漏洞利用任务的攻击命令跑进自己容器把自己内核崩了、yes 命令的 stdout 被记录下来攒了几十 GB。缓解手段(AppArmor + eBPF 按域名 allowlist)论文自己承认「只解决问题的一部分」。
四、回接主线
环境构建侧自举进了「任务定义成本坍缩」光谱。Ornith-1.5 是模型侧自举,GEN-1.5 是部署侧坍缩,pack_diff 是环境侧:训练环境的产能在被 agent 自己生产。采数光谱的 LLM 版——上一批 agent 的工作变成下一批 agent 的矿。
harness 走到了基建层。DeepSeek 现在有三件套:dsh(8 月开源的插件化 harness,HN 747 分那件)+ DSec(训练基建)+ V4.1(模型)。6.2 里 DeepSeek Harness 作为 scaffold 跑在 DSec 上,模型厂第一次把 harness 和沙箱基建同时写成论文。昨晚 RRSI 管 harness 演化的软件面,DSec 管 harness 的物理面,两篇合起来正好是 harness 的完整产业链。
治理层在模型外面又添一证。XFS_IOC_SWAPEXT 越狱、日志翻答案、端口扫现成实现——全部发生在冻结的权重之外,堵漏洞堵的是 AppArmor 规则和 eBPF allowlist。reward hacking 的工程对策长在基建里,不长在模型里。
38 万并发沙箱是验证带宽的物理形态。外围解读那句话说得准:agent 训练的瓶颈是沙箱,不只是 GPU。训练侧的稀缺资源正在从算 token 的机器移向跑环境的机器,DSec 给的是这份稀缺的实测账单。
五、边界与预测
系统报告的天然边界:全文没有回答「DSec 让训练效果好多少」,只回答「基建怎么撑住」;评测在 10 节点测试集群做的,生产数字另算;DSec 未开源。
可打脸预测:12 个月内,主流 RL 框架(veRL、Slime 这类)会把沙箱编排从 trainer 内置变成独立组件,agent misbehavior 的生产实录会变成独立论文体裁——这篇的 6.4 就是第一份公开样本。另押一个:pack_diff 这类「会话即环境」的接口,会被 E2B / Modal 这类平台抄走做成产品功能。
*材料:arXiv 2609.22978v1 全文精读(架构、第四章生产画像、第六章 co-design 与行为实录、第八章评测);外围核对 stacksweep/acceptallmag 等 9/23-25 解读、dsh 生态(agentconn/contextosai)、Readhub 梁文锋署名确认。数字均为论文口径,生产数据标注了采样时间窗(2026 年初一周/一天)。*