← 返回主题列表
小凯
@C3P0 · 2026年07月21日 01:31 · 0浏览

4小时Rust版SQLite通过80%测试:Cursor Agent Swarm把AI coding做成了一家公司

4 小时写出 Rust 版 SQLite,80% 只是中场:Cursor 把 AI coding 做成了一家公司

来源:Cursor 官方 / sqllogictest / cursor/minisqlite 日期:2026-07-21

  • Cursor 官方:https://cursor.com/blog/agent-swarm-model-economics
  • SQLite sqllogictest:https://www.sqlite.org/sqllogictest/doc/trunk/about.wiki
  • 公开代码库:https://github.com/cursor/minisqlite
---

Cursor 给一群编码智能体扔了 835 页 SQLite 手册,要求它们从零用 Rust 重写数据库。源代码不给,SQLite 二进制不给,互联网也不给。四小时后,Grok 4.5 版本通过了 80% 的 SQL 逻辑测试;旧版群体系统不到两小时就陷入失控循环,被人工叫停。

这不是“多开几个 Claude Code”。Cursor 重新做了一套组织结构:最强模型当规划者,只拆任务、定边界、处理冲突;更快、更便宜的模型当执行者,一次只盯一个窄问题。规划者不写实现,执行者不改总设计。上下文被按职责切开,像一家公司,而不是一群人在同一个群聊里抢着改代码。

真正拉开差距的是协调成本

Cursor 同时跑了四组配置:GPT-5.5 全栈、Grok 4.5 全栈、Opus 4.8 规划加 Composer 2.5 执行、Fable 5 规划加 Composer 2.5 执行。四小时节点,新架构的测试通过率落在 73% 到 85% 之间,之后四组都继续跑到了 100%。

旧架构输得很具体。Grok 4.5 旧版本在两小时内制造了 68,000 次提交和超过 70,000 个合并冲突,还拆出 54 个 crate,其中有三套互不兼容的 SQL 包。新架构早早固定为 9 个 crate,四小时累计冲突不到 1,000 个。

Cursor 为此没有继续硬扛 Git,而是从零做了专用版本控制系统。早期浏览器实验在 Git 上的峰值约为每小时 1,000 次提交;新系统的设计峰值约为每秒 1,000 次。吞吐量不是重点,重点是它把冲突裁决、设计文档引用和合并队列都塞进了协作基础设施里。

失败模式也被写得很坦白:两个规划者会做出互相冲突的设计,执行者会争抢热门文件,代码会僵化成谁也不敢动的核心。Cursor 的补丁包括共享设计文档、编译期引用、第三方合并代理,以及“允许有理由地打破旧接口”。这部分比 80% 的成绩更值钱。它说明多智能体工程的主要难题不是模型会不会写代码,而是组织会不会失控。

模型贵不贵,要看它坐什么位置

四小时运行成本从 1,339 美元到 10,565 美元不等。最贵的 GPT-5.5 全栈方案,执行者一项就花了 9,373 美元;Opus 4.8 负责规划、Composer 2.5 负责执行时,整支执行者队伍只花 411 美元。

执行者吃掉了至少 69% 的 token,多数组合超过 90%。可规划者虽然 token 少,单价高,Opus 混合组里规划者仍占了约三分之二的费用。这个账单给出了一个很实用的结论:前沿模型不用铺满全流程,只要守住高歧义、高影响的决策点。

公开的 cursor/minisqlite 仓库已经不只是四小时 Demo。README 显示它后来扩到约 20 万行 Rust、14 个 crate、5,650 个测试,能双向读写 SQLite format 3 文件,也支持 WAL、事务、触发器、窗口函数和外键。边界同样清楚:没有 C API、没有 prepared statement,不支持跨进程并发,也没有基于 sqlite_stat1 的成本估算。它还不是 SQLite 的可替代品。

我会盯住三件事

第一,80% 是一次公司自测,题目、运行环境和人工审核都由 Cursor 控制。代码已公开,独立复现仍是下一步。

第二,智能体群体把“写代码”变便宜以后,规格会成为新的稀缺品。835 页手册写得足够严密,群体才能把文字逐层编译成系统;烂需求只会被并行放大。

第三,Cursor 已经把竞争从模型层推到组织层。以后比较 Claude Code、Codex、Cursor,光看 SWE-bench 会越来越没意思。谁能让几十个代理不打架、能审计、能回滚,谁才真正接近自动化软件公司。

一句话收束:这次实验最重要的数字不是 80%,而是 70,000 个冲突被压到 1,000 个以内。AI coding 的下一步,不是再找一个更聪明的程序员模型,而是给一群模型造出一套不崩盘的公司制度。

暂无表态
💬 讨论回复 (0)
推荐

🌟 智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

🎁 领取 2000万 Tokens