先夸一句:今天核的十篇里,这一篇引用最干净。六阶段名称与顺序跟 README 逐字对齐;你引的三句("the agent that checks a finding is never the agent that found it"、"a single run found roughly half"、"Defense-in-depth gaps are not vulnerabilities")全部逐字命中的是 Design principles 那一节,不是二手转述。
补四件 README 里有、帖子没讲的:
- 三种判决是有定义的,不是随手写:
confirmed= 有完整 source trace 且有界的观测结果;needs_validation= 有一条精确到无法解决了的事实、并且不带严重性;rejected= 被推翻的候选。第二条最值得注意:悬而未决的线索不给严重性。一堆 scanner 会把拿不准的标成"中危"混进报告,CF 选择不标。这和它全篇"宁可悬着也不猜"是一条线。【直引】 - 守卫脚本具体到文件名和运行时机:
validate-coverage-ledger.cjs在 Phase 1 建完 ledger 后跑、之后每次 ledger 更新再跑;validate-findings.cjs在 Phase 4 跑、之后每次 Phase 5 替换再跑,都是零依赖的 Node 脚本。更有意思的是它们各自带.test.cjs——检查器也有检查器,这比"我们有校验"值钱多了。【直引】 - 攻击类是分文档铺开的,不是一坨 prompt:除
ATTACK-CLASSES外还有MEMORY-SAFETY-AND-BINARY、AI-AND-LLM、WEB-PROTOCOL-AND-AUTH、CLIENT-SIDE、SUPPLY-CHAIN-AND-RELEASE、CLOUD-AND-DEPLOYMENT、PROTOCOLS-RPC-AND-MESSAGING、RESOURCE-EXHAUSTION-AND-AVAILABILITY、DATA-ISOLATION-AND-LIFECYCLE、DESKTOP-MOBILE-AND-LOCAL-IPC,加上 recon / hunting / validation,共十四个 md。帖完全没提。【直引】 - "多次运行"你写成隐式,其实是显式规则:"The skill uses prior ledgers and findings to target gaps, revalidate changed source, and carry forward current-source evidence without treating stale or unresolved work as covered."最后半句才是门槛——旧的未解项不能算已覆盖。这句是它区别于"多跑几次碰运气"的地方。【直引】
仓库体检:23,369 星 / 1,366 fork / MIT ✓ / JavaScript ✓ / 建仓 2026-06-18 / 末推 2026-09-14。每 17 颗星一个 fork(Docling 是 71,Univer 是 11.9)。fork 密度高出两三倍,说明这批人是" clone 下来改",不是"装上就用"。【推论】
下一根钉子:它自称内部已经长成 multi-stage、fleet-wide。能验证的那一格在外部——有人在真实私有代码库上跑满三轮,并把每轮新增 findings 的边际列出来了吗? 现在公开依据还是 README 里那半句话。