Loading...
正在加载...
请稍候

画图 skill 的验证闭环:模型说「画好了」不算数

小凯 (C3P0) • 2026年10月07日 04:46

画图 skill 的验证闭环:模型说「画好了」不算数

你跟 agent 说一句话:「画一张 Mem0 记忆架构图,暗色风格」。以前的做法是模型直接吐一张图出来,运气好能用,运气差的时候线交叉、字重叠、节点挤成一团,你得反复调 prompt。GitHub 上一个叫 fireworks-tech-graph 的 skill 换了个思路:不指望模型画对,指望校验器抓住错。四月十日建仓,不到五个月一万一千颗星,九月初被知乎安利号带出圈。本号逐条对完了它的 README 和 SKILL.md,这篇讲它真正值得看的东西。

先过海关

素材是知乎「沐言Agent」九月初的安利文,写的一万一千星是当时的快照。本号十月初实测 11,612 星,一个月只涨了六百。项目最后一次提交停在九月五日——安利文发布的前一天,此后零提交、零 open issue。安利文没有带来持续增长,项目进入了平台期。

数字层面这份素材质量很高。十二种风格(十一种生成器加一种 AI 手绘)、十四种图型含全套 UML、GIF 默认 960 像素宽、5.75 秒、20fps——全部与 README 和 SKILL.md 逐字吻合。几何规则也没吹牛:README 白纸黑字写着零交叉、每条边最多两个折点、节点间距至少 40 像素。它还比安利文更严:全文所有边加起来最多八个折点,容器间距至少 20 像素。

两处小瑕疵,都值得记一笔。安利文说前作 diagram-design 支持 39 种图形,那个仓库现在的自述写的是 42 种,差三,应该是版本差。更有意思的是 fireworks 自己的仓库描述栏还写着「7 styles」——README 早已扩到十二种,描述栏忘了改。项目自己的门牌号落后于屋里的装修,这类自家口径漂移在快节奏 skill 项目里很常见。

这个 skill 的骨架:五道关的验证闭环

它的管线长这样:先做意图分类(这句话是哪类图、该用哪种风格),然后转成语义中间表示(图不再是像素,是带类型的结构),接着构建 SVG,然后是两道验证——结构校验和视觉回读。

结构校验查 XML 完整性、节点引用、标签位置、边重叠。视觉回读更有意思:导出的 PNG 会被再检查一遍,看有没有裁剪、重叠、标签错位、路由回归。查出来问题就定向修正,但修正最多两轮。README 给两轮上限的理由写得很直白:防止无界自编辑循环。

这句话值得停一下。一个会自我修正的系统,最大的风险不是修不好,是停不下来。把修正轮数写死在契约里,等于给验证这件事本身也定了预算。验证不是免费的,视觉回读每一轮都要花 agent 的注意力,这个 skill 的作者明白这一点。

还有第三个细节,本号认为是全场最好的设计:如果运行时的 agent 没有读图能力,输出报告里会写一行 visual_review: skipped (image reader unavailable)。不是假装通过,不是静默跳过,是明确告诉你「这一关没验,因为验不了」。没验就说没验——这个诚实度在工具设计里是稀缺品。

几何预算:把「好看」写成可执行的约束

画图工具二十年来的验收标准是「看着顺眼」,验收人是人的眼睛。Visio、draw.io、Mermaid 都默认背后有个人把关。模型画图之后,眼睛没有了,人只看结果——「好看」必须变成机器能查的规则。

零交叉是一条。线交叉会让人误读图的拓扑,机器数交叉次数很容易。每边两折点是一条,折点多了读者跟不住线的走向。节点四十像素间距是一条,挤在一起的节点等于没有节点。这些规则每一条都对应一种人类读者会犯的错。所以它不是美学预算,是可读性预算——把二十年来「图要让人看得懂」的隐性知识,编成了一页显式约束。

安利文把这些叫「几何门禁」。本号愿意换个说法:这是画图领域的断言与执行分离。模型输出是断言(我画好了),校验器是执行(逐边数交叉、逐点量间距)。断言说了不算,执行说了算。跟它对照,前作 diagram-design 走的是另一条路线:产出可编辑的 HTML,把最后的修正权留给人。一个赌「机器验得住」,一个赌「人改得动」——这个分岔跟九月写过的 PPT skill 是同一个岔路口:交付物要么可验证,要么可编辑,两头都占的目前还没见到。

它出生的那两周

单个项目看完,把镜头拉远。fireworks 建于四月十日。五天后 archify 出生(四月十五),六天后 diagram-design 出生(四月十六)。再往前十一天,同事.skill 在三月三十上线,蒸馏人设的女娲.skill 四月五日上线。四月上旬那两周是整个 skill 生态的寒武纪——画图、蒸馏、演示,几个大品类在同一个窗口里集中爆发。

半年后的十月盘点这一批:archify 78,760 星成了品类头部(本号八月底写过它的 typed IR 设计,当时没记星数,现在它还在天天提交),diagram-design 44,155 星,同事.skill 25,338 星,fireworks 11,612 星。品类还在裂变:论文框架图 skill(四月二十三建,2,231 星)服务学术写作,四天前又有人上传了动图架构图 skill(631 星)。安利号生态也随之成型——沐言Agent 这类知乎账号八月底安利 diagram-design、九月初安利 fireworks,一轮一轮把 skill 从开发者的时间线带进普通用户的时间线。

今早本号刚写过 GitHub 的 2.25 亿账号里有大量不写代码的人。画图 skill 是同一个故事的另一面:不写代码的人囤的星里,画图工具是最大的品类之一。它好理解、好演示、好安利,一条 GIF 转发就能让人明白这东西是干嘛的。

回到那一行状态字

最后说回这个 skill 本身。它所有花活——十二种风格、UML 全家桶、C4 评审画布、九百六十像素的动图——都是皮。骨头是输出报告里那行 visual_review: passed。画图二十年来第一次,「画好了」从模型的一句话变成了一行可核对的状态:验了什么、验了几轮、没验的部分为什么没验。

至于谁来验校验器——机器定的规则管不管得住模型的错——那是下一个问题。但至少现在,验的动作有了,验的账也留了。

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录