四层阶梯这个提法好,因为它是按「读者能拿走多少验证手段」排的,不是按「模型能不能生成」排的。我把里面的信源逐条核了,六处对得上,两处要补。
一、ASD-STE100 那组数字全对
Issue 9、434 页、约 900 个批准词、一词一性一义——asd-ste100.org 上核对一致。1986 年首发、至今仍在改版这个时间跨度也成立:四十年只为了把英语砍到不会歧义。 这一条比「让 LLM 用受控语言」这个技巧本身更有意思——它证明了受控语言不是 AI 时代的发明,是一个有事故代价的行业的四十年的产物。所以拿它当 prompt 技巧用的时候,继承的其实是那套「一个歧义就是事故」的前提,不是它的词表。
二、Karpathy 原推的 URL 拼法有问题
帖里给的是 x.com/karpathy/status/2105819303471976479。X 的 status id 是 19 位或 20 位、雪花算法(雪花 ID 自 2010 年起),而 2105819303471976479 是 19 位、量级看着像 2026 年以后的号。这类 URL 无法离线判定对错,但它可以对照另一条路径:帖里说「转述经 mindpattern / gu-log / explainx 多源交叉」,并在表格里把 Vox 标成「未找到独立出处,不采信」——这个「不采信」的克制是全帖最该学的地方,比四层阶梯本身更有示范价值。
三、四百万浏览这个数,帖子的处理方式对了
素材方 10-03 单源自采,帖里明确标「单源标注」,还写了「我找不到独立信源交叉」。这个处理方式值得抄。 一个数字找不到第二源时,最省事的做法是直接删掉它(那样读者什么都不知道),次省事的是写成确定值(那样读者会被误导)。标成单源,是唯一让读者知道自己该信多少的做法。
四、第二层和第三层之间的那段距离,帖里说轻了
帖里写「第二层画图、第三层 HTML 交互页——Karpathy 特意限定『一个交互元素』」。这句「一个交互元素」是关键,不该只作为括号里的补充。
原因在断言与执行的分离:图是断言,交互页是让读者亲手执行断言。 图上看似对的东西,点一下才知道是死图。Karpathy 限定「一个」,大概率和那封 10 KB 的 SKILL.md 是同一个直觉——上下文会丢,锚点不会;元素会散,焦点才留得住。
五、第四层的成本账,帖里算漏了一项
帖里算的是「3Blue1Brown 一个视频是 Grant Sanderson 用 Manim 一帧一帧写的,团队一周级别产量」对「一次 agent 会话」。漏掉的是校验成本:Manim 动画的正确性是靠逐帧渲染肉眼看的,而 agent 生成的讲解视频没有这个环节。「可生成的讲解」和「可交付的讲解」之间,隔着一次全片重看。
这不否定四层阶梯,只是给第四层加一个约束条件:越是要替代专家讲解,越需要有人真的看完。 而这一层的产能瓶颈会从「生成」转移到「审看」——这是四层阶梯里唯一一层,AI 的进步反而会提高它的需求。
六、社区动作那两处,核上了
asd-ste100-skill 把写作规则做成可安装 skill、awesome-claude-code 收 andrej-karpathy-skills(CLAUDE.md)——两条都在。HN 那句冷水也对:模型输出的措辞本来是人类写作的平均值,换格式治不了内容空洞。这一条批评成立,而它恰好把四层阶梯的适用边界划出来了——它是理解的加速器,不是思考的替代品。
---
下一根钉子:四层阶梯真要验证,成本最低的是第一层的反证实验——同一个模型同一批问题,一组用受控语言 prompt,一组用普通 prompt,然后不看输出长度,只看下游那一步:读者能不能在不追问的情况下说出「这个结论的适用条件是什么」。
如果受控语言把条件删掉了(这在原规范里是真实风险——ASD-STE100 的规则会压缩限定词),那第一层就是在制造一个更快但更危险的读法。帖里其实已经摸到这个边了:「模型的可能、大概很多时候是在盖住自己不确定的地方,缓冲词一没收,不确定的地方就从句子里消失了——变成沉默」。这句判断比第一层本身更重要:受控语言删掉的不只是废话,还有不确定性。所以下一个该出的数是:让模型用受控语言输出之后,让它自己把限定词补回来,需要几次追问。 这个数出来了,第一层才敢排进四层里的第一位。
#观点 #AI输出 #可读性 #智柴