Karpathy 的四层阶梯:读懂 LLM 输出,从 40 年前的航空手册开始
10 月 2 日,Karpathy 沉寂一段时间后回归发帖(Superhuman 10 月 5 日的说法是「Karpathy's Back」)。主题只有一个:我们会花越来越多的时间去理解语言模型的输出。
10 月 2 日,Karpathy 沉寂一段时间后回归发帖(Superhuman 10 月 5 日的说法是「Karpathy's Back」)。主题只有一个:我们会花越来越多的时间去理解语言模型的输出。
这句话值得停一下。过去两年所有优化都朝着生成端去——更快的模型、更长的上下文、更低的 token 价格。Karpathy 把镜头转了个方向:模型写东西的速度已经远超人类读东西的速度,瓶颈挪到了理解端。他给了四层方案,一层比一层重:受控语言、图、交互网页、定制讲解视频。
第一层:先让模型删掉自己的自由度
第一层听起来最冷门。Karpathy 说对他个人很好用的一个技巧,是让 LLM 用 ASD-STE100 解释东西。
这是一个真实存在的规范,全称 ASD-STE100 Simplified Technical English,航空维修手册的写作标准。1986 年首发,现在到 Issue 9,规范全文 434 页。核心是两本账:一本约 900 个批准词的词典,每个词只有一个词性、一个意思;一本写作规则,短句、主动语态、每段一条指令。修波音 747 的技师来自世界各地,英语水平参差,手册里一个歧义就是事故——所以这个行业四十年来坚持把英语砍到只剩不会歧义的部分。
为什么它对 LLM 输出有效?因为模型生成「废话」的机制和人一样:自然语言给了太多自由度,「可能」「大概」「值得注意的是」这些缓冲词本质上是把不确定性摊薄到句子里。受控语言把自由度直接没收。剩下的句子没法绕,要么是信息,要么暴露为空白。
第二层和第三层:从线性到平面,再到可动手
第二层是让模型画图。转述 gu-log 的说法,原推的比喻是:图是一个平面,你的眼睛决定先看哪里。文字是线性的,读的人被作者的顺序拖着走;图把结构摊开,读者自己选路径。
第三层是 HTML 交互页——而且 Karpathy 特意限定「一个交互元素」。多一个维度:读者可以点击、拖拽、转动参数,自己跑实验。
这一层联动着五个月前的一场讨论。Anthropic Claude Code 团队的工程师 Thariq Shihipar 当时说了一句传播很广的话:HTML 是新 Markdown。那句话说的是输出、不是存储——模型写 HTML、CSS、JavaScript 的能力,已经好过你设计的任何轻量标记格式。Karpathy 当时公开背书过。这次的四层阶梯可以看成他那句话的展开版:Markdown 是给人读的静态格式,HTML 是给读者动手的活格式。中间隔着的不是格式之争,是「读」和「试」的差别。
第四层:他最看好的,是定制讲解视频
第四层,Karpathy 最看好的:3Blue1Brown 风格的定制讲解视频,按需生成。转述 Martin Fowler 站点收录的片段,他的原话是对「highly bespoke(高度定制)的讲解内容即将到来的时代」非常感兴趣。
这里有一个成本账。3Blue1Brown 的每个视频是 Grant Sanderson 用 Manim 一帧一帧写出来的,一个团队一周级别的产量。而「TTS 源 + 两分钟讲解」的配方,生成一次的成本是一次 agent 会话。讲解视频从作品变成耗材。浏览量数据是素材方 10 月 3 日自采的口径:一天四百万,我找不到独立信源交叉,按单源标注——但方向上,这条推的传播热度有多路转述可以佐证。
海关裁决表
| 素材声明 | 核对 | 裁决 |
|---|---|---|
| 四层:受控语言/画图/HTML/讲解视频 | 多源转述一致,含「一个交互元素」「TTS+两分钟」细节 | 属实 |
| ASD-STE100 航空受控语言 | 官网 Issue 9、434 页、约 900 批准词、一词一性一义 | 属实 |
| 一天四百万浏览 | 仅素材方 10-03 自采,无独立信源 | 单源标注 |
| AYi 跟进 | @AYi_AInotes 实锤为中文 AI 笔记博主,本次跟进内容未溯源到 | 部分核实 |
| Vox 跟进 | 未找到独立出处 | 不采信 |
社区已经接招
正方动作快。GitHub 上已经有 asd-ste100-skill,把写作规则做成可直接安装的 skill 文件;awesome-claude-code 收录的 andrej-karpathy-skills,一个 CLAUDE.md 文件,专门改善 Claude Code 的输出行为。受控语言从航空业的手册,变成了 agent 的系统指令。
反方也有,而且有分量。HN 上的冷水是这样泼的:模型输出的措辞本来就是人类写作的平均值,你换格式,治不了内容空洞——格式管得了废话的形态,管不了废话本身。这个批评成立。受控语言能删掉「值得注意的是」,删不掉没有值得注意的东西。四层阶梯是理解的加速器,不是思考的替代品。
接主线
用本号的账本看,这四层其实是一个东西:理解的验证带宽在换载体。第一层删词汇自由度,让你读得快;第二层换空间自由度,让你扫得快;第三层给交互自由度——这是四层里唯一让读者自己动手跑验证的一层,Karpathy 把它排在视频前面,顺序是对的;第四层加时间轴自由度,讲解变耗材。断言-执行分离在这里又一次显形:纯文字输出是断言,交互页面是让读者亲手执行断言。给 LLM 输出做格式选型时,能上交互就不要停在图,能停在图就不要靠长文。
可打脸预测:十二个月内,主流 agent 的默认报告格式会从 Markdown 挪到带一个交互元素的 HTML——如果这件事没发生,说明理解端瓶颈的判断错了。
结尾停在第一层的一个细节上。受控语言删掉的不只是废话。模型的「可能」「大概」很多时候是在盖住自己不确定的地方,缓冲词一没收,不确定的地方就从句子里消失了——变成沉默。读输出的人要习惯这种沉默:模型没说的,可能比它说了的更值得追问。
信源:Karpathy 原推(x.com/karpathy/status/2105819303471976479,转述经 mindpattern / gu-log / explainx 多源交叉)、asd-ste100.org(Issue 9 规范)、Thariq 推文经 MDflow/mastra 二手转述、awesome-claude-code 与 GitHub asd-ste100-skill、HN 相关讨论、Superhuman(10-05)。浏览量为素材方单源自采。发布于 2026-10-06。