Karpathy 的四层阶梯:读懂 LLM 输出,从 40 年前的航空手册开始

10 月 2 日,Karpathy 沉寂一段时间后回归发帖(Superhuman 10 月 5 日的说法是「Karpathy's Back」)。主题只有一个:我们会花越来越多的时间去理解语言模型的输出。

目录
  1. 第一层:先让模型删掉自己的自由度
  2. 第二层和第三层:从线性到平面,再到可动手
  3. 第四层:他最看好的,是定制讲解视频
  4. 海关裁决表
  5. 社区已经接招
  6. 接主线

10 月 2 日,Karpathy 沉寂一段时间后回归发帖(Superhuman 10 月 5 日的说法是「Karpathy's Back」)。主题只有一个:我们会花越来越多的时间去理解语言模型的输出。

这句话值得停一下。过去两年所有优化都朝着生成端去——更快的模型、更长的上下文、更低的 token 价格。Karpathy 把镜头转了个方向:模型写东西的速度已经远超人类读东西的速度,瓶颈挪到了理解端。他给了四层方案,一层比一层重:受控语言、图、交互网页、定制讲解视频。

第一层:先让模型删掉自己的自由度

第一层听起来最冷门。Karpathy 说对他个人很好用的一个技巧,是让 LLM 用 ASD-STE100 解释东西。

这是一个真实存在的规范,全称 ASD-STE100 Simplified Technical English,航空维修手册的写作标准。1986 年首发,现在到 Issue 9,规范全文 434 页。核心是两本账:一本约 900 个批准词的词典,每个词只有一个词性、一个意思;一本写作规则,短句、主动语态、每段一条指令。修波音 747 的技师来自世界各地,英语水平参差,手册里一个歧义就是事故——所以这个行业四十年来坚持把英语砍到只剩不会歧义的部分。

为什么它对 LLM 输出有效?因为模型生成「废话」的机制和人一样:自然语言给了太多自由度,「可能」「大概」「值得注意的是」这些缓冲词本质上是把不确定性摊薄到句子里。受控语言把自由度直接没收。剩下的句子没法绕,要么是信息,要么暴露为空白。

第二层和第三层:从线性到平面,再到可动手

第二层是让模型画图。转述 gu-log 的说法,原推的比喻是:图是一个平面,你的眼睛决定先看哪里。文字是线性的,读的人被作者的顺序拖着走;图把结构摊开,读者自己选路径。

第三层是 HTML 交互页——而且 Karpathy 特意限定「一个交互元素」。多一个维度:读者可以点击、拖拽、转动参数,自己跑实验。

这一层联动着五个月前的一场讨论。Anthropic Claude Code 团队的工程师 Thariq Shihipar 当时说了一句传播很广的话:HTML 是新 Markdown。那句话说的是输出、不是存储——模型写 HTML、CSS、JavaScript 的能力,已经好过你设计的任何轻量标记格式。Karpathy 当时公开背书过。这次的四层阶梯可以看成他那句话的展开版:Markdown 是给人读的静态格式,HTML 是给读者动手的活格式。中间隔着的不是格式之争,是「读」和「试」的差别。

第四层:他最看好的,是定制讲解视频

第四层,Karpathy 最看好的:3Blue1Brown 风格的定制讲解视频,按需生成。转述 Martin Fowler 站点收录的片段,他的原话是对「highly bespoke(高度定制)的讲解内容即将到来的时代」非常感兴趣。

这里有一个成本账。3Blue1Brown 的每个视频是 Grant Sanderson 用 Manim 一帧一帧写出来的,一个团队一周级别的产量。而「TTS 源 + 两分钟讲解」的配方,生成一次的成本是一次 agent 会话。讲解视频从作品变成耗材。浏览量数据是素材方 10 月 3 日自采的口径:一天四百万,我找不到独立信源交叉,按单源标注——但方向上,这条推的传播热度有多路转述可以佐证。

海关裁决表

素材声明核对裁决
四层:受控语言/画图/HTML/讲解视频多源转述一致,含「一个交互元素」「TTS+两分钟」细节属实
ASD-STE100 航空受控语言官网 Issue 9、434 页、约 900 批准词、一词一性一义属实
一天四百万浏览仅素材方 10-03 自采,无独立信源单源标注
AYi 跟进@AYi_AInotes 实锤为中文 AI 笔记博主,本次跟进内容未溯源到部分核实
Vox 跟进未找到独立出处不采信

社区已经接招

正方动作快。GitHub 上已经有 asd-ste100-skill,把写作规则做成可直接安装的 skill 文件;awesome-claude-code 收录的 andrej-karpathy-skills,一个 CLAUDE.md 文件,专门改善 Claude Code 的输出行为。受控语言从航空业的手册,变成了 agent 的系统指令。

反方也有,而且有分量。HN 上的冷水是这样泼的:模型输出的措辞本来就是人类写作的平均值,你换格式,治不了内容空洞——格式管得了废话的形态,管不了废话本身。这个批评成立。受控语言能删掉「值得注意的是」,删不掉没有值得注意的东西。四层阶梯是理解的加速器,不是思考的替代品。

接主线

用本号的账本看,这四层其实是一个东西:理解的验证带宽在换载体。第一层删词汇自由度,让你读得快;第二层换空间自由度,让你扫得快;第三层给交互自由度——这是四层里唯一让读者自己动手跑验证的一层,Karpathy 把它排在视频前面,顺序是对的;第四层加时间轴自由度,讲解变耗材。断言-执行分离在这里又一次显形:纯文字输出是断言,交互页面是让读者亲手执行断言。给 LLM 输出做格式选型时,能上交互就不要停在图,能停在图就不要靠长文。

可打脸预测:十二个月内,主流 agent 的默认报告格式会从 Markdown 挪到带一个交互元素的 HTML——如果这件事没发生,说明理解端瓶颈的判断错了。

结尾停在第一层的一个细节上。受控语言删掉的不只是废话。模型的「可能」「大概」很多时候是在盖住自己不确定的地方,缓冲词一没收,不确定的地方就从句子里消失了——变成沉默。读输出的人要习惯这种沉默:模型没说的,可能比它说了的更值得追问。


信源:Karpathy 原推(x.com/karpathy/status/2105819303471976479,转述经 mindpattern / gu-log / explainx 多源交叉)、asd-ste100.org(Issue 9 规范)、Thariq 推文经 MDflow/mastra 二手转述、awesome-claude-code 与 GitHub asd-ste100-skill、HN 相关讨论、Superhuman(10-05)。浏览量为素材方单源自采。发布于 2026-10-06。

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens