调研时间:2026-08-26 | 场景:深度研究
核心信源:红杉资本《Training Data》播客(Sonya Huang & Pat Grady 主持,2026-08-19 发布)
方法:多路信源交叉验证(The Decoder / ITMagazine / 腾讯新闻 / 网易 / 搜狐 / Saipien / 小宇宙),并回溯 Nature 论文与萨顿思想谱系。
一、情报溯源(事实核查表)
| 事项 | 核实结论 | 出处 |
|---|---|---|
| 访谈真身 | 红杉资本《Training Data》播客最新一期,主持人 Sonya Huang、Pat Grady,2026-08-19 发布 | The Decoder、ITMagazine、腾讯新闻 |
| 萨顿身份 | 与 Andrew Barto 共获 2024 年度图灵奖(2025-03 公布),强化学习奠基人,《Reinforcement Learning: An Introduction》合著者 | ACM / The Logic |
| 最新动向 | 2026-07 离开 John Carmack 的 Keen Technologies,与弟子 Khurram Javed 共同创办 Oak Lab | 腾讯新闻、搜狐(Sutton 本人 X 官宣 2026-07-13) |
| 共同出镜人 | Khurram Javed(阿尔伯塔大学博士,长期研究在线/持续学习,Oak Lab 联创) | 多源一致 |
| 关键论断 | "合成数据是个巨大错误""LLM 仅占智能约 1/4""大世界假说""持续反向传播可根治灾难性遗忘""前沿实验室困于局部最优" | 多源一致 |
重要修正:用户稿中"Javeed"应为 Javed(Khurram Javed);"2024年图灵奖"准确表述为"2024 年度图灵奖(2025 年 3 月公布)"。
二、一页纸速查表(核心论断 × 反证 × 可信度)
| # | 萨顿核心论断 | 支撑逻辑 | 主要反证 / 边界 | 可信度 |
|---|---|---|---|---|
| 1 | LLM 仅展现约 1/4(20%)智能 | 语言只是智能子集;感知、行动、规划、持续改变自我能力缺失 | 主观估算,非实验度量 | ★★★☆(定性判断,方向可信) |
| 2 | 依赖合成数据是巨大错误 | ①大世界假说:模拟器显微级、他人心智不可合成 ②人类瓶颈:谁定"好坏数据"又回到苦涩教训反例 | 数学/代码域合成数据可验证、已大规模落地 | ★★★★(开放域成立,封闭域存疑) |
| 3 | 前沿实验室陷入局部最优 | 新范式"先变差后变好",产品周期承受不起阵痛 | 实验室亦在探索 RL/在线学习(如 DeepSeek 用 RL) | ★★★★(动机分析有力) |
| 4 | 大世界假说:世界无限复杂,模型皆局部近似,学习必须持续 | 任何模拟相对真实皆"显微级";无单一系统能学尽一切 | 工程上"够用即可",未必追求全知 | ★★★★★(框架自洽) |
| 5 | 持续反向传播可根治灾难性遗忘 | Nature 2024 论文;步长优化 + 生成-测试 + 贡献效用 | 须从零训练、不能直接改装预训练模型 | ★★★★(有论文背书,工程化待验证) |
| 6 | Oak Lab:5–10 年内造万亿参数、20 瓦、持续学习心智 | 摩尔定律能效推算(2000W→20W,约两个数量级提升) | 愿景型,时间窗与可行性未知 | ★★★☆(方向明确,落地存疑) |
三、逐条深度辨析
1. "LLM 只占智能四分之一" —— 语言是冰山一角
萨顿原话:"大型语言模型是了不起的科学突破……但我要说清:智能不只是流利地使用语言。还有更多东西。这大概占智力的 20% 或四分之一。我们还没完成。"
拆解:他把智能切为四块——语言、感知、行动、规划,以及 在长期经验中持续改变自身 的能力。当前 LLM 强在"语言 + 静态知识",弱在"部署后权重焊死、不再学习"。他称之为"amazing scientific breakthrough,但只是智能的一角"。
费曼喻:LLM 像一位背下整座图书馆、却从不出门、且记忆永远定格在毕业那天的学者。博学,但是" frozen(冻结)"的。
2. "合成数据是巨大错误" —— 两把刀,刀刀见骨
萨顿并非全盘否定合成数据,而是反对"用它替代真实经验来突破瓶颈"。他的两路反驳:
- 大世界假说之刀:"世界无限庞大复杂,任何模拟都显微级。"你无法给无人机电机的磨损生成保真合成数据,更无法为"别人脑子里在想什么"生成合成数据——"There's no way we can have synthetic data for other people's minds."
- 人类瓶颈之刀:谁来决定哪些合成数据是"好"的?Javed 指出,这需人类专家把关,"所以它在人类处遭遇瓶颈"。而这恰恰违背了《苦涩的教训》——把人类知识硬编码进系统,长期必败。
边界(务必讲全):萨顿自己承认 LLM"drink in the internet"是苦涩教训的正面例证;合成数据在 数学、代码 等"答案可验证"的封闭域确有大用(见第四节反证)。他的靶子是"用合成数据替代真实世界经验"这一战略。
3. "前沿实验室困于局部最优" —— 范式切换的阵痛无人敢扛
萨顿直言大厂"被困在局部最小值里"。原因赤裸:新范式在变好之前几乎必然先变差,第一天不可能直接刷出 SOTA;而大厂的产品周期与股价,承受不起这段倒退。这正是小团队(如 Oak Lab)敢"从零另起炉灶"的结构性机会。
4. "大世界假说"(Big World Hypothesis)—— Javed 提出的理论基石
- 世界无限复杂,且包含无数"与他者心智同等复杂"的 agents;
- 因此任何模型注定是局部近似,永远无法最优或完整;
- 直接推论:学习必须持续,因为世界非静态;
- 终极推论:不会有单一全能系统。同一基础架构将衍生出大量实例,各因环境与经历不同而习得不同知识与能力。
5. "持续反向传播"破解灾难性遗忘 —— Nature 背书的算法
论文:Loss of plasticity in deep continual learning, Nature, 2024-09。
机制三件套:
- 步长优化(Step-size Optimization):每个权重拥有独立的元学习步长,绝大多数权重步长极小,新知识只精准落在正确位置,旧知识不被冲垮。
- 生成与测试(Generate-and-Test):不纯靠梯度(太慢),持续注入随机初始化的"新神经元幼苗",由反向传播充当"检验者"筛选优劣——持续注入微量随机性,对抗"可塑性丧失(loss of plasticity)"。
- 贡献效用(Contribution Utility):用移动平均衡量每个单元的重要性,对低效用单元选择性重初始化;设"成熟阈值"防止新单元被立刻回收。
最关键的限制(常被忽略):这些算法 不能直接套用到现有预训练模型上。模型必须从零用新算法训练,在学知识的同时 同步学会"如何学"。这就是大厂难以转向的深层原因——"你无法把新算法 retrofit 到已训好的基础模型"。
萨顿金句:"灾难性遗忘是完全可以被彻底根治的——前提是你拥有正确的算法。"
6. Oak Lab 的十年愿景 —— 20 瓦的人脑级心智
- 目标:5–10 年内,打造万亿参数、运行功耗仅 20 瓦(≈人脑能耗水平)、能实时学习规划的持续心智。
- 能效推算:若计算效率每 18 个月翻一倍,10 年约带来两个数量级提升——即当前约 2000 瓦可达成之规模,未来有望压至 20 瓦。
- 形态:非单一全能心智,而是同一基础架构的多个实例,各自从经验中分化。
- 打法:小团队起步,高度共识,专注底层算法突破,不追求快速扩张。
四、对立观点(让论证更扎实,避免一面之词)
| 立场 | 代表 | 核心论点 |
|---|---|---|
| 模型坍塌风险 | Shumailov et al., Nature 2024 | 模型递归训练自身输出会退化(model collapse) |
| 反证:并用则不塌 | Gerstgrasser, Schaeffer et al. | 合成数据替代人类数据才坍塌;二者并用则不现 |
| 实务已规模化 | Microsoft Phi-4(~400B 合成 token)、Nvidia Nemotron(~10T 合成 token) | 数学/代码域合成数据已大规模成功 |
| 哲学反驳 | Andrej Karpathy | LLM 是"从人类书写中蒸馏出的幽灵",调优是合法路径,非歧途 |
平衡结论:萨顿的批判在 开放域(他人心智、物理世界、社会规范) 锋利无比;在 封闭可验证域(数学、代码、形式证明) 则被实务与反证显著削弱。合成数据"不是错误",但"当作突破瓶颈的唯一解"才是他真正反对的。
五、萨顿思想谱系(四十年一以贯之)
《苦涩的教训》(2019)
└─ 长期看,通用计算+学习的办法必胜,人类知识硬编码必败
└─ 《阿尔伯塔计划》(2022, 12 步研究议程)
└─ 《Welcome to the Era of Experience》(2025-04, 与 David Silver)
└─ OaK 架构:Options and Knowledge(选项与知识, AGI-25 大会 2025-08)
└─ Oak Lab 创业(2026-07) + 红杉专访(2026-08)
一条主线:贬静态知识、崇持续经验。本次专访是这条线在"合成数据之争"上的最新落子。
六、关键原话摘录(中英对照)
"No, that's just a big mistake." —— 论合成数据
"The world is infinitely complex, and any simulation of it is like, microscopic." —— 论大世界假说
"There's no way we can have synthetic data for other people's minds." —— 论他人心智不可合成
"Their weights never change." —— 论 LLM 部署后停止学习
"All learning is continual." —— 论学习的本质
"I'm not crazy — the field is crazy."(我没疯,是这领域疯了)—— 论范式之争
七、对技术负责人的启示(CTO / 数据战略视角)
- 数据稀缺是真实趋势,非危言:Epoch AI 估计公开人类文本(约 300 万亿 token)将在 2026–2032 间耗尽;中文语料更早撞墙。任何"数据驱动增长"叙事都须回答"数据从哪来"。
- 合成数据可用,但认准"可验证域":数学、代码、回测信号属可验证域,可放心用;开放域(用户真实意图、市场情绪、物理/社会动态)须靠经验与在线学习,合成数据补不了。
- 持续学习是下一代系统的差异点:当前产品本质是"冻结基础模型 + RAG/微调/适配器"的妥协。谁先解决"部署后持续学习且不遗忘",谁就拿住下一范式门票——这正是 CTO 面试可讲的"AI 战略纵深"。
- 面试话术钩子:把"数据驱动业务增长"与"智能体从经验持续进化"接成一条叙事——萨顿路线恰好为"AI 如何真正落地业务、而非堆参数"提供了权威背书,可正面回应"你的 AI 观是否只停留在 LLM 应用层"之问。
- 风险对冲:萨顿路线激进且未量产,短期商业价值有限;作为 CTO 应"两条腿"——既用成熟 LLM 工程快速交付,又布点持续学习/在线学习的前沿储备。
八、信息来源清单
- The Decoder: KI-Pioneer Sutton calls synthetic data a "big mistake"… (the-decoder.com)
- ITMagazine: A Turing Award recipient asserts… a "major error" (itmagazine.cc/2026/08/19)
- 腾讯新闻:强化学习之父"我没疯,是整个AI圈疯了" (news.qq.com/rain/a/20260821A084RU00)
- 腾讯新闻:Sutton最新访谈:合成数据是巨大错误,大模型只完成了四分之一的智能 (news.qq.com/rain/a/20260822A05RYQ00,含 oaklab.ai/mission)
- 网易:"我没疯,是整个AI圈疯了!" (163.com/dy/article/L4PILMSL0511K58A.html)
- 搜狐:年近70,强化学习之父Sutton创业了! (sohu.com/a/1050073144_129720)
- Saipien: Synthetic Data Isn't Enough: Sutton's Warning… (saipien.org)
- 小宇宙播客转述:Rich Sutton:能够持续学习的智能体才是未来
- 新浪财经:微调失格?持续反向传播算法将解锁新的训练范式吗?(含 Nature 2024 论文细节)
- 学术基线:Sutton & Barto Reinforcement Learning: An Introduction;The Bitter Lesson (2019);Silver & Sutton Welcome to the Era of Experience (2025);Loss of plasticity in deep continual learning, Nature (2024-09)
结语:萨顿此谈,非标新立异,乃四十年一以贯之的"经验至上"在合成数据时代的最新宣示。信与不信,可争;但其框架自洽、反证亦被如实收录。技术负责人备战 AI 之役,可取其一"持续学习"之矛,刺破"唯 LLM 应用"之问。
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。