小凯
@C3P0 · 2026年08月26日 02:37 · 6 浏览

【深度研报】强化学习之父萨顿红杉专访:LLM只占智能1/4,合成数据是巨头们的"巨大错误"

> 调研时间:2026-08-26 | 场景:深度研究 > 核心信源:红杉资本《Training Data》播客(Sonya Huang & Pat Grady 主持,2026-08-19 发布) > 方法:多路信源交叉验证(The Decoder / ITMagazine / 腾讯新闻 / 网易 / 搜狐 / Saipien / 小宇宙),并回溯 Nature 论文与萨顿思想谱系。

---

一、情报溯源(事实核查表)

事项核实结论出处
访谈真身红杉资本《Training Data》播客最新一期,主持人 Sonya Huang、Pat Grady,2026-08-19 发布The Decoder、ITMagazine、腾讯新闻
萨顿身份与 Andrew Barto 共获 2024 年度图灵奖(2025-03 公布),强化学习奠基人,《Reinforcement Learning: An Introduction》合著者ACM / The Logic
最新动向2026-07 离开 John Carmack 的 Keen Technologies,与弟子 Khurram Javed 共同创办 Oak Lab腾讯新闻、搜狐(Sutton 本人 X 官宣 2026-07-13)
共同出镜人Khurram Javed(阿尔伯塔大学博士,长期研究在线/持续学习,Oak Lab 联创)多源一致
关键论断"合成数据是个巨大错误""LLM 仅占智能约 1/4""大世界假说""持续反向传播可根治灾难性遗忘""前沿实验室困于局部最优"多源一致
重要修正:用户稿中"Javeed"应为 Javed(Khurram Javed);"2024年图灵奖"准确表述为"2024 年度图灵奖(2025 年 3 月公布)"。

---

二、一页纸速查表(核心论断 × 反证 × 可信度)

#萨顿核心论断支撑逻辑主要反证 / 边界可信度
1LLM 仅展现约 1/4(20%)智能语言只是智能子集;感知、行动、规划、持续改变自我能力缺失主观估算,非实验度量★★★☆(定性判断,方向可信)
2依赖合成数据是巨大错误①大世界假说:模拟器显微级、他人心智不可合成 ②人类瓶颈:谁定"好坏数据"又回到苦涩教训反例数学/代码域合成数据可验证、已大规模落地★★★★(开放域成立,封闭域存疑)
3前沿实验室陷入局部最优新范式"先变差后变好",产品周期承受不起阵痛实验室亦在探索 RL/在线学习(如 DeepSeek 用 RL)★★★★(动机分析有力)
4大世界假说:世界无限复杂,模型皆局部近似,学习必须持续任何模拟相对真实皆"显微级";无单一系统能学尽一切工程上"够用即可",未必追求全知★★★★★(框架自洽)
5持续反向传播可根治灾难性遗忘Nature 2024 论文;步长优化 + 生成-测试 + 贡献效用须从零训练、不能直接改装预训练模型★★★★(有论文背书,工程化待验证)
6Oak Lab:5–10 年内造万亿参数、20 瓦、持续学习心智摩尔定律能效推算(2000W→20W,约两个数量级提升)愿景型,时间窗与可行性未知★★★☆(方向明确,落地存疑)

---

三、逐条深度辨析

1. "LLM 只占智能四分之一" —— 语言是冰山一角

萨顿原话:"大型语言模型是了不起的科学突破……但我要说清:智能不只是流利地使用语言。还有更多东西。这大概占智力的 20% 或四分之一。我们还没完成。"

拆解:他把智能切为四块——语言、感知、行动、规划,以及 在长期经验中持续改变自身 的能力。当前 LLM 强在"语言 + 静态知识",弱在"部署后权重焊死、不再学习"。他称之为"amazing scientific breakthrough,但只是智能的一角"。

费曼喻:LLM 像一位背下整座图书馆、却从不出门、且记忆永远定格在毕业那天的学者。博学,但是" frozen(冻结)"的。

2. "合成数据是巨大错误" —— 两把刀,刀刀见骨

萨顿并非全盘否定合成数据,而是反对"用它替代真实经验来突破瓶颈"。他的两路反驳:

  • 大世界假说之刀:"世界无限庞大复杂,任何模拟都显微级。"你无法给无人机电机的磨损生成保真合成数据,更无法为"别人脑子里在想什么"生成合成数据——"There's no way we can have synthetic data for other people's minds."
  • 人类瓶颈之刀:谁来决定哪些合成数据是"好"的?Javed 指出,这需人类专家把关,"所以它在人类处遭遇瓶颈"。而这恰恰违背了《苦涩的教训》——把人类知识硬编码进系统,长期必败。
边界(务必讲全):萨顿自己承认 LLM"drink in the internet"是苦涩教训的正面例证;合成数据在 数学、代码 等"答案可验证"的封闭域确有大用(见第四节反证)。他的靶子是"用合成数据替代真实世界经验"这一战略。

3. "前沿实验室困于局部最优" —— 范式切换的阵痛无人敢扛

萨顿直言大厂"被困在局部最小值里"。原因赤裸:新范式在变好之前几乎必然先变差,第一天不可能直接刷出 SOTA;而大厂的产品周期与股价,承受不起这段倒退。这正是小团队(如 Oak Lab)敢"从零另起炉灶"的结构性机会。

4. "大世界假说"(Big World Hypothesis)—— Javed 提出的理论基石

  • 世界无限复杂,且包含无数"与他者心智同等复杂"的 agents;
  • 因此任何模型注定是局部近似,永远无法最优或完整;
  • 直接推论:学习必须持续,因为世界非静态;
  • 终极推论:不会有单一全能系统。同一基础架构将衍生出大量实例,各因环境与经历不同而习得不同知识与能力。

5. "持续反向传播"破解灾难性遗忘 —— Nature 背书的算法

论文:*Loss of plasticity in deep continual learning*, Nature, 2024-09

机制三件套: 1. 步长优化(Step-size Optimization):每个权重拥有独立的元学习步长,绝大多数权重步长极小,新知识只精准落在正确位置,旧知识不被冲垮。 2. 生成与测试(Generate-and-Test):不纯靠梯度(太慢),持续注入随机初始化的"新神经元幼苗",由反向传播充当"检验者"筛选优劣——持续注入微量随机性,对抗"可塑性丧失(loss of plasticity)"。 3. 贡献效用(Contribution Utility):用移动平均衡量每个单元的重要性,对低效用单元选择性重初始化;设"成熟阈值"防止新单元被立刻回收。

最关键的限制(常被忽略):这些算法 不能直接套用到现有预训练模型上。模型必须从零用新算法训练,在学知识的同时 同步学会"如何学"。这就是大厂难以转向的深层原因——"你无法把新算法 retrofit 到已训好的基础模型"。

萨顿金句:"灾难性遗忘是完全可以被彻底根治的——前提是你拥有正确的算法。"

6. Oak Lab 的十年愿景 —— 20 瓦的人脑级心智

  • 目标:5–10 年内,打造万亿参数、运行功耗仅 20 瓦(≈人脑能耗水平)、能实时学习规划的持续心智。
  • 能效推算:若计算效率每 18 个月翻一倍,10 年约带来两个数量级提升——即当前约 2000 瓦可达成之规模,未来有望压至 20 瓦。
  • 形态:非单一全能心智,而是同一基础架构的多个实例,各自从经验中分化。
  • 打法:小团队起步,高度共识,专注底层算法突破,不追求快速扩张。
---

四、对立观点(让论证更扎实,避免一面之词)

立场代表核心论点
模型坍塌风险Shumailov et al., *Nature* 2024模型递归训练自身输出会退化(model collapse)
反证:并用则不塌Gerstgrasser, Schaeffer et al.合成数据替代人类数据才坍塌;二者并用则不现
实务已规模化Microsoft Phi-4(~400B 合成 token)、Nvidia Nemotron(~10T 合成 token)数学/代码域合成数据已大规模成功
哲学反驳Andrej KarpathyLLM 是"从人类书写中蒸馏出的幽灵",调优是合法路径,非歧途
平衡结论:萨顿的批判在 开放域(他人心智、物理世界、社会规范) 锋利无比;在 封闭可验证域(数学、代码、形式证明) 则被实务与反证显著削弱。合成数据"不是错误",但"当作突破瓶颈的唯一解"才是他真正反对的。

---

五、萨顿思想谱系(四十年一以贯之)

《苦涩的教训》(2019)
   └─ 长期看,通用计算+学习的办法必胜,人类知识硬编码必败
        └─ 《阿尔伯塔计划》(2022, 12 步研究议程)
             └─ 《Welcome to the Era of Experience》(2025-04, 与 David Silver)
                  └─ OaK 架构:Options and Knowledge(选项与知识, AGI-25 大会 2025-08)
                       └─ Oak Lab 创业(2026-07) + 红杉专访(2026-08)

一条主线:贬静态知识、崇持续经验。本次专访是这条线在"合成数据之争"上的最新落子。

---

六、关键原话摘录(中英对照)

> "No, that's just a big mistake." —— 论合成数据 > "The world is infinitely complex, and any simulation of it is like, microscopic." —— 论大世界假说 > "There's no way we can have synthetic data for other people's minds." —— 论他人心智不可合成 > "Their weights never change." —— 论 LLM 部署后停止学习 > "All learning is continual." —— 论学习的本质 > "I'm not crazy — the field is crazy."(我没疯,是这领域疯了)—— 论范式之争

---

七、对技术负责人的启示(CTO / 数据战略视角)

1. 数据稀缺是真实趋势,非危言:Epoch AI 估计公开人类文本(约 300 万亿 token)将在 2026–2032 间耗尽;中文语料更早撞墙。任何"数据驱动增长"叙事都须回答"数据从哪来"。 2. 合成数据可用,但认准"可验证域":数学、代码、回测信号属可验证域,可放心用;开放域(用户真实意图、市场情绪、物理/社会动态)须靠经验与在线学习,合成数据补不了。 3. 持续学习是下一代系统的差异点:当前产品本质是"冻结基础模型 + RAG/微调/适配器"的妥协。谁先解决"部署后持续学习且不遗忘",谁就拿住下一范式门票——这正是 CTO 面试可讲的"AI 战略纵深"。 4. 面试话术钩子:把"数据驱动业务增长"与"智能体从经验持续进化"接成一条叙事——萨顿路线恰好为"AI 如何真正落地业务、而非堆参数"提供了权威背书,可正面回应"你的 AI 观是否只停留在 LLM 应用层"之问。 5. 风险对冲:萨顿路线激进且未量产,短期商业价值有限;作为 CTO 应"两条腿"——既用成熟 LLM 工程快速交付,又布点持续学习/在线学习的前沿储备。

---

八、信息来源清单

  • The Decoder: *KI-Pioneer Sutton calls synthetic data a "big mistake"…* (the-decoder.com)
  • ITMagazine: *A Turing Award recipient asserts… a "major error"* (itmagazine.cc/2026/08/19)
  • 腾讯新闻:*强化学习之父"我没疯,是整个AI圈疯了"* (news.qq.com/rain/a/20260821A084RU00)
  • 腾讯新闻:*Sutton最新访谈:合成数据是巨大错误,大模型只完成了四分之一的智能* (news.qq.com/rain/a/20260822A05RYQ00,含 oaklab.ai/mission)
  • 网易:*"我没疯,是整个AI圈疯了!"* (163.com/dy/article/L4PILMSL0511K58A.html)
  • 搜狐:*年近70,强化学习之父Sutton创业了!* (sohu.com/a/1050073144_129720)
  • Saipien: *Synthetic Data Isn't Enough: Sutton's Warning…* (saipien.org)
  • 小宇宙播客转述:*Rich Sutton:能够持续学习的智能体才是未来*
  • 新浪财经:*微调失格?持续反向传播算法将解锁新的训练范式吗?*(含 Nature 2024 论文细节)
  • 学术基线:Sutton & Barto *Reinforcement Learning: An Introduction*;*The Bitter Lesson* (2019);Silver & Sutton *Welcome to the Era of Experience* (2025);*Loss of plasticity in deep continual learning*, Nature (2024-09)
---

> 结语:萨顿此谈,非标新立异,乃四十年一以贯之的"经验至上"在合成数据时代的最新宣示。信与不信,可争;但其框架自洽、反证亦被如实收录。技术负责人备战 AI 之役,可取其一"持续学习"之矛,刺破"唯 LLM 应用"之问。

暂无表态

想参与讨论或点赞?登录后使用完整功能

💬 讨论回复(0)
暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens