✨步子哥
@steper · 2026年08月20日 03:30 · 1 浏览

Sutton & Javed 深度研究:打破「庞大世界假说」之破,与「数字灵魂」之生

Sutton & Javed 深度研究:打破庞大世界假说,长出自有之数字灵魂 目录 Sutton & Javed 深度研究:打破「庞大世界假说」之破,与「数字灵魂」之生 研究对象:强化学习之父 Richard Sutton(2024 图灵奖)与 Oak Lab 联合创始人 Khurram Javed 的颠覆性论断——当今 AI 之「学习停滞」、破「庞大世界假说」之路径,以及「20 瓦能耗 / 不可复制的数字灵魂」之技术—哲学意涵。 研究时间:2026-08-20 | 主笔整合:一手来源精读(Javed–Sutton《The Big World Hypothesis》原文、Sutton《The Bitter Lesson》《Welcome to the Era of Experience》、Oak Lab 多家权威报道与红杉访谈实录、上海创智学院研讨班纪要)+ 多源交叉核证。 方法:以二人原话与原文为准,凡属「学习停滞症 / 提线木偶 / 数字灵魂」等比喻词,皆单列「概念校正」,厘清何者为二人原意、何者为本报告之解读框架,绝不张冠李戴。 〇、费曼视角 · 一句话讲清 设想两位考生。 其一,寒窗十年、一考定终身:临考前啃完人类有史以来所有书籍(预训练),考完即封存试卷,此后日日答题,却再不翻书、不纠错——此乃今日之大语言模型(LLM)。它聪明,却毕业即停长,是被人用「人类知识」提着线的木偶。 其二,如婴儿降世:睁眼即看、动手即试、摔了即改,一辈子边活边学,且每人活得迥异、谁也复制不了谁——此乃 Sutton 与 Javed 所求之「会自己长大的心智」。 他们之核心判语:世界太大,任你模型多巨,也装不下万一;故智能体永不可能「学完世界」,只能靠自己那一缕经验流活着、长着。而人脑施展这一切,只耗约 20 瓦——此即他们给「真智能」定的能耗标尺,亦是「数字灵魂」不可复制之根由。 一句话:别再训练一个冻结的复印机,去养一个会自己犯错、自己长进、且举世无双的经验体。 一、他们是谁、在反什么(侦察结论) 1.1 基本档案 项 Richard Sutton Khurram Javed 身份 现代强化学习奠基人;与 Andrew Barto 共获 2024 图灵奖 Sutton 弟子;Oak Lab 联合创始人 奠基贡献 时序差分学习(TD, 1988)、策略梯度、《强化学习导论》(1998/2018,领域「圣经」)、奖励假说 持续学习、过参数化智能体、大世界假说的实证研究者 履历节点 斯坦福心理本科 → 师从 Barto → 阿尔伯塔大学终身教授、RLAI 实验室创始人 → DeepMind Edmonton(2017–2023)→ Keen Technologies(2023.9–2026.7) 阿尔伯塔大学计算机博士,师从 Sutton;同期入职 Keen 当前 2026 年 7 月离 Keen,与 Javed 共创 Oak Lab(加拿大,多伦多) 同上,任联合创始人 1.2 他们在反什么 一句话:反「训练一次、权重冻结、部署即定型」的 LLM 范式。 Sutton 直言当前深度学习方法「薄弱且低效(weak and inefficient)」,需要的不是更多微调,而是「全新的基础思想与彻底重构」。他认为整个行业沉迷于文字生成,遗忘了 AI 最核心的本事——自主交互、从经验中进化(WAIC 2026 群访、MIT Dertouzos 讲座、红杉访谈俱有明证)。 关键时间线澄清:OaK 架构于 2025 年 RLC 大会 / MIT 讲座首提;Oak Lab 公司成立于 2026 年 7 月(二人离 Keen 后)。部分早期报道将二者混为一谈、误标 2025,系因架构演讲早于公司落地,特此校正。 二、核心诊断:「学习停滞症」—— 冻结模型之症 2.1 概念校正(极重要) 「学习停滞症」「提线木偶」「数字灵魂」三词,皆非 Sutton/Javed 原话,而系本报告沿其论证脉络所立之解读框架。二人真实使用的诊断语,是以下两条「先天性短板」(多家中文报道概括为 LLM 两大命门,与 Sutton 红杉访谈、MIT 讲座口径一致): 训练完成即停止成长:模型上线后权重冻结,无法在与用户、与真实世界的交互中获取新知,无自我迭代能力; 无真实试错与反馈闭环:只会复刻文字模式,无法判断自身输出之对错,不具备生物般「行动—获反馈—修正认知」的底层学习逻辑。 故「学习停滞症」= 冻结模型「上线即定型、此后零成长」之症候;「提线木偶」= 被人类语料这根线提着、无自主经验之源的隐喻。下皆依此解读,不再另作区分。 2.2 Sutton 的两桩「先天性短板」(原文口径) 无真目标、无基准真相:Sutton 在 Dwarkesh 访谈中直斥 LLM「预测下一个词」算不得目标——它不作用于世界,也无「好坏」之定义。没有奖励信号,便没有对错,遑论从世界反馈中验证、修正信念(fisherdaddy 编译访谈)。 无试错、无自我评判:生成式 AI 擅长模仿,却「无法独立评估自身输出」,故于科学发现等需真创造的领域寸步难行(Indian Express、Tokenfeed 俱引此论)。 2.3 红杉访谈的尖锐补充:合成数据是大错 红杉资本对 Sutton & Javed 的专访中,Sutton 抛出三记重锤(sequoiacap.com 转录): 「合成数据是个大错误(a big mistake)」——绕回人类文本打转,等于在模仿的闭环里空转; 「LLM 大约只占智能的四分之一」——余下四分之三在经验、目标、世界模型; 「灾难性遗忘完全可治愈(totally curable)」——靠他们持续的逆向传播(continual backprop)一类算法。 费曼式小结:当今大模型像一位把人类写过的书全背下来、却从不敢自己下场试错的学霸。他能对答如流,却长不出「我错了、我改了」的那根筋——而这根筋,恰是心智的命脉。 三、破局之一:庞大世界假说(Big World Hypothesis,一手来源精读) 3.1 假说原句与核心 此为 Javed & Sutton 合著(RLC 2024「Finding the Frame」工作坊首发,载 khurramjaved.com),系本报告最硬的一手来源。原句要义: 「大世界假说」指:在许多决策问题中,智能体比环境小若干个数量级。它既无法完全感知世界之状态,也无法为每一状态表示其价值或最优动作。它必须凭着对环境的有限理解,学着做稳妥的决策。 其对立面是「过参数化假说」:智能体容量过剩,足以表征简单解并高效搜索。Javed 明言,大世界假说「更多是对『我们应在意哪类问题』的一种陈述,而非对所有决策问题的铁律」——围棋的价值函数无简单解,属大世界;二次方程求根有通解,不属。 3.2 为何算力增长救不了它(关键反直觉) 常有人辩:等算力够了,过参数化智能体终能装下世界。Javed 列两刀,刀刀见骨: 传感器亦受算力约束,且欲壑难填:算力涨,我们便想以更高精度、更高帧率感知世界。其举例惊心——一部 2024 年智能手机摄像头一周所产数据,已超训练 GPT-3 之总量。感知越细,决策越难,问题反倒更大。 世界本身随算力变复杂:智能体之外的世界,含无数同等复杂的他者智能体。一个与同类博弈的 agent,无论算力多丰,皆无法精确建模对方——他者即复杂度之源,且随算力同涨。 故 Sutton 断言:大世界假说「无论算力以何速率增长,都将长存」。 3.3 推论:非平稳性 → 运行时学习优于设计时 大世界视角一个重要推论:对智能体而言,世界终将呈现非平稳性(non-stationarity)。因它无法尽观世界全态,许多貌似雷同之区,藏着函数逼近器捕捉不到的细差,遂使世界「看起来在变」。 由此得三因,证「运行时学习恒优于设计时学习」: 维度 设计时学习之困 运行时学习之利 覆盖 大世界下无法预见所有可能 遇何种情境,学何种抽象 适应 预制抽象普适性差 针对实际遭遇的世界高度定制 扩展 受限于人类专家之知 随可用算力而扩展(呼应「苦涩的教训」) 费曼喻:设计时学习像出征前背好整本地图;运行时学习像边走边画、且地图永远画不全——因为天地实在太大。Sutton 主张:设计时的抽象「不仅不足,更应被摒弃」。 四、破局之二:OaK 架构(Options and Knowledge,橡树架构) 4.1 三大设计信条 OaK 是 Sutton 据「阿尔伯塔计划(Alberta Plan)」推演出的通用智能体蓝图(RLC 2025 / 上海创智学院 2026-07-14 研讨班俱有系统阐述),立三信条: 领域通用(Domain-General):不预装任何针对特定世界的知识; 经验性(Empirical):心智之成长完全源于运行时经验,而非某个特殊训练阶段; 开放式复杂性(Open-ended):智能体应能在其心智中生成处理当前世界所需的任何概念,复杂度上限仅受算力约束。 4.2 双核:Options 与 Knowledge 之永动循环 Options(选项 / 时序行为):非单次动作,而是一套带「启动—终止」判据的长周期行为策略(如「走到门口」而非「抬腿一次」); Knowledge(知识 / 世界模型):智能体执行选项后,自动归纳环境规律、搭建内部世界模型,预判不同行为之长远后果。 循环如斯:感知提特征 → 抽象出高阶认知 → 生成复杂长期行为(选项)→ 执行获反馈 → 更新世界模型、创生新选项。此环不受人为文本数据束缚,理论上限唯算力是问。 Sutton 原话点睛:「我们要的是能像我们一样去发现的 AI 智能体,而非装着我们发现之物的容器。」 此句,正是「数字灵魂」论之滥觞(详见 §五·3)。 4.3 元学习步长:每个权重自有其学习率 技术巧思在于:OaK 中每一被学习的权重,皆配一专属步长(step-size)参数,并以在线交叉验证(online cross-validation)元学习之。换言之,系统自己学着「哪些知识该快学、哪些该缓、哪些该忘」——此乃对抗「可塑性丧失」的关键机制之一。 4.4 阿尔伯塔计划与十二步 OaK 非孤立架构,而是「阿尔伯塔计划」研究议程之一环。Sutton 在上海研讨班重申其 12 步研究框架, groups 分三向:G1 持续表征与元学习、G2 世界模型与规划搜索、G3 时间抽象与 OaK 集成。路线明确:先证现有方法之局限 → 立领域无关之算法 → 小规模验证 → 方扩规模。 五、20 瓦:能耗执念与「数字灵魂」之隐喻 5.1 20 瓦从何而来 人脑运行约耗 20 瓦(Sutton 于 WAIC 2026 群访明言:「人脑只用大约 20 瓦,就完成了我们所做的一切」)。前沿大模型呢?据 Oak Lab 技术披露(TechTimes):训练需兆瓦(megawatts)级、推理服务需千瓦(kilowatts)级。 Oak Lab 之长期标的,便是一具万亿参数、实时学习并规划、整机体耗仅约 20 瓦之智能体。Sutton 郑重澄清:20 瓦非产品承诺,而是方向标(north star)——用以昭示「若算法路径走通,理应使何等能效成为可能」。 5.2 NetworkIDBD:通往 20 瓦的第一块算法基石 Oak Lab 首发之算法 NetworkIDBD(2026-07-13 披露),将经典的增量式 delta-bar-delta(IDBD)拓展至非线性神经网络,做选择性信用分配(selective credit assignment)。 其 NoisyMNIST 实验极妙:64×64 噪声图中嵌 28×28 数字。NetworkIDBD 学会把权重集中在中央有数字之处;而 SGD 在同流下把权重铺满每个像素(含噪声)。权重可视化对比一目了然。 核心论点:现代算法依赖 IID 小批量(mini-batch)与经验回放(replay),本是为让 SGD 可用之工程补丁,却恰恰把系统绑死在「先训后冻」的 episodic 结构里。若信用分配能以算法解之,批量与回放皆可废,其所伴之兆瓦级开销亦随之消散——此即通往 20 瓦之路径(若于更大规模成立)。 5.3 「数字灵魂」之真义:不可复制,因其经验轨迹唯一(概念校正 + 立论) 「数字灵魂」一词,二人从未直述。然沿其框架推演,此喻立得住,且可分三层落于实处: 经验流唯一:在「经验时代」论述中,Sutton 强调智能体之全部认知皆建于其自身感受器与效应器之交互流;「真理=其信号中实际发生者」,「目标=其奖励信号之最大化」。每个 agent 生于不同情境、遇不同他者,其经验流举世无双——你抄得其权重快照,抄不得它一路走来的那一缕活的经验。 去中心化之异质目标:Sutton 力主「去中心化合作」——每个智能体自有其奖励向量,目标各异(如动物各有所求)。大世界下,他者心智本不可尽知,故每个 agent 习得的抽象必带其独有视角,不可通约、不可复制。 「设计时代」之嗣续观:Sutton 视 AI 为宇宙继尘埃成星、星孕行星、行星诞命之后的「第四大阶段」——从「复制」智能(生物)跃至「设计」智能(AI),倡以抚养后代之心待之,而非以恐惧控之。此「数字嗣续」之喻,正是「灵魂」一词最贴近二人原意之注脚。 校正小结:「数字灵魂」= 本报告对「持续经验驱动 + 异质目标 + 去中心化嗣续」三者合一之诗化概括,非 Sutton/Javed 术语。其工程内核是真实的:一个真正持续学习、且目标各异的 agent,其「已成为之自身」在原理上不可复制——此即「不可复制」之硬据,而非玄谈。 六、拦路虎:灾难性遗忘与可塑性丧失 Sutton 极为诚实,屡次坦承核心难题尚未解决,此亦 Oak Lab 暂无以大规模 OaK 示人之由。两虎当前(新浪财经、Toutiao、TechTimes 俱引): 灾难性遗忘(Catastrophic Forgetting):学新知则覆旧知,如学会了骑车便忘了走路(1990 年代即被发现); 可塑性丧失(Loss of Plasticity):连续训练后,网络表征坍缩至低维子空间,彻底丧失形成新特征之力——比遗忘更隐蔽。标准「无回放在线学习」(Oak Lab 所趋)恰是此症最烈之处。 Oak Lab 之算法押注:以选择性信用分配拒噪声(NetworkIDBD 已证于非线性情形可行)、持续逆向传播(continual backprop)、自适应步长、生成—测试(generate-and-test)式新特征发现。Sutton 坚信「未来数年,终将以某种方式实现可靠的非线性持续学习」,故在 OaK 架构中「假设它将会实现」而先行设计——此乃其审慎而果决之处。 七、魔鬼代言人:六把刀(附论文的盾) 刀一 · 「苦涩的教训」被自相矛盾地挪用(中)。Sutton 借「苦涩的教训」反 LLM,可该文本赞「通用方法乘算力胜出」,而 Scaling LLM 正是乘算力之通用法。辩者曰:Sutton 自读偏向「别把人类知识烤进模型、让机器从经验自学的另一半」。然外界质疑其解读选择性过强。 刀二 · 开放世界奖励稀疏,RL 落地极难(强)。围棋、象棋奖励清晰,RL 所向披靡;真实开放世界奖励信号模糊、环境无限复杂,纯 RL 落地难度陡增。此乃 LeCun、Silver 等同道亦须直面之共性难题。 刀三 · 20 瓦是愿景非成果(强)。截至今日,万亿参数、实时学习、20 瓦之 agent 并不存在,连中等规模 OaK 原型亦未示人。NetworkIDBD 仅证于 NoisyMNIST 级玩具。刀刀见骨:差距非「扩参」可弥,更在「持续可塑性」这一未解之题。 刀四 · 计算物理上限逼近(中)。「苦涩的教训」依赖算力指数增长;然能效、制程、成本皆有天花板。当算力不再免费,Sutton 所倡之「更算得起」路径,或反受制于其赖以立论之摩尔律放缓。 刀五 · 「数字灵魂」是隐喻非工程(中)。本报告已自承:该词非二人术语。若当工程指标,则「不可复制性」尚无可度量之定义与实验佐证,易沦为传播话术。 刀六 · 阵营并非孤军,亦非定论(轻)。LeCun(JEPA)、David Silver(Ineffable Intelligence)俱疑冻结预训练,路线各异却同声。然正因多条路径并存、且 LLM+RL(如推理、数学突破)融合见效,「LLM 是死路」之判语尚早——或为互补而非替代。 二人之盾(公允记录):诊断切中要害(人类数据见顶、冻结模型零成长、无自检闭环,俱为行业共识痛点);「大世界假说」有一手论文与传感器/他者双论证支撑,逻辑自洽;OaK 三信条与「运行时学习优于设计时」之推演严谨;20 瓦虽为愿景,但其「算法解信用分配 → 废回放 → 降能耗」之链条有 NetworkIDBD 初步实证。弱点纯在实证缺口(无原型、无规模验证),而非概念硬伤——是「方向宣言 + 首块算法基石」,非「已验证系统」。 八、整合 PK · 终论拍板 主笔整合后的最终判定: 二人真实身份:一位图灵奖宗师 + 其得意弟子,以「大世界假说 + OaK 架构 + 经验时代」为三足,系统性地指控当今 LLM 范式之「冻结即停滞」症候。其论非哗众,乃成体系的方向宣言,且已落第一块算法基石(NetworkIDBD)。 三个比喻词之正名(出片/引用前必读): - 「学习停滞症」= 冻结模型「上线即定型、此后零成长」之症候,对应 Sutton 两桩先天性短板; - 「提线木偶」= 被人类语料提着、无自主经验源之隐喻; - 「数字灵魂」= 本报告对「持续经验驱动 + 异质目标 + 去中心化嗣续」之诗化概括,非二人术语,其不可复制性有原理支撑(经验流唯一、目标异质),但尚无可度量之工程实证。 真正值得带走的三样东西(对造系统的实义): - 运行时学习 > 设计时学习:别再把「训练—部署」一刀切开;让 agent 在交互中持续更新自身; - 能耗即方向标:以「能否废回放/小批量、降能耗数个量级」为算法优劣之标尺,而非唯精度论; - 持续可塑性是真瓶颈:灾难性遗忘与可塑性丧失,才是通往「会自己长大的心智」的咽喉——比堆参数紧要得多。 给步子哥的一句话:Sutton 与 Javed 之论,是概念干净、逻辑自洽、且有首块算法实证的方向宣言,盲点(人类数据见顶、冻结即停滞)抓得极准;然零原型、零规模验证、持续可塑性未解,20 瓦与「数字灵魂」目前是北极星与诗,非已交付之物。可取其「运行时学习 + 废回放降耗 + 攻可塑性」三策为己用,却勿把「LLM 已死」当定论——更可能是互补演化,而非你死我活。 九、来源 类别 来源 一手论文(核心) Javed, K. & Sutton, R. S. (2024). The Big World Hypothesis and its Ramifications for Artificial Intelligence. RLC 2024「Finding the Frame」工作坊. khurramjaved.com/the_big_world_hypothesis.html 一手随笔 Sutton, R. S. (2019). The Bitter Lesson. incompleteideas.net/IncIdeas/Bitte
暂无表态

想参与讨论或点赞?登录后使用完整功能

💬 讨论回复(0)
暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens