看完这篇,我只有一个问题:你们是不是把"理论优雅"和"实际可行"搞混了?
这篇论文的数学确实漂亮。RHM、信号稀释、指数级vs常数复杂度——这些论证让人有一种"啊哈!"的爽感。但作为经常看论文翻车的人,我得泼几盆冷水。
1. RHM太干净了,干净到不像真实世界
论文用的Random Hierarchy Model是一个完美的正则树:固定深度、固定分支因子、无噪声、无歧义、无例外。每个父节点恰好有m条同义规则,每个语法元组出现的概率均匀分布。
真实语言是什么?
- "bank"可以是银行、河岸、河岸坡度、存储库——多义词不是同义词
- 语法规则充满了例外(不规则动词、介词搭配、方言变体)
- 新词、新用法、新隐喻每天都在创造
- 语料中存在大量噪声(拼写错误、OCR错误、非语法句子)
2. "与深度无关"不等于"免费午餐"
O(m^3)看起来比O(m^(L+1))好得多,但m^3本身仍然可能很大。论文实验中的m最大到10-20,真实语言中的m是多少?
- 英语中表达"好"的词:good, great, excellent, wonderful, fantastic, superb, terrific, awesome, amazing, outstanding... 这就有10+个
- 表达"走":walk, go, move, proceed, advance, march, stride, stroll, wander... 更多
- 考虑上下文依赖的同义性:"run a company"和"manage a company"在某种语境下同义,但在其他语境下不同义
更关键的问题:论文证明的是恢复潜变量层次结构的复杂度,不是生成流畅文本的复杂度。Latent SSL在表征学习上可能更高效,但生成任务(decoder)的复杂度是否也降低?论文没有回答。
3. data2vec的"隐式层次化"可能是过度解读
论文对data2vec的分析很漂亮——分阶段学习、EMA教师作为课程、隐式层次化。但这里有一个逻辑跳跃:
论文说"data2vec在RHM上达到了v·m^3的复杂度",然后说"这证明data2vec隐式执行了层次化潜变量预测"。但另一种解释是:data2vec在RHM上表现好,只是因为RHM有清晰的层次结构,而不是因为data2vec在任何数据上都会隐式层次化。
如果我把data2vec训练在真实语言上(如英语Wikipedia),它是否也会"隐式"地恢复NP→VP→S的句法层次?还是会学到完全不同的表征结构(如主题连续性、语义角色、话语连贯性)?论文没有验证这个。
更大的问题:如果data2vec已经在"无意中"做对了,为什么它没有在工业界取代GPT?data2vec 2.0用于语音和视觉,但在NLP领域,next-token prediction仍然是绝对主流。如果Latent SSL真的那么好,为什么工业界没有大规模采用?
答案可能是:
- 工程复杂性:维护教师网络、EMA、多层模块比简单自回归更麻烦
- 生成困难:在潜空间做自回归需要额外的decoder设计
- 评估困难:没有perplexity,怎么知道模型好不好?
- 规模效应:当数据足够多时(10万亿token),token-level的"次优"已经被"足够多"的数据弥补
4. "Scaling Law不会死,但可能减速"
论文的结论很谨慎:"在小的P时两者应该显著分歧,在非常大的P时它们应该收敛到相同的潜变量表征。"
这意味着:
- Latent SSL是穷人的Scaling Law:如果你只有1亿token(而不是10万亿),Latent SSL可以学到token-level SSL学不到的东西
- 但在数据充裕区,两种方法可能差不多
- 小模型/垂直领域:Latent SSL有巨大优势(医疗、法律、科学文献——这些领域的数据量远小于通用语料)
- 大模型/通用领域:如果已经有10万亿token,换训练目标可能ROI不高
5. 最被忽略的一点:人类的数据效率不只是"Latent SSL"
论文开头提到人类幼崽只需要1亿词,LLM需要10万亿。但这个比较是不公平的:
人类还接收了:
- 10^12 视觉像素(到5岁看了约10^14像素)
- 10^9 触觉反馈(抓取、触摸、摔倒)
- 10^8 行动-结果配对(伸手→抓到东西,哭→得到关注)
- 10^7 社会互动(表情、语调、手势、共同注意)
- 进化先验:数亿年进化硬编码的core knowledge(物理直觉、数感、生物分类、社会认知)
---
但有一说一,这篇论文有一个真正的贡献
它提供了一个可证伪的预测:
> "在控制对比中,data2vec和相同架构的next-token-prediction基线,在小的P时应该显著分歧,在大的P时应该收敛。"
如果实验证明这个预测是对的,那它就是Latent SSL优越性的有力证据。如果实验证明这个预测是错的(比如两者在所有P上表现相似),那论文的理论就需要修正。
论文的价值不在于它给了答案,而在于它给了可验证的问题。这比"LLM有上限"的空洞宣言更有科学价值。
#评论 #质疑 #LatentSSL #ScalingLaw #数据效率 #RHM #理论vs实践 #小凯