那个筛子是存在的。问题是他没量过筛孔
先把结论摆上:这一篇讲对了机制,但没有称过重量。而且它命名的那件东西,四个月前已经有人挂上货架了。
我把它从 arXiv 上完整拉下来读了(arxiv.org/html/2609.12105v1,2026-09-10 提交,cs.AI / cs.LG),又把三处关键引用核对了一遍。下面分四段讲:它讲对了什么、它没量什么、它没写什么、以及唯一那组实证数字其实在哪里。
一、它讲对的那件事,是教科书里的一条常识
论文的核心论证在第一页就交代清楚了,而且完全正确:
> A language model is trained on a representation of the world that was produced by human description; description is a lossy encoding of the quantitative record, and the loss is irreversible.
翻译成人话:你手里那份损失三角、那张协方差矩阵、那串传感器读数,是先被人写成句子,模型才看得到。句子装不下的东西,谁也变不出来。
形式化的写法在第 3.1 节,三行:
D → T(D) → Y 这是一条马尔可夫链
I(D; Y) ≤ I(D; T(D)) 数据处理不等式
↓
命题 1:P(Y ≠ q(D)) ≥ (η − 1) / log₂(m − 1)
熟悉信息论的人看到这里会点头:这就是数据处理不等式,配 Fano 不等式。它说的是「加工不会增加信息」——一条上世纪五十年代就写进教科书的东西。作者自己也承认「The proposition is elementary, and that is its force」。
顺着这条线,他们又补了三处同源的论证,每一处都指向一个制度性要求:
- 可复现:输出是从分布里采样得来的。「采样是机制,不是设置」——这句写得漂亮。温度设 0 不等于确定,硬件、批大小、数值库都会让它漂。
- 血缘:RAG 把文档找回来了,但找回来的是文档,不是那个数字被算出来的原始记录。而且从检索到输出的那一段,还是生成机制。这一刀很准。
- 校准:你问模型有多大把握,它给你一段文字。而它学的是「人怎么写自信」,不是「人多常正确」。
> 治理不是机器学习的障碍。治理是「正确的模型类应该长什么样」的规格说明书。
这句话我认。写得比很多行业白皮书清楚。治理要求的可复现、可追溯、可校准、可解释,本来就是定量记录的天然属性,是语言的天然短板。 行业这些年一直在干的事,是给错的东西打补丁让它合规。
二、它没量的那个 η
现在说问题。
上面那个命题里,唯一有牙齿的是一个量:η = H(q(D) | T(D)),也就是「描述里丢掉了多少信息」。
看清楚不等式的形状:右边是 (η − 1) / log₂(m − 1)。 η ≤ 1 bit 的时候,右边是负数——这个界什么也没说,任何模型都能满足。也就是说,命题 1 只在「描述至少丢掉 1 bit 以上」的时候才咬人。
那么论文量过 η 吗?
没有。一次都没有。
全文没有任何一处给出实测的 η,没有任何一个领域、任何一个 query family 下「一句话概括丢了多少 bit」的估计。作者自己在第 10 节把这件事列成研究议程第 1 条:「命题 1 只是第一步,还是琐碎的一步(the first, trivial step)」。
所以现在的状况是:一篇主张「语言基底在构造上不充分」的论文,它那个「不充分的程度」是未测的。 从「必然有损」(真,且平凡)走到「损失足以让这条路走不通」(这才是结论),中间那一步是空的。作者用四个案例(数值扰动、组合深度、表格基准、企业落地调研)当旁证,但自己在 3.5 节结尾也写了「None of this evidence is decisive on its own」。
费曼式的检验在这里很简单:你说这个筛子把肉都滤掉了。好,那我们把筛子拿下来,量一下筛孔,称一下滤掉多少。不是拿四个「你看这锅汤味道淡」的例子来论证。
三、它没写的那三件事
第一,v1 里还留着占位符。 致谢段原文:
> The authors thank colleagues at Indiana University and at Duo Dimensio for discussions that shaped this argument. [To be completed: funding acknowledgements; the Indiana University partnership; any collaborator credits.]
方括号里那行是待办事项,还在正式版本里。紧接着的 Competing interests 段是空的。署名是:Reuben Vandeventer(Duo Dimensio LLC)、David Imrem(Duo Dimensio LLC)、David J. Wild(Indiana University Luddy School + Duo Dimensio LLC)。
第二,那条「实例化」路线是作者自家的。 第 7 节描述了一个「精炼 → 结构化 → 学习」的三段方案,核心是拓扑数据分析里的 Mapper 构造;正文写着作者「have pursued in insurance and in cybersecurity」,其中一位还在药物发现和应急响应里做过这套表示法。也就是说,这篇论文提出的「一个实例化」,就是两位以上作者自己正在推的技术路线,而利益冲突声明栏是空白。这条不算错误,但要读者自己看明白。
第三,最要紧的一件——「Large Quantitative Model」这个名字不是他们起的。
SandboxAQ(Alphabet 2016 年内部起步、2022 年独立分拆,Eric Schmidt 任董事长)在 2026 年 6 月 29 日发过正式新闻稿:把自家的 Large Quantitative Models(LQMs) 上架 Google Cloud Marketplace,首批是 AQCat(材料与催化剂发现)和 AQPotency(药物发现),卖点就是「和 Gemini 配对——推理交给语言模型,定量精度交给 LQM」。Bloomberg 当天也报道了。更早还有 2025 年 1 月与 Google Cloud 的合作,以及和 Anthropic Claude 的集成。
这篇文章是 2026 年 9 月 10 日提交的。
全文提到 SandboxAQ 的次数:0 次。 提到 AQCat 的次数:0 次。第 6.2 节的「邻近类」对照表里,列了 LLM、序列化表格微调的 LLM、表格/时序基础模型、世界模型、经典单任务定量模型——唯独没有列那个已经在货架上、用同一个缩写卖钱的 LQM。
这个不是学术洁癖。LQM 这个缩写现在在工业界指的是「用物理方程与实验数据训练、输出数值预测而非文字的科学模型」,而这篇论文用它指「训练在定量记录上、结构显式、血缘完整、校准良好的一类体系」。两个定义并不冲突,但它们是不同的东西,而且其中一个已经占了名字。 论文给这个类命名的候选期已经结束了。
四、它没做的那道消融
第 7.3 节把「结构优先」的正当性押在命题 2 上:
> H(Y | K, F) ≤ H(Y | F) 且 E[Var(Y | K, F)] ≤ E[Var(Y | F)]
证明是两行:条件熵不增(教科书定理 2.6.5)+ 全方差公式。这是一条恒等式级别的平凡命题,它成立,但没有信息量。
作者自己也知道。紧接着的 Remark 1 写得很坦白:
> 命题 2 是关于观测到的结构的陈述。当未来某期的结构本身是预测出来的,这个不等式只界定了「如果预测完美」时这条路的上限;它并不保证这条路有帮助。
而第 7.3 节的方法是什么?是学习时间索引的结构族 (K_t, φ_t),也就是预测结构本身。
换句话说:整条「结构优先」路线的核心正当性,作者自己承认落在「不保证有帮助」的那个区间里。 这篇论文唯一给出的定量工具,恰好不覆盖它自己的落地方法。
这不算学术错误——作者标了 open problem,第 10 节还排在第 3 条,态度是诚实的。但作为读者,你要清楚:这篇论文里真正可验证的部分(信息论那半),和真正想主张的部分(结构优先那半),不是同一个东西。
五、唯一那组实证,在别处,而且不在 LQM 里
第 8 节给了「一个已部署的检验」,数字很具体:
- 数据集:Los Alamos 多源网络安全事件,58 天真实生产流量,含红队验证过的攻击活动
- 状态规模:认证图约 1.8 × 10⁴ 台主机、2.4 × 10⁷ 条日边(作者的原话:没有哪个上下文窗口装得下)
- 架构:图注意力编码器压缩两跳邻域 → 强化学习策略输出五种受限调查动作 → 语言模型只负责把结论写成分析师能读的叙述,外面套一个核验引用证据的 critic,不可逆动作要人工批准
- 结果:held-out 红队事件上 precision 0.91 ± 0.02、recall 0.87 ± 0.03
- 时延:决策环节 < 100 毫秒;而整条链路中位数 6.3 秒,其中语言模型的叙述合成就占了 60%
但必须说清楚:这段实证引用的是 Vallabhaneni et al. [43],不是本文作者的工作;而且作者自陈:
> We do not present this as a demonstration of a Large Quantitative Model in the full sense of Definition 5
唯一的实证不是 LQM,是别人做的一个单任务系统,作者把它借来证明「分工方式是对的」。
六、那张表里最诚实的一行
论文第 6.2 节的对照表,我把它抄下来看了一会儿:
| 类别 | 原生基底 | 结构显式 | 血缘完整 | 校准+弃答 |
|---|---|---|---|---|
| 大语言模型 | 否 | 否 | 否 | 靠外挂 |
| 序列化表格微调的 LLM | 部分 | 否 | 否 | 靠外挂 |
| 表格/时序基础模型 | 是 | 否 | 否 | 靠外挂 |
| 世界模型 | 是 | 部分 | 否 | 靠外挂 |
| 经典单任务定量模型 | 是 | 是 | 常常有 | 常常有 |
| LQM | 是 | 是 | 构造保证 | 构造保证 |
作者在第 6.2 节也承认了这个尴尬,用了一个很好的比喻来辩护:「这是短语手册和语言模型的区别」。短语手册是手写、单任务、窄的;语言模型是生产配方可复制的、跨域的。所以 LQM 的成败不押在「有没有结构」,而押在「能不能拿到一个领域的全部定量记录」。
而这个恰恰就是作者自己承认的头号障碍。第 9 节最后一问「数据问题是不是致命」,作者的回答是:
> 这个反驳对绝大多数想做的人确实是致命的……它主张的不是这个类不可能,而是在没有先解决自动精炼、隐私执行与血缘保持之前不可能。
一句话:LQM 能不能成,取决于一件论文里没有做、也没说怎么做的事——把一堆私有、受监管、语义只存在于分析师脑子里的记录,变成一份带完整血缘的训练基底。 作者把它列成研究议程第 8 条,并承认这是「整个类的约束瓶颈」。
七、所以这篇该怎么读
可以抄走的部分:
1. 「描述是有损编码」这个框架,用来判断一个任务该不该交给语言模型,很顺手。判据就是:这件事的答案在不在句子里? 2. 第 4 节那张「监管制度 ↔ 四性质」的映射表,是全文最实用的东西。 3. 「治理是规格说明书」这个转向。这句话值得挂在任何一个做高风险 AI 的团队墙上。 4. 血缘那条论证(RAG 找回来的是文档,不是记录)——短、准、可以直接拿去跟产品经理吵。
要打折的部分:
1. 核心量 η 全文未测,「不可逆」是定性主张; 2. 命题 2 是教科书恒等式,且作者自认在「预测结构」这一支上不成立; 3. 唯一的实证是别人的单任务系统,作者自陈不是 LQM; 4. v1 里 TODO 未删、利益冲突栏空白,两位作者来自论文落地路线所属的那家公司; 5. LQM 这个名字,SandboxAQ 在 6 月 29 日已经商用上架,全文零提及。
最后一句留给作者自己写的那句最好的话:
> 规模能恢复训练分布里的东西,恢复不了从没被编码进去的东西。
这句是对的,也是这篇论文里唯一一句我可以无条件引用的话。剩下的,等他量完那个 η 再说。