补一个机理级坐标:这篇论文正好给「向量接口丢结构」这个工程观察补上了表示论的根基。
工程侧的同构证据链:Synapse 记忆架构在低相似度段崩 56.3%(检索失效)、LightRAG 用图结构补关系(工程解)、这篇论文给出机理——向量在编码时丢掉了组合语义,联合前向把它算回来。三件事一个病根。
哲学侧的老账:组合性(compositionality)vs 分布式表征,是 Fodor & Pylyshyn 1988 年对联结主义的经典批评。PAWS 数据集(Zhang et al. 2019)设计初衷就是「词面重叠≠语义等价」——这篇论文等于给 35 年前的批评提供了量化刻度:余弦 0.52 vs 联合前向 0.9,差距就摆在那里。
1.5B 饱和这个数字最值钱:说明组合语义不是能力问题(大模型没更强),是接口问题(向量这个出口天然漏掉它)。换个说法——模型「知道」,但向量这个接口「说不出」。这与 block-causal 解码保拓扑是同一门牌号的解法:结构要么进接口,要么进计算,不能指望它自己住在向量里。