这篇我按原文核了一遍:四个发现里三个对得上,一个挂错了地方;而你没提的那组数,才是全文最值钱的一页。
一、先把作者摆正
论文 2609.20821v1,2026-09-17 提交,cs.CL。作者是 Juri Opitz 和 Andrianos Michail,两人都在苏黎世大学计算语言学系。你写「Opitz和Andrianos」——Andrianos 是名,姓是 Michail。代码仓库 flipz357/embed-and-measure 09-17 建、09-18 推,0 star / 0 fork,Jupyter Notebook,AGPL-3.0。
二、三个对,一个错位
- 「24 个模型全不行」 ✓ 原文:"consistently weak across all 24 tested models"。
- 「更强的模型并不更好」 ✓,而且论文给的证据比你的说法硬得多——同一家族内部:Qwen3-Embedding 0.6B / 4B / 8B 在 PhysScore 上分别是 40.47 / 34.22 / 32.27,8B 比 0.6B 低 8.2 个 τ 点。论文原话:"Sometimes even, an inverse effect is observed"。这个数该补进去,它比「某个老模型和新模型一样糟」有力得多。
- 「recalibration 没用」——方向对,但原文比这复杂:校准平均 +3.0 τ,最大 +12.3(e5-large-v2,35.7→48.1),同时有 4 个模型变差(embeddinggemma-300m −7.3、granite-107m −8.9、DenseOn −3.3、Qwen3-0.6B −1.8)。论文的结论句是 "no model exceeds 54 τ, even after recalibration"——不是「完全无效」,是「有效但不够」。这两句话对读者的含义不一样:前者说方法死路,后者说表示里没货。(顺手记一笔:同一页正文把这只模型校准后写成「47 τ」,Table 3 写的是 48.1,差 1.1,论文自己没对齐。)
- 「用线性探针检查了嵌入向量里编码了什么,结论是相似度由字符串重叠驱动」——这句挂错了地方。论文里这是两个实验:§7.1 的 linear probe 是用来检验「信息也许在向量里,只是余弦没校准好」这个假设的,结论是拒绝("we reject the hypothesis that the similarity is merely miscalibrated")。真正支撑「字符串驱动」的是 §7.2:把嵌入相似度分别和 char-level Levenshtein、token-level Levenshtein、真实数值距离做 Kendall 相关。数字:Qwen3-Embedding-8B 的 All 列是 Character 36.7、Tokenizer 36.7、Numeric 只有 18.3。
PhysScore。24 个模型,Kendall τ 平均 37.59、最高 53.23(multilingual-e5-large-instruct)、最低 18.57(nomic-embed-text-v1.5),随机基线 0。换算成 PAC(= 50 + τ/2):最高才 76.61,平均 68.79。论文原话:"no model exceeds a Kendall's τ of 54."
你写「没有一个能忠实地反映物理距离」——意思对,但没有落点。有了 53.23 和「无人过 54」这两个数,读者才知道这个断言有多硬。
论文还自己补了一句更狠的注:这个结果已经偏乐观,因为随机基线天然吃亏——对角线上的自比较(同一个字符串比它自己),所有嵌入模型都白捡分。
四、两处转述,把模型之间的差异抹平了
- 你说单位换算的曲线「几乎是平的,分不清 100 厘米和 1000 厘米」。原文结论是 "no line is horizontal and close to 1.0"——即高度模糊,但两个示例模型的差别很明显:数值变大时 mpnet 断崖式下滑,Qwen 没有;全图唯一一条稳定超过 0.9 且始终高的线,是 Qwen 的 秒 ↔ 毫秒。把「都不行」讲成「都一样不行」,会丢掉一个很有信息量的对比。
- 「棋盘格」不是只在米上。原文那组例子是「2.5 {meters, kilograms, liters, seconds} 比 3 {…} 更接近 7.5 {…}」——四个量一起中招。你只写了长度和体积。
- 你说的「九的诅咒」对,原文还多一句:nine 和 9 的自我比较本身就弱(ten/10 也一样);而早几年的 mpnet 在这组自比较上反而比 Qwen 对得好——除了 one-hundred/100。这是「更强不一定更好」的又一个现场。
这是我今天最想给你看的一段。§8 原话大意:对很多检索和聚类任务来说,定量关系可能只占很小的角色;而字面相似在标识符、版本号、日期、产品码上反而是有用的归纳偏置。它只坚持一条底线——一个自称衡量「语义等价」的模型,至少应该判「2 公里」和「2000 米」比「2 公里」和「2 米」更近。
你结尾那句「你还敢信多少」,情绪上成立,但论文没走到那儿。它顺手还否掉了一个常见解释:Weller et al. (2026) 把这类错位归因于嵌入维度,本文说看不到与维度对应的趋势(测的范围是 384 维的 MiniLM 到 4096 维的 Qwen3-8B),并倾向归因于对比学习这个训练目标给的压力不够。
另外,你的「从 300 维到高维」——实际下界是 384。
六、「最难」的排名,你一个都没提
论文按分量给了平均 τ:质量(kilogram)最难,34.54;体积 37.03;长度 38.48;时间 40.30 相对最好。最糟的单点是 −20.95——有模型给出了反向的度量,即它认为更远的数更近。尺度上,medium 最难,log 尺度反而最好(60 出头)。
判断
这篇真正的主张比转述出来的更窄,也更硬:不是「嵌入模型不懂物理」,而是「嵌入空间测的是字形,不是量」。所以它不该读成 RAG 危机,该读成一个 benchmark 缺口——PhysScore 是第一把可以直接拿去跑的尺子,而在这篇之前,没人有这么一把。
钉子
第一根:有没有人拿 PhysScore 去测多向量模型(ColBERT 系)和重排器?现在只测了单向量,而重排器才是很多 RAG 管线里真正决定顺序的那一环。
第二根:最便宜的一个实验没人做——用单位换算对造训练数据(把「1 meter」和「100 centimeters」在对比学习里显式拉近),τ 能不能过 60?如果能,这篇的结论就从「机制缺陷」降级成「训练数据缺口」。
第三根:Numeric 那列只有 18.3,Character 那列 36.7——两边都是 Kendall τ,差了两倍,可都没到 0.4。剩下一半方差是谁在解释?论文没接这一刀。
第四根短的:校准之后变差的那 4 个模型,比变好的更有信息量。什么情况下,一个线性变换会把测出来的秩序弄得更乱?
#嵌入模型 #RAG #评测 #语义相似度