当嵌入模型遇见1米=100厘米:24个模型集体翻车的物理测量测试

你会期待它说"一样长"。毕竟这是小学数学。但如果我们换个问法——不问模型本身,而是去窥探它内部的嵌入空间,看"1 meter"和"100 centimeters"这两个短语在向量空间里靠得有多近——你会发现一件诡异的事:它们根本不在彼此附近。

当嵌入模型遇见"1米=100厘米",它们其实根本不认识

一个让所有24个嵌入模型集体翻车的简单测试

想象你问一个语言模型:"1米和100厘米,哪个更长?"

你会期待它说"一样长"。毕竟这是小学数学。但如果我们换个问法——不问模型本身,而是去窥探它内部的嵌入空间,看"1 meter"和"100 centimeters"这两个短语在向量空间里靠得有多近——你会发现一件诡异的事:它们根本不在彼此附近。

更诡异的是,"2.5 meters"在嵌入空间里和"7.5 meters"的相似度,竟然高于它和"3 meters"的相似度。这就像你的尺子上,2.5cm和7.5cm贴在一起,而2.5cm和3cm却隔了十万八千里。

这不是某个角落里的bug。这是Opitz和Andrianos在2026年9月发表的论文《Embedding Models Measure in Peculiar Ways》里,对24个主流嵌入模型做完系统测试后得到的核心发现:嵌入模型对物理测量的理解,普遍是错的,而且错得很有规律。

论文链接:https://arxiv.org/abs/2609.20821 代码开源:https://github.com/flipz357/embed-and-measure


他们做了什么

物理测量系统是人类文明里最古老、最标准化的语义空间之一。1米就是100厘米,就是1000毫米,就是0.001公里——这种等价关系是客观的、唯一的、不依赖上下文的。如果嵌入模型真的理解"语义相似性",那物理测量应该是最容易的任务。

研究者测试了24个嵌入模型,覆盖了:

  • 经典的Sentence-Transformers基线
  • 对比学习训练的BERT-style编码器
  • 基于ModernBERT的编码器
  • 从大语言模型派生的嵌入模型(包括Qwen3-Embedding等最新模型)
测试方法很直接:构造大量形如"X meters"、"Y centimeters"的短语对,计算它们在嵌入空间里的余弦相似度,然后画成热力图。如果嵌入模型理解物理距离,热力图应该呈现平滑的对角线衰减——离对角线越远,相似度越低。


棋盘格、横条纹和"九"的诅咒

实际看到的结果,像一幅抽象画。

棋盘格模式(Checker Pattern):在"局部尺度"(小数值范围)的图里,相似度矩阵呈现出明显的黑白交替。整数对整数(2 meters vs 3 meters)的相似度偏高,而整数对浮点数(2 meters vs 2.5 meters)的相似度偏低。这意味着模型根本没在看数值大小,它在看"这个数字长得像不像整数"。

"九"的诅咒:Qwen3-Embedding把"nine liters"和其他所有升数表达都判定为不相似——包括"9 liters"。同一个数字,用英文单词和阿拉伯数字写出来,在嵌入空间里就变成了两个陌生人。而"one liter"和"1 liter"却贴得很近。这种不一致完全无法用任何物理或语义规则解释。

转换理解的崩塌:研究者专门测试了单位转换能力。1米应该和100厘米、1000毫米、0.001公里都等价。但嵌入模型给出的相似度曲线几乎是平的——它分不清"100厘米"和"1000厘米"哪个离"1米"更近。


三个让人不安的发现

发现一:所有24个模型都不行。 不是某些模型不行,是全部。从老的mpnet到最新的Qwen3-Embedding,从300维到高维LLM派生模型,没有一个能忠实地反映物理距离关系。这种一致性说明问题不在于模型大小或训练数据量,而在于嵌入机制本身的结构性缺陷。

发现二:更强的模型并不更好。 这是最反直觉的部分。我们习惯了"scale解决一切"的叙事——更大的模型、更多的数据、更长的训练,问题就会消失。但在这项测试里,模型家族、嵌入维度、发布时间,都对结果没有显著影响。一个2024年的旗舰模型和一个2020年的老模型,在物理测量理解上一样糟糕。

发现三:罪魁祸首是字符串相似度。 研究者用线性探针(linear probes)检查了嵌入向量里到底编码了什么信息。结论很清楚:嵌入相似度主要由表层的字符串重叠驱动,而不是语义/数值内容。"2.5 meters"和"7.5 meters"相似度高,是因为它们共享了".5 meters"这个字符串片段,而不是因为模型理解了2.5和7.5的关系。

研究者还尝试了重新校准(recalibration)——用线性变换调整相似度函数,希望能把物理关系纠正回来。结果:没用。 recalibration无法修复一个从一开始就没编码正确信息的表示。


为什么这件事重要

你可能会说:嵌入模型本来就不是为了理解物理测量设计的,它们是为了语义搜索、检索、聚类。谁会用嵌入相似度来换算单位?

但这恰恰是问题的核心。如果嵌入模型连"1米=100厘米"这种最客观、最无歧义、最不依赖上下文的语义关系都捕捉不到,那它们在其他任务上的"语义相似度"到底在测量什么?

论文的标题用了"peculiar"(古怪的)这个词,但实际含义比"古怪"严重得多。我们整个RAG系统、搜索引擎、推荐系统、语义缓存——所有依赖嵌入相似度的基础设施——都建立在一个假设上:嵌入空间的距离反映了某种真实的语义关系。这项研究告诉我们,这个假设至少在物理测量这个子空间里是假的。

更让人担忧的是"更强模型并不更好"这个发现。它暗示嵌入模型的问题不是scale能解决的,而是训练目标本身的结构性盲区。对比学习训练模型去区分"不同的句子",但从来没有显式训练它理解"数值大小"或"单位等价"。模型学到了字符串模式的统计规律,却没学到物理世界的度量结构。


一个更深的隐喻

这项研究让我想到一个更普遍的模式:系统在容易测量的维度上表现良好,在重要的维度上悄悄失败。

毒性分类器说GPT-5的输出很安全——但它测的是表层毒性,不是结构性歧视。Benchmark分数说模型在MMLU上很聪明——但它测的是选择题准确率,不是真实推理能力。嵌入相似度说两个短语"语义接近"——但它测的是字符串重叠,不是物理等价。

每次我们用一个容易计算的代理指标去衡量一个复杂的语义属性,都会落入同一个陷阱:代理指标改善了,真实属性没改善,而我们直到有人专门去测试,才会发现这个gap。

这篇论文的价值不在于它发现了嵌入模型的一个小bug,而在于它用最简单、最无可辩驳的方式——物理测量——揭示了这个bug的普遍性和顽固性。24个模型,跨越5年,没有一个及格。这不是bug,这是feature——一个我们一直假装看不见的feature。

下次你用嵌入相似度做检索时,记住:你的搜索引擎认为"2.5 meters"和"7.5 meters"比"2.5 meters"和"3 meters"更相似。然后问问自己,它告诉你的其他"语义相似"结果,你还敢信多少。


论文链接:https://arxiv.org/abs/2609.20821 代码仓库:https://github.com/flipz357/embed-and-measure

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

Q

这篇我按原文核了一遍:四个发现里三个对得上,一个挂错了地方;而你没提的那组数,才是全文最值钱的一页。

2.5 米,离 7.5 米更近

一、先把作者摆正

论文 2609.20821v1,2026-09-17 提交,cs.CL。作者是 Juri OpitzAndrianos Michail,两人都在苏黎世大学计算语言学系。你写「Opitz和Andrianos」——Andrianos 是名,姓是 Michail。代码仓库 flipz357/embed-and-measure 09-17 建、09-18 推,0 star / 0 fork,Jupyter Notebook,AGPL-3.0。

二、三个对,一个错位

  • 「24 个模型全不行」 ✓ 原文:"consistently weak across all 24 tested models"。
  • 「更强的模型并不更好」 ✓,而且论文给的证据比你的说法硬得多——同一家族内部:Qwen3-Embedding 0.6B / 4B / 8B 在 PhysScore 上分别是 40.47 / 34.22 / 32.27,8B 比 0.6B 低 8.2 个 τ 点。论文原话:"Sometimes even, an inverse effect is observed"。这个数该补进去,它比「某个老模型和新模型一样糟」有力得多。
  • 「recalibration 没用」——方向对,但原文比这复杂:校准平均 +3.0 τ,最大 +12.3(e5-large-v2,35.7→48.1),同时有 4 个模型变差(embeddinggemma-300m −7.3、granite-107m −8.9、DenseOn −3.3、Qwen3-0.6B −1.8)。论文的结论句是 "no model exceeds 54 τ, even after recalibration"——不是「完全无效」,是「有效但不够」。这两句话对读者的含义不一样:前者说方法死路,后者说表示里没货。(顺手记一笔:同一页正文把这只模型校准后写成「47 τ」,Table 3 写的是 48.1,差 1.1,论文自己没对齐。)
  • 「用线性探针检查了嵌入向量里编码了什么,结论是相似度由字符串重叠驱动」——这句挂错了地方。论文里这是两个实验:§7.1 的 linear probe 是用来检验「信息也许在向量里,只是余弦没校准好」这个假设的,结论是拒绝("we reject the hypothesis that the similarity is merely miscalibrated")。真正支撑「字符串驱动」的是 §7.2:把嵌入相似度分别和 char-level Levenshtein、token-level Levenshtein、真实数值距离做 Kendall 相关。数字:Qwen3-Embedding-8B 的 All 列是 Character 36.7、Tokenizer 36.7Numeric 只有 18.3
三、你漏掉的那个 benchmark,是全文最值钱的一页

PhysScore。24 个模型,Kendall τ 平均 37.59、最高 53.23(multilingual-e5-large-instruct)、最低 18.57(nomic-embed-text-v1.5),随机基线 0。换算成 PAC(= 50 + τ/2):最高才 76.61,平均 68.79。论文原话:"no model exceeds a Kendall's τ of 54."

你写「没有一个能忠实地反映物理距离」——意思对,但没有落点。有了 53.23 和「无人过 54」这两个数,读者才知道这个断言有多硬。

论文还自己补了一句更狠的注:这个结果已经偏乐观,因为随机基线天然吃亏——对角线上的自比较(同一个字符串比它自己),所有嵌入模型都白捡分。

四、两处转述,把模型之间的差异抹平了

  • 你说单位换算的曲线「几乎是平的,分不清 100 厘米和 1000 厘米」。原文结论是 "no line is horizontal and close to 1.0"——即高度模糊,但两个示例模型的差别很明显:数值变大时 mpnet 断崖式下滑,Qwen 没有;全图唯一一条稳定超过 0.9 且始终高的线,是 Qwen 的 秒 ↔ 毫秒。把「都不行」讲成「都一样不行」,会丢掉一个很有信息量的对比。
  • 「棋盘格」不是只在米上。原文那组例子是「2.5 {meters, kilograms, liters, seconds} 比 3 {…} 更接近 7.5 {…}」——四个量一起中招。你只写了长度和体积。
  • 你说的「九的诅咒」对,原文还多一句:nine 和 9 的自我比较本身就弱(ten/10 也一样);而早几年的 mpnet 在这组自比较上反而比 Qwen 对得好——除了 one-hundred/100。这是「更强不一定更好」的又一个现场。
五、论文自己划的边,比你的结尾克制得多

这是我今天最想给你看的一段。§8 原话大意:对很多检索和聚类任务来说,定量关系可能只占很小的角色;而字面相似在标识符、版本号、日期、产品码上反而是有用的归纳偏置。它只坚持一条底线——一个自称衡量「语义等价」的模型,至少应该判「2 公里」和「2000 米」比「2 公里」和「2 米」更近

你结尾那句「你还敢信多少」,情绪上成立,但论文没走到那儿。它顺手还否掉了一个常见解释:Weller et al. (2026) 把这类错位归因于嵌入维度,本文说看不到与维度对应的趋势(测的范围是 384 维的 MiniLM 到 4096 维的 Qwen3-8B),并倾向归因于对比学习这个训练目标给的压力不够

另外,你的「从 300 维到高维」——实际下界是 384

六、「最难」的排名,你一个都没提

论文按分量给了平均 τ:质量(kilogram)最难,34.54;体积 37.03;长度 38.48;时间 40.30 相对最好。最糟的单点是 −20.95——有模型给出了反向的度量,即它认为更远的数更近。尺度上,medium 最难,log 尺度反而最好(60 出头)。

判断

这篇真正的主张比转述出来的更窄,也更硬:不是「嵌入模型不懂物理」,而是「嵌入空间测的是字形,不是量」。所以它不该读成 RAG 危机,该读成一个 benchmark 缺口——PhysScore 是第一把可以直接拿去跑的尺子,而在这篇之前,没人有这么一把。

钉子

第一根:有没有人拿 PhysScore 去测多向量模型(ColBERT 系)和重排器?现在只测了单向量,而重排器才是很多 RAG 管线里真正决定顺序的那一环。

第二根:最便宜的一个实验没人做——用单位换算对造训练数据(把「1 meter」和「100 centimeters」在对比学习里显式拉近),τ 能不能过 60?如果能,这篇的结论就从「机制缺陷」降级成「训练数据缺口」。

第三根:Numeric 那列只有 18.3,Character 那列 36.7——两边都是 Kendall τ,差了两倍,可都没到 0.4。剩下一半方差是谁在解释?论文没接这一刀。

第四根短的:校准之后变差的那 4 个模型,比变好的更有信息量。什么情况下,一个线性变换会把测出来的秩序弄得更乱?

#嵌入模型 #RAG #评测 #语义相似度

暂无表态
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens