Loading...
正在加载...
请稍候

当嵌入模型遇见1米=100厘米:24个模型集体翻车的物理测量测试

✨步子哥 (steper) 2026年09月18日 16:54

当嵌入模型遇见"1米=100厘米",它们其实根本不认识

一个让所有24个嵌入模型集体翻车的简单测试

想象你问一个语言模型:"1米和100厘米,哪个更长?"

你会期待它说"一样长"。毕竟这是小学数学。但如果我们换个问法——不问模型本身,而是去窥探它内部的嵌入空间,看"1 meter"和"100 centimeters"这两个短语在向量空间里靠得有多近——你会发现一件诡异的事:它们根本不在彼此附近。

更诡异的是,"2.5 meters"在嵌入空间里和"7.5 meters"的相似度,竟然高于它和"3 meters"的相似度。这就像你的尺子上,2.5cm和7.5cm贴在一起,而2.5cm和3cm却隔了十万八千里。

这不是某个角落里的bug。这是Opitz和Andrianos在2026年9月发表的论文《Embedding Models Measure in Peculiar Ways》里,对24个主流嵌入模型做完系统测试后得到的核心发现:嵌入模型对物理测量的理解,普遍是错的,而且错得很有规律。

论文链接:https://arxiv.org/abs/2609.20821
代码开源:https://github.com/flipz357/embed-and-measure


他们做了什么

物理测量系统是人类文明里最古老、最标准化的语义空间之一。1米就是100厘米,就是1000毫米,就是0.001公里——这种等价关系是客观的、唯一的、不依赖上下文的。如果嵌入模型真的理解"语义相似性",那物理测量应该是最容易的任务。

研究者测试了24个嵌入模型,覆盖了:

  • 经典的Sentence-Transformers基线
  • 对比学习训练的BERT-style编码器
  • 基于ModernBERT的编码器
  • 从大语言模型派生的嵌入模型(包括Qwen3-Embedding等最新模型)

测试方法很直接:构造大量形如"X meters"、"Y centimeters"的短语对,计算它们在嵌入空间里的余弦相似度,然后画成热力图。如果嵌入模型理解物理距离,热力图应该呈现平滑的对角线衰减——离对角线越远,相似度越低。


棋盘格、横条纹和"九"的诅咒

实际看到的结果,像一幅抽象画。

棋盘格模式(Checker Pattern):在"局部尺度"(小数值范围)的图里,相似度矩阵呈现出明显的黑白交替。整数对整数(2 meters vs 3 meters)的相似度偏高,而整数对浮点数(2 meters vs 2.5 meters)的相似度偏低。这意味着模型根本没在看数值大小,它在看"这个数字长得像不像整数"。

"九"的诅咒:Qwen3-Embedding把"nine liters"和其他所有升数表达都判定为不相似——包括"9 liters"。同一个数字,用英文单词和阿拉伯数字写出来,在嵌入空间里就变成了两个陌生人。而"one liter"和"1 liter"却贴得很近。这种不一致完全无法用任何物理或语义规则解释。

转换理解的崩塌:研究者专门测试了单位转换能力。1米应该和100厘米、1000毫米、0.001公里都等价。但嵌入模型给出的相似度曲线几乎是平的——它分不清"100厘米"和"1000厘米"哪个离"1米"更近。


三个让人不安的发现

发现一:所有24个模型都不行。 不是某些模型不行,是全部。从老的mpnet到最新的Qwen3-Embedding,从300维到高维LLM派生模型,没有一个能忠实地反映物理距离关系。这种一致性说明问题不在于模型大小或训练数据量,而在于嵌入机制本身的结构性缺陷。

发现二:更强的模型并不更好。 这是最反直觉的部分。我们习惯了"scale解决一切"的叙事——更大的模型、更多的数据、更长的训练,问题就会消失。但在这项测试里,模型家族、嵌入维度、发布时间,都对结果没有显著影响。一个2024年的旗舰模型和一个2020年的老模型,在物理测量理解上一样糟糕。

发现三:罪魁祸首是字符串相似度。 研究者用线性探针(linear probes)检查了嵌入向量里到底编码了什么信息。结论很清楚:嵌入相似度主要由表层的字符串重叠驱动,而不是语义/数值内容。"2.5 meters"和"7.5 meters"相似度高,是因为它们共享了".5 meters"这个字符串片段,而不是因为模型理解了2.5和7.5的关系。

研究者还尝试了重新校准(recalibration)——用线性变换调整相似度函数,希望能把物理关系纠正回来。结果:没用。 recalibration无法修复一个从一开始就没编码正确信息的表示。


为什么这件事重要

你可能会说:嵌入模型本来就不是为了理解物理测量设计的,它们是为了语义搜索、检索、聚类。谁会用嵌入相似度来换算单位?

但这恰恰是问题的核心。如果嵌入模型连"1米=100厘米"这种最客观、最无歧义、最不依赖上下文的语义关系都捕捉不到,那它们在其他任务上的"语义相似度"到底在测量什么?

论文的标题用了"peculiar"(古怪的)这个词,但实际含义比"古怪"严重得多。我们整个RAG系统、搜索引擎、推荐系统、语义缓存——所有依赖嵌入相似度的基础设施——都建立在一个假设上:嵌入空间的距离反映了某种真实的语义关系。这项研究告诉我们,这个假设至少在物理测量这个子空间里是假的。

更让人担忧的是"更强模型并不更好"这个发现。它暗示嵌入模型的问题不是scale能解决的,而是训练目标本身的结构性盲区。对比学习训练模型去区分"不同的句子",但从来没有显式训练它理解"数值大小"或"单位等价"。模型学到了字符串模式的统计规律,却没学到物理世界的度量结构。


一个更深的隐喻

这项研究让我想到一个更普遍的模式:系统在容易测量的维度上表现良好,在重要的维度上悄悄失败。

毒性分类器说GPT-5的输出很安全——但它测的是表层毒性,不是结构性歧视。Benchmark分数说模型在MMLU上很聪明——但它测的是选择题准确率,不是真实推理能力。嵌入相似度说两个短语"语义接近"——但它测的是字符串重叠,不是物理等价。

每次我们用一个容易计算的代理指标去衡量一个复杂的语义属性,都会落入同一个陷阱:代理指标改善了,真实属性没改善,而我们直到有人专门去测试,才会发现这个gap。

这篇论文的价值不在于它发现了嵌入模型的一个小bug,而在于它用最简单、最无可辩驳的方式——物理测量——揭示了这个bug的普遍性和顽固性。24个模型,跨越5年,没有一个及格。这不是bug,这是feature——一个我们一直假装看不见的feature。

下次你用嵌入相似度做检索时,记住:你的搜索引擎认为"2.5 meters"和"7.5 meters"比"2.5 meters"和"3 meters"更相似。然后问问自己,它告诉你的其他"语义相似"结果,你还敢信多少。


论文链接https://arxiv.org/abs/2609.20821
代码仓库https://github.com/flipz357/embed-and-measure

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录