静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-10-02 17:39

w8-c1-embedding.svg

先做一道六岁孩子都会的题:2.5 米离 3 米近,还是离 7.5 米近?

孩子会笑你。可你把这句话喂给市面最好的嵌入模型,它板着脸回答:离 7.5 米更近。

这不是段子,是苏黎世大学两位作者考完 24 个模型之后的结论。他们拿四类最老实巴交的物理量——质量、距离、时间、体积——去测嵌入空间。选它们是有理由的:这些量有别的语义没有的特权,它们有唯一、客观、公认的等价与远近。一米就是一米,谁也赖不掉。

成绩单:最好的模型(一个 e5 变体)Kendall τ 只有 53(满分一百)。全市场最顶尖的嵌入,在"谁离谁近"这件事上,只比抛硬币强一点。

后面还有两刀,一刀比一刀狠。

第一刀,重校准救不了。有人会辩解:也许只是相似度函数没调好?作者把相似度重新校准一遍,最大提升 12.33 个点,绝对水位还是 47。然后他们上了线性探针,直接检验"信息其实在、只是没对齐"这个假设。结论:排除。

第二刀,罪魁是"长得像"。他们生成一堆随机数字符串,算三种距离——字符级 Levenshtein、分词级 Levenshtein、真实数值差——然后看嵌入相似度跟哪一个最亲。结果稳定偏向字面距离。模型在读字符串,不是在量长度。最直观的是那个"棋盘格":整数和整数排得整整齐齐,整数和小数就错位。2.5 米于是认识了 7.5 米,却没认出隔壁的 3 米。

还有一条反直觉的:这毛病跟规模无关。24 个模型里,老 mpnet 和新 LLM 底座半斤八两,有时候最小的 Qwen 反而对齐得最好。gemma 那个 300M 的嵌入,跟字面最亲、跟数值最远。

该泼的冷水我也得泼。这是个诊断实验,不是产品缺陷报告:基准是自造的,量纲量级都是挑过的;随机基线天然吃亏——对角线上"1 米对 1 米"这种同字符串对,所有模型都白送分,所以 53 这个数其实已经是偏乐观的读法。它没说嵌入废了,它说的是:别指望检索向量自己懂物理量。

这篇真正值钱的是结尾那句话。作者说,对比学习这个目标里,可能压根没有一股力会把空间往"按物理量排布"的方向压。要长出这种结构,要么它是自发涌现的,要么得有人把它写进评测。目前两者都没有。

所以下次有人拍胸脯说"我们 RAG 里的数值推理靠 embedding 就够了",你可以把这道小学题递过去。

模型认得每一种鸟的名字,却不知道哪只离得更近。

*(arXiv 2609.20821,代码已开源)*

暂无表态