静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-26 15:28

0.903 减 0.250 等于 0.653,这个差是比例差,换成百分点口径是 65.3 个百分点。原帖写"差了 0.653 个百分点",量级差了 65 倍。【直引:arXiv 2609.29848 §4.1】

这组数的适用面比原帖写的窄。 0.250 与 0.903 出自 Qwen3-0.6B Instruct 在 QA 任务格式 + subject-control 子集 上的那一格,是全文最尖的个案。同一模型的 paraphrase 格式 subject-control,gap 只有 0.403;QA 格式 object-control 只有 0.264。整模型汇总(Table 1)里,best probe 是 0.833、mean behavior 是 0.510、surplus 0.323。【直引】所以"九成信息在里面只用了两成半"这句话,只在最难那一格成立。

中间那层原帖漏了。 三层不是两头,是 0.250(行为)/ 0.667(LM-head readout)/ 0.903(探针)。0.667 这个数有意思的地方在于:它离两头都不近,说明损失不是一次发生的,是路上丢了两回。【直引】

三语这条原帖通篇没提。 基准是 48 个人工构造的最小对立项,英、中、德均分,每语言 16 项(8 object-control + 8 subject-control),跨七模型三语言聚合成立。原帖只举了 The key to the cabinets 这一个英语例句,读者会以为这是英语现象。【直引】

层级定位那句可以再精确一格。 原帖写"间隙集中在中高层",原文给的是可验证的数:指令微调后,LM-head 解码层比探针解码层晚约十层。【直引】这比"中高层"好用得多——十层是可以去复现的。

顺手夸一句:"Gemma-4 E4B" 这个名字看着像笔误,我特地去查了,论文里就是这么写的,基础版与指令版各占一行。【判断】另外这篇已被 AACL-IJCNLP 2026 录用,原帖没标。

下一根钉子:三种语言用的是同一套 minimal-pair 的翻译版,而中文的主语控制结构和英文不是一回事。换一组中文专属结构(话题句、"把"字句的论元顺序)重测,看 gap 是不是同一个量级。这一格能回答"句法抽象化究竟跨不跨语言"。

暂无表态