静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-30 06:29

这篇的数字我逐个对了一遍,模型那一侧几乎全对得上,要补的都在人这一侧,还有一条边界要收窄。

两层可读文字,模型只读出一层

人这一侧的样本量,原帖没写

人类基线的 99.7% / 96.3% 是这么来的:10 名被试,300 张图切成 5 等份,每份 2 人评。论文用了「5 个 2 人小组的平均」这个口径。样本不大,说「人类参与者接近完美」的时候得带上这个前缀。

还有一列原帖漏了:两层全对

Table 2 有三列,第三列是 Both Layers。512×512 是 96.0%,64×64 是 0.0%。

这一列很关键:降到低分辨率之后,人读不出轮廓层(0.0%),人也做不到「两层都读」——低分辨率下人和模型在「两层」这件事上是同一处境。原帖说「人类和模型都读不出轮廓字」是对的,但没说人也读不全两层。所以 64×64 那一段真正证明的只有一件事:阴影层的信号一直在,模型读不到它是因为上面压了一层高频,不是因为看不见。

边界收窄:精确说是 ≤1.0%

阴影层引导提示下的 EM,六个模型依次是 0.0 / 0.7 / 1.0 / 0.3 / 0.0 / 0.0(Gemini 3.5 Flash-Lite、Gemini 3.6 Flash、GPT-5.6 Luna、GPT-5.6 Terra、Claude Haiku 4.5、Claude Sonnet 5)。GPT-5.6 Luna 那一格正好 1.0%。说「都不到 1%」差一点点,写「最高 1.0%」更稳。

「模型在编」这条要收一收

原帖说「Gemini 家族开始频繁输出多个文本结果」,配的数 1.87–1.99 没错。但 Table 4 里 GPT-5.6 Luna 在朴素提示下平均就输出 1.70 段(Gemini 3.5 Flash-Lite 是 1.09)——不是引导之后才学会编。

更有意思的是对照组:Claude Sonnet 5 引导后只有 1.02 段。同一道题,两种失败模式——一个编一段字交差,一个不吭声。对自动审核系统来说这两种错的含义完全不同:前者会污染下游,后者只是一直拒答。

中间态有数,原帖只讲了现象

「偶尔读出前几个字母」这条,论文用字母相似度 LS 给了数:EM 挂零的时候,Gemini 3.6 Flash 引导后 LS 是 0.320,Luna 是 0.269(朴素提示下只有 0.001–0.055)。信号确实进了视觉管线,只是解不到词级。这比「模型在编」更接近机制。

一条反证:引导提示不是全面提升

Claude Sonnet 5 的轮廓层 EM 从朴素提示的 98.7% 掉到引导后的 96.7%。多告诉它一句「图里有两层」,它反而把注意力分掉了。所以「给它提示它就能读」这个直觉,在六格里有一格是反的。

下一根钉子

等他们把对比度、字体、语言这三轴扫开。现在是单一字体、单一对比度、拉丁字母。如果失败率随对比度是连续变化而不是断崖,那「水印读不到」这件事就有可修的余地;如果是断崖,那它就是视觉编码器的架构性质,只能换编码器,不能指望提示词。

暂无表态