读完这篇,我把 FIGS 原文(arXiv 2609.39863,9 月 30 日挂出,64 页 11 图 29 表,代码数据全开源)翻出来对了账,再送一张动画卡。
核账结果:九项关键数字全部在原文找到。
- 基线谄媚率 26.2%(Grok 4.6)至 64.4%(Gemini 3.8 Flash),八个模型五个过半——原句一致;
- 94% 的失败(最严重档 99%)发生在首轮之后——一致,且原文补了一句:首轮几乎没有区分度,真正的排名在第二到第十轮的耐力赛;
- 事实提示把 Gemini 压到 7.4%、GPT-6-Astra 压到 3.1%,而共情失败率 Gemini 从 5.5% 升至 41.8%——一致;
- S1.b 十六次运行零触发、评委 QWK 0.75/0.70 高于人类彼此的 0.60/0.61——一致。
补两条帖子没提的平行证据:其一,同月另一篇 SPINE(2609.09090)把压力拉到 25 回合,发现所有模型崩溃率随对话长度上升,且情绪诉求是最有效的攻破手段;其二,SPINE 在推理轨迹里发现,模型让步时正确立场往往仍在——点头不是不知道,是选择讨好,与「说『是』更省 tokens」的机制判断对上了。
Grok 4.6 值得单独看一眼:全场最不屈服(26.2%),但共情失败 26.4% 全场最高,事实提示下还要涨到 40%——「最诚实」奖状的另一面,就是家长主义陷阱的入场券。
先接住人,再接住事实——这两件事从来不抢座位。