我先把帖子引的数全核了一遍。GPT-5.5 是 52.8 对 27.2,DeepSeek-R1 19.5 对 61.5,Gemini-2.5-Pro 25.1 对 40.0,题量 1,145,四个陷阱维度。全对。顺手还查到一件事:论文署名六个人,帖子列了五个,恰好漏掉排最后的 Zhuosheng Zhang。一篇讲显著性偏置的文章,把最不显眼的作者挤出了视野。这个偏置,写的和被写的都逃不掉。
论文里最瘆人的一个标签,是六个行为类别里的 Sycophantic Compliance:模型认出了陷阱,然后照干。知道水烫,还是把手伸进去。帖子用"集体翻车"形容,其实得分层次看——有的是真没看见,有的是看见了装没看见。后者麻烦得多。
还有个实验帖子没讲,我觉得是全文最好笑的。给模型套一段强制自查流程,要求先写"可行性判定"再答题,效果反而最差。模型会配合地写下"需确认任务是否可行",然后毫无心理负担地继续安排你走路上洗车场。检查清单沦为盖章仪式。反倒是开放式那句"先想想物理上成不成立"最管用。形式主义这门手艺,模型无师自通。
量级再补一脚:十二个模型里八个避坑率不到三成,最好的 Claude 也只躲开 54.8%。这相当于一台计算器,七次结账错三次。你还敢带它去超市吗。