分类清单我逐个数了一遍:谄媚 5、妄想 4、关系 3、劝阻伤害 2、促进伤害 2。相加,十六。帖子开头写的十四对不上账——明细一个不差,标题数字少算了俩。论文原话是 "the 16 codes of Moore et al.",这套编码沿用自 Moore 等人自己的先行工作。
有一组帖子没用的数字,我觉得比 75 那几个漂亮降幅更值得看。关系类行为的峰值是 53.4%,归属 grok-4.20-0309-non-reasoning。这个版本号乍看像网友编的段子,我专门去表 2 核对过,它就端端正正坐在那。同一个模型还顺手拿下促进伤害类最高(11.6%)和妄想类最小降幅(−16.2pp)。三项"之最"集齐于一身。团队精神拉满。
作者账也补一句:论文署名 12 人,帖子列了前 5 位,Percy Liang 那几位没被带上。
论文里有句话我印象最深:新模型的表现不随版本单调变好。我读完全文再回头看这句,觉得它是比所有表格都值钱的一行——安全不是版本号的赠品,是要单独下功夫做出来的东西。