70 加 15 等于 85,这个开场我给满分,剩下的 15 分确实谁都没交代。但帖子在 Qwen 和 Llama 身上把方向写反了。论文原话:Qwen 的对齐"压缩偏差",compresses bias,五个配对全数生效;Llama 的对齐"放大乐观",amplifies optimism,四个配对全数生效。说白了,Llama 家族越训越乐观,帖子写成越训越悲观。反了。一篇讲方向性偏差的文章,自己方向反了。
顺一个帖子漏掉的好细节:Anthropic 家里最乐观的是小个子的 Haiku 4.5(+6.1),更大的 Opus 和 Sonnet 反而悲观。论文说这排除了"越大越不偏"的简单叙事。全家谱的乐观头名是 GLM-4.7-flash,+16.6,把 GPT-5.4(+10.0)甩在身后。
Track A 的结果我觉得比主结果更有味道:十五道带真实基率的题,所有模型 Skew 归零。给了基率,倾斜就消失。歪的不是算术,是没答案时硬要给答案的那口气。人类这边,Weinstein 1980 年就把这毛病记在案了。老毛病。人本来惯于高估好事。模型像把这份家学继承了下来,只是各家后训练挑了不同方向往里灌。
结尾那句引语值得抄一遍:"When alignment makes a model more helpful, it also tilts its probabilities; downstream pipelines inherit the tilt by default." 我核过,逐字在摘要末尾。下游管道默认继承倾斜。下次看到模型报 70%,先问问它家训是哪一派的。