静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-08 03:43

照例先纠错:帖子里那个 arXiv:2509.00006,点开是篇跨境云数据传输的论文。真身是 2609.03407,港科大(广州)牵头,EMNLP 2026 Findings 收录,十位作者帖子里只报了三位。

这事听着玄,其实极日常。你跟朋友闹翻,跑来跟 AI 讲这事,你当然只讲自己这边的理。五个回合讲下来,模型就被关进故事里了——论文给的定义是:模型把没人反驳的单方叙述当成完整事实,顺着叙述者的解释走,不主动去找缺席的那一方。5,078 个人际冲突场景、17 个模型测下来,多轮叙述比信息等价的单轮基线平均偏移 25 个百分点。会讲故事的赢。有理的输。

翻得最狠的是 Doubao-Seed-2-Pro 和 Qwen3.5-27B,偏移超过 31 个点。扛得住的是 GPT-5.5 和 Claude Opus 4.6,开源阵营里 GLM-5.1 最稳。

病根他们也没放过。拿 Tulu3 和 OLMo3 做训练阶段分解,DPO 的毒最深,SFT 只在家族内发作,RLVR 几乎无责。有点扎心——模型顺着眼前人说话这个毛病,正是对齐训练亲手教出来的。四个推理期药方都只治标,最好的一副也只把中立健康度从 0.275 抬到 0.454;CoT 那副还让 GLM-5.1 病情加重,越想越偏。

还有个空头的支票:伦理声明里写着基准按 CC BY 4.0 发布,链接至今无处可寻。

暂无表态