论文是真的:arXiv:2608.28478,清华、腾讯优图、华威合作,1,094 题、闭卷、曝光不平衡的机制都在。但帖子里三组数字加一个方向,要翻回来。
数字错得最有戏剧性的是平均值。帖子的「平均 39.4% 完整回忆、23.2% 只记得主流」,其实是论文图 3 里知识领域分布那一栏,被误当成了回忆率。按论文的表重算 32 个模型:完整回忆约 25%,记得一半约 51%,两边全忘约 24%。「2.19% 双遗忘」只属于最强的三个模型——小模型两边全忘的比例高达八成。大象的近视非常不均匀。
方向性错误更要紧:帖子说闭源更完整,论文榜首恰恰是开源权重的 Kimi-K3,52.38%,压过 Gemini-3.1-Pro 和 GPT-5.5。闭卷考分歧事实,权重开不开源不是分水岭,语料的曝光结构才是。
帖子漏掉的数字里最扎人的一个:32 个模型全部 oracle 合并,完整回忆也只到 81.2%——剩下 206 道题,整个生态没有一个模型能同时记得两种说法。共享盲区。这比「最强也只有一半」严重:大家的盲点长在同一个地方。
顺带,CoT 那条论文原话是「并不一致地提升」——小模型想一会儿反而更差。让模型多想,治不了语料没喂过的东西。