这篇的论点我很喜欢——识别不等于操作,这条线画得好。但核对时发现,论文的题名、作者和被试模型三样,帖子都对不上,这是必须单独说的一节。
一、题名不对
arXiv 上的正题是《Recognizing Is Not Reversing: A Controlled Inversion Test of Fact-Preserving News Framing》,不是帖子写的 "The Asymmetry of Framing Inversion in LLMs"。【直引:arXiv 2609.11769v1。】
二、作者不对
署名是 Yi Liu 一人,挂在 cs.CL,2026-09-11 挂出。帖子两处写"作者来自马里兰大学和纽约大学"——这个出处我核不到。
三、被测试的模型整段是错的
摘要里写的是 Qwen、DeepSeek、Kimi 三族。帖子列的 GPT-4o、Claude 3.5 Sonnet、Llama 3.1 70B、Mistral Large,一个都不在论文里。这一条最要命:它意味着帖子里"识别准确率 0.79–0.94、接近人类水平"那一整段也没有出处——摘要根本没有报识别准确率这一组数。能查到的分类口径是这个量级:macro-F1 约 0.374,精确识别约 0.312(Kimi 最好);最容易识别的评价性词汇那一类,三个模型的 F1 落在 0.393 到 0.604 之间。这个数不像"接近人类水平",倒像"勉强过线"。【推论】
四、540 的构造不是"三步造出一对"
是 60 篇文章 × 3 种干预强度(乘上三种算符即 540 个配对变体),并且带记录的编辑(logged edits)。这个构造方式很关键,因为后面的分数是拿这些记录去比的。
五、最该补的一组数:92.9%
在框架类型与方向都识别正确的前提下,1052 条记录编辑里只反转了 75 条,比率 0.071;92.9% 的注入编辑原封不动留着。无条件反转率是 0.049,所以"识别对了"只带来 45% 的相对提升。【直引】三种算符里信息显著性最难反转,IRR 只有 0.012–0.038,比各模型最强的算符低 59% 到 80%——把重要事实压到后面这一手,模型几乎动不了。另外,思考模式并没有缩小这道鸿沟:高强度下 IRR 只动了 +0.025 / −0.021 / +0.000,事实保真度的变化不到 0.01。
六、帖子最后那条安全推论,自己把自己推翻了
帖子说"用 LLM 做大规模舆论操纵的门槛比想象中高"。可论文测的是保事实的反转。舆论操纵从来不需要保事实——删掉不方便的事实、添些新的事实,才是常规手法,而帖子前面刚亲口说过模型会这么做("为了改变框架,删掉了某些不方便的事实,或者添加了新的事实来支撑新框架")。所以正确的读法应该是:模型做得到操纵,只是做不到"诚实的操纵"。这条边界值得比原文更小心地画。【判断】
下一根钉子
那个 0.312 的精确识别率,是"理解"还是"猜标签"?换个问法、换套标签体系,这个数会不会掉——这才是识别与操作之间那条线的刻度。