SSR: Semantic and Spatial Rectification for CLIP-based Weakly Supervised Segmentation
2026-08-06 15:10
🔍 耿同学打假报告
论文信息
- 标题:SSR: Semantic and Spatial Rectification for CLIP-based Weakly Supervised Segmentation
- 作者:Xiuli Bi, Die Xiao, Junchao Fan, Bin Xiao
- 期刊/会议:AAAI-26 (The Fortieth AAAI Conference on Artificial Intelligence)
- DOI:未提供
- 发表年份:2026
- 论文来源:07906-AAAI26.BiX-CV.pdf
综合评定:🟠 高度可疑
详细发现
发现 1:核心公式与实现细节的严重逻辑冲突
- 位置:Methodology (公式 9) / Implementation Details (Page 2448)
- 描述:在公式 9 中,作者将 CLIP 和 DINO 的多头自注意力(MHSA)特征进行融合,定义明确使用的是 \(ConCat\)(拼接)操作:“\(A=ConCat(MHSA_{CLIP}, MHSA_{DINO})\)”。然而,在后续的“Implementation Details”中,作者又写道:“In SGC, the CLIP:DINO weighting ratio is 0.4:0.6.”
- 证据:这是一个基础性的深度学习常识错误。如果使用的是通道或维度拼接,是不会产生“0.4:0.6”这种加权和权重比的。如果使用了权重比,那么公式 9 应该是 \(A = 0.4 \times MHSA_{CLIP} + 0.6 \times MHSA_{DINO}\)。这说明作者在撰写方法和实现细节时存在严重的脱节,或者是在堆砌技术名词时露出了马脚,公式很可能是为了凑数学美观而随意编造的。
- 严重程度:🔴
- 复核状态:✅ 成立
发现 2:核心数据比例计算异常与文本不符
- 位置:Fully-supervised Counterparts (Page 2449, Table 6 下方文本)
- 描述:文中声称“SSR achieves 79.5% mIoU on VOC 2012 val set, reaching 97.4% of fully-supervised performance.”
- 证据:核对数据可以发现,在 Table 6 中,表现最好的全监督基线是 DeepLabV2 F ViT-B,其 mIoU 为 82.3%。用 79.5 除以 82.3,等于 96.59%,根本不是作者声称的 97.4%。如果按照 97.4% 反推,全监督的 mIoU 应该是 81.6%,但表中根本没有这个数据。这种关键提升比例的算术错误,说明作者极有可能是在凭空捏造数字,连计算器都没按对。
- 严重程度:🔴
- 复核状态:✅ 成立
发现 3:基线对比中的“无中生有”与张冠李戴
- 位置:Model Performance Across Key Metrics (Page 2449, Table 5 下方文本)
- 描述:文本中描述:“Our method achieves superior performance on all indicators: surpassing the best baseline MoRe by 3.1% in mIoU and 3.5% in Precision”。
- 证据:核对 Table 5 的数据发现:mIoU 方面,Ours (0.795) 相比 MoRe (0.764) 确实提升了 3.1%;但是 Precision(精确率)方面,Table 5 显示 Ours 为 0.879,而 MoRe 为 0.837,差值实际是 4.2%!作者宣称的 3.5% 实际上是拿 Ours (0.879) 减去了 WeCLIP 的 0.844(差值刚好为 3.5%)。作者搞错了对比对象,暴露出在编写文本时生搬硬套数据,缺乏最基本的严谨校对。
- 严重程度:🟠
- 复核状态:✅ 成立
⚠️ 发现 4:图片与指标信息无法进行像素级核验
- 位置:Figures 1-6
- 描述:本文是一篇重度依赖可视化(CAM 激活图、分割掩码、t-SNE 特征图)的计算机视觉论文,但提供的文本中无法展示高分辨率的原始图像数据。
- 证据:由于仅有文本信息,无法对 Figure 3 的分割图边缘是否过度平滑、Figure 4 的 CAM 激活图是否存在局部擦除、以及 Figure 6 的 t-SNE 是否存在人工框选修改等进行视觉像素层面的鉴定。当前环境缺乏原图像素依据。
- 严重程度:🟡
- 复核状态:⚠️ 依据不足
耿同学辣评
这篇顶会稿子把“Concat(拼接)”和“加权求和”混为一谈,把 96.6% 硬说成 97.4% 以夸大逼近全监督的效果,甚至做减法都能找错减数!深度学习论文不是请客吃饭,不能连小学算术都指望 AI 帮你编吧?如果算法核心公式和实验结果连内部逻辑都无法自洽,那这模型不是在炼丹,而是在炼“糊弄学”的仙丹啊!
建议后续行动
- 联系作者要求提供原始数据(特别是公式9的具体代码实现逻辑和全监督对比比例的计算源代码)。
- 在 PubPeer 上提出质疑。
- 向 AAAI 2026 期刊/会议编辑部举报,要求在接收前大修并核查代码开源情况。
- 向作者所在机构学术委员会举报(目前证据偏向于极度的学术粗制滥造或意图拔高数据的学术不端)。
⚠️ 免责声明
本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。