SSR: Semantic and Spatial Rectification for CLIP-based Weakly Supervised Segmentation
2026-08-06 15:10
🔍 耿同学打假报告
论文信息
- 标题:SSR: Semantic and Spatial Rectification for CLIP-based Weakly Supervised Segmentation
- 作者:Xiuli Bi, Die Xiao, Junchao Fan, Bin Xiao
- 期刊:The Fortieth AAAI Conference on Artificial Intelligence (AAAI-26)
- DOI:未提供
- 发表年份:2026
- 论文来源:07906-AAAI26.BiX-CV.pdf
综合评定:🟡 存疑
详细发现
发现 1:文本与公式符号不一致
- 位置:Methodology - Cross-Modal Prototype Alignment (公式 1 及其下文)
- 描述:公式 (1) 及其下方的解释文本中,特征维度的符号存在自相矛盾。公式说明提取的特征为 \(v'_i \in R^{1 \times d_1}\) 和 \(t'_i \in R^{1 \times d_1}\),但紧接着的下文在解释这两个变量时,却写道“where \(v'_i \in R^{1 \times d_2}\) and \(t'_i \in R^{c_f \times d_2}\) denote the projected image features...”。
- 证据:同一句话中,映射后的特征维度前半句写的是 \(d_1\),后半句写的是 \(d_2\)。
- 严重程度:🟡
- 复核状态:✅ 成立
发现 2:图表缩写定义冲突
- 位置:Table 2 (Page 2448)
- 描述:表 2 下方的注脚中对网络结构的缩写定义存在冲突。注脚写道:“D:DINO. N: network. R: ResNet. D:Deit. V:Vit-B.”。其中字母 “D” 同时被用于指代 “DINO” 和 “Deit”,这在学术论文中会引起读者的严重误解。
- 证据:注脚中重复定义了缩写 D。
- 严重程度:🟡
- 复核状态:✅ 成立
⚠️ 发现 3:缺乏原始图像数据导致的部分检测盲区
- 位置:全文图片(Figure 1-6)
- 描述:由于仅获取到文本和部分低分辨率的图表描述,无法对文中的特征可视化图、分割预测图、以及 CAM 激活图进行像素级别的篡改或复用比对。计算机视觉领域的论文常出现不同模块的可视化结果截取自同一张底图的情况,纯文本分析无法排除一图多用的可能。
- 证据:论文原文未提供可供图像取证的原始像素信息,无法在文本层面找到图像造假或一图多用的直接证据。
- 严重程度:🟡(客观条件限制,非造假指控)
- 复核状态:⚠️ 依据不足
耿同学辣评
这篇论文整体上逻辑自洽,时间线(大量引用2024和2025年的文献,投给2026年的会议)也挑不出毛病,算不上严重的学术造假。但是!这篇论文在文字细节上多少有点“马大哈”了:公式后面的维度符号写着写着自己就变了(从 \(d_1\) 突变成 \(d_2\)),表注里的缩写“D”能同时代表 DINO 和 Deit。虽然不是什么伤天害理的数据伪造,但定稿前连这种基础符号都会打架,这校对态度多少有点“弱监督”了吧?建议作者在最终版本出版前好好把文字部分“微调”一下!
建议后续行动
- 论文未发现核心数据造假,但存在明确的行文与排版笔误瑕疵。
- 联系作者要求提供原始数据及高清图片(如需进一步核实可视化图片真实性)。
- 在 PubPeer 上提出质疑。
- 向期刊编辑部举报。
- 向作者所在机构学术委员会举报。
⚠️ 免责声明
本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。