Micron-BERT: BERT-based Facial Micro-Expression Recognition
2026-09-17 08:58
🔍 耿同学打假报告
论文信息
- 标题:Micron-BERT: BERT-based Facial Micro-Expression Recognition
- 作者:Xuan-Bac Nguyen, Chi Nhan Duong, Xin Li, Susan Gauch, Han-Seok Seo, Khoa Luu
- 期刊:arXiv 预印本(CVPR 类格式),来源:arXiv:2304.03195
- DOI:arXiv:2304.03195
- 发表年份:2023
综合评定:🟠 高度可疑(多处降级保留的独立疑点累积,但无一条实锤确认)
详细发现
⚠️ 发现 1:Figure 1 输入图与输出图高度一致(视觉摘要线索)
- 位置:Figure 1
- 描述:视觉分析摘要指出,Figure 1 左侧输入帧与右侧 "μ-BERT 输出" 的面部图像像素级高度一致(头发高光、肤色、背景噪点均一致)。需注意:该图是方法示意图而非实验证据图,caption 表述为 "Given two frames from a high-speed video, the proposed µ-BERT method can localize and highlight the regions of micro-movements",属于输入-输出对应示意,存在合理的展示成分;但 caption 并未明确标注输出框内容是否为模型重建/处理结果,存在误导性展示的可能,需原始图片进一步确认。
- 证据:论文文本无可用像素级核验数据;视觉分析摘要(置信度:高)报告了像素级一致。
- 严重程度:🟡
- 复核状态:⚠️ 依据不足(纯视觉定性线索,原文 caption 支持示意图解读,无文本可佐证造假)
⚠️ 发现 2:Figure 7 可视化热力图过于平滑理想化(视觉摘要线索)
- 位置:Figure 7 最右列 "μ-BERT with DMA + POI"
- 描述:视觉摘要指出该列结果在不同样本间激活模式高度一致(集中眼周、嘴周),背景噪声被完全抹除,相比中间列 "μ-BERT with DMA" 明显更平滑。论文方法部分明确声称 POI 的设计目标就是“过滤背景噪声、聚焦面部显著区域”("The POI is designed as a filter that only lets the typical interesting patches belonging to the subject go through"),最右列的平滑表现与该机制在逻辑上一致,构成有原文正面依据的良性解释;但“跨样本激活模式高度一致”仍值得作者提供原始未经后处理的注意力图予以澄清。
- 证据:Figure 7 caption 描述各列分别为 onset/apex 帧、RAFT、MagNet 与 µ-BERT 各模块结果;Section 5.6 描述 POI 的过滤作用。程序化取证在多张图检出噪声方差异常与 copy-move 匹配,但本文图片为规则排布的多面板结果网格(重复面部裁剪块),极易产生同偏移伪匹配,单一证据不足以定罪。
- 严重程度:🟡
- 复核状态:⚠️ 存在良性解释(最右列平滑与论文明确声称的 POI“过滤背景、聚焦面部”机制一致,可能系方法本身所致,需原始注意力图确认)
ℹ️ 发现 3:Benford / 末位数字检验异常——检验前提不成立,不采纳
- 位置:Tables 1–6 全部数值
- 描述:机器取证报告 Benford 第 1/3/4 位显著偏离、末位分布轻度不均。但本文全部数值为精度受限的百分比指标(UF1/UAR,两位小数、范围约 17–90%),Benford 检验对受控范围、精度截断数据不适用;末位分布受“两位小数+有限样本量”约束,轻度不均在预期之内。本条仅作为线索记录,不构成造假证据。
- 证据:Tables 1–6 中所有数值均为两位小数百分比(如 56.04、61.25、32.64 等),检验前提不满足。
- 严重程度:🟡(检验适用性问题,非数据异常)
- 复核状态:ℹ️ 不构成不端证据(Benford/末位检验前提对本类数据不适用)
⚠️ 发现 4:跨数据集比较的类别数不一致与结果过于全面领先
- 位置:Tables 1–4、Section 5.4
- 描述:论文在四个基准上对每一种类别数设置均声称全面超越 SOTA,且 Table 1 中 µ-BERT 相对 Baseline(+Depth) 的提升幅度(+16~17 UF1)远超其余文献间的典型差距(1–5 点)。原文核实:Table 1 中 "µ-BERT (ours) 3 56.04 61.25" 与 "RCN-A [49] 3 39.28 38.93"、"µ-BERT (ours) 4 47.18 49.13" 与 "Baseline (+Depth) [14] 4 30.01 29.82"、"µ-BERT (ours) 7 32.64 32.54" 与 "Baseline(+Depth) [14] 7 17.73 18.29" 均为原文真实数据;CASME II 与 SAMM 表中同时混排 3 类和 5 类结果,与不同文献比较时类别数并不对齐,存在选择性比较的空间。这属于实验报告规范问题,不必然指向数据造假。
- 证据:Table 1–4 原文数据逐项核对无误;引用数字均命中原文。
- 严重程度:🟡
- 复核状态:⚠️ 依据不足(数据核对无误,但“大幅领先+类别数不对齐”更可能源于新方法真实提升与领域内常用比较惯例,不足以支持造假指控)
✅ 发现 5:轻微内部不一致与编辑疏漏
- 位置:Abstract vs. Introduction;参考文献 [11]/[12]/[17]/[18]/[31]
- 描述:摘要称微表情持续 "0.25 to 0.5 seconds",引言称 "between 5 milliseconds and half a second",两处口径不一致,原文均可见。参考文献方面,[11]、[12] 两条目共享同一标题片段与页码("…facial graph representation learning and facial action unit fusion. … CVPRW, pages 1571–1580, June 2021"),[31] 亦指向同一论文与相同页码(1571–1580);[17]/[18] 为同一条 STSTNet 论文(FG 2019, pages 1–5)的重复条目。程序化核验未命中完整字符串系 OCR 截断所致,页码 1571–1580 与论文标题片段在原文中逐字可见,重复事实成立。这些是写作/整理疏漏的典型特征,属编辑质量问题,不指向数据造假。
- 证据:Abstract "0.25 to 0.5 seconds" vs. Introduction "5 milliseconds and half a second";[11][12][31] 均含 "pages 1571–1580" 及相同论文题名/会议信息;[17][18] 均为 STSTNet (FG 2019)。
- 严重程度:🟡
- 复核状态:✅ 成立(文字不一致与引文重复均有原文直接依据)
说明:无法判定的事项
- 文本中未提供可供像素级复核的原始图片数据。程序化图像取证的 copy-move/PRNU 线索(I1–I24)在本类多面板深度学习论文中存在大量结构性伪触发来源:论文图片均由同一 arXiv PDF 渲染导出(同一管线天然导致 PRNU 相似)、Figure 2/7 等为规则排布的面板/面部网格(重复面部裁剪块在固定网格间距 32px 上产生同偏移 copy-move 匹配)、面部与背景混合导致噪声方差梯度。各线索所提“扫描照明梯度/统一导出”等通用托辞虽无逐条原文正面支持,但“同一 PDF 渲染”与“规则网格面板”的结构性解释由论文图片形态本身支撑,故不作为定罪依据,仅记录备查。
- 训练声明(8M 帧、32×A100 40G、batch 64/GPU、100 epochs、三天完成)数值上自洽,无法证伪,记录备查。
耿同学辣评
这篇论文的表格数字一个比一个漂亮、四个基准全面屠榜,提升幅度还一骑绝尘——越是“零噪声”的结果,越要多看两眼。可惜目前真正坐实的只有排版和引文打架:微表情时长两处口径对不上、三组参考文献互相抄袭自己。图像方面的“完美热力图”疑点虽与论文自述的 POI 机制能对上号,但作者若肯把原始注意力图和 Figure 1 的输入/输出原图交出来,一切谣言不攻自破;藏着掖着才是最大的微表情。
建议后续行动
- 联系作者要求提供 Figure 7 的原始(未经后处理)注意力图与可视化脚本
- 要求作者澄清 Figure 1 输出框中图像的来源(是否为模型重建结果)并补充明确标注
- 修正重复参考文献([11]/[12]/[31]、[17]/[18])及微表情时长口径不一致问题
- 说明跨数据集比较中的类别数对齐方式,避免选择性比较质疑
- (可选)在 PubPeer 上就可视化一致性问题礼貌提问
⚠️ 免责声明
本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。
🧮 证据合成(自动生成)
- 综合后验概率:62.8%(先验 5%)
- 95% 可信区间:[25.3%, 86.9%]
- 贝叶斯因子:BF = 32.02(非常强(very strong))
- 综合评级:🟠 存在疑点
- 复核已排除线索:27 条(良性解释成立 / 检验前提不满足 / 说明性条目,未计入合成)
贡献最高的证据:
- [发现1] 视觉摘要指出 Figure 1 输入帧与输出框面部像素级一致,存在误导性展示风险,但示意图场景有良性解释。(vision/*,logLR=1.19)— 贡献 36.6%
- [发现2] 最右列结果跨样本高度一致且背景噪声被完全抹除,与 POI 设计逻辑一致但建议作者提供原始注意力图。(vision/*,logLR=1.19)— 贡献 33.7%
- [发现4] 表格混排不同类别数设置并与不同文献比较,存在选择性比较空间,属报告规范问题。(llm/*,logLR=1.08)— 贡献 29.8%
免责:本小节由程序化贝叶斯合成自动生成,不构成学术不端判决。先验固定 5%,证据间按条件独立处理(可能高估相关证据的联合强度),LR 版本 geng_lr_v3(Phase 5 基准回归校准:任务级触发率比值+复核处置标签,n=11,向 v2 收缩 k=10);可信区间与点估计来自同一后验(先验抽样 + LR 噪声的联合蒙特卡洛,区间随证据强度收敛)。请以正文具体发现与原始数据为准。