ClinAlign: A Memory-based Retrieval Framework Aligned with Clinical Workflow (推断标题)
2026-08-06 15:10
🔍 耿同学打假报告
论文信息
- 标题:ClinAlign: A Memory-based Retrieval Framework Aligned with Clinical Workflow (推断标题)
- 作者:未在文本中明确提供(受限于提供的 PDF 文本提取)
- 期刊/会议:IJCAI-ECAI 2026 (依据文件名 IJCAI__ECAI_26_Formatting_Instructions (1).pdf)
- DOI:未提供
- 发表年份:2026 (投稿)
- 论文来源:IJCAI__ECAI_26_Formatting_Instructions (1).pdf
综合评定:🟠 高度可疑
详细发现
发现 1:核心评价指标存在数学不自洽(Precision/Recall/F1)
- 位置:Section 4.2 Experimental Results (Results on MIMIC-CXR 段落) 及 Table 1
- 描述:作者在正文中声称其模型在 MIMIC-CXR 数据集上取得了 0.525 的 Precision,0.546 的 Recall,以及 0.505 的 F1-score。然而,根据数学公式,F1-score 是 Precision 和 Recall 的调和平均数。
- 证据:
将作者报告的数值代入公式:\(F1 = 2 \times \frac{Precision \times Recall}{Precision + Recall} = 2 \times \frac{0.525 \times 0.546}{0.525 + 0.546} = \frac{0.5733}{1.071} \approx 0.535\)
计算得出的理论 F1-score 应为 0.535,但论文中堂而皇之地写成了 0.505。更令人怀疑的是,正文紧接着写道:“即使是与最强的竞争者(0.475 F1)相比,也实现了 3.0% 的绝对提升”。\(0.505 - 0.475 = 0.030\)。作者极有可能是为了强行凑出“3.0%”这个极其工整的提升数字,从而人为编造/篡改了最终的 F1 指标,却忘记了更新或计算前面的 Precision 和 Recall,导致基础的数学逻辑崩盘。 - 严重程度:🔴
- 复核状态:✅ 成立
发现 2:表格数据大面积缺失与排版异常
- 位置:Table 1, Table 2, Table 3
- 描述:论文声称进行了广泛的实验和消融研究,但提供的表格数据极不完整,存在明显的内容缺失和排版断层。
- 证据:
- Table 1 中,CoFE 模型的部分指标缺失(如
- 0.125,完全缺失 Precision/Recall/F1/BLEU-1);而 Ours(本文模型)这一行除了名字之外,所有的数值数据全部丢失。 - Table 2 中,Ours 这一行仅提取到了
0.397(结合下文可知这是 ROUGE-L),其余声称的 BLEU-1 (0.495) 等数据在表格中完全不见踪影。 - Table 3 (消融实验) 中,表头有 Random/KNN 等策略和多项指标,但数据行除了打勾打叉(✓/✗)之外,没有任何一个具体的数值。
这是一个极其不正常的学术现象。如果这是排版软件解析错误,那说明源文件结构极度混乱;如果是作者赶时间拼凑的“占位符”模板,说明实验数据甚至可能根本没有跑完。
- Table 1 中,CoFE 模型的部分指标缺失(如
- 严重程度:🔴
- 复核状态:✅ 成立
发现 3:正文逻辑断层与 Copy-Paste 残留痕迹
- 位置:Section 1 Introduction, Section 3 Method, Section 4.2
- 描述:论文正文中存在大量句子主谓宾缺失、引用占位符未替换、段落上下文不连贯的现象。
- 证据:
- 4.2 节中:“compared with method yields an absolute improvement...” 以及 “compared with 18.4%.” 这里明显缺失了对比模型的名称(如 compared with [Model X], our method yields...)。
- 4.2 节中:“Even against the strongest competitor (0.475 F1) and achieves a 3.0% absolute improvement”,语法支离破碎。
- 1 节中:“To tackle these limitations, we introduce, a memory retrieval framework...”,缺少了框架的名称。
这种文本碎片化表明,作者很可能是在不同的草稿文档中进行复制粘贴,或者在 LaTeX 中错误使用了\cite{}或宏定义却未加以编译检查。这在严谨的学术写作中属于严重的低级失误。
- 严重程度:🟡
- 复核状态:✅ 成立
⚠️ 发现 4:无法进行图片复用与 PS 痕迹检测
- 位置:Figure 1, Figure 2, Figure 3, Figure 4, Figure 5
- 描述:文本中未提供足够的图片像素信息,无法进行视觉相似度、PS拼接、 Western Blot 或显微镜图的一图多用检测。
- 证据:耿同学六式中的第一式(图片复用)和第三式(图片拼接)因缺乏原始图像数据而无法应用。
- 严重程度:ℹ️ 信息缺失
- 复核状态:⚠️ 依据不足
耿同学辣评
你这论文是赶 DDL 赶到连 F1-score 的计算公式都忘了,还是拿随机数生成器直接生成的结果?为了硬凑出比竞品好 3.0% 的“完美”数据,愣是把 F1 从 0.535 压到了 0.505,数学老师看了都要流下心痛的眼泪!再看看那满屏缺胳膊少腿的表格和句子里凭空消失的模型对比名字,你这是把审稿人当成了你论文修补程序的测试员了呀!
建议后续行动
- 要求作者提供原始的 LaTeX 源文件,以确认大面积缺失的表格数据(Table 1/2/3)和正文残缺究竟是格式解析问题,还是“占位符”未填的学术造假。
- 联系作者要求提供原始数据,特别是有关 Precision, Recall 和 F1-score 的计算脚本,验证 0.535 与 0.505 之间的数学矛盾。
- 在 PubPeer 上提出质疑,重点关注核心评价指标的自相矛盾。
- 建议作者所在机构学术委员会在论文正式录用/发表前介入审查其实验记录。
⚠️ 免责声明
本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。