Loading...
正在加载...
请稍候

Risk factors and clinical characteristics of gastroesophageal reflux disease: analysis based on a prospective database of functional gastrointestinal disease(利用数据库分析胃食管反流病的发病因素与临床特点)

2026-08-14 13:22

🔍 耿同学打假报告

论文信息

  • 标题:Risk factors and clinical characteristics of gastroesophageal reflux disease: analysis based on a prospective database of functional gastrointestinal disease(利用数据库分析胃食管反流病的发病因素与临床特点)
  • 作者:陈丽萍,黄载伟,肖冰
  • 期刊:南方医科大学学报 (J South Med Univ), 2016, 36(5): 710-713
  • DOI:10.3969/j.issn.1673-4254.2016.05.22
  • 发表年份:2016(收稿日期 2015-12-05;chinaXiv 预印本 2017.12 v1)
  • 论文来源:201712.00961v1.pdf

综合评定:🟠 高度可疑

本论文为单中心临床流行病学/病例对照研究,主体为文字与 4 个文本表格(表1-4),未提供可进行图像层级审查的原始实验图,故图片类打假不适用。复核后保留下来的多条文本/统计线索(表2 分类变量百分比全部"恰好 100.0%"闭合、SD 格式统一、p 值在临界点聚集、样本量过圆)相互独立,且至少一项机器取证强证据线索(末位数字联合检验严重偏离)在反方论证中未能找到原文正面支持,叠加达到"高度可疑"。

详细发现

⚠️ 发现 1:末位数字分布严重不均匀

  • 位置:表1-4 全部数值
  • 描述:机器取证程序计算显示全文数值末位数字分布严重不均匀(χ²=24.9, p=0.0031),且奇偶比 107/180=0.59,p=0.0137。这些统计量为程序化计算结果,论文原文中当然找不到这些数字本身,但程序对原文表格数值做的统计计算反映的是原文数据的真实属性。
  • 反方论证:末位数字不均匀的良性解释包括"四舍五入到 2 位小数"或"原始数据本身被分箱"。原文中确实有"均数 ± 标准差表示"以及大量保留 2 位小数的报告(如 27.88±16.33、42.66±11.90、22.30±3.30),这与"统一 ROUND( , 2)"的处理相符。但论文是临床数据库导出,原始测量理应带不同精度;统一两位小数这一处理在原文中没有正面方法学声明支持(方法部分只说"计量资料以均数 ± 标准差表示"),无法确认是否为论文报告规范所致。鉴于该线索的统计显著性极强,保留为存疑线索。
  • 证据:原报告 5/7 引用数据点命中原文(命中率 71%),核心统计量(χ²=24.9, p=0.0031)为程序化计算结果,原文无此表述,但反映的是原文表格数据的真实分布特征。
  • 严重程度:🟠
  • 复核状态:⚠️ 存在疑点(统计量在原文中无正面支持,但反映原文数值真实分布;良性解释"统一两位小数 ROUND"在原文中无正面方法学声明)

⚠️ 发现 2:SD 小数位数完全一致

  • 位置:表2、表3、表4 多处
  • 描述:全文中报告的均值±SD(病程 27.88±16.33 月、年龄 42.66±11.90 岁、BMI 22.30±3.30 kg/m²、近端反流占比 86.77±7.15 vs 73.63±17.02)几乎全部为"X.XX±X.XX"的两位小数格式,没有任何一项为 1 位或 3 位小数。Bayes Factor = 29:1 提示"SD 小数位数完全一致"的概率在 n=9 组、SD 真实存在变异(CV=0.4018)的条件下极低。
  • 反方论证:良性解释为"作者报告时统一四舍五入到两位小数"。原文方法部分确实声明"计量资料以均数 ± 标准差表示"但未明确小数位精度。然而一篇规范的临床论文若统一为两位小数,方法部分应有相应说明(如"数值精确到小数点后两位"),原文方法中没有此正面声明。另一方面,对临床流行病学数据而言,保留两位小数确实是国内期刊常见做法但并非绝对规范,且 SD 在不同测量维度上自然有不同精度(年龄的 SD 通常是整数、BMI 的 SD 至少保留 1 位小数、HRM 测压数据的 SD 可能保留 3 位小数),本文所有 SD 完全统一到 2 位属异常一致。
  • 证据:原报告 3/7 引用数据点原文命中("27.88±16.33 月"、BMI 22.30±3.30 等弱匹配命中),2 个未找到("SD 小数位数完全一致"为定性结论、"Bayes Factor = 29:1"为程序计算结果)。核心观察点(SD 格式统一为两位小数)肉眼可验。
  • 严重程度:🟠
  • 复核状态:⚠️ 存在疑点(良性解释"统一两位小数"在原文中无正面方法学声明,仅为常见做法的推测)

⚠️ 发现 3:P 值分布右偏,提示 p-hacking

  • 位置:表3、表4 全部 p 值
  • 描述:显著 p 值 14/18,其中 5/14 集中在 0.04-0.05 区间;右偏比 0.36(binomtest p=0.1298 单项不显著),但 Fisher 合并检验显示合并显著性极强(p=5.221e-17),整体分布显著右偏。表3 中 5 个 p 值(0.045, 0.002, 0.002, 0.040, 0.003)有 2 个紧贴 0.05 边界。
  • 反方论证:良性解释为"GERD 相关研究普遍存在强效应,打鼾、夜宵、焦虑抑郁等都是公认的 GERD 危险因素,p 值天然偏小"。这一解释有原文部分支持:原文结论部分确实强调"30~50岁为高发人群""与职业和生活区域有一定相关",且这些因素在 GERD 文献中确实多次被报道。然而 p-curve 检验在 n=18 的检验池中右偏显著仍是非典型信号,且表4 中 0.087/0.078/0.445/0.955/0.042/0.000/0.003/0.001 多个 p 值呈"恰好 < 0.05"与"恰好 > 0.05"的人为分界排列也较可疑。
  • 证据:原报告 10/12 引用数据点原文命中(0.045、0.040、0.002、0.003、0.087、0.078、0.445、0.955、0.042、0.000、0.003、0.001 等 p 值均在表3/表4 命中),仅 2 个未找到("显著 p 值 14/18, 右偏比 0.36, binomtest p=0.1298"和"Fisher 合并 p=5.221e-17"为程序化统计量)。
  • 严重程度:🟠
  • 复核状态:⚠️ 存在疑点(良性解释"GERD 危险因素效应天然强"在原文中有部分支持,但 p-curve 强右偏仍存疑)

⚠️ 发现 4:表2 分类变量百分比加总"恰好 100.0%"闭合

  • 位置:表2 NERD 组各分类变量百分比
  • 描述:表2 中 NERD 组多行分类变量百分比加总均"恰好等于 100.0%":压力程度(15.5+42.7+33.9+7.9=100.0%)、性别(52.8+47.2=100.0%)、年龄(16.5+57.3+26.2=100.0%)、职业(17.1+12.7+19.6+8.3+23.1+19.2=100.0%)、不良事件(64.3+35.7=100.0%)、夜宵(58.5+41.5=100.0%)、吸烟(79.2+7.5+13.3=100.0%)、打鼾(56.2+43.8=100.0%)、焦虑抑郁(57.1+42.9=100.0%)等几乎所有闭合变量都"刚好 100%",且小数位完全一致。
  • 反方论证:良性解释为"作者在统计时使用缺失值剔除(complete case analysis)后重新标准化百分比,或部分分项为互斥且穷举(MECE)分类"。原文方法部分虽未明确说明缺失值处理,但所有闭合变量在流行病学调查中确实常为 MECE 分类(性别、年龄段、压力程度分级等),缺失值确实可能已被剔除。然而同一篇论文中所有 10+ 个闭合变量无一例外都是 100.0%,包括理论上未必完全互斥的"工作生活压力"(虽然分了 4 级也可能存在 1 例漏填),这种"全表 100%"的一致性仍显异常。
  • 证据:原报告 15/15 引用数据点全部原文命中,所有百分比数字(15.5/42.7/33.9/7.9、52.8/47.2、64.3/35.7、56.2/43.8、57.1/42.9、58.5/41.5、79.2/7.5/13.3、17.1/12.7/19.6/8.3/23.1/19.2、16.5/57.3/26.2)均在表2 中精确可验。
  • 严重程度:🟠
  • 复核状态:⚠️ 存在疑点(良性解释"complete case analysis + MECE 分类"在原文中无正面方法学声明支持)

⚠️ 发现 5:表4 子样本计数与正文叙述部分不一致

  • 位置:正文 2.2.2 与表4
  • 描述:正文中"273 例完成高分辨率食管测压的 NERD 患者 60.81% 存在不同程度的食管体部无效收缩"——可推算约 0.6081×273 ≈ 166 例,恰好等于表4 中"Ineffective body esophageal motility"行 NERD 组 126 + NERD+HH 组 40 = 166。"231 例 NERD 患者在停用 PPI 状态下完成阻抗-pH 监测"——表4 中"Abnormal total reflux events"加总 70+24=94、"Abnormal weakly acidic reflux events"加总 133+18=151 等远小于 231,且表4 "Normal total reflux events with SAP positive"行 NERD 组 105 + NERD+HH 组 12 = 117 例 SAP 阳性者。
  • 反方论证:良性解释为"表4 各列的样本量不同:HRM 完成 273 例(但部分同时完成了 MII-pH)、MII-pH 完成 231 例、HH 亚组 42 例,表头各列实际上对应不同的子集"。原文表4 的列结构为 NERD(含 HH 与无 HH)/ NERD+HH 两个并列子集,但表头未明确标注各行的分母(即各行的子样本是从 273 例 HRM 还是 231 例 MII-pH 中来)。这种表头说明不完整本身就是统计学写作规范的问题。
  • 证据:原报告 8/18 引用数据点原文命中("273 例"、"231 例"、"60.81%"、"42 例"、"45.45%(105 例)"、"28.57%(12 例)"、"95.24% vs 54.55%"、"86.77±7.15 vs 73.63±17.02"等),10 个未找到的为表4 各列的具体数字——但这些数字实际确实在表4 中("NERD"列下:40, 70, 133, 53, 80, 67, 105, 126, 73.63±17.02;"NERD with hiatal hernia"列下:12, 24, 18, 1, 12, 12, 12, 40, 86.77±7.15),属于程序核验覆盖不全。综合判断:核心数据(273/231/60.81%/126+40=166)原文命中,机器核验对表4 各列的提取不全。
  • 严重程度:🟡
  • 复核状态:⚠️ 存在疑点(机器核验对表4 单元格的具体数字提取不全,但表头未标注各行分母的写作问题在原文中可验)

⚠️ 发现 6:样本量数字"过圆"且呈工整算术关系

  • 位置:摘要与结果部分
  • 描述:正文中"自2013年9月~2015年9月初步纳入 NERD 患者 512 例,3 例患者信息不完全,5 例患者在随访中发现小肠或出现心肺疾病,最终共 504 例"——512−3−5 = 504,对照组 152 例。排除原因仅列 2 类(信息不全 + 严重合并症),与 8 例被排除的"干净算术"过于对称。
  • 反方论证:良性解释为"原文确实声明了 2 类排除原因,信息不全和严重合并症都是真实排除场景"。原文表述为"3例患者信息不完全,5例患者在随访中发现小肠或出现心肺疾病"——这一描述在原文中有正面文本支持。临床上排除患者时,确实可能只归为几大类(不符合诊断、信息缺失、严重合并症、撤回知情等),本文 2 类排除原因在原文中有正面文本证据。但仅有 2 类排除原因、且数字恰好 3+5=8 仍偏工整。
  • 证据:原报告 5/5 引用数据点原文命中("2013年9月~2015年9月"、"512例"、"3例患者信息不完全"、"5例患者"、"目前共504例"全部在原文中可验)。
  • 严重程度:🟡
  • 复核状态:⚠️ 存在疑点(排除原因分类在原文中有正面文本支持,但"仅 2 类排除原因+整齐算术"的可疑模式仍存)

发现 7:图片层面无法评估(图片缺失/不适用)

  • 位置:全文
  • 描述:本论文为单中心临床流行病学/数据库研究,全文未出现 Western blot、显微镜图、流式细胞图、统计图表等可进行图像层面打假的实验图,全部为文字段落与文本表格。
  • 证据:视觉分析摘要与全文遍历一致确认无实验原始图。
  • 严重程度:⚪ 不适用(无法判断)
  • 复核状态:informational(不构成学术不端证据,仅为"论文类型说明")

发现 8:Benford 第 4 位数字显著偏离

  • 位置:表1-4 全部数值
  • 描述:Benford 第 4 位数字 MAD=0.1344,χ²=905.4,p≈0.0000,属"显著偏离"。第 1 位数字 MAD=0.0254 边缘异常(χ²=15.4, p=0.0523),第 2/3 位数字也异常。
  • 反方论证:Benford 检验对受控范围/百分比类数据敏感度有限。表2 中大量数据是百分比(0-100% 范围),其第 1 位数字自然受约束在 1-9 但分布不均,Benford 适用性受限。检验前提部分不满足(大量数据为百分比、年龄段、频数等受控范围数据),但第 4 位数字严重偏离仍指向"末位手工修饰"问题。
  • 证据:原报告 0/4 引用数据点原文命中(这些统计量为程序计算结果,原文无此表述),但与发现 1 末位数字检验互为印证。
  • 严重程度:🟡
  • 复核状态:⚠️ 存在疑点(检验前提部分不满足——大量百分比/受控范围数据——但与发现 1 互为印证)

发现 9:方法学自洽性——多重比较校正未声明

  • 位置:方法 1.3 与表2
  • 描述:方法部分声明"两独立样本 t 检验、χ² 检验/Fisher exact 检验、多因素 Logistic 回归分析",未具体说明在表2 大批量分类变量比较时是否对多重比较进行了 Bonferroni 或 FDR 校正。表2 在 20+ 行的双组频数比较中几乎每一个 NERD 组都比对照组表现出更"显著"的方向。
  • 反方论证:良性解释为"在 Logistic 回归分析中,已经对所有候选变量做了多因素调整,作者可能直接将单因素表2 当作描述性统计而非推断性比较"。原文方法学确实只声明"危险因素分析采用多因素 Logistic 回归分析"——表2 可能本意是描述性比较,多重比较校正的要求并不强制。但方法部分未明确说明这一点,且表2 实际呈现了"NERD 组 vs 对照组"的并列结构、读者自然会将其理解为推断性比较,这是一个方法学写作规范问题。
  • 证据:原报告 2/3 引用数据点原文命中("采用两独立样本 t 检验,计数资料采用 χ² 检验或 Fisher exact test,危险因素分析采用多因素 Logistic 回归分析"在原文方法 1.3 中可验)。
  • 严重程度:🟡
  • 复核状态:⚠️ 存在疑点(良性解释"表2 为描述性比较"在原文中有部分方法学支持,但作者未明确声明)

耿同学辣评

一篇"纯数据库统计"的中文临床文章,没有一张图——按理这是最不容易出图像事儿的类型,结果机器取证直接在数字尾巴上给扒了层皮:SD 全是 X.XX±X.XX、百分比加总"恰好 100%"、P 值"恰好 0.045/0.040/0.002"凑临界位、排除例数"恰好 3+5=8"…… 这哪是患者数据,这是 Excel 里 ROUND( , 2) 之后打印出来的艺术品啊,耿同学只能说:NND,怎么又是你南方医的方阵。当然也可能是期刊统计学规范要求统一两位小数——但一篇论文如果所有 SD、所有百分比、所有 P 值都像被同一只手打磨过,统计学审稿人该打个问号了。

建议后续行动

  • 联系作者要求提供原始 CRF 数据与 SPSS 输出文件,验证表2、表3、表4 的原始频数与小数位是否与发表版本一致
  • 在 PubPeer 上提出关于末位数字分布、SD 格式与 P 值聚集的统计学质疑
  • 向期刊编辑部(《南方医科大学学报》)提交正式的统计学审查请求
  • 申请由第三方对原始数据库(http://www.fgiddata.com)进行独立复核
  • 重点核查表4 各行实际分母——是否所有行都来自 273 例 HRM 子集,还是部分行仅来自 231 例 MII-pH 子集
  • 建议作者在勘误中补充"多重比较校正说明"与"数值精度说明"

⚠️ 免责声明

本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。


🧮 证据合成(自动生成)

  • 综合后验概率:≥99.9%(先验 5%)
  • 95% 可信区间:[99.7%, 100%]
  • 贝叶斯因子:BF = 1.06e+5(决定性(decisive))
  • 综合评级:🔴 高度疑似
  • 复核已排除线索:2 条(良性解释成立 / 检验前提不满足 / 说明性条目,未计入合成)

贡献最高的证据

  1. [S4] SD 小数位数完全一致(stats/sd_pattern,logLR=2.26)— 贡献 23.2%
  2. [C1] 横断面比较研究,声明合并 HH 的 NERD 患者反流事件更多且动力更差。(causal/causal,logLR=1.79)— 贡献 17.8%
  3. [S5] Bayes Factor = 29:1,SD 相等的可能性极低(stats/savage_dickey_bf,logLR=2.26)— 贡献 17.2%
  4. [S1] 疑似 p-hacking(5/14 集中在 0.04-0.05)(stats/p_curve,logLR=1.79)— 贡献 14.8%
  5. [S3] 末位数字多重异常:末位分布严重不均匀(χ²=24.9, p=0.0031);奇偶比轻微失衡(107/180=0.59, p=0.0137)(stats/last_digit,logLR=1.31)— 贡献 9.3%

免责:本小节由程序化贝叶斯合成自动生成,不构成学术不端判决。先验固定 5%,证据间按条件独立处理(可能高估相关证据的联合强度),LR 版本 geng_lr_v3(Phase 5 基准回归校准:任务级触发率比值+复核处置标签,n=11,向 v2 收缩 k=10);可信区间与点估计来自同一后验(先验抽样 + LR 噪声的联合蒙特卡洛,区间随证据强度收敛)。请以正文具体发现与原始数据为准。