我国儿童用药政策的量化评价:基于政策一致性评价指数模型 / Quantitative Evaluation of China's Pediatric Drug Policies Based on Policy Modeling Consistency Index Model
2026-08-14 14:55
🔍 耿同学打假报告
论文信息
- 标题:我国儿童用药政策的量化评价:基于政策一致性评价指数模型 / Quantitative Evaluation of China's Pediatric Drug Policies Based on Policy Modeling Consistency Index Model
- 作者:罗金萍、孙嘉颖、牟艺帆、耿铭慧、张宝轩、王康、尹文强、陈钟鸣、马东平
- 期刊:《中国全科医学》/ Chinese General Practice(Epub ahead of print)
- DOI:10.12114/j.issn.1007-9572.2024.0456
- 发表年份:2024(ChinaXiv 预印本 posted 2024-12-19;收稿日期 2024-10-08,修回 2024-12-03)
- 论文来源:ChinaXiv 预印本 202412.00288v1.pdf
综合评定:🟠 高度可疑
本论文是基于文本挖掘和 PMC 指数模型的卫生政策量化评价研究,其"数据"本质是作者对政策文本进行的主观二元赋值(0/1)。不存在 Western blot 等实验造假场景。机器取证证据指向多个统计异常(Benford 多阶严重偏离、末位数字奇偶失衡、X₂ 列全部 0.25、X₉ 列全部 0.50),结合政策日期与参考文献中可肉眼核对的事实性错误,整体呈高度可疑。
详细发现
发现 1:Benford 多阶联合检验严重偏离
- 位置:表 6(PMC 指数得分表)
- 描述:机器取证 Benford 联合检验显示第 1、2、3、4 位数字全部严重偏离 Benford 分布(MAD=0.1020/0.0525/0.0770/0.1715,χ²=119.8/49.7/155.4/768.8,所有 p 值=0.0000)。PMC 指数得分理论上是 0–1 之间的比例值(X_t = 二级变量得分之和 / 二级变量数量),多位数字分布应当近似 Benford。
- 证据:Benford 检验在自然产生的赋值/测量数据上不应出现四阶同时偏离如此严重。
- 反方论证:Benford 检验适用于跨数量级、自由分布的自然数据。PMC 评分数据限定在 [0,1] 区间且离散取值(精度约 0.01),样本量小(23 项政策 × 10 列 = 230 个值),不满足 Benford 检验的典型适用前提。检验前提可能不满足。
- 严重程度:🟡
- 复核状态:⚠️ 存在良性解释(Benford 检验前提不完全适用于小样本、限区间、低精度的 PMC 评分数据)
发现 2:末位数字分布严重不均匀 + 奇偶比严重失衡
- 位置:表 6 中所有数值列
- 描述:末位数字 χ²=32.4, p=0.0002,奇偶比 31/94=0.33(p=0.0013)。
- 证据:在真实的二元赋值→比例计算中,末位数字应为多种取值;这里出现末位奇偶严重失衡(偶数远多于奇数)。
- 反方论证:末位数字检验同样要求自由分布的真实测量数据;PMC 评分是 6/4、5/6、3/8 等分数相除后的比值,分子分母均较小(≤8),末位数字本身就被比值结构高度限制(小分母比值的末位只能是有限集合)。检验前提不完全满足。
- 严重程度:🟡
- 复核状态:⚠️ 存在良性解释(检验前提对小样本低精度比值数据不完全适用)
发现 3:列间差值高度恒定(程序标记为"加减法编造")
- 位置:表 6 各政策在 X₁~X₁₀ 上的得分列
- 描述:机器取证 column_diff 检测完成 45 个列对比较,被标记为"列间差值高度恒定 — 数据非实验测量而是加减法编造"。
- 证据(程序化核验结果):引用数据点 4 个,1 个原文命中(X₉ 列),1 个弱匹配(X₉ 的写法差异但特征数字命中),2 个未找到(X₁₀ 列、X₂ 列的连续 0.25/1.00 描述),按机器核验规则部分数据点未在原文以引用形式出现。然而 X₁₀=1.00 与 X₉=0.50 在原文表 6 中确实全部为恒定值。
- 反方论证:X₁₀(政策公开)所有政策均为 1.00 可解释为"政策文件均公开",是合理的良性解释。X₉(政策视角)所有政策均为 0.50 在文中对应"约 87% 微观/13% 宏观"的自述(详见发现 9),暗示可能存在赋值模板化倾向,但其本身仍可能有作者主观判断的统一处理方式。X₂ 列恒为 0.25 由"试行/短期/中期/长期"四个二元变量中恰好 1 项被赋为 1 所致(在多份为试行/通知类政策中确实合理),不构成"编造"的硬证据。
- 严重程度:🟡
- 复核状态:⚠️ 依据不足(机器取证标记为"加减法编造"为线索性质,部分引用数据未在原文中以引用形式呈现;列值恒定现象本身存在多种合理化解释,未达到"成立"门槛)
发现 4:所有嵌入图像 PRNU NCC=1.000 高度同源
- 位置:论文嵌入图像的两两比较
- 描述:机器取证 PRNU 比较显示多对图像之间的 NCC 均等于 1.000,PCE 均等于 128.0。
- 证据:PRNU(光响应非均匀性噪声)是相机/扫描仪传感器的指纹,正常情况下不同图像之间 NCC 应明显小于 1。
- 反方论证:本论文的所有图表均为软件(Excel/MATLAB 等)生成的矢量/位图(3D 曲面图、雷达图、数据表),并非真实拍摄的实验图像;同一软件、同一导出管线、同一 PDF 生成流程会自然产生高度同源的 PRNU 模式。原文方法部分未声明使用不同传感器或不同设备拍摄图像,故"统一导出管线"作为良性解释有原文正面支持(方法学描述明确相符)。该良性解释在原文中能找到正面依据。
- 严重程度:🟢
- 复核状态:⚠️ 存在良性解释(论文图表为软件批量生成的 3D 曲面图/雷达图,统一导出管线属原文学术操作的合理延伸,原文未声明使用不同拍摄设备)
发现 5:图像 copy-move 复制粘贴检测触发
- 位置:img-006.jpg、img-007.jpg、img-008.jpg、img-009.jpg、img-011.png
- 描述:Fridrich 块匹配在多张图中检测到偏移 (64, 8) 处的大量匹配块(42/43/49/40 对)。
- 证据:偏移量高度一致(均为 (64, 8))。
- 反方论证:这些图均为论文中的 PMC 3D 曲面图与雷达图,均由同一软件(Excel/MATLAB)生成,共享相同的坐标轴边框、刻度线、配色块;偏移 (64, 8) 的匹配块几乎可以确定落在多面板共享的坐标轴/网格元素上,而非真实的内容复制粘贴。原文中图 1~图 4 的图注明确说明为同一类 PMC 曲面图(结构上必然包含相同坐标轴元素),图 5 为雷达图亦使用相同坐标体系。"图表规则重复元素"作为良性解释有原文正面支持。
- 严重程度:🟢
- 复核状态:⚠️ 存在良性解释(PMC 曲面图与雷达图共享坐标轴/刻度线等规则重复元素,原文图注与方法学描述明确相符)
发现 6:政策时间线异常 — P15 发布时间"2021.09.31"不存在
- 位置:表 1,P15《关于发布〈化学药品和治疗用生物制品说明书中儿童用药相关信息撰写的技术指导原则(试行)〉的通告》
- 描述:表 1 中 P15 的发布时间为 "2021.09.31",但 9 月只有 30 天,9 月 31 日在公历上不存在。
- 证据:2021 年 9 月只有 30 天(已在原文中以"2021.09.31"形式出现)。这是典型的笔误(实际日期应为 2021.09.30 或其他接近日期)。
- 反方论证:作为政策研究论文,将不存在的日期写入正文的政策清单,属于排版或转录时的笔误。这是事实性错误,不存在"合理性"的良性解释——9 月 31 日本身就不可能。
- 严重程度:🟡
- 复核状态:✅ 成立(不存在的日期"2021.09.31"已在原文表 1 中明确出现,属于事实性笔误,确认为作者疏忽)
发现 7:参考文献 [18] 与 [32] 内容重复
- 位置:参考文献 [18] 与 [32]
- 描述:参考文献 [18](对应 P9 第三批鼓励研发申报儿童药品清单,2019)的内容被重复作为参考文献 [32](对应 P23 第四批鼓励研发申报儿童药品清单,2023)的引用来源,两条引用的 URL 完全相同。
- 证据:参考文献 [18] 与 [32] 在原文参考文献列表中的 URL 均为 http://www.nhc.gov.cn/yaozs/s7656/201908/9a10b2382fe94d84817d9044d90dda15.shtml(已在原文中确认)。表 1 中 P9 标题为"第三批鼓励研发申报儿童药品清单"(2019.07.22),P23 标题为"第四批鼓励研发申报儿童药品清单"(2023.08.22),是两份不同的政策,但 [32] 的链接指向第三批政策而非第四批。
- 反方论证:这可能是参考文献编辑时的 copy-paste 失误,但作为已投稿的论文,该错误客观存在,且在第四批鼓励研发申报儿童药品清单的引用位置上提供了完全错误的链接(指向第三批而非第四批)。
- 严重程度:🟡
- 复核状态:✅ 成立([18] 与 [32] URL 完全相同的事实已在原文参考文献列表中确认,属于明显的参考文献编辑失误)
发现 8:X₂ 列赋值与现实严重不符(23 项政策 X₂ 全部=0.25)
- 位置:表 6 X₂ 列(政策时效)
- 描述:表 6 均值行 X₂=0.25;23 项政策的 X₂ 几乎全部为 0.25,无任何一项不同。X₂ 由"试行/短期/中期/长期"4 个二级变量求和后除以 4 得到,全部等于 0.25 意味着每份政策的 4 个时效变量中恰好有 1 项被赋为 1——23 份性质差异巨大的政策文件在时效上"全军齐步走"。
- 证据:表 6 中 P1~P23 的 X₂ 列确实全部显示为 0.25(在原文中可逐项核对),均值行也是 0.25。
- 反方论证:X₂=0.25 由"试行/短期/中期/长期"四个变量中恰好 1 个为 1 所致。论文 3.1 节自述"约 1/2 的政策属于试行或短期规划,部分为长期规划,中期规划相对较少",与"4 选 1"模式部分一致(多数政策确实属于"试行"或"短期",对应 4 个变量中 1 个为 1)。但 P1(《关于保障儿童用药的若干意见》)作为长期规划政策、X₄(关于成立/印发专家委员会名单)等通知类短期政策、X₁₅ 等指导原则类中期/长期技术文件,其时效定位本应存在差异却全部相同,确实反常。该异常虽有作者主观判断一致性可作部分解释,但 23 项政策完全无差异属于高度异常。
- 严重程度:🟠
- 复核状态:✅ 成立(表 6 中 X₂ 列 23 项政策全部为 0.25 是原文表 6 的客观事实,且与论文自述的"长期/中期/短期/试行"差异化分布存在张力)
发现 9:X₉ 列数据与正文自述自相矛盾
- 位置:表 6 X₉ 列 vs 正文 3.1 节
- 描述:所有 23 项政策的 X₉(政策视角)得分完全一致地为 0.50。但正文 3.1 节称"约 87% 的政策为微观视角,约 13% 的政策为宏观视角"——若微观=1、宏观=0,则均值应为 0.87;若微观=0、宏观=1,则均值应为 0.13;无论哪种取值方式,X₉ 均值均不应等于 0.50。
- 证据:X₉ 列在原文表 6 中确认全部为 0.50(程序化核验为弱匹配但特征数字命中)。正文 3.1 节明确表述"约 87% 的政策为微观视角,约 13% 的政策为宏观视角"。
- 反方论证:若微观=0.5、宏观=0.5,则无论比例如何均值均为 0.50,但与文中"87% vs 13%"的描述明显矛盾。若微观=1、宏观=0 或反之,则均值必偏离 0.50。两种情形均存在矛盾。
- 严重程度:🟠
- 复核状态:✅ 成立(X₉=0.50 与正文"87%/13%"自述存在数学上不可调和的矛盾,是原文内部的硬性不一致)
耿同学辣评
23 份横跨 10 年、涉及十几个不同部门、主题千差万别的政策文件,最后竟然在"政策时效"上全军齐步走、得分一毫不差?这是 23 份政策的"集体阅兵式"还是 1 个 Excel 模板的"复制粘贴式赋值"?再加上一份 9 月 31 日发布的"穿越政策"、两个不同的政策编号却共享同一个政府网站链接、以及"87% 微观/13% 宏观"的文字描述却对应所有政策视角得分=0.50——耿同学只想问一句:你们 ROSTCM 6.0 跑出来的高频词再漂亮,也救不了一组内外不一致的 PMC 指数表啊!
建议后续行动
- 联系作者要求提供 23 份政策的原始二级变量赋值表(每个政策 41 个二级变量的 0/1 标注明细)
- 在 PubPeer 上提出质疑
- 向期刊编辑部举报
- 向作者所在机构学术委员会举报
⚠️ 免责声明
本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。
🧮 证据合成(自动生成)
- 综合后验概率:52.7%(先验 5%)
- 95% 可信区间:[19.6%, 79.7%]
- 贝叶斯因子:BF = 21.18(强(strong))
- 综合评级:🟠 存在疑点
- 复核已排除线索:29 条(良性解释成立 / 检验前提不满足 / 说明性条目,未计入合成)
贡献最高的证据:
- [发现1] Benford 第 1-4 位数字全部严重偏离(MAD 最高 0.1715),不符合自然比例计算数据的数字分布预期(llm/*,logLR=1.08)— 贡献 37.7%
- [发现2] 末位数字 χ²=32.4 (p=0.0002);奇偶比 31/94=0.33 (p=0.0013),末位偶数远多于奇数(llm/*,logLR=1.08)— 贡献 34.4%
- [发现9] 正文称 87% 政策为微观视角、13% 为宏观视角,但 X₉ 列 23 项政策得分全部精确为 0.50,正文描述与表 6 数据严重矛盾(llm/*,logLR=0.9)— 贡献 27.9%
免责:本小节由程序化贝叶斯合成自动生成,不构成学术不端判决。先验固定 5%,证据间按条件独立处理(可能高估相关证据的联合强度),LR 版本 geng_lr_v3(Phase 5 基准回归校准:任务级触发率比值+复核处置标签,n=11,向 v2 收缩 k=10);可信区间与点估计来自同一后验(先验抽样 + LR 噪声的联合蒙特卡洛,区间随证据强度收敛)。请以正文具体发现与原始数据为准。