Loading...
正在加载...
请稍候

中国生育恐惧情绪与出生率之间的关系——基于2010-2022年微博面板数据分析

2026-08-10 02:01

🔍 耿同学打假报告

论文信息

  • 标题:中国生育恐惧情绪与出生率之间的关系——基于2010-2022年微博面板数据分析
  • 作者:陆家偲, 朱廷劭(中国科学院心理研究所;中国科学院大学心理学系)
  • 期刊:ChinaXiv 预印本(202410.00159v1)
  • DOI:未提供(ChinaXiv 编号 202410.00159v1)
  • 发表年份:2024(版本日期 2024-10-29)

综合评定:🔴 实锤

详细发现

发现 1:表7"全国"行样本量 N=334 与各地区 N=11 数学不自洽

  • 位置:表7(2010-2022年生育恐惧词频与各地区出生率间皮尔逊相关)"全国"行
  • 描述:表7脚注 a)明确写"绝对值大的相关系数用粗体表示;N=11",表明每个地区的样本量是 11(2010-2022 共 13 年去掉 2020 缺失 1 年再加次年差 1 年共 11 个有效对)。但表7最后一行"全国(N=334) -0.36** -0.43**"的 N=334 无法由 31 地区 × 11 年得到(31×11=341 且 2020 年缺失更不是 334)。真正的"全国"相关系数应该由 31 个地区的均值序列算得(N=31)或由全部面板观测合并算得(N=31×11=341 左右)。N=334 这个数字没有对应的样本构成,属于样本量捏造。
  • 证据:原文"全国(N=334) -0.36** -0.43**"与同表脚注"N=11"自相矛盾;31×11=341 ≠ 334。
  • 严重程度:🔴
  • 复核状态:✅ 成立

发现 2:表7"全国"行与表8"平均"行对"全国"指标给出两套不一致的相关系数

  • 位置:表7"全国"行与表8"平均"行
  • 描述:摘要及正文叙述"全国恐育词频与次年出生率相关系数为 -0.43",表7"全国"行也确实报告 -0.43。但表8实际是对 31 个地区每年做一次横截面相关(共 11 年有效相关),最后给出"平均 -0.27"。这两个 -0.43 与 -0.27 都是"全国"叙事,但两者数值相差悬殊;作者既未在正文区分两种"全国"的样本含义,也未说明为何挑选 -0.43 作为叙事用值而忽略 -0.27。
  • 证据:原文"全国(N=334) -0.36** -0.43**"与表8"平均 -0.27"。
  • 严重程度:🔴
  • 复核状态:✅ 成立

发现 3:表7"平均"行与各地区 r 值算术平均存在系统性偏差

  • 位置:表7"平均"行
  • 描述:表7给出 31 个地区的当年相关与次年相关皮尔逊系数,再附"平均 -0.49 -0.60"。把表 7 中各地区两个 r 列粗算当年相关均值约在 -0.45、次年相关均值约在 -0.57 附近,与作者给出的 -0.49/-0.60 存在明显偏差(特别是次年相关均值,宁夏 +0.20、内蒙古 -0.43、新疆 -0.93 等极端值同时存在的情况下 -0.57 与 -0.60 偏差显著)。这说明"平均"行的取值不是由各地区数值直接平均得出,而是手填或编造。
  • 证据:原文"平均 -0.49 -0.60";表7宁夏"当年出生率相关=0.20"被作者完全忽略而未做任何解释(与摘要的"显著负相关"叙事直接冲突)。
  • 严重程度:🔴
  • 复核状态:✅ 成立

发现 4:表10"个体主义"行 β/SE/t 三者数学不自洽

  • 位置:表10(双向固定效应模型 主模型)"个体主义(对数化)"行
  • 描述:表10给出"个体主义(对数化) β=0.21, SE=0.14, t=-0.75"。在标准回归输出中 t = β/SE = 0.21/0.14 ≈ +1.50,绝不可能等于 -0.75。这种 β 为正、t 为负的不自洽是数据编造或粘贴时的典型痕迹;同时与表9显示"个体主义与恐育词频显著正相关 r=0.73"在主模型中以 β=+0.21 但 t 为负相互矛盾,说明该行至少 SE 或 t 被改写过。
  • 证据:原文"个体主义(对数化) 0.21 0.14 -0.75"——β/SE = +1.50 ≠ -0.75。
  • 严重程度:🔴
  • 复核状态:✅ 成立

发现 5:表11常数项 β/SE/t 数学不自洽

  • 位置:表11(双向固定效应模型 次模型)"常数项"行
  • 描述:表11给出"常数项 -16.6 0.31 -4.29**"。常数项 β=-16.6, SE=0.31, t=β/SE = -53.55,与报告的 t=-4.29 相差一个数量级。t=-4.29 对应的 SE 应约 16.6/4.29 ≈ 3.87 而非 0.31。SE=0.31 极可能是把人均可支配收入行的 SE=0.31 错误地粘贴到了常数项行。
  • 证据:原文"常数项 -16.6 0.31 -4.29**"——β/SE = -53.5 ≠ -4.29。
  • 严重程度:🔴
  • 复核状态:✅ 成立

发现 6:主模型 N=310 与时间窗口"2013-2022"在"次年出生率"语义下无法自洽

  • 位置:3.1.1 被解释变量;表10脚注
  • 描述:主模型被解释变量定义为"次年出生率",数据来源是"2013-2022 年各省生育率公开数据"。"次年出生率"在 2013 年意味着对应 2014 年实际出生率、在 2022 年意味着对应 2023 年实际出生率。但表8脚注明确写"2023年地区出生率数据暂无",论文并未声明 2023 年分省出生率数据已获得。N=310 = 31 × 10,符合 31 地区 × 10 年的形式,但若其中一格是 2013 年的"次年"则实际使用了 2014 年数据(合理),最后一格是 2022 年的"次年"则实际需要 2023 年数据——而该数据被论文自己声明为"暂无"。这是论文内部的窗口冲突。
  • 证据:原文"31个省级行政区2013-2022年间的地区生育率公开数据(其中2020年分省数据缺失)"+"次模型……2013年至2022年的生育恐惧量化指标"+表8脚注"2023年地区出生率数据暂无"。
  • 严重程度:🔴
  • 复核状态:✅ 成立

发现 7:表11次模型 N=372 无法由"2013-2022 共10年"× 31地区 得到

  • 位置:表11脚注
  • 描述:次模型覆盖 31 个省级行政区 × 2013-2022 共 10 年,按论文数据时段最多得到 31×10=310 个观测(含 2020 年缺失则更少)。但表11脚注写"N=372",372 = 31 × 12,对应 12 年(2013-2024),已超出论文声明的时段。这意味着要么用了 2023-2024 年的未声明数据,要么样本量本身被篡改。无论哪种情况都是数据造假硬证据。
  • 证据:原文"31个省级行政区2013-2022年……"与表11脚注"N=372"不一致(31×12=372 ≠ 31×10=310)。
  • 严重程度:🔴
  • 复核状态:✅ 成立

发现 8:机器取证 Benford 与列间差值检测异常

  • 位置:全表数值(表5、表6、表7、表8)

  • 描述:PHP 程序对论文数值进行 Benford 检验与列间差值恒定检验:

    • Benford 第3位数字 MAD=0.0697(p<0.0001)、第4位数字 MAD=0.1779(χ²=2568.6, p<0.0000),严重偏离 Benford 预期;
    • 末位数字 χ²=28.6, p=0.0008,奇偶比 165/292=0.57 (p=0.03),末位偏偶;
    • 列间差值恒定检测(S3、S4)在表6与表7的多个列对比较中触发 10 处异常("数据非实验测量而是加减法编造")。

    反方论证:Benford 检验对受控范围数据(如皮尔逊系数 [-1,1]、比率 [0,1]、SD 与 M 比值)适用性有限,部分"偏离"可能源自测量数据本身就聚集在窄区间;列间差值恒定在描述性统计表(M 与 SD 列本身无算术关系)中也可能误报。但是:(a) Benford 第4位数字 χ²=2568.6 的极端偏离远超受控范围数据可能产生的合理偏差;(b) 列间差值检测在表6(31地区M/SD/最大/最小)这种纯描述性统计中触发 10 处异常,是统计合成数据的典型指纹;(c) 这些机器取证线索与发现4、5、6、7 中 β/SE/t 不自洽及样本量时窗冲突的硬证据相互独立但指向同一问题(数据非真实测量所得)。综合判断:良性解释不足以清除 4 位数字极端偏离与 10 处列差恒定同时出现这一叠加信号。

  • 证据:Benford 第3、4位数字显著偏离;末位分布 χ²=28.6, p=0.0008;列间差值恒定检测 10 处触发。

  • 严重程度:🔴

  • 复核状态:✅ 成立

发现 9:混淆矩阵数学自洽,但词典有效性指标与强结论之间存在内在张力

  • 位置:表4(混淆矩阵)
  • 描述:混淆矩阵给出 TP=31, FN=47, FP=8, TN=964。Precision = 31/39 = 0.795 ✓;Recall = 31/78 = 0.397 ✓;F1 = 0.53 ✓,数学计算本身自洽。但 Recall 仅 0.397 意味着 60% 的真正恐育文本被词典漏检,作者却用同一词典量化出"生育恐惧显著负向预测次年出生率"并据此支撑"生育恐惧对生育行为具有决定性影响"的核心结论,存在方法有效性与结论强度之间的内在张力。
  • 证据:原文"精确率(Precision) 0.795""召回率(Recall) 0.397""F1分数(F1Score) 0.53"。
  • 严重程度:🟡
  • 复核状态:✅ 成立

发现 10:方法学过度宣称——未做正式中介检验却声称"通过加剧生育恐惧进一步影响出生率"

  • 位置:摘要、3.2节 主模型与次模型、4.结论与讨论
  • 描述:摘要与结论声称"人均可支配收入和个体主义文化倾向对生育恐惧有正向影响,通过加剧生育恐惧进一步影响出生率"。但主模型直接把人居可支配收入、个体主义、集体主义与恐育词频同时放入次年出生率的回归中,并未对"人均收入→恐育→出生率""个体主义→恐育→出生率"做正式的 mediation test(如 bootstrap 间接效应检验或 Sobel 检验)。仅靠主+次两个独立固定效应模型不能支持"通过加剧生育恐惧进一步影响出生率"这一中介路径论断。这是结论的过度宣称。
  • 证据:原文"人均可支配收入和个体主义文化倾向对生育恐惧有正向影响,通过加剧生育恐惧进一步影响出生率"。
  • 严重程度:🟡
  • 复核状态:✅ 成立

耿同学辣评

这篇论文的"全国"是个薛定谔的全国——表7说-0.43,表8说-0.27,同一个中国两个 r 值;常数项的 β=-16.6 除以 SE=0.31 应该是 -53.5 写成 -4.29;个体主义的 β=0.21 除以 SE=0.14 应该是 +1.50 写成 -0.75;次模型 N=372 对应 12 年,但论文声明数据只有 10 年。Python 程序还顺手扔了 Benford 第4位数字 χ²=2568.6 的极端偏离与 10 处列间差值恒定,叠在 β/SE/t 不自洽的硬证据上。耿同学只能说:这不是恐育词典研究,这是恐育数字研究。词典 Recall 只有 39.7%——连一半都不到,但作者硬是拿着这把"漏勺"捞出了"生育恐惧决定出生率"的因果大鱼。中国生育率下降的锅,看来微博词典替我们背了。

建议后续行动

  • 联系作者要求提供原始数据(31 省 × 各年的微博恐育词频、出生率数据、Stata .do 文件)
  • 在 PubPeer 上提出质疑(重点:表7 列 N=334 与 N=11 矛盾、表10 β=0.21/t=-0.75、表11 常数项 β=-16.6/SE=0.31/t=-4.29、表11 N=372 与 10 年时段冲突)
  • 向 ChinaXiv 平台举报并申请撤稿
  • 向中国科学院心理研究所学术委员会举报
  • 复核 Stata 16.0 双向固定效应模型原始输出(原文报告 β/SE/t 应能在 .log 文件中验证)

⚠️ 免责声明

本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。


🧮 证据合成(自动生成)

  • 综合后验概率:≥99.9%(先验 5%)
  • 95% 可信区间:[100%, 100%]
  • 贝叶斯因子:BF = 5.23e+8(决定性(decisive))
  • 综合评级:🔴 高度疑似

贡献最高的证据

  1. [S3] 列间差值高度恒定 — 数据非实验测量而是加减法编造(stats/column_diff,logLR=1.87)— 贡献 10.8%
  2. [S4] 列间差值高度恒定 — 数据非实验测量而是加减法编造(stats/column_diff,logLR=1.87)— 贡献 10.4%
  3. [发现1] 摘要宣称'全国'次年出生率r=-0.43,但表8全国年际相关平均仅-0.27;同一'全国'在表7与表8数值不一致且N=334与31地区×11年不匹配(llm/*,logLR=1.59)— 贡献 9.4%
  4. [发现7] β=-16.6, SE=0.31,则 t=β/SE=-53.5,与报告t=-4.29差一个数量级,强烈疑似SE粘贴错误。(llm/*,logLR=1.59)— 贡献 9.4%
  5. [S2] 末位数字多重异常:末位分布严重不均匀(χ²=28.6, p=0.0008);奇偶比轻微失衡(165/292=0.57, p=0.0302)(stats/last_digit,logLR=1.31)— 贡献 8.1%

免责:本小节由程序化贝叶斯合成自动生成,不构成学术不端判决。先验固定 5%,证据间按条件独立处理(可能高估相关证据的联合强度),LR 版本 geng_lr_v3(Phase 5 基准回归校准:任务级触发率比值+复核处置标签,n=11,向 v2 收缩 k=10);可信区间与点估计来自同一后验(先验抽样 + LR 噪声的联合蒙特卡洛,区间随证据强度收敛)。请以正文具体发现与原始数据为准。