Loading...
正在加载...
请稍候

中国生育恐惧情绪与出生率之间的关系——基于2010-2022年微博面板数据分析

2026-08-30 13:19

🔍 耿同学打假报告

论文信息

  • 标题:中国生育恐惧情绪与出生率之间的关系——基于2010-2022年微博面板数据分析
  • 作者:陆家偲、朱廷劭(中国科学院心理研究所 / 中国科学院大学心理学系)
  • 期刊:ChinaXiv 预印本(未经同行评审)
  • DOI:ChinaXiv:202410.00159v1
  • 发表年份:2024-10-29

综合评定:🟠 高度可疑

详细发现

发现 1:相关矩阵正文与表格数值直接矛盾

  • 位置:3.3.1 描述性统计 / 表9(Page 13)
  • 描述:正文声称“个体主义与生育恐惧词频显著正相关(r=0.73,p<0.01)”,但表9中“个体主义”与“恐育词频”交叉格显示为 -0.44**,是显著相关。正文的 0.73 恰好与次模型表11中“个体主义(对数化)β=0.73”完全相同,疑似把回归系数误写入相关矩阵描述,或数据经修改后正文未同步更新。
  • 证据:同一数值 0.73 在正文描述与表11回归系数中重复出现,而与表9对应位置(-0.44)完全冲突;正文还同时声称“集体主义在两个模型中的影响均不显著”,但表9显示集体主义与次年出生率相关 0.36**、与个体主义相关 0.81**,均为 p<0.01 的显著结果,正文与表格再次矛盾。
  • 严重程度:🔴
  • 复核状态:✅ 成立(正文 r=0.73 与表9的 -0.44**、表11的 β=0.73 均经原文逐字核验命中,矛盾确凿)

发现 2:回归表格符号与显著性标注自相矛盾

  • 位置:表10、表11(Page 13-14)
  • 描述:表10中“个体主义(对数化)”β=0.21(正),但 t 值为 -0.75(负),且未标显著性——系数为正而 t 统计量为负在数学上不可能(除非有未披露的约束)。“集体主义”β=-0.17(负)但 t=1.51(正),同样方向相反。表11中“集体主义(对数化)”β=0.26、标准误 0.43、t=0.61,正文明确写“集体主义对生育恐惧的影响不显著(β=0.26,p=0.61)”,但表中该行却标了 (p<0.01)——p=0.61 与双星标注直接冲突。
  • 证据:“个体主义(对数化) 0.21 0.14 -0.75”;“集体主义(对数化) -0.17 0.24 1.51”;“集体主义(对数化) 0.26 0.43 0.61 **”;三处均无法通过“β 与 t 同号、显著性标注与 t 值一致”的基本校验,强烈提示表格数值系手工拼凑或复制错行。
  • 严重程度:🔴
  • 复核状态:✅ 成立(三处引用数据点均经原文逐字核验命中;β 与 t 反号、p=0.61 配双星为硬性矛盾,无任何良性解释可在原文中找到依据)

发现 3:样本量 N 与声称的时间范围不匹配

  • 位置:3.3.3 次模型 / 表11脚注(Page 14)
  • 描述:次模型被解释变量为“31个省级行政区2013年至2022年的生育恐惧词频”,共 10 年,31×10=310。表11脚注却写“a)N=372”。372=31×12,对应 12 年数据,与正文声明的 2013-2022 年(10 年)不符,且第2.1.2节还声称数据库包含“2010年至2023年”数据,时间口径全篇混乱(摘要 2010-2022、表5/6为13年、主模型10年、次模型却冒出372)。
  • 证据:“得出31个省级行政区2013年至2022年的生育恐惧量化指标” vs “a)N=372”。
  • 严重程度:🟠
  • 复核状态:✅ 成立(两处原文表述均核验命中,N=372 与 31×10=310 无法调和,原文无任何解释)

发现 4:表7脚注样本量前后矛盾

  • 位置:表7及续表脚注(Page 9)
  • 描述:表7脚注称“N=11”,但表中“全国(N=334)”(334≈31×10.8)与“北京(N=8)”“广东(N=7)”并存,若部分地区仅7-8年数据,何以脚注统称 N=11?同一表内三种不同的 N 且无解释。
  • 证据:“北京(N=8)”“广东(N=7)”“全国(N=334)”“a)绝对值大的相关系数用粗体表示;N=11”。
  • 严重程度:🟠
  • 复核状态:✅ 成立(四处数据点均核验命中;同表内 N=7、N=8、N=334、N=11 并存且无说明,属明确的报告不一致)

发现 5:混淆矩阵召回率仅 0.397,与“证明词典有效性”结论逻辑矛盾

  • 位置:表4及 2.2 结果(Page 6)
  • 描述:TP=31, FN=47, FP=8, TN=964。Precision=31/39≈0.795、Recall=31/78≈0.397 计算无误,但召回率不足 40% 意味着词典漏判约 60% 的真实恐育文本,且样本极度不平衡(正例78 vs 负例972)未做任何讨论。以此“证明了词典的有效性”属结论与数据脱节;整篇核心自变量(恐育词频)的测量效度建立在这样一个性能不佳的分类器上,动摇后续所有回归结果。
  • 证据:“召回率(Recall)为0.397,F1分数(F1Score)为0.53,证明了词典的有效性”;“实际正例 31(TP) 47(FN) 78”。
  • 严重程度:🟠
  • 复核状态:✅ 成立(混淆矩阵各数值经核验命中且计算自洽,问题不在计算而在“漏判60%仍宣称有效”的论证脱节,属结论与数据矛盾)

⚠️ 发现 6:表7中部分地区相关系数高得反常

  • 位置:表7(Page 8-9)
  • 描述:黑龙江(-0.94**, -0.95**)、新疆(-0.96**, -0.93**)、河北(-0.89**, -0.74**)等地区,在仅约 10 余个时间点的宏观序列上,恐育词频与出生率相关绝对值超过 0.9。真实社会宏观数据受疫情(2020-2022出生率断崖)等多重冲击,如此高的线性相关更可能是序列整体趋势共线(恐育词频单调上升、出生率单调下降导致的虚假相关)。此发现提示可能为方法学缺陷(未去趋势)而非数据造假,需原始数据进一步确认。
  • 证据:“黑龙江 -0.94** -0.95**”“新疆 -0.96** -0.93**”。
  • 严重程度:🟡
  • 复核状态:⚠️ 存在良性解释(两个单调趋势序列可天然产生高相关,属可能的虚假相关/方法学问题,原文引用数值属实但不构成造假证据)

发现 7(已删除)

原“机器取证显示数值分布多重统计异常”一条,因所引用的关键数据点(“末位分布严重不均匀 χ²=28.6, p=0.0008”“列间差值高度恒定——10个列对比较完成”)经程序化核验未在原文中找到且不构成原文内容,按复核规则删除。相关统计检验线索已在复核中另行评估:Benford/末位检验在本论文数据(取值限于[-1,1]的相关系数、10⁻⁶量级的词频统计量)上适用前提不满足;“列间差值恒定”所比较的列(表5/6的 M、SD、最大值、最小值)为同一底层序列的汇总统计量,差值稳定可由数据自身结构产生,检验前提不满足。均不作为有效证据。

发现 8:正文交叉引用错误与选择性报告

  • 位置:Page 10 / 表8
  • 描述:正文写“如表12所示”,全文并无表12(实为表8),稿件粗糙可见。表8中 2020 年相关系数为 +0.12(方向与全文“负向预测”结论相反),2021年又回到 -0.49**,作者仅以政策年份解释显著负相关的年份(2013、2015、2021),对方向反转的2020年未做任何讨论,存在选择性叙事的嫌疑(疫情年份出生率异常波动很可能破坏词频-出生率关系)。
  • 证据:“如表12所示”;“2020 0.12”。
  • 严重程度:🟡
  • 复核状态:✅ 成立(“如表12所示”与“2020 0.12”两处均经核验命中,表12确实不存在,2020年正相关的选择性未讨论属实)

耿同学辣评

一篇教别人“如何科学地恐惧生育”的论文,先让自己的数据吓坏了审稿人:正文说正相关,表格偏偏是负相关;β 是正的,t 值是负的;p=0.61 头上顶着两颗星;样本量一会儿 310 一会儿 372,表号从表8跳票成表12——这张回归表怕不是用掷骰子填的。词典召回率不到四成就敢喊“证明了有效性”,靠的怕不是词典,是信心。六处硬性数值矛盾叠加,要么是极端草率,要么是数据经过事后改动而正文未同步——无论哪种,都需要作者拿出 Stata 日志和原始词频矩阵自证清白。

建议后续行动

  • 联系作者要求提供原始数据(微博词频原始矩阵、Stata 回归日志、混淆矩阵原始评分记录),重点核查表9/10/11的数值矛盾
  • 在 PubPeer / ChinaXiv 评论区提出质询(正文-表格矛盾为最优先核查项)
  • 若该稿后续投稿发表,向期刊编辑部举报数值不一致问题
  • 向作者所在机构学术委员会反映(若作者无法提供原始分析输出)

⚠️ 免责声明

本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。


🧮 证据合成(自动生成)

  • 综合后验概率:99.9%(先验 5%)
  • 95% 可信区间:[99%, 100%]
  • 贝叶斯因子:BF = 2.44e+4(决定性(decisive))
  • 综合评级:🔴 高度疑似
  • 复核已排除线索:5 条(良性解释成立 / 检验前提不满足 / 说明性条目,未计入合成)

贡献最高的证据

  1. [发现3] 次模型声明使用2013-2022年(10年)数据,31×10=310,但表11脚注N=372(对应12年),全篇时间口径混乱。(llm/*,logLR=1.59)— 贡献 18.5%
  2. [发现5] 词典召回率仅0.397(漏判约60%恐育文本),样本极度不平衡(78 vs 972),却据此宣称词典有效,作为全文核心自变量的测量效度存疑。(llm/*,logLR=1.59)— 贡献 17.9%
  3. [发现1] 正文称个体主义与恐育词频正相关r=0.73,表9却为-0.44**;正文称集体主义两模型均不显著,表9却为0.36**、0.81**显著。(llm/*,logLR=1.59)— 贡献 15.1%
  4. [发现2] 表10两行β与t值符号相反;表11集体主义t=0.61(不显著)却标注p<0.01双星,与正文p=0.61冲突。(llm/*,logLR=1.59)— 贡献 13.9%
  5. [发现4] 同一表内出现N=8、N=7、N=334、N=11四种样本量且无解释,数据完整性说明不一致。(llm/*,logLR=1.59)— 贡献 13.4%

免责:本小节由程序化贝叶斯合成自动生成,不构成学术不端判决。先验固定 5%,证据间按条件独立处理(可能高估相关证据的联合强度),LR 版本 geng_lr_v3(Phase 5 基准回归校准:任务级触发率比值+复核处置标签,n=11,向 v2 收缩 k=10);可信区间与点估计来自同一后验(先验抽样 + LR 噪声的联合蒙特卡洛,区间随证据强度收敛)。请以正文具体发现与原始数据为准。