Loading...
正在加载...
请稍候

统计学习和感觉-运动联结:婴儿语音感知的双重路径 / Statistical Learning and Sensorimotor Coupling: Dual Pathways Underlying Infant Speech Perception

2026-08-09 10:53

🔍 耿同学打假报告

论文信息

  • 标题:统计学习和感觉-运动联结:婴儿语音感知的双重路径 / Statistical Learning and Sensorimotor Coupling: Dual Pathways Underlying Infant Speech Perception
  • 作者:肖容, 梁丹丹(南京师范大学文学院)
  • 期刊:ChinaXiv 预印本
  • DOI:未提供
  • 发表年份:2026(预印本 posted 2026-08-06)
  • 论文来源:202608.00003v1.pdf
  • 伦理审批号:NNU2023060022
  • 基金:国家社会科学基金重点项目 22AYY013

综合评定:🟡 存疑

本论文为婴儿语音感知的行为实验研究(2×2×2 设计 × 2 个实验),主要疑点集中在方法学层面与摘要措辞层面——关键三阶交互仅达边缘显著(p=0.055)却被摘要描述为"significantly",且被试年龄范围跨越 8 月龄/ɖ/-/d̪/感知调谐下降的关键窗口。程序化图像取证信号(copy-move、噪声方差)受良性解释(统一导出、规则重复元素)影响较大,且原文未提供图像内容描述以排除良性解释;统计取证(Benford/末位数字)在婴儿注视时间这类受测量精度约束的数据上适用前提不完全满足。以下逐条汇报。

详细发现

发现 1:实验 2 关键三阶交互仅达边缘显著(p=0.055),与摘要/讨论中的"结论性"陈述不匹配

  • 位置:实验 2 结果部分、表 8、讨论 4.1、英文摘要
  • 描述:实验 2 的核心结果——"允许运动组在辅音条件下呈现交替优势,而运动抑制组未呈现相应模式"——依据的是试次类型×组别×刺激类型三阶交互,F(1,554.00)=3.71, p=0.055(边缘显著),b=−0.27, SE=0.14, 95%CI [−0.55, 0.01](CI 包含 0)。论文中文摘要明确表述"允许运动组在辅音条件下呈现交替优势",英文摘要表述 "infants demonstrated significantly longer looking times to alternating speech streams"(用了"significantly")。但实际主分析 p=0.055,仅简单效应的简单-简单比较 p=0.005(允许运动组辅音条件下交替 vs 相同),属于多重比较校正后的局部显著。
  • 证据:摘要用"significantly"描述了实际仅为边缘显著的高阶交互模式,夸大结论强度。同时论文讨论中也坦承"关键三阶交互仅达到边缘显著水平,因此该结果更适合被视为趋势性证据"。摘要/讨论之间存在不一致。
  • 严重程度:🟡
  • 复核状态:✅ 成立

发现 2:被试年龄范围跨越 8 月龄/ɖ/-/d̪/感知调谐下降窗口

  • 位置:实验 2 被试信息;实验 1 被试信息
  • 描述:允许运动组月龄范围 7m23d8m30d(均值 8.15 个月),最大值 8 个月 30 天接近 9 个月。抑制运动组 7m29d8m19d(均值 8.14 个月)。实验 1 也存在类似情况:单峰组 7m30d8m22d(均值 8.13),双峰组 7m24d8m23d(均值 8.16)。论文声称选择 8 月龄"该月龄处于/ɖ/-/d̪/感知调谐的关键窗口内",但样本实际年龄跨度最大超过 1 个月,且最大值已接近论文引用的 6~10 月龄调谐下降的边界(Werker & Tees, 1984),可能引入额外的年龄混淆。
  • 证据:原文实验 1 被试部分"单峰接触组的月龄范围为7个月30天至8个月22天(M=8.13个月),双峰接触组为7个月24天至8个月23天(M=8.16个月)";实验 2 被试部分"抑制口腔运动组月龄范围为7个月29天至8个月19天(M=8.14个月),允许口腔运动组为7个月23天至8个月30天(M=8.15个月)";论文引言部分"6个月婴儿仍能区分/ɖ/-/d̪/,而10个月后其敏感性显著下降"。
  • 严重程度:🟡
  • 复核状态:✅ 成立

发现 3:测试阶段时长与试次数学不自洽

  • 位置:实验 1、实验 2 程序描述
  • 描述:实验 1 测试阶段每个试次时长 10 秒,共 16 个试次,纯刺激时长 160 秒(≈2.7 分钟),论文声称"测试总时长平均约为 10 分钟"。实验 2 测试阶段"实验总时长约 10 分钟",同样 16 个试次 × 10 秒。两个实验测试阶段设计相同,16 试次 × 10 秒 = 160 秒纯刺激,加上注视定位、试次间隔、组块间休息、校准等流程可推高到 5~8 分钟,但声称的"约 10 分钟"明显偏长。
  • 反方论证:眼动实验包含大量校准、注视吸引、被试调整时间,加上注视定位、试次间隔、组块间休息、校准等流程,10 分钟属合理范围。论文中并未精确说明"测试总时长"是仅指纯刺激播放时间还是包含全部流程时间,存在术语解释空间。
  • 严重程度:🟡
  • 复核状态:⚠️ 存在良性解释(眼动实验含校准/注视定位/被试调整等大量额外流程,10 分钟为合理上限)

发现 4:统计学习方法学的多重比较与 p-hacking 风险

  • 位置:实验 1 简单效应分析(结果 2.2)、表 3
  • 描述:实验 1 中先做三阶交互的简单-简单效应分解,再做"在双峰组-交替试次中"的前后半段定向比较("先验假设的定向探索性比较"),并采用 Bonferroni 校正。结果中出现了多个 p 值落在 0.04~0.05 附近(如试次类型×组别×刺激类型三阶交互 p=0.043、试次类型×刺激类型 p=0.044、组别×刺激类型 p=0.049),刚好越过显著性门槛。
  • 反方论证:论文已明确采用 Bonferroni 法进行多重比较校正,多个 * 级别 p 值挤在临界点附近属于正常的统计波动范围,不必然表明 p-hacking。论文在方法部分也声明了效应量假设(f=0.15~0.20)和先验效能分析,样本量设计有理论依据。
  • 证据:原文表 3 显示:试次类型×刺激类型 p=0.044,组别×刺激类型 p=0.049,三阶交互 p=0.043;表 8 显示实验 2 三阶交互 p=0.055(边缘显著)。原文方法部分声明:"显著性检验由lmerTest包基于Satterthwaite自由度近似提供……采用Bonferroni法进行多重比较校正。"
  • 严重程度:🟡
  • 复核状态:⚠️ 存在良性解释(已使用 Bonferroni 校正,p 值临界聚集属正常统计波动)

耿同学辣评

这篇论文听上去很"心理语言学正规军"——80 名 8 月龄婴儿、Tobii 眼动仪、lme4 混合效应模型、Bonferroni 校正——包装很到位。但复核后耿同学发现,真正站得住脚的疑点集中在方法学与措辞一致性上。

第一,实验 2 的关键三阶交互 p=0.055(95% CI 包含 0),英文摘要却用"significantly"描述,属于典型的"摘要放大"操作。讨论里老实承认是"趋势性证据",摘要里却升格为结论强度——这种前后不一致在任何期刊审稿中都会被要求修改。

第二,被试年龄范围最大值 8 个月 30 天(允许运动组),跨入了论文自己引用的调谐下降窗口("10个月后其敏感性显著下降"),存在年龄混淆的设计缺陷。

不过耿同学也得说句公道话:程序化图像取证虽然抓到了若干 copy-move 匹配块,但论文中只有图 1~图 8 的 caption 而没有可供人工审查的图像内容,且语谱图/统计图本身就是规则重复元素密集的图类(坐标轴刻度、多面板边框),单独的水平偏移匹配块不足以定罪。Benford 检验在婴儿注视时间这类受 Tobii 采样精度(20ms)约束的数据上不满足"自由取值"的适用前提,因此统计取证信号也无法直接采纳。

建议后续行动

  • 联系作者要求提供每个被试各试次的原始注视时间数据,验证表 1、表 6 中描述性统计的真实性
  • 对实验 2 的三阶交互(p=0.055)要求作者报告主效应模型的所有简单效应表(含 CI),核查摘要"significantly"的措辞依据
  • 要求作者公开样本排除标准与每个被试的精确月龄分布,核查 7.5~9 月龄跨度对/ɖ/-/d̪/感知调谐窗口的潜在影响
  • 要求作者说明"测试总时长约 10 分钟"的具体计算方式(纯刺激播放 vs. 含流程),并提供各被试的实际测试时长分布

⚠️ 免责声明

本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。