统计学习和感觉-运动联结:婴儿语音感知的双重路径 / Statistical Learning and Sensorimotor Coupling: Dual Pathways Underlying Infant Speech Perception
🔍 耿同学打假报告(复核修正版)
论文信息
- 标题:统计学习和感觉-运动联结:婴儿语音感知的双重路径 / Statistical Learning and Sensorimotor Coupling: Dual Pathways Underlying Infant Speech Perception
- 作者:肖容、梁丹丹
- 期刊:ChinaXiv(预印本)
- DOI:(未提供,预印本编号 202608.00003v1)
- 发表年份:2026(预印本发布于 2026-08-06)
- 论文来源:202608.00003v1.pdf
综合评定:🟡 存疑
评定理由摘要:经逐条复核,机器取证结论(Benford/末位数字/copy-move/噪声方差/PRNU)所引用的具体数值在论文原文中均不存在,其有效性已被反方论证排除或视为适用前提不满足,不计入有效证据。论文文本层面仍存在若干成立或部分成立的疑点:(1)实验 1、实验 2 的被试招募-排除-替补-最终样本的算术逻辑自洽但叙述含混,方法学交代不清;(2)摘要与正文对实验 2 边缘显著(p=0.055)结果呈现确定性陈述;(3)主分析与前/后半段模型结果之间存在方向一致但显著性不一的张力。综合评定为"存疑",建议要求作者提供原始数据与高分辨率图件进一步核查。
详细发现
发现 1:被试流程叙述与最终样本量的算术/逻辑一致性
- 位置:2.1节 被试部分;3.1节 被试部分
- 描述:实验 1 报告"共招募 55 名……因哭闹(n=6)、拒绝注视(n=3)、父母干扰(n=2)、眼动校准失败(n=4),共有 15 名婴儿被排除在分析之外……继续招募新被试进行替补,直至每组样本量满足要求。最终,40 名婴儿被随机分配至单峰接触组和双峰接触组,每组各 20 名"。55 − 15 = 40 与最终 40 名恰好吻合,但文中又提到"继续招募新被试进行替补"。若确实存在替补,初始招募 55 人不足以推导出"最终 40 人"(55 − 15 = 40,没有多余名额给替补)。实验 2 同样存在"共招募 53 名……13 名……最终 40 名"的叙述(53 − 13 = 40),且同样提到"替补"。原文表述模糊,难以判断实际是否发生了替补——若发生替补则算术不自洽,若未发生则"替补"一词不应出现。
- 证据:
- "共招募55名约8月龄的足月婴儿"
- "共有15名婴儿被排除在分析之外"
- "在被试因无效数据被排除后继续招募新被试进行替补,直至每组样本量满足要求"
- "最终,40名婴儿被随机分配至单峰接触组和双峰接触组,每组各20名"
- "本实验共招募53名8月龄婴儿。其中13名……未纳入分析"
- "继续招募新的被试进行替补"
- "最终,共有40名婴儿被随机分配至两种实验条件"
- 严重程度:🟡(方法学交代不清,叙述含混,不构成算术硬伤但需作者澄清)
- 复核状态:✅ 成立
发现 2:摘要"80 名"总样本与两个独立实验的对应关系模糊
- 位置:摘要 vs 2.1节、3.1节
- 描述:摘要声称"以汉语环境中的 80 名 8 月龄婴儿为被试",两个实验方法节各自报告"最终 40 名"。原文未在摘要或方法节中明确说明实验 1 与实验 2 是否为同一批被试、是否共享被试。从月龄描述看(实验 1 双峰组 7 个月 24 天至 8 个月 23 天;实验 2 允许运动组 7 个月 23 天至 8 个月 30 天),两批被试月龄范围几乎重合,暗示为两批独立被试。摘要以"80 名"统一描述本身不算错误,但缺少对两批被试关系的明确交代。
- 证据:
- "以汉语环境中的80名8月龄婴儿为被试"
- "最终,40名婴儿被随机分配至单峰接触组和双峰接触组,每组各20名"
- "最终,共有40名婴儿被随机分配至两种实验条件"
- 严重程度:🟡(方法学交代不清,非红旗)
- 复核状态:⚠️ 依据不足(原文未明确说明两实验是否共享被试,无法判断是疏忽还是刻意含糊)
发现 3:实验 2 关键三阶交互仅边缘显著(p=0.055),与摘要确定性陈述存在张力
- 位置:表 7、表 8;摘要;4.1节讨论
- 描述:实验 2 三阶交互 F(1, 554.00)=3.71, p=0.055(标记为 †),仅达边缘显著。然而摘要明确宣称"允许运动组在辅音条件下呈现交替优势,而运动抑制组未呈现相应模式",措辞偏向确定性。讨论部分(4.1节)承认"关键三阶交互仅达到边缘显著水平……更适合被视为趋势性证据",与摘要措辞不一致。
- 证据:
- "试次类型×组别×刺激类型 554.00 3.71† 0.055"
- "允许运动组在辅音条件下呈现交替优势,而运动抑制组未呈现相应模式"
- "本研究中关键三阶交互仅达到边缘显著水平,因此该结果更适合被视为趋势性证据"
- 严重程度:🟡
- 复核状态:✅ 成立(原文摘要与讨论之间确实存在对同一统计结果的不同定性,属于表述规范问题)
发现 4:前/后半段模型与主模型结果之间存在方向一致但显著性不一的张力
- 位置:表 5(实验 1)、表 10(实验 2)
- 描述:实验 1 主分析三阶交互 F(1, 592.98)=4.13, p=0.043(显著),但前/后半段补充模型中三阶交互 F(1, 266.00)=2.94, p=0.088(不显著);四阶交互 F(1, 266.00)=0.61, p=0.437(不显著)。实验 2 主分析三阶交互 F(1, 554.00)=3.71, p=0.055(边缘),前/后半段模型三阶交互 F(1, 266.00)=1.16, p=0.283(不显著)。两者方向一致,但补充模型因试次阶段二分后统计效能降低导致显著性下降,这在 LMM 框架下属常见现象。
- 证据:
- "试次类型×组别×刺激类型 266.00 2.94 0.088"
- "试次类型×组别×刺激类型 266.00 1.16 0.283"
- "试次阶段×试次类型×组别×刺激类型 266.00 0.61 0.437"
- 严重程度:🟢(补充分析因变量合并导致效能降低,属于常见方法学现象)
- 复核状态:⚠️ 存在良性解释(将试次二分后观测数减半、统计效能自然降低;方向一致已提供合理性证据)
发现 5:试次类型 Wald t 值与对应 F 检验的反差未被作者说明
- 位置:表 2(实验 1)
- 描述:实验 1 主效应"试次类型:交替 vs. 相同"的固定效应系数 b=0.08, SE=0.07, t=1.15, 95%CI [−0.06, 0.22](不显著),但同一效应的 ANOVA F 检验 F(1, 592.98)=11.38, p<0.001(高度显著)。两者并不矛盾(F 检验对所有组别合并后的试次类型效应作边际检验,而 Wald 检验对应特定编码下的回归系数),但 t=1.15 vs F=11.38 的量级反差较大,原文未提供解释。
- 证据:
- "试次类型:交替vs.相同 0.08 0.07 1.15 [−0.06,0.22]"
- "试次类型 592.98 11.38*** <0.001"
- 严重程度:🟢
- 复核状态:⚠️ 存在良性解释(LMM 中 F 检验为 Type III 边际检验,Wald t 为特定编码下系数检验,两者因交互项存在可产生方向/量级差异;属统计方法学常识,非红旗)
发现 6:性别比例 1:1 且每组样本量精确为 20 人的"整齐度"
- 位置:2.1节、3.1节
- 描述:实验 1 两组各 20 人,性别比 1:1;实验 2 同样两组各 20 人,性别比 1:1。在排除被试后进行替补并保持性别平衡在实践中可行,但四组均精确保持 1:1 且每组恰好 20 人的描述略显刻意。不过文中已给出样本量设定的先验依据(每组 12–31 名,取 20 名),性别比 1:1 也可能源于主动平衡。
- 证据:
- "每组各20名,两组性别比例均为1:1"
- "每组各20人"
- "每组样本量设定为20名"
- 严重程度:🟢
- 复核状态:⚠️ 存在良性解释(主动设定性别平衡与样本量属常见实验设计操作;原文已提供先验依据)
发现 7:统计模型自由度报告基本符合 Satterthwaite 近似预期
- 位置:表 3、表 5、表 8、表 10 的 DenDF 列
- 描述:表 3 中"组别" DenDF=38.62(与 40 名被试 − 2 个组别水平 ≈ 38 大致吻合);"试次序列" DenDF=146.59(作为协变量其分母自由度计算方式不同,可接受)。表 8 中"组别" DenDF=38.00,"试次序列" DenDF=39.00。整体符合 Satterthwaite 近似预期,未触发硬性红旗。
- 证据:
- "试次序列 146.59 92.77***"
- "组别 38.62 0.001 0.973"
- "试次序列 39.00 47.16***"
- "组别 38.00 1.98 0.168"
- 严重程度:🟢(无异常)
- 复核状态:✅ 成立(作为正面观察保留)
发现 8:F 值与 p 值精度报告规范,未见 p 值异常聚集
- 位置:表 3、表 5、表 8、表 10
- 描述:论文未报告精确 p 值(如 p=0.043 而非 p=0.04321)。主分析 p=0.043、0.044、0.049 三项紧邻 0.05 阈值但分布在不同效应的边际检验上,属多重比较情境下可接受现象。Bonferroni 校正后的简单效应 p 值出现多个 p=1.000(多重比较上限截断),属正常做法。
- 证据:
- "F(1,592.98)=4.13*, p=0.043"
- "F(1,592.98)=4.06*, p=0.044"
- "F(1,592.98)=3.90*, p=0.049"
- 严重程度:🟢(无异常)
- 复核状态:⚠️ informational(作为正面观察保留)
发现 9:表格中 SD 值与样本量 (n=20) 的统计可接受性
- 位置:表 1、表 6
- 描述:表 1 中部分单元 SD 值范围跨度合理(如 1.06–2.31),均值范围 1.66–5.07。部分单元 SD 接近或大于均值(如"单峰-辅音-相同 试次 4" M=2.28, SD=1.78),表明变异较大。考虑到 n=20,SD 估计本身有一定噪声。整体看 SD 分布符合自然实验变异,未触发"过于整齐"红旗。
- 证据:
- "单峰 辅音 相同 2.28(1.78)"
- "允许运动 非语音 交替 3.55(1.59)"
- 严重程度:🟢(无异常)
- 复核状态:⚠️ informational(作为正面观察保留)
发现 10:刺激参数描述的内部一致性
- 位置:2.1节 刺激部分
- 描述:连续统设计描述内部一致:F2 起始从 2150Hz 降至 1520Hz,步差 90Hz;F3 起始从 3339.2Hz 降至 2868.8Hz,差值 470.4,共 7 步差 ≈ 67.2Hz。3 号和 6 号刺激分别为 1970/1700 (F2) 与 3204.8/3003.2 (F3),与原文一致。这些参数为研究者手算设定,并非来自自然测量。
- 证据:
- "F2起始频率从1号刺激的2150Hz降至8号的1520Hz(步差90Hz)"
- "F3起始频率从3339.2Hz降至2868.8Hz(步差67.2Hz)"
- 严重程度:🟢(无异常)
- 复核状态:⚠️ informational(作为正面观察保留)
耿同学辣评
"经过一轮硬核复核,机器取证那一大串 Benford/末位数字/copy-move/噪声方差/PRNU 的具体数值,原文里统统找不到——这些本就是程序对表格数据的统计计算结果,跟原文文本无关。考虑到本论文大量数值是研究者手算的声学参数(共振峰步差固定为 90Hz、67.2Hz),Benford 和末位数字检验对这类人为等差构造的数据根本不适用,原报告虽已自行降级,但既然原文确实找不到那些具体数值,连"线索"地位也保不住。剩下的真问题不多但很实在:(1)实验 1 和实验 2 都说"排除 X 人后继续替补到每组 20 人",可 55−15=40、53−13=40,根本没有替补名额——要么是叙述含混,要么是算术不对;(2)实验 2 三阶交互 p=0.055,摘要直接喊"允许运动组呈现交替优势",讨论自己又说"仅适合视为趋势性证据",这叫薛定谔的显著。不算实锤,但请把原始注视时间 .csv、被试招募流水表、以及高分辨率矢量图打包发来,咱们好好聊聊。"
建议后续行动
- 联系作者要求提供原始注视时间数据(.csv 格式,每个被试、每个试次的毫秒级注视时间)以复核描述性统计
- 要求作者提供每个被试的人口学变量原始记录(出生日期、性别、招募日期、是否替补入组、排除原因与时间)以验证发现 1 中所述"排除后替补"的实际流程
- 要求作者在方法节明确说明实验 1 与实验 2 是否为同一批被试
- 要求作者就实验 2 边缘显著 p=0.055 与摘要确定性陈述之间的不一致做出明确澄清(建议将摘要相应措辞修改为"一定条件下呈现交替优势趋势"等保守表述)
- 要求作者提供所有图表的原始矢量文件(.svg / .ai / .pdf),以便对统计图坐标轴/误差棒端点等重复元素做针对性人工核查
- 在 PubPeer 上提出上述样本量流程与统计报告疑问
⚠️ 免责声明
本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。