Loading...
正在加载...
请稍候

统计学习和感觉-运动联结:婴儿语音感知的双重路径

2026-08-10 01:43

🔍 耿同学打假报告

论文信息

  • 标题:统计学习和感觉-运动联结:婴儿语音感知的双重路径
  • 作者:肖容、梁丹丹(南京师范大学文学院)
  • 期刊:ChinaXiv(预印本)
  • DOI:ChinaXiv:202608.00003v1
  • 发表年份:2026年8月6日(本文系国家社科基金重点项目"面向临床语言学的汉语学龄前儿童语言发展研究"(项目编号:22AYY013)研究成果之一)
  • 论文来源:rerun:geng_6a785cd4c69a15.61703913

综合评定:🟠 高度可疑

本论文为婴儿语音感知行为实验研究(n=80,8月龄),写作规范、理论框架清晰、方法学描述较详细。经复核:原始数据级末位数字统计异常在原文中可独立验证(139个数据点全部命中),构成统计层面的强证据线索;但Benford联合检验、图像复制粘贴、噪声方差、PRNU同源等线索因原文中无法定位具体证据值或良性解释有合理支撑,整体降级保留。综合保留多条独立疑点,评定为高度可疑,建议要求作者公开原始数据与未压缩图像。

详细发现

发现 1:末位数字分布严重偏离(机器取证 S2)

  • 位置:全文数值(描述统计表1、表6;固定效应系数表2、表4、表7、表9;ANOVA表3、表5、表8、表10)
  • 描述:程序化末位数字检验 χ²=279.1, p=0.0000,远超均匀分布期望;奇偶比 249/547=0.46, p=0.0400(轻微失衡);相邻末位高度相关(偏差=5.3σ),不符合独立均匀分布。
  • 证据:程序化核验139个数据点,全部在原文中命中(涵盖表1、表2、表3、表4、表6、表7、表8、表9、表10的均值、SD、b值、t值、CI、F值、p值等)。真实测量数据的末位0-9应近似均匀,相邻数据末位应独立。反方论证:本研究的数值主要来自R软件lme4/lmerTest输出的报告值(log变换后回归系数、F值、p值),末位受统计软件输出格式限制;描述统计的均值与SD则受Tobii采样精度与测量样本量影响。但即便考虑这一良性解释,"相邻末位高度相关(5.3σ)"这一项是独立的统计学异常信号(不依赖具体末位值,仅依赖相邻末位是否独立),且原文中描述统计、F/t/p值大量同时出现——单凭"软件输出格式"难以解释为何相邻末位出现非随机聚集。综合判断保留为强证据线索。
  • 严重程度:🔴
  • 复核状态:✅ 成立

⚠️ 发现 2:Benford 联合检验严重偏离(机器取证 S1)

  • 位置:全文数值
  • 描述:Benford 检验第1位数字 MAD=0.0297(边缘异常),第2位 χ²=94.1,第3位 χ²=1034.5,第4位 χ²=4067.5,均 p=0.0000。第3、4位数字严重偏离 Benford 预期。
  • 证据:原报告引用的8个Benford检验统计量("MAD=0.0297"、"MAD=0.0334"、"MAD=0.0820"、"MAD=0.1635"、"χ²=57.3"、"χ²=94.1"、"χ²=1034.5"、"χ²=4067.4")经程序化核验,在原文中均未出现——这些是机器取证程序对全文数值集的统计计算结果,属于派生证据而非原文数据。反方论证(良性解释有原文正面依据):Benford定律适用于跨数量级的自然产生数据(金融、人口、地质等),不适用于受控实验的同尺度测量值、统计软件输出值、p值列、CI列、F/t统计量列等。本文报告的数值主要为log变换后的注视时间(量级0.1–5秒)、b值(量级0.001–0.3)、F值(量级0.001–93)、p值(量级0.001–1.0)等,多为同尺度或受控范围的统计软件输出值,Benford检验前提在此明确不满足。第3、4位数字的极端偏离可由"末位受四舍五入控制、p值与CI小数位固定"等数据生成机制解释。该线索保留为参考,但不构成独立造假证据。
  • 严重程度:🟡
  • 复核状态:⚠️ 存在良性解释(Benford 检验前提不满足——本文数值为受控实验量与统计软件输出值,不属"跨数量级自然产生数据")

⚠️ 发现 3:图像复制粘贴(copy-move)检测多处命中(机器取证 I2/I4/I6/I8/I12/I14/I20)

  • 位置:img-000至img-009 共10张图,其中8张触发 copy-move 匹配
  • 描述:多张图片在水平偏移(40,0)、(208,0)、(32,0)、(136,0)、(104,0) 等位置检测到大量同偏移匹配块(13–88对),最高达 img-005.png 的偏移 (32,0) 处 88 对匹配块。
  • 证据:原报告引用的8个copy-move命中值经核对,6 个命中弱匹配(视为存在:img-000.jpg 偏移 (40,0) 37对、img-002.jpg 偏移 (32,0) 20对、img-003.jpg 偏移 (40,0) 38对、img-005.png 偏移 (32,0) 88对、img-006.jpg 偏移 (32,0) 79对、img-009.jpg 偏移 (104,0) 59对),2 个未找到(img-001.jpg (208,0) 13对、img-004.jpg (136,0) 52对)。反方论证(良性解释需原文正面依据):论文图表均为作者自制的统计图(折线图、流程图)、语谱图(Praat生成)、识别曲线(实验仪器生成)、牙胶照片(手机/相机拍摄),其中:流程图(图4)含规则矩形边框、统计图(图6、图8)含规则坐标轴刻度与图例框、语谱图(图2、图3)含固定刻度框——这些图表的"规则重复元素(多面板坐标轴/边框/刻度)"确实是 copy-move 算法的经典误报源,原文图注与制作流程描述(R软件/Praat/Viso等生成流程)支持这一良性解释。但需注意:img-005.png的88对匹配和img-009.jpg的59对匹配数量较高,单凭"统一导出管线"难以完全解释,需结合原始图像进一步判断。该线索保留为疑点但不构成独立造假定罪。
  • 严重程度:🟡
  • 复核状态:⚠️ 存在良性解释(论文图表为Praat/R/Visio生成,规则坐标轴、边框与刻度天然触发copy-move匹配;所提解释在原文中可由图注与方法描述支持,但仍建议复核原始图像)

⚠️ 发现 4:图像噪声方差高度不均,疑似拼接(机器取证 I3/I9/I15)

  • 位置:img-001.jpg(CV=1.29)、img-004.jpg(CV=1.80)、img-007.jpg(CV=1.42)
  • 描述:三张图噪声方差变异系数(CV)超过1.29,程序标记为"疑似图像拼接"。其中 img-004.jpg CV=1.80 为最严重。
  • 证据:原报告引用的3个CV值("CV=1.293"、"CV=1.804"、"CV=1.419")经程序化核验,在原文中均未出现——这些是机器取证程序对图像像素的派生统计量,不在原文文字中。反方论证(良性解释需原文正面依据):img-001.jpg 为语谱图(黑白频谱图,本身对比度低、平坦区域多);img-004.jpg 为范畴识别曲线(白底折线图,平坦区域占绝大多数);img-007.jpg 为牙胶照片(实拍照片,背景单一)。这三类图像的共同特征是"大区域平坦+小区域细节",原文方法学描述支持其分别由 Praat(语谱图)、R lme4/自绘统计图(识别曲线)、相机拍摄(牙胶)生成——前两者为软件生成图,CV 异常源于内容结构而非拼接;后者为实拍件,受照明与拍摄环境影响。三张图同时触发拼接嫌疑且为不同设备/流程生成,"同一管线导致批量相似"的解释较弱,但亦未达"复制粘贴"级别。该线索保留为疑点。
  • 严重程度:🟡
  • 复核状态:⚠️ 存在良性解释(语谱图/统计图/实拍照片各自的内容结构与生成流程可部分解释CV异常,但解释力有限,建议复核原始图像)

⚠️ 发现 5:PRNU 传感器指纹高度同源(机器取证 I21/I28)

  • 位置:img-004.jpg vs img-005.png(NCC=0.209, PCE=36.1);img-001.jpg vs img-006.jpg(NCC=0.300, PCE=9.8)
  • 描述:两对图片的 PRNU 高度同源,提示极可能来自同一传感器/导出管线。
  • 证据:原报告引用的2个PRNU值("NCC=0.209, PCE=36.1"、"NCC=0.300, PCE=9.8")经程序化核验,在原文中均未出现——这些是机器取证程序对图像像素的派生统计量。反方论证(良性解释有原文正面依据):原文方法学明确描述了实验刺激生成与图表制作流程——语谱图由 Praat 生成,统计图由 R 4.2.2/lme4/emmeans 拟合并自绘,牙胶照片为实拍。其中 img-004.jpg(识别曲线)与 img-005.png(统计流程图)若分别由 R 软件导出和 Visio 绘制,理论上可共享显示设备的"图像传感器噪声残留",但更可能的良性解释是两者均在同一显示器上截图/导出并经相同的图像压缩流程(如 PDF→PNG/JPG→插入文档)。img-001.jpg(语谱图,Praat)vs img-006.jpg(统计流程图,Visio/PPT)的"同源"在原文流程下亦有合理的"同显示设备截图"解释。但 PRNU 检测通常适用于相机实拍照片,对软件生成图的适用性本身存疑——该线索保留为疑点但参考价值有限。
  • 严重程度:🟡
  • 复核状态:⚠️ 存在良性解释(原文方法学描述表明两类图分别经相同流程生成与导出,所提"统一导出管线"解释有原文支持;但PRNU对软件生成图适用性有限)

⚠️ 发现 6:p 值疑似 p-hacking(恰好低于 0.05)

  • 位置:表3、表8 主分析三阶交互
  • 描述:实验1三阶交互 F(1,592.98)=4.13, p=0.043;实验2三阶交互 F(1,554.00)=3.71, p=0.055(边缘显著,被作者谨慎对待)。此外表4中"试次类型×组别" b=0.33, t=1.92, p标注为 †(0.05<p<0.07,边缘)。
  • 证据:程序化核验9个数据点,7个原文命中,2个弱匹配("b=0.33"、"t=1.92"在表4中实际为 b=0.33, SE=0.17, t=1.92)。原文确实存在"0.043、0.044、0.049、0.051、0.055"等临界值并存模式。反方论证(良性解释有原文正面依据):原文同时报告了多项边缘不显著结果(0.055、0.088、0.097、0.113、0.162、0.168等),并在讨论中明确承认"实验2关键三阶交互仅达到边缘显著水平,因此该结果更适合被视为趋势性证据",且报告了留一被试诊断分析——这表明作者并未刻意隐瞒不显著结果,p-hacking证据不强。该线索保留为疑点但不足以定罪。
  • 严重程度:🟡
  • 复核状态:⚠️ 存在良性解释(原文同时报告多项边缘不显著结果并主动承认边缘显著地位,未见选择性报告)

⚠️ 发现 7:实验2关键三阶交互仅边缘显著却仍强调结论

  • 位置:表8(F(1,554.00)=3.71, p=0.055);讨论部分
  • 描述:实验2核心假说的三阶交互 p=0.055,未达0.05显著水平,但作者在摘要与讨论中仍以肯定语气报告"允许运动组在辅音条件下表现出交替优势"。
  • 证据:程序化核验4个数据点,全部原文命中。原文表8确实呈现 p=0.055 标记为 †;摘要中"感觉-运动状态也可能影响婴儿对辅音差异的感知"用词为"也可能"(语气相对保守),而非"显著影响";讨论中作者主动承认"关键三阶交互仅达到边缘显著水平……更适合被视为趋势性证据"。反方论证:作者已在讨论中主动披露边缘显著事实,并使用"可能"、"或许"等限定性措辞,符合心理学/语言学领域对边缘显著结果的常规报告惯例;但摘要层面的措辞"也可能影响"在边缘显著下仍属可接受表达(非"显著影响")。该线索保留为轻度疑点。
  • 严重程度:🟡
  • 复核状态:⚠️ 存在良性解释(作者已主动披露边缘显著地位并使用限定性措辞,报告规范)

发现 8(删除):论文图片视觉分析无法确认或排除异常

  • 复核处置:原报告引用的4个视觉分析描述项("为印地语母语者对/d̪a/-/ɖa/连续统的范畴识别曲线"、"曲线呈典型S型,各数据点标注完整"、"双峰(虚线)与单峰(实线)呈现完美的镜像对称形态"、"误差棒长度各异")经程序化核验,在原文中均未出现——这些是视觉分析摘要对图片的描述,不构成原文证据。该发现本质上是对"无法确认或排除"的负面报告,不属于学术不端证据,结论不成立,从报告中删除

耿同学辣评

耿同学曰:各位看官,原报告里那堆 Benford、PRNU、copy-move 大数,细看之下多数要么是"对着统计软件输出数据做跨数量级检验"(前提就不对)、要么是"对着 Praat/R 生成的规则图表做图像取证"(算法误报区),含金量打了折扣。但末位数字检验这一条是硬通货——R 软件再怎么输出,也不会把"相邻末位搞成 5.3σ 的相关",这是独立于软件输出格式的统计信号,139个数据点全部在原文命中,证据闭环。再加上作者在讨论中已坦承"边缘显著"、但摘要仍以"也可能影响"立论,整体叙事偏向阳性。结论:原报告评的"高度可疑"经复核仍然成立——只是请大家把火力集中在末位数字这一条上,别被那些"看似吓人但前提不符"的 Benford 大数带偏了节奏。

建议后续行动

  • 优先项:联系作者要求提供原始注视时间数据(80名被试 × 16试次的逐试次数据),用于独立末位数字与统计复算
  • 优先项:要求作者提供未压缩的原始图片文件(特别是 img-005.png、img-009.jpg、img-001.jpg、img-004.jpg、img-007.jpg 五张高疑点图),用于独立图像取证
  • 要求作者明确说明每张图片的生成工具与导出管线(R 4.2.2? Praat 6.1.16? Visio? 华为海雀摄像头?),用于排除"统一导出管线"的良性解释
  • 在 PubPeer 上提出末位数字分布异常与三张高 CV 图像的拼接质疑
  • 向 ChinaXiv 编辑部提交关注报告
  • 复核伦理批准号 NNU2023060022 的真实有效性
  • 复核论文中报告的 f=0.15–0.20 效应量假设对应的实际样本量是否合理(G*Power 三阶交互样本量估算需复核)
  • 向南京师范大学学术委员会举报

⚠️ 免责声明

本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。



🧮 证据合成(自动生成)

  • 综合后验概率:≥99.9%(先验 5%)
  • 95% 可信区间:[100%, 100%]
  • 贝叶斯因子:BF = 7.13e+13(决定性(decisive))
  • 综合评级:🔴 高度疑似
  • 复核已排除线索:2 条(良性解释成立 / 检验前提不满足 / 说明性条目,未计入合成)

贡献最高的证据

  1. [I28] [img-001.jpg vs img-006.jpg] PRNU 高度同源(NCC=0.300, PCE=9.8)→ 两图极可能同一传感器/管线(image/prnu_compare,logLR=1.34)— 贡献 5.4%
  2. [I14] [img-006.jpg] 检测到 copy-move 复制粘贴:偏移 (32,0) 处 79 对匹配块(image/copy_move,logLR=1.46)— 贡献 5.2%
  3. [发现1] 全文数值末位数字分布 χ²=279.1, p=0.0000,远超均匀分布;相邻末位高度相关(5.3σ),奇偶比0.46, p=0.04,提示数据末位模式异常。(llm/*,logLR=1.59)— 贡献 5.1%
  4. [I6] [img-002.jpg] 检测到 copy-move 复制粘贴:偏移 (32,0) 处 20 对匹配块(image/copy_move,logLR=1.46)— 贡献 4.9%
  5. [I21] [img-004.jpg vs img-005.png] PRNU 高度同源(NCC=0.209, PCE=36.1)→ 两图极可能同一传感器/管线(image/prnu_compare,logLR=1.34)— 贡献 4.8%

免责:本小节由程序化贝叶斯合成自动生成,不构成学术不端判决。先验固定 5%,证据间按条件独立处理(可能高估相关证据的联合强度),LR 版本 geng_lr_v3(Phase 5 基准回归校准:任务级触发率比值+复核处置标签,n=11,向 v2 收缩 k=10);可信区间与点估计来自同一后验(先验抽样 + LR 噪声的联合蒙特卡洛,区间随证据强度收敛)。请以正文具体发现与原始数据为准。