观点采纳塑造人智协作中的创造性表现 / Perspective Taking Shapes Creative Performance in Human–AI Collaboration
2026-08-09 11:08
🔍 耿同学打假报告
论文信息
- 标题:观点采纳塑造人智协作中的创造性表现 / Perspective Taking Shapes Creative Performance in Human–AI Collaboration
- 作者:张曼、彭洋、王雅洁、胡慧清、陈石、赵庆柏
- 期刊:ChinaXiv预印本(华中师范大学)
- DOI:未提供(ChinaXiv编号 202607.00201v1)
- 发表年份:2026年7月25日发布于ChinaXiv(收稿日期:2026-04-17)
- 论文来源:202607.00201v1.pdf
综合评定:🟡 存疑
详细发现
⚠️ 发现 1:列间差值高度恒定(机器取证证据 S3/S4/S5)
- 位置:表1、表2、表3、表4、表5、附表1(全文统计表格)
- 描述:PHP程序对全文66个列对进行差值恒定检验,三次触发红线(S3、S4、S5),提示"数据非实验测量而是加减法编造"。
- 证据:原文中表2的人智协作与双人协作各列均值与标准差均为标准报告格式(如人智协作流畅性均值=22.51,SD=6.92;双人协作=19.38,SD=9.30),数据本身无法在原文中直接验证其是否符合"自然变异性"。
- 复核分析(反方论证):心理学实验中均值±SD的呈现形式本身就来源于真实测量结果汇总,差值恒定检验的"红线"在多种心理学量表数据集中可能产生假阳性。该检验对样本量较小(如本研究n=49-55对)、且来自同一实验流程的数据敏感度较高,原文未提供任何指向"加减法编造"的直接证据(如自相矛盾的数据、完全线性的散点)。同时,原文报告了多个变量(新颖性、适用性、流畅性、灵活性、观点采纳等)的均值与标准差,这些数据在真实实验中通常由不同维度独立测量,存在通过差值恒定检验的良性可能(不同变量均来自同一批被试,统计量间存在系统性关联)。
- 严重程度:🟡
- 复核状态:⚠️ 存在良性解释(差值恒定检验对小样本心理学数据敏感,多个独立维度的统计量本就来自同一被试群体,存在系统性关联属正常现象)
⚠️ 发现 2:末位数字分布严重不均匀 + Benford偏离(机器取证证据 S1/S2)
- 位置:全文表格中的均值、标准差、t值、p值、回归系数
- 描述:末位数字分布在χ²检验中达到p=0.0000(χ²=69.5),奇偶比394/846=0.47;Benford联合检验中第1位至第4位数字均呈显著或边缘异常(MAD最高达0.1386,χ²=4518.4)。
- 证据:原文中报告的p值包括p<0.001、p=0.024、p=0.029、p=0.045、p=0.038、p=0.005、p=0.010等,均为标准报告格式。
- 复核分析(反方论证):Benford定律适用于跨数量级的真实测量数据(如人口、河流长度、经济数据),但不适用于受控范围的心理量表评分(李克特1-7)或标准化回归系数(通常-1到1);论文中大量变量(如t值、p值、回归系数)的取值范围本身就受限于特定分布,不满足Benford检验的前提条件。末位数字分布在心理学论文中受小数位舍入规则(如报告至两位小数)影响较大,可能产生系统性末位偏好。原文未出现"所有数据均落在某些数字上"的极端异常,且p值分布覆盖了广泛区间(从0.001到0.924),未见系统性p-hacking模式。
- 严重程度:🟡
- 复核状态:⚠️ 存在良性解释(Benford检验前提在受控范围的量表数据/回归系数上不满足;末位分布受小数位舍入影响)
⚠️ 发现 3:图2A与B面板人物素材疑似复用
- 位置:第7页 图2(A、B面板)
- 描述:图2A(双人协作场景)中"房间1"的人物图像与图2B(人智协作场景)中"房间1"的人物图像高度相似,背景与人物姿态几乎完全一致,仅面部细节略有不同。
- 证据:视觉分析摘要标注置信度"中"。论文原文第7页图2注仅描述"A)双人协作场景;B)人智协作场景;C)双人协作网页聊天界面;D)人智协作网页聊天界面",未提供关于素材来源的说明。
- 复核分析(反方论证):①示意图中"房间1"均为人类参与者使用电脑的标准场景,使用同一素材绘制不同实验条件的场景是学术示意图的常见做法(避免重新绘图的成本与版权问题);②论文图注已明确标注四个面板分别对应不同实验条件,即使素材复用,也不影响读者对实验设计的理解;③视觉分析摘要同时指出"置信度:中",未达到"高度确信"标准;④原文未声明使用了不同人物素材,因此复用同一人物素材不构成"伪造"。
- 严重程度:🟡
- 复核状态:⚠️ 存在良性解释(实验场景示意图中使用同一人物素材绘制不同条件是常见做法,图注已明确标注条件差异)
⚠️ 发现 4:图2C与D面板笔记本电脑模板疑似同一素材
- 位置:第7页 图2(C、D面板)
- 描述:图2C与D中笔记本电脑的硬件外观(边框、键盘、底座阴影、渲染角度、光照方向与桌面阴影)几乎完全一致,仅替换了屏幕内聊天内容。
- 证据:视觉分析摘要标注置信度"中"。论文原文图2注描述"C)双人协作网页聊天界面;D)人智协作网页聊天界面"。
- 复核分析(反方论证):示意图中笔记本电脑模板复用是学术插图的标准做法(同一硬件设备用于不同实验条件),论文重点展示的是屏幕内的聊天界面差异,而非硬件外观。视觉分析摘要本身将此标记为"轻微"而非"可疑"。
- 严重程度:🟡
- 复核状态:⚠️ 存在良性解释(示意图中笔记本模板复用是学术插图的常见做法)
⚠️ 发现 5:图3、图5、图6小提琴图中AI组数据"过于干净"
- 位置:第12页 图3A、图3B;第15页 图5、图6
- 描述:AI组(红色)数据点分布形态明显更窄,散点几乎全部聚集在中位数附近,缺乏自然数据应有的离散噪声。
- 证据:论文原文第6页明确报告"温度(temperature)= 0.70,核采样参数(top p)= 1.00,存在惩罚(presence penalty)= 0.00,频率惩罚(frequency penalty)= 0.20"以及"每个想法限制在40字以内"。
- 复核分析(反方论证):GPT-5-mini在固定参数(temperature=0.70, top_p=1.00, frequency_penalty=0.20)下生成的回答本就较为一致,加之40字以内输出约束,导致AI生成想法在类别和长度上的方差天然较小。这是LLM输出行为的固有特征,而非数据造假。视觉分析摘要本身标注"置信度:低",并提示"也有可能是AI回复本身较为一致所致,需谨慎判断"。
- 严重程度:🟡
- 复核状态:⚠️ 存在良性解释(LLM在固定参数与字数限制下输出方差天然较小,原文已明确报告相关参数)
⚠️ 发现 6:图像取证发现多张统计图存在copy-move嫌疑(I2、I4、I6、I8、I10、I12、I14、I16、I18、I20、I22)
- 位置:img-000至img-010(共11张图)
- 描述:PHP程序对12张图两两比对,发现多张图在不同偏移处出现疑似复制粘贴块(最多达69对匹配块,如I4:img-001.jpg偏移(32,0)处69对匹配块)。
- 证据:原文中图1-图10均为统计图或概念示意图,包含大量规则重复元素(坐标轴边框、刻度线、网格线、面板分隔线、置信区间阴影)。
- 复核分析(反方论证):统计图(散点图、小提琴图、APIM模型示意图)中存在大量规则重复元素(坐标轴边框、刻度线、网格线、面板分隔线),这些元素本身就容易被Fridrich块匹配算法误判为"同偏移复制"。R语言ggplot2等统计绘图软件的默认渲染输出具有高度统一的像素特征(相同的字体、相同的边框宽度、相同的刻度间距),同一论文中所有图由同一脚本/同一软件渲染时,其"同偏移匹配"是预期结果而非篡改证据。原文未声明使用了不同的渲染工具或不同的图像来源。
- 严重程度:🟡
- 复核状态:⚠️ 存在良性解释(统计图中规则重复元素易导致copy-move算法误判,同一论文批量渲染的统计图天然共享大量像素特征)
⚠️ 发现 7:图像噪声方差不一致/高度不均(I1、I3、I5、I7、I9、I11、I13、I15、I17、I19、I21)
- 位置:img-000至img-010
- 描述:多张图呈现噪声方差CV>1.0(最高1.52),部分被程序标记"疑似图像拼接"。
- 证据:论文原文中的统计图均为软件(R/Python)渲染输出,未提及扫描或翻拍。
- 复核分析(反方论证):统计图中大面积平坦区域(白色背景、空白面板)会导致高通滤波后有效块数量减少、CV升高。R语言ggplot2的白色背景面板在9×9盒式高通滤波下会产生极低的方差值,与数据区域(包含彩色元素)的方差形成巨大差异,这是统计图的固有特征而非拼接证据。不同面板的数据密度不同(如小提琴图与简单柱状图的数据填充区域面积差异巨大),也会导致CV值显著不同。
- 严重程度:🟡
- 复核状态:⚠️ 存在良性解释(统计图大面积平坦区域与数据区域方差天然不同,软件渲染统计图的CV值受背景面积影响)
发现 8:PRNU弱相似(I23、I24)
- 位置:img-010 vs img-011、img-000 vs img-011
- 描述:两张图的PRNU(相机传感器噪声指纹)比较显示NCC值极低(-0.001、0.048),提示它们不来自同一拍摄设备。
- 证据:论文原文中的所有图均为软件渲染的统计图与概念示意图,无任何相机拍摄内容。
- 复核分析(反方论证):PRNU主要用于检测照片是否来自同一相机传感器,而论文中的统计图是软件(R/Python)渲染的矢量/位图输出,本身就不含相机传感器噪声。软件渲染图之间的PRNU"弱相似"是预期结果,不构成造假证据。
- 严重程度:⚪
- 复核状态:✅ 成立(PRNU弱相似在软件渲染图中为预期结果,良性解释明确)
⚠️ 发现 9:样本量与剔除标准的表述歧义
- 位置:第5页 第2.1节被试部分;第11页 表1表头
- 描述:正文称"双人协作条件57对,人智协作条件55对",表1表头写"人智协作(55) 双人协作(114)"。若55对应为110人,则表1数字与正文一致(55对=110人,但表1只列55人);若57对=114人,则表1列头括号内应为"110"和"114"而非"55"和"114"。
- 证据:论文原文第5页明确报告"从华中师范大学共招募169名被试"、"被试被随机分配至双人协作或人智协作条件,其中双人协作条件57对,人智协作条件55对"、"被试平均年龄为19.57岁(SD=1.26)。其中,男性58人,女性111人";表1表头显示"人智协作(55) 双人协作(114)",df=167支持总人数约168-170人的推断。
- 复核分析(反方论证):①df=167与总人数168人(55+114=169)高度吻合,说明表1括号内的数字确实指人数;②若按55对=110人和57对=114人计算,总人数应为224人而非169人,因此正文中的"55对""57对"可能是"55人""57人"的笔误,或表1括号内的数字才是正确的人数;③此处矛盾属于排版/表述歧义,不涉及数据本身的自相矛盾(如不同表中同一变量的数值不一致),且df值与表1人数自洽;④可能为论文从投稿到ChinaXiv发布过程中的格式转换错误。
- 严重程度:🟡
- 复核状态:⚠️ 依据不足(正文"55对"与表1"55人"存在单位歧义,但df=167与总人数自洽,可能为排版笔误,不构成数据造假证据)
发现 10:时间线合理性核查(GPT-5-mini的可用性)
- 位置:第6页 第2.2节
- 描述:研究选用GPT-5-mini作为AI协作对象,API调用时间为2025年11月8日至2025年12月21日。
- 证据:论文原文明确报告"研究选取 GPT-5-mini作为人智协作条件的互动对象"及"API调用时间为2025年11月8日至2025年12月21日"。
- 复核分析(反方论证):截至当前日期(2026年8月),GPT-5系列已由OpenAI正式发布并提供API服务,GPT-5-mini作为轻量版本应已上线。论文收稿日期2026年4月17日,晚于API调用结束日期(2025年12月21日),时间线逻辑合理。
- 严重程度:✅
- 复核状态:✅ 成立(无时间线冲突)
发现 11:方法学描述与统计方法
- 位置:第2节、第3节
- 描述:方法部分内部基本一致,使用pwr包确定样本量(d=0.55, α=0.05, power=0.80),与每组最少53对的需求基本匹配;APIM模型设定(含不可区分/可区分二元组、随机截距、均值中心化)描述规范。
- 证据:原文第6页明确报告样本量计算方法及参数选择理由。
- 复核分析(反方论证):方法学描述详尽完整,APIM模型的统计建模策略(不可区分/可区分二元组的区分使用、均值中心化处理、随机截距设置、似然比检验的模型比较策略)均符合方法学规范。
- 严重程度:✅
- 复核状态:✅ 成立(方法学描述自洽)
发现 12:多重比较与p值分布
- 位置:第3节各表
- 描述:报告了多个p值(如p<0.001、p=0.024、p=0.029、p=0.045、p=0.038等),未观察到典型的p-hacking模式。
- 证据:原文表2、表4、表5中的p值分布广泛,从p<0.001到p=0.924均有报告。
- 复核分析(反方论证):p值分布总体合理,未见所有p值都恰好在0.04-0.05区间的p-hacking模式,且论文明确报告了大量非显著结果(如适用性p=0.137、灵活性p=0.186等),说明研究结果未经过筛选性报告。
- 严重程度:✅
- 复核状态:✅ 成立(p值分布合理,未见p-hacking)
耿同学辣评
这篇论文选题很有前瞻性——人智协作中的观点采纳确实是一个值得深挖的方向,方法学设计(APIM模型、不可区分/可区分二元组的区分使用)也相当规范。机器取证跑出的几条统计线索(Benford偏离、末位分布异常、列间差值恒定)虽然看起来触目惊心,但仔细想想:Benford定律本就不适用于李克特量表分数和回归系数,差值恒定检验对小样本心理学数据天然敏感——这些"红线"在论文原文中都能找到合理的良性解释。示意图里两间实验室共用同一个演员?这在学术插图里实在太常见了,不值得大惊小怪。唯一真正值得注意的是表1表头的"55"和正文"55对"的表述歧义——到底是55人还是55对?建议作者仔细核实一遍,但这更像是排版笔误而非数据造假。总的来说,这篇论文的数据更可能是真实跑出来的实验结果,只是恰好被统计检验的"火眼金睛"误判了几次。建议后续重点关注的不是数据真伪,而是表述规范的统一性。
建议后续行动
- 联系作者澄清表1表头"55"与正文"55对"的表述歧义(人数vs.组数)
- 建议作者在正式发表版本中统一样本量表述(建议改为"人智协作条件55人(28对),双人协作条件57人(28对)"或类似明确表述)
- 提供GPT-5-mini的完整API调用日志作为补充材料,增强可重复性
- 当前统计线索(Benford、列间差值恒定、copy-move等)均存在明确良性解释,无需启动正式学术调查
- 建议作者在补充材料中公开原始对话记录与评分者打分原始数据,以便后续研究者复核
⚠️ 免责声明
本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。