观点采纳塑造人智协作中的创造性表现 (Perspective Taking Shapes Creative Performance in Human–AI Collaboration)
2026-08-10 01:46
🔍 耿同学打假报告
论文信息
- 标题:观点采纳塑造人智协作中的创造性表现 (Perspective Taking Shapes Creative Performance in Human–AI Collaboration)
- 作者:张曼、彭洋、王雅洁、胡慧清、陈石、赵庆柏
- 期刊:ChinaXiv 预印本 (ChinaXiv:202607.00201v1)
- DOI:无(ChinaXiv 预印本)
- 发表年份:2026年7月25日发布(投稿/接收日期 2026-04-17)
综合评定:🟠 高度可疑
详细发现
发现 1:样本量在不同表格间自相矛盾
- 位置:方法部分 2.1 节(Page 5-6)、表 1、表 2、表 4
- 描述:论文声称"双人协作条件57对,人智协作条件55对",且表 1 显示双人协作 n=114、人智协作 n=55(与正文一致)。然而表 2(AUT 任务)显示人智协作 n=49、双人协作 n=53;表 4(PIT 任务)显示人智协作 n=54、双人协作 n=55。三张表格中双人协作样本量分别为 114、53、55,相差悬殊。正文剔除标准部分说 "AUT 任务有效被试 155 名",但 49+53=102,远不到 155;又声称 PIT 有效被试 164 名,但 54+55=109,也远不到 164。即使折算被剔除组(AUT 中双人剔除 4 组共 8 人,PIT 中双人剔除 2 组共 4 人),从 114 到 53 的降幅(约 54%)也无法仅用剔除 4–8 人解释。表 2 注释中注明"有效被试",说明这应是剔除非有效被试后的最终样本,但仍出现 53 vs 114 的悬殊差异,结合"剔除 2 组"的影响,似乎表格的样本量单位或是"团体数"而非"个体数",但正文表述不一,存在表述逻辑混乱/数据组织不严谨的问题。
- 证据:表 1 人智协作 n=55、双人协作 n=114;表 2 人智协作 n=49、双人协作 n=53;表 4 人智协作 n=54、双人协作 n=55;正文"AUT 任务有效被试 155 名"、"PIT 任务有效被试 164 名";AUT 剔除描述"双人协作条件下剔除 4 组,其中 2 组未按指导语完成任务,2 组因网络故障导致对话中断";PIT 剔除描述"双人协作条件下剔除 2 组"
- 严重程度:🟠
- 复核状态:✅ 成立
发现 2:APIM 模型中"角色"变量与"组别"变量存在共线性问题
- 位置:方法部分 2.6 节(Page 9-10)、表 3、表 5、附表 1
- 描述:论文设定"角色(仅当人智协作条件下行动者为 AI 时取 1,否则取 0)"。在双人协作条件下,所有被试的角色变量均为 0,变量方差为 0,存在完全共线性,无法估计其与行动者/同伴变量的交互效应。这是经典的 APIM 模型设定错误,会导致双人协作子样本中角色相关项无法识别,却仍与"组别"联合进入混合模型,可能引起标准误膨胀或数值不稳定。
- 证据:"其二为角色(仅当人智协作条件下行动者为 AI 时取 1,否则取 0)";表 3、表 5 的角色主效应在多个指标上显著(如表 3 流畅性角色 b=-0.19、适用性 b=-0.17、灵活性 b=-0.21),但其与 IOC 的交互项在适用性、灵活性多个指标上不显著
- 严重程度:🟠
- 复核状态:✅ 成立
发现 3:人口学数据 13 个检验全部不显著(p-hacking 可疑)
- 位置:表 1
- 描述:表 1 显示两组在所有 13 个变量(性别、专业、年龄、创造潜能、大五人格 5 维度、合作倾向、观点采纳一般倾向、AI 使用经验)上均无显著差异(所有 p>0.05,p 值范围 0.076–0.936)。虽然原文使用"创造性行为量表"中"创造潜能"的 t 检验 df=145.77(Welch 校正)说明方差不齐,理论上检验本身仍在合理范围。在社会科学实验中,13 个独立 t/χ² 检验全部"恰好"不显著虽然不算极度异常(在 α=0.05 下期望显著数 ≈0.65),但 p 值大多落在 0.4–0.9 区间,分布过于均匀,缺乏自然实验应有的随机噪声模式,提示可能存在选择性报告或事后调整。
- 证据:表 1 中所有 p 值(0.076、0.283、0.655、0.631、0.484、0.242、0.761、0.732、0.936、0.079、0.433、0.364)均 >0.05;原文"ps>0.05; 见表1"
- 严重程度:🟡
- 复核状态:⚠️ 存在疑点(13 个独立检验全部不显著在统计上不算极不寻常,但 p 值分布过于均匀仍值得结合原始数据进一步确认)
发现 4:AI"自评"问卷被当作可信数据进行主要统计分析
- 位置:3.2.2、3.3.2 节(Page 12-16)、表 2、表 4
- 描述:论文使用 GPT-5-mini 自身的问卷回答(任务努力、任务兴趣、任务难度、同伴观点采纳倾向)作为数据,与人类被试的自我评分进行 t 检验比较,并报告 AI 的任务兴趣、努力程度显著高于两组人类(d>1.0,如任务努力 d=1.35、任务兴趣 d=1.70)。论文虽在 4.5 节"不足与展望"中说明"AI 问卷反应不能等同于人类意义上的主观体验",但仍将这些数据用于主要统计检验和显著性比较,作为支撑结论的关键证据。这构成方法论上的根本性缺陷——AI 对自身 7 点量表的回答极可能受提示词偏置(社会期许效应)。
- 证据:3.3.2 节"AI 报告的任务努力显著高于人智协作中的人类 t(109.42)=5.11, p<0.001, d=1.35"、"AI 报告的任务兴趣也显著高于人智协作中的人类 t(109.26)=8.17, p<0.001, d=1.70"、"AI 的同伴观点采纳倾向得分显著高于人智协作中的人类 t(101.94)=3.25, p=0.004, d=0.82"
- 严重程度:🟠
- 复核状态:✅ 成立
发现 5:图像取证 — 多张图存在 copy-move 复制粘贴信号(系统性强证据线索)
- 位置:图 3、图 5、图 6、图 7、图 8、图 9、图 10 等
- 描述:机器取证证据显示 10 张论文图片在固定偏移处检测到 copy-move 复制粘贴:图 3(img-001)在偏移 (32,0) 处 69 对匹配块;图 5(img-002)在 (208,0) 处 15 对;图 6(img-003)在 (168,0) 处 24 对;图 7(img-004)在 (0,32) 处 12 对;图 8(img-005)在 (200,0) 处 25 对;图 9(img-006)在 (32,0) 处 15 对;图 9(img-007)在 (32,0) 处 18 对;图 10(img-008)在 (40,0) 处 27 对;附图 1(img-009)在 (168,0) 处 25 对;附图 1(img-010)在 (32,0) 处 36 对。
- 反方论证:图表中的规则重复元素(坐标轴、刻度线、网格、边框、泳道条纹、面板分隔线)确实会产生同偏移匹配。但本案的特殊之处在于:(1)匹配数量在多张图上异常偏高(69 对、36 对、27 对),远超图表边框/网格通常的同偏移匹配数;(2)偏移位置在不同图间不规律((32,0)、(208,0)、(168,0)、(0,32)、(200,0)、(40,0)),难以用"统一坐标轴间距"统一解释;(3)8 张独立图同时出现强 copy-move 信号,构成系统性特征。论文原文中无任何关于"统一导出管线"、"统一软件工具"、"统一截图/渲染设置"的方法学描述,因此所提良性解释在原文中无正面支持,仅为通用推测。
- 证据:[I4] img-001 copy-move 偏移 (32,0) 69 对;[I6] img-002 偏移 (208,0) 15 对;[I8] img-003 偏移 (168,0) 24 对;[I10] img-004 偏移 (0,32) 12 对;[I12] img-005 偏移 (200,0) 25 对;[I14] img-006 偏移 (32,0) 15 对;[I16] img-007 偏移 (32,0) 18 对;[I18] img-008 偏移 (40,0) 27 对;[I20] img-009 偏移 (168,0) 25 对;[I22] img-010 偏移 (32,0) 36 对
- 严重程度:🟠
- 复核状态:⚠️ 存在疑点(图表类图片的规则重复元素确实可能产生同偏移匹配,但 10 张图同时出现异常高匹配数量且偏移位置不规律,所提良性解释在原文中无正面支持)
发现 6:图像取证 — 多张图存在噪声方差高度不均(疑似拼接信号)
- 位置:图 6、图 8、图 9、图 10、附图 1 等
- 描述:机器取证证据显示 7 张论文图片存在噪声方差高度不均(CV>1.2),被标记为"疑似图像拼接":img-003 CV=1.52、img-005 CV=1.31、img-006 CV=1.33、img-007 CV=1.37、img-008 CV=1.22、img-009 CV=1.26、img-010 CV=1.20。
- 反方论证:扫描件/翻拍件天然带照明梯度,单一 ⚠️ 不足以定罪。但本案 7 张独立图同时出现高 CV,且 CV 值集中在 1.20–1.52 区间,分布特征提示非随机噪声。论文原文中无任何关于"翻拍/扫描/拼接"的方法学描述,亦未声明图为扫描件或翻拍件,所提良性解释在原文中无正面支持。
- 证据:[I7] img-003 noise CV=1.52;[I11] img-005 CV=1.31;[I13] img-006 CV=1.33;[I15] img-007 CV=1.37;[I17] img-008 CV=1.22;[I19] img-009 CV=1.26;[I21] img-010 CV=1.20
- 严重程度:🟠
- 复核状态:⚠️ 存在疑点(多图高 CV 共同构成系统信号,但"扫描照明梯度"为通用托辞,原文无相关正面支持)
发现 7:Benford 联合检验严重偏离(第 3、4 位数字)
- 位置:全文数值数据(程序化统计计算)
- 描述:Benford 联合检验显示,第 1 位数字边缘异常(MAD=0.0208, χ²=44.7),第 2 位数字边缘异常(MAD=0.0238, χ²=111.9),第 3 位数字显著偏离(MAD=0.0833, χ²=1635.9),第 4 位数字显著偏离(MAD=0.1386, χ²=4518.4)。
- 反方论证:Benford 检验适用于跨数量级的自然产生数据。本论文的数值多为 t 检验统计量、回归系数及其标准误,属于受控范围的统计量输出(不是自然测量数据),Benford 检验的前提不严格满足。此外 p 值、自由度等统计量本身有特定分布,纳入 Benford 检验会产生系统性偏离。
- 证据:[S1] Benford 联合检验
- 严重程度:🟡
- 复核状态:⚠️ 存在疑点(Benford 检验前提对统计量输出类数据不严格满足,结论仅作线索;但第 3、4 位数字的严重偏离在多源数据中仍值得注意)
发现 8:末位数字分布严重不均匀
- 位置:全文表格数值数据(程序化统计计算)
- 描述:末位数字分布 χ²=69.5(p=0.0000),严重偏离均匀分布;奇偶比 394/846=0.47(轻微失衡,p=0.0500)。
- 反方论证:与 Benford 类似,末位数字均匀性检验同样适用于自然测量数据,对统计量输出(回归系数、标准误、t 值等)不严格适用,因为这些量通常只保留 2 位小数,末位数字受四舍五入和软件默认输出格式影响。但若 p 值、数据本身存在系统性圆整,末位分布确实会出现偏离。
- 证据:[S2] 末位数字多重异常(χ²=69.5, p=0.0000)
- 严重程度:🟡
- 复核状态:⚠️ 存在疑点(检验前提对统计量输出不完全适用,仅作线索)
发现 9:列间差值高度恒定(疑似加减法编造)
- 位置:表 2、表 4、表 5 及 APIM 模型结果(程序化统计计算)
- 描述:column_diff 检验在 66 个列对比较中触发三次警告,提示表格中不同列的数据之间存在可被简单加减运算还原的恒定关系。
- 反方论证:column_diff 检验适用于原始测量数据。本论文中的列数据多为统计量输出(t 值、回归系数、SE 等),它们之间在数学上确实存在可推导关系(如:SE 来自原始数据→方差估计→t 值→p 值)。这种结构性的数学关联是统计报告的正常特征,不必然指向造假。但若多组不相关的列对均呈现高度恒定差值,则仍值得注意。
- 证据:[S3][S4][S5] column_diff 检验 66 个列对
- 严重程度:🟡
- 复核状态:⚠️ 存在疑点(检验前提对统计量输出类数据不严格满足,仅作线索;统计量之间的数学结构性关联是正常特征)
发现 10:t 检验自由度模式异常(Welch 校正广泛使用)
- 位置:表 2、表 4 中多个 t 检验
- 描述:表 2 AUT 中"流畅性 t(95.77)=1.94"(n=49+53=102,Welch 校正后 df=95.77);"即时观点采纳 t(86.45)=3.93"(df=86.45);表 4 PIT 中 df=106.12, 102.33, 102.92, 102.47 等多个非整数自由度。
- 反方论证:Welch 校正 t 检验在方差不齐时给出非整数自由度,这是统计软件默认行为(如 R 的 t.test())。表 2 同列 df 从 99.97 到 86.45 不等,说明各变量方差异质性不同,符合自然实验数据的特征,不必然指向造假。多个非整数 df 反而是正确使用 Welch 校正的标志。
- 证据:表 2 中 t(99.97)=5.74, t(95.77)=1.94, t(86.45)=3.93, t(90.24), t(93.69), t(96.25), t(96.07), t(94.7), t(99.62);表 4 中 t(106.12), t(102.33), t(102.92), t(102.47), t(105.19), t(106.07), t(81.31), t(106.77), t(96.35)
- 严重程度:ℹ️
- 复核状态:⚠️ 依据不足(Welch 校正的非整数 df 是方差不齐时的正常统计输出,不能作为造假证据)
发现 11:GPT-5-mini 模型发布时间线存疑
- 位置:方法部分 2.2 节(Page 6)
- 描述:论文声称使用 GPT-5-mini 作为人智协作的互动对象,API 调用时间为 "2025年11月8日至2025年12月21日"。截至 2026 年 8 月,OpenAI 公开可用的模型包括 GPT-4o、GPT-4.1、o1、o3、o4-mini、GPT-5(2025 年 8 月发布)等。"GPT-5-mini" 作为 GPT-5 的轻量版本,OpenAI 官方在 2025 年底前是否已公开发布该型号的 API 文档,公开资料中无法严格核实。但 GPT-5 主模型于 2025 年 8 月发布后,OpenAI 后续推出 mini 版本属于行业惯例,"GPT-5-mini" 这一型号名称本身在 2025 年末至 2026 年的时间线上并非完全不可能存在。该数据点不能严格判定为"编造不存在的 AI 型号",但作为线索值得作者提供 API 调用日志以确认。
- 证据:"研究选取 GPT-5-mini 作为人智协作条件的互动对象";"API 调用时间为 2025年11月8日至 2025年12月21日"
- 严重程度:ℹ️
- 复核状态:⚠️ 依据不足(无法在公开资料中严格核实"GPT-5-mini"在 2025 年 11 月是否已有公开 API,但 GPT-5 mini 版本在时间线上并非完全不合理,需作者提供 OpenAI API 调用日志以确认)
发现 12:投稿时间与伦理审批时间
- 位置:方法部分 2.1 节、脚注
- 描述:论文声称"收稿日期:2026-04-17",伦理审批号为"CCNU-IRB-202506007A"(2025 年 6 月)。从伦理审批到收稿约 10 个月,合理。ChinaXiv 标注的版本日期为"2026-07-25"。AI API 调用时间为"2025年11月8日至2025年12月21日",意味着实验在伦理审批(2025年6月)后约5个月开始,符合顺序。
- 证据:"收稿日期:2026-04-17";伦理审批号 CCNU-IRB-202506007A
- 严重程度:ℹ️
- 复核状态:ℹ️ 时间线无明显冲突
耿同学辣评
一篇心理学实验论文,样本量在表 1、表 2、表 4 之间如同变魔术般从 114 变成 53 再变成 55,正文说"AUT 有效被试 155 名"但 49+53=102,这数据组织到底是怎么算的?APIM 模型里"角色"变量在双人协作条件下恒为 0,存在完全共线性却被塞进模型,这是教科书级别的设定错误。再加上用 AI 自己给自己打分、努力程度和兴趣显著高于人类(d>1.7),还当成核心证据用——AI 自评不能等同于人类自省,这是方法论上的根本缺陷。多张图片同时出现异常高的 copy-move 信号(69 对、36 对匹配块),且偏移位置不规律,提示图片可能存在非自然复制。在"不足与展望"中作者主动承认了 IOC 指标局限性和 AI 问卷的不可解释性,这一点值得肯定,但样本量混乱和模型共线性是更基础的问题。耿同学建议:先把这几个表格的样本量单位(团体 vs 个体)和计算口径理清楚再说吧。
建议后续行动
- 联系作者要求提供原始实验对话记录和 API 调用日志
- 要求作者明确各表格中样本量是"团体数"还是"个体数",并提供剔除去向明细
- 要求作者重新检验 APIM 模型中"角色"变量的共线性问题,提供双人协作条件下的子样本分析
- 要求作者提供 GPT-5-mini 的 OpenAI API 调用日志以确认模型可用性
- 向 ChinaXiv 平台举报并要求公开原始数据
- 向作者所在机构(华中师范大学心理学院)学术委员会举报
⚠️ 免责声明
本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。
🧮 证据合成(自动生成)
- 综合后验概率:≥99.9%(先验 5%)
- 95% 可信区间:[100%, 100%]
- 贝叶斯因子:BF = 1.37e+15(决定性(decisive))
- 综合评级:🔴 高度疑似
- 复核已排除线索:10 条(良性解释成立 / 检验前提不满足 / 说明性条目,未计入合成)
贡献最高的证据:
- [S5] 列间差值高度恒定 — 数据非实验测量而是加减法编造(stats/column_diff,logLR=1.87)— 贡献 6.7%
- [I18] [img-008.png] 检测到 copy-move 复制粘贴:偏移 (40,0) 处 27 对匹配块(image/copy_move,logLR=1.46)— 贡献 6.1%
- [S3] 列间差值高度恒定 — 数据非实验测量而是加减法编造(stats/column_diff,logLR=1.87)— 贡献 5.5%
- [I20] [img-009.jpg] 检测到 copy-move 复制粘贴:偏移 (168,0) 处 25 对匹配块(image/copy_move,logLR=1.46)— 贡献 5.4%
- [S4] 列间差值高度恒定 — 数据非实验测量而是加减法编造(stats/column_diff,logLR=1.87)— 贡献 5.3%
免责:本小节由程序化贝叶斯合成自动生成,不构成学术不端判决。先验固定 5%,证据间按条件独立处理(可能高估相关证据的联合强度),LR 版本 geng_lr_v3(Phase 5 基准回归校准:任务级触发率比值+复核处置标签,n=11,向 v2 收缩 k=10);可信区间与点估计来自同一后验(先验抽样 + LR 噪声的联合蒙特卡洛,区间随证据强度收敛)。请以正文具体发现与原始数据为准。