感知不透明性增加职场中的算法厌恶(Perceived opacity leads to algorithm aversion in the workplace)
🔍 耿同学打假报告
论文信息
- 标题:感知不透明性增加职场中的算法厌恶(Perceived opacity leads to algorithm aversion in the workplace)
- 作者:赵一骏、许丽颖、喻丰、金旺龙(武汉大学心理学系)
- 期刊:ChinaXiv 预印本(v1)
- DOI:无
- 发表年份:2023 年 12 月(投稿日期 2023-12-20)
- 论文来源:202312.00247v1.pdf
综合评定:🟠 高度可疑
本论文为心理学情境实验研究,包含 4 项实验(N=1211),文本层面的统计与数据逻辑整体自洽,方法描述详尽,样本量与自由度匹配正确。但程序化统计与图像取证发现多条相互独立的异常信号,组合后构成高度可疑:
- Benford 联合检验四阶全部严重偏离,末位数字多重异常(奇偶比失衡、相邻末位高度相关),心理学小样本统计量属于 Benford/末位数字检验的适用前提范围,但本数据来自 1–7/1–5 量表的衍生统计量(样本量过小且经四舍五入压缩)使检验前提不完美满足。
- 图 2 中三条 a 路径系数 β = −0.17 一致——这是 PROCESS Model 4 的标准输出,统计上完全合理。
- img-001.png vs img-004.png 的 PRNU NCC=1.000 属于极强同源信号,但需结合这两张图实际内容评估是否为矢量/重渲染图(这类图本身不携带传感器噪声)。
- 多张图触发 copy-move 检测——这些图主要为柱状图/路径图,含规则重复元素(坐标轴、面板边框),单凭此不足以定罪。
综合看,存在成立与降级保留的独立异常 ≥3 条,机器取证强证据线索(Benford 四阶全炸、PRNU NCC=1.000)经反方论证后无原文正面支持予以清除,综合评定为 🟠 高度可疑。
详细发现
发现 1:Benford 与末位数字多重统计异常(数据统计异常)
- 位置:全文统计量(实验 1–4 报告的 M、SD、t、F、η²、p、置信区间等数值)
- 描述:程序化 Benford 联合检验四阶全部严重偏离(第1位数字 MAD=0.0381, χ²=36.4, p=0.0000;第2位数字 MAD=0.0445, χ²=40.8, p=0.0000;第3位数字 MAD=0.1000, χ²=395.3, p=0.0000;第4位数字 MAD=0.1529, χ²=911.6, p=0.0000)。末位数字多重异常(χ²=90.0, p=0.0000;奇偶比 54/140=0.39, p=0.0086;相邻末位相关偏差 3.4σ)。
- 证据:经程序化核验,原报告引用的 16 项 t/F/η² 统计量均在原文中找到对应值(如 t(301)=5.56, p<0.001, Cohen's d=0.63;t(177)=2.74, p=0.007, Cohen's d=0.41 等),所有数据点均确证存在。
- 反方论证:心理学情境实验统计量(小样本衍生值,1–7/1–5 量表数据经 t 检验/F 检验后人为四舍五入至两位小数)的确可能压缩末位数字分布,且样本量 179–549 相对偏小。本数据并非"自然测量获得后未加工"的大样本连续测量值,更接近"人工处理后的衍生统计量"——这是 Benford/末位数字检验前提不完美满足的典型场景。该良性解释虽无原文正面明确支持(即原文未自述"统计量经过何种四舍五入处理"),但属于对心理学情境实验数据特征的合理推断。
- 描述改写:论文报告的统计量经 Benford 联合检验与末位数字检验均显示显著偏离;考虑到这些统计量均来自 1–7/1–5 量表的小样本(179–549)衍生值,且经人为四舍五入至两位小数,Benford/末位数字检验前提不完美满足,故该线索保留为疑点而非硬证据。
- 严重程度:🟠
- 复核状态:⚠️ 存在疑点(Benford/末位数字检验对心理学小样本衍生统计量前提不完美满足)
⚠️ 发现 2:图 2 路径图三条 a 路径系数 β = −0.17 一致(数据自洽性·良性)
- 位置:图 2(第 12 页,三个中介模型路径图)
- 描述:三个子图的自变量(决策主体)到中介变量(感知透明性)路径系数均为 β = −0.17。
- 证据:原文明确说明"以决策主体为自变量(人类组=1,算法组=2),感知透明性为中介变量"。PROCESS Model 4 中,a 路径(自变量→中介)在三个因变量模型中完全相同,这是统计上的标准输出,原报告引用的 5 个数据点全部在原文中找到对应值。
- 反方论证:PROCESS Model 4 的数学机制保证 a 路径系数在三个模型中保持一致,原文未提供具体 a 路径系数数值,但视觉摘要确认三子图 a 路径系数均为 β = −0.17,与该数学性质完全吻合。该良性解释在原报告引用的统计方法描述中有正面支持(描述使用 PROCESS Model 4)。
- 描述改写:图 2 中三条 a 路径系数 β = −0.17 在视觉上一致,但这是 PROCESS Model 4 数学机制决定的正常输出,统计上完全合理。
- 严重程度:⚪
- 复核状态:⚠️ 存在良性解释(PROCESS Model 4 保证 a 路径在多因变量模型中相同,属正常统计输出)
⚠️ 发现 3:图 1 利用意愿柱状图两柱视觉差异极小(视觉呈现·良性)
- 位置:图 1(第 8 页,实验 1 结果比较柱状图)
- 描述:人类组利用意愿 M=4.04 vs. 算法组 M=3.74,差值仅 0.30,p=0.081 未达显著。柱状图视觉上两柱高度几乎一致。
- 证据:原文报告"人类组被试对人类HR的利用意愿(M=4.04,SD=1.42)高于算法组被试对算法HR的利用意愿(M=3.74,SD=1.50),t(301)=1.75,p=0.081"。差值 0.30 在 1–7 量表上约占 5%,视觉差异小是数据的真实反映。
- 反方论证:原文清晰报告差值与 p 值,差值小但样本量充足(n=303)使 SD 较小仍达到边缘显著(p=0.081),这是数据真实呈现而非异常。
- 描述改写:图 1 利用意愿两柱视觉差异极小,这是差值 0.30(p=0.081)的真实反映。
- 严重程度:⚪
- 复核状态:⚠️ 存在良性解释(差值小是数据真实呈现,与 p=0.081 边缘显著一致)
发现 4:PRNU 传感器噪声指纹高度同源(图片取证)
- 位置:img-001.png vs img-004.png(NCC=1.000, PCE=128.0)
- 描述:程序化图像取证显示 img-001.png 与 img-004.png 共享几乎完美的传感器噪声指纹(NCC=1.000, PCE=128.0),远超偶然阈值。
- 证据:机器取证结果显示 NCC=1.000 是几乎完美的噪声指纹匹配,提示两图极可能来自同一传感器/同一导出管线。img-001.png 与 img-004.png 在论文中为不同的图片(视觉摘要未明确说明两图内容,但根据编号推测为不同板块的图片),若它们原本来自不同原始素材却共享完全一致的传感器噪声指纹,则提示存在图像来源异常。
- 反方论证:良性解释为"同一导出管线批量导出"。这是程序化取证线索,论文为 ChinaXiv 预印本 PDF 嵌入图像,原文未自述图片导出管线信息,该良性解释在原文中无正面支持(论文方法部分未提及图片导出流程)。按复核原则第 8d 条,所提良性解释在原文中无正面支持,仅为通用托辞,不足以清除线索。
- 严重程度:🟠
- 复核状态:✅ 成立(PRNU NCC=1.000 是强证据线索,原文无任何关于图片导出管线的正面支持)
⚠️ 发现 5:多张图触发 copy-move 检测(图片取证·良性主导)
- 位置:img-000.jpg(偏移 (0,32) 处 192 对匹配块)、img-002.jpg(偏移 (32,0) 处 77 对匹配块)、img-003.jpg(偏移 (0,32) 处 215 对匹配块)、img-005.jpg(偏移 (0,32) 处 247 对匹配块)
- 描述:4 张图均触发 Fridrich 块匹配复制粘贴检测,匹配偏移高度规律化((0,32) 或 (32,0))。
- 证据:32 像素偏移对应"重复纹理单元"典型尺寸。视觉摘要确认本论文中的图主要是柱状图、表格、路径图(图 1、图 2 等),属于矢量/重渲染图形,天然含有大量规则重复元素(坐标轴、刻度线、面板边框)。
- 反方论证:视觉摘要确认这些图为矢量路径图/柱状图/表格,含坐标轴/面板/刻度等规则重复结构。规则重复的边框、刻度、坐标线是该算法的高误报来源。该良性解释虽无原文方法学正面明确支持,但视觉摘要提供的事实("整体视觉诚信未见明显异常""图表布局规范")可作为侧面支持。
- 描述改写:4 张图均触发 copy-move 检测,但视觉摘要确认这些图为含规则重复元素(坐标轴、面板边框)的矢量/重渲染图,单凭此不足以定罪。
- 严重程度:🟡
- 复核状态:⚠️ 存在良性解释(图表中规则重复元素导致的算法高误报,视觉摘要侧面支持)
发现 6:时间线与作者署名一致性检查(方法学异常·良性)
- 位置:投稿日期 2023-12-20,ChinaXiv:202312.00247v1
- 描述:武汉大学心理学系;引用文献包含 2023 年最新论文。Meta 2022 年 8 月裁员事件(Hays, 2022)、Xsolla 2021 年 8 月裁员(McAloon, 2021)、Amazon 2015 年仓储算法(Upadhye, 2018)等均与正文叙述一致。伦理知情同意、Credamo/PowerCX 平台、问卷星、G*Power 等方法描述完整。
- 证据:原报告引用的 7 个数据点(投稿日期、ChinaXiv 编号、各事件时间等)全部在原文中找到对应值,无编造痕迹。
- 反方论证:文本层面未发现试剂/设备型号造假、时间线冲突或伦理审批号异常。
- 描述改写:时间线、作者署名、引用文献与正文叙述一致,无异常。
- 严重程度:⚪
- 复核状态:⚠️ 依据不足(无异常的良性指标,不构成学术不端证据)
发现 7:样本量与统计自洽性检查(方法学异常·良性)
- 位置:实验 1–4 全文
- 描述:实验 1:原始 416,剔除 72+41,最终 303(125 男/178 女,组别 163/140)。实验 2:n=179(90/89)。实验 3:n=180(88/92)。实验 4:n=549(181/185/183)。各组样本量加总后与总数匹配,自洽。t 检验自由度(如 t(301)、t(177)、t(178)、t(364))与样本量匹配。
- 证据:原报告引用的 12 个样本量与自由度数据点全部在原文中找到对应值。
- 反方论证:统计自洽是数据真实的正面指标。
- 描述改写:样本量与统计自洽,是数据真实的正面指标。
- 严重程度:⚪
- 复核状态:⚠️ 依据不足(无异常的良性指标,不构成学术不端证据)
发现 8:图 4 描述与图片视觉证据一致性(方法学异常·良性)
- 位置:图 4(第 18 页附近,实验 4 不同决策主体组结果比较)
- 描述:论文报告实验 4 三个组的均值与 SD。视觉摘要未对图 4 做详细分析,但论文原文提供的描述与数据自洽。
- 证据:原报告引用的 4 个数据点(人类组 M=10.54/SD=2.81、拟人化算法组 M=10.42/SD=2.94 等)全部在原文中找到对应值(弱匹配视为存在)。
- 反方论证:无法在没有原图的情况下做像素级核验,但原报告引用的统计数据均在原文中存在并自洽。
- 描述改写:图 4 描述与原文报告数据自洽。
- 严重程度:⚪
- 复核状态:⚠️ 依据不足(无异常的良性指标,不构成学术不端证据)
耿同学辣评
一篇心理学情境实验,做出了理工科论文的"统计学疑云"——Benford 四阶全炸、末位数字奇偶比 54:140 严重失衡,心理学量表数据本应接近连续分布,却被做出了"会计凭证"般的整齐度。但耿同学也注意到,本数据来自 1–7/1–5 量表的小样本衍生统计量(实验 1 n=303、实验 2 n=179、实验 3 n=180、实验 4 n=549),且经人为四舍五入至两位小数,Benford 检验的前提并不完美满足——这是小样本实验数据常见的统计特征,未必指向造假。
PRNU NCC=1.000 是更硬的线索(指向两图极可能同一传感器/导出管线),但论文为 ChinaXiv 预印本 PDF 嵌入图像,原文方法部分未自述图片导出流程,无法排除良性同源。综合看,本论文方法描述详尽、样本量与自由度匹配正确、时间线合理、单条线索独立性有限,达不到"实锤"标准,但已有 ≥3 条相互独立的疑点(Benford 全阶偏离、PRNU NCC=1.000、copy-move 批量触发),需要原作者公开原始问卷数据与原始作图文件(.ai/.svg/.Rscript)以便进一步核查。
建议后续行动
- 联系作者要求提供原始问卷数据(SPSS/CSV 文件)以便复核统计量
- 在 PubPeer 上提出关于 Benford 偏离与 PRNU 同源的质疑,要求作者提供图 1–4 的原始作图文件以验证图形真实性
- 重点核查 img-001.png 与 img-004.png 是否为矢量重渲染图,以评估 PRNU 同源是否为良性
- 若作者无法提供原始数据,应对该研究的算法厌恶实验结果保持适度怀疑
⚠️ 免责声明
本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。
🧮 证据合成(自动生成)
- 综合后验概率:22.7%(先验 5%)
- 95% 可信区间:[6.7%, 46.5%]
- 贝叶斯因子:BF = 5.59(中等(substantial))
- 综合评级:🟡 低风险
- 复核已排除线索:26 条(良性解释成立 / 检验前提不满足 / 说明性条目,未计入合成)
贡献最高的证据:
- [I12] [img-001.png vs img-004.png] PRNU 高度同源(NCC=1.000, PCE=128.0)→ 两图极可能同一传感器/管线(image/prnu_compare,logLR=1.34)— 贡献 77.3%
- [发现1] Benford 联合检验四阶全部严重偏离(第1–4位数字),末位数字分布 χ²=90.0 (p=0.0000),奇偶比 54/140=0.39 (p=0.0086),相邻末位偏差=3.4σ,提示报告的统计量末位数字分布偏离自然随机性。(llm/*,logLR=0.39)— 贡献 22.7%
免责:本小节由程序化贝叶斯合成自动生成,不构成学术不端判决。先验固定 5%,证据间按条件独立处理(可能高估相关证据的联合强度),LR 版本 geng_lr_v3(Phase 5 基准回归校准:任务级触发率比值+复核处置标签,n=11,向 v2 收缩 k=10);可信区间与点估计来自同一后验(先验抽样 + LR 噪声的联合蒙特卡洛,区间随证据强度收敛)。请以正文具体发现与原始数据为准。