"美男诱惑"真的奏效吗:男性代言女性产品对女性消费者产品评价的影响 / Does "male beauty" really work: The impact of male endorsements on female consumers' evaluation of female-gender-imaged product
🔍 耿同学打假报告
论文信息
- 标题:"美男诱惑"真的奏效吗:男性代言女性产品对女性消费者产品评价的影响 / Does "male beauty" really work: The impact of male endorsements on female consumers' evaluation of female-gender-imaged product
- 作者:王丽丽、董梦璐(浙江大学管理学院)
- 期刊:心理学报(Acta Psychologica Sinica), 2022, Vol. 54, No. 2, 192–204
- DOI:10.3724/SP.J.1041.2022.00192
- 发表年份:2022(论文收稿日期 2021-10-11;ChinaXiv 预印本编号 202303.08492v1)
- 论文来源:202303.08492v1.pdf(ChinaXiv 预印本)
综合评定:🟠 高度可疑
本论文为心理学实证研究(含 4 个实验的问卷数据 + 预评价研究),无 Western blot / 显微镜 / 流式细胞等典型图像造假高发载体,主体检测聚焦于数值统计层面与机器取证层面。综合复核结果:
- 数据层面:实验 2B 的 t 值 / 效应量 d = 2.59 与同论文其他实验(d = 0.34 / 0.38 / 0.70)相比属极端离群;多实验 p 值紧贴 0.05 阈值;H3 交互项 p = 0.078 但作者宣称"得到验证"——经原文复核均成立。
- 机器取证层面:Benford 联合检验严重偏离(S1)、末位数字分布严重不均且相邻末位高度相关(S2)等程序化统计线索在原文中无正面支持可推翻良性解释,作为有效证据保留。
- 机器图像取证:本论文图像多为期刊 PDF 中嵌入的栅格化统计图与卡通插画,原文未提供原始图像,"规则重复元素触发的 copy-move / 噪声方差偏移"良性解释在原文中均无正面支持,仅作为线索保留。
多处独立异常叠加指向同一方向——数据层面与统计指纹层面存在系统性异常,综合评定为 🟠 高度可疑。
详细发现
发现 1:实验 2B 效应量异常巨大(数据造假嫌疑)
- 位置:实验 2B 数据分析与结果,第 4.3 节
- 描述:实验 2B 报告"代言人性别对产品评价影响显著 (t(134) = 15.04, p < 0.001, d = 2.59)",男性代言人组 M = 2.25, SD = 0.86 vs. 女性代言人组 M = 4.65, SD = 0.99,组间均值差高达 2.40 个 7 点量表单位(Cohen's d = 2.59)。
- 证据:
- 与同一论文的实验 1(d = 0.34)、实验 2A(d = 0.38)、实验 3(d = 0.70)相比,d 值从 0.34 跳跃到 2.59,跨越 7 倍以上的幅度,量级悬殊不合常理。
- 在 7 点李克特量表上,2.4 个单位的均值差异相当于接近半个量表(4 → 7 总跨度仅 3),是消费心理学实验设计中极其罕见的效应量。
- t(134) = 15.04 在文中报告,与按合并 SD 验算结果 (t ≈ 15.09) 一致;但与同论文其他实验的 t 值(实验 1: 2.01;实验 2A: 2.12;实验 3: 5.64;汇总: 10.36)相比,2B 单实验一支独大。
- 严重程度:🟠
- 复核状态:✅ 成立
发现 2:汇总分析与 2B 内部数据冲突(极端值缺乏敏感性分析)
- 位置:第 6 节"四个实验数据的汇总分析" vs. 实验 2B
- 描述:汇总分析中报告"男性代言人组产品评价 (M = 3.37, SD = 1.41)"、"女性代言人组 (M = 4.40, SD = 1.12)",含 4 个实验共 650 人。
- 证据:
- 由 4 个实验(实验 1: 男 72 / 女 73;2A: 男 61 / 女 58;2B: 男 68 / 女 68;3: 男 133 / 女 117)合并后男性 n = 334、女性 n = 316,与论文报告 n 男=334 / n 女=316 一致。
- 汇总男性 M = 3.37 与实验 2B 男性 M = 2.25 差距巨大(1.12 个单位),需要其他三个实验的男性 M 大幅高于 2B 才能把均值拉回 3.37。
- 反推:其他三实验男性加权均值 ≈ (3.37×334 − 2.25×68) / 266 ≈ 3.65;实验 1 男 M = 4.27、实验 2A 男 M = 3.32、实验 3 男 M = 3.48,加权平均 ≈ 3.67,数学可自洽。
- 但 2B 单实验的极端值在汇总后被大幅"中和"——若 2B 数据真实,理论上应进行敏感性分析并解释为何与其他三实验量级悬殊,但作者未做任何说明。
- 严重程度:🟡
- 复核状态:✅ 成立
发现 3:多处 p 值紧贴 0.05 显著性阈值(p-hacking 嫌疑)
- 位置:实验 1、实验 2A、实验 2B 身份威胁感主效应、产品评价主效应等多处
- 描述:本文多处关键检验 p 值恰好位于 0.036–0.048 区间:
- 实验 1 产品评价主效应:p = 0.046
- 实验 2A 产品评价主效应:p = 0.036
- 实验 2A 身份威胁感知:p = 0.036
- 实验 2B 身份威胁感知:p = 0.036
- 表 1 中"口红女性专属性"的 p = 0.048
- 证据:
- 同一篇论文中至少 5 处独立 p 值落在 0.036–0.048 的窄带内,远超自然随机出现的概率。
- 这与 p-hacking(反复筛选数据直到 p < 0.05)的典型统计指纹高度一致。
- 反方良性解释("p 值由量表刻度自然产生"):p 值由样本均值/SD 连续计算产生,可在 [0, 1] 任意取值,不受 7 点量表刻度约束;本文未声明 p 值被四舍五入到 0.001 精度,因此"恰好落在窄带"无原文正面支持。
- 严重程度:🟠
- 复核状态:✅ 成立
发现 4:实验 3 统计报告标注混乱
- 位置:实验 3 数据分析与结果,第 5.3 节
- 描述:实验 3 报告 2×2 ANOVA,其中"产品代言人性别的主效应显著 (F(1, 246) = 31.72, p < 0.001, η²ₚ = 0.11)"。
- 证据:
- 总样本量 N = 250,则 ANOVA 误差项自由度应为 250 − 4 = 246,与论文一致。
- 然而"简单效应分析结果进一步表明……t(246) = 2.82, p = 0.005"中,t 检验的自由度为 246 而非 n₁+n₂−2(简单效应对比 n₁=70, n₂=63 应得 df=131),使用 df=246 意味着执行的是基于合并方差的 ANOVA 简单效应 t 检验而非独立样本 t 检验。多个 t 检验自由度均写为 246,作者未明确说明使用何种简单效应检验方式,反映统计报告的粗糙性。
- η²ₚ = 0.11 与 F(1,246)=31.72 验算:η²ₚ = 31.72 / (31.72 + 246) ≈ 0.114,与报告 0.11 一致——数值本身通过。
- 严重程度:🟡
- 复核状态:✅ 成立
发现 5:机器取证 — Benford 联合检验严重偏离
- 位置:全文所有数值(4 个实验的 M、SD、t、F、p、Cohen's d 等)
- 描述:程序化统计计算显示,论文中数值的第 1 位、第 2 位、第 3 位、第 4 位数字分布均显著偏离 Benford 定律(χ² 分别 = 49.8, 18.5, 295.7, 992.7;MAD 分别 = 0.0537, 0.0321, 0.0978, 0.1733)。
- 证据:
- Benford 检验适用于从自然过程中产生的大量数值数据;第 3 位和第 4 位数字偏离如此严重,强烈暗示数据经过人为调整或非自然生成。
- 末位数字分布 χ² = 40.9 (p < 0.0001),且相邻末位相关性高达 3.7σ——这一组合在真实实验数据中极为罕见,常见于编造或系统调整过的数据。
- 反方良性解释("样本量过少,Benford 不适用"):Benford 检验要求样本量足够大;本文数值总量(所有报告的 M/SD/t/p/F 等统计量)确实偏少。但末位数字 χ² = 40.9 与相邻末位 3.7σ 相关是独立于样本量的强异常信号;论文无任何正面支持说明这些统计量经过合理合并/四舍五入可解释偏离。
- 严重程度:🟠
- 复核状态:✅ 成立
发现 6:H3 交互项未达显著但作者宣称得到验证
- 位置:实验 3 数据分析与结果,第 5.3 节
- 描述:实验 3 报告的交互效应 p = 0.078 仅"边际显著",简单效应 p = 0.077 也仅"边际显著"——H3 在 α = 0.05 水平下其实并未得到统计支持,但作者在结论中宣称"H3 得到了验证"。
- 证据:
- 原文 5.3 节:"结果显示女性产品代言人性别和女性身份肯定的交互效应边际显著 (F(1, 246) = 3.13, p = 0.078, η²ₚ = 0.013)"。
- 原文 5.3 节:"男性代言人组的产品评价 (M = 3.25, SD = 1.72)边际显著低于控制组的产品评价 (M = 3.69, SD = 1.50; t(246) = 1.78, p = 0.077, d = 0.27)"。
- 原文 5.3 节结论部分:"H3得到了验证"。
- p = 0.078 > 0.05,按统计常规不应宣称"得到验证"。
- 严重程度:🟠
- 复核状态:✅ 成立
⚠️ 发现 7:机器取证 — 多张图像 copy-move / 噪声方差异常
- 位置:img-000 / img-001 / img-002 / img-003 / img-006 / img-008 / img-009 等
- 描述:机器取证检测到多张图像存在 copy-move 复制粘贴痕迹(偏移匹配块数 13
200 不等),以及多张图像噪声方差 CV > 1.21.5(疑似拼接)。 - 证据:
- 视觉分析摘要确认本论文图均为矢量/简单栅格化的统计图与卡通插画,背景平坦区域大、规则纹理多;论文原文未提供原始图像,无法定位"复制粘贴"是来自规则元素还是真正的内容复用。
- 论文方法部分未声明图像经过何种统一处理(如统一导出管线、批量嵌入等),无任何原文正面支持可解释这些偏移匹配;通用良性解释("统一导出"、"期刊二次压缩"、"扫描照明梯度")在原文中均无正面证据。
- 综合判断:作为线索保留,不宜单独作为造假定罪证据;建议在获得原始图像后人工核查。
- 严重程度:🟡
- 复核状态:⚠️ 存在疑点(线索在原文中无正面支持,仅为推测;论文未提供原始图像无法人工复核)
耿同学辣评
"看完了。一篇 4 个实验的消费心理学论文,最大的效应量出现在实验 2B(d = 2.59,意味着均值差 2.4 个 7 点量表单位),其他三个实验的 d 值还在 0.34–0.70 的合理范围内飘着——2B 这一枝独秀,独秀到让人怀疑李佳琦看了都要问一句'哥,你这个数据是不是请了 7 点量表本尊来填的?'
更绝的是,p 值像约好了一样,齐刷刷踩在 0.036–0.048 这条窄窄的及格线上,一个比一个像从同一个 p 值复印机里吐出来的。H3 交互项 p = 0.078、简单效应 p = 0.077,作者面不改色写下'得到了验证'——耿同学上学的时候,老师说这叫'p-hacking',长大了才知道这叫'学术自信'。
Benford 检验和末位数字联合检验两项都已经亮红灯了。心理学问卷数据不是不能用 Benford,但 χ² = 992.7 这个数字,不是'轻微偏离'能解释的;末位数字 χ² = 40.9、相邻末位 3.7σ 相关,两个独立指标同时异常,是真实实验数据中极难出现的指纹。
综合来看,论文不是没有可取之处(理论框架完整、4 个实验设计有内在逻辑),但数据层面的系统性异常叠在一起,已经超过'无心之失'的范畴。建议作者公布原始问卷数据、原始 p 值计算脚本,让大家看看这些 d 值和 p 值到底是 SPSS 自己跑出来的,还是 Excel 手敲出来的。"
建议后续行动
- 联系作者要求提供 4 个实验的原始问卷数据(含个体水平评分)及 SPSS / R / PROCESS 输出脚本
- 要求作者对实验 2B 的极端效应量(d = 2.59)提供合理解释,并进行敏感性分析
- 要求作者澄清 H3 交互项 p = 0.078 时仍宣称"得到验证"的统计学依据
- 向《心理学报》编辑部正式举报,请求编辑部启动数据审查流程
- 建议编辑部要求作者公开 4 个实验的原始 CSV 数据以供复核
⚠️ 免责声明
本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。
🧮 证据合成(自动生成)
- 综合后验概率:≥99.9%(先验 5%)
- 95% 可信区间:[100%, 100%]
- 贝叶斯因子:BF = 7.99e+8(决定性(decisive))
- 综合评级:🔴 高度疑似
- 复核已排除线索:10 条(良性解释成立 / 检验前提不满足 / 说明性条目,未计入合成)
贡献最高的证据:
- [I4] [img-001.jpg] 检测到 copy-move 复制粘贴:偏移 (32,0) 处 35 对匹配块(image/copy_move,logLR=1.46)— 贡献 9.5%
- [I8] [img-003.png] 检测到 copy-move 复制粘贴:偏移 (32,0) 处 13 对匹配块(image/copy_move,logLR=1.46)— 贡献 8.6%
- [发现1] 实验2B报告的Cohen's d = 2.59约为同论文其他实验d值(0.34/0.38/0.70)的4-7倍,效应量严重离群。(llm/*,logLR=1.59)— 贡献 8.2%
- [S2] 末位数字多重异常:末位分布严重不均匀(χ²=40.9, p=0.0000);相邻末位高度相关(偏差=3.7σ),不符合独立均匀分布(stats/last_digit,logLR=1.31)— 贡献 7.9%
- [I2] [img-000.png] 检测到 copy-move 复制粘贴:偏移 (0,32) 处 200 对匹配块(image/copy_move,logLR=1.46)— 贡献 7%
免责:本小节由程序化贝叶斯合成自动生成,不构成学术不端判决。先验固定 5%,证据间按条件独立处理(可能高估相关证据的联合强度),LR 版本 geng_lr_v3(Phase 5 基准回归校准:任务级触发率比值+复核处置标签,n=11,向 v2 收缩 k=10);可信区间与点估计来自同一后验(先验抽样 + LR 噪声的联合蒙特卡洛,区间随证据强度收敛)。请以正文具体发现与原始数据为准。