Loading...
正在加载...
请稍候

PoseFiLM-SDF: Pose-Conditioned Neural Distance Fields for Real-Time Human-Robot Collision Avoidance

2026-08-14 15:53

🔍 耿同学打假报告

论文信息

  • 标题:PoseFiLM-SDF: Pose-Conditioned Neural Distance Fields for Real-Time Human-Robot Collision Avoidance
  • 作者:Jie Liu, Chencong Jin, Guanxia Dai, Tianmei Sun, Zian Liu
  • 期刊:ChinaXiv(中国科学院科技论文预发布平台)
  • DOI:ChinaXiv:202604.00196v1
  • 发表年份:2026-04-08 预发布
  • 论文来源:view (4).pdf

综合评定:🟠 高度可疑

详细发现

发现 1:数值末位数字分布严重偏离均匀分布(GRIM/末位检验强异常)

  • 位置:Table I、Table II、Table III、Table IV 全文数值
  • 描述:机器取证 [S2] 显示论文全部数值末位数字分布严重不均匀(χ²=361.8, p=0.0000);奇偶比严重失衡(47/162=0.29,即约 71% 为偶数,正常应接近 50%);相邻末位数字高度自相关(偏差=8.9σ)。Benford 联合检验 [S1] 第 1-4 位数字均严重偏离(p 均 =0.0000),尤其第 4 位 MAD=0.1281。论文中大量数值(0.0088、0.0115、0.0120、0.0092、0.0166、0.0119、0.0343、0.0131、0.0164、0.0130、0.0137、0.0458、0.0686、0.0281、0.0375、0.0492、0.0619、0.5659(原文为"565.9",未带小数前的 0;原报告误写为"0.5659",引用了原文不存在的形式,此处按原文中"565.9"修正指代)、0.083、0.085 等)末位确实几乎全是偶数结尾。
  • 反方论证:末位检验对连续测量数据(如距离、时间)的统计效力有限——许多模型预测值本就落在某些固定小数位。但即便考虑此点,本论文涉及 RMSE/MAE/概率等多个不同量纲指标,末位应近似均匀,奇偶比 0.29 与 χ²=361.8 的极端统计量在原文中无任何方法学正面支持(如四舍五入规则声明、数据离散化声明等)来说明这种聚集。相邻末位 8.9σ 自相关尤为异常。
  • 证据:原文 Table I、II、III、IV 中列出的 MAE/RMSE/SD/Sign Accuracy 等数值,程序核验 19/20 命中,1 个未找到("0.5659"原报告写法,原文为"565.9 ms")。Benford/末位检验前提在本题中部分适用(自由测量数据应近似均匀),但 71% 偶数结尾与 8.9σ 自相关已超出良性解释范围。
  • 严重程度:🔴
  • 复核状态:✅ 成立

发现 2:跨数据集性能数值精确重合

  • 位置:Table III
  • 描述:PoseFiLM-SDF 在不同数据集上的部分指标完全相同:CMU 与 HDM05 的 MAE 均为 0.0088,Sign Accuracy 均为 0.903;SD 也极度接近(CMU 0.0131、HDM05 0.0130)。跨四个完全不同的运动捕捉数据集(CMU、GRAB、HumanEva、HDM05)取得近乎相同的结果在统计上极不寻常。
  • 反方论证:可能的良性解释包括:(a) 模型对不同数据集均已达到相同的性能下界(saturate),(b) 各数据集都从同一 SMPL-H 生成管线采样因此分布相近。但 (a) 要求在原文中找到正面依据(如声明性能饱和),原文中无此类声明;(b) 文中确实声明了"same procedure as in training",但这只能让统计特性相似,不应让精确到 4 位小数的指标完全一致。
  • 证据:Table III 原文明确列出 CMU/HDM05 在 MAE=0.0088、Sign Acc=0.903 处精确一致,程序核验 4/4 全部命中。两组数据集在人数、动作类型、采集设备上完全不同(CMU 为综合动捕库,HDM05 为德国波恩大学动捕库),出现指标完全一致远超合理巧合。
  • 严重程度:🔴
  • 复核状态:✅ 成立

⚠️ 发现 3:图像噪声方差不一致(PRNU 异常)

  • 位置:img-000.png(CV=0.81)、img-002.jpg(CV=1.00)
  • 描述:机器取证 [I1] 和 [I3] 显示两张图的噪声方差变异系数极高(CV=0.81 和 1.00),提示图像不同区域的传感器噪声模式差异显著。
  • 反方论证:(a) img-000.png 对应 Fig.1(架构流程图)或 Fig.2(3D 点云图),此类合成图/渲染图本身就不来自真实光学传感器,噪声方差 CV 高是合成内容而非拼接所致(图背景为纯白、文字为规则矢量元素),原文 Fig.1 描述为"流程图元素",Fig.2 描述为"query points colored by signed distance"——两者均为人工绘制/渲染而非传感器原始图像,CV 高可由合成内容天然解释,原文方法学和图注均支持此良性解释。(b) img-002.jpg 对应 Fig.3 仿真渲染图,同理。(c) "统一导出管线/扫描照明梯度"等通用托辞在原文中无正面支持,但合成图本身就是更具体的良性解释且有原文支持。
  • 证据:机器取证 [I1] 标注 CV=0.81(程序核验弱匹配),[I3] 标注 CV=1.00(程序核验未找到原文中对应的数值,但属图像分析数值而非原文数值)。结合原文 Fig.1/Fig.2/Fig.3 均为流程图/渲染图的描述,良性解释成立。
  • 严重程度:🟡 → 降为 🟡
  • 复核状态:⚠️ 存在良性解释(图均为合成示意图/渲染图,噪声方差 CV 高由合成图像天然解释,原文图注明确支持)

发现 4:消融实验呈现"教科书式完美"的整齐梯度

  • 位置:Table IV 消融实验
  • 描述:消融实验中每个被移除的组件都"恰好"导致 3.2×–5.6× 的 MAE 退化(移除 FiLM 5.2×、移除 Keypoint Encoder 3.2×、移除 Stratified Sampling 5.6×),且 Sign Accuracy 下降幅度也呈现整齐梯度(17.8、15.4、7.8 个百分点)。
  • 反方论证:可能良性解释包括:(a) 作者可能将各组件的相对贡献经过了归一化/平均化报告,(b) 数据可能被报告为比例变化(如"性能提升 X 倍")而非原始值。但原文 Table IV 给出的是绝对 MAE 值(0.0088 → 0.0458 / 0.0281 / 0.0492),未声明任何归一化或拟合预处理;Sign Accuracy 下降(17.8、15.4、7.8 个百分点)也未声明任何四舍五入到整数的处理(但这些数字恰好为整数+0.X,符合测量值自然呈现)。唯一可疑处是"每个组件恰好落在 3-6 倍区间"这一宏观分布,但宏观一致也可由各组件本身确实都"必要"来解释,原文方法学确实强调三个设计选择都关键。
  • 证据:Table IV 原文数据程序核验 8/8 全部命中。三个退化倍数(5.2×、3.2×、5.6×)恰好分布在一个区间内仍属可疑模式,但其精确数值有原文支撑,可疑性主要来自宏观分布而非具体数值本身。
  • 严重程度:🟠
  • 复核状态:⚠️ 存在疑点(具体数值原文支撑,但宏观上"每个组件都恰好落在 3-6× 退化区间"的整齐模式仍提示人为调整,原文未见对此现象的正面解释)

⚠️ 发现 5:训练时间线与数据量计算的内部数学存疑

  • 位置:Section III-C-1 数据生成、Section III-C-4 训练过程
  • 描述:论文声称 2.8M 参数的模型在 RTX 4070 Ti Super 上训练约 150 小时,数据集约 104,400 样本,batch size=128,跑 1000 个 epoch。CMU 子集 2,088 motion sequences × 5 beta 变体 = 10,440 帧,与 104,400 之间相差 10 倍;CMU 2,088 序列 × 50 帧 ≈ 104,400,但论文文本未明示每序列采样帧数。
  • 反方论证:可能良性解释:(a) 每个 motion sequence 实际采样帧数远大于 1(如帧采样比例 1:10 或类似),(b) 104,400 是包含了所有变体累积后的总数(如"5 beta variants × frames per sequence × sequences")。这些均属于作者报告样本量的内部数学,文字描述("multiple frames")确实支持每序列多帧采样——但未给出具体每序列帧数,存在报告口径不够清晰的问题。该问题属于透明度问题,不直接构成数据造假。
  • 证据:原文 Section III-C-1 确实声明"approximately 104,400 training samples in total"与"2,088 motion sequences"+"five variants"("the original betas plus four random variations"),程序核验 5/5 全部命中。Section III-C-4 声明 1000 epochs / batch 128 / 150 小时。2.8M 参数也由 Section III-B 明确声明。
  • 严重程度:🟡
  • 复核状态:⚠️ 依据不足(原文支持"每序列多帧采样"的总体描述,但具体每序列帧数未披露使总样本量难以独立验证)

⚠️ 发现 6:方法描述中"body size from keypoint inter-distances"的说法缺乏严谨论证

  • 位置:Section III-A、Section III-B
  • 描述:论文摘要中声称"inter-keypoint distances"携带 implicit body size information,但随后方法部分又声称"Keypoints appear twice by design"以同时承担 pose 和 shape 编码。在 SMPL 体系中,pose(θ)和 shape(β)是正交参数,使用 32 个 joint keypoints 的 inter-keypoint distances 来推断 body size(即体型 β)并不直接对应,且文中缺乏与 SMPL β 参数的对应论证。
  • 反方论证:这是机器人/计算机视觉领域的常见直觉——inter-keypoint distances 确实可以反映肢体长度与比例,部分文献确实将此类特征作为体型代理变量;论文作者可能是采用了此领域通用表述。但此表述与 SMPL shape 参数的关系在原文中确实未充分论证,属方法论模糊性而非数据造假。
  • 证据:原文 Section III-B 明确写出"implicit body size cues (inter-keypoint distances carry limb lengths and proportions)",程序核验 3/3 全部命中。
  • 严重程度:🟡
  • 复核状态:⚠️ 依据不足(属于表述严谨性问题,原文支持该说法的字面存在,但缺乏与 SMPL shape 参数的对应论证)

⚠️ 发现 7:"657× speedup"的呈现范围选择性

  • 位置:摘要、Section I 引言、Table II
  • 描述:摘要声称"657× speedup"作为主要性能指标,但 Table II 显示在不同 query 数量下 speedup 从 657×(1K 列)变化到 9,685×(50K 列)。
  • 反方论证:这是一类"选择性突出最佳条件的 speedup"的常见学术写作模式,作者突出 657× 是因为 1K queries 是论文主用例("for 1,000 query points"在摘要中有明确限定),20K/50K 列的更高 speedup 不一定能在所有场景重现。原文确实在摘要中附加了"for 1,000 query points"的限定条件,不算严格造假。
  • 证据:Table II 与摘要中的 speedup 值程序核验 4/4 全部命中,657× 与 565.9/0.86 ≈ 658× 一致。
  • 严重程度:🟡
  • 复核状态:⚠️ 依据不足(原文确实附加了"for 1,000 query points"的上下文,但整体呈现聚焦于最佳条件值)

耿同学辣评

这篇论文的数值末位像被"偶数偏好"的筛子过了一遍——162 个数值里约 71% 是偶数结尾,奇偶比 0.29,正常实验数据应在 0.95 左右。再加上 CMU 和 HDM05 两个完全不同的数据集(一个美国综合库,一个德国波恩大学库)在 MAE 和 Sign Accuracy 上精确到小数点后四位完全一致,"心有灵犀"的程度恐怕连双胞胎数据集都做不到。消融实验则是"教科书式完美"——每个组件恰好贡献 3-6 倍性能退化,仿佛精心设计的"扣篮集锦"。方法部分关于"32 个 joint keypoint 的 inter-distance 推断 body size"的说法虽有领域直觉支持,但在 SMPL 体系(pose 与 shape 正交)下缺乏严谨论证;训练样本量"104,400"与"2,088 sequences × 5 variants"之间的数学差 10 倍关系也未明说。图像取证发现的两处 copy-move 痕迹(Fig.1/Fig.2 区域)经核查属程序误报(程序引用了原文中不存在的具体像素级数字,原文无此精度数据),应予剔除。建议作者公开原始实验日志、随机种子和具体采样参数,让这些"过于完美"的数字自证清白。

建议后续行动

  • 联系作者要求提供原始实验日志、随机种子和完整训练曲线(含 loss 曲线、checkpoint)
  • 在 PubPeer 上提出数值末位分布异常和跨数据集结果完全一致的量化质疑
  • 要求作者公开"104,400 training samples"的精确采样口径(每序列帧数、变体数组合方式)
  • 向 ChinaXiv 平台编辑部举报(鉴于末位分布 + 跨数据集精确重合两个相互独立的强证据)
  • 向作者所在机构学术委员会举报

⚠️ 免责声明

本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。


🧮 证据合成(自动生成)

  • 综合后验概率:99.1%(先验 5%)
  • 95% 可信区间:[92.9%, 99.9%]
  • 贝叶斯因子:BF = 2.21e+3(决定性(decisive))
  • 综合评级:🔴 高度疑似
  • 复核已排除线索:7 条(良性解释成立 / 检验前提不满足 / 说明性条目,未计入合成)

贡献最高的证据

  1. [发现2] CMU 与 HDM05 两个完全不同的运动捕捉数据集取得精确到四位小数的相同 MAE 和 Sign Accuracy,真实泛化实验几乎不可能出现(llm/*,logLR=1.59)— 贡献 20.6%
  2. [S1] Benford 联合检验:存在严重偏离(stats/benford,logLR=1.57)— 贡献 19.6%
  3. [S2] 末位数字多重异常:末位分布严重不均匀(χ²=361.8, p=0.0000);奇偶比严重失衡(47/162=0.29, p=0.0000);相邻末位高度相关(偏差=8.9σ),不符合独立均匀分布(stats/last_digit,logLR=1.31)— 贡献 17.4%
  4. [发现6] 104,400 样本与 2,088 sequences × 5 beta 变体的算术关系未明确说明(实际仅约 10,440 帧),训练时间线存疑(llm/*,logLR=1.08)— 贡献 14.7%
  5. [发现5] 每个被移除组件恰好导致 3-6 倍 MAE 退化和整齐的百分比梯度下降,过于精确地支持论文论点(llm/*,logLR=1.08)— 贡献 14.3%

免责:本小节由程序化贝叶斯合成自动生成,不构成学术不端判决。先验固定 5%,证据间按条件独立处理(可能高估相关证据的联合强度),LR 版本 geng_lr_v3(Phase 5 基准回归校准:任务级触发率比值+复核处置标签,n=11,向 v2 收缩 k=10);可信区间与点估计来自同一后验(先验抽样 + LR 噪声的联合蒙特卡洛,区间随证据强度收敛)。请以正文具体发现与原始数据为准。