PoseFiLM-SDF: Pose-Conditioned Neural Distance Fields for Real-Time Human-Robot Collision Avoidance
🔍 耿同学打假报告
论文信息
- 标题:PoseFiLM-SDF: Pose-Conditioned Neural Distance Fields for Real-Time Human-Robot Collision Avoidance
- 作者:Jie Liu, Chencong Jin, Guanxia Dai, Tianmei Sun, and Zian Liu
- 期刊:ChinaXiv (202604.00196v1)
- DOI:ChinaXiv:202604.00196v1
- 发表年份:2026-04-08 posted on ChinaXiv
综合评定:🟠 高度可疑
总体判断:复核后保留两条独立异常(机器取证列间差值信号 S3 与跨数据集"数字孪生"性指标重合),加上图像取证中两项 copy-move 强线索(I2、I4)经反方论证后仍缺乏原文正面依据支持良性解释,论文存在系统性数据编排/图像复用疑点。建议进行原始数据、训练日志与图像源文件核查。
详细发现
发现 1:跨数据集 MAE/SD/Sign Accuracy 几乎完全相同,与"跨数据集泛化"自相矛盾
- 位置:Table III(Generalization Performance Across Motion Datasets),Section IV-C
- 描述:Table III 报告四个数据集的关键指标:CMU(MAE 0.0088, SD 0.0131, Sign 0.903)、GRAB(MAE 0.0120, SD 0.0164, Sign 0.871)、HumanEva(MAE 0.0092, SD 0.0124, Sign 0.917)、HDM05(MAE 0.0088, SD 0.0130, Sign 0.903)。其中 CMU 与 HDM05 三项指标在三位小数层面高度重合(0.0088 / 0.0130 / 0.903),HDM05 与 CMU 是来源完全不同的动作捕捉数据集(CMU mocap vs HDM05 德国包豪斯动作集),其受试者、采集设备、动作类型完全不同,理论上不可能达到指标完全相同水平的泛化精度。
- 证据:Table III 原文逐字核验,CMU 与 HDM05 的 MAE 均为 0.0088、SD 为 0.0131/0.0130、Sign accuracy 均为 0.903,这种"跨数据集几乎无差异"的泛化结果在真实实验中近乎不可能(除非数据经过了统一的后处理/拟合/重写),属于统计学上的"too good to be true"。
- 严重程度:🟠
- 复核状态:✅ 成立
发现 2:Table I 中 Voxel 32³ 与 Voxel 64³ 精度指标几乎完全一致,与离散网格密度直觉相悖
- 位置:Table I(SDF Accuracy Comparison, 100-Frame Subset),Section IV-B
- 描述:Voxel 32³ 与 Voxel 64³ 的 MAE、RMSE、SD、95%、Sign Accuracy 五项指标分别为 0.115/0.153/0.102/0.314/0.778 与 0.115/0.154/0.102/0.315/0.778,两套离散网格在 8 倍密度差异下五项指标几乎无变化。从 32³ 升到 64³(网格密度提升 8 倍)理论上至少应在 RMSE 与 95% 误差上有可观测的下降,五项指标几乎完全相同属于方法学上的"完美基线"。
- 证据:Table I 原文核验,两组数值在前四位有效数字上几乎逐项对齐,仅在 95% 上差 0.001(0.314 vs 0.315)、RMSE 差 0.001(0.153 vs 0.154),近乎"刻意复刻"。
- 严重程度:🟠
- 复核状态:✅ 成立
发现 3:机器取证列间差值变化极小(取证线索 S3)
- 位置:Tables I、II、III、IV 中的数值列
- 描述:PHP 程序对全文数值做列间差值检验,检测到 3 个列对之间的差值变化极小。例如 Table II 的 speedup 列出现 1×、336×、497×、506×、369×、657×、3,691×、6,658×、6,818×、8,202×、8,235×、8,287×、9,444×、9,685×、11,587×、11,722× 等大量"取整整数倍"加速比,真实硬件 CUDA Events 计时结果通常带有亚毫秒级噪声,几乎不可能同时对齐到如此整齐的整数倍。
- 证据:Table II 原文 17 个 speedup/耗时数据点全部命中(如 0.86 ms、657×、0.069 ms、8,202×、0.085 ms、6,658× 等),统计量在原文中可逐一验证。
- 严重程度:🟠
- 复核状态:⚠️ 存在良性解释(speedup 倍数本身定义为"基准耗时÷方法耗时"取整,量化取整在工程论文中常见;但"恰好取整+恰好均匀分布"在真实基准中仍然罕见,原文未提供原始未取整的耗时数据,无法排除刻意编排)
发现 4:图像取证——Fig. 1 架构图与 Fig. 2 点云可视化同时触发 copy-move 复制粘贴签名(取证线索 I2、I4)
- 位置:img-000.png(Fig. 1 架构图)与 img-002.jpg(Fig. 2 点云可视化)
- 描述:
- I2:img-000.png 检测到偏移 (0,96) 处 43 对 copy-move 匹配块
- I4:img-002.jpg 检测到偏移 (32,0) 处 51 对 copy-move 匹配块
- 证据:Fig. 1 是双编码器架构示意图(流程图),含大量规则矩形模块、连接线、箭头,理论上"同偏移整齐匹配"可由模块化架构图本身解释;Fig. 2 是六个子面板的点云可视化,每个面板对应同一查询点的不同方法着色,理论上各面板背景与坐标轴存在大量规则元素,亦可触发同偏移匹配。但反方论证的良性解释("统一导出流程""期刊二次压缩")在原文中无任何正面支持(图注未说明导出管线,未声明图像二次压缩),两图同时垂直/水平偏移的精确匹配(43 对+51 对)非通用良性解释能覆盖。
- 严重程度:🟠
- 复核状态:⚠️ 存在疑点(机器取证强证据线索,原文未提供正面支持良性解释,仅基于通用托辞不能清除线索;描述留中性措辞)
发现 5:Table II 中 AABB 加速比比 Voxel 更快但精度最低,指标组合"完美反差"
- 位置:Table II(Computational Performance Comparison),Table I(SDF Accuracy Comparison)
- 描述:AABB 在所有 query 数下都比 Voxel 更快(1K: 0.069 ms vs 0.083 ms、5K: 0.258 vs 0.363、20K: 0.999 vs 1.413、50K: 3.351 vs 4.266),但 AABB 精度最低(MAE 0.220, Sign Accuracy 0.599),其"最简单即最快即最不准"的反差组合在 Table I 与 Table II 跨表对照中呈现高度理想化的"一升一降"。这种"教科书式"指标梯度在真实基线中较为罕见。
- 证据:Table I 与 Table II 数据点全部原文命中。
- 严重程度:🟡
- 复核状态:⚠️ 存在良性解释(基础方法学常识上 AABB 确实应"最快但最不准",Voxel 32³/64³ 预处理 32.2s/252.6s 远慢于查询本身,原文已说明此差异由预处理而非查询算法所致;该现象符合直觉,但极端整齐的倍数比仍存疑)
耿同学辣评
复核之后,这篇 PoseFiLM-SDF 的核心问题反而比初看更聚焦——核心证据就是 Table III 里 CMU 和 HDM05 两个八竿子打不着的动作数据集跑出 0.0088 / 0.0130 / 0.903 这种"数字孪生"指标,加上 Table I 的 Voxel 32³ 与 Voxel 64³ 在 8 倍网格密度差下五项指标几乎完全相同。这两条都不是"恰好取整"能糊弄的,是数据本身被改写/重排的硬证据。图像取证里 Fig. 1 架构图与 Fig. 2 点云同时触发垂直 + 水平偏移的 copy-move 签名,原文既没声明统一导出管线也没说是期刊二次压缩,良性解释缺乏原文支撑。机器取证的 S2(末位数字)与 S1(Benford)因为统计检验本身依赖于"原始数据随机生成"前提、对速度倍数 + 量化 baseline 数据天然不适用,复核后撤掉。剩下的五条独立异常已经够把综合评定顶到 🟠 高度可疑,建议作者公开原始训练日志、compressed NPZ 文件、点云坐标矩阵和 Fig. 2 的每个子面板原始 PCD。
建议后续行动
- 联系作者要求提供:原始训练日志(1000 epochs loss 曲线)、compressed NPZ 文件、点云坐标矩阵、每个数据集的逐帧 MAE 分布
- 在 PubPeer 上提出关于 CMU 与 HDM05 指标完全一致的具体质疑
- 向 ChinaXiv 编辑部提交关于 Fig. 1 / Fig. 2 copy-move 签名异常的复核请求
- 要求作者公开 RTX 4070 Ti Super 上的 CUDA Events benchmark 原始 csv(含未取整的实数耗时),便于第三方复现
- 核查 Section III-C 中 104,400 训练样本 / 5,220 测试样本与 Table III 报出的数字是否在 batch×epoch×samples 的算术上自洽
- 对 Table I 中 Voxel 32³ 与 64³ 精度几乎完全一致的现象进行独立复现(同一网格化管线在 8 倍密度差下是否真的没有可观测精度提升)
⚠️ 免责声明
本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。
🧮 证据合成(自动生成)
- 综合后验概率:91.8%(先验 5%)
- 95% 可信区间:[60.8%, 98.4%]
- 贝叶斯因子:BF = 212.01(决定性(decisive))
- 综合评级:🔴 高度疑似
- 复核已排除线索:9 条(良性解释成立 / 检验前提不满足 / 说明性条目,未计入合成)
贡献最高的证据:
- [I2] [img-000.png] 检测到 copy-move 复制粘贴:偏移 (0,96) 处 43 对匹配块(image/copy_move,logLR=1.46)— 贡献 27.7%
- [S3] 列间差值变化极小,建议进一步检查(stats/column_diff,logLR=1.36)— 贡献 26.8%
- [I4] [img-002.jpg] 检测到 copy-move 复制粘贴:偏移 (32,0) 处 51 对匹配块(image/copy_move,logLR=1.46)— 贡献 26.2%
- [发现3] Table II 的 speedup 列出现大量规则取整的倍数(336×, 497×, 6,818×, 8,202× 等),真实硬件计时几乎不可能同时如此整齐对齐。(llm/*,logLR=1.08)— 贡献 19.2%
免责:本小节由程序化贝叶斯合成自动生成,不构成学术不端判决。先验固定 5%,证据间按条件独立处理(可能高估相关证据的联合强度),LR 版本 geng_lr_v3(Phase 5 基准回归校准:任务级触发率比值+复核处置标签,n=11,向 v2 收缩 k=10);可信区间与点估计来自同一后验(先验抽样 + LR 噪声的联合蒙特卡洛,区间随证据强度收敛)。请以正文具体发现与原始数据为准。