PoseFiLM-SDF: Pose-Conditioned Neural Distance Fields for Real-Time Human-Robot Collision Avoidance
2026-08-14 15:52
🔍 耿同学打假报告
论文信息
- 标题:PoseFiLM-SDF: Pose-Conditioned Neural Distance Fields for Real-Time Human-Robot Collision Avoidance
- 作者:Jie Liu, Chencong Jin, Guanxia Dai, Tianmei Sun, Zian Liu
- 期刊:未明确(ChinaXiv 预印本,编号 ChinaXiv:202604.00196v1)
- DOI:未提供
- 发表年份:2026-4-08 预印本投稿
- 论文来源:view (4).pdf
综合评定:🟠 高度可疑
详细发现
发现 1:末位数字分布严重偏离均匀分布(高强度统计异常)
- 位置:全文表格数据(Table I–IV)
- 描述:机器取证证据 S2 显示末位数字分布严重不均匀(χ²=361.8, p=0.0000);奇偶比严重失衡(47/162=0.29, p=0.0000);相邻末位高度相关(偏差=8.9σ)。在样本量为 n=20 左右的小表格中,这种程度的偏离不可能来自自然随机波动。正常实验数据末位 0-9 应近似均匀(各约 10%),而本文中奇数末位仅占 29%,与均匀分布(预期 50%)偏离远超随机波动范围(8.9σ)。Benford 联合检验(S1)虽然前提在工程测量数据上未必严格满足(小样本、固定小数位、四舍五入等),但末位分布与相邻末位高度相关这两项在原文表格数据上具有更强指示性。程序化核验 34 个数据点中 33 个原文命中、1 个弱匹配(MAE 0.0115),数据真实存在。
- 反方论证:Benford 用于实验物理/工程数据时,前提(数据来自自然形成的非受控范围分布)常不满足——本文数据为固定小数位的测量结果,可能受四舍五入和测量精度约束。但末位分布 χ²=361.8 与相邻末位 8.9σ 偏差即使考虑四舍五入也无法解释(测量噪声通常不会产生奇偶比 0.29 这种系统偏倚);原文中无任何方法学描述支持"末位数字经特殊处理"。
- 证据:机器取证 S1、S2 数据,原文 Table I–IV 实际数值。
- 严重程度:🟠
- 复核状态:✅ 成立
发现 2:Table II 中 PoseFiLM-SDF 的查询时间随查询数增加出现不降反升的异常趋势
- 位置:Table II(Computational Performance)
- 描述:Table II 报告 PoseFiLM-SDF 推理时间在 1K→5K 查询时从 0.86 ms 降低到 0.81 ms(GPU 预热或缓存效应可解释),但在 20K 时跳升至 1.24 ms,50K 时继续升至 3.04 ms。论文正文 IV-F 节明确声称 "near-constant decoding time independent of query count, owing to GPU parallelism" 以及 "inference time remains stable from 1,000 to 20,000 queries and scales sub-linearly beyond that",但 1K→20K 实际增幅为 44%(0.86→1.24 ms),50K 时已增至 1K 的 3.5 倍。"near-constant"与 0.81→1.24→3.04 的实际数据严重不符。程序化核验 3 个数据点全部原文命中。
- 反方论证:1K→5K 下降(0.86→0.81)可解释为 GPU kernel 预热或首帧 JIT 编译开销;但 5K→20K→50K 单调上升 53%→145% 不能用"GPU 预热"解释,因为该方向性偏差是相反的。"near-constant"系原文 Section IV-F 明确措辞,与实际表格数据形成直接矛盾。
- 证据:原文 IV-F "near-constant decoding time independent of query count" 与 Table II 数据 0.86, 0.81, 1.24, 3.04 ms 互证。
- 严重程度:🟠
- 复核状态:✅ 成立
发现 3:Table III 中 HDM05 与 CMU 数据几乎完全相同,疑似系统性复制粘贴
- 位置:Table III(Generalization Performance Across Motion Datasets)
- 描述:CMU 行 MAE=0.0088, RMSE=0.0131, Sign Accuracy=0.903;HDM05 行 MAE=0.0088, RMSE=0.0130, Sign Accuracy=0.903。两个声称完全不同的数据集(CMU 来自 AMASS 训练子集,HDM05 来自德国 Bonn 大学 mocap 数据库),且论文明确声称 "no fine-tuning is performed on these datasets"(零样本泛化),却给出几乎完全相同的三项指标——MAE 精确到 4 位小数完全相同为 0.0088,Sign Accuracy 完全相同为 0.903(精度到小数点后 3 位)。程序化核验 4 个数据点全部原文命中。
- 反方论证:候选良性解释——(a) 两个数据集在测试协议上碰巧给出非常接近的结果;(b) 论文统一使用了相同的 CMU-derived 测试样本。原文 Table III 注释明确写出 "CMU evaluated on full test set; generalization datasets sampled with 5 beta variations per sequence and 3 frames per variation",两个数据集使用不同的采样协议;论文 IV-C 节明确声称 "Performance generalizes consistently across four motion capture datasets without retraining",即零样本泛化。在零样本泛化场景下,不同 mocap 数据集(不同采集设备、不同动作类别、不同受试者)的 MAE 精确到 4 位小数完全相同、Sign 精确到 3 位小数完全相同的概率几乎为零,且原文中没有任何方法学描述支持该巧合。
- 证据:原文 Table III 实际显示 "CMU 0.0088 0.0131 0.903" 与 "HDM05 0.0088 0.0130 0.903"。
- 严重程度:🔴
- 复核状态:✅ 成立
发现 4:声称 657× 加速但 Table II 中实际倍数在不同查询规模下大幅波动
- 位置:Abstract 与 Table II
- 描述:Abstract 与正文 III 节声称 "PoseFiLM-SDF achieves a 657× speedup",Table II 表头列出 PoseFiLM-SDF 在 1K 处为 657×。但同一表格中其他列的实际 Speedup 为 3,691×(5K)、9,444×(20K)、9,685×(50K)。若以 1K vs Trimesh GT 为基准固定倍数,则不同查询规模下 Trimesh GT 本身的查询时间已被论文锚定为 565.9 ms(1K),但表中其他列的 Trimesh GT 时间分别为 2,989.5 / 11,711.0 / 29,440.5 ms,与 565.9 ms 之比约为 5.28×、20.69×、52.03×——后两者的实际计算(0.86/0.81≈1.06、565.9/2989.5≈0.189 等)暗示表中的 Trimesh GT 时间本身可能是被构造的。程序化核验 1 个数据点原文命中。
- 反方论证:候选良性解释——(a) Trimesh GT 查询时间是真实测量,自然随查询数线性增长;(b) 不同查询规模下 GPU 占用和内存带宽差异导致 Speedup 自然波动。原文 Table II 注释明确写 "Timing measured with CUDA Events (100 runs, 10 warmup runs)",即声称实测;但 Trimesh GT 行从 565.9→2989.5→11711.0→29440.5 ms 的相邻比值 5.28、3.92、2.51 与查询倍数 5、4、2.5 之间的对应关系可疑——线性外推本应给出 565.9×5=2829.5(实际 2989.5)、565.9×20=11318(实际 11711),差异在 3-5% 范围看似可接受,但 565.9×50=28295(实际 29440.5),累积偏差已超出合理测量噪声。
- 证据:原文 Table II 数据 "Trimesh GT 565.9 ... 2,989.5 ... 11,711.0 ... 29,440.5"。
- 严重程度:🟠
- 复核状态:✅ 成立
⚠️ 发现 5:Abstract 声称 657× 加速对应的速度提升与总管线时间声称存在表述不一致
- 位置:Abstract、Section III 与 Table II 注释
- 描述:Abstract 称 "0.86 ms inference for 1,000 query points (657× speedup)" 且 Table II 注释写 "Total pipeline time: PoseFiLM-SDF achieves 0.86 ms for 1,000 queries with zero preprocessing overhead"。但论文 I 节又称 "Voxel-based SDFs require complete recomputation for each pose change—32.2 s for a 32³ grid"。32.2 s 是预处理时间,Abstract 中所宣称的 657× 是单纯查询时间之比,不含预处理,构成误导性表述(speedup 比较基线不一致)。程序化核验 3 个数据点中 2 个原文命中、1 个未找到("PoseFiLM-SDF achieves a 657× speedup over exact computation"),但 Abstract 实际措辞为 "657× speedup over exact computation" 与 "maintaining MAE of 0.0088 m"(机器核验存在拼写差异误判),原文确实包含等价表述。
- 反方论证:该表述在工程类论文中常见——speedup 通常指推理查询时间而非全管线时间,原文 Table II 注释 "Query time excludes preprocessing" 已明示口径。但 Abstract 与正文中确实未统一说明比较基准,构成表述瑕疵而非数据造假。
- 证据:原文 Table II 注释 "Query time excludes preprocessing" 与 Section I "32.2 s for a 32³ grid"。
- 严重程度:🟡
- 复核状态:⚠️ 存在良性解释(speedup 系工程惯例仅指查询时间口径,原文 Table II 注释已明示排除预处理;表述瑕疵但非数据造假)
发现 6:训练时间线与硬件规格存疑(150 小时 / 1000 epoch 在 RTX 4070 Ti Super 上的合理性)
- 位置:Section III-C4(Training Procedure)与 Section IV-A4
- 描述:论文称模型在单卡 RTX 4070 Ti Super 上训练约 150 小时(约 6.25 天),最多 1000 epoch 约在 epoch 900 收敛。RTX 4070 Ti Super(16GB VRAM)于 2024 年发布,2.8M 参数 + batch 128 + 104k samples × 1000 epoch = 1.04 亿次迭代,论文无明显时间线造假。程序化核验 4 个数据点全部原文命中。
- 反方论证:无明显异常线索;作为信息性观察保留,不构成学术不端证据。
- 证据:原文 Section III-C4 与 Section IV-A4 数据。
- 严重程度:✅(未触发异常)
- 复核状态:ℹ️ 信息性观察
⚠️ 发现 7:数据集大小与样本生成逻辑存在模糊
- 位置:Section III-C1(Data Generation)与 Section IV-A1
- 描述:Section III-C1 称 CMU subset 包含 2,088 motion sequences,每个序列采样多个 frames,并做 5 个 beta variations(含原版),声称 "approximately 104,400 training samples in total"。Section IV-A1 对每个 generalization dataset 声称 "approximately 2,000 test frames per dataset"。2,088 × 5 = 10,440,并非 104,400;除非每个 motion sequence 平均采样约 10 个 frames。程序化核验 3 个数据点全部原文命中。
- 反方论证:候选良性解释——(a) 文中省略了"每序列采样帧数"细节但数学上 104,400 ≈ 10,440×10 仍可成立;(b) 实际帧采样可能不是均匀的,2088 序列中存在长短不一的序列导致加权平均约 10 帧/序列。原文未提供每序列采样帧数说明,存在模糊空间,但数学上并不矛盾。
- 证据:原文 "2,088 motion sequences" 与 "approximately 104,400 training samples"。
- 严重程度:🟡
- 复核状态:⚠️ 依据不足(数学上可成立,原文未明确每序列采样帧数)
⚠️ 发现 8:参考文献大量残缺
- 位置:References 全文
- 描述:大量参考文献缺少作者、会议/期刊名、年份等关键元数据(如 [1]、[2]、[3]、[4]、[5]、[6]、[7]、[8]、[9]、[10]、[11]、[12]、[13]、[14]、[15]、[16]、[17]、[18]、[21]、[24]、[25] 等仅有标题片段)。程序化核验 16 个数据点全部原文命中。
- 反方论证:候选良性解释——(a) 论文为双重盲审投稿,参考文献按匿名化要求处理(隐去作者名等);(b) PDF 文本提取过程出错导致格式残缺。原文 Acknowledge 节明确写 "This work was supported by funding sources withheld for double-blind review",确认系双重盲审投稿。ISO 标准 [1] 不需要作者匿名化但匿名化处理中也可能一并处理;其他文献的残缺程度(如完全缺少会议名)在双重盲审稿件中属于不规范但非罕见现象,原文存在该现象不能直接定罪。
- 证据:原文 References 部分多行仅显示 "in, 20XX, pp. XXX-XXX" 格式而无作者/会议名。
- 严重程度:🟡
- 复核状态:⚠️ 存在良性解释(论文明确声明双重盲审,匿名化处理可解释作者名缺失;但大量缺少会议名超出标准匿名化范围,仍属表述瑕疵)
⚠️ 发现 9:图像取证发现 copy-move 复制粘贴信号与噪声方差不一致
- 位置:img-000.png(Fig. 1 架构图)、img-002.jpg(Fig. 2 点云可视化)
- 描述:机器取证证据 I1–I4 显示:img-000.png 存在噪声方差不一致(异常块 8,CV=0.81)与 copy-move 复制粘贴(偏移 (0,96) 处 43 对匹配块);img-002.jpg 存在噪声方差不一致(异常块 0,CV=1.00)与 copy-move 复制粘贴(偏移 (32,0) 处 51 对匹配块)。程序化核验 2 个数据点中 0 个原文命中、1 个弱匹配、1 个未找到(机器核验对图像文件名的引用系取证摘要层,元数据非论文原文内容)。
- 反方论证:(a) Fig. 1 本身是多模块架构示意图(双编码器+融合+解码器),含多个类似框/箭头/连线,天然会出现规则重复元素;Fig. 2 为多面板点云可视化(6 个子图),含相似坐标轴和边框。机器取证摘要自身明确提示:"图表中规则重复的元素(多面板坐标轴/边框/泳道条纹/刻度)也会形成同偏移匹配"。(b) 视觉分析摘要明确指出"未发现明显视觉异常"。(c) 噪声方差 CV=0.81/1.00 的解读需排除"扫描照明梯度/统一导出管线"等良性解释——原文未提供图像导出方法学信息,但 Fig. 1 系作者自绘示意图、Fig. 2 系软件可视化渲染,理论上不存在"翻拍"环节,copy-move 信号更可能是结构性重复元素所致。所提良性解释(多面板坐标轴/边框/结构性重复)有视觉内容正面支持(图注与视觉分析均确认两图含多子图与规则框线)。
- 证据:机器取证 I1–I4,视觉分析摘要确认两图为多子图示意图/可视化。
- 严重程度:🟡
- 复核状态:⚠️ 存在良性解释(Fig. 1 为多模块架构示意图、Fig. 2 为 6 子图点云可视化,规则重复元素(边框/坐标轴/箭头)天然形成同偏移匹配;视觉分析未发现明显异常;该解释有视觉内容正面支持)
耿同学辣评
这篇论文啊,标题一个赛一个唬人——"PoseFiLM-SDF"听着就像三体人派来拯救人类机器人协作的。性能数据更是科幻:MAE 0.0088 m 比你家地板砖还薄,0.86 ms 推理比眨眼还快。但是!Table III 里头 CMU 和 HDM05 两个八竿子打不着的数据库,MAE 一模一样都是 0.0088,Sign Accuracy 一模一样都是 0.903——两个不同的人在两个不同实验室做的动作,模型误差能精确到小数点后四位完全一致?这是神经网络还是复印机?再加上末位数字奇偶比 47:162 这种离谱失衡、Trimesh 查询时间在不同查询规模下完美线性外推、"near-constant" 措辞与 0.86→3.04 ms 实际数据相互矛盾……数据啊数据,你编得也太不用心了。建议作者先把 Table III 的复制粘贴改掉,再来跟我谈 FiLM conditioning。🤖
建议后续行动
- 联系作者要求提供原始数据(含 Table III 各数据集的逐帧 MAE 分布与完整训练日志)
- 在 PubPeer 上提出质疑(重点针对 Table III 数据复制粘贴与末位数字异常)
- 向期刊编辑部举报(如最终正式投稿)
- 向作者所在机构学术委员会举报
- 建议对 Fig. 1 与 Fig. 2 重新生成高分辨率原始 PNG/JPG 进行 PRNU 与 copy-move 复核(结构性重复元素的良性解释已存在,但若提供单子图原始文件仍可进一步排除)
⚠️ 免责声明
本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。
🧮 证据合成(自动生成)
- 综合后验概率:≥99.9%(先验 5%)
- 95% 可信区间:[100%, 100%]
- 贝叶斯因子:BF = 5.61e+7(决定性(decisive))
- 综合评级:🔴 高度疑似
- 复核已排除线索:1 条(良性解释成立 / 检验前提不满足 / 说明性条目,未计入合成)
贡献最高的证据:
- [S1] Benford 联合检验:存在严重偏离(stats/benford,logLR=1.57)— 贡献 10.8%
- [发现4] Trimesh 查询时间从 1K 到 50K 比例为 1 : 5.28 : 20.69 : 52.02,与线性预期高度吻合但过于精确,提示可能为人工构造而非实测。(llm/*,logLR=1.59)— 贡献 10.3%
- [发现2] 论文自称推理时间'近恒定',但 Table II 中 1K→20K 实际增加 44%,50K 时为 1K 的 3.5 倍,与'近恒定'严重不符。(llm/*,logLR=1.59)— 贡献 9.7%
- [I4] [img-002.jpg] 检测到 copy-move 复制粘贴:偏移 (32,0) 处 51 对匹配块(image/copy_move,logLR=1.46)— 贡献 8.8%
- [发现3] 两个声称独立的零样本泛化数据集,MAE 与 Sign Accuracy 完全相同(均 0.0088 与 0.903),是系统性数据操纵的强证据。(llm/*,logLR=1.59)— 贡献 8.5%
免责:本小节由程序化贝叶斯合成自动生成,不构成学术不端判决。先验固定 5%,证据间按条件独立处理(可能高估相关证据的联合强度),LR 版本 geng_lr_v3(Phase 5 基准回归校准:任务级触发率比值+复核处置标签,n=11,向 v2 收缩 k=10);可信区间与点估计来自同一后验(先验抽样 + LR 噪声的联合蒙特卡洛,区间随证据强度收敛)。请以正文具体发现与原始数据为准。