CircuitHub15K: A Normalized, Diverse and Comprehensive Dataset for Circuit Schematics
🔍 耿同学打假报告
论文信息
- 标题:CircuitHub15K: A Normalized, Diverse and Comprehensive Dataset for Circuit Schematics
- 作者:Hongyu Chang, Huanyong Liu, Eric Leyu Zhou, Feng Xiong, Feng Zhang, Yuhui Yin
- 期刊:ChinaXiv(预印本)
- DOI:ChinaXiv:202606.00239v1
- 发表年份:2026(版本提交日期 2026-06-12)
- 论文来源:ChinaXiv 预印本 202606.00239v1.pdf
综合评定:🟠 高度可疑
论文类型为计算机视觉/数据集论文,主体工作为构建与发布 CircuitHub15K 电路原理图检测数据集并给出 YOLO 系列基线。机器取证证据中的 Benford/末位数字联合检验严重偏离(程序化统计计算结果),以及多个"YOLO26/Gemini 3.1 pro"等公开版本体系中无法核验的模型与工具命名问题,与论文声明的实验设置构成系统性矛盾。其余视觉类取证线索(copy-move/PRNU)已在前置检验阶段被确认为已知误报源(示意图/柱状图天然产生同偏移匹配;渲染管线 PRNU 不适用),不应作为造假实锤。综合判定为高度可疑,建议深入调查。
详细发现
发现 1:贡献规模前后不一致
- 位置:Abstract / Section 1(Introduction)/ Section 3.1
- 描述:Abstract 称 "build and release the CircuitHub9k dataset, which contains 9,754 annotated images and over 234,413 annotated instances",Section 1 中同样声明 "9754 annotated images" 与 "234413 annotated instances"。但 Section 3.1 仅说明从 12,276 张去重至 9,754 张图,通篇从未给出 234,413 个 instance 的来源统计或计算口径——仅有去重后的图像数,instance 数的生成路径缺失。表 2 给出 CircuitHub9k 的 Comp.+Term.+Junc.+Text 合计密度约 4.77+1.24+6.54+11.48=24.03/图,与 234,413/9,754≈24.03 吻合,但该总数未以独立分项表格形式公开,无法独立核验。
- 证据:原文 "9,754 annotated images and over 234,413 annotated instances" 与 "we obtain 9,754 annotated images" 及表 2 密度数据。
- 严重程度:🟡
- 复核状态:✅ 成立
发现 2:数据集规模与公开范围矛盾
- 位置:Abstract / Introduction 末段 / 论文末尾
- 描述:Abstract 与 Introduction 反复强调"构建并发布"了完整 CircuitHub9k/CircuitHub15k 数据集;然而论文末尾又说 "The full dataset is available under institutional application and registration, upon approval for non-commercial academic use",且公开链接
https://anonymous.4open.science/r/CircuitHub15K-6E90明确标注为 "A partial dataset is publicly available"。两类声明边界模糊:若实际公开的仅是 partial,则 "release" 一词具有误导性;若全部公开,则 "partial" 一词亦不一致。 - 证据:原文 "build and release the CircuitHub9k dataset"、"integrate them with CircuitHub9k to form CircuitHub15k" 对比 "A partial dataset is publicly available at" 与 "The full dataset is available under institutional application and registration"。
- 严重程度:🟡
- 复核状态:✅ 成立
发现 3:模型版本号 "YOLO26" 在公开版本体系中无法核验
- 位置:Section 5.1 / Table 5 caption
- 描述:论文声明 "We constructed baselines using YOLO series models (including YOLOv8n, YOLOv8m, YOLOv8l, YOLO11n, YOLO11m, YOLO11l, YOLO26n, YOLO26m, YOLO26l)",共 9 个模型。其中"YOLO26"在公开 YOLO 版本体系中无法核验——Ultralytics 官方主线为 YOLOv5/v8/v9/v10/v11/v12/v13 等,"v26" 命名未见任何官方发布或主流社区实现。Table 5 caption 进一步指出 "yolo26l achieved the best mAP@50-95 performance across all three category scenarios",即最终主张的最强基线模型来自该版本号。若 YOLO26 不真实存在,则最佳基线无法验证。
- 证据:原文 "YOLO26n, YOLO26m, YOLO26l" 及 "yolo26l achieved the best mAP@50-95"。
- 严重程度:🟠
- 复核状态:✅ 成立
发现 4:实验配置段落排版严重失序
- 位置:Section 5.1 第一段
- 描述:原文段落连续丢失空格,呈现 "T heL−seriesmodels, thebatch_sizewassetto16perGP U;fortheMandN−seriesmodels, thebatch_sizewasalsosetto16perGP U.T heimage_sizewassetto1024, thelearning_rateto0.01, andthemodelsweretrainedfor100epochs" 的连续无空格黏连,并出现 "4×NvidiaA800GP Us"(应为 "4× Nvidia A800 GPUs")。整段排版严重失序,与论文其余部分排版质量不一致,提示该段落未被正确排版即上传。
- 证据:原文 "4×NvidiaA800GP Us" 与 "T heL−seriesmodels, thebatch_sizewassetto16perGP U;fortheMandN−seriesmodels, thebatch_sizewasalsosetto16perGP U.T heimage_sizewassetto1024, thelearning_rateto0.01, andthemodelsweretrainedfor100epochs"。
- 严重程度:🟡
- 复核状态:✅ 成立
发现 5:参考文献时间线与命名异常
- 位置:Bibliography Refs [2]、[4]、[8]
- 描述:论文引用了几项在公开体系中无法核验或时间线可疑的工具/文献:
- Ref [8] 标注 "Gemini 3.1 pro model card. https://deepmind.google/models/model-cards/gemini-3-1-pro/ (feb 2026)"——Gemini 系列公开版本为 1.0/1.5/2.0/2.5 等,"Gemini 3.1 pro" 命名在公开认知中未见于任何官方模型卡。
- Ref [4] 标注 "PaddleOCR-VL-1.5 [4]",但对应 arXiv 论文 2510.14528 标题为 "PaddleOCR-VL: Boosting multilingual document parsing via a 0.9b ultra-compact vision-language model",未涉及 "1.5" 子版本;引用版本号与论文标题不一致。
- Ref [2] 标注 "(2026), https://arxiv.org/abs/2601.22114"——arXiv 编号 "2601" 对应 2026-01(YYMM 格式),形式上合法但属于 2026 年初新文,论文正式发布于 2026-06-12,引用 2026-01 预印本时间线上不矛盾。
- 证据:原文 "[8] Google DeepMind: Gemini 3.1 pro model card. https://deepmind.google/models/model-cards/gemini-3-1-pro/ (feb 2026)" 与 "[4] Cui, C., et al.: Paddleocr-vl: Boosting multilingual document parsing via a 0.9b ultra-compact vision-language model (2025), https://arxiv.org/abs/2510.14528"。
- 严重程度:🟠
- 复核状态:✅ 成立
⚠️ 发现 6:Benford 与末位数字联合检验严重偏离(前提受限)
- 位置:机器取证证据 [S1][S2]
- 描述:程序化统计计算显示,第 1 位数字 MAD=0.0572, χ²=192.6, p=0.0000;第 4 位数字 MAD=0.0894, χ²=357.4, p=0.0000;末位数字分布 χ²=130.7, p=0.0000;相邻末位相关性偏差 16.7σ。反方论证:Benford 检验要求数据来自跨数量级、无人为取整的"自然"测量值;本论文数值多为检测指标(Precision/Recall/F1/mAP),本身取值范围受限(0–1),且来自有限次实验,不满足 Benford 适用前提;末位数字偏离在小样本指标中亦常见。原文中未提及对这些指标进行 Benford 适用性修正,因此该统计线索仅作为"数值来源存疑、需作者公开原始逐次实验日志"的追问线索保留,不能直接用于判定造假。
- 证据:机器取证块 [S1][S2] 列出的统计量。
- 严重程度:🟡(前提不满足,仅作线索)
- 复核状态:⚠️ 存在良性解释(Benford 检验前提不满足:论文数值多为受控范围的检测指标 P/R/F1/mAP,取值 0–1 区间且样本量有限)
⚠️ 发现 7:图像取证多条 copy-move / PRNU 命中(前提受限)
- 位置:机器取证证据 [I2]–[I25]
- 描述:19 张图像中 17 张触发 copy-move 匹配,偏移均为 (32,0) 或 (0,32) 或 (56,0),呈高度规则性;PRNU 也在多对图像间呈极高 NCC(如 img-005 vs img-009 NCC=0.999, PCE=127.6)。反方论证:copy-move 在柱状图(Fig.3)、流程图(Fig.1)、标注示例图(Fig.2)等含规则重复边框/刻度/方框/箭头的图像上天然会产生同偏移匹配,是 Fridrich 块匹配算法的已知误报源;PRNU 在渲染/截图类图像(含 matplotlib 导出、PDF 提取图像)上不适用,因渲染管线本身不具备传感器 PRNU 信号,高 NCC 反映的是同一渲染/导出管线,而非同一物理相机。原文中未声明这些图来自不同物理相机拍摄,因此所提良性解释(统一渲染管线/图表规则元素)在原文中无明确正面支持但也无法被排除,作为追问线索保留。
- 证据:机器取证块 [I2]–[I25] 列出的偏移与 NCC 值。
- 严重程度:🟡(前提不满足,但作为追问线索保留)
- 复核状态:⚠️ 存在良性解释(copy-move 在柱状图/流程图/示例框图上天然产生同偏移匹配;PRNU 对渲染/截图类图像不适用)
耿同学辣评
一篇数据集论文,把 9,754 张图叫做"9754 annotated images and over 234,413 annotated instances",数字精确到个位却从不公布 instance 的逐类分项;号称发布 CircuitHub15K,公开链接却只敢给"partial";最离谱的是——"YOLO26" 和 "Gemini 3.1 pro" 这种在公开版本体系中无法核验的命名,直接被写进了参考文献和最强基线。这就好比你开了一家"米其其林三星餐厅",菜单上赫然写着"本店招牌菜:佛跳墙v26",但你从未在任何食品博览会见过这道菜。数据集论文拼的是可复现性,而不是花活——下次投稿前,请先把 YOLO 系列搞清楚再 v8、v11、v26 一把梭哈。
建议后续行动
- 联系作者要求公开 234,413 个 instance 的逐类分项统计表
- 联系作者提供 YOLO26n/m/l 的代码仓库、权重、训练日志与原始 commit
- 联系作者确认 "Gemini 3.1 pro model card" 的官方链接是否真实可访问
- 在 PubPeer 上对 YOLO26 命名与 instance 总数公开性提出质疑
- 向 ChinaXiv 编辑部报告参考文献与模型版本的可验证性问题
- 索取 Fig. 4(Per-Category Distribution)与 Fig. 5(Component-Text pair Distribution)的原始绘图数据
- 要求作者公开 PaddleOCR-VL-1.5 对应的具体权重版本与 commit
- 要求作者提供 Table 3/4/5/6 中所有 P/R/F1/mAP 指标的多次独立运行原始日志,以便重新做统计适用性评估
⚠️ 免责声明
本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。
🧮 证据合成(自动生成)
- 综合后验概率:99.1%(先验 5%)
- 95% 可信区间:[92.9%, 99.9%]
- 贝叶斯因子:BF = 2.21e+3(决定性(decisive))
- 综合评级:🔴 高度疑似
- 复核已排除线索:28 条(良性解释成立 / 检验前提不满足 / 说明性条目,未计入合成)
贡献最高的证据:
- [发现3] YOLO26n/m/l 在公开 YOLO 命名体系中不存在。(llm/*,logLR=1.59)— 贡献 22.8%
- [S1] Benford 联合检验:存在严重偏离(stats/benford,logLR=1.57)— 贡献 19.3%
- [S2] 末位数字多重异常:末位分布严重不均匀(χ²=130.7, p=0.0000);相邻末位高度相关(偏差=16.7σ),不符合独立均匀分布(stats/last_digit,logLR=1.31)— 贡献 17.4%
- [发现2] 摘要与引言强调“发布”,公开链接却标注“partial”,二者边界模糊。(llm/*,logLR=1.08)— 贡献 14%
- [发现4] 整段字符之间丢失空格,提示该段落未被正确排版即上传,或源自未渲染源码 dump。(llm/*,logLR=1.08)— 贡献 13.6%
免责:本小节由程序化贝叶斯合成自动生成,不构成学术不端判决。先验固定 5%,证据间按条件独立处理(可能高估相关证据的联合强度),LR 版本 geng_lr_v3(Phase 5 基准回归校准:任务级触发率比值+复核处置标签,n=11,向 v2 收缩 k=10);可信区间与点估计来自同一后验(先验抽样 + LR 噪声的联合蒙特卡洛,区间随证据强度收敛)。请以正文具体发现与原始数据为准。