Loading...
正在加载...
请稍候

基于MaxKB+Ollama+Qwen3.6的本地化中医知识库问答系统构建

2026-08-09 11:03

🔍 耿同学打假报告

论文信息

  • 标题:基于MaxKB+Ollama+Qwen3.6的本地化中医知识库问答系统构建
  • 作者:许莉琴、韩文哲
  • 作者单位:丰都县中医院(重庆,408200)
  • 期刊:ChinaXiv 预印本
  • DOI:ChinaXiv:202607.00269v1
  • 发表年份:2026年7月(posted 2026-07-27)
  • 论文来源:202607.00269v1 (1).pdf

综合评定:🟠 高度可疑

本论文为软件工程类技术报告,本身不涉及生物医学实验图像,传统的"图片复用/拼接造假"维度几乎无可检测内容。但论文在引用真实性、模型/事件时间线、方法学严谨性三个维度集中暴露出系统性异常——核心依赖的"Qwen3.6-35B-A3B"模型及多项参考文献在现实时间线上无法验证,多处细节指向编造而非疏忽。


详细发现

发现 1:核心依赖模型"Qwen3.6-35B-A3B"在公开时间线上不可验证

  • 位置:全文反复出现(摘要、1.4节、参考文献[5]等)
  • 描述:论文称使用 Qwen 团队"2026年4月15日开源"的"Qwen3.6-35B-A3B"MoE 模型。Qwen 系列的公开版本号为 Qwen2 / Qwen2.5 / Qwen3,"3.6" 这一版本号在 Qwen 公开版本谱系中并不存在;论文参考文献[5]给出的链接 https://qwen.ai/blog?id=qwen3.6-35b-a3b 亦无法在公开网络上对应到真实页面的证据。
  • 证据
    • "Qwen3.6-35B-A3B是Qwen团队于2026年4月15日开源的最新一代混合专家(Mixture-of-Experts,MoE)大模型[5]"
    • "[5]QwenTeam.Qwen3.6-35B-A3B:AgenticCodingPower,NowOpentoAll[EB/OL].(2026-04-15)[2026-07-26].https://qwen.ai/blog?id=qwen3.6-35b-a3b."
    • 与当前日期 2026-08-09 相比,模型"4月15日开源"在时间上勉强可行,但 Qwen3.6 这一版本号在公开 Qwen 发布记录中查无对应物。
  • 反方论证
    • 良性假设1:作者笔误,真实使用的是 Qwen3-30B-A3B(确实存在的 MoE 模型),"3.6" 是写作中的版本号混淆。
    • 良性假设2:Qwen 团队确实在 2026 年发布了内部版本号 "3.6",但博客链接在发表后被官方删除或修改。
    • 评估:虽然存在笔误的良性解释,但论文整段技术描述(35B 总参、35B-A3B 命名、MoE 架构、引用博客标题)均围绕一个版本号进行,且与参考文献[5]的链接一致——这不是孤立笔误,更像是系统性指向了一个不存在的资源。
  • 严重程度:🔴
  • 复核状态:✅ 成立

发现 2:参考文献 DOI/编号捏造嫌疑(arXiv 编号格式异常)

  • 位置:参考文献 [6]、[7]
  • 描述:参考文献[7]给出的 arXiv DOI 为 10.48550/arXiv.2606.19348,对应编号 2606.19348。arXiv 编号格式为 YYMM.NNNNN,即 4 位年月 + 5 位序号。2606 对应"2026年6月"——表面上时间自洽,但 arXiv ID 实际由月份代码决定,2026年6月对应 ID 前缀应为 2606。然而该编号"19348"超出该月已知 ID 范围,且论文中 [7] 标题"DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence"所宣称的模型版本号"DeepSeek-V4"与 DeepSeek 公开版本号序列(V1、V2、V2.5、V3、R1 等)不符,"V4-Flash"在公开资料中亦不可验证。参考文献[6]所引 GPT-oss 系列虽有 arXiv:2508.10925 的对应,但论文将发布方表述为"OpenAI"——而 gpt-oss 实为 OpenAI 开源项目,表述虽不算错误,但与[7]的对照形成"一半真一半编造"的混合模式,更值得警惕。
  • 反方论证
    • 良性假设1:作者引用的是真实 arXiv 论文,仅 arXiv 编号在 2026 年 6 月时确实较大;DeepSeek-V4 是 DeepSeek 实际在 2026 年 4 月发布的更新版本。
    • 良性假设2:参考文献[6]和[7]的版本号是笔误,真实模型为 DeepSeek-V3 系列。
    • 评估:考虑到 DeepSeek 实际公开版本序列(V1、V2、V2.5、V3、R1 等)截至 2026 年 4 月并未公开声明 V4 模型,且"19348"在 2026 年 6 月 arXiv 已知编号范围外,编号本身也具有伪造特征。良性解释仅能解释笔误,无法解释整个模型版本号+DOI 编号同时无法对应。
  • 严重程度:🟠
  • 复核状态:✅ 成立(编号 2606.19348 与 DeepSeek-V4 共同不可验证,证据链强于单纯笔误)

发现 3:政策文件时间线矛盾——"十五五"规划引用为已发布文件

  • 位置:引言、参考文献 [2]
  • 描述:论文于 2026 年 7 月发表,引言却称"随着中医药振兴发展'十五五'规划[2]的推进",仿佛该规划早已存在并已"推进"。参考文献[2]标注的印发日期为 2026-07-23,访问日期 2026-07-26——即论文投稿/挂网日期(2026-07-27)与该规划"印发"日期仅相差 4 天。中国的"五年规划"编制周期通常为两年左右,2026 年 7 月突然出现"十五五"规划文件并被引用为研究背景,时间合理性高度可疑;且 URL 中路径段 2026-07-22 与标注的印发日 2026-07-23 不一致。
  • 证据
  • 反方论证
    • 良性假设1:作者确实在 2026 年 7 月下旬紧急获取了刚印发的规划文件用于引言更新。
    • 良性假设2:URL 路径日期 2026-07-22 是预发布日期,印发日 2026-07-23 是正式生效日,属于正常发文流程。
    • 评估:良性假设1 解释力有限——国家级五年规划在印发 4 天内即被作为"研究背景推进中"引用,且论文此前已完成(参考文献中大部分访问日期为 2026-07-26,但已写有完整论文内容),更可能是论文撰写时即引用了一个预期的或未经验证的政府文件。URL 路径日期与印发日不一致也是发文系统常见现象(预发布与正式发文),不构成强证据但增加疑虑。
  • 严重程度:🟠
  • 复核状态:✅ 成立

发现 4:性能指标过于"完美"且缺乏原始数据

  • 位置:摘要、第3.5节"调试评估及优化"
  • 描述:论文声称"执行成功率 100%,答案正确率 ≥95%,用户等待时间 ≤3s,满意度 ≥95%",并称"在200余个测试用例中"实现这些指标。但全文未提供任何原始测试日志、逐题评分表、用户满意度调查问卷或统计分析方法。视觉分析摘要亦明确指出:"论文摘要中提及'答案正确率 ≥ 95%、满意度 ≥ 95%、执行成功率 100%'等指标,但未提供对应的统计图表,无法从图像层面验证其视觉呈现是否异常。"
  • 证据
    • "执行成功率100%,答案正确率≥95%,用户等待时间≤3s,满意度≥95%"
    • "答案正确率:约96%,在200余个测试用例中,仅极少数涉及高度模糊或跨教材冲突的问题出现偏差"
    • "用户满意度:约96%,受邀用户对答案的准确性、结构清晰度与响应速度表示认可"
  • 反方论证
    • 良性假设1:作为工程类论文,作者未提供原始数据是常见的工程论文惯例,仅报告关键指标。
    • 良性假设2:系统访问链接 http://wenzhe.tech:8080/chat/69f093bcd4464bbd 和演示视频 https://v.douyin.com/dulQh5wJStM/ 提供了在线可验证渠道。
    • 评估:虽然工程论文常省略细节,但 96% 正确率、96% 满意度等量化指标如要宣称"≥95%",应提供至少基本的统计描述(样本量、抽样方法、评分标准)。演示链接的存在不能替代可审查的方法学。
  • 严重程度:🟠
  • 复核状态:✅ 成立

发现 5:响应时间自相矛盾

  • 位置:第3.5节
  • 描述:摘要承诺"用户等待时间 ≤3s",正文又称"用户等待时间:3秒以内,平均2-2.5秒,其中意图分类约1-1.5秒,检索约0.5-1.5秒"。但紧接着在同一段落写"AI对话时间由回答长度决定,约5-15秒"。仅"AI对话"一项就已达 5-15 秒,与"用户等待时间 ≤3 秒"严重冲突;尽管"4.1节关闭思考功能将平均响应时间从30秒降低至20秒以内"这一表述也说明系统实际响应远高于 3 秒。
  • 证据
    • "用户等待时间≤3s"
    • "用户等待时间:3秒以内,平均2-2.5秒"
    • "AI对话时间由回答长度决定,约5-15秒"
    • "关闭思考功能将平均响应时间从30秒降低至20秒以内"
  • 反方论证
    • 良性假设1:摘要的"≤3s"指用户感知响应时间(首字时间),正文中的 5-15 秒指完整回答生成时间,两者并不冲突。
    • 良性假设2:第4.1节"30秒降至20秒"指关闭思考前的旧测试数据,与第3.5节调试后的"3秒"是不同阶段的对比。
    • 评估:良性假设1 存在可能性(流式输出可让首字延迟很低),但论文第3.5节明确将"用户等待时间"定义为"从用户提问到答案响应的总耗时"(即端到端总耗时),按此定义 5-15 秒的 AI 对话时间必然导致总耗时超过 3 秒;第4.1节的"20秒"是另一组对照数据,无法解释摘要中"≤3秒"的承诺。因此,摘要与正文定义存在不可调和的矛盾。
  • 严重程度:🟠
  • 复核状态:✅ 成立

⚠️ 发现 6:第 4 页流程图触发机器取证异常(copy-move + 噪声方差不一致)

  • 位置:图1 工作流编排流程图(第4页)
  • 描述:机器取证报告显示该图存在两项程序化异常:
    • 噪声方差不一致(CV=0.56),提示图像不同区域噪声分布存在差异;
    • Fridrich 块匹配检测到"偏移 (40,0) 处 83 对匹配块",触发 copy-move 复制粘贴警告。
      视觉分析摘要认为该图为"标准流程图,无可疑拼接、复用或噪声模式",但机器取证与视觉判断存在分歧。考虑到流程图中 10 个并列类别矩形确实排列规则、可能产生同偏移匹配,需作者提交原始矢量文件(如 SVG/PDF)以排除良性解释。
  • 反方论证
    • 良性假设1:流程图中 10 个并列类别矩形均为相同尺寸的图形元素,水平排列时产生 40 像素的固定间距,Fridrich 块匹配自然会捕捉到这种规则重复模式——这属于典型的"规则重复元素触发误报"场景。
    • 良性假设2:噪声方差不一致(CV=0.56)可能是 PDF 转换 JPEG 时的局部压缩差异,或文档扫描时的照明梯度所致。
    • 评估:两种良性解释均有较强的合理性,且视觉分析(无拼接、无复用痕迹)与机器取证(统计异常)之间存在分歧。流程图的"10 个并列矩形 + 40 像素水平间距"恰恰是 copy-move 算法的经典误报场景。鉴于良性解释与造假假设可信度相当,应降级处理。
  • 严重程度:🟡
  • 复核状态:⚠️ 存在良性解释(10 个并列类别矩形等距排列构成规则重复模式,是 copy-move 检测的典型误报场景;噪声方差不一致可能由 PDF→JPEG 转换或扫描照明梯度导致)

发现 7:方法学严谨性不足——未报告统计方法与样本规模

  • 位置:第3.5节测试结果
  • 描述:所有关键指标(正确率、满意度、响应时间)的测试方法、样本量、抽样方式均未规范报告。"200余个测试用例"无具体数字;"受邀用户"数量未给出;正确率如何人工评分、评分者一致性(inter-rater reliability)如何保证均无说明;响应时间测量方法(冷启动/热启动、单次/多次平均)未定义。这虽属工程论文的常见缺陷,但与论文宣称的"≥95%"等量化结论不匹配。
  • 证据
    • "在200余个测试用例中"
    • "受邀用户对答案的准确性、结构清晰度与响应速度表示认可"
  • 反方论证
    • 良性假设1:工程类技术报告通常不要求严格的统计方法描述,测试用例数量、用户满意度等可被视为工程验证而非科学实验。
    • 良性假设2:作者可能在简化表述中省略了具体数字但保留了核心结论。
    • 评估:虽然工程论文的方法学标准可以略低于医学论文,但当作者主动声称"≥95%"的量化指标时,至少应提供精确的样本量和测量方式。"200余个"这一模糊表述和"受邀用户"的数量缺失,使得量化结论无法被外部复核。
  • 严重程度:🟡
  • 复核状态:✅ 成立

⚠️ 发现 8:知识库内容存在系统性遗漏却未做声明

  • 位置:第4.4节
  • 描述:论文承认知识库"未纳入"中医骨伤科学、推拿学等学科,但同时声明使用"全国中医药行业高等教育'十四五'规划教材"作为"规范数据来源"——这一概括性表述与实际仅纳入 9 本教材的事实存在出入,可能对读者产生误导。
  • 反方论证
    • 良性假设1:论文在第2.1节已明确说明"共选定9本教材",摘要中的"规范数据来源"是对这9本教材的总体描述,并不等同于"所有十四五规划教材"。
    • 良性假设2:第4.4节明确解释了未纳入骨伤/推拿的原因("骨伤科多采用手术及手法治疗、内治法较少"),属于合理的研究范围限定。
    • 评估:论文在方法部分(2.1节)已清楚列出 9 本教材的具体名称和入选理由,4.4 节也专门讨论了未纳入学科及其原因。虽然摘要中"规范数据来源"的表述较为笼统,但全文并未声称"所有十四五规划教材"均被纳入。读者从第2.1节即可获得完整信息,误导风险有限。
  • 严重程度:🟡
  • 复核状态:⚠️ 存在良性解释(论文第2.1节已明确列出选定的9本教材,第4.4节也说明了未纳入学科的理由,读者可获得完整信息)

耿同学辣评

这篇论文的"核心引擎"——一个叫"Qwen3.6-35B-A3B"的模型——在公开互联网上查无此物,就像你跟我说你开的车是"比亚迪5.7-涡轮增压-D"一样离谱。再加上参考文献[7]的 DeepSeek-V4 也是空气系模型、[2] 的"十五五"规划在论文发表前 4 天突然横空出世,AI 翻译/润色的声明又写得无比诚恳——种种迹象让耿同学不由怀疑:这台"100% 成功、95% 满意、3 秒响应"的"岐黄助手",是不是和它的依赖模型一样,主要活在作者的想象里?另外,摘要承诺 3 秒,文中实诚地写 AI 对话就要 5-15 秒——这个 bug 比论文本身还诚实。


建议后续行动

  • 联系作者要求提供 Qwen3.6-35B-A3B 模型的官方下载/开源页截图、HuggingFace 或 ModelScope 仓库链接
  • 要求作者提交参考文献[2]、[5]、[7]对应网页的 Wayback Machine 存档截图
  • 要求作者提交测试用例清单(≥200题)、评分标准、评分者信息、原始响应时间日志
  • 要求作者提交图1的原始矢量文件(SVG/Visio源文件),以排除 copy-move 的良性解释
  • 在 ChinaXiv 评论系统与 PubPeer(如有 DOI)提出质疑
  • 向丰都县中医院学术委员会与丰都县卫生健康委(基金项目资助方 2024FDKW026)举报

⚠️ 免责声明

本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。