Loading...
正在加载...
请稍候

面向汽车金融的行为评分卡设计与实现

2026-08-06 15:10

🔍 耿同学打假报告

论文信息

  • 标题:面向汽车金融的行为评分卡设计与实现
  • 作者:水新莹(长三角信息智能创新研究院;惠国征信服务股份有限公司)
  • 期刊:电脑知识与技术(Computer Knowledge and Technology)
  • 文章编号:1009-3044(2023)14-0001-05
  • 发表年份:2023年5月
  • 论文来源:面向汽车金融的行为评分卡设计与实现_水新莹.pdf

综合评定:🔴 实锤

详细发现

发现 1:文本数据与表格数据完全对立(张冠李戴式造假)

  • 位置:2.2.3 客户定义 及 表4(逾期状态样本数量)
  • 描述:作者在正文中对滚动率分析(表4)的解读,与表格中实际算出的数据发生了极其严重的数学冲突。
  • 证据
    正文称:“S1-2状态保持率在 47%左右,向坏转移率为 38%,向好转移率为15%,因此认定为‘坏客户’。”
    我们来算一下表4中的 S1-2 行的总样本量:
    48+289+313+1124+791+349+134+30+0+0+1+0+0 = 3079。
    • S1-2 保持不变(即转回 S1-2)的数量是 349,占比 11.3%(作者竟称 47%)。
    • 向好转移(转移到 S0 至 S1-1)的数量是 2565,占比 83.3%(作者竟称 15%)。
    • 向坏转移(转移到 S1-3 及以后)的数量是 165,占比 5.3%(作者竟称 38%)。
      作者得出的结论(转坏率高,所以是坏客户)与真实表格数据(绝大部分都转好了)完全相反!这证明文字部分和表格部分至少有一个是直接从别处 Copy 过来的凑数内容。
  • 严重程度:🔴

发现 2:正文夸大实验结果,无视自家表格数据

  • 位置:5.3 实验结果 与 表7(消融实验结果)
  • 描述:作者在进行消融实验分析时,对实验数据的增长幅度进行了违背数学常识的虚假描述。
  • 证据
    正文原话:“根据表中结果可以看出,本文使用 GPS 特征作为模型特征可以有效提升模型预测效果,各项指标均有超过两个百分点的提升”。
    但看表7的真实数据:加入 GPS 特征后(即“本文模型”):
    • ACC 从 0.7281 提升到 0.8533,提升了 12.52 个百分点
    • Recall 从 0.7563 提升到 0.8984,提升了 14.21 个百分点
      这已经不是简单的用词不当了,作者大概率根本没有看自己跑出来的(或拼凑出来的)表格,而是在盲目套用论文模板里的客套话。
  • 严重程度:🔴

发现 3:文本拼接痕迹暴露(复制粘贴导致的章节乱码)

  • 位置:第3章节 特征工程
  • 描述:论文的结构排版出现了明显的复制粘贴失误,导致章节号发生跳跃。
  • 证据
    正文中先出现了 3.1.1 基于GPS经纬度数据的降采样,紧接着下一个小节直接变成了 3.3.2基于GPS数据的驾驶习惯特征挖掘
    请问 3.1.23.2 去哪儿了?为什么从 3.1 直接跳到了 3.3?这种低级的排版错误通常发生在东拼西凑多篇文献内容时,忘记修改自动编号或手动删改不彻底。
  • 严重程度:🟠

发现 4:总体样本量存在数学悖论

  • 位置:5.2 数据集 与 表4
  • 描述:数据集声称的总样本量与核心分析表格中的样本量出现严重分歧。
  • 证据
    5.2节明确写道:“构建了一个由 23243 个贷款客户的数据集……选取了 20000 训练,2000 验证,1243 测试”。
    但是,表4(逾期状态样本数量)最右侧的 Sum 列,把所有状态的客户加起来,总数是:1160+7819+9219+25855+8144+2753+2901+639+22+5+247+1+960 = 54725 个样本!
    就算这仅仅是测试集(1243条)或训练集的子集,也无法解释 5 万多的庞大数字。结合“发现1”中错乱的转移率,表4大概率是直接从外部其他文献或项目中直接截图/抄表挪用过来的假数据。
  • 严重程度:🔴

发现 5:图片信息缺失无法进行像素级验证

  • 位置:图1(MOB折线图)、图2/图3(行为模式图)、图4-7(流程图)
  • 描述:由于仅有文本提取内容,无法对论文中的折线图和模型框架图进行视觉相似度、PS拼接痕迹的检测。
  • 证据:论文提到图1的逾期率在16月后上涨趋势趋于平缓,暴露比为67%。逻辑上听起来合理,但在文本模式下无法核实其图表是否存在一图多用或捏造的情况。
  • 严重程度:🟡(技术限制,非论文本身缺陷)

耿同学辣评

这篇论文属实是把“Ctrl+C 和 Ctrl+V”玩到了极致。文字描述和表格数据主打一个“各玩各的,互不干涉”。正文里说向坏转移率高达38%,一看表格83%的客户全都转好了;正文里说提升了2个百分点,一看表格提升了12个百分点。更离谱的是,总共2万条的样本量,在表里硬生生加出了5万多。拿计算器按一下就知道真假的事儿,偏偏连演都不演了,这种闭着眼睛“盲填”数据的量产水文,简直是给学术界塞垃圾!

建议后续行动

  • 实锤级建议:直接联系期刊编辑部(《电脑知识与技术》),指出其核心数据表格(表4)与文本描述完全相悖,且样本量存在严重造假嫌疑,要求彻查并撤稿。
  • 在 PubPeer 或国内学术打假平台上披露此文的核心数据冲突。
  • 核查该作者(水新莹)所在课题组其他论文是否存在同样的“多源拼接”现象。

⚠️ 免责声明

本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。