多级评分试题的理论假设及其Logistic加权模型的适合性 / The Measurement Characteristics and measure theory hypothesis of the Polytomously Scored Item and the Polytomously Model
🔍 耿同学打假报告
论文信息
- 论文来源:202608.00109v1.pdf(ChinaXiv 预印本)
- 标题:多级评分试题的理论假设及其Logistic加权模型的适合性 / The Measurement Characteristics and measure theory hypothesis of the Polytomously Scored Item and the Polytomously Model
- 作者:简小珠¹,戴步云²
- 机构:¹南昌大学公共政策与管理学院;²江西师范大学心理学院
- 期刊:ChinaXiv 预印本(未列同行评审期刊)
- DOI:未列出(ChinaXiv:202608.00109v1)
- 发表年份:2026年8月23日(预印本发布日)
综合评定:🟡 存疑
详细发现
发现 1:投稿/写作时间线与基金编号异常
- 位置:首页页脚 + 参考文献部分
- 描述:论文标注 "ChinaXiv:202608.00109v1, This version posted 2026-08-23",资助项目为"国家自然科学基金地区项目'心理与教育测验 Logistic 加权模型的理论假设、测量技术与应用检验'(编号:32360204)"。文末引用了"简小珠, 戴步云. (2025). Logistic 加权模型下非连续记分时的模拟研究. 中国心理学预印本平台. [DOI:10.12074/202511.00062]",以及"简小珠, 戴步云. (2022). 等级反应模型下多级评分形式的难度等级作用探讨. 中国考试, 30(6), 57–67."等已有成果。
反方论证:时间线逻辑——2022年发表→2023年获NSFC→2025年预印本→2026年综合论文——本身可成立。论文是2026-08-23发布的预印本,距2025年11月同系列预印本约9个月,写作—综合成文的时间窗偏紧但不属于不可解释。论文投稿与发表的时间逻辑(预印本2026-08-23发布)经核验一致,无明显前后矛盾。
- 证据:NSFC 地区科学基金项目编号 32360204 按编号段属于 2023 年度地区基金项目;引用文献中2022年正式发表于《中国考试》、2025年预印本DOI:10.12074/202511.00062均见原文。
- 严重程度:🟡
- 复核状态:⚠️ 依据不足(投稿时间线可成立,无法确认存在时间造假)
发现 2:中英文摘要内容不对应
- 位置:首页中文摘要 vs 首页英文摘要
- 描述:中文摘要阐述"两个基本测量特征:存在多种评分点结构类型、多级评分具有分数加权作用",对应提出"平均难度参数理论假设、分数加权作用理论假设"。英文摘要出现明显语句断裂与不自然表达:"In a the polytomous item, the score point value is different…","WSLM can be better suited to the six kinds of the scoring point types and structural","However, Graded-Response Model, Genaral Partial Credit Model and the other polytomous models is not suitable for the aptitude test."——典型非母语直译+语法错误。
反方论证:英文摘要存在 "the full score of the the polytomous item" 等冗余/语法错误,以及 "Genaral Partial Credit Model" 拼写错误(应为 General),首句 "The previous polytomous models also cannot effectively are applied to the polytomous items" 出现 can+are 双动词错误。但这些均属于翻译/校对质量问题,不涉及数据伪造。中文摘要的内容表述清晰完整,英文摘要的语法瑕疵不影响核心结论。中英文摘要的论点对应关系基本成立(均提及评分点结构类型、分数加权作用、WSLM适合性等核心概念)。
- 证据:英文摘要首段 "The previous polytomous models also cannot effectively are applied to the polytomous items in the aptitude tests"、第二段 "Genaral Partial Credit Model" 拼写错误等均在原文中可定位。
- 严重程度:🟡
- 复核状态:⚠️ 存在良性解释(英文摘要语法/拼写错误可能为非母语作者翻译或赶稿所致,原文中英文摘要的核心论点仍可对应)
发现 3:表 1 文字矩阵的内部一致性疑点
- 位置:表 1(第 11–12 页),"多级评分模型对能力测验中多级评分试题两个基本测量特征的适合"
- 描述:作者将 GRM、GRM 加速模型、RSM、NRM、PCM、WSLM 六列与 6 类评分点 × 2 类评分连续性 = 12 行的表格。表中对 GRM 加速模型在连续性评分 ②–⑥ 类评分点均填 "形式适合",而在非连续性评分下全填 "待论证"。文中 §4 脚注 (3) 又说"虽然从数据形式上,可以适合非连续评分数据"——表 1 标"待论证"与正文"可以适合"语气相左。
反方论证:作者明确将"待论证"定义为"表示目前尚未研究者进行分析探讨"(见表1注(2)),而非"不适合"。"待论证"表示尚未有定论,正文中"从数据形式上可以适合"是从数学形式角度的判断,二者并不矛盾——"形式上可以适合"但"尚未有研究者进行实证论证",这在学术论述中是合理的区分。RSM、NRM、PCM 在连续性评分下填"形式适合"有作者的理论推导依据(这些模型在数学上确实可以处理连续性多级评分数据),虽未逐一引用文献,但"形式适合"本身是一个数学形式判断,不必然需要每条都引用文献。
- 证据:表1注释明确:"'待论证',表示目前尚未研究者进行分析探讨"。§4脚注(3)原文:"虽然从数据形式上,可以适合非连续评分数据"。
- 严重程度:🟡
- 复核状态:⚠️ 存在良性解释("待论证"与"形式可以适合"在文中定义明确,不矛盾)
发现 4:方法学描述的内部矛盾
- 位置:第 3 节"测量理论假设"与第 5.1 节"讨论"
- 描述:作者在 §3.1 表述两个前提理论假设"(1)单维性;(2)在一道多级评分试题内不同评分点上的每一得分具有相同的分数加权作用",并据此构建 WSLM。但 §5.1 又说:"同时,该模型的几何加权形式表达体现了一道多级评分试题内的每一个分值都有相同的分数加权作用,忽略各个评分点之间的作答差异,也忽略了各个评分点得分分值之间的差异"——这恰恰是 §3 提到的前提假设(2)本身,将"前提"又当作"不足"来批评。
反方论证:§3.1 明确列出的两条前提假设是"(1)单维性;(2)不同评分点上的每一得分具有相同的分数加权作用"。§5.1 讨论 WSLM 的局限性时说"几何加权形式表达体现了一道多级评分试题内的每一个分值都有相同的分数加权作用,忽略各个评分点之间的作答差异,也忽略了各个评分点得分分值之间的差异"。§3 中"前提假设(2)"是指"在不同评分点上的每一得分具有相同的分数加权作用"(即评分点之间的等价性),而 §5.1 的"局限性"描述的是"忽略各个评分点之间的作答差异"和"忽略各个评分点得分分值之间的差异"——后者指的是评分点在作答内容和分值大小上的差异性,前者指的是评分点得分在加权上的等价性。虽然表述上有交叉,但二者的理论侧重点不同:前提假设是"分数加权作用的等价性",局限性是"忽略作答过程与分值大小的差异"。作者将前提假设的简化视为一种"代价/局限",在理论论文中是常见的自评表述,不构成逻辑自相矛盾。
- 证据:§3.1 原文:"(1)测验中在所有试题上所测量的测验目标、测量能力维度从总体上看是单维的;(2)在一道多级评分试题内不同评分点上的每一得分具有相同的分数加权作用。"§5.1 原文:"该模型的几何加权形式表达体现了一道多级评分试题内的每一个分值都有相同的分数加权作用,忽略各个评分点之间的作答差异,也忽略了各个评分点得分分值之间的差异。"
- 严重程度:🟡
- 复核状态:⚠️ 存在良性解释(前提假设的"等价性"与局限性的"差异忽略"论述侧重不同,作者自我批评简化假设的代价在理论论文中常见)
发现 5:参考文献的潜在小问题(不构成造假)
- 位置:参考文献区
- 描述:
- "Nering, L., & Ostins, R. (Eds.). (2010). Handbook of polytomous item response models. New York, New Yerk Routledge. 2010."——"New Yerk" 拼写错误,疑为 New York 误录。
- "Tutz, G. (2020). On the structure of ordered latent trait models. Journal of Mathematical Psychology, 96(4):10234.. https://doi.org/10.1016/j.jmp.2020.102346."——页码 "10234" 实为文章号(article number 102346),并非卷期页码,标注方式不规范。
- "Vander Linden, W.J., & R.K. Hambleton, Eds. (1997)…" 与 "Vander Linden, W. (2016). Handbook of Item Response Theory. New York Springer."——vander Linden 的姓氏在英文规范中应小写连接为 "van der Linden",作者全大写 "Vander"。
- "Bradlow, E.T., Wainer, H., & Wang, X.H. (1999). A Bayesian random effects model for testlets]. Psychometrika, 64(2), 153–168."——题目中右括号 "]" 漏左括号,应为 "testlets)"。
反方论证:上述均为参考文献格式/拼写错误,未涉及伪造文献。这些错误在中文作者的英文参考文献中较常见,主要反映编辑/校对疏忽,不构成学术不端。
- 证据:上述引文均可在原文参考文献区逐一核实。
- 严重程度:🟡
- 复核状态:⚠️ 存在良性解释(参考文献格式错误为常见校对疏忽,非伪造证据)
发现 6:图片诚信维度——本论文无适用对象
- 位置:全文 12 页
- 描述:本文为纯理论与方法学论述,未提供任何 Western blot、显微镜图、统计散点/柱状图等可进行图像取证分析的视觉面板。论文图片视觉分析摘要确认全部 12 页均无实验原始图。
- 证据:仅有一处编号为"表 1"的文字矩阵表格,不含可视化图像内容。
- 严重程度:⚪ 不适用
- 复核状态:⚪ 不适用(本文为理论性论文,无图像Panel可供分析)
发现 7:统计学异常维度——本论文无适用对象
- 位置:全文 + §5.1 节
- 描述:本文未报告任何实验数据集、未给出具体 p 值、SD、SE、F/t 值、样本量等可做 GRIM/Benford/末位数字检验的统计量。仅 §5.1 提及"被试人数为 1000 人""Bias 小于 0.05,RMSE 小于 0.15""大于 0.20"等模拟描述,但未给出原始数值表。
- 证据:缺乏可量化的统计数据集,无法执行 GRIM、Benford、p-curve 等程序化检验。
- 严重程度:⚪ 不适用
- 复核状态:⚪ 不适用(缺乏可检验的统计数据)
耿同学辣评
这是一篇"理论思辨型"预印本,作者的目标是把自家 WSLM(Logistic 加权模型)包装成"突破以往 GRM/PCM 局限的灵丹妙药"。经过逐条复核,7条发现中:
- 3条降级为⚠️(前提/局限表述差异、表1"待论证"定义明确、参考文献格式错误——均有原文依据支撑的良性解释)
- 1条保留为⚠️依据不足(时间线可成立但偏紧)
- 1条保留为⚠️存在良性解释(英文摘要语法错误为翻译质量问题)
- 2条为⚪不适用(无图像、无统计数据)
核心问题是:①作者把"前提假设的简化"与"模型的局限性"放在同一性质的不同侧面讨论,论述上虽有交叉但理论侧重不同;②英文摘要满屏语法错误 + 拼写错误,疑似机器翻译或赶稿,但不影响中文核心论点;③表1全列 WSLM 胜出,其他模型都"形式适合但不适配",对比叙事明显倾向自家模型——这是综述类理论论文中常见的主观判断偏差,不是数据造假。本论文几乎没有报告新数据,真正的模拟/实测留给了引用文献(2022、2025)。说白了,这篇更像"自我表扬的综述+理论畅想",学术诚信上没有硬伤,但论证严谨度堪忧,投稿不到24小时就挂预印本,节奏也确实太赶。
建议后续行动
- 在 PubPeer 上提出关于"前提假设与局限性论述交叉"的学术讨论(非造假指控)
- 建议作者修订英文摘要的语法与拼写错误
- 参考文献格式需校对(Nering/New Yerk、Bradlow/testlets]、Tutz 文章号、van der Linden 大小写)
- 建议作者补充模拟/实测数据的详细数值表,以增强论证说服力
- 当前无足够的硬伤支持向期刊编辑部或机构学术委员会举报
⚠️ 免责声明
本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。