Constrained Semi-MDP Formulation and Perception-Enhanced Safe Policy Learning for Efficient Dynamic Task Scheduling of Data Centers
2026-08-06 15:10
🔍 耿同学打假报告
论文信息
- 标题:Constrained Semi-MDP Formulation and Perception-Enhanced Safe Policy Learning for Efficient Dynamic Task Scheduling of Data Centers
- 作者:Yiling Zhang, Yujian Ye, Jianxiong Hu, Heng Hu, Xi Zhang, Dezhi Xu
- 期刊:IEEE Transactions on Smart Grid (SUBMITTED FOR REVIEW / 投稿审稿中)
- DOI:未提供(暂未正式录用见刊)
- 发表年份:预印本/投稿时间约为 2024 年底 - 2025 年
- 论文来源:Zhang 等 - Constrained Semi-MDP Formulation and Perception-Enhanced Safe Policy Learning for Efficient Dynamic.pdf
综合评定:🟠 高度可疑
(注:本论文并未发现明显的图片复用或生物医学实验数据造假,但作为一篇深度强化学习/优化算法类的工科论文,其在数学公式推导、算法逻辑自洽性以及结论数据对应关系上存在多处低级错误或矛盾。有为了凑创新点而强行套用数学公式的嫌疑。)
详细发现
发现 1:基础数学公式写错(随机数生成器都不如?不,连抄都抄错了)
- 位置:Section IV-C, 公式 (29)
- 描述:作者定义了一个优先级评估函数 \(\phi(a)\),声称使用了 Softmax 操作。但原文给出的公式是:\(\sigma(x_i) = e^{x_i} / \sum_{j=1}^n x_j\)。
- 证据:这是一个极度低级的数学错误。Softmax 函数的分母应该是各项指数之和 \(\sum e^{x_j}\),而论文中竟然写成了原始数值求和 \(\sum x_j\)。在深度学习顶刊(如 IEEE Trans)的投稿中,出现这种大一新生级别的公式错误,说明作者极大概率没有自己推导过这部分的数学逻辑,或者是使用 AI 工具生成公式后未经校对。
- 严重程度:🟠
发现 2:理论证明与实际算法脱节(典型的学术“障眼法”)
- 位置:Appendix A (收敛性分析)
- 描述:作者在附录中费尽心机用三个引理和一个定理(Theorem 1)证明了算法能“收敛到满足约束的固定点”。但在证明开头的假设中,明确写了是基于 "tabular CDDQN"(表格型 CDDQN,即不使用神经网络)。
- 证据:在 V-A 节的实验设置中,作者明明写的是使用了 3个包含 256 个神经元的全连接隐藏层。在有函数逼近(尤其是神经网络)的强化学习中,由于“致命三要素”的存在,数学上是无法保证严格收敛到全局最优不动点的。用表格法证明收敛性,然后用神经网络做实验,这是强化学习论文中典型的“理论包装”套路,试图用无关的数学证明来糊弄审稿人。
- 严重程度:🟠
发现 3:正文数据与结论严重不符(满嘴跑火车)
- 位置:Section VI (Conclusions) 对比 Section V-B (Performance Evaluation)
- 描述:结论部分赫然写着:“it achieves up to 38.86%/36.20% improvement over baseline methods in the test scenarios”(相比基线方法提升了 38.86% 和 36.20%)。
- 证据:回看实验结果部分(Table II 及正文描述),作者提出的算法相比于基线算法(如 DDQN)在成本优化上的提升仅为 15.49% 左右,而由于本文算法已经逼近理想 MPC(差距仅 1.36%),任何达到 38% 以上提升率的说法都违背了物理极限。唯一沾边的是 DDQN 的计算总时间下降了约 38%(从 3.17h 降到 1.96h)。把“计算时间的缩短”偷换概念写成“测试场景下的性能提升”,这属于无法用粗心解释的结论夸大。
- 严重程度:🔴
发现 4:公式定义与物理意义自相矛盾
- 位置:Section III-B (公式 22-23)
- 描述:作者在定义任务截止时间违约成本 \(C_{ddl}\) 时,直接在公式里加了一个 \(\le \epsilon_i\) 的约束符号。
- 证据:式子 \(C = (A - B) \le \epsilon\) 这种写法在数学上极为不规范。如果这是一个约束,应该写成 \(C \le \epsilon\);如果 \(C\) 是计算违约成本的函数,它应该是一个具体的值。这种公式写法暴露了作者可能在强行将原问题本该作为硬约束的条件,生搬硬套成软约束(Cost),以迎合后面自己发明的 "CSMDP" 框架。
- 严重程度:🟡
发现 5:实验环境与时间线验证(✅ 唯一清白之处)
- 位置:Section V-A (Experiment Setup)
- 描述:以 2026-06-14 为基准,检查其软硬件时间线。
- 证据:作者使用的软硬件为:PyTorch v2.4.1(2024年7月发布)、Gurobi v12.0.0(2024年11月发布)、AMD Ryzen9-9900X CPU(2024年8月上市)、NVIDIA RTX 4090D GPU(2024年初上市特供版)。所有设备的发布时间均早于论文的投稿时间,时间线逻辑完全合理,未发现“时空穿越”使用未来设备的造假情况。
- 严重程度:✅ (未触发红旗)
耿同学辣评
这篇投稿 IEEE Trans 的论文,表面上又是 SMDP、又是双重智能体、又是收敛性证明,包装得高大上。结果呢?大一水平的 Softmax 公式都能写错,拿表格法的证明来给神经网络实验背书,最后为了显得牛逼,甚至敢把“算力快了 38%”吹成“性能提升 38%”。耿同学在此奉劝这位作者:哪怕你的算法跑得再快,数学推导如果是 AI 帮你瞎编的,审稿人又不是瞎子!学术圈容不下连 \(\sum e^{x}\) 都搞不明白的“大神仙”!
建议后续行动
- 拒绝接收该论文(如果是审稿人身份)。
- 要求作者提供原始的强化学习训练日志和代码,以验证 Table II 中那组“过于完美且难以对齐”的数据(见发现3)。
- 在 PubPeer 上提出对公式 (29) 和结论部分夸大描述的公开质疑。
- 向作者所在机构(东南大学)学术委员会反映其在结论部分故意捏造提升指标的问题。
⚠️ 免责声明
本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。