基于 PatchTST 模型的多因子量化选股投资策略研究
2026-08-06 15:10
🔍 耿同学打假报告
论文信息
- 论文来源:基于PatchTST模型的多因子量化选股投资策略研究_邬萌.pdf
- 标题:基于 PatchTST 模型的多因子量化选股投资策略研究
- 作者:邬萌
- 指导教师:彭欢 教授;校外导师:杨又村
- 期刊/出处:西南大学经济管理学院(专业学位硕士论文)
- 发表/提交年份:2024 年 5 月
综合评定:🟠 高度可疑
详细发现
发现 1:数据穿越(未来函数)——量化研究的毁灭性打击
- 位置:第 4.5.1 节(数据集构建)与 第 5.2 节(回测框架定义)
- 描述:论文声称将“2020 年至 2023 年这一时间段内的股票市场多因子数据”按照 7:2:1 的比例划分为训练集、验证集和测试集。然后,作者又在第 5 章明确指出,策略的回测区间是“2023 年 1 月 1 日至 2023 年 12 月 31 日”。
- 证据:在时间序列预测和量化投资中,这是典型的“未来函数”或数据穿越错误。模型在训练阶段已经学习了 2023 年的数据,然后再去对 2023 年进行回测。这就好比你拿着期末考试的卷子背了一遍,然后再去考期末考试,能考不好吗?这使得 2023 年高达 80.05% 的回测收益率完全失去了可信度,属于严重的学术逻辑谬误。
- 严重程度:🔴 实锤级错误(即便作者是不懂造成的无心之失,该结论也已彻底失效)
发现 2:夏普比率与回撤数据"太完美"(违背金融常识)
- 位置:第 5.3.2 节(策略收益风险分析)
- 描述:论文声称该策略在 2023 年(A股整体低迷、基准收益为 -11.38% 的年份)实现了 80.05% 的收益率,夏普比率高达 3.43,而最大回撤仅为 5.93%。
- 证据:在真实的A股市场中,单策略一年翻倍且夏普比率超过 3,是各大顶级量化私募都难以企及的“圣杯”级别数据。更离谱的是,要在满仓轮动 5 只股票(极高集中度)的情况下将最大回撤压在 5.93% 以内,在数学概率上几乎不可能,除非借助于前面提到的“数据穿越”,或者回测引擎存在严重 bug(如没计算冲击成本、滑点等)。这属于典型的“教科书式完美”造假或欺骗性美化。
- 严重程度:🟠 高度可疑
发现 3:时间序列滑动窗口的数学逻辑崩塌
- 位置:第 4.5.1 节(数据集划分)
- 描述:论文提到“滑动窗口的长度应设定为 61 天,以确保包含完整的 60 天历史数据和对应的分类标签”,并声称窗口移动步长为 1 天。
- 证据:作者的核心预测目标是“未来 5 天的股票收益率”。如果输入特征是过去 60 天(T-60 到 T-1),预测目标是 T 到 T+5 的收益率,那么时间窗口从起点到终点的实际跨度应该是 65 天以上。作者设定长度为 61 天,说明其要么对时序模型的基本原理一窍不通,要么代码实现中根本就是错乱的(比如拿 T+4 的数据去预测 T+5,造成了隐蔽的特征穿越)。这是深度学习量化论文常犯的基础性严重错误。
- 严重程度:🟠 高度可疑
发现 4:机器学习任务与损失函数的南辕北辙
- 位置:第 4.5.1 节 与 第 4.5.3 节
- 描述:作者明确表示:“本研究并不关注于回归问题,而是将重点放在分类问题上...将股票在 5 天后的收益率映射到 20 个区间”。但是在模型评估(图 4-6 和公式 4-7)中,作者又使用了均方误差(MSE)作为 Loss 函数,并且大谈特谈预测误差。
- 证据:如果作为分类任务,标准的做法是使用交叉熵损失。MSE 虽然在极端情况下可用于分类,但在多分类且区间映射的任务中极不专业。更大可能是作者直接复制了别人的回归训练代码,然后在论文里强行包装成分类任务,导致前后逻辑割裂。
- 严重程度:🟡 存疑(作者对模型机制理解混乱)
发现 5:数据表格呈现"人工雕刻"痕迹
- 位置:表 4-3(最终因子重要性分析结果)
- 描述:随机森林跑出的特征重要性分数呈现出极其规律的阶梯式递减:0.111, 0.109, 0.109, 0.104, 0.101, 0.099, 0.093, 0.092, 0.091, 0.091。
- 证据:真实的随机森林特征重要性分布通常会有几个主导特征拔尖,然后断崖式下跌,再出现长尾。像这样每个特征都极其接近(在 0.09 到 0.11 之间),平滑得像一条直线,极大概率是数据是人工编造分配的,或者是用极其错误的输入(比如全是噪声的随机数据)跑出来的结果。
- 严重程度:🟡 存疑
耿同学辣评
这篇文章把量化圈最喜欢犯的“终极绝症”给集齐了:拿着未来的报纸做今天的决策,再用夏普 3.4 的“股神级”曲线来包装一个连 Loss 函数都用不对的模型。如果作者真的发现了这种回撤不到 6% 且年化 80% 的印钞机代码,别读研了,赶紧去私募发产品秒杀巴菲特吧!作为金融硕士论文,在核心逻辑上出现“用 2023 年数据训练模型,再去回测 2023 年赚了 80%”这种穿越戏码,简直是视学术严谨性为儿戏。
建议后续行动
- 联系作者要求提供源代码和完整的回测报告(特别是数据集切分的具体时间戳)。
- 要求作者解释 61 天滑动窗口如何能够预测未来 5 天数据。
- 在答辩委员会或西南大学经济管理学院学术委员会层面提出复审,该论文的核心结论已被“数据泄露”彻底污染。
- (如需公开质疑)在知网或学术打假平台上披露其时间序列数据划分的致命缺陷。
⚠️ 免责声明
本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。