Loading...
正在加载...
请稍候

基于LightGBM的股票收益率预测与策略实现

2026-08-06 17:51

🔍 耿同学打假报告

论文信息

  • 标题:基于LightGBM的股票收益率预测与策略实现
  • 作者:朱芝萱
  • 期刊:ChinaXiv 预印本
  • DOI:未提供
  • 发表年份:2026
  • 论文来源:view.pdf

综合评定:🔴 实锤

详细发现

发现 1:核心财务数据存在不可调和的数学矛盾(数据造假检测)

  • 位置:第4页,3.3 回测结果与分析
  • 描述:论文声称策略初始资金10万元,绝对总收益率为62.53%(即总净利润约62530元)。在此期间共进行9笔交易(5次盈利,4次亏损),胜率55.56%,盈亏比为2.31,并明确给出了“单笔交易平均盈利达7011.94元”的数据。这些核心财务数据之间产生了极其严重的数学对冲矛盾。
  • 证据
    • 假设文中“单笔交易平均盈利7011.94元”指的是盈利单笔的平均值,那么5笔盈利交易的总盈利为 \(5 \times 7011.94 = 35059.7\) 元。根据盈亏比2.31,4笔亏损交易的总亏损应为 \(35059.7 \div 2.31 \times 4 \approx 12141.9\) 元。最终净盈利仅为 $22917.8$ 元(约22.9%的收益),这与文中声称的“实现3.72%的超额收益率”、“绝对总收益率为62.53%”直接矛盾!
    • 假设“单笔交易平均盈利7011.94元”指的是每笔交易净利润的算术平均,那么9笔交易的总净盈利约为 \(9 \times 7011.94 = 63107.46\) 元,虽然接近62530元,但若以此反推:\(5W - 4L = 63107.46\)\(W/L = 2.31\),计算得出盈利交易的平均收益 W 高达 19314元。此时文中所述的“平均盈利达7011.94元”就成了无源之水。
  • 严重程度:🔴
  • 复核状态:✅ 成立

⚠️ 发现 2:极小样本量推导“稳定盈利”(统计学异常检测)

  • 位置:第4页,3.3 回测结果与分析
  • 描述:回测周期长达16个月(2024.01-2025.04),但在“全仓买入/清仓”的严苛条件下,策略仅触发了9次交易。基于9次交易的极小样本量,作者得出了“具备稳定的盈利能力”、“并非参数过度优化的偶然结果”等强宏观结论。
  • 证据:量化回测中,9次交易在统计学上毫无代表性。用5次盈利、4次亏损算出“55.56%胜率”并大谈特谈策略稳定性,存在夸大研究结论的嫌疑。但也可能仅是作者缺乏基本统计学常识所致。
  • 严重程度:🟡
  • 复核状态:⚠️ 存在良性解释(作者可能仅是缺乏量化金融统计常识,过度解读了小样本结果,属学术能力问题而非主观数据造假)

发现 3:年化收益率与绝对总收益的数学不自洽(统计学异常检测)

  • 位置:第4页,3.3 回测结果与分析
  • 描述:论文声称基准绝对总收益率为58.81%,年化收益率为34.63%。通过这两个数据进行时间周期反推,发现时间线凭空多出了几个月,存在明显的数据捏造或机械套用模板的痕迹。
  • 证据:根据复利公式 \(1 + 绝对收益率 = (1 + 年化收益率)^{年数}\),反推回测时间 \(T\)
    • 基准组反推:\(T = \ln(1.5881) / \ln(1.3463) \approx 1.554\) 年(约568天)
    • 策略组反推(62.53%与36.65%):\(T = \ln(1.6253) / \ln(1.3665) \approx 1.557\) 年(约569天)
    • 论文明确定义的回测区间为 2024年1月1日至2025年4月24日,实际日历天数仅480天(约1.314年)。两组数据反推出的“隐形时长”高度一致地指向了约1.55年,说明作者极大概率是用真实涨幅算出了绝对收益率,然后随手编造或套用了带有固定且错误年化公式的模板,导致数学上完全对不上。
  • 严重程度:🔴
  • 复核状态:✅ 成立

发现 4:滚动训练机制与早停验证集的逻辑冲突(方法学异常)

  • 位置:第2页,1.2 整体研究框架与数据划分;第3页,1.4 模型训练方案
  • 描述:作者声称采用滚动预测(每60个交易日向前滚动更新一次模型),同时又声称使用固定的“验证集(2023年下半年)”来触发早停机制,两者在机器学习工程实现中存在严重的底层逻辑冲突。
  • 证据:如果在2024年和2025年的回测期间,每60天就用最新数据重新训练模型,那么固定在2023下半年的验证集与当前训练集的时间跨度会越来越大(甚至相差超过一年),用这种严重脱节的验证集来触发早停,直接违背了金融时序预测防止信息泄露和概念漂移的初衷。若不是代码写死报错,就是作者为凑字数随意拼接的专业术语。
  • 严重程度:🟠
  • 复核状态:✅ 成立

耿同学辣评

量化圈有句老话:“回测猛如虎,实盘二百五”。但这篇论文更离谱,是“算术猛如虎,逻辑全靠补”。9笔交易就敢吹稳健,平均盈利连自己都算不对;最荒唐的是时间线反推还能凭空长出好几个月,连基本的复利公式都能用错套牢。此外,一套声称“每60天滚动更新”的模型,居然对着大半年前的固定验证集做“早停”,这是把金融工程的底裤都给扒了。建议作者先把小学算术和机器学习入门补一补,再来做量化模型吧!

建议后续行动

  • 联系作者要求提供原始交易流水表、特征工程数据集和回测源代码
  • 在 PubPeer 或相关学术平台上公开提出质疑
  • 向 ChinaXiv 平台反映该预印本存在的严重数据质量与核心逻辑问题

⚠️ 免责声明

本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。


🧮 证据合成(自动生成)

  • 综合后验概率:≥99.9%(先验 5%)
  • 95% 可信区间:[100%, 100%]
  • 贝叶斯因子:BF = 1.72e+12(决定性(decisive))
  • 综合评级:🔴 高度疑似

贡献最高的证据

  1. [img-001.jpg] 检测到 copy-move 复制粘贴:偏移 (48,0) 处 79 对匹配块(image/copy_move,logLR=3)— 贡献 12.1%
  2. 持续向前滚动的训练机制与固定在2023年的验证集发生使用逻辑冲突。(llm/*,logLR=2.3)— 贡献 10.5%
  3. [img-002.jpg] 检测到 copy-move 复制粘贴:偏移 (48,0) 处 46 对匹配块(image/copy_move,logLR=3)— 贡献 10.1%
  4. [img-000.jpg] 检测到 copy-move 复制粘贴:偏移 (32,0) 处 80 对匹配块(image/copy_move,logLR=3)— 贡献 9%
  5. 总利润、交易胜率、盈亏比与平均盈利金额之间存在无法自圆其说的数学矛盾,数据高度疑似编造。(llm/*,logLR=2.3)— 贡献 8.8%

免责:本小节由程序化贝叶斯合成自动生成,不构成学术不端判决。先验固定 5%,证据间按条件独立处理(可能高估相关证据的联合强度),LR 版本 geng_lr_v2(初值未校准,待 Phase 5 基准回归);可信区间与点估计来自同一后验(先验抽样 + LR 噪声的联合蒙特卡洛,区间随证据强度收敛)。请以正文具体发现与原始数据为准。