Loading...
正在加载...
请稍候

同一个策略换 20 次种子,夏普从 0.233 跑到 0.855

QianXun • 2026年09月28日 01:14

同一套架构、同一组超参数、同一份数据,只换随机数种子,同一个股票交易策略的年化夏普比率在 0.233 与 0.855 之间摆动,20 次运行的均值是 0.604。挑出最好的那个种子报出去,夏普比被抬高 44%。

先说这组数字的出处。它来自 Tech Daily Byte 对一篇论文的转述,我未能定位到论文正文里对应的表格,读的时候请以正文为准。那篇论文本身的结论是完整可查的,9 月 23 日在《The Journal of Finance and Data Science》上线。

一篇把矛头指向评估方式的论文

论文题目是 Unstable Gains: Multiplicity-Aware Evaluation of Financial Deep Reinforcement Learning,期刊卷 12 文章编号 100205,DOI 10.1016/j.jfds.2026.100205,2026 年 3 月 4 日收稿,8 月 16 日接收,9 月 23 日上线,开放获取。

它问的事情很朴素:深度强化学习在非凸随机优化下做金融决策,可靠性到底怎么评估。作者指出实证研究普遍依赖两种做法,一是单次运行的回测,二是未经多重性校正的算法比较。这两种做法会造出一种经济绩效稳定超越的错觉。

实验设计也简单。在股票交易与加密货币组合配置两类任务上,固定超参数,把既有的 DRL 架构在多次独立训练运行中复现一遍。

三条结论,一条比一条硬

第一条,夏普比率在不同随机种子之间差异显著,表面上的卓越表现在多运行与多重性感知评估下往往会消失。

第二条更狠。原始排行榜里看着有经济意义的算法间相对比较,经过置换检验与族系错误校正之后,常常失去统计显著性。这条直接指向了一个行业惯例:把若干算法排成一张表,谁在上面谁就有优越性。

第三条涉及一个具体的统计量。在高波动的加密货币市场里,同样量级的夏普比率,在缩水夏普比率(Deflated Sharpe Ratio)下得到的诊断支持水平可以完全不同。缩水夏普比率由 Bailey 与 López de Prado 在 2014 年提出,用来校正选择偏差、回测过拟合与非正态性。

作者的解读值得抄下来:一次异常回测的证据价值,不只看它的幅度,还要看它相对于随机训练运行结果分布有多稀有。

那句方法论主张

论文的核心主张是一句范式层面的话:当交易策略由非凸随机优化产生时,绩效应被视为学习策略上的随机变量,而不是数据的确定性函数。

这句话如果成立,影响的是报告方式。一个策略不该报一个数,该报一个分布。作者据此给了一套规范性框架,三根柱子分别是多运行评估、不确定性量化、显式的多重性控制。

结论也写得直白:缺少多重性感知评估与稳定性分析,金融 DRL 里报告的改进,反映的可能是随机优化与模型选择过程本身,而不是经济绩效的稳健提升。

另一份独立诊断,数字更刺眼

同期还有一份预印本在做同类型的事,对象是 PPO。研究叫 RiskLens Trader,发布在 Research Square,尚未同行评审。

设定是五只美股大盘股 AAPL、MSFT、NVDA、AMZN、GOOGL,区间 2018 到 2026,按时间做八二分训练测试切分,五个随机种子,其余条件全部固定。最好的那个种子拿到 132.6% 的样本外总回报和 1.78 的夏普比率。五个种子的均值夏普是 0.79,低于所有对照的经典基线,包括等权、买入持有、动量和最小方差。

还有一个细节更值得记。最成功的那几次运行伴随着显著更高的换手率与组合集中度,回报不是来自稳定的风险调整效率,而是来自激进的再分配与风险集中。

三份材料摆在一起

材料 对象 关键数字 出处状态
Unstable Gains 股票交易与加密组合的 DRL 跨种子夏普显著离散,排行榜比较经校正后常失显著 期刊正式上线 2026-09-23,开放获取
RiskLens Trader PPO 五只美股组合配置 最好种子夏普 1.78,五种子均值 0.79 低于经典基线 预印本,未经同行评审
Deflated Sharpe Ratio 通用统计量 按试验次数、样本长度、非正态性向下校正夏普 Bailey 与 López de Prado 2014,SSRN 2460551

另有一层是转述中提到的两篇,一篇说标普 500 波动率预测模型在样本外误差几乎相同的情况下换手率可以差到三倍,另一篇说在人为构造为零可预测性的合成市场里回测仍可能显得统计显著。这两篇我没能定位到一手出处,列在这里只作线索,不作为论据。

对自己搭量化系统的人,这份清单要前置

把论文的框架翻译成工程动作,是这几条。

  • 每个策略至少跑多个种子,报分布而不是报最大值,报的时候把跑了多少次一起写出来
  • 算法之间的相对比较先过置换检验,再做族系错误校正,别直接看排行榜
  • 夏普比率一律配缩水夏普比率一起报,尤其是加密这类高波动市场
  • 维护一份试验日志,特征集、模型类型、标签定义、参数扫描,每改一次都算一次尝试
  • 时间切分按日期不按随机,标签重叠的部分做 purge 与 embargo
  • 成本模型提前写死,换手率高的策略单独看成本翻转点

收在哪儿

这篇论文没有证明深度强化学习在交易上无效,它证明的是另一件事:在现有报告惯例下,我们分不清一个好结果是模型好还是运气好。

可跟踪的观察点有三个。这篇论文提出的规范性框架会不会被后续实证工作采纳为标准报告格式。期刊与会议会不会把多运行报告写进审稿要求。以及各家量化团队自己那份试验日志,愿不愿意跟着结果一起公开。

参考信源

  • 《Unstable Gains: Multiplicity-Aware Evaluation of Financial Deep Reinforcement Learning》,The Journal of Finance and Data Science,卷 12,文章编号 100205(2026),DOI 10.1016/j.jfds.2026.100205,2026-09-23 上线,开放获取
  • Bailey, D. H. 与 López de Prado, M.《The Deflated Sharpe Ratio》,SSRN 2460551(2014)
  • 《Seed Sensitivity and Risk Efficiency in PPO-Based Portfolio Allocation》,Research Square 预印本 rs-9824202,未经同行评审
  • Tech Daily Byte 对三篇 2026 年研究的综合转述(0.233 至 0.855、均值 0.604、44% 虚增,及另两篇论文的主张)
  • Bailey、Borwein、López de Prado、Zhu《Pseudo-Mathematics and Financial Charlatanism》,Notices of the AMS(2014)

#量化交易 #回测 #深度强化学习

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录