四十个资产,六个活到最后:分钟级交易的成本账
四十支队伍进场,完赛留在台上的只有六支。10 月 1 日发表在 Frontiers in Applied Mathematics and Statistics 的一项研究,把这个残酷的比例写成了学术结论:机器学习模型在四十个金融资产上都找到了方向性信号,扣掉交易成本后,只有约 15% 的资产累计盈利为正。
四十支队伍进场,完赛留在台上的只有六支。10 月 1 日发表在 Frontiers in Applied Mathematics and Statistics 的一项研究,把这个残酷的比例写成了学术结论:机器学习模型在四十个金融资产上都找到了方向性信号,扣掉交易成本后,只有约 15% 的资产累计盈利为正。
作者 Alan Gaona、Jennifer Rangel-Madariaga 与 Lourdes Uribe 给自己出的是一道比预测准确率苛刻得多的题:这些预测能不能在摩擦之后还剩下钱。
🧪 实验怎么做
样本是四十个资产:二十四只股票,横跨信息技术到金融的五个行业板块;十个外汇对,主流与新兴市场货币混搭;六个加密货币,比特币与以太坊带几个山寨币。数据全部是一分钟线,从 2022 年 1 月 1 日到 2023 年 12 月 31 日整整两年。
特征是九类教科书级技术指标。
- 趋势与量能:简单均线与指数均线,加上成交量加权均价
- 动量与振荡:MACD 与随机指标,动量与变化率
- 波动与强弱:布林带与 RSI基本面被刻意排除,理由是预测窗口以分钟计,财报与宏观帮不上忙。
最关键的一处在目标函数。交易成本按券商披露的价差标准化设定,股票、外汇、加密货币各用各的费率,成本既计入训练目标,又计入最后的盈亏核算。模型从训练那天起就知道自己在跟手续费赛跑。
📉 预测看着不错,赚钱是另一回事
先看预测面。股票的平均精确率 45.35%,召回率 33.35%,精确率加权的 F 值平均 43.88%。精确率 45% 的直观意思是,模型喊十次方向,对的不到五次。加密货币的预测成绩与股票大体相当,外汇最难测。
再看盈利面:四十个资产里只有约 15% 在扣成本后累计盈利为正。预测与盈利之间隔着的那道坎,名字叫成本。
这张表列的是各资产类别自动选中的最优预测窗口,要看的是结论有多一致。
| 类别 | 选 30 分钟 | 选 15 分钟 | 其余 |
|---|---|---|---|
| 股票,24 只 | 22 | 未逐项披露 | 2 |
| 外汇,10 对 | 10 | 0 | 0 |
| 加密货币,6 个 | 4 | 2 | 0 |
🤔 三种读法
第一读:短窗口死于噪声。作者给出的一种解释是,最短的几个价格变动里,噪声太多,选定的指标与树模型提不出稳定的方向信息。分钟线上最活跃的那部分波动,多半是流动性摩擦而不是信息。
第二读:30 分钟的胜利要打折扣。它是六个候选窗口里最长的那个,边界上赢了不等于边界外还有更优。45 分钟、一小时会不会更好,实验没测。把边界值当成最优值,是这类研究最容易被误读的地方。【判断】
第三读:这套设计对成本是双重的严格。训练目标里扣一次,盈亏核算里再扣一次,而且三十个种子的稳定性检查拦住了单次好运。15% 这个幸存率是在对模型最有利的假设下算出来的,换个说法,真实世界只会更狠。
🧭 和上周那篇拼起来看
9 月 30 日智柴发过《The Price of Thought》,那篇的结论是给大语言模型加推理算力,换不来交易净收益。这一篇用的是教科书级的树模型加技术指标,没有大模型,结论方向却拼上了同一块拼图:信号存在,成本与噪声是分母,分母大到吞掉分子。
两篇合起来的含义对量化从业者相当具体。前一篇砍的是推理预算的迷信,这一篇砍的是频率的迷信:把预测窗口从一分钟挪到三十分钟,比把模型从决策树换成 XGBoost 更可能改变盈亏。
样本停在 2023 年底也是一个限定:这两年是高波动年份,成本结构与流动性状况换一个时段,幸存名单未必是同一批名字。
信源:Frontiers in Applied Mathematics and Statistics 论文报道(Research Today,2026-10-01,作者 Gaona、Rangel-Madariaga、Uribe)。
限定:未核到论文原文与 DOI,全部数字出自 Research Today 的转述;三十个随机种子、双重计成本等细节同样为二手;各资产类别的具体成本费率数值报道未给出;2024 年之后的数据未覆盖。