📉 十八点三和负二点七:一条新闻在强化学习里帮了倒忙
同一份新闻,在两个阶段里值 21 个百分点。
arXiv 2610.10407,10 月 7 日 16:55 UTC 提交,96 KB,NeurIPS 2026 Agenthon Workshop 录用。作者两人,Yizhen Xie 与 Mengyang Liu。
论文在美股九只大盘股加 SPY 的期权上做智能体交易,六个月样本外总收益 18.3%,夏普 1.60,最大回撤 8.96%。摘要里紧跟一句:保留新闻输入会让样本外收益从 18.3% 掉到 -2.7%。
🧾 三个数字摆在一起看
| 配置 | 样本外总收益 |
|---|---|
| 完整 SOTA | 18.3% |
| 强化学习阶段保留新闻 | -2.7% |
| 差值 | 21 个百分点 |
夏普 1.60 和回撤 8.96% 是完整 SOTA 的口径。摘要没有给出保留新闻那一组的夏普与回撤,只给了收益。
🏗️ 期权的麻烦在于合约数量
一只股票可以挂几千张合约。智能体要同时决定两件事:交易哪几张,以及怎么把它们组合起来。已有做法大多绕开这个复杂度,办法是把策略限制成固定结构,比如一个跨式 straddles,代价是市场条件变化时没法换策略。
SOTA 的处理是把大期权宇宙抽象成策略级决策,交给确定性 resolver 去做组合实现。底座是 Qwen3.8-27B,先监督微调再强化学习。对照组是规则式和机器学习的策略选择器,在同一个交易环境里跑。
🧩 那个不对称才是论文最硬的发现
新闻在监督微调阶段是有用的,它让前沿教师产出的轨迹更好。保留到强化学习阶段就翻转了。
【推论】机制上讲得通。强化学习阶段模型在优化策略本身,新闻里的措辞波动成了奖励信号的噪声源,模型开始拟合「新闻语气」而不是「策略优劣」。但这是作者的框架,不是论文用实验分离出的因果结论。
要读出这条结论得接受几个前提。样本外区间的具体起止日期摘要未给。交易成本假设摘要未给。滑点模型、手续费与保证金设置同样未给。基准与对照策略的具体参数摘要未给。「同一交易环境」是论文自己的表述。
💡 为什么新闻会在这里反噬
信源与限定:全部数字取自 arXiv 2610.10407 摘要,v1 预印本,未经同行评审。未读正文,因此以下均未取到:九只股票名单、Qwen3.8-27B 的基座版本、策略集合的规模、交易成本假设、Sharpe 的计算口径,以及最大回撤的统计窗口。18.3% 与 -2.7% 是论文自报,无第三方复现。arXiv 分类为 cs.AI 与 cs.LG,交叉 q-fin.PM 与 q-fin.TR。
一句话:这条论文的价值不在 18.3%,在提醒所有做金融智能体的人:哪些输入放在微调里有用,取决于你把它放进了哪一格。
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。