排序排得像,换股票就不像
让大模型给一百只股票排个序,做这件事本身不难,难的是回答后面那一问:这个排序能不能变成一条能拿去交易的规则。
10 月 1 日早上七点十九分,Shuai Wu、Xue Li、Zhijun Wang 等七个人交了一篇计算审计(arXiv:2610.01213,45.8 MB 的大文件)。他们在做的事,是把语言模型的排序剥到只剩骨架,然后看骨架里还剩多少东西。
答案是:整体轮廓留下了,具体到个股进出就没了。
怎么剥的
审计的骨架是四个模型加五个数值对照方法,共用同一个组合引擎,跑 72 个按月划分的持有期,覆盖上证 50、沪深 300 与中证 500 三个指数池。排序用九个特征。上证 50 上重复跑了五次,测的是同样输入下的波动。
剥法是:先在开发期把模型偏好拟合成线性规则,然后把规则冻结,再去做未见月、更大池与受控干预这三组测试。
对照的量是两套。相对零变化预测的排序变化误差,在十二组归档特征组比较与八组匹配单特征比较里更低,Holm 校正分成九加三与六加两个族做。
三个数放在一起看
| 指标 | 数值 | 含义 |
|---|---|---|
| Spearman 一致度(上证 50) | 0.923 至 0.984 | 整体排序几乎一致 |
| 迁移后一致度 | 0.795 至 0.985 | 换池子后仍然接近 |
| 个股进出事件 Jaccard | 0.000 至 0.125 | 具体买什么卖什么,几乎重合不上 |
第一行和第三行之间的落差就是这篇的全部。前者说的是两个模型对一百只股票的整体偏好有多像,后者说的是两个模型对某只股票该不该进出的判断有多像。
1.0 的 Jaccard 意味着每次进出都完全一致。0.125 意味着八次里只对上一次。
【直引】论文自己用的词是,预测个股进出依然弱。整体排序可以用紧凑规则近似,收益结论则依赖比较族、不确定性方法与并列处理方式。
收益那一半
历史均值上,模型口径的复合年增长率在 6.26% 到 11.17% 之间。数字体面。
交易成本这一栏就没那么好看。单边 10 个基点、六个月分块的情况下,十二组比较的模型减规则收益族与因子控制后的关联,校正之后没有任何显著发现。
有三组高成本、十二个月分块的比较,在各自的十二个测试切片里偏向一条叫 Terra 的规则。但放回完整的 144 项敏感性网格,校正之后依然没有显著结果。
两批输入干预测试合计 5184 次响应。三模型那一批在主分块长度上没有 bootstrap 校正后的发现;Luna 那一行在异方差与自相关一致(HAC)校正下、在其三测试族内出现了一个行序效应,但放到合并的 24 项校正里就没了。
【判断】行序效应是这一堆统计里唯一值得单拎出来的东西。模型看到的行序不同,给出的排序就不一样,而这件事在它自己的三测试族里是显著的。这不是收益泄漏,是模型对输入格式的敏感,属于另一类问题。
它和另外两篇拼起来是什么图
量化方向这两周有三篇东西指向同一个位置。
| 日期 | 论文 | 落在哪一层 |
|---|---|---|
| 09-28 | 回测验证失效,RiskLens PPO 五种子与 DSR | 验证机制本身会不会骗人 |
| 09-29 | Price of Thought,80 万次预测买不到四分之一个基点 | 推理算力换不来净收益 |
| 10-01 | 本篇,模型排序的可检验经济规则审计 | 排序能否还原成规则 |
前两篇讲成本与噪声,这一篇讲结构。三篇的共同底色是:回测里的那条曲线由分母决定,而分母被反复低估。
有个数字可以自己算。144 项敏感性网格里,三个高成本比较各自在十二项切片里偏向 Terra。十二除以 144 是百分之八。这是未经校正的命中率,Holm 校正之后归零。
【直引】论文的结论句写得很克制:紧凑规则能近似整体排序;收益结论取决于比较族、不确定性与并列优先级。
四个必须标出来的限定
- arXiv v1 预印本,45.8 MB,未经同行评审
- 72 个月的历史区间约 2019 年中到 2025 年中,市场结构并非恒定
- 10 个基点单边成本是一个假设值,论文把它当主口径
- Terra 与 Luna 是论文里规则的代号,未见完整规则定义
【推论】这篇的方法论价值高于它的结论价值。四个模型与五个对照,共用一套引擎,三组冻结后测试,144 项敏感性网格,两个多重校正族,这一整套是把 LLM 排序类论文的常见漏洞逐个堵上的做法。别的团队做同类选题,这套模板可以直接借。
对交易的现实含义反而是负面的。整体偏好稳定,落到个股就是噪声,那么可用的部分只剩下粗粒度的行业或风格暴露,而那一层不需要四个语言模型来排。
参考来源
- arXiv:2610.01213,Shuai Wu 等七人,2026-10-01 提交
- ML-Quant 2026-10-02 第 133 期对量化研究文献的筛选结果
- arXiv:2610.01325 PPO-HRAP 作为单窗口单资产对照,2026-10-01 提交
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。