给模型多买一点推理算力,它会写出更长更完整的分析。这在数学题和代码题上成立,因为答案对错当场可判。放到交易上,这个问题要换一种问法:多花的推理 token,扣掉交易成本之后,还能不能变成组合的钱?
新泽西理工学院的 Jiayi Chen 与 Guiling Wang 把这个问法做成了控制实验,论文《The Price of Thought: Does Test-Time Reasoning Pay in LLM Trading?》于 2026 年 9 月 25 日上传 arXiv(2609.30705)。结论写在摘要第一句之后的那一句:三个模型家族里,增加推理都没有带来可靠的净收益提升。【直引】
🧪 实验怎么锁的变量
常见的 LLM 交易研究会把模型、提示词、工具、记忆、决策流程一起换,测出来的是一整套系统的差别。这篇只动一个旋钮:推理力度。
| 设定项 | 取值 |
|---|---|
| 时间范围 | 2024 年全年,241 个建仓日(1 月 10 日至 12 月 23 日) |
| 股票池 | 100 只美股,拆成 4 个任务各 25 只 |
| 标识处理 | 不透明代码,隐藏公司名 |
| 组合构建 | 排名最高 10 只做多、最低 10 只做空,两侧等权 |
| 敞口 | 总敞口 2,净敞口 0(市场中性) |
| 持有期 | 每个 cohort 持 5 个交易日,日历上重叠 |
| 交易成本 | 单边 10 个基点,敏感性分析覆盖 5、20、50 |
| 经济门槛 | 0.25 个基点/天 |
| 模型 | DeepSeek-Flash、GPT-5.6 Luna、Gemini 3.1 Flash-Lite |
| 输入条件 | 数值、可识别新闻、掩码新闻 |
| 规模 | 超过 80 万次资产预测 |
【直引:论文 §3 与附录】
基线推理档:DeepSeek 与 GPT 是 none(完全不开推理),Gemini 是 minimal,因为它的接口没法保证把内部思考彻底关掉。
判定规则预先写死:双侧 95% 置信区间下界大于 0.25 才算实质收益,上界小于 0 才算有害,上界小于 0.25 算无实质收益,其余一律 inconclusive。注意 inconclusive 不等于零效应,多数区间仍然同时包含正负两侧有经济意义的数值。【直引】
📊 九个年度对比,一个都没过线
九个年度 low vs baseline 对比(3 个模型家族 × 3 种输入条件),估计值单位是基点/天:
| 模型 | 输入条件 | 估计值 | 95% 区间 | 判定 |
|---|---|---|---|---|
| DeepSeek | 数值 | +6.159 | −7.243 到 19.560 | inconclusive |
| DeepSeek | 可识别新闻 | +0.378 | −9.033 到 9.790 | inconclusive |
| DeepSeek | 掩码新闻 | +1.449 | −6.768 到 9.666 | inconclusive |
| GPT | 数值 | +3.540 | −2.531 到 9.611 | inconclusive |
| GPT | 可识别新闻 | −0.626 | −5.905 到 4.653 | inconclusive |
| GPT | 掩码新闻 | +0.040 | −4.297 到 4.378 | inconclusive |
| Gemini | 数值 | +0.758 | −6.233 到 7.749 | inconclusive |
| Gemini | 可识别新闻 | −0.142 | −8.128 到 7.844 | inconclusive |
| Gemini | 掩码新闻 | −1.123 | −8.418 到 6.173 | inconclusive |
【直引:论文主结果表】
九个估计里六个正三个负,九个区间全部跨过 0,也全部跨过 0.25 的门槛线。Holm 校正之后判定不变。
绝对收益那一栏更冷。18 个组合(9 个基线加 9 个低推理)里 13 个净收益为负。正收益只出现在 Gemini 的可识别新闻(+1.417% / +1.275%)和 Gemini 掩码新闻的 minimal 基线(+2.122%)。Sharpe 比例大多在负区间,最大回撤普遍在 −20% 到 −34%。【直引:论文附录 Table 7】
📉 非单调,而不是边际递减
DeepSeek 是唯一测了完整曲线的家族:none、low、high、maximum。在 48 个冻结建仓日、68 个收益日、每个 backbone 重复生成三次的审计样本上:
| 输入条件 | 对比 | 估计值 | 95% 区间 |
|---|---|---|---|
| 数值 | Maximum − none | −4.875 | −20.319 到 10.569 |
| 可识别新闻 | Maximum − none | −4.053 | −12.949 到 4.843 |
| 掩码新闻 | Low − none | −9.016 | −16.248 到 −1.784 |
| 掩码新闻 | Maximum − none | −8.246 | −17.641 到 1.149 |
【直引:论文 Table 5】
掩码新闻下 low 对 none 的 −9.016 是全文唯一被判为 harm 的结果,区间上界 −1.784 全在零以下。三次独立生成分别是 −7.490、−9.327、−10.231,方向一致。移动块 bootstrap(5 个 session 一块)给出 −17.929 到 −3.477,cohort bootstrap 给出 −15.482 到 −2.281,都还活着。
唯一一段决定性为正的相邻对比,是可识别新闻的 Maximum − high:+4.639,区间 0.376 到 8.903。但 maximum 整体仍然没赢过 none。某一步有利和"越多越好"是两回事,这句话值得抄下来。【推论】
🎲 同样的问题问三遍,答案不一样
重复生成的结果更能说明问题。在冻结的市场日期上,同一个任务问三次:
- GPT 的净收益在正负之间翻符号。
- Gemini 在正收益和亏损之间摆。
- 被审计的 GPT 或 Gemini 建仓日里,没有任何一对生成选出完全相同的多空两端(identical tails 为 0.000)。GPT 数值低推理的 Spearman ρ 是 0.946,尾端 Jaccard 只有 0.657;Gemini 掩码新闻低推理的 ρ 是 0.669,Jaccard 0.355。
【直引:论文附录 H】
分数看着差不多,选出来的股票不一样。在十只做多十只做空的边界上,一点点排序抖动就会换掉一只持仓,换掉持仓就产生换手。【推论】
换手率数据支持这个链条。九种条件下换手率在 24.5% 到 31.2% 之间。DeepSeek 加推理反而降换手(数值条件从 30.83% 降到 24.48%),Gemini 加推理略微升换手(掩码新闻从 28.38% 升到 29.51%)。成本敏感性分析里,5、20、50 基点下 GPT 与 Gemini 的全部对比仍为 inconclusive,DeepSeek 掩码新闻的 harm 依然成立。【直引:论文附录 E】
🧾 格式变好了,收益没变
推理对输出结构合规的影响因模型而异,方向还不一致。
| 模型 | 推理对格式失败率的影响 |
|---|---|
| GPT | 数值条件 0.41% 升到 1.45%(p=.030);可识别新闻 从 17 降到 5(p=.016) |
| Gemini | 可识别新闻从 54 降到 14(p 小于 0.000001);掩码新闻 4.56% 降到 2.07%(p=.0032) |
| DeepSeek | 经 17 次确定性修复后无最终无效任务 |
无效任务率的基线:GPT 保留 57 个无效任务占 0.99%,Gemini 136 个占 2.35%,DeepSeek 为 0。
论文原句是:推理改变了输出结构可靠性,且方向因模型而异,可靠性改善本身并不意味收益改善。【直引:论文 §6.1】
这句话值得单独框起来。一个智能体输出的 JSON 完全合规、字段全对、类型无误,它选出来的股票篮子照样可以稳定亏钱。把语法合规当成判断力,是目前企业智能体落地里最贵的一类错误。【判断】
🧭 为什么值得盯
第一,它测的是经济量而不是代理量。多数 test-time scaling 研究落在数学和代码上,那里有可验证的真值。这篇把终点设成扣完成本之后的净收益,转换链条上每一环都可能把收益吃掉。【推论】
第二,结论对做量化的人是直接可用的。在 241 个交易日、100 只股票、10 多 10 空、单边 10 基点的设定下,三个家族九个对比没有一个能证明"多想一会儿值这个钱"。这不能外推成"推理没用",只能外推成"在你自己的流程里,推理的收益要单独验证"。【判断】
第三,它顺手拆了"分数稳定等于决策稳定"的假设。ρ 0.946 配 Jaccard 0.657,说明聚合指标会掩盖尾部选择的不稳定,而尾部才是决定持仓的地方。【推论】
⚠️ 边界
论文是预印本。样本只有 2024 一年、100 只美股、单一组合构建规则。基线是零推理档,不是"当前最佳实践"。交易成本用固定基点,没有滑点和市场冲击模型。inconclusive 的判定不等于等价,多数区间仍包含有意义的正负值。DeepSeek 的 −9.016 出自 48 个冻结日的审计样本,不是 241 天主样本。另外,模型选型(Flash 档、Luna、Flash-Lite)不是各家的最强推理模型,这一点限制了结论的外推范围。【判断】
参考
- Jiayi Chen, Guiling Wang(New Jersey Institute of Technology),《The Price of Thought: Does Test-Time Reasoning Pay in LLM Trading?》,arXiv:2609.30705,2026-09-25
- 论文引用的 test-time compute 背景:Wei et al. 2022;Wang et al. 2023;Snell et al. 2025;Muennighoff et al. 2025
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。