Loading...
正在加载...
请稍候

思考的价签:80 万次预测,买不到四分之一个基点

QianXun • 2026年09月29日 22:50

给模型多买一点推理算力,它会写出更长更完整的分析。这在数学题和代码题上成立,因为答案对错当场可判。放到交易上,这个问题要换一种问法:多花的推理 token,扣掉交易成本之后,还能不能变成组合的钱?

新泽西理工学院的 Jiayi Chen 与 Guiling Wang 把这个问法做成了控制实验,论文《The Price of Thought: Does Test-Time Reasoning Pay in LLM Trading?》于 2026 年 9 月 25 日上传 arXiv(2609.30705)。结论写在摘要第一句之后的那一句:三个模型家族里,增加推理都没有带来可靠的净收益提升。【直引】

🧪 实验怎么锁的变量

常见的 LLM 交易研究会把模型、提示词、工具、记忆、决策流程一起换,测出来的是一整套系统的差别。这篇只动一个旋钮:推理力度。

设定项 取值
时间范围 2024 年全年,241 个建仓日(1 月 10 日至 12 月 23 日)
股票池 100 只美股,拆成 4 个任务各 25 只
标识处理 不透明代码,隐藏公司名
组合构建 排名最高 10 只做多、最低 10 只做空,两侧等权
敞口 总敞口 2,净敞口 0(市场中性)
持有期 每个 cohort 持 5 个交易日,日历上重叠
交易成本 单边 10 个基点,敏感性分析覆盖 5、20、50
经济门槛 0.25 个基点/天
模型 DeepSeek-Flash、GPT-5.6 Luna、Gemini 3.1 Flash-Lite
输入条件 数值、可识别新闻、掩码新闻
规模 超过 80 万次资产预测

【直引:论文 §3 与附录】

基线推理档:DeepSeek 与 GPT 是 none(完全不开推理),Gemini 是 minimal,因为它的接口没法保证把内部思考彻底关掉。

判定规则预先写死:双侧 95% 置信区间下界大于 0.25 才算实质收益,上界小于 0 才算有害,上界小于 0.25 算无实质收益,其余一律 inconclusive。注意 inconclusive 不等于零效应,多数区间仍然同时包含正负两侧有经济意义的数值。【直引】

📊 九个年度对比,一个都没过线

九个年度 low vs baseline 对比(3 个模型家族 × 3 种输入条件),估计值单位是基点/天:

模型 输入条件 估计值 95% 区间 判定
DeepSeek 数值 +6.159 −7.243 到 19.560 inconclusive
DeepSeek 可识别新闻 +0.378 −9.033 到 9.790 inconclusive
DeepSeek 掩码新闻 +1.449 −6.768 到 9.666 inconclusive
GPT 数值 +3.540 −2.531 到 9.611 inconclusive
GPT 可识别新闻 −0.626 −5.905 到 4.653 inconclusive
GPT 掩码新闻 +0.040 −4.297 到 4.378 inconclusive
Gemini 数值 +0.758 −6.233 到 7.749 inconclusive
Gemini 可识别新闻 −0.142 −8.128 到 7.844 inconclusive
Gemini 掩码新闻 −1.123 −8.418 到 6.173 inconclusive

【直引:论文主结果表】

九个估计里六个正三个负,九个区间全部跨过 0,也全部跨过 0.25 的门槛线。Holm 校正之后判定不变。

绝对收益那一栏更冷。18 个组合(9 个基线加 9 个低推理)里 13 个净收益为负。正收益只出现在 Gemini 的可识别新闻(+1.417% / +1.275%)和 Gemini 掩码新闻的 minimal 基线(+2.122%)。Sharpe 比例大多在负区间,最大回撤普遍在 −20% 到 −34%。【直引:论文附录 Table 7】

📉 非单调,而不是边际递减

DeepSeek 是唯一测了完整曲线的家族:none、low、high、maximum。在 48 个冻结建仓日、68 个收益日、每个 backbone 重复生成三次的审计样本上:

输入条件 对比 估计值 95% 区间
数值 Maximum − none −4.875 −20.319 到 10.569
可识别新闻 Maximum − none −4.053 −12.949 到 4.843
掩码新闻 Low − none −9.016 −16.248 到 −1.784
掩码新闻 Maximum − none −8.246 −17.641 到 1.149

【直引:论文 Table 5】

掩码新闻下 low 对 none 的 −9.016 是全文唯一被判为 harm 的结果,区间上界 −1.784 全在零以下。三次独立生成分别是 −7.490、−9.327、−10.231,方向一致。移动块 bootstrap(5 个 session 一块)给出 −17.929 到 −3.477,cohort bootstrap 给出 −15.482 到 −2.281,都还活着。

唯一一段决定性为正的相邻对比,是可识别新闻的 Maximum − high:+4.639,区间 0.376 到 8.903。但 maximum 整体仍然没赢过 none。某一步有利和"越多越好"是两回事,这句话值得抄下来。【推论】

🎲 同样的问题问三遍,答案不一样

重复生成的结果更能说明问题。在冻结的市场日期上,同一个任务问三次:

  • GPT 的净收益在正负之间翻符号。
  • Gemini 在正收益和亏损之间摆。
  • 被审计的 GPT 或 Gemini 建仓日里,没有任何一对生成选出完全相同的多空两端(identical tails 为 0.000)。GPT 数值低推理的 Spearman ρ 是 0.946,尾端 Jaccard 只有 0.657;Gemini 掩码新闻低推理的 ρ 是 0.669,Jaccard 0.355。

【直引:论文附录 H】

分数看着差不多,选出来的股票不一样。在十只做多十只做空的边界上,一点点排序抖动就会换掉一只持仓,换掉持仓就产生换手。【推论】

换手率数据支持这个链条。九种条件下换手率在 24.5% 到 31.2% 之间。DeepSeek 加推理反而降换手(数值条件从 30.83% 降到 24.48%),Gemini 加推理略微升换手(掩码新闻从 28.38% 升到 29.51%)。成本敏感性分析里,5、20、50 基点下 GPT 与 Gemini 的全部对比仍为 inconclusive,DeepSeek 掩码新闻的 harm 依然成立。【直引:论文附录 E】

🧾 格式变好了,收益没变

推理对输出结构合规的影响因模型而异,方向还不一致。

模型 推理对格式失败率的影响
GPT 数值条件 0.41% 升到 1.45%(p=.030);可识别新闻 从 17 降到 5(p=.016)
Gemini 可识别新闻从 54 降到 14(p 小于 0.000001);掩码新闻 4.56% 降到 2.07%(p=.0032)
DeepSeek 经 17 次确定性修复后无最终无效任务

无效任务率的基线:GPT 保留 57 个无效任务占 0.99%,Gemini 136 个占 2.35%,DeepSeek 为 0。

论文原句是:推理改变了输出结构可靠性,且方向因模型而异,可靠性改善本身并不意味收益改善。【直引:论文 §6.1】

这句话值得单独框起来。一个智能体输出的 JSON 完全合规、字段全对、类型无误,它选出来的股票篮子照样可以稳定亏钱。把语法合规当成判断力,是目前企业智能体落地里最贵的一类错误。【判断】

🧭 为什么值得盯

第一,它测的是经济量而不是代理量。多数 test-time scaling 研究落在数学和代码上,那里有可验证的真值。这篇把终点设成扣完成本之后的净收益,转换链条上每一环都可能把收益吃掉。【推论】

第二,结论对做量化的人是直接可用的。在 241 个交易日、100 只股票、10 多 10 空、单边 10 基点的设定下,三个家族九个对比没有一个能证明"多想一会儿值这个钱"。这不能外推成"推理没用",只能外推成"在你自己的流程里,推理的收益要单独验证"。【判断】

第三,它顺手拆了"分数稳定等于决策稳定"的假设。ρ 0.946 配 Jaccard 0.657,说明聚合指标会掩盖尾部选择的不稳定,而尾部才是决定持仓的地方。【推论】

⚠️ 边界

论文是预印本。样本只有 2024 一年、100 只美股、单一组合构建规则。基线是零推理档,不是"当前最佳实践"。交易成本用固定基点,没有滑点和市场冲击模型。inconclusive 的判定不等于等价,多数区间仍包含有意义的正负值。DeepSeek 的 −9.016 出自 48 个冻结日的审计样本,不是 241 天主样本。另外,模型选型(Flash 档、Luna、Flash-Lite)不是各家的最强推理模型,这一点限制了结论的外推范围。【判断】


参考

  • Jiayi Chen, Guiling Wang(New Jersey Institute of Technology),《The Price of Thought: Does Test-Time Reasoning Pay in LLM Trading?》,arXiv:2609.30705,2026-09-25
  • 论文引用的 test-time compute 背景:Wei et al. 2022;Wang et al. 2023;Snell et al. 2025;Muennighoff et al. 2025

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录