当 LLM 遇到股票:检索帮了基本面,却害了交易信号
场景:一个 LLM 分析师回答不了的问题
2025 年 7 月,英伟达股票小幅回调。一个用户问 GPT-5-mini:"英伟达 7 月的回调是买入机会吗?"
这个问题需要两类推理。第一类是基本面推理:英伟达的资产回报率、现金流强度、负债比率——这些信息藏在 SEC 10-K/10-Q 文件里,是文本密集的。第二类是交易信号推理:动量、波动率、RSI、回撤——这些需要从 OHLCV(开盘、最高、最低、收盘、成交量)价格序列中计算数值指标。
GPT-5-mini 在这个题上栽了。它正确识别了"没有回调"这个事实,但在"是否买入"的判断上完全失败——所有 14 个被测 LLM 在买入判断上都答错了。
这不是个例。FinTradeBench 的作者团队(Yogesh Agrawal、Aniruddha Dutta 等)发现:现有的金融 QA 基准测试几乎只评估基本面推理,几乎没有评估交易信号推理。FinQA、ConvFinQA、TAT-QA、FinanceBench——它们都聚焦在财务报表和文本披露上。但真实的金融分析需要同时处理两种信号:会计指标和市场动态。
于是他们构建了 FinTradeBench:1400 道题,覆盖纳斯达克 100 公司、十年历史窗口(2015-2025),分为三类——基本面(F)、交易信号(T)、混合(FT)。
基准构建:校准-然后-扩展
构建一个高质量的金融推理基准,难点不在于出题,而在于规模化地保证题目正确。FinTradeBench 用了一个"校准-然后-扩展"(calibration-then-scaling)框架:
1. 专家种子问题:金融专家手写少量高质量问题,定义问题格式和推理深度。
2. 多模型响应生成:用多个 LLM 在种子问题的基础上生成大量候选问题,用 TELeR 分类法控制推理层级(从 L1 简单指令到 L6 复杂 RAG 推理)。
3. 模型内自过滤:每个模型独立评估自己的候选,选出最佳——不跨模型比较,避免偏好泄漏。
4. 自动化数值审计:独立 LLM 审计员检查每个响应中的数值声明,分类为 SUPPORTED、CONTRADICTED 或 NOT_FOUND。
5. 人-LLM 评判对齐:人类专家和 LLM 评判员对齐,确保评分可靠。
这个流程的精髓是:用 LLM 的规模性生成,但用多层级过滤保证质量。每一层过滤都针对一个特定的失败模式——自过滤消除逻辑错误,数值审计消除幻觉,人-LLM 对齐消除评判偏差。
核心发现:检索是双刃剑
FinTradeBench 评估了 14 个 LLM,在零样本和 RAG(检索增强生成)两种设置下。结果揭示了一个反直觉的规律:
检索帮了基本面,害了交易信号。
在 F 类问题上,RAG 带来了巨大提升。DeepSeek-R1 提升了 23.6%,Gemini 2.5 Flash 提升了 23.8%,R1-Distill-Qwen (32B) 提升了 37%。这很合理——基本面问题需要从 SEC 文件中提取会计指标,RAG 正好擅长从长文本中检索相关信息。
但在 T 类问题上,RAG 系统性地降低了性能。Gemini 2.5 Flash-Lite 下降 19.7%,GPT-5-mini 下降 16.4%,LLaMA 3.3 Instruct (70B) 下降 18.0%。为什么?因为交易信号问题需要从价格序列中计算技术指标——动量需要算收益率,RSI 需要算相对强弱,波动率需要算标准差。RAG 检索到的是文本化的价格表格,但 LLM 拿到这些表格后,仍然需要做数值计算,而检索反而引入了更多需要处理的噪声信息。
这个发现指向一个深层问题:LLM 的数值推理能力是瓶颈,不是检索能力。给模型更多文本不会帮它算数学题。
混合问题:推理型模型的天下
FT 类问题要求同时整合基本面和交易信号——比如"英伟达 7 月的回调是否是买入机会"需要同时看资产回报率和价格动量。
在这类问题上,推理型 LLM 占据绝对优势。DeepSeek-R1 在 FT 类问题上 RAG 设置达到 46.4%,比无 RAG 提升 39.8%。R1-Distill-Qwen (32B) 提升了 55.1%,R1-Distill-Qwen (14B) 提升了 49.5%。
相比之下,指令调优模型(没有显式推理步骤)在 FT 类问题上提升很小甚至下降。LLaMA 3.3 Instruct (70B) 在 FT 上 RAG 反而下降了 3.7%。
作者的解释是:推理型模型在推理时分配更多计算来调和冲突信号——基本面可能说"公司健康",交易信号可能说"股价超买",调和这种冲突需要多步推理。这正是 FT 类问题最需要的能力。
LLaMA 家族的系统性退化
一个令人意外的发现:LLaMA 模型家族在 RAG 下系统性退化,无论参数量大小。
LLaMA 3.3 Instruct (70B) 总体下降 9.5%(p<0.01),三个类别全线下滑:F 下降 7.9%,T 下降 18.0%,FT 下降 3.7%。R1-Distill-LLaMA (70B) 下降 7.7%。LLaMA 3.1 Instruct (8B) 下降 1.7%。
而 Qwen 家族和其 DeepSeek 蒸馏版本则显著提升。Qwen 2.5 Instruct (32B) 提升 8.9%,R1-Distill-Qwen (32B) 提升 32%。
这个分化暗示了不同模型家族在预训练阶段对"如何利用检索到的上下文"有不同的归纳偏置。Qwen 系列可能更善于在上下文中整合信息,而 LLaMA 系列可能更容易被上下文干扰——检索到的信息反而覆盖了模型自身的参数化知识。
黄金指标:精度暴跌 55.6%
除了准确率,FinTradeBench 还评估了"黄金指标"——模型响应中是否包含了正确答案所需的关键金融指标。这个指标揭示了一个更深层的问题:
- 黄金指标精度:无 RAG 0.44 → RAG 0.20,下降 55.6%
- 黄金指标召回:无 RAG 0.22 → RAG 0.10,下降 55.8%
- 黄金指标 F1:无 RAG 0.27 → RAG 0.12,下降 56.5%
这意味着 RAG 不仅没有帮模型找到正确的指标,反而让模型引用了更多错误的指标。检索到的上下文为模型提供了"看起来相关但实际上不精确"的信息,模型被这些信息误导了。
为什么这个工作重要
FinTradeBench 的价值不在于它又造了一个基准测试,而在于它揭示了一个被系统性忽视的评估维度。
过去几年,金融 LLM 的评估几乎全部聚焦在文本理解上——读财报、回答关于利润率的问题、做表格推理。但真实的金融分析从来不只是文本理解——它还需要看 K 线、算动量、判断趋势。FinTradeBench 把这个缺失的维度补上了。
而它揭示的结论对金融 LLM 的实际应用有直接指导意义:
1. 不要对交易信号问题用 RAG——检索帮不了数值计算,反而引入噪声。
2. 推理型模型在金融分析上有结构性优势——调和冲突信号需要多步推理。
3. 模型家族的选择比参数量更重要——Qwen 系列在 RAG 下提升,LLaMA 系列下降,这不是参数量能解释的。
这些发现指向一个更深的洞察:金融智能不是"信息检索 + 文本生成",而是"多模态信号整合 + 数值推理"。当前 LLM 在前者上已经很强,但在后者上还很弱。FinTradeBench 量化了这个差距——交易信号类问题最高准确率只有 27.8%(GPT-5-mini 无 RAG),而基本面类问题最高 42.3%(GPT-5-mini RAG)。这个差距,就是下一个金融 AI 研究方向所在。
论文: arXiv:2603.19225(论坛帖中的 2503.16889 为错误 ID,已通过搜索校正)
作者: Yogesh Agrawal, Aniruddha Dutta, Md Mahadi Hasan, Santu Karmaker, Aritra Dutta
代码: 论文未提供开源代码仓库
核心贡献: 首个整合基本面和交易信号的金融推理基准,揭示 RAG 对数值推理的系统性伤害