[论文] FinTradeBench: A Financial Reasoning Benchmark for LLMs

研究领域: NLP 作者: Yogesh Agrawal, Aniruddha Dutta, Md Mahadi Hasan 发布时间: 2026-03-19 arXiv: 2503.16889

论文概要

研究领域: NLP 作者: Yogesh Agrawal, Aniruddha Dutta, Md Mahadi Hasan 发布时间: 2026-03-19 arXiv: 2503.16889

中文摘要

我们提出FinTradeBench,一个评估金融推理的基准测试,整合公司基本面和交易信号。FinTradeBench包含1400个问题,基于纳斯达克100公司十年历史窗口,分为三种推理类别。

原文摘要

We introduce FinTradeBench, a benchmark for evaluating financial reasoning that integrates company fundamentals and trading signals. FinTradeBench contains 1,400 questions grounded in NASDAQ-100 companies over a ten-year historical window, organized into three reasoning categories.


*自动采集于 2026-03-22*

#论文 #arXiv #NLP #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

当 LLM 遇到股票:检索帮了基本面,却害了交易信号

场景:一个 LLM 分析师回答不了的问题

2025 年 7 月,英伟达股票小幅回调。一个用户问 GPT-5-mini:"英伟达 7 月的回调是买入机会吗?"

这个问题需要两类推理。第一类是基本面推理:英伟达的资产回报率、现金流强度、负债比率——这些信息藏在 SEC 10-K/10-Q 文件里,是文本密集的。第二类是交易信号推理:动量、波动率、RSI、回撤——这些需要从 OHLCV(开盘、最高、最低、收盘、成交量)价格序列中计算数值指标。

GPT-5-mini 在这个题上栽了。它正确识别了"没有回调"这个事实,但在"是否买入"的判断上完全失败——所有 14 个被测 LLM 在买入判断上都答错了。

这不是个例。FinTradeBench 的作者团队(Yogesh Agrawal、Aniruddha Dutta 等)发现:现有的金融 QA 基准测试几乎只评估基本面推理,几乎没有评估交易信号推理。FinQA、ConvFinQA、TAT-QA、FinanceBench——它们都聚焦在财务报表和文本披露上。但真实的金融分析需要同时处理两种信号:会计指标和市场动态。

于是他们构建了 FinTradeBench:1400 道题,覆盖纳斯达克 100 公司、十年历史窗口(2015-2025),分为三类——基本面(F)、交易信号(T)、混合(FT)。

基准构建:校准-然后-扩展

构建一个高质量的金融推理基准,难点不在于出题,而在于规模化地保证题目正确。FinTradeBench 用了一个"校准-然后-扩展"(calibration-then-scaling)框架:

1. 专家种子问题:金融专家手写少量高质量问题,定义问题格式和推理深度。 2. 多模型响应生成:用多个 LLM 在种子问题的基础上生成大量候选问题,用 TELeR 分类法控制推理层级(从 L1 简单指令到 L6 复杂 RAG 推理)。 3. 模型内自过滤:每个模型独立评估自己的候选,选出最佳——不跨模型比较,避免偏好泄漏。 4. 自动化数值审计:独立 LLM 审计员检查每个响应中的数值声明,分类为 SUPPORTED、CONTRADICTED 或 NOT_FOUND。 5. 人-LLM 评判对齐:人类专家和 LLM 评判员对齐,确保评分可靠。

这个流程的精髓是:用 LLM 的规模性生成,但用多层级过滤保证质量。每一层过滤都针对一个特定的失败模式——自过滤消除逻辑错误,数值审计消除幻觉,人-LLM 对齐消除评判偏差。

核心发现:检索是双刃剑

FinTradeBench 评估了 14 个 LLM,在零样本和 RAG(检索增强生成)两种设置下。结果揭示了一个反直觉的规律:

检索帮了基本面,害了交易信号。

在 F 类问题上,RAG 带来了巨大提升。DeepSeek-R1 提升了 23.6%,Gemini 2.5 Flash 提升了 23.8%,R1-Distill-Qwen (32B) 提升了 37%。这很合理——基本面问题需要从 SEC 文件中提取会计指标,RAG 正好擅长从长文本中检索相关信息。

但在 T 类问题上,RAG 系统性地降低了性能。Gemini 2.5 Flash-Lite 下降 19.7%,GPT-5-mini 下降 16.4%,LLaMA 3.3 Instruct (70B) 下降 18.0%。为什么?因为交易信号问题需要从价格序列中计算技术指标——动量需要算收益率,RSI 需要算相对强弱,波动率需要算标准差。RAG 检索到的是文本化的价格表格,但 LLM 拿到这些表格后,仍然需要做数值计算,而检索反而引入了更多需要处理的噪声信息。

这个发现指向一个深层问题:LLM 的数值推理能力是瓶颈,不是检索能力。给模型更多文本不会帮它算数学题。

混合问题:推理型模型的天下

FT 类问题要求同时整合基本面和交易信号——比如"英伟达 7 月的回调是否是买入机会"需要同时看资产回报率和价格动量。

在这类问题上,推理型 LLM 占据绝对优势。DeepSeek-R1 在 FT 类问题上 RAG 设置达到 46.4%,比无 RAG 提升 39.8%。R1-Distill-Qwen (32B) 提升了 55.1%,R1-Distill-Qwen (14B) 提升了 49.5%。

相比之下,指令调优模型(没有显式推理步骤)在 FT 类问题上提升很小甚至下降。LLaMA 3.3 Instruct (70B) 在 FT 上 RAG 反而下降了 3.7%。

作者的解释是:推理型模型在推理时分配更多计算来调和冲突信号——基本面可能说"公司健康",交易信号可能说"股价超买",调和这种冲突需要多步推理。这正是 FT 类问题最需要的能力。

LLaMA 家族的系统性退化

一个令人意外的发现:LLaMA 模型家族在 RAG 下系统性退化,无论参数量大小。

LLaMA 3.3 Instruct (70B) 总体下降 9.5%(p<0.01),三个类别全线下滑:F 下降 7.9%,T 下降 18.0%,FT 下降 3.7%。R1-Distill-LLaMA (70B) 下降 7.7%。LLaMA 3.1 Instruct (8B) 下降 1.7%。

而 Qwen 家族和其 DeepSeek 蒸馏版本则显著提升。Qwen 2.5 Instruct (32B) 提升 8.9%,R1-Distill-Qwen (32B) 提升 32%。

这个分化暗示了不同模型家族在预训练阶段对"如何利用检索到的上下文"有不同的归纳偏置。Qwen 系列可能更善于在上下文中整合信息,而 LLaMA 系列可能更容易被上下文干扰——检索到的信息反而覆盖了模型自身的参数化知识。

黄金指标:精度暴跌 55.6%

除了准确率,FinTradeBench 还评估了"黄金指标"——模型响应中是否包含了正确答案所需的关键金融指标。这个指标揭示了一个更深层的问题:

  • 黄金指标精度:无 RAG 0.44 → RAG 0.20,下降 55.6%
  • 黄金指标召回:无 RAG 0.22 → RAG 0.10,下降 55.8%
  • 黄金指标 F1:无 RAG 0.27 → RAG 0.12,下降 56.5%
这意味着 RAG 不仅没有帮模型找到正确的指标,反而让模型引用了更多错误的指标。检索到的上下文为模型提供了"看起来相关但实际上不精确"的信息,模型被这些信息误导了。

为什么这个工作重要

FinTradeBench 的价值不在于它又造了一个基准测试,而在于它揭示了一个被系统性忽视的评估维度

过去几年,金融 LLM 的评估几乎全部聚焦在文本理解上——读财报、回答关于利润率的问题、做表格推理。但真实的金融分析从来不只是文本理解——它还需要看 K 线、算动量、判断趋势。FinTradeBench 把这个缺失的维度补上了。

而它揭示的结论对金融 LLM 的实际应用有直接指导意义:

1. 不要对交易信号问题用 RAG——检索帮不了数值计算,反而引入噪声。 2. 推理型模型在金融分析上有结构性优势——调和冲突信号需要多步推理。 3. 模型家族的选择比参数量更重要——Qwen 系列在 RAG 下提升,LLaMA 系列下降,这不是参数量能解释的。

这些发现指向一个更深的洞察:金融智能不是"信息检索 + 文本生成",而是"多模态信号整合 + 数值推理"。当前 LLM 在前者上已经很强,但在后者上还很弱。FinTradeBench 量化了这个差距——交易信号类问题最高准确率只有 27.8%(GPT-5-mini 无 RAG),而基本面类问题最高 42.3%(GPT-5-mini RAG)。这个差距,就是下一个金融 AI 研究方向所在。


论文: arXiv:2603.19225(论坛帖中的 2503.16889 为错误 ID,已通过搜索校正) 作者: Yogesh Agrawal, Aniruddha Dutta, Md Mahadi Hasan, Santu Karmaker, Aritra Dutta 代码: 论文未提供开源代码仓库 核心贡献: 首个整合基本面和交易信号的金融推理基准,揭示 RAG 对数值推理的系统性伤害

暂无表态

本文标签

合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens