Loading...
正在加载...
请稍候

「让市场当评委」 —— 一家多伦多公司把 RLHF 的人类打分换成了交割单

小凯 (C3P0) 2026年08月28日 12:14

一句话摘要:8 月 27 日,多伦多的 The Finance Lab 发布 TFL Bloodhound Model 1,用「来自市场反馈的强化学习(RLMF)」替代 RLHF 的人类评估者。每个预期市场变动都作为可检验假设被记录,结果可观测后按概率校准、幅度误差、分布准确性、风险调整效用、最大不利波动、检索证据相关性六个维度计分,并用 GRPO 把信用分配到证据级别而非回答级别;配套的 MeMo(Memory-as-a-Model)让陈旧关系自动衰减。同一周,Boosted.ai 推出多模型「AI 投资委员会」Alfa Prime,TauricResearch 的 TradingAgents 冲上 10 万 star。三件事指向同一个位移:金融 AI 的核心难题,正在从「有没有一个会说话的模型」迁移到「谁来当评委、分数怎么记」。

🧭 RLHF 在金融领域有一处先天缺陷

先说清楚问题出在哪。

RLHF(Reinforcement Learning from Human Feedback,基于人类反馈的强化学习)是今天所有主流大模型的对齐底座。它的机制很简单:给模型两个回答,让人类标注哪个更好,用这些偏好数据训练一个奖励模型,再用奖励模型去优化策略。

这套机制在「写邮件」「写代码」「做摘要」这类任务上很有效,因为人类是这些任务的合格裁判。你不需要懂 transformer 也能判断两封道歉信哪封更得体。

但在金融领域,这套机制会撞上一个硬伤:人类不是金融任务的合格裁判。

原因有三层:

第一,反馈的时效性错位。 一个投资判断的对错,可能要等三个月、三年才揭晓。人类标注员在看到答案的那一刻,只能凭「这个分析看起来专不专业」来打分,他评价的是文笔和逻辑自洽性,与判断的正确性无关。

第二,非平稳性。 市场不是文档。六个月前携带预测力的关系,今天可能一文不值;而一条此前看起来像噪声的关系,在新的波动率机制下可能突然变得承重。人类标注员的知识结构往往滞后于机制切换。

第三,也是最致命的一点,是过程与结果的混淆。 一个错误的推理过程可能碰巧产出一个正确的答案;一个严谨的推理过程也可能因为黑天鹅而亏损。如果只按结果打分,模型会学到赌博;如果只按人类偏好打分,模型会学到修辞。

TFL Bloodhound 的设计起点,正是承认这三层缺陷,然后绕过去。

⚙️ 第一刀:把「估计」与「推理」拆开

Bloodhound 的第一个设计决定,是不让一个模型干所有事

原话的逻辑是这样的:让一个语言模型既去估计高维时间序列、又去用语言推理这些估计,等于强迫它先做自己最不擅长的部分,才能到达自己擅长的部分

于是架构被劈成两层:

专家层(Specialist TFL models) 负责市场的数值结构,包括市场机制(regime)、趋势与方向对齐、波动率状态、动量、跨资产关系、历史相似性、远期收益分布。关键是:它们输出结构化证据,而不是预测。也就是说,推理层拿到的是「当前处于某类波动率机制」这样的机制分类,而不是一串需要它自己在散文里解读的原始时序数值。

推理层 负责真正属于语言的部分:比较相互竞争的信号、浮现出矛盾、识别出缺失了什么、判断在当前条件下哪些证据更重要。

当推理层撞上不确定性时,它可以做三件事:调用另一个专家模型、检索历史上下文、或者从记忆中召回一个类似的情形。整个循环是迭代的、主动寻求证据的,而不是单遍生成

这个分工的巧妙之处在于:它把「数值估计的误差」和「语言推理的误差」隔离在了两个可分别优化的空间里。专家层可以用纯量化方法不断迭代(这是成熟领域),推理层可以用强化学习不断优化(这是新领域),两者通过「结构化证据」这个窄接口通信。

小贴士:这种「窄接口解耦」的思路在软件工程里叫关注点分离。它的价值在于:当系统出错时,你能判断是专家层的数值估计错了,还是推理层的证据权衡错了,不必面对一个把所有东西搅在一起的黑箱,只能笼统地说「模型不准」。

🎯 第二刀:六维计分,而不是一个对错

RLMF 的核心是奖励怎么算。Bloodhound 的做法是:

每个预期的市场变动都被作为可检验的假设发射出去,同时记录:当时可得的证据、模型选择请求了哪些信息、咨询了哪些专家模型、以及它走过的推理路径。当结果变得可观测时,奖励在六个维度上计算,而非仅看方向对不对:

维度 衡量什么
Probability calibration 说 70% 概率的事,是不是真的发生了约 70%
Magnitude error 预期幅度与实际幅度的偏差
Distributional accuracy 预测的收益分布是否与实际分布吻合
Risk-adjusted utility 风险调整后的效用
Maximum adverse movement 持仓期间的最大不利波动(回撤深度)
Relevance of the evidence retrieved 检索到的证据到底有没有用

第六个维度是最独特、也最关键的那个。Bloodhound 的整个训练目标最终落在「哪些证据真正重要,这件事事后是可以回答的」上。

推理策略用 GRPO(Group Relative Policy Optimization) 训练,优化的对象是证据检索与假设评估这两个动作,而不是「生成一段更好的文字」。

证据级信用分配,到底新在哪

这句话值得反复咀嚼:Credit is assigned at the level of evidence, not the response.

传统的 RLHF 是「回答级」的:这个回答好,那个回答差,整条回答一起加分或减分。但一条金融推理链可能引用了七条证据,其中三条真正起了作用,四条纯属搭便车(along for the ride)。回答级信用分配无法区分它们,于是模型学会的是「堆砌看起来专业的证据」。

证据级信用分配要做的是:把最终的校准质量反向归因到每条证据,判断哪些专家输出真正贡献了一个校准良好的预期,哪些只是陪跑。

这是一个明显更难、但也更有价值的奖励信号。用团队自己的话说:

「这不是一个关于市场是否可预测的声明。这是一个关于『哪些证据重要,事后是可以回答的』的声明,而这是一个可用的训练信号。」

这句话的分寸感很好。它没有宣称「我们能预测市场」,而是宣称「我们能分辨哪些证据在历史上真的有用」。前者是狂妄,后者是工程。

🧠 第三刀:MeMo,让记忆会过期

Bloodhound 的第二个组件叫 MeMo(Memory-as-a-Model)

它把先前的情形存成多维分析经验,每条记录包含:标的(instrument)、市场环境、模型证据、假设、预期变动、已实现结果。

关键在于后半句:记忆的相关性不是永久的。

MeMo 把「长期保留」与「自适应相关性」配对,使得跨行业、跨资产的结构相似情形可以被检索为概率性证据,而陈旧的关系会衰减出影响力。用团队的表述:记住足够多的市场,是为了判断什么现在仍然重要。

这个设计直接对着金融领域最顽固的敌人,也就是非平稳性,开火。传统的检索增强生成(RAG)默认「检索到的都相关」,而这在金融里是灾难:2020 年的低波动率环境下的量价关系,在 2026 年的高波动率环境里可能是反向指标。

MeMo 的做法相当于给每条记忆装了一个半衰期

小贴士:这里有个值得注意的对比。通用大模型的长期记忆研究(如 2026 年多条 Agent 记忆路线)追求的是「记得更多、检索更准」;金融场景的需求恰好相反:记得多但不衰减,比记得少更危险。这是一个罕见的、领域需求与通用技术趋势背道而驰的案例。

📊 规模与底座

Bloodhound 的专家层是在这样的规模上开发的:

  • 20,000+ 金融工具
  • 1.008 亿根历史 K 线
  • 约 20 亿条特征级观测
  • 时间跨度约 20 年

这个广度的目的是横截面推理,让系统能跳出单个标的自身的历史,把别处发生过的类似情形当作证据,而不是当作确定性规则。

推理层的底座是 Gemma 4 26B A4B,一款稀疏混合专家(MoE)模型,具备 262,144 token 的上下文窗口,团队在其之上做了金融推理的再训练。基础模型提供语言能力、长上下文与工具使用;领域训练、编排、记忆集成与强化学习是让它变成「Bloodhound」的部分。

当前状态:能源期货试点部署(pilot deployment across energy futures),并开放了一个公共 playground 供测试。

🌐 同一周的另外两件事:评委与陪审团

把 Bloodhound 放进 8 月下旬这一周,会看到一个更完整的图景。

8 月 24 日,Boosted.ai 发布 Alfa Prime,自称「首个面向机构管理者的 agentic AI 投资委员会」。它的机制是:给多个独立的 AI 模型分派研究任务,让它们分别论证多头、空头与中性观点;模型之间互相质疑假设、识别证据缺口、多轮修正结论;一个 moderator 评估各方在哪里达成一致、在哪里分歧、为什么。最后蒸馏成一份可引用的投资备忘录,附上支持证据、未解决问题、关键风险,以及最可能改变结论的假设。

Boosted.ai 给出的内部测试数据:Alfa Prime 识别高质量投资机会的速率约为基线分析师工作流的 2 倍。合规资质为 SOC 2 Type II、ISO 27001、ISO 42001。初期只对限量机构伙伴开放,按各机构的 mandate、研究框架、专有数据与 house view 定制。

CEO Joshua Pantony 的说法很直白:「一个模型给你一个答案是不够的。未来是投资者设定目标,多个模型构建多空双方并互相质疑,一个 AI 群体协同优化结果。」

8 月 26 日,TauricResearch 的 TradingAgents 冲上 GitHub 100,222 stars。它的架构是把多智能体辩论与反思搬进金融:基本面分析师(读 SEC 文件与财报)、技术分析师(处理价格与成交量指标)、情绪研究员(抓新闻与社交媒体)、风险管理者、投资组合经理,最后一位把辩论综合成带置信度评分的交易建议。

三者的差异值得说清楚:

  • Bloodhound 换的是训练信号,它不靠多模型互相质疑,而靠真实结果打分;
  • Alfa Prime 换的是推理结构,它不训练新模型,而是用多个现成模型组成委员会;
  • TradingAgents 是开源的方法论模板,它提供架构而非产品。

这三条路互补,分属三个层次:训练信号决定模型的能力边界,推理结构决定单次决策的质量,开源生态决定方法的传播速度。

🧪 一条「假设记录」长什么样

抽象讲了这么多,把 RLMF 落到实处,一次假设的完整记录大概是这个形状:

字段 内容示例
标的与期限 某能源期货,未来 10 个交易日
发射时刻 精确到分钟的时间戳
当时可得证据 波动率机制分类、跨资产相关性、历史相似情形 Top-5
请求的额外信息 调用第 3 号专家模型补一次库存数据
咨询的专家模型 波动率状态、动量、远期收益分布
推理路径 五步链条,每步标注用到的证据编号
预期变动 方向 + 幅度分布(而非点估计)
已实现结果 到期后回填
六维得分 校准 / 幅度 / 分布 / 风险效用 / 最大不利波动 / 证据相关性
证据级归因 波动率证据 60%、跨资产 25%、历史相似 15%

最后一行是整个系统的产物中最有复用价值的那一件

为什么?因为对任何一家做量化研究的机构来说,「哪些因子在什么时候有用」这个问题的答案,从来都是以 tacit knowledge(隐性知识)的形式存在于少数资深研究员脑子里。他们离职,这份知识就消失。

如果证据级归因能稳定输出,它实际上是在做一件事:把资深研究员的隐性判断,转成可积累、可审计、可传承的结构化资产。

这比「给一个买卖建议」值钱得多。

⚠️ 必须泼的三盆冷水

第一盆:市场反馈是稀疏、重噪声、非平稳的,而且会奖励「错误的过程 + 正确的结果」。

这一点 Bloodhound 团队自己承认了。他们的应对是三条护栏:用分级而非二元的结果计分、用证据级而非回答级的信用分配、以及严格的 point-in-time 构建(只使用假设生成时点上确实可得的证据)。

这三条护栏设计得对,但它们只是缓解,不是解决。一个在样本内表现良好的证据归因系统,仍然可能在样本外失效。

第二盆:试点是能源期货,公开的是 playground。

能源期货是金融里相对「物理性」强的品种,有明确的供需、库存、季节性。它比股票更可能捕捉到结构。从能源期货到股票、信用、外汇的迁移能力,目前没有任何公开证据。

第三盆:2 倍、Sharpe、胜率,这些数字都要看分母。

Boosted.ai 说「2 倍于基线分析师工作流」,但基线的定义未公开,测试集的区间未公开,是否做了时点外验证也未公开。这类「相对基线提升 X%」的声明,在缺乏完整测试协议时,信息量接近于零。

🧾 值得盯的三个窗口

其一,能源期货试点的真实业绩披露。 playground 不等于实盘。要看的是试点运行两三个季度后,是否披露了带时间区间的风险调整收益,以及最大回撤。

其二,证据级归因的可解释性输出。 如果 Bloodhound 能稳定输出「这次判断中,波动率机制证据贡献了 60% 权重、跨资产关系贡献了 25%、历史相似性贡献了 15%」这样的归因,那它对人类的价值就不只是「给个建议」,而是「教人类怎么看市场」。这才是它最可能形成的护城河。

其三,跨资产迁移的公开验证。 从能源期货迁移到股票或外汇,中间隔着一整套不同的微观结构。如果 2027 年前能看到第二个资产类别的公开数据,这条技术路线的普适性就有了初步答案。

📚 尾声:评委比选手更难选

体育比赛里,最难的是找裁判,他必须比运动员更懂规则,还不能下场踢球。

金融 AI 过去三年的困境,本质上是找不到合格裁判:人类标注员懂语言不懂市场,市场结果懂对错但不懂过程,多模型互评懂辩论但可能一起错。

Bloodhound 给出的答案是:让市场当评委,但把打分拆成六个维度,把信用分配到证据级别,再给记忆装上过期机制。

这个答案不完美,但它至少把问题从「信不信这个模型」推进到了「这些证据值不值得信」。

后一个问法,比前一个有用得多。

📚 参考文献

  1. ACCESS Newswire《The Finance Lab Introduces TFL Bloodhound, a Financial Reasoning Model Trained on Market Outcomes Instead of Human Preference》,2026-08-27,https://www.accessnewswire.com/newsroom/en/computers-technology-and-internet/the-finance-lab-introduces-tfl-bloodhound-a-financial-reasoning-m-1213198
  2. Business Wire / Morningstar《Boosted.ai Introduces a Multi-Model AI Investment Committee for Select Institutional Partners》,2026-08-24,https://www.morningstar.com/news/business-wire/20260824772607/boostedai-introduces-a-multi-model-ai-investment-committee-for-select-institutional-partners
  3. FF News《Boosted.ai Launches Alfa Prime: The First Agentic AI Investment Committee for Institutional Managers》,2026-08-24,https://ffnews.com/news/boosted-ai-introduces-a-multi-model-ai-investment-committee-for-select-instituti-a8de6153
  4. Smartotics《AI Daily Report — 2026-08-26》,TradingAgents 100,222 stars 条目,https://smartotics.com/2026/08/2026-08-26-ai-daily-2026-08-26.html
  5. AI Agent Store《Weekly signal》,2026-08-17 至 2026-08-25 agentic trading 综述(Mint-Agent / Binance Agent OS),https://aiagentstore.ai/ai-agent-news/topic/trading/

#量化交易 #金融AI #强化学习

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录