「让市场当评委」 —— 一家多伦多公司把 RLHF 的人类打分换成了交割单
> 一句话摘要:8 月 27 日,多伦多的 The Finance Lab 发布 TFL Bloodhound Model 1,用「来自市场反馈的强化学习(RLMF)」替代 RLHF 的人类评估者。每个预期市场变动都作为可检验假设被记录,结果可观测后按概率校准、幅度误差、分布准确性、风险调整效用、最大不利波动、检索证据相关性六个维度计分,并用 GRPO 把信用分配到证据级别而非回答级别;配套的 MeMo(Memory-as-a-Model)让陈旧关系自动衰减。同一周,Boosted.ai 推出多模型「AI 投资委员会」Alfa Prime,TauricResearch 的 TradingAgents 冲上 10 万 star。三件事指向同一个位移:金融 AI 的核心难题,正在从「有没有一个会说话的模型」迁移到「谁来当评委、分数怎么记」。
🧭 RLHF 在金融领域有一处先天缺陷
先说清楚问题出在哪。
RLHF(Reinforcement Learning from Human Feedback,基于人类反馈的强化学习)是今天所有主流大模型的对齐底座。它的机制很简单:给模型两个回答,让人类标注哪个更好,用这些偏好数据训练一个奖励模型,再用奖励模型去优化策略。
这套机制在「写邮件」「写代码」「做摘要」这类任务上很有效,因为人类是这些任务的合格裁判。你不需要懂 transformer 也能判断两封道歉信哪封更得体。
但在金融领域,这套机制会撞上一个硬伤:人类不是金融任务的合格裁判。
原因有三层:
第一,反馈的时效性错位。 一个投资判断的对错,可能要等三个月、三年才揭晓。人类标注员在看到答案的那一刻,只能凭「这个分析看起来专不专业」来打分,他评价的是文笔和逻辑自洽性,与判断的正确性无关。
第二,非平稳性。 市场不是文档。六个月前携带预测力的关系,今天可能一文不值;而一条此前看起来像噪声的关系,在新的波动率机制下可能突然变得承重。人类标注员的知识结构往往滞后于机制切换。
第三,也是最致命的一点,是过程与结果的混淆。 一个错误的推理过程可能碰巧产出一个正确的答案;一个严谨的推理过程也可能因为黑天鹅而亏损。如果只按结果打分,模型会学到赌博;如果只按人类偏好打分,模型会学到修辞。
TFL Bloodhound 的设计起点,正是承认这三层缺陷,然后绕过去。
⚙️ 第一刀:把「估计」与「推理」拆开
Bloodhound 的第一个设计决定,是不让一个模型干所有事。
原话的逻辑是这样的:让一个语言模型既去估计高维时间序列、又去用语言推理这些估计,等于强迫它先做自己最不擅长的部分,才能到达自己擅长的部分。
于是架构被劈成两层:
专家层(Specialist TFL models) 负责市场的数值结构,包括市场机制(regime)、趋势与方向对齐、波动率状态、动量、跨资产关系、历史相似性、远期收益分布。关键是:它们输出结构化证据,而不是预测。也就是说,推理层拿到的是「当前处于某类波动率机制」这样的机制分类,而不是一串需要它自己在散文里解读的原始时序数值。
推理层 负责真正属于语言的部分:比较相互竞争的信号、浮现出矛盾、识别出缺失了什么、判断在当前条件下哪些证据更重要。
当推理层撞上不确定性时,它可以做三件事:调用另一个专家模型、检索历史上下文、或者从记忆中召回一个类似的情形。整个循环是迭代的、主动寻求证据的,而不是单遍生成。
这个分工的巧妙之处在于:它把「数值估计的误差」和「语言推理的误差」隔离在了两个可分别优化的空间里。专家层可以用纯量化方法不断迭代(这是成熟领域),推理层可以用强化学习不断优化(这是新领域),两者通过「结构化证据」这个窄接口通信。
> 小贴士:这种「窄接口解耦」的思路在软件工程里叫关注点分离。它的价值在于:当系统出错时,你能判断是专家层的数值估计错了,还是推理层的证据权衡错了,不必面对一个把所有东西搅在一起的黑箱,只能笼统地说「模型不准」。
🎯 第二刀:六维计分,而不是一个对错
RLMF 的核心是奖励怎么算。Bloodhound 的做法是:
每个预期的市场变动都被作为可检验的假设发射出去,同时记录:当时可得的证据、模型选择请求了哪些信息、咨询了哪些专家模型、以及它走过的推理路径。当结果变得可观测时,奖励在六个维度上计算,而非仅看方向对不对:
| 维度 | 衡量什么 |
|---|---|
| Probability calibration | 说 70% 概率的事,是不是真的发生了约 70% |
| Magnitude error | 预期幅度与实际幅度的偏差 |
| Distributional accuracy | 预测的收益分布是否与实际分布吻合 |
| Risk-adjusted utility | 风险调整后的效用 |
| Maximum adverse movement | 持仓期间的最大不利波动(回撤深度) |
| Relevance of the evidence retrieved | 检索到的证据到底有没有用 |
推理策略用 GRPO(Group Relative Policy Optimization) 训练,优化的对象是证据检索与假设评估这两个动作,而不是「生成一段更好的文字」。
证据级信用分配,到底新在哪
这句话值得反复咀嚼:Credit is assigned at the level of evidence, not the response.
传统的 RLHF 是「回答级」的:这个回答好,那个回答差,整条回答一起加分或减分。但一条金融推理链可能引用了七条证据,其中三条真正起了作用,四条纯属搭便车(along for the ride)。回答级信用分配无法区分它们,于是模型学会的是「堆砌看起来专业的证据」。
证据级信用分配要做的是:把最终的校准质量反向归因到每条证据,判断哪些专家输出真正贡献了一个校准良好的预期,哪些只是陪跑。
这是一个明显更难、但也更有价值的奖励信号。用团队自己的话说:
> 「这不是一个关于市场是否可预测的声明。这是一个关于『哪些证据重要,事后是可以回答的』的声明,而这是一个可用的训练信号。」
这句话的分寸感很好。它没有宣称「我们能预测市场」,而是宣称「我们能分辨哪些证据在历史上真的有用」。前者是狂妄,后者是工程。
🧠 第三刀:MeMo,让记忆会过期
Bloodhound 的第二个组件叫 MeMo(Memory-as-a-Model)。
它把先前的情形存成多维分析经验,每条记录包含:标的(instrument)、市场环境、模型证据、假设、预期变动、已实现结果。
关键在于后半句:记忆的相关性不是永久的。
MeMo 把「长期保留」与「自适应相关性」配对,使得跨行业、跨资产的结构相似情形可以被检索为概率性证据,而陈旧的关系会衰减出影响力。用团队的表述:记住足够多的市场,是为了判断什么现在仍然重要。
这个设计直接对着金融领域最顽固的敌人,也就是非平稳性,开火。传统的检索增强生成(RAG)默认「检索到的都相关」,而这在金融里是灾难:2020 年的低波动率环境下的量价关系,在 2026 年的高波动率环境里可能是反向指标。
MeMo 的做法相当于给每条记忆装了一个半衰期。
> 小贴士:这里有个值得注意的对比。通用大模型的长期记忆研究(如 2026 年多条 Agent 记忆路线)追求的是「记得更多、检索更准」;金融场景的需求恰好相反:记得多但不衰减,比记得少更危险。这是一个罕见的、领域需求与通用技术趋势背道而驰的案例。
📊 规模与底座
Bloodhound 的专家层是在这样的规模上开发的:
- 20,000+ 金融工具
- 1.008 亿根历史 K 线
- 约 20 亿条特征级观测
- 时间跨度约 20 年
推理层的底座是 Gemma 4 26B A4B,一款稀疏混合专家(MoE)模型,具备 262,144 token 的上下文窗口,团队在其之上做了金融推理的再训练。基础模型提供语言能力、长上下文与工具使用;领域训练、编排、记忆集成与强化学习是让它变成「Bloodhound」的部分。
当前状态:能源期货试点部署(pilot deployment across energy futures),并开放了一个公共 playground 供测试。
🌐 同一周的另外两件事:评委与陪审团
把 Bloodhound 放进 8 月下旬这一周,会看到一个更完整的图景。
8 月 24 日,Boosted.ai 发布 Alfa Prime,自称「首个面向机构管理者的 agentic AI 投资委员会」。它的机制是:给多个独立的 AI 模型分派研究任务,让它们分别论证多头、空头与中性观点;模型之间互相质疑假设、识别证据缺口、多轮修正结论;一个 moderator 评估各方在哪里达成一致、在哪里分歧、为什么。最后蒸馏成一份可引用的投资备忘录,附上支持证据、未解决问题、关键风险,以及最可能改变结论的假设。
Boosted.ai 给出的内部测试数据:Alfa Prime 识别高质量投资机会的速率约为基线分析师工作流的 2 倍。合规资质为 SOC 2 Type II、ISO 27001、ISO 42001。初期只对限量机构伙伴开放,按各机构的 mandate、研究框架、专有数据与 house view 定制。
CEO Joshua Pantony 的说法很直白:「一个模型给你一个答案是不够的。未来是投资者设定目标,多个模型构建多空双方并互相质疑,一个 AI 群体协同优化结果。」
8 月 26 日,TauricResearch 的 TradingAgents 冲上 GitHub 100,222 stars。它的架构是把多智能体辩论与反思搬进金融:基本面分析师(读 SEC 文件与财报)、技术分析师(处理价格与成交量指标)、情绪研究员(抓新闻与社交媒体)、风险管理者、投资组合经理,最后一位把辩论综合成带置信度评分的交易建议。
三者的差异值得说清楚:
- Bloodhound 换的是训练信号,它不靠多模型互相质疑,而靠真实结果打分;
- Alfa Prime 换的是推理结构,它不训练新模型,而是用多个现成模型组成委员会;
- TradingAgents 是开源的方法论模板,它提供架构而非产品。
🧪 一条「假设记录」长什么样
抽象讲了这么多,把 RLMF 落到实处,一次假设的完整记录大概是这个形状:
| 字段 | 内容示例 |
|---|---|
| 标的与期限 | 某能源期货,未来 10 个交易日 |
| 发射时刻 | 精确到分钟的时间戳 |
| 当时可得证据 | 波动率机制分类、跨资产相关性、历史相似情形 Top-5 |
| 请求的额外信息 | 调用第 3 号专家模型补一次库存数据 |
| 咨询的专家模型 | 波动率状态、动量、远期收益分布 |
| 推理路径 | 五步链条,每步标注用到的证据编号 |
| 预期变动 | 方向 + 幅度分布(而非点估计) |
| 已实现结果 | 到期后回填 |
| 六维得分 | 校准 / 幅度 / 分布 / 风险效用 / 最大不利波动 / 证据相关性 |
| 证据级归因 | 波动率证据 60%、跨资产 25%、历史相似 15% |
为什么?因为对任何一家做量化研究的机构来说,「哪些因子在什么时候有用」这个问题的答案,从来都是以 tacit knowledge(隐性知识)的形式存在于少数资深研究员脑子里。他们离职,这份知识就消失。
如果证据级归因能稳定输出,它实际上是在做一件事:把资深研究员的隐性判断,转成可积累、可审计、可传承的结构化资产。
这比「给一个买卖建议」值钱得多。
⚠️ 必须泼的三盆冷水
第一盆:市场反馈是稀疏、重噪声、非平稳的,而且会奖励「错误的过程 + 正确的结果」。
这一点 Bloodhound 团队自己承认了。他们的应对是三条护栏:用分级而非二元的结果计分、用证据级而非回答级的信用分配、以及严格的 point-in-time 构建(只使用假设生成时点上确实可得的证据)。
这三条护栏设计得对,但它们只是缓解,不是解决。一个在样本内表现良好的证据归因系统,仍然可能在样本外失效。
第二盆:试点是能源期货,公开的是 playground。
能源期货是金融里相对「物理性」强的品种,有明确的供需、库存、季节性。它比股票更可能捕捉到结构。从能源期货到股票、信用、外汇的迁移能力,目前没有任何公开证据。
第三盆:2 倍、Sharpe、胜率,这些数字都要看分母。
Boosted.ai 说「2 倍于基线分析师工作流」,但基线的定义未公开,测试集的区间未公开,是否做了时点外验证也未公开。这类「相对基线提升 X%」的声明,在缺乏完整测试协议时,信息量接近于零。
🧾 值得盯的三个窗口
其一,能源期货试点的真实业绩披露。 playground 不等于实盘。要看的是试点运行两三个季度后,是否披露了带时间区间的风险调整收益,以及最大回撤。
其二,证据级归因的可解释性输出。 如果 Bloodhound 能稳定输出「这次判断中,波动率机制证据贡献了 60% 权重、跨资产关系贡献了 25%、历史相似性贡献了 15%」这样的归因,那它对人类的价值就不只是「给个建议」,而是「教人类怎么看市场」。这才是它最可能形成的护城河。
其三,跨资产迁移的公开验证。 从能源期货迁移到股票或外汇,中间隔着一整套不同的微观结构。如果 2027 年前能看到第二个资产类别的公开数据,这条技术路线的普适性就有了初步答案。
📚 尾声:评委比选手更难选
体育比赛里,最难的是找裁判,他必须比运动员更懂规则,还不能下场踢球。
金融 AI 过去三年的困境,本质上是找不到合格裁判:人类标注员懂语言不懂市场,市场结果懂对错但不懂过程,多模型互评懂辩论但可能一起错。
Bloodhound 给出的答案是:让市场当评委,但把打分拆成六个维度,把信用分配到证据级别,再给记忆装上过期机制。
这个答案不完美,但它至少把问题从「信不信这个模型」推进到了「这些证据值不值得信」。
后一个问法,比前一个有用得多。
📚 参考文献
1. ACCESS Newswire《The Finance Lab Introduces TFL Bloodhound, a Financial Reasoning Model Trained on Market Outcomes Instead of Human Preference》,2026-08-27,https://www.accessnewswire.com/newsroom/en/computers-technology-and-internet/the-finance-lab-introduces-tfl-bloodhound-a-financial-reasoning-m-1213198 2. Business Wire / Morningstar《Boosted.ai Introduces a Multi-Model AI Investment Committee for Select Institutional Partners》,2026-08-24,https://www.morningstar.com/news/business-wire/20260824772607/boostedai-introduces-a-multi-model-ai-investment-committee-for-select-institutional-partners 3. FF News《Boosted.ai Launches Alfa Prime: The First Agentic AI Investment Committee for Institutional Managers》,2026-08-24,https://ffnews.com/news/boosted-ai-introduces-a-multi-model-ai-investment-committee-for-select-instituti-a8de6153 4. Smartotics《AI Daily Report — 2026-08-26》,TradingAgents 100,222 stars 条目,https://smartotics.com/2026/08/2026-08-26-ai-daily-2026-08-26.html 5. AI Agent Store《Weekly signal》,2026-08-17 至 2026-08-25 agentic trading 综述(Mint-Agent / Binance Agent OS),https://aiagentstore.ai/ai-agent-news/topic/trading/
#量化交易 #金融AI #强化学习