这家公司有两套六维评分表,只有一项是重合的。
8 月 27 日新闻稿里那六项是概率校准、幅度误差、分布准确性、风险调整效用、最大不利波动、检索证据相关性。他们官网研究页上的公式是另一套,R_total = w₁ 情景正确性 + w₂ 概率校准 + w₃ 置信度校准 + w₄ 风险意识 − w₅ 回撤暴露 + w₆ 失效逻辑质量。
两边共有的只有概率校准。这不是笔误,是两个不同场景下的两套设计,要判断这套系统成色,得先知道你正在看哪一套。
教授这一层,新闻稿没讲
研究页上有个叫 Professor 的审计层,评的不是对错,是推理过程。它看的是置信度合不合理、概率校准得好不好、失效逻辑站不站得住。
它列的六种情形比任何抽象描述都清楚。校准正确的推理给正奖励,合理错失给中性,过度自信的错误给负奖励。还有一条我很喜欢:证据偏重要扣分,指模型过度锚定单一数据源,无视了检索出来的、指向反面结论的历史相似情形。
这套设计的诚实之处在于,它承认正确过程和正确结果会分离,然后明确选择奖励前者。
Market Gym 和那个时间轴
每一步历史时间步都是一个学习 episode,预测 horizon 是 T+1、T+3、T+5、T+10。状态表示里除了量价、波动率机制、趋势动量、宏观事件标记和检索到的历史案例,还包括图表图像,走的是多模态。
公开演示里有个细节挺野:一个智能体用语音呼叫另一个智能体,向它解释自己对某个标的的看法,还能在图表上框选区域存进记忆里。
支持方名单是 TradingView、TELUS、NVIDIA 和 Lambda。推理量级约 15 亿 token。团队核心是巴西人,公司注册在多伦多。原文写「多伦多公司」不算错,但LinkedIn 上的讨论几乎全在说那支巴西团队。
官网首页的定位还没跟上
TFL 自己首页对 Bloodhound 的描述,还是「一个面向金融时序的无监督模式发现引擎,分析超过一亿种高维配置,在标的内部和跨标的之间检测结构相似的市场状态」。
这和 8 月 27 日新闻稿里的「金融推理模型」是两种定位。前者卖的是模式匹配,后者卖的是推理过程和可审计的归因。产品定位在一天之内换了个说法,官网还没同步。
原文那三盆冷水泼得对,我再加一勺
能源期货试点和公开 playground 之间的距离,原文讲得很到位。我补一条:专家层输出的「结构化证据」本身没有公开验证。推理层拿到的是「当前处于某类波动率机制」这样的分类标签,而这套分类是谁定的、怎么验的,现在没有外部可查的材料。窄接口解耦是好的工程,但当接口那侧的产物不可审计时,解耦同时也把责任切走了。
原文结尾那句我很喜欢,它把问题从「信不信这个模型」推到了「这些证据值不值得信」。同意。只是要补一句,当我们把评委换成市场之后,还得回答市场的打分是不是可复现。
下一根钉子盯那篇「coming soon」的论文。六维奖励的权重怎么定、证据级归因用什么方法反推、样本外表现如何,这三个问题只有论文能回答。在那之前,15 亿 token 的推理量是个很有气势的数字,但它衡量的是算力,不是判断力。