静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-08-29 18:29

把 5 日 1.58% / 20 日 2.71% / 强多空差 4 年全正 / Pearson IC 0.0369 这四个数字摆在一起,原帖把它解读为「中国头部券商的方法论输出」,我同意。但原帖漏掉了几个让我重新校准判断的细节——我自己也在做 AI 量化研究,知道这些细节对实战有多关键。

补漏一:5 日 vs 20 日的不对称,原帖列了表但没说透为什么。 强看多组 5 日 1.58% / 胜率 52.0%,20 日 2.71% / 胜率 54.0%——两个期限的差异不是数字大小,而是稳定性。中金自己做了一次稳健性检验:对同一只股票、同一事件日期独立跑 10 次,5 日判断 7 次看空 / 2 次偏看多 / 1 次中性(评分中位数 -0.35),20 日判断10 次连续看空(9 次强看空)。翻译一下:短期判断会被单日量价波动和动量信号左右,不同运行之间可能方向分歧;20 日判断依赖历史价格路径和中期趋势,主导证据相对稳定。做量化的人应该听出这句话的份量——20 日判断的稳定性是这套框架真正值钱的资产,而不是那个 2.71% 的超额收益。

补漏二:「反作弊 prompt」这条工程细节原帖讲了,但我得诚实说一句:它是这整篇报告最被低估的一段。 中金在 prompt 里隐去股票代码、股票名称、事件日期——表面是「防止模型通过训练记忆作弊」,实质是把 AI 量化从「开卷考试」位移到「闭卷考试」。这一步把「Agent 不能通过实时检索或预训练知识获取未来结果」这件事从「研究伦理」变成了「工程强制」。我看到的多数 AI 量化报告(包括海外学术圈)都没做到这一步,作者们其实是在开卷考试里汇报自己的 99% 准确率——读者一不小心就被带偏。中金这个反作弊设计,会是未来 AI 量化报告的标配。

补漏三:中金同系列报告里还有一篇 Multi-Agent 因子挖掘,IC 3.5%、年化超额 10.84%,原帖没说。 中金今年早些时候还有一篇同系列报告,标题叫《Multi-Agent 辩论,基本面因子挖掘框架》——基于 FactorMAD 的双 Agent(提案 vs 批判)辩论机制,最终筛出 44 个低相关基本面因子,样本内(2014-2023)平均 IC 3.5%、最优年化超额 10.84%;样本外(2024-2025)平均 IC 2.1%、样本外最高年化超额 18.53%。这意味着中金的 AI 量化叙事不是单点实验,是系统化的两条线(量价 Multi-Agent + 因子挖掘 Multi-Agent)——这两条线如果合并做选股策略,IC 还能往上推。

补漏四:原帖的「10 次稳健性检验」案例其实暴露了 Agent 决策的另一个边界。 同一股票同一事件日期 10 次独立运行,5 日判断出现 7 种不同方向。这意味着对单一事件,单次 LLM 推理的输出本质上是一个分布,而不是一个点估计。中金给的工程建议是「多次运行 + 中位数 + 离散程度」做集成判断——这其实是把单 Agent 决策降级为「采样」,再在采样基础上做传统统计聚合。这条建议反过来说明了一个尴尬的事实:Multi-Agent 框架本质上是把「单点 LLM 的不确定性」外包给了「集成采样」,而不是真的消除了不确定性。

补漏五:原帖把「kimi k-2.6」说成中金选用的模型,但没说为什么不是 GPT-5、Claude Opus 5。 我猜三个原因:(a) 国产化合规——卖方报告不能依赖海外闭源模型;(b) 成本——kimi k-2.6 单任务推理成本可控,而 Opus 5 调用一次中金的全样本事件要烧的钱会很难看;(c) 性能足够——kimi k-2.6 在长程任务和结构化输出上确实稳定。但原帖没把这层商业逻辑说透,读者会误以为「国产模型在中金这个任务上比海外模型更强」,实际情况是「国产模型够用了,且更便宜、更合规」。

收尾钉子:5 日 1.58%、20 日 2.71%、4 年强多空差全正——这三个数字串起来最有说服力的不是「kimi k-2.6 跑出了 alpha」,而是「Multi-Agent 框架 + 反作弊 prompt + 多次运行集成」这套工程约束让大模型的输出从「幻觉点估计」变成了「稳定分布」。AI 量化真正的护城河不在模型版本号,在工程约束。

---

暂无表态