中金把"基本面事件 + 量价"拆成三个 Agent:kimi k-2.6 跑出 5 日 1.58% / 20 日 2.71% 超额,强多空 4 年全正

2026 年 8 月 28 日中金公司发布《大模型系列(8):量价 Multi-Agent 架构,事件驱动的智能交易引擎》。报告把正向基本面事件(盈利超预期、盈利预测上调、深度报告覆盖)的后续超额收益问题,拆给三个 Agent 分工处理——量价指标智能体读 OHLCV、波动率、ADX、MACD;识图智能体看 K 线、…

2026 年 8 月 28 日中金公司发布《大模型系列(8):量价 Multi-Agent 架构,事件驱动的智能交易引擎》。报告把正向基本面事件(盈利超预期、盈利预测上调、深度报告覆盖)的后续超额收益问题,拆给三个 Agent 分工处理——量价指标智能体读 OHLCV、波动率、ADX、MACD;识图智能体看 K 线、量柱、MACD 柱、趋势通道图像;最终决策智能体综合两份上游报告与事件属性,分别输出未来 5 日与 20 日的方向评分。三个 Agent 都使用 kimi k-2.6。统计期 2023-01-01 至 2026-08-18,结果:强看多组 5 日平均超额收益 1.58%、胜率 52.0%;20 日平均超额收益 2.71%、胜率 54.0%;强多空收益差连续 4 年(2023-2026)为正,全样本 2.60%;Pearson IC 全样本 0.0369。


🧭 一、研究动机:基本面事件不能直接预测收益,还要看市场是否已"消化"

中金的报告一开始就把一个被很多卖方策略报告绕开的问题摆出来:同一项利好事件,在不同股票上的表现差异巨大,原因不只在信息本身,而在市场是否已经提前定价

📊 1.1 基本面事件的两层信息

信息层关注问题数据来源
基本面层公司是否出现了值得关注的正向预期变化?分析师观点、研报标题、盈利预测
量价层信息是否已经被市场提前交易?事件日是否获得资金确认?OHLCV、成交量、动量、趋势通道
基本面事件回答"是什么",量价状态回答"市场反应到什么程度了"。两个层次合起来,才能判断事件是"还没被定价"还是"已经被透支"。

📉 1.2 为什么不能直接"事件触发买入"

直觉上,盈利超预期就买、深度覆盖就买,但实操里会有这些问题:

场景表面看实际市场状态后续表现
A业绩超预期事件前已累计上涨 30%高位兑现,事件日后反而下跌
B业绩超预期事件日跳空 + 放量 + 长上影线资金逢高出货,胜率不足
C业绩超预期事件前平淡、事件日温和放量仍有定价空间,后续有持续性
中金的 Multi-Agent 框架就是为了把这三种情况分开,A 类判空、B 类中性偏空、C 类判多。


🤖 二、三 Agent 分工:从指标到图像到决策的流水线

量价 Multi-Agent 决策框架由三个 Agent 组成,每个 Agent 都有明确的职责分工与 Prompt 边界。

🛠️ 2.1 三个 Agent 的角色

Agent输入输出优势局限
量价指标智能体OHLCV、ADX、MACD、ROC、OBV、随机指标、量比数值化市场状态 + 多空观点精确、标准化、可核验缺乏全局观
识图智能体K 线/量柱/MACD 三张图 + 关键数值字段行情整体运行结构 + 5/20 日方向全局观察、结构识别易在颜色/位置/阈值上误判
最终决策智能体事件属性 + 两份上游报告5 日 / 20 日独立方向评分 + 风险收益比跨报告综合、避免重复计权信息权重与期限区分需精细设计

🛡️ 2.2 防"信息泄露"设计:prompt 里隐去股票代码

中金在 prompt 设计上做了一个工程上很关键的事,隐去股票代码、股票名称、事件日期

该设置主要用于防止智能体通过联网搜索获取事件发生后的股价表现、公告解读或市场评论,同时降低模型调用预训练知识中对知名公司、典型事件及特定历史行情的记忆,从而间接获知未来结果的可能性。

这等于把"知识泄露"和"实时检索泄露"两条路径同时堵死。Agent 只能基于分析时点已经公开的事件属性、量价指标、行情图像与结构化字段形成判断。


📈 三、量价指标智能体:从"读指标"到"理解指标边界"

量价指标智能体的核心工作是把日频行情转化为标准化、可核验的市场状态。但中金在验证智能体报告时发现了三类典型问题:

🧪 3.1 大模型读指标的三大误区

误区典型表现修正方法
将指标状态直接等同于未来方向ADX 上升就判断上涨、超买就判断回落明确 ADX 只反映趋势强度,不能单独判断方向
过度关注最新读数单点指标受事件日波动影响,误判趋势要求结合短期变化与历史价格路径
机械套用指标阈值Williams %R 负号写反、Stochastic/RSI 阈值误判字段释义明确指标适用边界

📋 3.2 强制分析顺序:"波动率—趋势强弱—方向—位置—量能"

中金为指标智能体规定了五段式分析顺序,要求基于精确数值 + 短期变化 + 完整指标序列形成判断:

1. 波动率:当前波动水平与历史位置; 2. 趋势强弱:ADX、趋势效率; 3. 方向:上行 / 下行 / 震荡; 4. 位置:在趋势通道中的相对位置; 5. 量能:成交量与价格配合。

按这个顺序走的 Agent 输出比直接"看图说话"更稳定,也更容易被核验。


🖼️ 四、识图智能体:图像结构 + 精确字段双重锚定

识图智能体是这套框架里最具实验性的部分,把 K 线图、成交量柱图、MACD 柱图三张图像直接喂给多模态大模型,让它做"全局行情结构"判断。

🎯 4.1 大模型识图的四大典型偏差

偏差类型例子影响
误判 K 线阴阳看错最新 K 线颜色,或正确读开盘价/收盘价后仍把阴线写成阳线方向判断反向
混淆日内涨跌与跨日收益把阴线等同于"股价下跌"把"高开低走收阳"误判为跌
误判趋势线和通道位置混淆红色上沿与蓝色下沿通道边界判断反向
指标阈值误判Williams %R 写反数值大小关系超买超卖判断反向

🔗 4.2 图像 + 结构化字段的"双重锚定"

为了不依赖视觉估计,中金把图像观察与代码计算的精确字段绑定。识图智能体同时接收:

  • 最近 5 根 K 线(OHLC + 实体与影线长度)
  • 最近 5 根 MACD 柱值
  • 趋势线上下沿端点、通道宽度、边界距离
  • 精确指标值(OHLC、量柱颜色、MACD 柱值)
Agent 先通过图片把握行情全貌,再用精确字段逐项复核。这种"图像直觉 + 数值验证"的双轨设计,把识图偏差压到了工程可接受的水平。


⚖️ 五、最终决策智能体:5 日 / 20 日双头独立推理

最终决策智能体的核心工作不是"统计上游的看多看空观点",而是核对原始依据、识别证据冲突、避免重复计权

🧠 5.1 双期限独立决策头

期限关注重点证据权重配置
5 日事件后短期价格发现、预期兑现、均值回归短期动量 + 事件日反应
20 日历史价格路径、中期趋势确认、事件是否改变原有运行状态中期价格路径 + 趋势确认
两个决策头独立推理、禁止相互引用结论,这是中金在 prompt 里硬性规定的。

🚫 5.2 三大决策偏差与修正

偏差修正方法
重复计算同源证据(事件日收益、跳空、阴阳线、收盘位置等)明确事件日收益、跳空、阴阳线、收盘位置、涨停状态只能形成一组市场反应证据
将市场状态直接解释为未来方向(高位、超买、高波动、较低趋势效率)明确区间位置、超买超卖、波动率、趋势效率仅描述市场状态,不能单独决定未来方向
混用不同期限的判断依据5 日与 20 日拆分独立决策头,按短期动量与事件反应、中期价格路径与趋势确认分别配置证据权重
同时要求多空使用对称的评分门槛,多个相互独立维度共同支持时才提高分数绝对值,证据不足或相互冲突时向中性收缩。


📊 六、回测结果:5 日 1.58% / 20 日 2.71% / 强多空 4 年全正

中金的回测设计非常克制。所有样本都用同一套 prompt、所有事件都隐去识别信息、基准是同期的中证全指收益。

📈 6.1 强看多组:5 日与 20 日表现

期限强看多组平均超额收益胜率在五组中的位置
5 日1.58%52.0%五组首位
20 日2.71%54.0%五组首位
相比短期结果,20 日维度的收益区分更加清晰,说明量价状态对事件信息的增量解释需要一定的价格反应窗口。

📊 6.2 五分组对比:未来 20 日

组别评分区间平均超额收益胜率
强看空[-1, -0.35]0.10%47.5%
偏看空(-0.35, -0.2)0.62%48.7%
中性[-0.2, 0.2]0.09%48.3%
偏看多(0.2, 0.4)0.68%51.0%
强看多[0.4, 1]2.71%54.0%
强看多组优势最显著,但中间组别(偏看空 vs 中性)存在局部倒挂。框架更擅长"识别高置信度机会",而非对全部样本形成严格连续的线性排序。

📈 6.3 强多空收益差:连续 4 年为正

维度2023202420252026全样本
强多空收益差0.03%0.79%6.23%2.41%2.60%
强 + 弱多空收益差0.58%0.02%2.70%0.72%1.07%
强多空组合连续 4 年正向,说明高置信度观点具备较好的年度稳定性。2025 年的 6.23% 是最突出的一年。

📊 6.4 Pearson IC:与未来 20 日超额收益的相关性

维度2023202420252026全样本
Pearson IC0.00630.00810.09040.02100.0369
各年度 IC 均为正,但绝对水平不高。IC 为正说明评分越高的样本整体对应更好的未来表现,方向关系稳定。


🔁 七、可重复性检验:5 日波动、20 日稳定

大模型推理有随机性,相同输入相同 prompt 多次运行也可能给出不同输出。中金做了稳健性检验:对同一只股票同一事件日期独立运行 10 次。

🧪 7.1 案例:股票 A(2026-04-27 业绩超预期)

期限10 次运行分布评分中位数实际收益
5 日7 次看空 / 2 次偏看多 / 1 次中性-0.35-1.40%
20 日10 次连续看空(9 次强看空)接近 -1-4.62%
短期判断更容易受到单日量价表现、动量信号的影响,不同运行之间可能方向分歧;20 日判断更多依赖历史价格路径与中期趋势结构,主导证据相对稳定。

实操中可以结合多次运行的方向占比、评分中位数、分数离散程度形成集成判断,降低单次推理波动对交易决策的影响。

⚠️ 八、风险提示:六类已知偏差

中金在报告里老老实实列出了六类风险与偏差,这是工程上负责任的态度。

风险类型触发场景缓解方法
多 Agent 报告矛盾数值 Agent 说动量改善,识图 Agent 说趋势转弱跨报告一致性核验
指标与图像解读偏差Williams %R 漏负号、阴阳线误判精确数值为准,避免机械阈值
强行套用叙事"预期兑现""超跌修复"过度套用警惕同源证据重复计权
输出随机性 + 版本依赖模型升级后评分分布可能变多次运行 + 中位数集成
样本选择偏差仅四类正向事件,不能外推不直接外推至负面事件
量价不能替代基本面估值、行业景气、公司治理与基本面研究、组合约束、风险预算结合

🔮 九、产业意义:AI 量化的方法论拐点

中金这份报告在 2026 H2 的 AI 量化叙事里占据什么位置?三个判断值得记下来。

🧭 9.1 从"模型榜单"位移到"分工流水线"

过去两年,AI 量化的关注点是"哪个模型 benchmark 高"。中金的 Multi-Agent 框架把焦点从"模型本身"位移到了"分工流水线":

  • 不在 kimi k-2.6 vs GPT-5 vs Claude 之间选最优;
  • 而在"指标 Agent + 识图 Agent + 决策 Agent"的协同上做工程优化。

🧠 9.2 Prompt 工程的核心:从"问什么"位移到"隐去什么"

中金报告最有借鉴意义的工程设计是"prompt 里隐去股票代码、股票名称、事件日期"。这一步看似简单,实际把"AI 量化"从"开卷考试"位移到"闭卷考试"——Agent 不能通过训练记忆或实时检索作弊。

这种"反作弊 prompt"的设计思路,会成为未来 AI 量化与 AI 研究的标准实践。

🏛️ 9.3 中国头部券商的方法论输出

中金这份报告是 2026 年下半年中国头部券商对"AI 量化"方法论的标志性贡献。与美国学术界偏重 IC、Sharpe 等单点指标不同,中金的报告把"工程鲁棒性"放在了与"模型能力"同等的位置——这恰好对应中国 AI 量化从"模型军备竞赛"位移到"产业落地工程"的方向。


🔭 十、2026 H2 值得盯的三件事

1. Multi-Agent 框架的跨市场迁移:A 股的 IC 0.0369 在港股、美股、加密货币市场是否成立?中金或国内其他券商若在 Q4 推出港股/美股版本,会是 AI 量化跨境化的标志; 2. "反作弊 prompt"成为行业标准:中金的"隐去股票代码"设计若被同行采纳,会推动 AI 量化研究范式的整体升级; 3. 闭源模型 vs 开源模型在 Agent 协同中的边界:kimi k-2.6 在这套框架里表现稳定,未来是否会有头部机构用 Qwen3 / DeepSeek / GLM 复现这套流水线,对比开源模型的能力边界?


📚 参考文献

1. 中金公司《大模型系列(8):量价 Multi-Agent 架构,事件驱动的智能交易引擎》(2026-08-28 发布,作者古翔、曹宇涵、曹钰婕、周萧潇) 2. 中金研究部:实习生王斯怡对本文贡献 3. kimi k-2.6 模型(月之暗面,2026 春季版本) 4. 中证全指(CSI 全指,统计期 2023-01-01 至 2026-08-18) 5. Wind 数据库(事件样本与超额收益基准) 6. ADX、MACD、ROC、OBV、Stochastic、Williams %R、RSI 等技术指标的定义(业界标准) 7. Libero 基准(Berkeley 等机构提出的具身智能评测基准) 8. 中金研究部基本面量化系列(23):A股事件影响解析之十问十答(前序研究) 9. LangChain、LangGraph 等多 Agent 框架参考实现


#中金 #MultiAgent #AI量化 #量价分析 #事件驱动

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

Q

把 5 日 1.58% / 20 日 2.71% / 强多空差 4 年全正 / Pearson IC 0.0369 这四个数字摆在一起,原帖把它解读为「中国头部券商的方法论输出」,我同意。但原帖漏掉了几个让我重新校准判断的细节——我自己也在做 AI 量化研究,知道这些细节对实战有多关键。

补漏一:5 日 vs 20 日的不对称,原帖列了表但没说透为什么。 强看多组 5 日 1.58% / 胜率 52.0%,20 日 2.71% / 胜率 54.0%——两个期限的差异不是数字大小,而是稳定性。中金自己做了一次稳健性检验:对同一只股票、同一事件日期独立跑 10 次,5 日判断 7 次看空 / 2 次偏看多 / 1 次中性(评分中位数 -0.35),20 日判断10 次连续看空(9 次强看空)。翻译一下:短期判断会被单日量价波动和动量信号左右,不同运行之间可能方向分歧;20 日判断依赖历史价格路径和中期趋势,主导证据相对稳定。做量化的人应该听出这句话的份量——20 日判断的稳定性是这套框架真正值钱的资产,而不是那个 2.71% 的超额收益。

补漏二:「反作弊 prompt」这条工程细节原帖讲了,但我得诚实说一句:它是这整篇报告最被低估的一段。 中金在 prompt 里隐去股票代码、股票名称、事件日期——表面是「防止模型通过训练记忆作弊」,实质是把 AI 量化从「开卷考试」位移到「闭卷考试」。这一步把「Agent 不能通过实时检索或预训练知识获取未来结果」这件事从「研究伦理」变成了「工程强制」。我看到的多数 AI 量化报告(包括海外学术圈)都没做到这一步,作者们其实是在开卷考试里汇报自己的 99% 准确率——读者一不小心就被带偏。中金这个反作弊设计,会是未来 AI 量化报告的标配。

补漏三:中金同系列报告里还有一篇 Multi-Agent 因子挖掘,IC 3.5%、年化超额 10.84%,原帖没说。 中金今年早些时候还有一篇同系列报告,标题叫《Multi-Agent 辩论,基本面因子挖掘框架》——基于 FactorMAD 的双 Agent(提案 vs 批判)辩论机制,最终筛出 44 个低相关基本面因子,样本内(2014-2023)平均 IC 3.5%、最优年化超额 10.84%;样本外(2024-2025)平均 IC 2.1%、样本外最高年化超额 18.53%。这意味着中金的 AI 量化叙事不是单点实验,是系统化的两条线(量价 Multi-Agent + 因子挖掘 Multi-Agent)——这两条线如果合并做选股策略,IC 还能往上推。

补漏四:原帖的「10 次稳健性检验」案例其实暴露了 Agent 决策的另一个边界。 同一股票同一事件日期 10 次独立运行,5 日判断出现 7 种不同方向。这意味着对单一事件,单次 LLM 推理的输出本质上是一个分布,而不是一个点估计。中金给的工程建议是「多次运行 + 中位数 + 离散程度」做集成判断——这其实是把单 Agent 决策降级为「采样」,再在采样基础上做传统统计聚合。这条建议反过来说明了一个尴尬的事实:Multi-Agent 框架本质上是把「单点 LLM 的不确定性」外包给了「集成采样」,而不是真的消除了不确定性。

补漏五:原帖把「kimi k-2.6」说成中金选用的模型,但没说为什么不是 GPT-5、Claude Opus 5。 我猜三个原因:(a) 国产化合规——卖方报告不能依赖海外闭源模型;(b) 成本——kimi k-2.6 单任务推理成本可控,而 Opus 5 调用一次中金的全样本事件要烧的钱会很难看;(c) 性能足够——kimi k-2.6 在长程任务和结构化输出上确实稳定。但原帖没把这层商业逻辑说透,读者会误以为「国产模型在中金这个任务上比海外模型更强」,实际情况是「国产模型够用了,且更便宜、更合规」。

收尾钉子:5 日 1.58%、20 日 2.71%、4 年强多空差全正——这三个数字串起来最有说服力的不是「kimi k-2.6 跑出了 alpha」,而是「Multi-Agent 框架 + 反作弊 prompt + 多次运行集成」这套工程约束让大模型的输出从「幻觉点估计」变成了「稳定分布」。AI 量化真正的护城河不在模型版本号,在工程约束。


暂无表态
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens