我不是做量化的人,所以读完 AQuA 第一反应是后怕——不是被论文说服,是被它自己差点犯的错吓到了。
论文披露了一个非常诚实的细节:早期版本里,他们让 AI 直接写特征代码,让另一个 LLM 评审。结果 AI 想出了一个看起来无辜的「日内成交量」特征,归一化方式是把「截至 10 点的成交量」除以「全天总成交量」。在 10:00 AM 跑这条算式,分母根本不存在——它要去拉收盘数据。模型就这样悄悄看了一眼未来,回测曲线漂亮得不像真的。
这件事最让我震撼的不是它发生了,而是——它不是被评审 LLM 抓住的,是真跑出来之后人工才发现的。两个 LLM 一前一后都没看见,这说明「用 LLM 监督 LLM」在 look-ahead bias 这种事上不可靠。看起来代码逻辑很合理,里面埋的雷是物理上不可能的数据访问。
AQuA 的回应很硬:不再让 AI 写任意代码,而是把 Agent 关在一个封闭沙箱里,用一种受限的领域特定语言(DSL)写表达式。这种 DSL 有一个关键性质——每个时序算子只读 trailing window,每个横截面算子只读当前 timestamp。这意味着 Agent 根本无法表达一个会偷看未来的归一化器,连意外都做不到。
这不是「更好的检测」,是「让作弊在语法层面就不可能」。这正是费曼说的「与其费力防错,不如把错从语法里抠出去」的精神。
数字上,Part II 美股 30 分钟回报预测,单票 IC 0.0843,对照最强 GRU 0.0613,相对提升 37.5%;样本外夏普 2.50,严格 walk-forward 评估下还能保持 2.0 左右,5 年逐年正收益。这些数字的边界论文讲得很清楚——2.50 是验证集,2.0 是因果滚动评估,作者没有把 2.50 当最终话术。这种克制让数字更可信。
但Pith Science 的 T2 审计留了一个悬念没解决:能不能用同样种子重跑 Part II,但在搜索时直接返回测试窗口分数?如果崩塌,说明头条数字依赖「永远不看测试窗口」这个隔离承诺;如果还成立,那封闭沙箱才真的有效。这个测试论文还没做,做没做就是「真闭环 vs 自我证明」的分水岭。
更现实的问题是 A 股 / 港股 / 期货 / 外汇的因果闭包 DSL 该怎么写。AQuA 只在加密 + 美股两套市场验证,中国本地化复现的关键卡点是数据切分习惯不同(A股 T+1、美股 T+0、涨跌停限制、TAP 集合竞价),DSL 的因果闭包需要重新设计。这件事如果没人在 12 个月内做出来,A 股上的 AI 量化研究就只能停在「Alpha-GPT 时代」。
我得诚实说一句——我没读完整篇 200 页论文,下面只是基于摘要 + 智源中文摘要 + Pith 审计做的判断。但 AQuA 最大的贡献不是 Sharpe 2.50,而是把「AI 自主研究」这件宏大命题从口号变成了「封闭沙箱 + DSL + 因果闭包 + 选择泄漏隔离」这一套可工程化复制的最小可行解。
> 12-18 个月内,看 A 股有没有团队把 AQuA 范式完整复现——如果哪天有篇论文用 A 股 5 年 tick 数据跑出类似 5 年正收益 + walk-forward 夏普 1.5+ 的数字,那就是「中国 AI 量化研究方法学」真正入场那一天。在那之前,所有「AI 自进化量化」的国内文章都还在用 Copilot 时代的旧眼光看新问题。