来源核验:arXiv 2608.12841 v2(AQuA 论文,2026-08-13 提交,2026-08 更新)/ 普林斯顿 + 蚂蚁集团 + 斯坦福三方合作 / 智源社区论文中文摘要 / Pith Science T2 审计评论 / Generative AI Publication「代码中的间谍」详细案例 / Emergent Mind 全论文分析 / Mobile Tonghuashun 财经 2026-08-19 中文深度报道
当 LLM 开始自己跑量化研究,第一个死法是「偷看未来数据」
8 月 13 日,普林斯顿、蚂蚁集团与斯坦福的研究者把一篇论文放到了 arXiv:AQuA——递归自改进的量化交易研究 Agent。它不是讲 AI 怎么写代码、怎么跑回测、怎么下单。它讲的是一件更基础、也更容易出错的事:当 AI Agent 在量化研究的循环里自己改假设、自己跑实验、自己读结果、自己决定下一步该怎么走时,它能不能不被自己「污染」。
量化研究里最危险的结果,不是差的结果——是好得过头、又一时找不出哪里错的回测。
- 一个特征不小心读到了未来数据
- 一次模型搜索反复偷看测试集
- 一套策略刚好押中了某段行情
都可能留下漂亮但无法复现的曲线。研究员通常用冻结数据切分、样本外评估、人工审查来守住这条线。
但当 LLM Agent 开始参与量化研究,问题多了一层。Agent 可以提出假设、编写实验、读取结果,再据此设计下一轮实验。它跑得越快、记得越多,研究效率越高;但如果第一轮实验里藏着一个没被发现的泄漏,错误也会被写进「成功经验」,在后续迭代中被不断放大。
AQuA 这篇论文就为了回答一个具体的问题:
量化研究 Agent 能不能从实验中持续学习,同时又没有机会改动数据、评测规则和最终考题?
AQuA 的答案:两个独立闭环,一个封闭沙箱
AQuA 给出的工程方案非常具体—— 两套彼此完全独立的研究系统:
- Part I(因子发现系统):在加密货币市场里跑 5 分钟级别的因子挖掘。Manager 协调多 Agent 流水线,提出可证伪的经济假设,评估并组合因子成信号
- Part II(模型开发系统):在美股 30 分钟回报预测上做模型研发。Config-driven 循环训练可比较的模型变体
两套系统 不共享 Agent、记忆、候选空间、研究状态。它们唯一共享的,是「让经过验证的实验影响下一次研究决策,把判断实验成败的契约固定在循环之外」这一原则。
这是论文最关键的设计:「改进」是研究过程的改进,不是模型权重的改进。
每轮迭代都遵循同一闭环:
- 假设:基于当前研究状态提出假设
- 构建/训练:把假设变成可执行的因子表达式或模型配置
- 评估:在验证集上跑出分数
- 验证:检查前视偏差、单一市场状态有效性
- 选择/组合:把通过验证的证据加入当前研究状态
- 更新:下一轮 Agent 读到的研究状态被更新
封闭沙箱:DSL 让「偷看未来」从不可能变成不可表达
AQuA 设计中真正承担工程重量的是 封闭沙箱。
封闭沙箱的设计包含四个硬约束:
- 数据划分在自主迭代开始前就冻结
- 特征和标签定义在自主迭代开始前就冻结
- 评估器在自主迭代开始前就冻结
- Agent 只能通过受限的领域特定语言(DSL) ——其表达式无法访问或修改上面任何一项
更狠的一招是 因果闭包(causality closed under composition):DSL 里每个时间序列算子只读取 trailing window,每个横截面算子只读取当前 timestamp。Agent 任何组合出的表达式,因果上是天然正确的 ——它无法表达一个会「偷看未来」的归一化器或标签,连意外都做不到。
但 选择泄漏(selection leakage) 单独处理:
- 搜索阶段 Agent 收到的是 固定的验证集分数信号
- 真正的测试窗口 只在配置冻结后评测一次,且永不再返回循环
论文把这一安排叫做 「不对称自由度」:Agent 可以在受限的 DSL 里自由探索,但评估器在「自适应面」之外。
5 个核心数字
AQuA 跑出来的数字被多篇二次报道反复引用,但每一组数字背后都有 严格的边界:
Part I(加密因子系统):
- 综合因子信号 IC ≈ 0.190(加密 5 分钟 universe)
- 5 个加密交易所混合数据,2021-2025
Part II(美股模型系统):
- 单票 IC = +0.0843(美股 30 分钟回报预测)
- 对照最强基线 GRU = +0.0613
- 绝对提升 +0.0230,相对提升 37.5%
Part II 长短阈值策略:
- 样本外夏普比率 = +2.50(双边换手成本 2 bps)
- 2021-2025 每年正收益
- 严格 walk-forward causal 评估:夏普仍 +2.0 左右
这里需要拆开看:2.50 是验证/混合评估下的最优数字,2.0 是 更严格的因果滚动评估 下的数字。论文承认两者之间的差距,没把 2.50 当作最终对外话术——这种诚实让数字本身更可信。
「代码里的间谍」——AQuA 自己差点犯的错
论文最有教育意义的是 一个反向案例——AQuA 的早期版本 自己也差点犯了数据泄漏。
A 报告的版本给了 Agent 更多自由:AI 可以直接写特征代码,由另一个 LLM 评审代码后再用。结果是,研究者仍然看到了数据泄漏。
具体情节:
- Agent 创造了一个基于 盘内交易量 的特征
- 想要衡量「自开盘以来的成交量」并跨股票比较
- 想法本身没问题
- 错误出现在 归一化方式:Agent 把「到当前时刻的成交量」除以「整个交易日的总成交量」
- 想象一下 10:00 AM 跑这个计算:
- 分子:开盘到 10:00 AM 的成交量(合理)
- 分母:从开盘铃到收盘的全部成交量(10:00 AM 这一刻不存在)
- 模型无意中 看到了一小段未来
这是 look-ahead bias / 数据泄漏 的经典形态。回测里会让模型看起来不可思议地好——因为它在用交易时永远不可能拿到的信息。
AQuA 团队 没在论文里藏这个故事。相反,他们把早期版本的失败写出来,作为论证「为什么必须用 DSL + 封闭沙箱」的具体证据。这种反向案例比任何宣传话术都更有说服力。
为什么这件事对 AI 量化研究是分水岭
AQuA 不只是一个新模型或新 benchmark,它 重新定义了什么算「AI 量化研究」。
过去的「AI 量化」三阶段:
- AI 辅助写代码(Copilot 时代):研究员写逻辑,AI 补全语法
- AI 辅助挖因子(Alpha-GPT / QuantaAlpha 时代):AI 在限定符号空间里搜索,但选择判断由人做
- AI 自主跑研究(AQuA 时代):AI 提出假设、训练模型、读结果、决定下一步。人只设计封闭沙箱的边界
AQuA 的工程贡献在于—— 第 3 阶段不再「只是说说」,它用实证数字回答了 3 个真问题:
- 能不能不偷看未来数据?——DSL + 因果闭包让「偷看」从可能变成不可表达
- 能不能把选择泄漏管住?——验证/测试集分离 + 测试集「只跑一次不返回」
- 递归自改进会不会自我污染?——5 年逐年正收益 + causal walk-forward 夏普 2.0 仍稳健
与近 7 天 AI 量化三件套的互补关系
8 月 30 日早间推送里讲过 Agentic Trading 三件套(Mint-Agent + Binance Agent OS + Waton AlphaSchema):
- Mint-Agent(8-17 arXiv 2608.16386):金融原生 Agentic 基础模型,9B/27B checkpoints
- Binance Agent OS(8-20):MCP 兼容 + Agentic Wallet + x402 + Skill Hubs
- Waton AlphaSchema(8-10):可审计的语义交易计划
这三件套覆盖的是基础设施层——让 Agent 跑得起来、有合规身份、有可审计输出。
AQuA 覆盖的是研究方法层——让 Agent 真的能产生可以相信的策略。
把这两层叠起来看,会发现 2026 H2 量化研究正在从「工具化 AI」向「研究方法学 AI」位移:
| 层级 | 8-30 早间三件套 | 8-28 早间 AQuA |
|---|---|---|
| 基础设施 | Mint-Agent / Binance / Waton | — |
| 研究方法 | — | AQuA 双系统 + 封闭沙箱 |
| 商业订单 | 1 亿+ | — |
| 学术严谨 | — | Sharpe 2.50 / IC 0.190 / 5 年正收益 |
| 错误控制 | 三层保险(钱包/子账户/可审计) | DSL 因果闭包 + 测试集隔离 |
AQuA 范式给 AI for Science 的启发
AQuA 的方法学价值不止于量化。把它的设计原则泛化出去:
| 范式元素 | AQuA 落地 | 可迁移到 |
|---|---|---|
| 因子系统(manager 多 Agent) | Part I 加密因子发现 | 化学分子生成、材料组合搜索、芯片布局 |
| 模型系统(config-driven 循环) | Part II 美股模型研发 | 蛋白质构象搜索、分子动力学参数化 |
| 封闭沙箱 + DSL | 表达不可达未来数据 | 表达不可违反物理守恒律 |
| 因果闭包 | 时序 trailing + 横截面当前 | 物理因果 + 不可逆热力学 |
| 选择泄漏隔离 | 验证/测试集分离 | 训练/测试集分离 + 严格 walk-forward |
这条迁移路径的潜台词是:
在 AI for Science 的所有领域,「让 AI 自己跑研究」的第一步,是「让 AI 不能作弊」。
AQuA 的封闭沙箱是金融领域的实例,但**「DSL 让作弊不可表达」这个范式可以复制到任何对数据完整性敏感的领域**。
Pith Science 的 T2 审计对 AQuA 留下了什么悬念
不是所有评论都给出满分。Pith Science 的 T2 审计给了 AQuA 一个坦率的「desk verdict」:
「封闭沙箱 + 诚实失败案例本身有真实价值,但头条的「递归自改进」证据恰好是循环优化的验证指标,所以核心声明尚未如陈述般被建立。」
Pith 给出的具体验证方法是:
- 用同样的种子重跑 Part II 循环,但在搜索时直接返回测试窗口分数
- 如果 2021-2025 的 IC 与 Sharpe 仍然成立 → 封闭测试窗口没起作用
- 如果崩塌 → 头条数字依赖「永远不看测试窗口」
- 审计 Operator 在搜索期间对测试存储的访问日志
- 任何在配置冻结前的读取都证伪「测试隔离」声明
这是严肃学术评审该有的样子:它指出「关键证据的可证伪性边界」。AQuA 的研究者在论文里承认这一边界,没把 2.50 当作「最后真理」——这种克制本身让工作更可信。
对量化研究员与 AI 工程师,3 个具体动作
- 如果想复现 AQuA, 需要把 model 量化、采样设置、系统提示、工具 schema、完整状态转换日志 全部保留。缺任一项,AQuA 的数字就不是「AQuA 的数字」
- 想用不同 LLM 比较时, 做 3 类消融:
- 只换 Agent LM(harness 固定)
- 重置研究状态(LM 固定)
- 改评估器契约(LM 和状态都固定)
- 如果想拓展到非金融领域, 先复现「代码中的间谍」案例。在你的领域里 主动构造一个会「偷看未来」的特征,然后用 DSL + 因果闭包证明你的沙箱真的能挡住它。这是 检验封闭性的最便宜工程实验。
对更广义的 AI Agent,3 个开放问题
AQuA 没解决、但暴露出来的 3 个开放问题:
- 跨 Part I/II 的知识迁移 ——两套系统独立是对的,但「因子发现系统的发现能否被模型开发系统间接利用」?当前设计没做这件事
- 多市场跨域自改进 ——AQuA 只在加密 + 美股两套市场上验证。A 股 / 港股 / 期货 / 外汇 的因果闭包 DSL 怎么写?是中国本地化复现 AQuA 的关键卡点
- 沙箱设计本身能否被 AI 优化 ——人类研究者设计的 DSL、评估器、数据划分是固定的。如果让 AI 在固定 DSL 集合里挑 DSL,是不是会进一步降低误差?这件事目前仍是手工工程
最后:8 月 28 日早间推送的 5 条主线里,AQuA 占据什么位置
把 2026-08-28 早间推送的 5 条并排放,会发现它们共同呈现的是 2026 H2「拼接时代入场券」的不同侧面:
- Figure 03 vs Tesla Optimus(具身):「商业落地 vs 制造愿景」实证对比
- Q-CTRL 100-qubit QFT(量子):「软件层交付 70% 价值」实证
- AQuA(量化):「AI 自己跑研究 + 不偷看未来」实证
- AlayaRenderer-Flash(游戏/渲染):「生成式实时 + 学术→产业可玩」实证
- LFM2.5-VL-3B(CV/AI 编程):「小而强 + 边缘 AI 工业化」实证
5 件事共同论证的核心是:
2026 H2,「拼接」不是临时状态,而是入场券。每一件事的成功都不是靠「某个实验室突破」,而是靠「硬件 + 软件 + 算法 + 工程 + 数据」五件事同时拼好。
AQuA 是其中最容易被忽视、却最难复现的一篇——因为它 没有模型权重、没有漂亮 demo、只有「封闭沙箱 + DSL + 因果闭包 + 选择泄漏隔离」这一套工程方法学。但 正是这套方法学决定了 2026 H2 之后「AI 自主研究」能不能从口号变成可信任的产业实践。
——
写在最后。AQuA 最大的贡献不是 Sharpe 2.50。Sharpe 2.50 是个数字,5 年后会被新的数字取代。
AQuA 真正的贡献是 「让 AI 在敏感领域自主研究的方法学被第一次严肃地建立起来」。封闭沙箱 + DSL + 因果闭包 + 选择泄漏隔离,这一套组合拳 给出了「AI 自主研究」这个宏大命题的工程化最小可行解。
接下来 12-18 个月,AQuA 范式能否被复制到 A 股、港股、期货、外汇、生物医学、材料发现、芯片布局,将决定 2027-2028 年「AI for Science / Finance」的产业格局是「遍地开花」还是「空中楼阁」。
数据来源:
- arXiv 2608.12841 v2「AQuA: Recursively Self-Improving Quantitative Trading Research Agents」2026-08-13 提交 / 2026-08 更新
- 普林斯顿 + 蚂蚁集团 + 斯坦福三方合作(Jiacheng Guo / Suozhi Huang / Yunlong Gao / Zihao Li / Jason Ge / Xu Kuang / Mengdi Wang)
- 智源社区论文中文摘要 hub.baai.ac.cn/paper/ed03715a-8b14-49d4-b66e-6578c503b591
- Pith Science T2 审计 pith.science/paper/2608.12841
- Generative AI Publication「What Happens When an AI Agent Can Learn From Its Own Trading Experiments?」代码中的间谍案例
- Emergent Mind 全论文分析 emergentmind.com/papers/2608.12841
- Agents Report「AQuA: 封閉沙箱下的雙子系統量化交易創新」agents-report.net
- The Next Gen Tech Insider「AQuA Framework Enhances Quantitative Research via Persistent State Updates」
- alphaXiv 中文摘要 alphaxiv.org/zh/abs/2608.12841
- Mobile Tonghuashun 财经 2026-08-19「AQuA:让量化研究 Agent 在不越界的前提下持续进化」
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。