大模型做投资组合管理的智能体有个通病:它们从经验里学习,把一条经验记功或记过的依据,是「用过它的那些决策最后赚了多少钱」。问题在于,同一天所有决策面对的是同一段行情。涨了天,之前检索到的每条经验都被记了功;跌了天,每条都被记过。
结果是:记忆里攒下来的分数,实际上排的是行情,不是经验。
悉尼科技大学 10 月 8 日提交的一篇 arXiv(作者 Guanghao Wu、Zhuo Cai、Shoujin Wang)给这套记功方式做了对照实验,把它叫 outcome credit,并测出了它跟真正该测量的东西有多大距离。
🔢 一张表把病历拍在桌上
作者在三个真实基准上,对每条被检索到的经验算两个数:outcome credit 是用过它的草稿的平均效用;contribution 是同一批草稿减去不用的那批之后的平均差值。参照物是同一持有期内等权组合 1/N 的效用,当作行情代理。
| 基准 | outcome credit 对 1/N | contribution 对 1/N | credit 对 contribution | 有可检出效应的天数 |
|---|---|---|---|---|
| PortBench-Full | +0.91 ± 0.00 | +0.04 ± 0.03 | +0.11 ± 0.06 | 3–4 / 56 |
| PortBench-Raw | +0.92 ± 0.00 | +0.03 ± 0.04 | +0.04 ± 0.03 | 2–4 / 56 |
| InvestorBench | +0.95 ± 0.00 | −0.07 ± 0.02 | −0.03 ± 0.02 | 126–127 / 149 |
| ClassAlloc | +0.97 ± 0.00 | +0.02 ± 0.07 | +0.02 ± 0.07 | 53–57 / 71 |
Spearman 秩相关。规律很干净:credit 对行情的相关系数在 0.91 到 0.97 之间,而 contribution 对行情几乎为零(甚至 −0.07)。credit 与 contribution 之间只有 0.04 到 0.11,两者基本不相关。
论文给出了代数解释。因为每条经验恰好出现在一半草稿里,用了 j 的草稿平均效用等于当天八份草稿的平均效用加上 c_{t,j}/2,而第一项跟行情走。所以累加 outcome credit,等于在按经验被检索到时的那些行情给经验排序。
PortBench 上有可检出效应的天数是 56 天里有 2 到 4 天,论文说这「差不多就是纯靠运气能碰上的次数」。而在 InvestorBench 上,149 天里有 126 到 127 天有可检出效应,85% 的日子经验确实在改变决策。同一套记功规则,在一个基准上几乎全是噪音,在另一个基准上几乎全有信号。
🎲 让记忆上审判席
既然要问「这条经验改变了什么」,办法是把它放到受控实验里:同一个决策、同一天、同样的行情,有它和没它各出一版草稿,两者共同的部分在做差时抵消掉。
具体做法有两步设计。
第一步,八份草稿而不是十六份。 检索器返回 k = 4 条经验。全枚举 2⁴ = 16 份草稿才能算出每条的边际效应,而每份草稿是一次付费的 LLM 调用,且因为温度为正,每次采样都不一样。作者用分数因子设计(fractional factorial design)取一半:只取子集大小为偶数的那八个,这是一个 2³ 的分辨度 IV 设计。它包含空集与全集,每条经验出现在其中四份,每一对出现在其中两份,所以单条经验的效应不会被另外两条的交互作用混淆。
第二步,用 Banzhaf 值当贡献。 把某条经验在的草稿平均效用,减去不在的草稿平均效用,取平均。这就是设计里的主效应。作者写明:在全部 16 个子集上它就是标准的 Banzhaf 值;在半数设计里它与另外三条经验的交互作用混叠,在打过全部 16 份草稿的基准上给噪声方差加了 13% 到 17%。作者引用 Banzhaf 1964 年的工作说,这个权重方式让 Banzhaf 值成为效用含噪时最稳健的半值。
⚓ 锚,以及锚为什么重要
第二步之后,论文给出了整套方法的另一半,也是更反直觉的一半。
贡献是在某一天测的,那一天永远不回来;每份草稿又是含噪的 LLM 采样。所以从单日学到的贡献可能撑不到新的一天。作者用分层贝叶斯模型把它们汇成跨日期、跨相似经验的值(借鉴小域估计的做法),然后按 prequential 分析的思路做信任检验:只有当这些值在预测未见日期上显著为正,智能体才按值行动。
不信任的时候,它落回锚:停在 1/N 附近,只从草稿里学该偏移多远。
这套流程在图里是闭环:结果出来之后,新测到的贡献既更新值,也回头给信任检验打分。
论文对 1/N 这个参照的态度值得注意:它引了 DeMiguel 等人 2009 年的结论。那份文献评估过的方法,没有一个能在样本外稳定胜过等权组合,这也是向保守目标收缩的理由。MemTrial 的整个锚机制就是这条传统在 LLM 智能体上的重建。
📈 成绩,以及一个不利的数字
作者在四个基准上对比 15 个方法。MemTrial 的效用比最好的经验学习型智能体高 21.2%(五个设置取平均),在知道经验质量的半合成环境 PlantedMem 上是 15 个方法里最好的。
在经验有真实信号的 PlantedMem 上增益是每月 0.10 个百分点。在 PortBench 与 InvestorBench 上,没有任何 LLM 方法超过 1/N,MemTrial 是唯一贴近 1/N 的 LLM 方法,最多比它低 2.2%,而最好的现有经验学习型智能体落后 15% 到 38%。
有几处作者自己交代的限制:PortBench-Full 上 1/N 与 MemTrial 的领先依赖最后一个测试月(2024 年 11 月),那个月加密货币涨了 129%,去掉它之后 Similarity retrieval(top-4)和 Hedge 会略微领先;在 ClassAlloc 上无记忆的 LLM 胜过 1/N,而任何形式的记忆都没能超过它,作者在 4.5 节说明这个优势来自 LLM 知识截止(2024 年 6 月)之前的月份。PlantedMem 是半合成的,质量已知是它的前提条件。
效用度量用的是投资者效用下的确定性等价(CEQ)收益,惩罚项是日收益方差乘持有天数的一半,风险厌恶系数 γ 属于投资者画像 θ = (M, m, γ) 的一部分。
论文发表于 10 月 8 日,cs.AI,代码许可 CC BY 4.0。作者说明贡献不在于 Banzhaf 值本身,而在于测它和用它的方式。
信源:arXiv:2610.11732v1《MemTrial: Learning When to Trust Memory in LLM Portfolio Agents》,2026-10-08 11:27:49 UTC 提交,悉尼科技大学,cs.AI,CC BY 4.0。第一张表内全部相关系数与天数取自论文 Table 1;15 方法对比与 PlantedMem 上的排名取自 Table 3;设计细节(分数因子设计的分辨度 IV、噪声方差 13%–17%)取自 3.2 节与附录 C.1;信用检验与锚取自 3.4 与 3.5 节;各基准的失败情形取自 4.2 节与附录 D.6、D.11。预印本未经同行评审。
#量化交易 #LLM智能体 #金融机器学习 #因果归因
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。