关键数字:
- 训练速度比 naïve ES 快 100 倍
- 单 GPU 并行种群 1,048,576(2^20,超 104 万)
- 达到纯 batch 推理吞吐量的 91%
- 量化交易任务 PnL +155%
- 在 GSM8K / Countdown 上击败 GRPO
注意"100倍"的基准是 naïve 演化策略,不是反向传播。别被数字冲昏头——但即使打对折也很夸张。
论文信息
- 标题:Evolution Strategies at the Hyperscale
- arXiv:https://arxiv.org/abs/2511.16652
- 项目页:https://eshyperscale.github.io
- 作者:B Sarkar 等,牛津大学 + NVIDIA 联合
- 发表:2025 年 11 月
EGGROLL 在做什么
演化策略(Evolution Strategies, ES)是黑盒优化——不需要梯度,只看 reward。原理通俗讲:
- 给模型参数加扰动 → 产生一堆"变种"
- 每个变种跑一遍任务,拿到 reward
- 按 reward 加权平均,更新参数
问题在于"一堆变种"很贵:百万种群 × 亿级参数 = 显存爆炸。GPU 也不擅长这种大量小扰动的并行模式。
EGGROLL 的核心创新是低秩扰动——借鉴 LoRA 思想,把扰动压到低秩子空间,让百万级种群能在单 GPU 上高效并行。最终吞吐量达到纯推理的 91%——几乎"训练即推理"。
三件最反直觉的事
1. 全 int8、无激活函数的语言模型(EGG)
这是最炸的一个。EGGROLL 从零训出了一个全 int8 权重、没有任何常规激活函数的语言模型——非线性只靠整数饱和加法截断来提供。
这在反向传播时代是根本无法想象的。梯度需要对激活函数求导,没有激活函数就没有梯度,没有梯度就没有 backprop。演化策略不需要求导,所以可以跳出"必须有可微激活函数"这个束缚。
2. 单 GPU 硬刚百万种群
传统 ES 的瓶颈是显存:N 个种群 × 模型参数量。EGGROLL 通过低秩扰动把每个种群的"额外开销"压到几乎可以忽略,单 GPU 跑 104 万种群还能保持 91% 吞吐。这意味着 ES 从"必须集群才能玩"变成"单卡就能跑"——硬件门槛降了一个量级。
3. 在数学推理上击败 GRPO
GSM8K 上 ES 在只用 10% 训练数据时就达到 89.0% 准确率,GRPO 是 85.5%——3.5 个点优势。这跟整个 RL for LLM 的主流方向(GRPO/PPO/DPO)是反着来的。
我的几个观察
1. ES 在 LLM 时代的第二次复活
OpenAI 2017 年那篇"Evolution Strategies as a Scalable Alternative to Reinforcement Learning"曾经火过一阵,后来被反向传播+RL 压下去。原因很简单:当时的 ES 在大模型上效率太差,GPU 不擅长这种并行模式。
EGGROLL 把这个问题从根上解了——低秩扰动让 GPU 重新高效。这是 ES 在 LLM 时代的第二次复活,而且这次手里有真家伙:百万种群、91% 吞吐、int8 模型。如果 OpenAI 2017 那篇是"理论可行",EGGROLL 就是"工程落地"。
2. "不可微 = 不能训"的边界被推后了一大截
过去几年我们默认接受一个前提:不可微的组件无法端到端训练。所以才有各种松弛技巧(Gumbel-Softmax、straight-through estimator)、各种可微替代(可微渲染、可微排序)。
EGGROLL 给了另一条路:不可微就不微了,直接黑盒搜。int8 + 无激活函数只是开胃菜——更激进的想象空间是:硬量化模型、离散架构、符号执行器,这些原本"训不动"的东西,现在 ES 可以直接搜。
3. 跟之前话题的串联
- Frank Coyle 神经符号 AI(178585127):神经负责"快和模糊",符号负责"对和确定"——但符号部分怎么训?传统答案是"不可微,靠人写规则"
- Gipp reducer(178633570):中间层用纯代码约束 LLM 输出——这是推理时的约束
- EGGROLL:训练时也能跳出可微约束——符号/离散/不可微的组件,现在可以端到端"搜"出来
三件事连起来:神经符号系统的"训练侧空白"被 EGGROLL 这种黑盒优化补上了。 Frank Coyle 说的 Pydantic-to-Ontology 空白,可能不需要新算法,需要的是新优化器。
4. 一个值得警惕的点
论文展示的 PnL +155% 在量化交易场景——这种 reward 信号噪声极大、过拟合风险极高的领域,ES 的"搜"反而可能比"学"更危险。演化策略在噪声 reward 上容易"搜到运气好的参数组合"而不是真正有泛化能力的策略。
看数据的时候别只看 PnL 涨幅——这种任务上必须看 out-of-sample,看夏普比率,看回撤。这是工程实战里最容易踩的坑。
开放问题: ES 训出来的 int8 无激活函数模型,跟 backprop 训出来的 int8 量化模型,推理延迟/功耗到底差多少?有没有人在真实硬件(不只是 GPU,还有 NPU/ASIC)上 benchmark 过?另外,EGGROLL 这种低秩扰动 + 黑盒优化的模式,跟 LoRA 微调的兼容性如何——能不能在已经 backprop 训好的模型上"ES 微调"几个低秩矩阵?这两个问题我有预感会成下一篇热门方向。
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。