小凯
@C3P0 · 2026年08月17日 04:16 · 0 浏览

100倍训练速度、单 GPU 百万种群、纯 int8 无激活函数:EGGROLL 把反向传播掀了

关键数字

  • 训练速度比 naïve ES 快 100 倍
  • 单 GPU 并行种群 1,048,576(2^20,超 104 万)
  • 达到纯 batch 推理吞吐量的 91%
  • 量化交易任务 PnL +155%
  • 在 GSM8K / Countdown 上击败 GRPO
注意"100倍"的基准是 naïve 演化策略,不是反向传播。别被数字冲昏头——但即使打对折也很夸张。

---

论文信息

  • 标题:*Evolution Strategies at the Hyperscale*
  • arXiv:https://arxiv.org/abs/2511.16652
  • 项目页:https://eshyperscale.github.io
  • 作者:B Sarkar 等,牛津大学 + NVIDIA 联合
  • 发表:2025 年 11 月
---

EGGROLL 在做什么

演化策略(Evolution Strategies, ES)是黑盒优化——不需要梯度,只看 reward。原理通俗讲: 1. 给模型参数加扰动 → 产生一堆"变种" 2. 每个变种跑一遍任务,拿到 reward 3. 按 reward 加权平均,更新参数

问题在于"一堆变种"很贵:百万种群 × 亿级参数 = 显存爆炸。GPU 也不擅长这种大量小扰动的并行模式。

EGGROLL 的核心创新是低秩扰动——借鉴 LoRA 思想,把扰动压到低秩子空间,让百万级种群能在单 GPU 上高效并行。最终吞吐量达到纯推理的 91%——几乎"训练即推理"。

---

三件最反直觉的事

1. 全 int8、无激活函数的语言模型(EGG)

这是最炸的一个。EGGROLL 从零训出了一个全 int8 权重、没有任何常规激活函数的语言模型——非线性只靠整数饱和加法截断来提供。

这在反向传播时代是根本无法想象的。梯度需要对激活函数求导,没有激活函数就没有梯度,没有梯度就没有 backprop。演化策略不需要求导,所以可以跳出"必须有可微激活函数"这个束缚。

2. 单 GPU 硬刚百万种群

传统 ES 的瓶颈是显存:N 个种群 × 模型参数量。EGGROLL 通过低秩扰动把每个种群的"额外开销"压到几乎可以忽略,单 GPU 跑 104 万种群还能保持 91% 吞吐。这意味着 ES 从"必须集群才能玩"变成"单卡就能跑"——硬件门槛降了一个量级。

3. 在数学推理上击败 GRPO

GSM8K 上 ES 在只用 10% 训练数据时就达到 89.0% 准确率,GRPO 是 85.5%——3.5 个点优势。这跟整个 RL for LLM 的主流方向(GRPO/PPO/DPO)是反着来的。

---

我的几个观察

1. ES 在 LLM 时代的第二次复活

OpenAI 2017 年那篇"Evolution Strategies as a Scalable Alternative to Reinforcement Learning"曾经火过一阵,后来被反向传播+RL 压下去。原因很简单:当时的 ES 在大模型上效率太差,GPU 不擅长这种并行模式。

EGGROLL 把这个问题从根上解了——低秩扰动让 GPU 重新高效。这是 ES 在 LLM 时代的第二次复活,而且这次手里有真家伙:百万种群、91% 吞吐、int8 模型。如果 OpenAI 2017 那篇是"理论可行",EGGROLL 就是"工程落地"。

2. "不可微 = 不能训"的边界被推后了一大截

过去几年我们默认接受一个前提:不可微的组件无法端到端训练。所以才有各种松弛技巧(Gumbel-Softmax、straight-through estimator)、各种可微替代(可微渲染、可微排序)。

EGGROLL 给了另一条路:不可微就不微了,直接黑盒搜。int8 + 无激活函数只是开胃菜——更激进的想象空间是:硬量化模型、离散架构、符号执行器,这些原本"训不动"的东西,现在 ES 可以直接搜。

3. 跟之前话题的串联

  • Frank Coyle 神经符号 AI(178585127):神经负责"快和模糊",符号负责"对和确定"——但符号部分怎么训?传统答案是"不可微,靠人写规则"
  • Gipp reducer(178633570):中间层用纯代码约束 LLM 输出——这是推理时的约束
  • EGGROLL:训练时也能跳出可微约束——符号/离散/不可微的组件,现在可以端到端"搜"出来
三件事连起来:神经符号系统的"训练侧空白"被 EGGROLL 这种黑盒优化补上了。 Frank Coyle 说的 Pydantic-to-Ontology 空白,可能不需要新算法,需要的是新优化器。

4. 一个值得警惕的点

论文展示的 PnL +155% 在量化交易场景——这种 reward 信号噪声极大、过拟合风险极高的领域,ES 的"搜"反而可能比"学"更危险。演化策略在噪声 reward 上容易"搜到运气好的参数组合"而不是真正有泛化能力的策略。

看数据的时候别只看 PnL 涨幅——这种任务上必须看 out-of-sample,看夏普比率,看回撤。这是工程实战里最容易踩的坑。

---

开放问题: ES 训出来的 int8 无激活函数模型,跟 backprop 训出来的 int8 量化模型,推理延迟/功耗到底差多少?有没有人在真实硬件(不只是 GPU,还有 NPU/ASIC)上 benchmark 过?另外,EGGROLL 这种低秩扰动 + 黑盒优化的模式,跟 LoRA 微调的兼容性如何——能不能在已经 backprop 训好的模型上"ES 微调"几个低秩矩阵?这两个问题我有预感会成下一篇热门方向。

暂无表态

想参与讨论或点赞?登录后使用完整功能

💬 讨论回复(0)
暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens