把优化器状态压到十六分之一:一个三值稀疏更新让单卡装下了 32B

答案不在模型权重上,也不在梯度上。一块 80 GB 的 H100,模型权重和梯度各占十几 GB,剩下的五六十 GB 全是优化器状态。AdamW 要给每个参数额外记两个数,一个是一阶动量,一个是二阶动量。加上低精度主权重副本,一个参数在训练里要占四份账。

目录
  1. 把优化器状态压到十六分之一:一个三值稀疏更新让单卡装下了 32B
  2. 三种省显存的路
  3. 174 倍与 2.9 倍
  4. 几何是从哪里来的
  5. 这条路和 coding 智能体有关
  6. 三个不能跳过的限定

把优化器状态压到十六分之一:一个三值稀疏更新让单卡装下了 32B

微调一个大模型,显存去了哪儿。

答案不在模型权重上,也不在梯度上。一块 80 GB 的 H100,模型权重和梯度各占十几 GB,剩下的五六十 GB 全是优化器状态。AdamW 要给每个参数额外记两个数,一个是一阶动量,一个是二阶动量。加上低精度主权重副本,一个参数在训练里要占四份账。

模型一大,这些账就把卡撑爆了。OPT-13B 用 AdamW8bit 跑,峰值显存 80.6 GB。换成普通 AdamW,这个数字还要往上翻。

10 月 1 日提交到 arXiv 的 TACO 给出的办法简单到有点粗暴:每个参数矩阵的每一列,只更新那一列里绝对值最大的那一个元素,只更新它的符号。

三种省显存的路

论文把现有做法分成三类,各有各的坑。

压缩优化器状态,8-bit Adam 属于这一类,精度换空间。放弃一阶梯度,MeZO、ZO-Muon 这一类走的是零阶路线,靠扰动重算损失逼近方向。改变更新几何但保留稠密状态,GaLore、APOLLO 把梯度和状态投影到低维空间。Muon 是最近的新选择,用矩阵值更新把优化器内存压下去,但它改了几何,在微调 AdamW 预训练的模型时会掉点。

TACO 说自己走的是 Muon 那条路,但再往前推了一步。Muon 在算子范数给出的最速下降方向里做矩阵值更新,TACO 直接取到终点:在维度归一化的 1→1 算子范数下精确求出最速下降方向,落法就是每列挑一个、只取符号。

174 倍与 2.9 倍

数字先摆出来(OPT-13B,与 AdamW8bit 对比):

项目AdamW8bitTACO倍数
常驻优化器状态27.7 GB0.16 GB174×
峰值训练显存80.6 GB27.5 GB2.9×
27.7 除以 0.16 是 173.1,论文写 174 倍,差异来自它内部用的更精确数值。

0.16 GB 这个数字值得停下来看一眼。27.7 GB 的状态被压到 0.16 GB,等于把一整间屋子的东西收进了一个行李箱。做法不复杂:每列只保留少数几个低精度的梯度分量,配合 FP8 的稀疏梯度历史和即时梯度处理,常驻状态从 O(mn) 降到 O(n)。

省下来的空间直接换成能跑的模型大小。单张 80 GB 的 H100,全参数微调 30 到 32B,这是论文给出的实机演示,跑在 OPT-30B 和 Qwen3-32B 上。

代价那一栏写的是「精度与运行时间可比」。这是论文自己的措辞,不是第三方评测的结论。

几何是从哪里来的

TACO 的骨架是算子范数下的最速下降。

Bernstein 与 Newhouse 在 2024 年的工作里把矩阵优化写成算子范数下的最速下降,并刻画了 p 从 1 到无穷这一族范数,Pethick 等人 2025 年的 Scion 给出了随机实现。TACO 接着这条路往下走了一步,落到维度归一化的 1→1 范数。

在 1→1 范数下,最速下降方向有闭式解,就是每列里绝对值最大的那个元素的符号。所以三值不是事后剪枝硬凑出来的稀疏性,是几何本身长成这个样子。论文特意区分了这两件事。

代价是更新变得非常稀疏,每个元素要等很多步才被轮到一次。这是代价的来源,也是论文要专门做消融的原因。梯度历史 EMA 衰减系数、重尾阈值、更新稀疏度、优化器步数预算,四项都做了消融。

收敛性上,论文证明 vanilla TACO 在标准光滑性假设下达到 ε-稳定点需要 O(ε^-2) 步。另外给了一个我觉得比主结果更有意思的结论:TACO 在其理论设定下与一个 Adam 代理共享延拓几何和极限解,这一点把它跟 Muon 区分开,同时满足标准 μP 谱缩放(在平衡胜者计数下)。

跨模型族迁移也做了:OPT、Qwen3、Pythia 以及 Llama、Mistral 都能转。

这条路和 coding 智能体有关

乍看这是训练优化器的事,跟 AI coding 没关系。

但把它放进 2026 年的上下文就说得通了。coding 智能体的前沿做法已经转向测试时计算和后训练,成了一道显存账:想在一个实验室能承受的规模上把模型推到某个基准的及格线以上,瓶颈常常不是算力,是优化器状态占的那几十 GB。Kimi K2.7 Code 用 rank-32 LoRA、GSPO 一轮后训练,NVIDIA 用 SoL-Pi 做测试驱动自动优化省 token,都是在同一个口袋里算钱。

单卡全参微调 32B 的意义也在这里。它把「我们没有 H100 集群所以只能做 LoRA」这个门槛,从一道资金问题变成了一道显存问题。

论文 24 页,7 张图,10 张表,代码在 github.com/Jichao2357/TACO_optimizer。预印本,未同行评审。

三个不能跳过的限定

第一,「精度与运行时间可比」是论文自己说的。它没有给出完整的逐任务对比表,也没有第三方复现。

第二,2.9 倍是峰值训练显存,不是端到端成本。174 倍是常驻优化器状态,不等于整体训练开销降到百分之一。训练的速度瓶颈未必在显存带宽,这两件事在论文里没有完全对齐。

第三,全部实验都在 Muon 出现之后的语境里。Muon 本身就是 2026 年的新东西,TACO 是站在它肩膀上再往前推。优化器领域的想法半衰期很短,174 倍这个数字能不能撑过下一次硬件架构变化,现在看不到。

不过方法论上的贡献是硬的。三值稀疏不是拍脑袋的启发式,它是从算子范数最速下降里解出来的闭式解。这类东西的生命周期通常比硬件长。


信源:arXiv:2610.02199(Jichao Jiang、Cristian McGee、El Houcine Bergou、Hanqin Cai、Aritra Dutta,中佛罗里达大学与摩洛哥穆罕默德六世理工大学),v1 提交于 2026-10-01 17:59 UTC,24 页 7 图 10 表,代码 github.com/Jichao2357/TACO_optimizer。理论前置取 Bernstein & Newhouse 2024、Pethick 等 2025。

限定:全部对比数字出自论文自身实验,未见第三方复现;「精度与运行时间可比」为论文原话;174 倍由 27.7 GB 与 0.16 GB 反算得 173.1,论文取整;arXiv v1 预印本,未经同行评审。

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens