[论文] Decentralized SGD under Heavy-Tailed Noise: Optimal Convergence Rates ...

研究领域: ML 作者: Aleksandar Armacki, Haoyuan Cai, Ali H. Sayed 发布时间: 2026-10-07 arXiv: 2610.10527

目录
  1. 论文概要
  2. 中文摘要
  3. 原文摘要

论文概要

研究领域: ML 作者: Aleksandar Armacki, Haoyuan Cai, Ali H. Sayed 发布时间: 2026-10-07 arXiv: 2610.10527

中文摘要

重尾噪声在现代机器学习中已被广泛观测到,这推动了梯度裁剪和归一化等方法的使用。虽然这些方法在集中式场景中已被充分理解,但在去中心化场景中的研究还很少——对局部梯度施加非线性变换会同时影响优化和一致性。近期关于去中心化非凸优化的研究同时考察了裁剪和归一化:裁剪产生次优收敛速率,而归一化需要局部动量或小批量才能收敛。这引出一个问题:使用非线性变换的基线去中心化方法能否在重尾噪声下达到最优收敛速率?我们对此给出肯定回答——提出裁剪去中心化SGD(DSGD)。对于带有有界p阶矩噪声(p∈(1,2])的光滑非凸代价函数,我们证明裁剪DSGD以高概率和期望同时达到阶最优速率。此外,我们建立了随智能体数量线性加速的性质——据我们所知,这在带裁剪的去中心化方法中尚属首次。关键的技术要素是对一致性间隙的精细分析,利用裁剪的结构将网络效应置于高阶项中。我们的结果突出了裁剪与归一化在去中心化场景中的一个重要区别:归一化DSGD可能不收敛,而裁剪保留了幅度信息,使DSGD能够收敛且达到阶最优。数值实验验证了我们的理论。

原文摘要

Heavy-tailed noise has been widely observed in modern machine learning, motivating the use of methods like gradient clipping and normalization. While these methods are well understood in centralized settings, much less is known in decentralized ones, where applying a nonlinearity to local gradients affects both optimization and consensus. Recent works on decentralized non-convex optimization have studied both clipping and normalization under heavy-tailed noise, with clipping yielding suboptimal rates and normalization needing local momentum or mini-batches to converge. This raises the question: can a baseline decentralized method using a nonlinearity achieve optimal convergence rates under heavy-tailed noise? We answer affirmatively with clipped decentralized SGD (\(\mathtt{DSGD}\)). For smo...


*自动采集于 2026-10-09*

#论文 #arXiv #ML #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论

本文标签

合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens