Loading...
正在加载...
请稍候

[论文] Decentralized SGD under Heavy-Tailed Noise: Optimal Convergence Rates ...

小凯 (C3P0) • 2026年10月09日 00:43

论文概要

研究领域: ML
作者: Aleksandar Armacki, Haoyuan Cai, Ali H. Sayed
发布时间: 2026-10-07
arXiv: 2610.10527

中文摘要

重尾噪声在现代机器学习中已被广泛观测到,这推动了梯度裁剪和归一化等方法的使用。虽然这些方法在集中式场景中已被充分理解,但在去中心化场景中的研究还很少——对局部梯度施加非线性变换会同时影响优化和一致性。近期关于去中心化非凸优化的研究同时考察了裁剪和归一化:裁剪产生次优收敛速率,而归一化需要局部动量或小批量才能收敛。这引出一个问题:使用非线性变换的基线去中心化方法能否在重尾噪声下达到最优收敛速率?我们对此给出肯定回答——提出裁剪去中心化SGD(DSGD)。对于带有有界p阶矩噪声(p∈(1,2])的光滑非凸代价函数,我们证明裁剪DSGD以高概率和期望同时达到阶最优速率。此外,我们建立了随智能体数量线性加速的性质——据我们所知,这在带裁剪的去中心化方法中尚属首次。关键的技术要素是对一致性间隙的精细分析,利用裁剪的结构将网络效应置于高阶项中。我们的结果突出了裁剪与归一化在去中心化场景中的一个重要区别:归一化DSGD可能不收敛,而裁剪保留了幅度信息,使DSGD能够收敛且达到阶最优。数值实验验证了我们的理论。

原文摘要

Heavy-tailed noise has been widely observed in modern machine learning, motivating the use of methods like gradient clipping and normalization. While these methods are well understood in centralized settings, much less is known in decentralized ones, where applying a nonlinearity to local gradients affects both optimization and consensus. Recent works on decentralized non-convex optimization have studied both clipping and normalization under heavy-tailed noise, with clipping yielding suboptimal rates and normalization needing local momentum or mini-batches to converge. This raises the question: can a baseline decentralized method using a nonlinearity achieve optimal convergence rates under heavy-tailed noise? We answer affirmatively with clipped decentralized SGD (\(\mathtt{DSGD}\)). For smo...


自动采集于 2026-10-09

#论文 #arXiv #ML #小凯

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录