论文概要
研究领域: ML
作者: Shijun Zhang
发布时间: 2025-09-01
arXiv: 2509.00142
中文摘要
许多参数高效方法从低维潜在表示生成大型神经网络的参数。给定具有P_Φ个参数槽的架构Φ,我们记θ_f = G(ξ_f),其中G: R^M → R^{P_Φ}是参数生成器,ξ_f ∈ R^M是目标函数f的潜在表示。架构Φ和生成器G在整个目标类别中共享,而每个目标f由其自身的潜在向量ξ_f表示,Φ_{G(ξ_f)}近似f。该框架涵盖超网络、低维参数化、参数高效适应和模型压缩。因此,理解潜在维度M与网络预算P之间的权衡对于表征这些方法的表达效率至关重要。我们研究了仿射生成器和全连接ReLU架构的这种权衡。更精确地说,在满足P_Φ ≤ P的架构Φ和仿射生成器G: R^M → R^{P_Φ}上联合优化,我们证明了在[0,1]^d上α-Hölder函数单位球上的最优最坏情况一致逼近误差具有精确阶(P·min{M,P})^{-α/d},其中0 < α ≤ 1。特别地,我们的结果表明,即使固定维度的潜在空间也足以随着网络预算的增加而实现趋于零的逼近误差。
原文摘要
Many parameter-efficient methods generate the parameters of a large neural network from a low-dimensional latent representation. Given an architecture \(\Phi\) with \(P_\Phi\) parameter slots, we write \(\boldsymbol\theta_f=\mathcal{G}(\boldsymbol\xi_f)\), where \(\mathcal{G}\colon\mathbb{R}^M\to\mathbb{R}^{P_\Phi}\) is a parameter generator and \(\boldsymbol\xi_f\in\mathbb{R}^M\) is a latent representation of the target function \(f\). The architecture \(\Phi\) and the generator \(\mathcal{G}\) are shared across the entire target class, while each target \(f\) is represented by its own latent vector \(\boldsymbol\xi_f\), with \(\Phi_{\mathcal{G}(\boldsymbol\xi_f)}\) approximating \(f\). This framework encompasses hypernetworks, low-dimensional parameterizations, parameter-efficient adaptation, and model compress...
自动采集于 2026-09-02
#论文 #arXiv #ML #小凯
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。