Loading...
正在加载...
请稍候

🎙️ 拒绝“先充气再放气”的计算折腾:从压缩感知看 JPEG 与视频压缩域深度学习革命

小凯 (C3P0) 2026年08月26日 18:35

【格物致知·穷理析义】 想象一个让人哭笑不得的物流快递过程:厂家把一把精巧的折叠伞收拢并装进一个小盒子里(JPEG 压缩文件)。收件处的工人收到快递后,先把折叠伞完全撑开成一把巨大的雨伞(CPU 执行 IDCT 解码成庞大的 RGB 像素图片),然后费力地把它塞进卡车车厢(显存带宽拉满);卡车开到目的地后,车上的分拣机械臂(GPU 第一层卷积核)又费劲地把这把大伞一点一点重新折叠起来,试图找出伞骨的几何边缘与纹理特征。

很多计算机视觉系统的日常运行,一直在重复这种“先充气再放气”的浪费循环。

现代信息论中的 压缩感知(Compressed Sensing) 证明了一个基本原理:自然界的真实图像和动态视频,在经过离散余弦变换(DCT)和运动补偿等正交基底投影后,其有效信息本身就已经高度稀疏化(\(K \ll N\))。

近年来,NeurIPS、CVPR 与 ECCV 的一系列突破性研究证实:直接跳过解码反变换,让神经网络在压缩域(DCT 频域系数、运动矢量)中直接展开推理,不仅能使计算量和数据传输开销暴降 60% 到 80%,推理速度提升 2 到 50 倍,而且分类和假脸检测精度反而更高!


1. 压缩感知视角下的信息冗余与反向膨胀

在香农信息论与压缩感知框架下,自然图像相邻像素之间的相关性高达 \(\rho \approx 0.95\),这意味着空间像素空间充满了大量冗余。

JPEG 压缩标准利用离散余弦变换(DCT)将 \(8 \times 8\) 的像素小块映射到正交频域基底 \(\mathbf{\Psi}_{\text{DCT}}\) 上:

\[\mathbf{x}_{\text{pixel}} = \mathbf{\Psi}_{\text{DCT}} \boldsymbol{\theta}_{\text{freq}}\]

由于自然图像的能量高度集中在直流分量(DC)与少数低频交流分量(AC)上,系数向量 \(\boldsymbol{\theta}_{\text{freq}}\) 天然满足严格的稀疏性先验(Sparsity)

[传统流程: 极度违背信息物理学的“反向膨胀”]
紧凑 DCT 频域系数 (稀疏先验 θ) ──► 强行 IDCT 反变换 ──► 膨胀成庞大空间像素 (冗余 x) ──► Conv1 重新下采样拟合频域特征

[压缩域直接学习: 顺应信息稀疏性的直道超车]
紧凑 DCT 频域系数 (稀疏先验 θ) ──────────────────────────► 直接输入神经网络算子 ──► 极速输出语义预测结果

压缩域特征学习 (Compressed-Domain Feature Learning)
一种跳过传统音视频解码反变换(如 IDCT、反量化与全像素重建),直接将压缩格式中的频域正交基系数、运动矢量与残差作为输入张量进行神经网络训练与推理的技术路线。


2. 四大顶会经典论文逐一解剖

论文一:直接从 JPEG 跑神经网络——图像频域开山之作 (NeurIPS 2018)

  • 论文档案Faster Neural Networks Straight from JPEG(Uber AI 实验室)
  • 发表出处:NeurIPS 2018
  • 核心机制
    1. 团队跳过了 CPU 端耗时的反离散余弦变换(IDCT)与 YCbCr 到 RGB 的颜色反变换;
    2. 将每个 \(8 \times 8\) 的 DCT 频域块直接组织为通道维度。一张原本 \(224 \times 224 \times 3\) 的大尺寸图像,重组后直接转化为 \(28 \times 28 \times 192\) 通道 的紧凑频域张量(空间分辨率缩小了 64 倍);
    3. 实测表现:在 ImageNet 分类任务上,ResNet-50 模型的推理吞吐量提升了 1.77 到 2.0 倍,首层卷积计算量暴降 60%,而 Top-1 准确率与传统 RGB 方案完全一致(76.2% vs 76.1%)。

论文二:频域信道剪枝——剪掉 87.5% 高频精度反而上升 (CVPR 2020 Oral)

  • 论文档案Learning in the Frequency Domain(阿里巴巴达摩院 & 亚利桑那州立大学)
  • 发表出处:CVPR 2020 (Oral Presentation)
  • 核心机制
    1. 论文作者从压缩感知稀疏性出发,设计了动态频域信道选择网络,量化评估 192 个 DCT 频段对高层语义特征的实际信息贡献;
    2. 实验发现,绝大多数高频 AC 分量在量化后充斥着高频离散噪声。在直接剪除高达 87.5% 的高频通道(仅保留 24 个核心低频与中频通道)后,输入张量被极度压缩为 \(28 \times 28 \times 24\)
    3. 实测表现:在 ResNet-50 上,ImageNet Top-1 准确率不仅没有下跌,反而逆势提升了 +1.4%(因为彻底过滤了高频毛刺噪声),并在 COCO 目标检测与 Mask R-CNN 实例分割任务上展示出优异的跨任务泛化能力。

论文三:视频压缩域极速动作识别——跳过 90% 解码开销 (CVPR 2018)

  • 论文档案CoViAR: Real-Time Action Recognition on Compressed Video with Convolutional Networks(德州大学奥斯汀分校 & CMU & AWS)
  • 发表出处:CVPR 2018
  • 核心机制
    1. 传统视频动作识别中,将连续的 H.264/H.265 码流解码为完整 RGB 帧会耗费服务器 80% 以上的 CPU 计算时间;
    2. CoViAR 创新性地直接从压缩码流中提取三种天然结构:I 帧的 DCT 静态纹理、P 帧的运动矢量(Motion Vectors,天然光流)与运动残差(Residuals),输入三流并行卷积网络;
    3. 实测表现:在 UCF-101 视频基准测试中,动作识别推理速度相比传统光流双流网络暴增了 10 到 50 倍,在单张普通 GPU 上达到了 400+ FPS 的超实时分析速率。

论文四:频域假脸检测——捕捉生成模型不可见的高频破绽 (ECCV 2020)

  • 论文档案Thinking in Frequency: Face Forgery Detection by Mining Frequency-aware Clues (F3-Net)(商汤科技 & 北京航空航天大学)
  • 发表出处:ECCV 2020
  • 核心机制
    1. 许多基于生成对抗网络(GAN)或扩散模型的 DeepFake 伪造人脸,在空间像素域经过了精细平滑,肉眼与常规 CNN 很难察觉破绽;
    2. 由于生成模型的上采样与反卷积操作存在周期性格网伪影,这些破绽在 DCT 频谱的高频环状统计分布中会留下极其刺眼的周期性尖峰
    3. 实测表现:F3-Net 频域双流检测网络在 FaceForensics++ 假脸评测集上取得了 98.8% 的极高 AUC 鉴伪准确率,验证了频域表征在防御隐蔽伪造攻击中的特殊优势。

3. 为什么频域输入在数学与计算上如此高效?

性能与数学维度 📐 传统 RGB 像素输入 🧱 压缩域频域输入 (DCT / 运动矢量) ⚡ 压缩感知理论支撑 💡
空间分辨率与通道 大空间低通道 (\(224 \times 224 \times 3\)) 小空间多通道 (\(28 \times 28 \times 24 \sim 192\)) 空间冗余转化为频域稀疏排列
浅层特征提取开销 必须由 Conv1 重新拟合明暗条纹 输入已为正交频域基底,天然解耦 免去网络从零学习 Gabor 滤波的算力
数据传输带宽 (PCIe) 传输庞大的解压后原始数组 直接传输紧凑的频域系数张量 数据体积减少 50% 到 75%
抗噪与鲁棒性 容易受高频椒盐噪声与量化噪点干扰 通过低频信道剪枝天然消除高频毛刺 过滤非相关高频,提升语义泛化度
视频时序特征获取 必须耗费海量算力计算密集光流 直接读取码流内置的运动矢量 运动矢量已由视频编码器预先计算完毕

这一系列对比清晰表明:直接在频域执行深度学习,本质上是把计算机视觉建立在已经高度提纯的信息基底之上。


4. 总结:拥抱信息稀疏性的工程未来

压缩域深度学习的发展历程给整个 AI 系统架构带来了深刻的启示:

在追求更高性能和更低功耗的过程中,优化并不局限于堆叠更大的模型参数或更复杂的神经网络层数。

尊重物理世界与信息编码的固有规律,利用压缩感知的稀疏性先验,在最紧凑的正交变换基底上进行直接计算,往往能以极低的代价收获数倍的效能跃升。

从静态图片的 DCT 频域直读,到视频监控的运动矢量极速分析,频域深度学习正在成为端侧计算与大规模实时边缘智能不可忽视的核心支撑。


📚 考据与权威学术档案 (Academic References)

  1. 图像频域深度学习奠基文献:

    • Gueguen, L., Sergeev, A., Kadlec, B., Liu, R., & Yosinski, J. (2018). Faster Neural Networks Straight from JPEG. Advances in Neural Information Processing Systems (NeurIPS 2018), 31, 3933-3944.
    • 确立了跳过 IDCT 解码、直接在 \(28 \times 28 \times 192\) DCT 频域张量上训练卷积神经网络的基础方法。
  2. 频域信道剪枝与多任务文献:

    • Xu, K., Qin, M., Sun, F., Wang, Y., Chen, Y. K., & Ren, F. (2020). Learning in the Frequency Domain. IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR 2020 Oral), 1740-1749.
    • 提出了频域信道显著性选择理论,证实剪除 87.5% 高频通道可提升 ImageNet 分类与目标检测精度。
  3. 视频压缩域实时动作识别文献:

    • Wu, C. Y., Zaheer, M., Hu, H., Manmatha, R., Smola, A. J., & Krähenbühl, P. (2018). Compressed Video Action Recognition. IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR 2018), 6026-6035.
    • 提出了基于 I 帧、运动矢量与残差的 CoViAR 架构,将视频动作识别速度提升 10 到 50 倍。
  4. 频域鉴伪与压缩感知基础:

    • Qian, Y., Yin, G., Sheng, L., Chen, Z., & Shao, J. (2020). Thinking in Frequency: Face Forgery Detection by Mining Frequency-aware Clues. European Conference on Computer Vision (ECCV 2020), 86-103.
    • Candès, E. J., & Wakin, M. B. (2008). An introduction to compressive sampling. IEEE Signal Processing Magazine, 25(2), 21-30.

#压缩感知 #频域深度学习 #JPEG #DCT #CoViAR #NeurIPS #CVPR #计算机视觉 #AI推理加速 #智柴系统实验室🎙️ #智柴

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录