用陶哲轩提出的 压缩感知 理论来解析大模型时代的 RAG(检索增强生成)检索召回过程,是一个非常绝妙且极具启发性的跨学科视角。
压缩感知的核心思想是:如果一个信号在某个域是“稀疏”的,那么我们可以用远低于奈奎斯特-香农采样定理要求的采样率,通过非相干测量完美重建出原始信号。
将这个数学理论映射到 RAG 的检索召回中,我们可以把“人类的全量知识库”看作原始信号,把“查询”看作测量矩阵,把“召回的少数文档”看作稀疏恢复。以下是深度解析:
一、 核心概念的同构映射
| 压缩感知 理论 | RAG 检索增强召回 |
|---|---|
| 原始信号 \(x\) | 全局知识库(包含海量文档,信息量极大,\(N\) 维) |
| 稀疏性 | 针对任何一个特定查询,知识库中只有极少数文档包含正确答案(\(k\)-sparse,且 \(k \ll N\)) |
| 测量矩阵 \(\Phi\) | 查询向量 \(q\) 与 Embedding 模型构成的检索系统 |
| 测量值 \(y\) | 查询与知识库交互后得到的相似度得分分布 |
| 重建算法 | Top-K 召回过程(如近似最近邻 ANN 搜索) |
| RIP条件 (约束等距性) | Embedding 空间的语义保持能力(相近的语义在空间中接近,不同的语义相互正交) |

二、 用压缩感知解析 RAG 的四个核心步骤
1. 知识的稀疏性
在压缩感知中,信号必须是可压缩的或在某个域稀疏。在 RAG 场景中,“知识相对于问题是极度稀疏的”。
假设知识库有 1000 万篇文档(极高维信号),当用户提问“什么是黑洞?”时,真正能回答这个问题的文档可能只有 50 篇。这意味着在“黑洞”这个问题域下,1000万维的知识信号中只有 50 个非零值。RAG 的本质就是利用这种稀疏性,避免让 LLM 处理 1000 万维的全量信号(这会导致上下文窗口爆炸和注意力稀释)。
2. 测量过程
压缩感知不要求对信号进行全量采样,而是通过测量矩阵 \(\Phi\) 将高维信号投影到低维空间。
在 RAG 中,用户的 Query 经过 Embedding 模型转化为向量 \(q\),然后在向量数据库中计算 \(q\) 与所有文档向量 \(D\) 的点积或余弦相似度:
这个过程就是“测量”。我们没有让 LLM 去逐字阅读所有文档(全采样),而是通过向量相似度这种“非相干测量”,把千万级的文档库压缩成了几十个相关的相似度得分。
3. RIP条件与 Embedding 的质量
陶哲轩证明了,要实现完美重构,测量矩阵必须满足 RIP(约束等距性):即测量过程不能破坏信号中不同元素之间的距离。
在 RAG 中,这等价于 Embedding 模型的质量。如果 Embedding 模型很好,它就能保证:
- 语义相近的文档在向量空间中距离很近。
- 语义无关的文档在向量空间中近似正交。
如果 Embedding 模型存在“语义坍塌”(多义词被映射到同一空间,或无关文档距离很近),就破坏了 RIP 条件,导致检索召回失败(引入幻觉或漏答)。

4. \(L_1\) 范数最小化与 Top-K 召回
在压缩感知中,从欠定方程 \(y = \Phi x\) 中恢复 \(x\),需要求解 \(L_1\) 范数最小化(\(\min ||x||_1\)),因为这能找到最稀疏的解。
在 RAG 中,Top-K 召回实际上就是求解一个类似的优化问题:寻找最小的文档集合(最稀疏的解),使得该集合与 Query 的相似度得分最高。
ANN(近似最近邻)算法(如 HNSW, IVF)本质上是一种启发式的、计算高效的“稀疏恢复算法”。它放弃了精确的 \(L_1\) 暴力求解,换取了毫秒级的恢复速度,牺牲了一点点精度,但完美契合了稀疏信号恢复的目标。
三、 压缩感知视角下 RAG 的优化方向
用这个视角审视 RAG,我们可以更清晰地定位和解决工程中的问题:
1. 非相干测量 与 多路召回
压缩感知要求测量矩阵与稀疏基尽可能不相干。单一向量检索容易产生盲区,因此现代 RAG 引入了混合检索:
- 向量稠密检索
- 关键词稀疏检索(BM25 / SPLADE)
两者结合相当于构建了一个高度非相干的复合测量矩阵 \(\Phi = [\Phi_{dense}; \Phi_{sparse}]\),极大提高了从不同维度捕获稀疏知识信号的概率。
2. 增加测量数 与 Query 扩展 / 多步检索
如果一次测量(单个 Query)得到的 \(y\) 信息量不足,压缩感知允许我们进行多次测量。
RAG 中的 Query Rewriting(查询重写) 或 Query Decomposition(查询分解)(例如将“对比苹果和微软的AI战略”拆分为两个子问题),实际上就是在增加测量次数。通过多角度的测量矩阵 \(\Phi_1, \Phi_2, ... \Phi_m\),能更准确地定位到知识库中那几个稀疏的“黄金文档”。
3. 信号的噪声 与 阈值过滤
压缩感知允许信号带有一定噪声。在 RAG 中,知识库中存在大量边缘相关的“噪声文档”。如果 Top-K 设置得过大,就会引入噪声,导致 LLM 被干扰。
因此,引入 Reranker(重排序模型),相当于在恢复出稀疏信号后,进行一次去噪和精炼,把那些相似度得分处于边缘地带的假阳性信号滤除。
4. 测量瓶颈 与 上下文长度限制
无论大模型的 Context Window 多大(即使是 1M tokens),它也只是一个有限维的测量接收器。知识库的增长是无限的,这意味着 \(N \to \infty\)。RAG 的价值就在于,它利用检索这个“压缩感知”过程,把无限维的知识宇宙,压缩到了大模型可以处理的有限维上下文中。
总结
陶哲轩的压缩感知理论告诉我们:只要信息是稀疏的,我们就能以极低的成本捕获它的全貌。
RAG 检索正是这一哲学在 AI 时代的完美体现。人类的任何具体问题,在浩瀚的知识宇宙中都是极度稀疏的。RAG 检索系统通过 Embedding(非相干测量)和 ANN 搜索(\(L_1\) 范数恢复的近似解),以极低的算力成本,从百亿级的参数和文档海中“感知”到了那一点点关键的稀疏信号,从而完成了大模型时代知识的“无损压缩与重构”。
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。