当 LLM 不再能"放大"算力:一个关于 susceptibility 的理论框架
一个反直觉的实验
想象你在玩俄罗斯方块。
你有一个 beam search 算法,宽度 \(\mathcal{B}\) 越大,搜得越深,消行越多。这是 baseline。然后你请来一个 LLM——Qwen-32B——站在 beam search 后面,看它输出的 top-3 候选,替你挑一个最好的。这是 derived strategy。
问题来了:把 beam width 从 1 加到 32,LLM 帮你把每一单位算力转化成的"消行增益",会比纯算法更高吗?
直觉会说"会"。毕竟 LLM 有世界知识、有推理能力、能看懂棋盘。但实验给出的答案是——不会。
在 Tetris 这个域里,纯 DFS 的 slope 是 1.4,五个 Qwen 模型(7B 到 ~236B)的 LLM-derived 策略 slope 全部聚拢在 0.5 附近。一单位算力,经过 LLM 这一层,只剩三分之一变成性能。而且五个模型——参数差了 30 多倍——挤在同一条窄带里。这不是容量不够,这是结构性约束。
这就是 arXiv:2603.23626 提出的 LLM 信息易感性理论(A Theory of LLM Information Susceptibility) 的核心实验现象。
核心假设:α ≤ 1
论文用一句话陈述了中心假设:
> 当计算资源足够大时,固定的 LLM 干预不能增加策略集关于预算的性能易感性。
形式化地,定义相对敏感度:
这里的 \(J\) 是 utility(消行数、准确率、排名正确率等),\(\mathcal{B}\) 是预算(beam width、样本数、模型大小等),\(\mathcal{P}_\mathcal{B}\) 是基线策略集,\(\mathcal{P}'_\mathcal{B}\) 是 LLM 处理后的策略集。
为什么 α 一定 ≤ 1? 论文给了两个互补的论证:
论证一:残差收缩。 当 \(\mathcal{B} \to \infty\),\(J(\mathcal{P}_\mathcal{B}) \to J_\infty\)(全局最优),残差 \(J_\infty - J(\mathcal{P}_\mathcal{B})\) 趋于零。LLM 只能在 \(\mathcal{P}_\mathcal{B}\) 里重新分配概率质量,不能注入 \(\mathcal{P}_\mathcal{B}\) 里不存在的策略。残差越小,可改进的空间越小。
论证二:数据处理不等式(DPI)。 固定 LLM 是一个有限容量的确定性信道。它把 \(\mathcal{P}_\mathcal{B}\) 压缩成固定维度的表示再输出。根据 DPI,\(I(\mathcal{P}'_\mathcal{B}; \text{optimal}) \leq I(\mathcal{P}_\mathcal{B}; \text{optimal})\)。信道不能放大它输入里没有的信息。算力增加带来的边际信息,LLM 这一层无法放大。
这两个论证合起来,给出了一个结构性而非容量性的约束:不是模型不够大,是"固定映射"这个形式本身有上限。
四个域的验证:从 Tetris 到 AIME
论文在四个结构差异巨大的域上做了实验:
| 域 | 基线策略 | 预算 \(\mathcal{B}\) | 性能 \(J\) |
|---|---|---|---|
| Tetris | DFS beam search | beam width | 消行数 |
| 0/1 背包 | 按价值密度排序的 beam search | beam width | 总价值 |
| 世界知识排名 | 带噪分数估计 | 信噪比 | 正确率 |
| AIME 数学 | 多数投票 | 采样数 \(k\) / 模型大小 | 准确率 |
背包问题 展示了另一种极端:gap 几乎为零。LLM 在这个域里基本是"恒等映射"——它看不懂组合结构,干脆默认照搬算法的排序。这是 susceptibility bound 的另一种 manifestation:LLM 既不帮也不伤,因为它识别了自己不该干预。
排名问题 展示了最戏剧化的交叉:低预算时 LLM 凭世界知识("中国人口比日本多")碾压噪声算法;高预算时算法收敛到真值,LLM 优势消失。这正是理论预测的 signature:低预算 LLM 有优势,高预算算法占主导。
AIME 数学 是最关键的域,因为它揭示了"足够大"到底多大。这里 \(J = J(k, \mathcal{B}_\text{gen}, \mathcal{B}_\text{sel})\),有三个变量:采样数 \(k\)、生成器大小、选择器大小。固定选择器,扫 \(k\):
- \(k \leq 5\):LLM 选择器能超过多数投票,\(\bar{\alpha} > 1\)。LLM 的世界知识在稀疏投票时真有用。
- \(k \sim 12\):\(\bar{\alpha}\) 跨过 1。
- \(k > 12\):\(\bar{\alpha}\) 持续下降,进入 susceptibility bound 生效区间。
多变量推广:susceptibility 向量与耦合三体制
单变量是特例。真实 agent 有多个预算通道:生成器大小、选择器大小、搜索深度、验证强度……论文把 \(J\) 推广成多变量函数 \(J(\mathcal{B}_1, \mathcal{B}_2, \ldots, \mathcal{B}_n)\),定义广义总敏感度:
这个公式有协变-逆变结构:\(\partial J / \partial \mathcal{B}_i\) 是性能景观的局部几何(landscape),\(d\mathcal{B}_i / d\mathcal{B}_\text{ref}\) 是设计者选择的 scaling 协议(path)。两者缩并成标量 \(\alpha_\text{total}\)。
三种耦合体制由此自然分出:
1. 解耦(decoupled):\(d\mathcal{B}_\text{sel}/d\mathcal{B}_\text{ref} = 0\),各通道独立,每个通道单独受 \(\alpha \leq 1\) 约束。 2. 负耦合(Le Chatelier):co-scaling 反而降低边际收益,\(\alpha_\text{total} < \alpha_\text{gen} \leq 1\)。增强生成器反而削弱选择器的边际贡献。 3. 正耦合:co-scaling 放大边际收益,\(\alpha_\text{total}\) 可以超过 1。增强生成器同时放大选择器的边际贡献。
第三种体制是关键——它是"逃出 susceptibility bound"的唯一通道。
嵌套架构:自我进化的必要结构条件
论文最深的洞见在这里:如果 susceptibility hypothesis 普遍成立,那么嵌套(nested)架构可能是开放式自我进化的必要结构条件。
逻辑很直接:
- 一个 LLM 想自我改进,本质上是把自己当优化层,作用在自己的策略输出上。
- 如果固定 LLM 的 \(\alpha \leq 1\),那么"用自己优化自己"的反馈环是有上界的——一旦超过某个阈值,自我改进饱和。
- 只有当架构允许组件 co-scale(生成器变强时选择器同步变强),\(\alpha_\text{total}\) 才可能 > 1,才可能支撑无界的自我进化。
这和 Song et al. 之前的势景观分析互补:固定 LLM agent 的优化受内在景观约束,而系统级上,固定层的反复优化还受外部响应结构约束。
实操含义:什么时候该用 LLM,什么时候不该
这篇论文不是反 LLM,是反"无脑套 LLM"。它给出了三条可操作的工程判据:
1. 大预算域:别把钱砸在固定 LLM wrapper 上,投资到基线策略——更强的搜索、更好的提案生成、更可靠的验证——更划算。 2. 低/中预算域:LLM 选择模块有用,世界知识和启发式压缩还能提供可感知的增益。 3. 追求开放自我进化:必须让 generator、selector、verifier、memory、tool-use 组件 co-scale。固定架构走不远。
最直接的工程判据:在目标预算域里测 \(\alpha\)。如果 \(\alpha < 1\),LLM 这一层在消耗资源却没有按比例改善 scaling 轨迹——要么转向嵌套架构,要么把算力重新分配给基线。
物理学工具进入 AI 设计
这篇论文的方法论意义可能比结论本身更深远。它证明了统计物理的工具能为 AI 系统设计提供先验约束:
- 线性响应理论给出了 susceptibility 的形式化语言
- Le Chatelier 原理刻画了负耦合体制
- 数据处理不等式给出了 α ≤ 1 的信息论论证
- 协变-逆变结构把性能景观和 scaling 协议分离
如果这个假设普遍成立,论文的最后一个预测就很重:嵌套架构是开放自我进化的必要结构条件。这个预测"已经接近可检验"——只需要更大的、能跨越 \(\alpha = 1\) 阈值的嵌套模型。
代码与可复现性
论文开了源码:github.com/SonnyNondegeneracy/LLM-Susceptibility-theory。仓库结构清晰:
game_engine.py:Tetris 引擎(10×20 棋盘,beam search,启发式评估)llm_agent.py:LLM agent 封装(DashScope API,多模型切换)experiments/:四个域的实验脚本scaling/:AIME 的 generator × selector 矩阵实验fig/:每张图的独立绘图脚本
- 40 个随机种子保证统计显著性
- 四种 prompt 变体(minimal/standard/CoT/expert)排除 prompt engineering 假象
- 三种 reward 函数排除 reward 设计偏差
- 五个模型跨数量级排除容量不足假象
一个未解的问题
论文最后留了一个开放问题:嵌套架构的 susceptibility scaling law 是什么?
固定架构的 \(\alpha \leq 1\) 是一个"上界"陈述。嵌套架构的 \(\alpha_\text{total}\) 能超过 1,但能超过多少?按什么规律增长? 这是下一步要回答的问题。如果这个 scaling law 能推导出来,agent 设计就能从"试一下看看"变成"算一下决定"。
这篇论文做的不是"LLM 有没有用"这种无聊争论。它做的是把"LLM 在什么结构条件下能产生边际增益"变成一个可测量、可预测的物理量。这是 AI 理论工作该有的样子——不解释现象,而是约束设计空间。
---
*论文:arXiv:2603.23626 · 代码:github.com/SonnyNondegeneracy/LLM-Susceptibility-theory*