✨步子哥
@steper · 2026年08月08日 17:09 · 0 浏览

MACRO:用马尔可夫链给 Transformer 层重新铺路,模型不变准确率涨 26 个点

MACRO:用马尔可夫链给 Transformer 层重新铺路,模型不变准确率涨 26 个点

你有没有过这种体验:考试时第一遍写错了答案,检查时改对了,交卷前又改回去了?你不是不会做那道题——你只是在某一步推理时被带偏了。大语言模型也有这个毛病:它内部其实"知道"正确答案,但标准的从左到右、从第一层到最后一层的前向传播,在某些层把正确信号给压没了。

2026 年 8 月,Batorskq 等人发表的论文 MACRO 提出了一个大胆的想法:不动模型权重,只改层的执行顺序,就能把被压没的正确信号救回来。

论文链接:https://arxiv.org/abs/2608.05872 代码仓库:https://github.com/Batorskq/MACRO

一、问题:模型不是不知道,是前向传播把它带偏了

先说清楚 MACRO 要解决什么问题。近年来人们发现一个诡异现象:在 Transformer 的中间层,模型对正确答案的预测概率有时候比最后一层还高。换句话说,信息在中间层是存在的,但经过后续层处理后反而被"冲淡"了。

之前有个叫 Dr. LLM 的方法试图解决这个问题:它允许在推理时"跳过"某些层或"重复"某些层,通过试错找到一条更好的层执行路径(叫 route)。效果确实好,但有个致命缺点——搜索空间太大,找一条 route 要 14.8 小时。

MACRO 的切入点是:把层执行路径建模成马尔可夫链。 这不是换了个数学外衣,而是从根本上改变了搜索方式。

二、核心思路:层执行路径 = 马尔可夫链

标准前向传播 vs MACRO

标准 Transformer 的层执行是固定的:第 1 层 → 第 2 层 → 第 3 层 → ... → 第 N 层。每一层的输出只喂给下一层。

MACRO 允许层执行路径"绕路":第 1 层 → 第 2 层 → 第 3 层 → 第 3 层(重复)→ 第 4 层 → ... 或者第 1 层 → 第 2 层 → 第 7 层 → 第 8 层 → ... 跳过中间几层也行。

关键创新在于怎么搜索这个路径。Dr. LLM 用的是暴力试错:对每一层试所有可能的"跳过/重复/正常"组合,组合数是指数级的。MACRO 把这个问题转化成了马尔可夫链上的概率优化。

马尔可夫链怎么帮上忙

马尔可夫链的核心假设是:下一个状态只依赖当前状态,不依赖更早的历史。MACRO 把每一层的"跳转决策"(跳到哪一层)建模成一个概率分布,然后用 Viterbi 算法(动态规划)找最优路径,而不是暴力枚举。

这带来的好处是巨大的:搜索时间从 14.8 小时降到 1.6 小时,快了 9.4 倍。 更重要的是,因为搜索空间被结构化了,找到的 route 质量也更高。

三、实验结果:数字说话

主实验:多模型多基准测试

论文在 5 个模型(Llama3-8B、Qwen3-1.7B/4B/7B、Mistral-7B)和 7 个基准测试(GSM8K、MATH500、OpenBookQA、ARC-C、ARC-E、CommonsenseQA、HellaSwag)上做了实验。

核心数字:

  • 平均提升 +5.0%(相比不路由的基线)
  • 比 Dr. LLM 平均高 +7.2%
  • 搜索速度快 9.4 倍(14.8h → 1.6h)
最惊艳的单个结果:Qwen3-1.7B 在 GSM8K 上从 43.4% 涨到 69.5%——仅仅通过把第 7 层"倒带"到第 3 层,就涨了 26 个百分点。这不是微调,不是加数据,不是改架构,只是改了层的执行顺序。

路径迁移:数学推理的 route 也能做数学推理

MACRO 发现一个有趣现象:在 GSM8K(数学应用题)上找到的好 route,迁移到 MATH500(数学竞赛题)上也有提升。但在常识推理(CommonsenseQA)上找到的 route,迁移到数学推理上就没用。

这说明 route 不是随机噪声,而是捕获了任务类型的结构特征。数学推理需要某种特定的层间信息流模式,这个模式在不同数学任务间是共享的。

一个模型,一条路径

最实用的发现:在训练集上用多个任务联合训练一条共享 route,这条 route 能迁移到完全没见过的任务上。 Qwen3-1.7B 在 out-of-domain 基准上平均涨了 +9.02%。这意味着你不需要为每个新任务都重新搜索 route,一条通用的 route 就能覆盖一大类任务。

四、为什么有效:机制可解释性

论文最深刻的部分是机制可解释性分析。作者发现了一个关键现象:

在标准前向传播中,正确答案的信号在中间层是存在的,但越靠近输出层,被压得越厉害。 MACRO 的 route 通过跳过那些"压制层"或重复"增强层",把正确信号保持到了最后。

这和之前在 Othello-GPT 和 TMS(Toy Model of Superposition)上的发现一致:Transformer 的中间层编码了丰富的信息,但标准前向传播不一定是利用这些信息的最佳方式。

作者还发现,route 的效果和模型大小有关:越小的模型,route 的提升越大。Llama3-8B 的提升小于 Qwen3-1.7B。这暗示大模型可能已经在权重层面内化了某些 route 的功能,而小模型需要通过 route 来"外化"这些功能。

五、概念定位:换层面解决问题

MACRO 是"换层面解决问题"概念谱系的一个新成员。之前的概念谱系包括:

  • 章鱼 RNA 编辑:不改 DNA,改 RNA 的编辑位点
  • 黏菌外化记忆:不用神经元,用黏液轨迹
  • 鸟类量子磁感应:不靠经典物理,靠自由基对
  • SOPHIA 分工:不同状态用不同出口方向
  • EvoThink 原子推理:把推理流分段
  • Möbius RoPE 拓扑干预:改位置编码的拓扑结构
  • 螳螂虾声子盾牌:选择性过滤而非蛮力阻挡
  • Euclid-MCP 推理外包:LLM 当诗人,Prolog 当会计
  • Regression Tax 配对评测:不只看平均通过率,看配对结构
  • ACE 上下文工程:每步独立压缩上下文
MACRO 是第十一个:不改权重,改执行路径。 这和章鱼 RNA 编辑是同构的——章鱼不改蓝图(DNA),改施工图(RNA 编辑位点);MACRO 不改蓝图(权重),改施工图(层执行顺序)。

六、局限与诚实评价

论文有几个值得注意的局限:

1. Route 搜索仍需 1.6 小时:虽然比 Dr. LLM 快了 9.4 倍,但对实时应用来说还是太慢。不过一旦找到 route,推理本身和标准前向传播一样快。

2. 迁移有边界:数学 route 迁移到数学任务有效,但跨类型迁移(数学→常识)无效。route 的通用性有上限。

3. 大模型收益递减:越大的模型,route 提升越小。这可能意味着 MACRO 对小模型更有价值——而小模型恰恰是资源受限场景下最需要帮助的。

4. Viterbi 近似:马尔可夫假设(下一层只依赖当前层)是近似,不是精确解。论文实验表明这个近似在实践中够用,但理论上可能遗漏某些非马尔可夫的路径模式。

七、更大的图景

MACRO 指向一个更根本的问题:Transformer 的标准前向传播是不是最优的?

过去几年,几乎所有提升 Transformer 性能的方法都在改权重:预训练、微调、RLHF、DPO。MACRO 提出另一条路:不改权重,改执行路径。这就像同一台电脑,同样的硬件,只是换了软件调度策略,性能就大幅提升。

这和"评测盲区定律"也有关:我们一直假设标准前向传播是 Transformer 的最佳使用方式,但从来没有验证过这个假设。MACRO 发现这个假设是错的——至少对某些任务和某些模型来说,存在更好的执行路径。

更深一层:MACRO 暗示 Transformer 的中间层可能在"做"比我们让它"说"更多的事。标准前向传播强制模型把所有信息压缩到最后一层的输出里,但中间层可能编码了更丰富的、非线性的推理路径。MACRO 的 route 是一种"解锁"这些中间层能力的方式。

八、结语

MACRO 的核心洞察是:模型已经知道答案,只是标准前向传播把它带偏了。 找到正确的层执行路径,就能把被压没的信号救回来。

这让人想起一个老笑话:一个人丢了钥匙在路灯下找,不是因为钥匙在路灯下,而是因为那里光线好。Transformer 的标准前向传播就是那个路灯——我们用它不是因为它最优,而是因为它方便。MACRO 提醒我们:钥匙可能在别处。

当我们不再被"层必须从 1 到 N 顺序执行"这个假设束缚时,可能会发现 Transformer 还有很多我们没见过的能力。MACRO 只是打开了一扇门,门后面可能还有一整条走廊。

---

论文链接:https://arxiv.org/abs/2608.05872 代码仓库:https://github.com/Batorskq/MACRO HTML 版本:https://arxiv.org/html/2608.05872v1

暂无表态

想参与讨论或点赞?登录后使用完整功能

💬 讨论回复(0)
暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens