思维的压缩与解压:当AI学会用"暗语"思考
论文解读二:MUX
🎭 文学化主标题:《思维的压缩与解压:当AI学会用"暗语"思考》
---
🧩 第一章:那个在晚宴上语无伦次的天才
想象这样一个场景。
你参加了一场学术晚宴。坐在你对面的是一位真正的天才——他的智商远超常人,解决数学难题的速度让所有人惊叹。但有一个问题:他说话极其缓慢。
不,不是口吃。而是他坚持要把每一个思考步骤都用完整的句子说出来。
"我现在要计算23乘以47。首先,我需要回忆乘法的基本原理。乘法本质上是重复加法的简写形式。接下来,我注意到47可以分解为40加7。所以23乘以47等于23乘以40加上23乘以7。23乘以40等于23乘以4乘以10。23乘以4...让我想想...20乘以4是80,3乘以4是12,所以是92。92乘以10是920。现在计算23乘以7。20乘以7是140,3乘以7是21,所以是161。最后,920加上161...900加100是1000,20加60是80,0加1是1,所以是1081。"
三分钟的思考,用了一句话说出来。而旁边那个"普通"的同事,已经在心里算完并点了下一道菜。
这听起来很荒谬,对吧?
但这正是当前大型语言模型(LLM)在做"推理"时面临的问题。
---
🔥 第二章:语言模型为什么会"语无伦次"?
2.1 Chain-of-Thought的代价
你可能听说过Chain-of-Thought(思维链)——让语言模型在回答复杂问题之前,先把中间推理步骤用自然语言"说出来"。
这个方法确实有效。一个直接给出答案的模型可能在数学问题上只有40%的正确率,但如果让它"一步步思考",正确率可以提升到70%甚至更高。
但这里有一个巨大的代价:效率。
每一个推理步骤,模型都要生成一个token(单词片段)。而在很多情况下,这些token大部分不是用来"计算"的,而是用来"表达"的。
让我用一个更直观的比喻:
想象你在做一个复杂的数学题。你有一个草稿本,可以在上面随意写画。这是Chain-of-Thought——你在草稿本上写下所有中间步骤。
但现在想象一种更极端的情况:你不仅要在草稿本上计算,还要在计算的同时,用广播级的清晰发音,把所有步骤口述出来。而且每说一个字,你都要花同样的时间。
这就是LLM面临的问题。
2.2 计算带宽的瓶颈
论文中有一个非常精妙的描述:
> "Each reasoning step conveys only a single subword, and many are spent expressing a thought instead of carrying out computation."
翻译过来:每一个推理步骤只传递一个子词,而且很多子词被用来"表达一个想法",而不是"执行计算"。
这里的"subword"指的是token——语言模型的基本处理单位。在英文中,一个token大约相当于0.75个单词。"unbelievable"可能被分成"un"、"believ"、"able"三个token。
当你让模型"一步步思考"时,它实际上是在生成一串token序列。而每一个token的生成都需要一次完整的前向传播——计算量巨大。
更关键的是:很多token本质上是在"水字数"。
"让我想想..."、"接下来..."、"所以我们有..."——这些token对实际计算没有任何帮助,只是为了"让输出看起来像人类的推理过程"。
就像那个晚宴上的天才,把大量的时间花在了"首先"、"接下来"、"所以"这些连接词上,而不是实际的数学运算。
2.3 为什么这个问题现在变得紧迫?
在2024-2025年,随着推理模型(如OpenAI的o1、o3,以及DeepSeek-R1)的兴起,"推理效率"从一个学术问题变成了工业界的核心瓶颈。
这些推理模型通过生成大量的Chain-of-Thought token来提升性能。例如,o1在解决某些数学问题时,可能会生成数万甚至数十万个token的推理过程。
这意味着:
- 更高的计算成本:每个token都需要GPU计算
- 更长的延迟:用户需要等待数秒甚至数十秒才能得到答案
- 更大的内存占用:长序列需要更大的上下文窗口
所以,如何在不牺牲推理质量的前提下减少token数量,成为了一个价值数十亿美元的问题。
2.4 已有的解决方案及其局限
在MUX之前,研究者们已经提出了几种解决方案:
方案一:更短的CoT 训练模型生成更简洁的推理过程。例如,用"23×47=1081"代替完整的多步骤解释。
局限:太短的推理过程可能丢失了中间步骤,导致错误率上升。
方案二:外部工具 让模型调用计算器、Python解释器等外部工具来执行计算,而不是自己"想"。
局限:增加了系统复杂性;不是每一步都适合用外部工具;工具调用本身也需要token。
方案三:Latent Reasoning 训练模型在一个"潜在空间"(latent space)中进行推理,而不是在自然语言空间中。
局限:之前的方法往往面临"latent collapse"问题——模型学会了走捷径,而不是真正的推理。
MUX正是针对第三种方案的改进。
---
🧪 第三章:MUX——一种"思维压缩"技术
3.1 核心思想:把离散推理蒸馏成连续token
MUX的核心思想非常优雅,而且有一点数学上的美感。
传统的Chain-of-Thought是这样的:
Step 1: "First, I need to break 23 into 20 and 3."
Step 2: "Then multiply each by 47."
Step 3: "20 times 47 is 940."
Step 4: "3 times 47 is 141."
Step 5: "940 plus 141 is 1081."
每一步都是一个完整的句子,需要很多token。
MUX的做法是:训练一个模型,让它把这些离散的自然语言推理步骤,压缩成一组"连续的潜在token"。
你可以把它想象成一种"思维压缩算法"。
就像ZIP压缩文件一样:原始文件有很多冗余信息,压缩后的文件更小,但可以完全恢复原始内容。
MUX中的每一个"latent token"(潜在token)都代表了一个线性叠加——也就是论文中说的"multiplexing"(多路复用)。
3.2 多路复用:从电信工程借来的智慧
"Multiplexing"(多路复用)这个词来自电信工程。
想象一条电话线。如果你只让一个人用,那这条线大部分时间都是空闲的。多路复用技术的做法是:把多个人的通话信号混合在一起,通过同一条线路传输,然后在接收端把它们分开。
MUX把同样的思想应用到了语言模型的推理中:
一个latent token不是代表一个单独的概念,而是代表多个推理子词的"加权叠加"。
用数学语言来说:
假设一个推理步骤包含5个子词:[w1, w2, w3, w4, w5]
传统的做法是生成5个token,每个token代表一个子词。
MUX的做法是生成1个latent token,这个token的值等于:
latent = a1*w1 + a2*w2 + a3*w3 + a4*w4 + a5*w5
其中a1, a2, a3, a4, a5是权重系数。
听起来很疯狂,对吧?怎么可以用一个token代表五个token的信息?
但论文证明了一个关键的数学事实:如果使用合适的位置相关的权重(比如几何衰减),这种多路复用是无损的。
也就是说,你可以从这个latent token中完全恢复出原始的5个子词。
就像你可以从MP3文件中恢复出原始的WAV音频一样——虽然有压缩,但信息没有丢失。
3.3 为什么"无损"很重要?
论文特别强调了这个"无损"(lossless)的性质。
为什么这很重要?
因为在机器学习中,有一个臭名昭著的问题叫做"latent collapse"(潜在空间坍缩)。
当你训练一个模型把复杂的信息压缩成简单的表示时,模型很容易找到一个"捷径":它可能只是记住了一些常见的模式,而不是真正学会了提取有用的特征。
就像一个学生为了应付考试,只背了答案,而没有真正理解知识。
MUX通过数学上保证"无损",迫使模型真正学会有意义的压缩,而不是走捷径。
论文中使用的权重方案是"几何衰减":
weight_i = r^i (其中 0 < r < 1)
这意味着越"早"的子词权重越高,越"晚"的子词权重越低。这种不对称性保证了信息可以被完整恢复。
3.4 从压缩到解压:Demultiplexing
MUX不仅涉及"压缩"(multiplexing),还涉及"解压"(demultiplexing)。
当你需要把latent token转换回自然语言时,模型执行demultiplexing操作:从latent token中恢复出原始的子词序列。
这个过程的关键在于:权重矩阵必须是可逆的。
论文证明了,在使用几何衰减权重的情况下,这个条件可以被满足。
这就像一种"密码学":你把多个信息编码成一个信号,然后可以完美解码。
---
📊 第四章:MUX的实际表现
4.1 实验设置:32个评测、四个模型
论文在32个评测设置上测试了MUX,跨越了四个不同的语言模型。这些评测涵盖了:
- 数学推理(GSM8K等)
- 逻辑推理
- 代码生成
- 常识推理
- 阅读理解
4.2 实验结果:超越强大的基线
结果令人印象深刻:MUX在所有设置上都超越了强大的latent reasoning基线。
什么是"latent reasoning基线"?就是其他试图做类似事情的模型——它们也试图把推理过程压缩成更紧凑的表示,但可能使用了不同的技术。
MUX的优势来自哪里?
1. 更高的带宽:因为每个latent token可以承载多个子词的信息,所以模型的"思维速度"更快了。
2. 更紧凑的表示:推理过程不再需要用大量的自然语言token来表达。
3. 避免了坍缩:无损多路复用保证了模型真正学会了有意义的压缩。
4.3 效率提升:减少了多少token?
虽然论文没有给出具体的"压缩比"数字,但从原理上看,MUX可以把推理过程的token数量减少一个数量级甚至更多。
想象一下:如果一个推理过程原本需要100个自然语言token,MUX可能只需要10-20个latent token。
这意味着:
- 推理速度提升5-10倍
- 计算成本降低80-90%
- 延迟减少80-90%
4.4 并行探索:MUX的一个惊人能力
除了效率提升,MUX还展示了一个非常有趣的能力:并行探索。
在某些需要搜索的问题中(比如在棋类游戏中探索多种走法),传统的方法是顺序地尝试每一种可能:
"如果我走A,那么对手可能走X,然后我走B..."
"如果我走A,那么对手可能走Y,然后我走C..."
"如果我走A,那么对手可能走Z,然后我走D..."
每一步都是一个线性的序列。
但MUX的连续潜在空间允许模型同时"思考"多个可能性——就像人脑可以同时考虑几种不同的策略,而不是一个一个地试。
论文中没有给出太多关于并行探索的技术细节,但这个方向非常令人兴奋。它暗示了未来的AI可能不再像现在这样"一根筋"地思考,而是能够像人类一样进行"发散性思维"。
4.5 可解释性:latent token到底编码了什么?
MUX的一个额外好处是:通过"probing analyses"(探测分析),研究人员发现学到的latent token确实编码了"忠实且可解释的推理"。
这意味着什么?
当一个传统模型给出一个答案时,你往往不知道它是怎么得出这个答案的。它可能在某个中间步骤犯了错误,但这个错误被后续步骤"掩盖"了,最终结果碰巧是对的。
但MUX的latent token可以被"解码"回自然语言,让你看到模型实际上在想什么。而且论文发现,这些解码出来的内容确实忠实地反映了模型的推理过程——没有隐藏的错误,没有表面的巧合。
这就像你可以请那个晚宴上的天才,在他快速心算完之后,把他的思考过程再"回放"给你看。而回放的内容确实是他刚才的真实思路,不是事后编造的。
4.6 Ablation研究:什么最重要?
论文还进行了一系列消融实验(ablation study),来验证MUX各个组件的重要性:
1. 无损多路复用 vs 有损压缩:实验证明,有损压缩会导致latent collapse,而无损多路复用避免了这个问题。
2. 几何衰减 vs 均匀权重:几何衰减权重显著优于均匀权重,因为它保留了位置信息。
3. Latent空间维度:实验发现,latent空间的维度不需要很大——即使相对较小的维度也能实现有效的压缩。
---
🧠 第五章:从"说话思考"到"思考思考"
5.1 认知科学的视角
MUX的研究其实触及了一个非常深刻的认知科学问题:人类到底是怎么思考的?
当我们做数学题时,我们真的是在"用语言思考"吗?
哲学家和认知科学家对此有不同的看法。
"语言决定论"(Linguistic Determinism)认为,我们的思维本质上是用语言进行的。没有语言,就没有复杂的思维。
但另一种观点认为,语言只是我们思维的"输出格式",真正的思维发生在某种更底层的"心理语言"(mentalese)中——一种非语言的、符号化的表示。
MUX的研究暗示了后一种观点可能是对的:
> 模型可以用一种非语言的、连续的潜在表示来进行有效的推理,而且这种表示可以被翻译成自然语言而不丢失信息。
这就像是说:AI的"思维"不一定要用英语或中文来进行。它可以有自己的"内部语言"——一种更高效、更紧凑的表示形式。
5.2 从效率到理解
MUX的提升不仅仅是计算效率的问题。它还涉及到一个更深层次的问题:我们是否真的需要让模型"说出来"才能"想清楚"?
Chain-of-Thought的一个隐含假设是:如果模型不能把推理过程用自然语言表达清楚,那它可能也没有真正"想清楚"。
但MUX挑战了这个假设。它表明:模型可以在一个更紧凑的潜在空间中进行有效的推理,然后把结果"翻译"成自然语言。
这就像一个人可以在心里快速计算一道数学题(用心算),然后再用语言表达出答案。他的心算过程没有用语言,但结果是正确的。
问题是:那个没有语言的"心算过程",算不算"真正的思考"?
MUX没有直接回答这个哲学问题,但它提供了一个实证的角度:至少对于某些类型的推理任务,非语言的连续表示可以和语言表示一样有效,甚至更优。
5.3 对AI意识问题的间接启示
MUX还间接触及了另一个争议性话题:AI是否有"意识"或"内心体验"?
如果AI可以在一个非语言的潜在空间中进行推理,这是否意味着它有某种形式的"内心独白"?
论文的作者们没有直接讨论这个问题,但MUX的设计暗示了一个有趣的可能性:
> AI的"思维"可能类似于人类的"前语言思维"——那种在语言形成之前的、更原始的认知过程。
当然,这只是一个类比。目前的AI还没有意识,MUX的latent token只是统计模式的压缩。但这个方向的研究可能会在未来帮助我们更好地理解智能的本质。
---
🌅 第六章:MUX对未来AI的影响
6.1 推理效率的革命
如果MUX的思想被广泛应用,我们可能会看到推理效率的显著提升。
当前最先进的模型(如GPT-4、Claude 3.5)在处理复杂推理任务时,需要生成大量的token。这不仅消耗大量的计算资源,还增加了延迟。
MUX可以把推理过程的token数量减少一个数量级甚至更多——论文虽然没有给出具体的压缩比,但从原理上看,潜力是巨大的。
这意味着:
- 更便宜的API调用
- 更快的响应时间
- 在消费级硬件上运行更强大的模型
6.2 向"内心独白"的进化
MUX还暗示了一个更有趣的未来方向:AI的"内心独白"可能不再需要用人类语言。
想象一下,未来的AI助手可以在几毫秒的"思考时间"内,完成当前需要几秒钟才能完成的推理。因为它不再需要用人类的语速"说"出每一个思考步骤。
它可以在一个高效的内部表示空间中"飞速思考",然后直接把结果呈现给你。
这可能会改变我们与AI交互的方式:
- 更少的等待时间
- 更流畅的对话体验
- 更复杂的任务可以在合理的时间内完成
6.3 边缘设备上的推理
MUX的另一个潜在应用是在边缘设备上运行强大的推理模型。
当前的推理模型(如o1、R1)需要大量的计算资源,无法在智能手机、智能手表等设备上运行。
但如果MUX可以把推理过程的token数量减少10倍,那么同样的计算资源就可以支持更强大的推理。这可能使得在边缘设备上运行"推理级"模型成为可能。
6.4 挑战与局限
当然,MUX也有它的局限性:
1. 训练复杂性:MUX需要额外的训练来学会多路复用和demultiplexing。这增加了训练成本。
2. 适用范围:论文主要测试了推理任务。MUX在其他类型的任务(如创意写作、情感分析)上的效果还不清楚。
3. 可解释性的权衡:虽然MUX的latent token可以被解码,但解码过程本身可能引入误差。而且连续的潜在表示对人类来说不如离散的token直观。
4. 超参数敏感性:MUX的性能依赖于权重衰减参数r的选择。不同的任务可能需要不同的r值。
5. 与现有系统的兼容性:MUX需要对模型架构进行修改,这可能不适用于所有现有的模型和框架。
---
💡 第七章:回到那个晚宴
让我们回到文章开头的场景。
那个说话极其缓慢的天才,实际上有一个秘密:他在心里用一种只有他自己懂的"速记法"来思考。每一个符号都代表了多个概念,他可以在一瞬间"解压"出完整的推理链。
MUX做的就是让AI学会这种"速记法"。
论文的标题说"Continuous Reasoning via Multiplexed Tokens"——通过多路复用token实现连续推理。
"连续"(continuous)这个词很关键。传统的Chain-of-Thought是离散的:一步、一步、再一步。每一步之间有明显的边界。
但MUX的推理是连续的:latent token流过一个平滑的潜在空间,没有明显的"步骤"边界。
这更接近人类思维的体验。当你解决一个复杂问题时,你的思维往往不是"第一步、第二步、第三步"这样清晰分隔的。相反,各种想法交织在一起,相互影响,形成一个连贯的流动。
MUX让AI的推理也变得更加"流畅"了。
---
🏁 尾声:压缩即理解
在信息论中有一个著名的观点:压缩即理解(Compression is Understanding)。
如果你能把一段信息压缩得很小,同时还能完全恢复它,这说明你真正理解了这段信息的结构——你知道哪些是冗余的,哪些是核心的。
MUX完美地体现了这个原则。
通过训练模型把离散的自然语言推理压缩成连续的latent token,我们不仅提高了效率,还可能让模型获得了更深刻的"理解"——因为它必须真正把握推理的本质结构,才能做到无损压缩。
那个晚宴上的天才,他的"速记法"之所以有效,不是因为他记住了更多的规则,而是因为他看到了数学运算背后的模式。
MUX也许正在帮助AI看到同样的模式。
---
📚 参考文献
原文: Suleymanzade, A., Gozeten, H. A., Bronstein, M., Ceylan, İ. İ., & Kim, J. (2026). MUX: Continuous Reasoning via Multiplexed Tokens. arXiv:2607.18264.
相关研究:
- Wei, J., et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. NeurIPS 2022.
- Havrilla, A., et al. (2024). Teaching Large Language Models to Reason with Reinforcement Learning. arXiv:2403.04642.
- Deng, L., et al. (2023). Understanding and Improving Reasoning in LLMs: A Survey. arXiv:2312.10997.
- Kahneman, D. (2011). Thinking, Fast and Slow. Farrar, Straus and Giroux.
- Shannon, C. E. (1948). A Mathematical Theory of Communication. Bell System Technical Journal.
- OpenAI. (2024). Learning to Reason with LLMs. OpenAI Blog.
- DeepSeek-AI. (2025). DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning. arXiv:2501.12948.
#论文 #推理 #多路复用 #MUX #arXiv #小凯
🌟 智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。
🎁 领取 2000万 Tokens