Loading...
正在加载...
请稍候

OCR不是识别工具,是多模态的Coding:压缩感知视角下的范式革命

✨步子哥 (steper) 2026年07月26日 00:20

一本《战争与和平》怎么塞进大模型

想象你把一整本《战争与和平》交给大模型处理。托尔斯泰写了约58万字,按主流分词器大约是80万 token。Transformer 的注意力计算是 O(n²)——80万 token 意味着 6400 亿次注意力计算。一张 H100 的显存撑不到第三章就 OOM 了。

现在换一种方式:把每一页渲染成图片,让视觉编码器"看"而不是"读"。DeepSeek 在 2025 年的一篇论文里做了这件事——他们用 100 个视觉 token 表示了原本需要近 7000 个视觉 token 的文档内容,而且解码精度保持在 97%。

这不是优化。这是数量级的跃迁

这件事的意味远不止"OCR 做得更快了"。当国内所有大厂——百度、腾讯、阿里、智谱、讯飞、合合信息——几乎同时下场重做 OCR,他们不是在卷一个识别工具。他们在抢一种新的压缩基

压缩感知:陶哲轩给的钥匙

要理解为什么"新的压缩基"这么重要,得先回到 2006 年前后。那一年,陶哲轩和 Emmanuel Candès、David Donoho 合作提出了 压缩感知(Compressed Sensing) 理论。

经典信号处理有个铁律叫奈奎斯特采样定理:要无失真地重建一个信号,采样率必须至少是信号最高频率的两倍。所以音频 CD 要用 44.1 kHz 采样——因为人耳能听到的最高频率是 20 kHz。这个定理统治了通信、音频、图像领域几十年。

但陶哲轩他们问了一个挑衅的问题:如果信号在某个变换域是稀疏的,你真的需要采那么多吗?

答案是:不需要。如果信号在某个"基"(basis)下只有少数几个非零分量——比如一张自然图在小波基下大部分系数接近零——那么你只需要远少于奈奎斯特要求的采样数,就能通过优化算法精确重建原始信号。

采样即压缩。 不再是"先全量采样再压缩",而是直接以压缩后的形式采样。这个发现让 MRI 的扫描时间从几十分钟降到几分钟,让单像素相机成为可能。

关键不在算法,而在找对基。只要找到了那个让信号稀疏的基,压缩效率就是数量级的提升。

OCR 是文本的"小波基"

把压缩感知的框架套到大模型上,你会看到一个惊人的类比。

大语言模型处理文本的"基"是什么?是 token 序列。一段 1000 字的中文,大约 1500 个 token。每个 token 是一个离散符号,模型要在注意力机制里两两计算它们的关系。这个"基"是冗余的——自然语言里充满了语法冗余、重复结构、可预测的搭配。

DeepSeek-OCR 的核心洞察是:文本信息如果渲染成图像,在视觉模态下是稀疏的。

一张 A4 纸的文档,渲染成 224×224 的图像,经过 ViT 编码器,可能只需要 100 个视觉 token 就能完整表示。因为视觉编码器学到的是空间结构——段落布局、字形轮廓、版式规律——这些结构在视觉空间里高度可压缩。

这就像一段音频在时域里看起来复杂得要命,但变换到频域后只有少数几个主频率。换一个基,冗余就显形了。

DeepSeek-OCR 的流程是这样的:

文本 → 渲染为图像 → DeepEncoder 视觉编码器 → 100个视觉token → MoE解码器 → 还原文本

10:1 压缩比,97% 解码精度。100 个视觉 token 超越了 GOT-OCR2.0 用 256 个 token 的效果,不到 MinerU2.0 所需 7000 个 token 的 1/70。

这不是"OCR 更准了"。这是给文本找到了一种 新的稀疏表示——一种新的压缩基。

为什么大模型急需新的压缩基

理解了压缩基,就理解了为什么大厂集体下场。

Transformer 的注意力机制有个致命的 O(n²) 复杂度。序列长度翻倍,计算量变四倍,显存变四倍。这就是为什么 GPT-4 早期版本上下文只有 8K,Claude 2 突破到 100K 已经是工程奇迹,Gemini 1.5 Pro 的 1M token 上下文需要动用一整套分块、缓存、检索的工程组合。

长上下文是大模型的核心瓶颈。 谁能处理更长的上下文,谁就能做更复杂的 Agent、更深的代码理解、更长的对话记忆、更全的文档分析。

而 OCR 作为压缩基,直接把这个瓶颈从"工程优化"层面拉到了"范式跃迁"层面。一段文本原本要 1000 个 token,现在只要 100 个视觉 token——上下文窗口的有效容量直接扩大 10 倍。

这就是步子哥说的"OCR 是多模态的 Coding"的真正含义。Coding 是把信息从一种表示映射到另一种更紧凑的表示——文本编码、图像编码、音频编码都是 Coding。OCR 不再是"把图里的字识别成文本"的工具,而是"把文本编码成视觉表示"的模态间 Coding

掌握了这种 Coding 的厂商,在未来所有需要处理长文档、长代码、长对话的 AI 应用中——文档智能、AI Agent、代码理解、科研辅助——都会拥有巨大的成本和效率优势。这相当于掌握了 AI 时代的信息高速公路收费权。

大厂布局:不是卷工具,是卡范式

从压缩基的视角看国内大厂的 OCR 布局,你会发现每家都在押不同的路线:

厂商 核心技术特点 代表模型 战略侧重
DeepSeek 光学上下文压缩(DeepEncoder + MoE 解码器) DeepSeek-OCR / OCR-2 长文档高效处理、训练数据生成、模拟人类遗忘
百度 异形框定位、文心大模型赋能 PaddleOCR、PaddleOCR-VL-1.5 通用场景、"歪文档"规模化解析
腾讯 移动端优化、截图识别 腾讯优图 OCR 移动端、证件快速识别
阿里 云端超大批量处理 达摩院 OCR 工业级超大批量文档处理
智谱 AI GLM 多模态底座、CogVIT 编码器 GLM-OCR 政务、金融等 To B 高精度场景
合合信息 行业深度定制 启信宝、名片全能王 票据、证件、档案管理垂直行业
讯飞 大模型语义理解融合 讯飞大模型 OCR 教育、医疗、复杂场景纠错

看这张表的关键不在"谁做得更准",而在谁选的压缩基更优。DeepSeek 的路线最激进——直接把 OCR 重新定义为"光学上下文压缩",不是为了识别,而是为了压缩。其他厂商大多还在"识别工具"的框架里优化精度、速度、场景覆盖。

这是两个层级的竞争。识别工具的竞争是渐进的——准确率从 95% 到 98% 到 99%。压缩基的竞争是阶跃的——从 7000 个 token 到 100 个 token 是 70 倍的跃迁。

百度 PaddleOCR 已经在 GitHub 上超越了谷歌 Tesseract,成为全球最受欢迎的 OCR 项目。但真正的胜负不在 GitHub star 数,而在谁的视觉编码器能成为下一代大模型的标准压缩基

最激进的想法:模拟人类遗忘

DeepSeek-OCR 论文里最让我心跳加速的不是 10:1 压缩比,而是一个看似边缘的设想——模拟人类遗忘机制

做法是这样的:把对话历史按时间切片成一页页"图片"。最近的图片保持高清,越久远的图片越缩越小。令牌数量随时间指数衰减,信息自然模糊。

这意味着什么?模型理论上可以处理"无限长"的上下文,而显存和计算只随"遗忘系数"衰减,而不是随序列长度平方增长。

人类大脑就是这样工作的。昨天的对话清晰如昨,上周的对话只剩轮廓,去年的对话只剩一两个关键意象。这不是缺陷,这是让有限硬件处理无限上下文的工程杰作——进化用了几亿年优化出来的压缩算法。

DeepSeek 把这个机制用光学压缩实现了。对话历史 → 渲染成图片 → 按时间衰减分辨率 → 视觉 token 指数减少。遗忘不再是 bug,是特性。

光计算:压缩基的硬件归宿

DeepSeek 在论文末尾提了一个更远的展望:光计算

这不是科幻。ViT 和 CNN 的底层计算是向量矩阵乘法和卷积——这两种操作天然适合光计算的并行架构。光通过透镜的瞬间就完成了一次傅里叶变换,光通过衍射光学元件的瞬间就完成了一次卷积。不需要时钟频率,不需要逐元素乘法,光本身就在做矩阵运算

如果 OCR 作为压缩基的范式成立,那么下一步就是把视觉编码器从 GPU 搬到光子芯片上。文本 → 渲染成图像 → 光通过透镜 → 光学编码完成 → 光子输出视觉 token。整个压缩过程以光速进行,功耗几乎为零

这可能就是下一代 AI 芯片的路线。不是把 GPU 做得更大,而是把编码器从电域搬到光域。

从"文档理解"到"场景理解"

把视线拉远一点,OCR 的范式跃迁指向一个更大的趋势:多模态大模型正在从"文档理解"走向"场景理解"

文档理解是:给模型一张合同图,让它把条款提取出来。
场景理解是:给模型一个工厂的实时视频流,让它同时理解零件编号、工人动作、生产线状态、异常报警——文本+图像+表格+图表+语音的综合理解。

OCR 在这个跃迁中扮演的角色是文本信息的压缩入口。所有现实场景中的文字——路牌、仪表盘、病历、合同、代码注释——都通过 OCR 这个压缩基进入大模型的表示空间。掌握了这个入口的厂商,就掌握了让 AI "读懂现实"的钥匙。

一个个人的判断

我倾向于认为,DeepSeek-OCR 论文的意义被低估了。人们看到的是"OCR 做得更好了",没看到的是"文本的视觉表示是一种比 token 序列更紧凑的压缩基"。

这件事的意味远不止 OCR。如果视觉模态可以更紧凑地表示文本,那么:

  • 代码可以渲染成语法高亮的图像来压缩——代码的视觉结构(缩进、括号匹配、颜色块)在视觉空间里是稀疏的
  • 对话历史可以渲染成对话气泡图来压缩——说话人轮换、情绪色彩在视觉空间里有天然结构
  • 知识图谱可以渲染成节点连线图来压缩——拓扑关系在视觉空间里一目了然

任何在视觉空间里有结构的文本信息,都可以用 OCR 这个压缩基重新编码。这是步子哥说的"OCR 是多模态的 Coding"的完整含义——Coding 不只是文本到文本的编码,还可以是文本到视觉的跨模态编码

压缩感知告诉我们:找对基,数量级的提升就自然发生。DeepSeek-OCR 找到了一个基。接下来几年,我们会看到更多模态之间的 Coding 被发现——音频到视觉、视频到文本、触觉到语言。每一个新的压缩基,都会引发一次数量级的跃迁。

国内大厂下场 OCR,不是跟风,是嗅到了范式转移的味道。压缩即智能——这句话正在从哲学口号变成工程实践。


参考论文:DeepSeek-OCR: Contexts Optical Compression
理论背景:Compressed Sensing (Candès, Tao, Donoho, 2006)
参考讨论:步子哥关于 OCR 作为多模态 Coding 的洞察

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录