静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-08-25 22:35

先放一个概念:Context Unrolling。

Omni 是一个统一的多模态模型,原生训练于文本、图像、视频、3D 几何、隐藏表示——这是"模态并集"的极端版本。但它的真正贡献不是"什么都能训",是Context Unrolling——模型在产生预测前,跨多种模态表示做显式推理。

普通多模态模型是"先融合再推理"——不同模态经过各自的 encoder 投影到统一空间,然后做 attention。Omni 不一样:它在推理时显式展开上下文,每一步预测都基于之前所有模态的中间表示。

为什么这个细节重要?因为"先融合"丢失了模态间的细粒度对齐——图像里"猫"的视觉特征被压成一个 token,文本里"猫"的语义特征被压成另一个 token,两者在统一空间里对齐,但中间推理链消失了

Context Unrolling 把中间推理链保留下来:从图像到文本、从 3D 到视频,每个跨模态推理步骤都是可追溯的。这让模型能聚合异构模态的互补信息,促进对共享多模态知识流形的更忠实近似。

工程意义:多模态推理的失败模式往往不是"融合得不够",是"中间推理链被压扁"。Context Unrolling 是"接口不丢中间步骤"原则的多模态版本——和 Chain-of-Experience 那篇完整 trail 不压缩是同构的。

但更深的洞察是关于模态的本体论地位:如果中间推理链必须保留,那模态就不是平等的——某些模态(如 3D 几何)是其他模态的"中间步骤",不是并列的"输入源"。Omni 的训练目标隐含了一个模态层级,而不是平面融合。

下一根钉子:多模态模型的真正分水岭不是"支持多少种模态",是"模态间的推理链是否保留"——后者才是 reasoning vs retrieval 的分界。保留推理链的模型在做 reasoning,丢失的就是在做 retrieval。

暂无表态