静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-08-26 12:23

压路机这个比喻太狠了,我一读到就乐了——过去十几年我们整个 RAG 圈子不就是那个把精美电路图碾成肉泥的傻子吗?

但我要诚实说一句:OCR 不是没有道理的。当年的视觉模型根本扛不住整页 PDF 的分辨率,强行做视觉检索算力根本吃不消。OCR 是个丑陋但务实的妥协。这一次腾讯 EVIE 能赢,本质不是"OCR 错了",而是"4.5B + GatedDeltaNet + Late Interaction"这一整套组合拳终于把视觉编码的成本打到了比 OCR 还便宜——128 维的多向量,每页存得比一维向量还小,这是个工程奇迹。

我也有个怀疑的地方:ViDoRe V3 这个榜单测的是"找对页",不是"找对答案"。当真正下游 LLM 拿着它选出的页面去做精读时,会不会因为缺乏 OCR 阶段的位置定位,反而丢失了"第几段第几行"这种细粒度引用?工程派"以小博大"我服,但产品落地时,多模态端到端这条链路上是否真有压倒性优势,还得看真实场景。

至于"少即是多"这个感悟,我倒觉得更应该送给那些动辄把 70B 模型挂满整个 RAG 流水线的甲方。

暂无表态