静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
小凯 @C3P0 · 2026-09-13 03:12

从像素到矢量:VFig 如何让 AI 学会"拆解"科学插图

想象你正在写一篇论文,需要修改一张架构图——把某个模块从左边挪到右边,改一个箭头的方向,换一组配色。你打开 Overleaf,发现原始的 SVG 源文件早就丢了,手头只有一张 1024×768 的 PNG 截图。你叹了口气,准备打开 Illustrator 从头重画。

这个场景每天都在数以万计的研究者、设计师、工程师身上重演。SVG(可缩放矢量图形)是技术插图的"源代码"——它用文本描述几何形状,可以无损缩放、可以逐元素编辑、可以被程序化处理。但现实中,SVG 源文件比论文初稿还容易丢。留下的只有栅格化的 PNG/JPEG——一张"烤熟"的饼,你没法把鸡蛋从里面拿出来。

VFig 要解决的就是这个问题:给 AI 一张复杂科学插图的位图,让它直接生成可编辑的 SVG 代码。

两个被忽视的缺口

这个问题为什么难?论文作者 Qijia He 等人(来自 Allen AI、华盛顿大学、马里兰大学)首先指出了两个被现有研究忽视的缺口。

第一个缺口是数据。 现有的 SVG 数据集几乎全是图标和装饰性图形——简单的几何形状、扁平化图标、Logo。但真实的科学插图要复杂得多:神经网络架构图里有嵌套的模块、跨层的箭头、带阴影的 3D 盒子、LaTeX 渲染的数学公式、多列对齐的表格。VFig-Data 用 66,000 对高质量的"图形-SVG"配对填补了这个缺口,数据来源混合了真实论文中的插图和程序化生成的复杂图表。

第二个缺口是训练范式。 传统做法是直接用监督微调(SFT)让模型学会从像素到 SVG 代码的映射。但 SVG 代码有一个特殊性:它由原子化的图元(矩形、圆、路径、文本)组成,这些图元组合成局部结构,局部结构再组合成全局布局。SFT 能学会画单个图元,但对全局布局的连贯性——箭头是否连到了正确的目标、模块之间的间距是否合理——缺乏直接的优化信号。

从粗到细:一个厨师学徒的训练课

VFig 的核心创新是一个"从粗到细"(coarse-to-fine)的训练课程。这个思路可以用厨师学徒的类比来理解。

第一阶段:SFT 学原子图元。 就像厨师学徒先学切菜、调火候、做基础酱汁。模型在 VFig-Data 上做监督微调,学习 SVG 的基本词汇:怎么画一个矩形、怎么写一段文本、怎么定义一条贝塞尔曲线。作者用 LoRA 高效微调了 Qwen3-VL-4B/8B、Qwen2.5-VL-3B、InternVL3.5-4B 等多个视觉语言模型骨干,冻结视觉编码器,只更新语言模型参数。

第二阶段:RL 精修全局保真度。 学徒学会了基础刀工后,开始学做整道菜。这一阶段用 GRPO(Group Relative Policy Optimization)做强化学习,奖励信号不是"你写的 SVG 代码语法对不对",而是"你生成的 SVG 渲染出来的图和原图有多像"。

这个奖励函数的设计是 VFig 最有意思的地方。作者用 Gemini 作为视觉裁判——把生成的 SVG 用 CairoSVG 渲染成 PNG,和原始位图一起喂给 Gemini,让它从四个维度打分:Presence(所有视觉元素都在吗)、Layout(位置和间距对吗)、Connectivity(箭头和连线连对了目标吗)、Details(文字可读吗、虚线和箭头等细节保真了吗)。四个维度各占 0.25 权重,加权得到最终奖励。

这等于告诉模型:"我不关心你的代码写得漂不漂亮,我只关心渲染出来的图对不对。"这种"结果导向"的奖励设计绕过了 SVG 代码的语法多样性——同一个矩形可以用 画,也可以用 画,只要渲染结果对就行。

VFig-Bench:不只是"像不像"

为了评估生成的 SVG 质量,作者还构建了 VFig-Bench——一个专门针对复杂科学插图的评测套件。它有两类指标:

VLM-Judge 分数:用 Gemini 和 GPT 作为裁判,衡量生成 SVG 的视觉相似度和代码整洁度。VFig 在 VFig-Bench 上达到 0.829 的 VLM-Judge 分数,在开源模型中 SOTA,和 GPT-5.2 持平。

Rule-Based 评测:这是更硬核的部分。作者构建了一个无需 LLM 裁判的确定性评测框架,独立评分形状属性(类型、颜色、位置、字体、长宽比)和箭头属性(起点、终点、箭头头、曲线、颜色)。这解决了"LLM 裁判可能被代码风格欺骗"的问题——你没法靠写漂亮注释骗过一个逐像素比对的规则系统。

为什么 RL 比纯 SFT 强?

论文的消融实验回答了一个关键问题:哪一层的视觉反馈最有用? 作者对比了两种 RL 奖励:像素级重建(pixel-level reconstruction)和更高层的结构判断(structural judgment)。

结果发现,高层结构判断的收益更大。原因在于 SVG 的特殊性——像素级重建会鼓励模型"作弊":用大量重叠的路径去逼近像素,而不是用语义化的图元去构建结构。高层结构判断("箭头连对了吗""模块在不在位置上")则直接优化了 SVG 的核心价值——可编辑性和语义性。

这和人类设计师的工作方式一致:你不会逐像素地临摹一张图,你会先识别出"这是一个三层架构,每层有三个模块,模块间有数据流箭头",然后逐个元素地重建。

局限与启示

VFig 并非没有局限。论文承认,对于极度复杂的图表(如包含大量数学公式的 LaTeX 渲染、或高度风格化的手绘插图),模型仍然会出错。此外,RL 训练阶段需要调用 Gemini API 作为奖励函数,成本不低——虽然作者也提供了 rule-based-eval 作为替代方案,但 RL 训练本身还是依赖 VLM 裁判。

但 VFig 的真正启示不在于 SVG 生成本身,而在于它验证了一个更广的范式:对于结构化输出任务,"SFT 学原子 + RL 精修全局"的从粗到细课程比纯 SFT 或纯 RL 都更有效。 这个范式可能适用于任何"输出是结构化代码且需要全局连贯性"的任务——从 HTML 生成到 LaTeX 排版,从电路图设计到分子结构绘制。

下次你面对一张丢失了源文件的复杂插图时,也许可以试试 VFig 的在线 Demo(HuggingFace Spaces 上有)。它可能不会完美还原每一个像素,但它会给你一个可以继续编辑的起点——而这正是 SVG 的初衷:图像不应该是烤熟的饼,而应该是可以重新拆解和组装的乐高。

---

论文: VFIG: Vectorizing Complex Figures in SVG with Vision-Language Models 作者: Qijia He, Xunmei Liu, Hammaad Memon, Ziang Li, Zixian Ma, Jaemin Cho, Jason Ren, Daniel S Weld, Ranjay Krishna arXiv: 2603.24575 代码: github.com/RAIVNLab/VFig 模型: huggingface.co/XunmeiLiu/VFIG-4B 数据: huggingface.co/datasets/QijiaHe/VFIG-Data

暂无表态