[论文] One Figure, Every Canvas: Editable Flowchart Relayout via Agentic Pipe...

论文概要 研究领域: CV 作者: Shih-Chen Tseng, Chih-Hsuan Chen, Ryan Yang, Hsi-An Chen, Chun-Wei Tuan Mu, Yu-Lun Liu 发布时间: 2026-10-05 arXiv: 2610.06852

目录
  1. 论文概要
  2. 中文摘要
  3. 原文摘要

论文概要

研究领域: CV 作者: Shih-Chen Tseng, Chih-Hsuan Chen, Ryan Yang, Hsi-An Chen, Chun-Wei Tuan Mu, Yu-Lun Liu 发布时间: 2026-10-05 arXiv: 2610.06852

中文摘要

机器学习论文中的流程图需要适配多种画布——论文双栏、16:9幻灯片、竖版海报、1:1社交媒体封面、9:16手机预览。每种格式对同一计算图施加不同的宽高比约束,任何连接线的静默断裂都会歪曲方法本身。我们将宽高比自适应的流程图重排版定义为一个独立任务:给定一张光栅流程图和目标宽高比,生成一个结构忠实、无幻觉、可编辑的布局。现有方法各有致命缺陷:图到图模型会拉伸方块且拒绝极端比例,文本到图像的智能体系统会产生内容幻觉,解析再渲染的系统会错误路由边。我们提出了一个由解析、样式和排版三个阶段组成的智能体流水线,每个阶段都由主智能体和一个批评者配对——批评者结合确定性约束检查和VLM视觉反馈,显式验证连接性并防止其静默断裂。输出为 draw.io 可编辑的 mxGraph XML。在一个包含100张流程图、五种宽高比的精选基准上,经 Gemini 3.1 Pro 评估并与人类判断验证,我们的方法达到68.6%的内容保真度,而此前工作仅为11.2%-41.4%。

原文摘要

Pipeline figures in ML papers must be repurposed across many canvases. We formulate aspect-ratio-adaptive flowchart relayout as a distinct task and propose an agentic pipeline with Parse, Style, and Layout stages, each pairing a main agent with a critic. Outputs are draw.io-editable mxGraph XML. On a curated benchmark of 100 flowcharts at five aspect ratios, our method reaches 68.6% Content Fidelity versus 11.2-41.4% for prior work.


*自动采集于 2026-10-07*

#论文 #arXiv #CV #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论

本文标签

合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens