论文概要
研究领域: CV
作者: Pouria Mahdi, Haq Nawaz Malik
发布时间: 2026-07-24
arXiv: 2507.18395
中文摘要
尽管波斯语在多个国家有超过1.1亿人使用,但波斯语的光学字符识别(OCR)仍然比拉丁字母语言远不成熟。这一差距源于两个基本挑战:波斯-阿拉伯书写系统的内在复杂性和大规模高质量注释数据集的有限可用性。波斯文字表现出强制性的草书连接、上下文相关的字形塑造、广泛的连字、变音符号放置以及跨书写形式(如Naskh和Nastaliq)的风格变化,所有这些都显著复杂化了文本识别。同时,手动注释的高成本和劳动密集型性质造成了持续的数据瓶颈,限制了鲁棒OCR系统的发展,并减缓了波斯语文档数字化的进展。在本文中,我们介绍了Persian Pixel,一个专门为解决这些挑战而设计的综合合成OCR数据集。该数据集包含超过343,000个高保真图像-文本对,涵盖句子、段落和全页文档布局,使用SynthOCR-Gen渲染框架从精心策划的700万词波斯语料库生成。生成管道忠实建模波斯文字的排版特征,包括上下文字符连接、位置字形变体、变音符号放置和多种代表性波斯字体。为弥合合成到真实的领域差距,渲染图像进一步用超过25个随机退化模型丰富,模拟真实的文档采集伪影,包括墨水渗透、纸张老化、模糊、光照变化、扫描仪缺陷、压缩伪影和多种噪声过程。通过克服长期存在的注释波斯OCR数据稀缺问题,Persian Pixel为训练和微调现代OCR架构(包括基于transformer的模型如TrOCR和Donut)提供了可扩展且公开可用的资源。该数据集为波斯语文档分析、历史手稿数字化和端到端文档理解研究建立了坚实的基础,同时证明了程序化合成数据生成为推进低资源和排版复杂脚本的OCR提供了实用、成本效益高且可扩展的替代手动注释的方案。
原文摘要
Optical Character Recognition (OCR) for Persian remains substantially less mature than for Latin-script languages despite Persian being spoken by more than 110 million people across multiple countries. This gap arises from two fundamental challenges: the intrinsic complexity of the Perso-Arabic writing system and the limited availability of large-scale, high-quality annotated datasets. Persian script exhibits obligatory cursive connectivity, context-dependent glyph shaping, extensive ligatures, diacritic placement, and stylistic variation across writing forms such as Naskh and Nastaliq, all of which significantly complicate text recognition. At the same time, the high cost and labor-intensive nature of manual annotation have created a persistent data bottleneck, limiting the development of...
自动采集于 2026-07-24
#论文 #arXiv #CV #小凯
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。