OvisOCR2 Technical Report
arXiv · HuggingFace · ▲52
摘要(原文)
We introduce OvisOCR2, a 0.8B document parsing model. OvisOCR2 is designed as an end-to-end parser: given a document page image, it generates a Markdown representation in natural reading order, covering text, formulas, tables, and visual regions. We build a data engine that combines filtered real-document annotations with synthetic pages whose rendered images and Markdown targets are derived from the same HTML source. The training recipe includes supervised fine-tuning, reinforcement learning on a 4B branch with a multi-component reward design, on-policy distillation into the 0.8B model, and model fusion. On OmniDocBench v1.6, OvisOCR2 achieves a state-of-the-art overall score of 96.58, placing an end-to-end model at the top of this leaderboard previously dominated by pipeline methods and highlighting the potential of end-to-end document parsing. On PureDocBench, OvisOCR2 also achieves the highest Avg3 score of 75.06. Beyond these two public benchmarks, we evaluate OvisOCR2 on an in-house benchmark designed to cover a broader set of long-tail and challenging scenarios. OvisOCR2 obtains the best overall performance among the compared methods, providing further evidence of its generalization and robustness. OvisOCR2 is available at https://huggingface.co/ATH-MaaS/OvisOCR2.
摘要(中译)
我们介绍了OvisOCR2,这是一个0.8B文档解析模型。OvisOCR2被设计为一个端到端的解析器:给定一个文档页面图像,它按自然阅读顺序生成Markdown表示,涵盖文本、公式、表格和视觉区域。我们构建了一个数据引擎,该引擎将过滤后的真实文档注释与合成页面相结合,这些合成页面的渲染图像和Markdown目标都是从同一HTML源派生的。训练方法包括监督微调、在具有多组件奖励设计的4B分支上进行强化学习、将策略蒸馏到0.8B模型中以及模型融合。在OmniDocBench v1.6上,OvisOCR2实现了96.58的整体最高分,使端到端模型在这个此前由管道方法主导的排行榜上名列前茅,并突显了端到端文档解析的潜力。在PureDocBench上,OvisOCR2也实现了最高的Avg3分数75.06。除了这两个公共基准测试之外,我们还在一个内部基准测试上评估了OvisOCR2,该基准测试旨在覆盖更广泛的长尾和具有挑战性的场景。OvisOCR2在比较的方法中获得了最佳的整体性能,进一步证明了其泛化能力和鲁棒性。OvisOCR2可在https://huggingface.co/ATH-MaaS/OvisOCR2上获取。
背景剖析
背景剖析
技术背景:文档解析技术旨在将视觉丰富的文档图像(如扫描件、PDF或照片)转化为机器可理解的结构性格式(如Markdown)。这类技术广泛应用于数字化办公、知识管理、搜索引擎索引等场景,核心需求是准确提取文本、表格、公式等内容,并保留其原始布局和阅读顺序。例如,企业需要将纸质合同转为可搜索的电子文档,学术平台需从论文图像中提取结构化数据供检索。
之前的问题:现有方法分为两类:
1. 流水线方法:分步骤处理(先分析布局,再识别内容,最后合并),虽在主流基准测试中表现较好,但部署复杂且易出错。例如,若表格边界识别错误,后续步骤无法修正;不同模块的运行时负载不均,增加系统开销。
2. 端到端方法:用单一模型直接生成结果,部署更简单,但性能落后于流水线方法。此前端到端模型的局限性在于难以处理长文档、复杂布局(如嵌套表格)或手写内容,导致在公开基准上得分较低。
本文的解法:OvisOCR2提出了一种优化的端到端方案:
- 数据引擎:结合真实文档标注与合成数据(通过HTML模板生成图像和对应Markdown),提升模型对多样场景的适应性。
- 训练策略:采用监督微调、强化学习(基于4B参数模型)、策略蒸馏(压缩至0.8B)和模型融合,平衡性能与部署效率。
- 目标:在保持模型轻量化的同时,超越当前领先的流水线方法。
切入角度:与前人工作相比,OvisOCR2的关键差异在于:
1. 端到端设计的性能突破:首次在主流基准(如OmniDocBench)上用单一模型超越流水线方法。
2. 轻量化与高效训练:基于Qwen3.5-0.8B小模型实现SOTA结果,适合资源受限场景。
3. 综合数据策略:通过合成数据弥补真实标注的不足,增强模型鲁棒性。
这一工作证明了端到端模型在文档解析中的潜力,为实际应用提供了更高效的解决方案。









