一、研究目标与定位
OvisOCR2 是一个参数规模仅为 0.8B 的端到端文档解析模型。其核心任务是将文档页面图像直接转换为结构化的 Markdown 格式,涵盖文本、公式、表格和视觉区域,并保持自然阅读顺序。研究的核心目标是:用一个小型端到端模型,超越当前由多阶段流程化方法主导的文档解析排行榜,实现更优雅、更易部署的解析方案。
二、技术路线与创新点
1. 数据引擎(双管道设计)
| 管道 | 数据来源 | 核心作用 |
|---|---|---|
| 真实数据管道 | 使用 PaddleOCR-VL 和 MinerU2.5 解析真实文档,经规则归一化与人工抽查过滤 | 提供自然布局、多样视觉条件和真实噪声 |
| 合成数据管道 | 从困难样本挖掘 HTML 模板,经代理多样化扩展,同源渲染图像与生成标注 | 确保标注精确,扩展长尾覆盖(复杂表格、密集公式、多列布局等) |
关键创新:合成数据严格遵循“真值来源”原则——图像和标注均来自同一 HTML 源,避免了解析器引入的标注噪声。
2. 四阶段训练流程
SFT(监督微调)→ RL(强化学习,4B分支)→ OPD(策略内蒸馏,到0.8B)→ 模型融合
| 阶段 | 核心内容 |
|---|---|
| SFT | 在混合数据上训练 0.8B 和 4B 模型,建立基础解析能力 |
| RL(GRPO算法) | 在 4B 分支上使用多组件奖励(文本编辑距离 + 公式CDM + 表格TEDS),针对困难样本优化结构化生成 |
| OPD(策略内蒸馏) | 将 4B 教师的对齐行为迁移到 0.8B 学生,避免紧凑模型直接 RL 的不稳定性;采用 Top-K 反向 KL 散度,显著降低计算成本 |
| 模型融合 | 对多个候选变体进行加权参数平均,得到最终模型 |
关键洞察:直接对 0.8B 做 RL 会导致 KL 漂移和表格质量下降,因此采用“大模型学奖励 → 蒸馏给小模型”的策略。
三、主要实验结果
1. OmniDocBench v1.6(公共基准)
| 指标 | OvisOCR2 成绩 | 对比亮点 |
|---|---|---|
| 整体得分 | 96.58(SOTA) | 超越所有流程化方法(PaddleOCR-VL-1.6: 96.33)和端到端方法 |
| 文本编辑距离 | 0.025(最低) | — |
| 公式 CDM | 97.53(最高) | — |
| 表格 TEDS | 94.76(并列最高) | — |
| 阅读顺序编辑距离 | 0.111(最低) | — |
2. PureDocBench(跨退化场景)
| 轨道 | OvisOCR2 成绩 | 排名 |
|---|---|---|
| Clean(干净渲染) | 81.55 | 第1 |
| Digital(数字退化) | 77.09 | 第1 |
| Real(真实再捕获) | 66.56 | 低于部分通用 VLM |
| Avg3 | 75.06(SOTA) | 第1 |
结论:在干净和数字退化场景下表现卓越,但对真实世界图像退化的鲁棒性仍有提升空间。
3. 内部基准(涵盖手写体与复杂表格)
| 场景 | 整体得分 | 关键发现 |
|---|---|---|
| 全量基准 | 85.54(最高) | 所有指标全面领先 |
| 手写体子集 | 72.28(最高) | 文本编辑距离最低(0.1561),公式 CDM 最高(81.51) |
| 复杂表格子集 | 83.97(最高) | 表格缺失率仅 7.96%,而流程化方法高达 13%~17% |
重要发现:流程化方法在布局解析阶段会遗漏 13%-17% 的表格,且该错误无法被下游识别器恢复,这是端到端方法的显著优势。
四、核心贡献总结
| 维度 | 贡献 |
|---|---|
| 模型设计 | 首个以 0.8B 端到端模型超越流程化方法 SOTA 的文档解析器 |
| 数据策略 | 构建了“真实+合成”双引擎数据管道,合成数据采用同源渲染确保标注零噪声 |
| 训练方法 | 提出“4B RL 学习 + OPD 蒸馏到 0.8B”的稳定训练范式,解决紧凑模型直接 RL 不稳定的问题 |
| 性能成果 | 在 OmniDocBench 和 PureDocBench 上均取得 SOTA,手写体和复杂表格场景表现突出 |
| 部署价值 | 端到端单模型设计简化部署,表格缺失率远低于流程化方法 |
五、未来方向
报告明确指出后续工作将聚焦于:
-
提升对退化真实世界图像(如拍照、复印、压缩截图)的鲁棒性
-
进一步强化在手写体密集和复杂表格文档上的解析性能
这里是自己的论文阅读记录,感兴趣的话可以参考一下,如果需要阅读原文的话可以看这里,如下所示:

模型权重发布地址在这里,如下所示:

摘要
我们推出 OvisOCR2,一个 0.8B 参数的文档解析模型。OvisOCR2 被设计为一个端到端解析器:给定一个文档页面图像,它能按照自然阅读顺序生成 Markdown 表示,涵盖文本、公式、表格和视觉区域。我们构建了一个数据引擎,该引擎结合了经过筛选的真实文档标注和合成页面,其中合成页面的渲染图像和 Markdown 目标均源自相同的 HTML 源码。训练流程包括监督微调、在 4B 参数分支上结合多组件奖励设计的强化学习、将策略蒸馏到 0.8B 模型,以及模型融合。在 OmniDocBench v1.6 上,OvisOCR2 取得了 96.58 的整体得分,创下了新的最佳成绩,将一个端到端模型推到了此前由流程化方法主导的排行榜首位,凸显了端到端文档解析的潜力。在 PureDocBench 上,OvisOCR2 也以 75.06 的 Avg3 得分拔得头筹。除了这两个公开基准外,我们还在一个内部基准上对 OvisOCR2 进行了评估,该基准旨在覆盖更广泛的长尾和具有挑战性的场景。OvisOCR2 在对比方法中取得了最佳的整体性能,为其泛化能力和鲁棒性提供了进一步的证据。

图 1:OvisOCR2 在 OmniDocBench v1.6 上的性能
1 引言
文档解析将富视觉文档图像转换为结构化的、机器可读的表示。这项任务超越了纯 OCR,不仅需要保留文本内容,还需要保留页面组织、阅读顺序、表格、公式、图形、页眉、页脚以及其他依赖于布局的元素。解析后的页面通常用 Markdown 表示,以便于下游应用进行索引、检索和使用 [1, 2, 3, 4, 5]。我们研究的是页面级别的图像到 Markdown 的设定,即模型处理文档图像并生成该页面的统一 Markdown 表示。
当前处理此任务的方法分为两大类。流程化方法将页面分解为布局分析、区域级内容识别和页面级合并 [3, 6, 5]。它们在主流文档解析排行榜(如 OmniDocBench v1.6 [1, 7])上仍然表现强劲,截至撰写本报告时,排名前三的方法均基于流程。然而,这种设计使部署变得复杂。布局解析和内容识别通常作为独立模型部署,往往具有不同的运行时负载。错误也会在各个阶段累积:遗漏的表格边界、不精确的公式裁剪或错误的阅读顺序分配,都无法被下游识别器完全修正。端到端方法则采取相反的路径,使用单一模型一次性读取文档页面图像并生成 Markdown 表示 [8, 9, 10]。这种一次性设计简化了部署,并允许模型在生成过程中依赖页面级的上下文信息。尽管如此,现有的端到端方法在主流基准上的解析性能仍落后于流程化方法。
我们认为端到端方法更为优雅,并通过对 Qwen3.5-0.8B(Qwen3.5 系列中最小的模型 [11])进行后训练,开发了 OvisOCR2 作为一个紧凑型文档解析器。我们的目标是在保持较小部署规模的同时,实现最先进的文档解析性能,使用单个端到端模型超越当前在公共排行榜上领先的流程化方法。使用紧凑型骨干网络实现这一目标,需要精心设计的数据引擎和适合长输出的训练方案。数据引擎结合了真实文档和合成页面。真实文档的标注由专用解析器生成,归一化为统一的 Markdown 架构,并通过基于规则的过滤和子集级抽查进行清理。合成页面生成始于从具有挑战性的样本构建的 HTML 模板;相同的 HTML 源码用于渲染文档图像和生成 Markdown 标注。训练过程包括监督微调、在 4B 分支上的强化学习训练、将策略蒸馏到 0.8B 模型,以及模型融合。
我们在两个公共基准和一个内部基准上评估了 OvisOCR2。在 OmniDocBench v1.6 [1, 7] 上,OvisOCR2 取得了 96.58 的整体得分,创下新的最佳成绩,并将端到端解析器推到了该排行榜上领先的流程化方法之前。在 PureDocBench [2] 上,OvisOCR2 也以 75.06 的 Avg3 得分排名第一。为了补充这些公共基准,我们构建了一个包含 1000 多页的内部基准,涵盖了更广泛的文档场景。OvisOCR2 在此基准上取得了最高整体得分,并在所有三个难度等级上均领先。特别是在手写体和复杂表格文档上(这两者在实际工作流中既难以解析又很常见),OvisOCR2 在相应子集上展现了最强的整体性能。
2 数据引擎
训练端到端文档解析器需要在多个层面都精确的监督信号:细粒度的文本转录、结构有效的序列化、表格和公式的忠实恢复,以及全局连贯的阅读顺序。这些要求使得数据准备本身成为系统设计的关键部分。单一数据源是不够的:真实世界的文档提供自然的布局和多样的视觉条件,但其标注存在噪声且难以标准化;合成文档提供可控的训练目标和可扩展的覆盖范围,但如果简单合成,可能缺乏真实感。为了解决这个问题,我们构建了一个由两个互补流程组成的数据引擎:真实数据流程和合成数据流程,如图 2 所示。
-
真实数据流程。此流程将大规模的真实世界文档图像转换为可靠的文档到 Markdown 训练数据。它使模型接触到真实世界的视觉分布,包括多样的模板、扫描质量、字体风格、语言、布局结构、表格、公式、图形和其他异构文档元素。
-
合成数据流程。此流程通过合成具有精确真实标注的可控文档样本来补充真实世界数据。其作用是扩展训练分布的长尾覆盖范围,特别是针对在自然收集的文档中代表性不足的罕见或困难案例,例如表格拓扑结构、密集的公式-文本交错、极端的多列布局和长 Markdown 输出。

图 2:数据引擎架构
2.1 真实数据流程
真实数据流程通过转换和过滤将文档图像转化为训练数据。它首先从 OCR 解析器获取结构化输出,将其归一化为通用的 Markdown 架构,然后通过基于规则的检查和子集级抽查来过滤生成的 Markdown 输出。在此过程中,解析器的输出被用作结构化候选,而非最终标签;在数据进入训练语料库之前,应用确定性转换和保守过滤,以提高序列化一致性和结构有效性。
2.1.1 基于规则的结构化解析和 Markdown 序列化
对于每个文档图像,真实数据流程使用专门的 OCR 解析器(PaddleOCR-VL-1.5 [12] 或 MinerU2.5-Pro [6])来获取结构化解析结果。我们并非直接使用这些系统生成的原始 Markdown 字符串,而是解析其结构化 JSON 响应,并通过特定于源的规则将其转换为统一的 Markdown 格式。每个解析器输出被视作一个有序的块列表,其中每个块包含其类别、识别内容、边界框和可选的解析器特定元数据。然后,数据引擎应用一个 JSON 到 Markdown 的转换器来归一化这些异构的块结构。
转换规则围绕以下原则设计:
-
严格的类别验证。转换器仅接受预定义的文档类别。MinerU2.5-Pro 的类别被分组为类文本元素、表格、视觉元素(如图像和图表)以及不直接贡献 Markdown 内容的容器类块。PaddleOCR-VL-1.5 使用更广泛的布局词汇,涵盖标题、段落、公式、表格、图形、页眉、页脚、印章、脚注、竖排文本和其他文档区域。未知或不支持的类别将被拒绝,而不是被静默忽略,从而降低损坏的标注进入训练集的风险。
-
文本块归一化。内容为空或包含不可读占位符的类文本块将被跳过,并由过滤标志记录。对于 MinerU2.5-Pro,标记为
merge_prev的相邻文本块会被保守地合并:仅当存在有效的前一个文本块且当前内容非空时才进行合并。中文文本直接连接,而非中文文本则用空格分隔。对于标题块,转换器还会根据编号模式(如十进制章节索引、罗马数字、字母标记和中文章节标记)推导 Markdown 标题级别,同时避免将类似年份的数字标题过度提升。 -
公式归一化。数学表达式被归一化为统一的 LaTeX 风格 Markdown 表示。对于 MinerU2.5-Pro,行内包装如
\(...\)转换为$...$,显示包装如\[...\]转换为$$...$$。移除数学定界符内部的多余空格,折叠数学包装内的换行符,并在转换期间保护转义后的美元符号。代码块和内联代码范围不进行公式重写。对于 PaddleOCR-VL-1.5,转换器在块连接后应用轻量级后处理,以修剪单美元符号行内公式内部的空间。 -
表格归一化。表格块必须包含有效的 HTML 表格结构。空表、非表格内容、格式错误的表格输出或重复的尾部片段将被过滤掉。MinerU2.5-Pro 的表格在
border属性缺失时,通过添加border="1"到<table>标签进行归一化。PaddleOCR-VL-1.5 的表格通过移除不必要的 HTML 样式属性进行清洗。
-
视觉区域归一化。视觉区域,如图形、图表、页眉图像和页脚图像,以 HTML 图像标签表示,而非文本描述。它们的边界框被归一化到范围 [0,1000][0,1000],并序列化为
<img src="images/bbox_left_top_right_bottom.jpg" />。 -
解析器特定的高风险案例。某些类别需要额外验证。例如,PaddleOCR-VL-1.5 的印章和图形标题区域可能被包装在类似 HTML 的容器中;转换器从这些容器中提取纯文本,并拒绝空结果。印章块还会根据布局置信度进行检查,以移除不可靠的检测结果。
在块级归一化之后,所有有效的块内容按照解析器提供的块顺序,使用双换行符连接。转换器还会应用预过滤检查,以移除没有有效文本内容、源图像重复、明显尾部重复或其他严重解析器端失败的样本。生成的 Markdown 仍不被视为最终训练数据。基于规则的归一化和预过滤可以移除明显的格式和解析器故障,但它们无法完全验证内容是否与源图像匹配。因此,我们在保留样本用于训练之前,进一步引入了一个抽查阶段,以评估内容对应性和全局一致性。
2.1.2 人工抽查和子集过滤
我们根据数据源、解析器类型、文档领域和转换配置来组织候选数据集。对于每个数据集子集,我们随机抽样文档-Markdown 对,并将转换后的 Markdown 与原始文档图像进行人工比对。检查旨在验证序列化的 Markdown 是否与源图像在以下维度匹配:
-
文本对应。检查 Markdown 输出是否保留了图像中的文本内容,无缺失、插入或识别错误。
-
公式准确性。根据 LaTeX 语法渲染公式,并检查渲染结果是否与图像中的公式匹配。
-
表格对齐。检查表格行、列、表头和单元格内容是否与原始表格对应,特别是对于密集表格和合并单元格。
-
视觉区域对齐。将 HTML 图像标签中编码的边界框渲染到原始文档图像上,检查它们是否覆盖了预期的图形或图表。
-
阅读顺序一致性。检查采样输出是否遵循自然的阅读顺序,特别是在多列页面以及文本、公式、表格和视觉区域密集混合的页面上。
此阶段有意设计得较为保守。目标不是通过自由形式生成来重写或修复转换后的标注,而是防止低质量数据子集污染训练语料库。当一个子集仅包含偶尔的轻微错误时,我们将其与基于规则转换期间应用的样本级过滤器一起保留。相反,当一个子集表现出频繁错误时,将其从训练语料库中移除。
2.2 合成数据流程
合成数据流程遵循“真值来源”原则,即从相同的 HTML 源生成文档图像及其 Markdown 目标,而不是通过解析渲染后的图像来推导目标。这种设计使得训练目标是确定性的,并避免了合成标签中的解析器衍生噪声。该流程首先通过多方面评估来挖掘困难样本,使用多模态模型将挖掘到的困难样本转换为初始 HTML 模板,采用基于代理的生成过程将其扩展为多样化的 HTML 页面,从结构化源推导 Markdown 真实值,使用 Playwright [13] 渲染文档图像,并在质量检查后最终将生成的图像-文本对打包为训练数据。
2.2.1 用于 HTML 模板生成的困难样本挖掘
合成数据流程从困难样本挖掘开始。我们并非随机合成通用文档页面,而是首先从多方面评估中识别的失败案例中收集困难样本。当这些样本揭示了代表性不足的文档模式时,例如表格密集型布局、不规则的文档结构、页眉/页脚干扰、手写区域、页码歧义和复杂的阅读顺序模式,它们就会被选中。
每个挖掘到的困难样本不仅被视为一个孤立的失败,而且被视为一种可复用的合成模式的证据。我们分析失败背后的视觉和结构因素,并将具有相似排版、表格结构、页面组织和定位要求的样本分组到同一个合成家族中。这种分组允许一个模板覆盖一类相关的失败模式,而不是过度拟合单个页面。
给定一个代表性的困难样本或一组相似的困难样本,我们使用多模态模型来推断文档的视觉和结构意图。该模型将观察到的困难样本转换为一个初始的 HTML 模板,该模板保留了后续多样化所需的关键布局结构。对于需要精确定位的元素,模板使用显式的 DOM 范围或元素级包装器,从而在渲染期间能够恢复紧密的边界框。
因此,生成的 HTML 模板并非最终的合成样本,而是挖掘到的困难样本分布的程序化抽象。它保留了在真实失败中观察到的挑战性因素,同时为后续的多样化暴露了可控变量。这种以困难样本为中心的设计将观察到的错误转换为具有清晰训练目标的可扩展文档生成器。
2.2.2 基于代理的 HTML 多样化
获得初始模板后,我们使用基于代理的生成过程将模板扩展为一组多样化的 HTML 页面。该代理编辑和扩展 HTML 模板,同时保留种子模板的视觉特性和结构意图。此过程支持迭代代码优化、有效性检查和受控多样化。
多样化过程在内容和结构两个层面引入随机性。内容层面的变化涵盖语义字段、文本长度、数值、公式和特定领域的术语。结构层面的变化涵盖表格结构、章节层次、页面组织和视觉区域放置。这些变化共同将每个种子模板扩展为一个具有多样化内容和布局配置的合成家族。
为了在多样化过程中保持标签有效,代理受到有效性规则的限制。每个生成的页面必须保持可渲染、视觉上合理、类别合规,并可转换为有效的 Markdown。该流程还维护特定领域的随机化内容池,使合成内容在语义上变化,同时保持生成的标签清晰一致。这确保了合成数据规模大、结构多样且标注可靠。
2.2.3 Markdown 真实值生成
对于每个多样化的 HTML 页面,数据引擎直接从相应的 HTML 源生成 Markdown 真实值。序列化器将源元素映射到目标 Markdown 格式,同时保留其预期的结构和阅读顺序,并为每种元素类型设置单独的规则:
-
文本元素。文本节点、段落、章节标题、列表项、页眉、页脚和脚注被序列化为标准 Markdown 文本。
-
表格。表格元素表示为 HTML 片段
<table>...</table>,以便同时保留单元格内容和表格结构。 -
公式。数学表达式用 LaTeX 风格的 Markdown 序列化。行内公式和显示公式用一致的数学定界符表示,以使目标格式与训练格式兼容。
-
视觉区域。每个视觉区域序列化为一个 HTML 图像标签。坐标从渲染后的 DOM 获取,缩放到 [0,1000)[0,1000),并写为
<img src="images/bbox_left_top_right_bottom.jpg" />。
阅读顺序在页面级别分配。序列化器使用文档类型感知的规则,而不是单一的全局空间启发式规则。对于常规的单列页面,元素主要从上到下、次要从左到右排序。对于多列布局,页面根据模板布局或归一化的边界框划分为列区域;每列内的元素从上到下序列化,列则从左到右遍历。对于结构化元素,如表格、列表、公式和锚定的视觉区域,序列化器保留其内部的 DOM 顺序和模板定义的关联。
2.2.4 文档图像渲染
在生成 Markdown 的同时,相同的 HTML 页面被渲染为文档图像。我们使用 Playwright [13] 进行基于浏览器的渲染,它保留了真实的排版、间距、表格线条、颜色样式、换行行为和页面级布局细节。视口自动调整以适应文档画布,并在必要时应用页面边界处理,以避免无效裁剪、底部区域不完整或掩码伪影。
在渲染过程中,数据引擎从 DOM 中记录需要边界框的元素级几何信息。显式的范围和元素包装器允许流程为文本或视觉元素获取紧密的边界框。这些框被归一化到目标坐标范围,并保持与最终屏幕截图一致。当应用视觉增强(如轻微旋转或其他几何扰动)时,相应的坐标变换也会应用于标签。
2.2.5 迭代质量控制
在规模化生成之前,我们执行预览和迭代过程。首先渲染一小批样本进行视觉检查。检查重点在于合成页面是否在排版、表格布局、页面组织、视觉区域定位和阅读顺序细节方面与预期的困难样本风格匹配。如果观察到布局缺陷,则在扩展之前修改 HTML 模板、代理多样化规则或渲染参数。

图 3:OvisOCR2 的双分支训练。4B 分支生成一个 RL 对齐的教师,而 0.8B 分支通过 SFT、OPD 和模型融合以获得最终模型。
预览通过检查后,流程扩展随机化内容池并规模化生成样本。规模化生成阶段支持多线程渲染,并在适用时写入配对的图像和标签以及增强变体。
质量控制阶段移除渲染或配对失败、Markdown 目标为空或退化、结构错误、定位错误或重复输出的样本。在样本被接纳进入训练数据集之前,验证最终数据集大小(包括图像文件、标签文件、增强变体和元数据记录)是否一致。
通过此流程,我们获得了既可控制又精确的合成 Markdown 训练数据。合成数据流程通过扩展长尾覆盖范围,同时保留清晰的真值和忠实的图像-文本对齐,来补充真实数据流程。
3 训练
3.1 训练流程
端到端文档解析既需要广泛的格式学习,也需要可靠的结构化生成。模型必须将文档页面图像转换为 Markdown 表示,同时保持文本保真度、公式可渲染性、表格结构、阅读顺序和页面级完整性。这些要求超越了令牌级别的模仿监督信号,因为表格、公式和长页面中的许多错误更容易通过结构验证,而非仅通过下一个令牌损失来表达。
因此,我们将训练流程组织为具有不同角色的阶段。监督微调构建初始的端到端文档解析策略;强化学习使用文本、公式和表格奖励在困难页面上进一步改进策略;策略内蒸馏将 4B 教师的奖励对齐行为迁移到可部署的 0.8B 学生模型;模型融合则形成最终模型。
3.2 监督微调
SFT 阶段建立了从文档图像生成 Markdown 表示的基础策略。SFT 使用数据部分描述的完整数据混合。该混合基于真实数据流程处理的真实文档页面,并由合成数据流程的可控样本补充。真实数据贡献自然的布局、扫描质量变化、文档类型和视觉噪声。合成数据增加了表格、公式密集型页面、长 Markdown 输出和其他长尾结构的覆盖范围。因此,此阶段为后续的 RL 和 OPD 阶段提供了广泛的覆盖范围和格式一致性。
我们在相同的文档解析目标上,对 Qwen3.5-0.8B 和 Qwen3.5-4B 模型进行全参数 SFT 训练。0.8B 模型训练两个周期,而 4B 模型训练 20% 个周期以减少较大分支的训练成本。0.8B SFT 检查点初始化可部署的学生分支,而 4B SFT 检查点则作为 4B RL 的基础策略;由此产生的 4B RL 检查点随后用作 OPD 教师。我们使用 16K 的最大序列长度,配合动态图像分辨率预算,在保留细粒度视觉信息的同时,无需将所有页面强制为固定分辨率。
3.3 强化学习
RL 通过对采样输出的奖励信号进一步改进端到端文档解析策略。许多重要的解析错误是结构性的,而非纯粹词汇性的:一个表格可能大部分文本正确,但单元格拓扑结构错误;一个公式作为字符串可能看起来很相似,但无法渲染或表示不同的表达式;长页面可能出现遗漏、重复或截断。这些错误在令牌级别的模仿损失中表现微弱,但可以通过程序化检查、基于渲染的比较和结构感知解析来衡量。
我们使用组相对策略优化(GRPO)[14] 作为主要的 RL 算法。对于每个提示,我们从策略中采样多个响应,并使用可验证的奖励计算组相对优势,而无需训练额外的价值模型。这种形式非常适合文档解析,因为响应长、结构化,并且可以通过文本、公式和表格分析器进行评估。GRPO 训练模型在同一页面的多个输出中偏好更好的候选者,从而强化更完整、稳定和结构有效的生成行为。
3.3.1 策略内困难案例构建
RL 数据的构建方式与广泛的 SFT 混合不同。此阶段主要使用来自合成数据流程的样本,其中真值结构足够精确,以支持文本、公式和表格奖励。保留一小部分高质量的真实文档,以保持自然的页面分布和多样的视觉条件。
训练集通过策略内过滤进一步塑造:我们首先在当前策略上运行候选页面,并使用奖励函数对生成的响应进行评分。非常容易和极其困难的样本提供的有用学习信号很少,而跨响应变化很小的奖励平坦样本对组相对学习帮助不大。因此,训练重点放在模型偶尔能产生明显优于其平均行为响应的页面上。
3.3.2 多组件奖励设计
RL 奖励是为完整的页面输出设计的,避免了将文档解析质量简化为单一的文本相似度分数。标量奖励是根据真值中实际存在的组件(文本、表格和显示公式)计算的。全局有效性检查,如最大长度截断和不可解析结构,作为防护措施应用,将受影响的可用组件得分置零,而不是形成一个独立的奖励项。
表 1 总结了在页面级聚合之前使用的组件得分。CDM 表示字符检测匹配,一种用于公式解析的图像级指标 [15],TEDS 表示基于树编辑距离的表格相似度指标 [16]。在奖励中,CDM 和 TEDS 用作 [0,1] 范围内的归一化得分。
表 1:RL 中使用的奖励组件。


3.3.3 可扩展的多模态 RL 训练
用于文档解析的多模态 RL 训练需要处理长文本响应、页面级图像输入和基于渲染的奖励计算。为了使训练基础设施可扩展,我们应用了以下优化。
首先,奖励计算使用层次化并行和快捷路径。在生成展开(rollout)之后,页面样本由多个奖励工作进程并行评分。在每个工作进程内,公式奖励首先执行匹配和归一化:归一化后的精确匹配直接获得满分,缺失或无效的预测得零分,只有剩余的情况进入 CDM 渲染比较。CDM 计算通过一个可重用的进程池执行,并带有每个任务超时设置,防止少数有问题的公式阻塞工作进程。表格奖励遵循相同原则:归一化后的精确匹配绕过 TEDS,而无效或不可解析的表格得零分。对于长页面或异常输出,页面级匹配器也使用超时回退,以防止匹配成为尾延迟瓶颈。在训练循环中保持奖励性能分析,以便将性能下降归因于匹配、归一化、基于渲染的公式奖励或表格结构评分。
其次,针对高分辨率文档页面优化了多模态输入传输路径。视觉预处理可能产生大的页面级张量,跨工作进程重复传输它们会增加主机端内存压力和通信量。因此,训练使用基于对象存储的引用传递:大型视觉张量存储一次,并由轻量级句柄连同紧凑的元数据引用。策略更新和参考约束计算在需要时检索和组装实际的视觉输入。这减少了传输开销,并防止高分辨率页面或长批次将训练瓶颈转移到序列化和数据移动上。
第三,针对长响应优化了 Actor 更新。我们使用公共前缀掩码,使得同一提示的多个展开中长的共享前缀不会主导损失,从而将梯度集中在生成分支发散后的令牌上。在严格的策略内、单周期更新设置下,系统还避免了额外的旧策略概率传递。这些优化减少了在长页面输出上的 Actor 端计算和内存压力。
3.4 策略内蒸馏
3.4.1 教师引导的策略迁移
一个核心挑战是将 4B RL 模型学习到的奖励对齐解析行为迁移到适合部署的紧凑型 0.8B 模型。4B 分支具有更大的容量,可以更稳定地吸收奖励信号,而紧凑型分支对长结构化输出的高方差更新更为敏感。在我们初步的直接 RL 比较中,将相同的 RL 阶段直接应用于紧凑型模型显示了更大的 KL 漂移和较不稳定的表格质量,尤其是在密集页面和复杂布局上。

图 4:4B RL 与 0.8B RL 的训练稳定性比较。(a) 报告了 Actor KL 损失,浅色迹线显示原始每步值,粗曲线显示 15 步中心滚动平均值。(b) 报告了验证集上的表格 TEDS。
如图 4 所示,直接进行 0.8B RL 在训练后期表现出更高的策略发散性,并且与 4B RL 模型相比,表格质量相应下降。因此,我们使用 RL 增强的 4B 模型作为 0.8B 学生的教师。
学生在其当前策略下生成完整的页面输出,教师通过令牌级分布监督 [17, 18] 来评估这些策略内轨迹。紧凑型模型因此通过分布匹配接收教师对表格、长公式和密集布局的解析偏好,减少了将学生暴露于另一个高方差 RL 阶段的需求。


3.4.2 高效的 OPD 训练
全词汇蒸馏对于文档解析来说成本很高,因为页面级响应很长。对于长度为 T、词汇量为 V 的响应,在每个响应位置匹配教师和学生分布需要 T×V 个对数概率张量。通过将对齐限制到学生的 Top-k 支持集 St,主要的张量大小从 O(TV) 减小到 O(Tk)。
教师评分在学生生成的轨迹上执行。学生展开后,我们在每个响应位置保留 Top-k 个令牌 ID,并查询教师在同一提示-响应前缀下的对数概率。学生更新使用相同的令牌 ID。在学生前向传播期间,仅收集 OPD 损失所需的选定 logits,并对长响应使用分块投影以减少峰值内存。
3.5 模型融合
我们通过改变数据混合和训练配置,训练了几个候选的 OvisOCR2 变体。然后,我们应用加权参数平均 [20] 进行模型融合,生成最终的 OvisOCR2 模型。
4 评估
在本节中,我们通过与一系列广泛的文档解析模型进行比较来评估 OvisOCR2 的有效性,这些模型分为通用 VLM 和专用 VLM。我们进一步按推理范式划分专用 VLM。流程组包括领先的方法,如 PaddleOCR-VL-1.6 [3]、GLM-OCR [5] 和 MinerU2.5-Pro [6],它们结合了布局分析和区域级解析。端到端组,包括 OvisOCR2,则从页面级图像一次性输出 Markdown 表示。我们在两个公共文档解析基准 OmniDocBench v1.6 [1] 和 PureDocBench [2] 以及一个专注于复杂文档场景的内部基准上进行评估。我们还在附录 A 中提供了定性比较。
表 2:OmniDocBench v1.6 比较。公共排行榜得分来自 OpenDataLab [7];PaddleOCR-VL-1.6、Unlimited-OCR 和 HunyuanOCR-1.5 的得分来自其技术报告 [3, 9, 8]。RO 表示阅读顺序。

4.1 OmniDocBench v1.6
OmniDocBench v1.6 [1] 是页面级文档解析最广泛采用的公共基准,涵盖 10 种文档类型、5 种布局类型和 5 种语言类型的 1,651 个 PDF 页面。与早期的 v1.5 协议相比,v1.6 优化了公式评估中的元素匹配,并引入了结构复杂页面的困难子集,从而在强方法之间产生了更具区分度的排名。该基准联合评估四个维度:文本转录(通过归一化编辑距离衡量)、公式识别(字符检测匹配,CDM [15])、表格重建(树编辑相似度,TEDS 和 TEDS-S [16])以及阅读顺序恢复(块序列上的编辑距离)。整体得分通过计算由归一化编辑距离转换而来的文本得分、公式 CDM 和表格 TEDS 的平均值获得。
如表 2 所示,在 OmniDocBench v1.6 上,OvisOCR2 以紧凑的 0.8B 模型取得了 96.58 的整体得分,创下新的最佳成绩。它超越了领先的流程化方法,包括 PaddleOCR-VL-1.6、MinerU2.5-Pro 和 GLM-OCR,并比之前最好的端到端方法提高了 1.84 分。在各个指标上,OvisOCR2 报告了最低的文本编辑距离、最高的公式 CDM 得分、并列最高的 TEDS 得分、最高的 TEDS-S 得分以及最低的阅读顺序编辑距离。
4.2 PureDocBench
PureDocBench [2] 通过源可追溯的评估数据补充了 OmniDocBench:文档图像从 HTML 源渲染,标注从同一源生成,而非从渲染图像转录。它评估了在 Clean(干净)轨道(渲染页面)、Digital(数字)轨道(退化图像)和 Real(真实)轨道(物理或屏幕介导的再捕获,包括手机拍摄页面、复印件、屏幕摄影和压缩截图)上的鲁棒性,涵盖 10 个领域和 66 个子类别的 1,475 个页面,总计 4,425 张图像。
表 3:PureDocBench 比较。Clean、Digital 和 Real 列报告的是每个轨道的整体得分;Avg3 是它们的平均值。公开得分转录自 PureDocBench 主表 [2]。

如表 3 所示,OvisOCR2 取得了 75.06 的 Avg3 得分,创下新的最佳成绩。它在干净和数字轨道上也排名第一。在真实轨道上,OvisOCR2 仍低于 Gemini-3.1-Pro 和 Qwen3.5-122B-A10B 等强大的通用 VLM,这表明对退化真实世界图像的鲁棒性仍是未来工作的重要方向。
4.3 内部基准
尽管现有的公共基准涵盖了广泛的文档布局,但它们的数据分布并未完全反映实际工作流中遇到的文档的异质性和视觉噪声。
表 4:内部基准结果。表 5:按难度等级划分的内部基准整体性能。表 6:内部基准手写体子集结果。

表 7:内部基准复杂表格子集结果。MR 表示缺失率,定义为解析输出中缺失表格的比例。

示例包括特定领域的表单、带印章的扫描报告、带手写注释的印刷模板以及具有不规则合并单元格的表格等。为了对 OvisOCR2 进行更全面的评估,我们按照 OmniDocBench v1.6 的评估协议构建了一个内部基准。该基准包含 1000 多页,跨越了广泛的文档类型。
在 OvisOCR2 的开发过程中,我们发现手写体和复杂表格是实际工作流程中经常遇到的两个具有挑战性的文档场景。因此,除了完整基准外,我们还分别报告了在手写体和复杂表格子集上的结果。
如表 4 所示,OvisOCR2 在内部基准上取得了最高的整体得分,并在文本、公式、表格和阅读顺序指标上均表现出一致的领先性能。我们进一步按解析难度划分基准。如表 5 所示,OvisOCR2 的优势在简单、中等和困难层级上均得以保持。
表 6 和表 7 总结了手写体和复杂表格的结果。在手写体方面,虽然 GLM-OCR 获得了更高的表格 TEDS 得分,但 OvisOCR2 实现了最高的整体得分、最低的文本编辑距离、最高的公式 CDM 得分和最低的阅读顺序错误。在复杂表格子集上,OvisOCR2 获得了最高的整体得分、最高的 TEDS 和最低的缺失率。缺失率的比较尤其能说明问题:流程化方法在布局解析期间遗漏了 13−17% 的表格,而这个错误是下游识别器无法挽回的。
5 结论
在本报告中,我们介绍了 OvisOCR2,一个用于页面级文档解析的紧凑型 0.8B 端到端模型。我们构建了一个数据引擎,该引擎结合了经过筛选的真实文档标注和源对齐的合成页面,并采用了包括监督微调、强化学习、策略内蒸馏和模型融合在内的训练方案。在公共和内部基准上的评估表明,OvisOCR2 在 OmniDocBench v1.6 和 PureDocBench 上均创下了新的最佳成绩,同时在我们的内部比较中也取得了最高整体得分。未来的工作将侧重于提高对退化真实世界图像的鲁棒性,并进一步加强在手写体密集和复杂表格文档上的性能。
307

被折叠的 条评论
为什么被折叠?



