告别逐字等待:PaddleOCR推出高吞吐层级并行文档解析技术 HPD-Parsing

告别逐字等待:PaddleOCR推出高吞吐层级并行文档解析技术 HPD-Parsing

面对一份文档,基于视觉语言模型的统一式文档解析模型通常沿单一自回归序列逐 token 生成整页内容:即使正文段落、公式和表格彼此独立,也要按顺序等待。这种串行的流水线式的工作模式十分低效。更高效的方式应当像团队协作:先完成全局规划,再让不同成员并行处理相对独立的任务,最后有序汇总。

受此启发,PaddleOCR 团队提出HPD-Parsing(Hierarchical Parallel Document Parsing,层级并行文档解析)技术。这种解析模式下,主线布局分支负责统一理解页面结构,并将不同区域动态分发至多个内容分支进行并行解析,同时结合渐进式多 token 预测,进一步减少各分支解码步骤,整体实现多层级高度并行解析。

告别逐字等待:PaddleOCR推出高吞吐层级并行文档解析技术 HPD-Parsing

HPD-Parsing将1B参数的基线模型Token吞吐大幅拉升至3倍以上,单卡NVIDIA A800 GPU实测,OmniDocBench v1.6评测集TPS(Tokens Per Second,每秒 Token 生成量)达4,752.1,解析精度保持行业第一梯队的同时,解析效率实现大幅领先。

告别逐字等待:PaddleOCR推出高吞吐层级并行文档解析技术 HPD-Parsing

HPD-Parsing的代码和权重已经开源至Github和HuggingFace,欢迎大家下载使用。

Github:

https://github.com/PaddlePaddle/PaddleOCR

HuggingFace:

https://huggingface.co/PaddlePaddle/HPD-Parsing

ArXiv论文地址:

https://arxiv.org/abs/2607.18839

告别逐字等待:PaddleOCR推出高吞吐层级并行文档解析技术 HPD-Parsing

效果速览
1、层级并行解析机制

告别逐字等待:PaddleOCR推出高吞吐层级并行文档解析技术 HPD-Parsing

2、大幅拉升基线吞吐,解析效率新SOTA:

OmniDocBench v1.6评测集512并发测试,传统自回归基线Token吞吐(TPS)为 1554.8、页吞吐(PPS)为1.02,引入HPD(层级并行解码)技术后,Token吞吐和页吞吐分别提升至4,752.1和2.68,领跑一众模型。

告别逐字等待:PaddleOCR推出高吞吐层级并行文档解析技术 HPD-Parsing

3、解析效率优势随文档长度显著提升:

OmniDocBench v1.6测试集按长度等间隔划分,结果显示,随着输出序列增长,HPD-Parsing相对自回归模型的优势持续扩大,解码步数最高实现18.04倍压缩、批量请求吞吐最高实现3.67倍提升、单并发推理时延最高下降5.8倍。

HPD-Parsing 带来的并非固定比例的性能提升,而是从解码机制上缓解了传统自回归解析中“文档越长、等待越久”的结构性瓶颈。页面越复杂,可并行解析的区域越多,其效率优势也越明显。

告别逐字等待:PaddleOCR推出高吞吐层级并行文档解析技术 HPD-Parsing

4、解析精度保持行业第一梯队:

扫描场景完成技术可行性验证,OmniDocBench v1.6指标达94.91%,文本识别、公式、表格和阅读顺序等关键能力上均保持了有竞争力的表现。

告别逐字等待:PaddleOCR推出高吞吐层级并行文档解析技术 HPD-Parsing

告别逐字等待:PaddleOCR推出高吞吐层级并行文档解析技术 HPD-Parsing

是什么在拖垮解析效率:

真正的瓶颈不在“看”,而在“写”

告别逐字等待:PaddleOCR推出高吞吐层级并行文档解析技术 HPD-Parsing

我们对一个经典的1B参数规模的统一式自回归模型统计了视觉编码器和语言解码器的耗时,结果显示,视觉编码时间相对稳定,而解码耗时会随输出长度快速增长。尤其是在长文档场景中,解码时间可接近视觉编码时间的500倍。

这意味着,对于长文档而言,模型主要不是慢在“看完整张图片”,而是慢在“逐token写出结果”。换一种更直观的说法:文档模型已经可以快速看完整页,但仍然被迫地一个字一个字地进行抄写。

仔细思考其中的奥秘:页面结构的确需要全局理解——例如标题层级、多栏布局、区域位置和阅读顺序,但某个文本段落、公式或表格的具体内容解析,往往只依赖于对应区域图像和必要的上下文,并不需要等待其他区域的全部内容生成完毕。

因此,文档需要整体理解,却不需要整体串行生成。

告别逐字等待:PaddleOCR推出高吞吐层级并行文档解析技术 HPD-Parsing

HPD-Parsing:

让文档解析像团队抄书一样高效协作

告别逐字等待:PaddleOCR推出高吞吐层级并行文档解析技术 HPD-Parsing

第一层并行:全局布局协调,局部并行解析

HPD-Parsing 将传统的单一解码序列重构为具有层级关系的并行生成过程。主布局分支负责识别页面中的区域类别、位置与阅读顺序;当一个区域的边界和类型确定后,模型便动态创建相应的内容分支,并行生成该区域中的正文、公式或表格内容。

不同于传统 Pipeline 通过多个独立模块分阶段完成版面分析与内容解析,HPD-Parsing 将区域级并行直接融入统一模型的解码过程。各内容分支共享整页视觉上下文,主布局分支持续维护区域关系与阅读顺序,并依据全局布局结构组织最终输出。因此,模型无需割裂页面上下文,即可将不同区域的内容生成转化为并发执行。

换句话说,HPD-Parsing 并非先将页面拆分为彼此独立的局部任务,而是在全局统一协调下并行生成不同区域的内容。

并且,分工不等于重复工作!HPD-Parsing采用了共享前缀KV Cache复用机制:新分支可直接复用已计算的视觉信息和布局前缀,无需重新编码整页图像,也无需重复执行完整的 Prefill 过程。

第二层并行:每个分支一次预测多个token

基于布局理解的动态分支解码,使不同文档区域可以并行生成,但每个分支内部仍保留逐token解码带来的串行路径。

为进一步减少主布局分支和各个内容分支的解码步数,HPD-Parsing进一步集成了PaddleOCR团队在ECCV 2026中提出的P-MTP(Progressive Multi-Token Prediction,渐进式多Token预测)技术。

P-MTP 能够在一次解码迭代中预测并验证多个后续 token,并将验证通过的 token 直接纳入输出。HPD-Parsing 平均每个解码步骤可接收6.6 个 token,使布局分支与内容分支能够以更少的解码步数完成生成,不再只能逐步向前推进。

P-MTP的模型结构、渐进式训练方式与推理验证机制,可参见此前的专题介绍:【ECCV 2026】P-MTP:让文档解析模型「一次读N个字」,推理提速5×。

两级并行,同时缩短区域间等待与区域内解码

由此,HPD-Parsing形成了两个相互补充的并行维度:
分支间并行:不同文档区域同时解码;
分支内并行:每条分支一次推进多个token。

前者减少区域之间的相互等待,后者减少单个区域内部的解码步数。二者协同作用,使整页内容不再沿着一条冗长的序列逐步生成,而是能够在不同区域之间并行展开,并在每个区域内部更快向前推进,从区域间和区域内两个层面共同缩短整体解析过程。

告别逐字等待:PaddleOCR推出高吞吐层级并行文档解析技术 HPD-Parsing

让模型分阶段快速适配HPD机制:

少量数据实现解码范式迁移

兼顾效率与精度

告别逐字等待:PaddleOCR推出高吞吐层级并行文档解析技术 HPD-Parsing

首先,HPD-Parsing构建了一套标准化的数据生产引擎。该引擎首先对原始文档进行特征提取、聚类与代表性采样,以扩大数据覆盖范围并减少重复样本;随后结合 PaddleOCR-VL-1.5、MinerU-2.5 Pro 等模型生成伪标签,并依据中间阶段模型与伪标签之间的解析差异,将样本划分为简单、中等和困难三个等级。对于困难样本,引入更强的视觉语言模型进行多轮检查、生成与纠正;最后从难度等级、文档类型以及文本、表格、公式和复杂版式等属性维度进行分布平衡,形成兼具多样性、可靠性和针对性的训练数据。

基于这一数据引擎,我们进一步构建了三阶段训练数据,用于支撑分阶段的 HPD 机制适配,使模型从传统全页生成逐步过渡到层级并行解码:

第一阶段,模型首先基于280万条全页样本进行训练,建立通用文档解析能力,并同步初始化P-MTP的多token预测能力。

第二阶段,在已有解析能力的基础上,使用十万级别难度分布均衡的分支训练样本,完成解码范式迁移。

第三阶段,进一步选取百级别代表性难例,通过强化训练进行针对性优化。

HPD-Parsing 通过三阶段训练逐步完成能力初始化、解码范式迁移与难例强化,并配合自动化难度感知数据构建,持续发现和补强模型的薄弱环节。

布局与内容监督的分解,使不同解析能力可以得到更有针对性的优化,而统一模型框架仍保留了对整页上下文和页面结构的整体建模能力。

告别逐字等待:PaddleOCR推出高吞吐层级并行文档解析技术 HPD-Parsing

结语

HPD-Parsing将文档解析机制从“一条序列从头写到尾”,转变为“全局协调、局部并行”的模式,在有限的适配数据下,做到了精度可靠的同时摆脱了完整页面串行生成的约束。值得说明的是,这种解析机制的革新,与视觉Token压缩、注意力交互长度压缩等加速手段并不冲突,而是可以相互协同,实现更强的推理效率。

当然,它的意义不只在于一个更高的TPS数字,更在于提供了一种新的解码方式:

页面结构需要全局协调,区域内容则可以局部并行。

未来,这种结构化并行的思路有望进一步扩展到其他具有明确层级结构的生成任务中。

FAQ

Q: HPD-Parsing 和 PaddleOCR-VL系列有什么关系?

A: HPD-Parsing是PaddleOCR团队面向文档解析推理加速提出的最新技术研究成果,建议应用场景聚焦在扫描文档场景且对于推理效率存在强需求的用户可以部署体验,对于解析效果存在强需求的用户,我们仍然建议使用PaddleOCR-VL系列作为第一选择。

告别逐字等待:PaddleOCR推出高吞吐层级并行文档解析技术 HPD-Parsing

告别逐字等待:PaddleOCR推出高吞吐层级并行文档解析技术 HPD-Parsing

告别逐字等待:PaddleOCR推出高吞吐层级并行文档解析技术 HPD-Parsing

关注【飞桨PaddlePaddle】公众号 获取更多技术内容~

前沿技术新闻资讯知识图谱

让 AI 快速「读懂」你的代码仓:Joy-Code-Graph 云端图谱服务的三次进化

2026-7-22 21:13:56

前沿技术新闻资讯知识图谱

知识图谱、问题图谱、能力图谱的界定及关联

2026-7-22 22:14:18

0 条回复 A文章作者 M管理员
    暂无讨论,说说你的看法吧
购物车
优惠劵
搜索