2026 年 09 月 24 日——阿里巴巴于 9 月 22 日在杭州云栖大会上发布并开源文档解析模型 Logics-Parsing-V3:模型仅 0.8B 参数,在多页文档解析评测 MPDocBench-Parse 综合评测中以 85.26 分排名第一,领先第二名端到端模型 PaddleOCR-VL-1.5 达 4.46 分,官方表示该模型是这一榜单目前唯一的开源 SOTA 模型。

据官方公众号"阿里数据"消息,Logics-Parsing-V3 是 Logics-Parsing 系列的第三代模型。该系列于 2025 年 9 月 25 日发布首代单页文档解析模型,2026 年 2 月 13 日推出强化复杂版面解析的 V2 版本,2026 年 3 月 9 日发布全要素解析版本 Logics-Parsing-Omni,此次的 V3 在单页识别基础上补齐了长文档整册解析能力。模型权重与代码已上架 Hugging Face 与 GitHub,并在 ModelScope 提供在线体验。

循环滑动窗口推理:跨页保持结构连续

官方介绍,V3 的核心升级是引入结构感知循环解析(Structure-Aware Recurrent Parsing)推理框架:模型按页循环解析文档时,将未闭合的标题层级路径、最近关闭的标题、跨页元素续接状态等结构信息压缩为状态向量,随页面滚动向后传递,解析完成后还原出整份文档的完整结构树。该方案主要针对传统逐页解析中跨页表格截断、跨页段落割裂、标题层级丢失等问题。

graph LR A[长文档输入] --> B[逐页滑动窗口解析] B --> C[结构状态压缩传递] C --> B C --> D[全文结构树还原]

在具体能力上,官方给出四点升级:一是跨页不断、长文无界,同时支持单页与多页解析,通过长文档滑窗方案处理超长内容;二是不止识别、更懂结构,抽取全文层级结构,定位图表所属层级并建立图文关联;三是复杂内容精准还原,覆盖密集文字、复杂表格、科学公式、化学符号,并支持乐谱、思维导图、代码与伪代码等小众排版;四是解析效率领先,官方数据显示其解析速度快于对比的端到端方案。

评测数据

评测项 数据
MPDocBench-Parse 综合评测 85.26 分,参评模型第一
领先幅度 高出第二名端到端模型 PaddleOCR-VL-1.5 达 4.46 分
截断文本编辑距离 0.07,参评模型中最佳
标题层级结构 Heading TEDS 62.33 分,领先第二名 8.97 分
跨页关键能力覆盖 全文档联合解析、跨页元素合并、图文关联、层级恢复四项全部覆盖
MPDocBench-Long 长文评测 官方自建,5 个长度区间、最长 50 页,质量随文档变长保持稳定

官方模型卡显示,在四项跨页关键能力对照表中,Logics-Parsing-V3 是对比模型中唯一全部覆盖的模型;单页解析方面,模型在 OmniDocBench v1.6 的文本、公式、表格、阅读顺序等指标上保持第一梯队水平。

在推理效率上,官方在 MPDocBench 全量 420 份文档共 3135 页上测试(H100 单卡、batch size 为 1):Logics-Parsing-V3 全程耗时 72.46 分钟,平均每页 1.39 秒;对比方案中 OvisOCR2 为 73.26 分钟(每页 1.40 秒),MinerU2.5-Pro 为 175.10 分钟(每页 3.35 秒),MinerU2.5-Pro 与 MinerU-PoPo 组合为 197.49 分钟(每页 3.78 秒)。

获取方式

渠道 地址
GitHub 仓库 https://github.com/alibaba/Logics-Parsing
Hugging Face 权重 https://huggingface.co/Logics-MLLM/Logics-Parsing-V3
ModelScope 在线体验 https://www.modelscope.cn/studios/Alibaba-DT/Logics-Parsing

部署方面,官方示例基于 vLLM 推理框架,依赖版本为 vllm 0.22.1 与 transformers 5.6.0;多页解析默认滑动窗口为 2 页,输出包含正文 Markdown、标题层级树 Markdown、DSL 中间表示与结构化 JSON 四类文件,可直接对接 RAG 入库等下游流程。