2026 年 09 月 24 日——阿里巴巴于 9 月 22 日在杭州云栖大会上发布并开源文档解析模型 Logics-Parsing-V3:模型仅 0.8B 参数,在多页文档解析评测 MPDocBench-Parse 综合评测中以 85.26 分排名第一,领先第二名端到端模型 PaddleOCR-VL-1.5 达 4.46 分,官方表示该模型是这一榜单目前唯一的开源 SOTA 模型。
据官方公众号"阿里数据"消息,Logics-Parsing-V3 是 Logics-Parsing 系列的第三代模型。该系列于 2025 年 9 月 25 日发布首代单页文档解析模型,2026 年 2 月 13 日推出强化复杂版面解析的 V2 版本,2026 年 3 月 9 日发布全要素解析版本 Logics-Parsing-Omni,此次的 V3 在单页识别基础上补齐了长文档整册解析能力。模型权重与代码已上架 Hugging Face 与 GitHub,并在 ModelScope 提供在线体验。
循环滑动窗口推理:跨页保持结构连续
官方介绍,V3 的核心升级是引入结构感知循环解析(Structure-Aware Recurrent Parsing)推理框架:模型按页循环解析文档时,将未闭合的标题层级路径、最近关闭的标题、跨页元素续接状态等结构信息压缩为状态向量,随页面滚动向后传递,解析完成后还原出整份文档的完整结构树。该方案主要针对传统逐页解析中跨页表格截断、跨页段落割裂、标题层级丢失等问题。
在具体能力上,官方给出四点升级:一是跨页不断、长文无界,同时支持单页与多页解析,通过长文档滑窗方案处理超长内容;二是不止识别、更懂结构,抽取全文层级结构,定位图表所属层级并建立图文关联;三是复杂内容精准还原,覆盖密集文字、复杂表格、科学公式、化学符号,并支持乐谱、思维导图、代码与伪代码等小众排版;四是解析效率领先,官方数据显示其解析速度快于对比的端到端方案。
评测数据
| 评测项 | 数据 |
|---|---|
| MPDocBench-Parse 综合评测 | 85.26 分,参评模型第一 |
| 领先幅度 | 高出第二名端到端模型 PaddleOCR-VL-1.5 达 4.46 分 |
| 截断文本编辑距离 | 0.07,参评模型中最佳 |
| 标题层级结构 Heading TEDS | 62.33 分,领先第二名 8.97 分 |
| 跨页关键能力覆盖 | 全文档联合解析、跨页元素合并、图文关联、层级恢复四项全部覆盖 |
| MPDocBench-Long 长文评测 | 官方自建,5 个长度区间、最长 50 页,质量随文档变长保持稳定 |
官方模型卡显示,在四项跨页关键能力对照表中,Logics-Parsing-V3 是对比模型中唯一全部覆盖的模型;单页解析方面,模型在 OmniDocBench v1.6 的文本、公式、表格、阅读顺序等指标上保持第一梯队水平。
在推理效率上,官方在 MPDocBench 全量 420 份文档共 3135 页上测试(H100 单卡、batch size 为 1):Logics-Parsing-V3 全程耗时 72.46 分钟,平均每页 1.39 秒;对比方案中 OvisOCR2 为 73.26 分钟(每页 1.40 秒),MinerU2.5-Pro 为 175.10 分钟(每页 3.35 秒),MinerU2.5-Pro 与 MinerU-PoPo 组合为 197.49 分钟(每页 3.78 秒)。
获取方式
| 渠道 | 地址 |
|---|---|
| GitHub 仓库 | https://github.com/alibaba/Logics-Parsing |
| Hugging Face 权重 | https://huggingface.co/Logics-MLLM/Logics-Parsing-V3 |
| ModelScope 在线体验 | https://www.modelscope.cn/studios/Alibaba-DT/Logics-Parsing |
部署方面,官方示例基于 vLLM 推理框架,依赖版本为 vllm 0.22.1 与 transformers 5.6.0;多页解析默认滑动窗口为 2 页,输出包含正文 Markdown、标题层级树 Markdown、DSL 中间表示与结构化 JSON 四类文件,可直接对接 RAG 入库等下游流程。
举手提问