2026 年 10 月 11 日——腾讯优图实验室于 10 月 9 日在 Hugging Face 开源全模态解析模型 Youtu-Parsing-Omni,参数量 5B,单个模型即可将文档页、自然图像、图表、流程图、几何图形、音频与音视频统一解析为结构化 JSON 输出。官方模型卡报告其在 OmniDocBench v1.6 综合得分 96.96,位列该榜单第一。

模型权重同步发布在 HuggingFace(tencent/Youtu-Parsing-Omni)与 ModelScope(tencent-community/Youtu-Parsing-Omni),配套代码、vLLM 插件与推理示例位于 GitHub 仓库 TencentCloudADP/youtu-parsing 的 youtu_parsing_omni 子目录。截至发稿(10 月 11 日),HuggingFace 页面显示 65 个赞、340 次下载,GitHub 仓库获 109 星。官方称技术报告已随仓库以 PDF 形式发布,arXiv 编号待定。

模型概况与任务范围

Youtu-Parsing-Omni 的官方定位是"一个将文档、图像、图表、几何图形、音频和视频解析为结构化 JSON 的模型"。给定单一输入,模型输出一个统一的 JSON 封套,同时覆盖感知层信息(版面元素、文本、表格、公式、边界框、时间戳、语音识别、光学字符识别、声学事件、镜头运动)与认知层信息(图注、叙述、报告)。据官方模型卡,七类解析场景共享同一套 OmniSchema 输出模式,由任务提示词选择具体输出形态,各任务的输出要点如下表。

输入类型 任务标识 输出要点
文档页 document 带边界框的版面元素、文本、LaTeX 公式、OTSL 表格、Markdown 图表、Mermaid 流程图、阅读顺序
自然图像 natural_image 带边界框的实体与文字、标签、图注、全局描述
图表 graphics_chart 单个 chart 元素:Markdown 表格、注释、图题
流程图 graphics_flowchart 单个 flowchart 元素:Mermaid 代码、图题
几何图形 graphics_geometric 点、线、弧、形状及几何关系与测量值
音频 audio 带时间戳的人声/非人声分段、说话人、ASR 文本、音色与场景描述、声学事件
自然视频 natural_video 时间分段及各段视觉元素、动作、交互、镜头运动与音轨
富文本视频 textrich_video OCR 与 ASR 分段,外加整段视频的 Markdown 结构化报告

该模型是腾讯优图 2026 年 1 月开源的文档解析模型 Youtu-Parsing(2.5B,基于 Youtu-LLM-2B 底座)的后续版本,前代模型专注文档场景,在 OmniDocBench v1.6 上得分 93.74。

架构设计:单编码器与统一模式

官方技术报告称,现有全模态解析器普遍采用双塔结构,像素与音频各用一套独立预训练的编码器,两路特征直到语言模型内部才相遇。Youtu-Parsing-Omni 将两塔替换为单一的 Youtu-Omni-Encoder,该编码器从预训练文本语言模型初始化以强化文字读取能力:轻量的模态专属前端将图像像素与音频 log-mel 频谱帧映射为 token,共享的双向 Transformer 在统一的 (t, h, w) 位置编码下处理任意混合排列的图像、音频块与视频,再经模态专属的合并器与投影器送入 Youtu-LLM 解码器生成 JSON。由于仅前端与合并、投影部分依赖模态,绝大部分感知参数在模态间共享。

视频场景下,帧与音频块按时间顺序打包,少数融合层在每个音频与帧的边界开启新的注意力窗口,使每一帧能够注意到同一时刻的声音;视觉 token 的时间坐标取自帧索引、空间坐标取自 patch 网格,音频 token 的时间坐标取自时间偏移,两者共享同一时间坐标系。官方表示,跨模态对齐因此在编码器内部完成,而非由解码器事后重建。

训练流程分为三步:监督微调、按输出模式路由的可验证奖励强化学习,以及名为 OSAD(OmniSchema-Aware On-Policy Distillation)的自进化后训练。模型对自己的解析结果采样,通过 JSON 有效性、模式符合性、边界框语法与重复检查四道准入门的样本,交由模型自身的冻结副本在参照解析辅助下评分;每个 token 被区分为内容 token 与结构 token,分别采用 Jensen-Shannon 散度与更高温度下的前向 KL 散度作为训练目标。每轮训练结束时学生模型的 LoRA 适配器被合并、学生升级为下一轮教师,无需人工设计奖励函数或单独训练教师模型。

评测数据

OmniDocBench v1.6

官方模型卡报告,Youtu-Parsing-Omni 在文档解析基准 OmniDocBench v1.6 上以 96.96 的综合得分排名第一,其中表格 TEDS-S 98.20 与阅读顺序编辑距离 0.1104 均为对比模型中最佳。主要对比模型成绩如下(数据来源:官方模型卡)。

模型 参数量 综合得分
Youtu-Parsing-Omni 5B 96.96
TeleOCR 1.2B 96.91
OvisOCR2 0.8B 96.47
PaddleOCR-VL-1.6 0.9B 96.34
MinerU2.5-Pro 1.2B 95.75
GLM-OCR 0.9B 95.22
HunyuanOCR-1.5 1B 94.74
Youtu-Parsing(前代) 2.5B 93.74
Gemini-3-Pro 闭源 92.91
DeepSeek-OCR 2 3B 90.25
Qwen3-VL-235B 235B-A22B 89.78
GPT-5.2 闭源 86.59

OmniParsingBench

在覆盖图表、几何图形、自然图像、音频与视频的 OmniParsingBench 上,官方报告 Youtu-Parsing-Omni 以 75.08 的平均分成为最佳开源权重模型,仅次于闭源的 Gemini-3-Pro(77.44);其中图表(95.02)与音频(78.08)两个单项为全部对比模型中最高。

模型 图表 几何图形 自然图像 音频 自然视频 富文本视频 平均
Gemini-3-Pro 92.79 85.43 69.73 76.74 74.82 76.80 77.44
Youtu-Parsing-Omni 95.02 74.33 62.84 78.08 74.18 75.62 75.08
Logics-Parsing-Omni 94.65 76.34 67.53 75.58 67.34 65.36 72.26
Qwen3-Omni-30B-A3B 87.07 58.60 59.35 75.23 65.19 59.59 66.44

专项基准

在化学结构识别基准 ChemOCR 上,模型平均相似度 74.6,Tani@1.0 指标 54.2 为对比模型中最高,超过 3B 参数的 DeepSeek-OCR 2(49.6)。在乐谱识别基准 PDMX-Synth 上,其字符错误率 22.73 低于专业光学乐谱识别模型 LEGATO 的 23.30,而 GPT-5.6 为 45.02、Gemini-3-Pro 为 54.26。官方称模型在这两个专用领域与专用模型具有竞争力。

部署方式与开源许可

模型基于 Python 3.10 以上版本与 CUDA GPU 运行,音频与视频输入依赖 ffmpeg。官方提供两条推理路径:vLLM 服务(vllm 0.19.0,配套 vllm-plugin-vita-omni 插件)与 Transformers 本地推理(transformers 5.10.2),两条路径固定的 transformers 版本不同,官方要求安装在两个独立的 Python 环境中,且服务环境不得安装 peft。

官方 vLLM 启动脚本以固定参数复现报告成绩:上下文长度 65536、单请求并发 1、显存利用率 0.70、bfloat16 精度,单请求上限为 8 张图像、4 段视频、8 段音频。服务默认提供 OpenAI 兼容接口,仅监听 127.0.0.1,并通过 allowed-local-media-path 参数限定可读取的本地媒体目录。视频请求默认采样 64 帧并同时解码音轨。模型输出为单个 JSON 代码块,边界框坐标以专用 token 编码在 0 至 1000 的归一化网格上,时间戳采用 HH:MM:SS 格式。

许可证方面,HuggingFace 页面将许可证标注为 other,即自定义的 youtu-parsing 许可,具体条款以仓库 LICENSE 文件为准。