2026 年 10 月 6 日——vLLM 项目于 10 月 5 日将 Transformers 后端的视频输入支持合并进主干(PR #57441),至此该后端可统一承接文本、图像、音频、视频四种模态的推理请求。由于合并时间比同日发布的 v0.31.0 稳定版晚约 1 小时,视频能力将随下一版本 v0.32.0 进入稳定版,按项目两周发布节奏预计在 10 月中下旬。

对 Transformers 已支持的模型,用户无需手写 vLLM 适配代码,在线服务通过 vllm serve <模型> --model-impl transformers 指定后端即可对外提供多模态推理,官方文档称经该后端加载的模型性能与 vLLM 专用模型实现应当一致。本次视频支持的合并,意味着该后端最后一块多模态拼图补齐,也进一步缩小了 Transformers 新模型在 vLLM 上的可用性时差。

1. Transformers 后端是什么:免适配复用 Transformers 模型实现

据 vLLM 官方文档,vLLM 将这一特性称为「Transformers modeling backend」(Transformers 建模后端):模型的前向计算直接采用 Hugging Face Transformers 库中的实现,vLLM 侧只接管注意力层、KV 缓存与调度等推理服务设施。对于 Transformers 库内已有实现的模型,这一路径免去了在 vLLM 中重复实现模型结构的适配工作; Transformers 上游新收录的模型,也可以在 vLLM 尚未提供原生实现之前先行部署。

该后端目前的覆盖范围为:模态上支持嵌入(embedding)模型、语言模型、视觉语言模型与音频语言模型;架构上支持 encoder-only、decoder-only 与混合专家(MoE);注意力类型上支持全注意力与滑动窗口注意力,或两者混合。官方文档同时说明,符合后端接入规范的模型可以兼容 vLLM 特性矩阵中的全部功能,并支持数据并行、张量并行、专家并行与流水线并行的任意组合。

在官方确认的后端支持清单中,文本侧包括 Arcee(AFM)、CWM、FlexOlmo、GLM-4、GPT-NeoX、Hunyuan、Jais2、Mellum 2、Nanbeige4.2、OLMo 家族、Phi、SeedOss、SmolLM3、Starcoder2、VaultGemma 等,多模态侧包括 Emu3、HunyuanOCR 与 VibeVoice-ASR。清单内模型运行时日志不出现回退警告;未列入清单的模型默认按回退方式运行并打印提示。

从近期仓库动态看,官方正在把更多模型迁移到该后端:10 月 2 日前后,GPT-NeoX、Phi、Seed-OSS、Jais2(PR #59701)与 Glm、Arcee、CWM、Mellum(PR #59679)两批迁移先后合并,Aria(PR #59767)与 Mistral-7B-v0.1(PR #59615)的迁移正在进行中。

2. 视频支持如何落地:检测机制、版本依赖与降级策略

视频输入支持由开发者 harshaljanjani 提交(其本人也是 7 月音频后端的提交者),PR #57441 于 9 月 17 日创建,10 月 5 日合并,改动规模为 9 个文件、新增 775 行、删除 115 行。按 PR 描述,其工作方式与既有的图像、音频路径一致:

  • 模型处理器的 _get_num_multimodal_tokens(video_sizes=...) 能返回视频 token 计数时,该模型即被视为支持视频输入;
  • 视频特征经 Transformers 的 get_video_features 接口提取,M-RoPE 位置信息经 get_rope_index 计算(依赖 video_grid_thw、second_per_grid_ts 字段),覆盖 Qwen 系视觉模型的时序位置编码需求。

依赖方面,视频输入要求 Transformers 版本不低于 5.18.0(PR 代码中以 check_version("5.18.0", "video inputs") 显式检查);实现依赖的上游修复为 Hugging Face Transformers 仓库 PR #48894(修复视频 token 计数器,属阻断性依赖),另一 PR #48900 负责补齐其余模型的计数器、不构成阻断。降级策略保持现状:尚不能计数视频 token 的处理器,会记录一次日志后按纯图像方式提供服务。

随着本次合并,官方文档同步删除了「视觉语言模型目前仅接受图像输入,视频输入将在未来版本加入」的脚注。时间线上,文本与图像支持此前已可用,音频支持由 PR #39330 于 7 月 25 日合并、随 v0.27.0(8 月 10 日发布)进入稳定版,视频是最后补齐的一种模态。

3. 官方实测:四款视觉语言模型的视频推理数据

PR 描述给出了四款模型的视频推理实测,测试口径为单张 NVIDIA L4、eager 模式、max_model_len=8192、贪心解码、生成 96 个新 token、每个视频取 8 帧且长边缩至 640 像素,输出 logprobs 与 Hugging Face Transformers 参考实现对齐:

模型 与 HF 输出对齐 端到端延迟 生成速度 生成 token 数
Qwen3-VL-2B-Instruct 一致 1199 毫秒 26.7 token/秒 32
LLaVA-OneVision-0.5B 一致 1489 毫秒 32.9 token/秒 49
North-Micro-Vision-Instruct(CohereLabs) 一致 919 毫秒 28.3 token/秒 26
Qwen2.5-VL-3B-Instruct 一致 660 毫秒 21.2 token/秒 14

测试之外,处理链路中还验证了 VideoLLaMA3(HF 格式)的压缩掩码布局、单请求多视频输入、图视频混合输入的字段隔离,以及处理器缓存的命中行为。

4. 版本时间线:为何视频支持要等 v0.32.0

vLLM 官方博客此前说明项目采用约两周的发布流程,近四个稳定版的发布日期也维持了这一节奏。本次 PR 合并时间为 10 月 5 日 07:51(UTC),而 v0.31.0 稳定版发布于同日 06:44(UTC),前后相差约 1 小时,视频支持未能进入该版本:

时间(2026 年,UTC) 事件
4 月 8 日 音频后端 PR #39330 创建
7 月 25 日 音频支持合并进主干
8 月 10 日 v0.27.0 发布,音频支持首次进入稳定版
8 月 26 日 / 9 月 9 日 / 9 月 22 日 v0.28.0、v0.29.0、v0.30.0 依次发布
9 月 17 日 视频支持 PR #57441 创建
10 月 5 日 06:44 v0.31.0 发布(不含视频支持)
10 月 5 日 07:51 PR #57441 合并进主干
预计 10 月中下旬 v0.32.0 发布,视频支持进入稳定版

希望在 v0.32.0 发布前使用视频输入的用户,可从源码安装 vLLM 主干版本;稳定版用户建议等待 v0.32.0(截至发稿官方未公布确切发布日期)。

5. 数据速览

项目 数据
本次变更 PR #57441,9 个文件,+775/-115 行
合并时间 2026 年 10 月 5 日 07:51 UTC
进入稳定版 v0.32.0(预计 10 月中下旬,官方未公布确切日期)
后端模态演进 文本、图像(既有);音频(7 月 25 日合并,v0.27.0 起随稳定版发布);视频(本次合并)
视频输入依赖 Transformers 不低于 5.18.0;HF Transformers PR #48894 已合入
适用架构 encoder-only、decoder-only、MoE;全注意力与滑动窗口注意力
并行能力 数据并行、张量并行、专家并行、流水线并行任意组合
启用方式 在线服务 --model-impl transformers;离线推理 LLM(model=..., model_impl="transformers")
实测模型 Qwen3-VL-2B、Qwen2.5-VL-3B、LLaVA-OneVision-0.5B、North-Micro-Vision-Instruct

数据来源:GitHub vllm-project/vllm 仓库 PR #57441、#39330、#59701、#59679 及 Releases 发布记录;vLLM 官方文档 supported_models 页面。

提示:视频输入在 v0.31.0 及更早的稳定版中不可用。文中性能数据为 PR 官方口径(单卡 L4、小参数量模型、短生成场景),实际表现因模型规模、量化方案与硬件配置而异。「无需手写适配代码」适用于 Transformers 库内已支持且符合后端接入规范的模型;开发者自定义模型仍需满足 Transformers 自定义模型结构,并让注意力模块经由标准注意力接口分发。