2026 年 10 月 6 日——vLLM 项目于 10 月 5 日将 Transformers 后端的视频输入支持合并进主干(PR #57441),至此该后端可统一承接文本、图像、音频、视频四种模态的推理请求。由于合并时间比同日发布的 v0.31.0 稳定版晚约 1 小时,视频能力将随下一版本 v0.32.0 进入稳定版,按项目两周发布节奏预计在 10 月中下旬。
对 Transformers 已支持的模型,用户无需手写 vLLM 适配代码,在线服务通过 vllm serve <模型> --model-impl transformers 指定后端即可对外提供多模态推理,官方文档称经该后端加载的模型性能与 vLLM 专用模型实现应当一致。本次视频支持的合并,意味着该后端最后一块多模态拼图补齐,也进一步缩小了 Transformers 新模型在 vLLM 上的可用性时差。
1. Transformers 后端是什么:免适配复用 Transformers 模型实现
据 vLLM 官方文档,vLLM 将这一特性称为「Transformers modeling backend」(Transformers 建模后端):模型的前向计算直接采用 Hugging Face Transformers 库中的实现,vLLM 侧只接管注意力层、KV 缓存与调度等推理服务设施。对于 Transformers 库内已有实现的模型,这一路径免去了在 vLLM 中重复实现模型结构的适配工作; Transformers 上游新收录的模型,也可以在 vLLM 尚未提供原生实现之前先行部署。
该后端目前的覆盖范围为:模态上支持嵌入(embedding)模型、语言模型、视觉语言模型与音频语言模型;架构上支持 encoder-only、decoder-only 与混合专家(MoE);注意力类型上支持全注意力与滑动窗口注意力,或两者混合。官方文档同时说明,符合后端接入规范的模型可以兼容 vLLM 特性矩阵中的全部功能,并支持数据并行、张量并行、专家并行与流水线并行的任意组合。
在官方确认的后端支持清单中,文本侧包括 Arcee(AFM)、CWM、FlexOlmo、GLM-4、GPT-NeoX、Hunyuan、Jais2、Mellum 2、Nanbeige4.2、OLMo 家族、Phi、SeedOss、SmolLM3、Starcoder2、VaultGemma 等,多模态侧包括 Emu3、HunyuanOCR 与 VibeVoice-ASR。清单内模型运行时日志不出现回退警告;未列入清单的模型默认按回退方式运行并打印提示。
从近期仓库动态看,官方正在把更多模型迁移到该后端:10 月 2 日前后,GPT-NeoX、Phi、Seed-OSS、Jais2(PR #59701)与 Glm、Arcee、CWM、Mellum(PR #59679)两批迁移先后合并,Aria(PR #59767)与 Mistral-7B-v0.1(PR #59615)的迁移正在进行中。
2. 视频支持如何落地:检测机制、版本依赖与降级策略
视频输入支持由开发者 harshaljanjani 提交(其本人也是 7 月音频后端的提交者),PR #57441 于 9 月 17 日创建,10 月 5 日合并,改动规模为 9 个文件、新增 775 行、删除 115 行。按 PR 描述,其工作方式与既有的图像、音频路径一致:
- 模型处理器的
_get_num_multimodal_tokens(video_sizes=...)能返回视频 token 计数时,该模型即被视为支持视频输入; - 视频特征经 Transformers 的
get_video_features接口提取,M-RoPE 位置信息经get_rope_index计算(依赖video_grid_thw、second_per_grid_ts字段),覆盖 Qwen 系视觉模型的时序位置编码需求。
依赖方面,视频输入要求 Transformers 版本不低于 5.18.0(PR 代码中以 check_version("5.18.0", "video inputs") 显式检查);实现依赖的上游修复为 Hugging Face Transformers 仓库 PR #48894(修复视频 token 计数器,属阻断性依赖),另一 PR #48900 负责补齐其余模型的计数器、不构成阻断。降级策略保持现状:尚不能计数视频 token 的处理器,会记录一次日志后按纯图像方式提供服务。
随着本次合并,官方文档同步删除了「视觉语言模型目前仅接受图像输入,视频输入将在未来版本加入」的脚注。时间线上,文本与图像支持此前已可用,音频支持由 PR #39330 于 7 月 25 日合并、随 v0.27.0(8 月 10 日发布)进入稳定版,视频是最后补齐的一种模态。
3. 官方实测:四款视觉语言模型的视频推理数据
PR 描述给出了四款模型的视频推理实测,测试口径为单张 NVIDIA L4、eager 模式、max_model_len=8192、贪心解码、生成 96 个新 token、每个视频取 8 帧且长边缩至 640 像素,输出 logprobs 与 Hugging Face Transformers 参考实现对齐:
| 模型 | 与 HF 输出对齐 | 端到端延迟 | 生成速度 | 生成 token 数 |
|---|---|---|---|---|
| Qwen3-VL-2B-Instruct | 一致 | 1199 毫秒 | 26.7 token/秒 | 32 |
| LLaVA-OneVision-0.5B | 一致 | 1489 毫秒 | 32.9 token/秒 | 49 |
| North-Micro-Vision-Instruct(CohereLabs) | 一致 | 919 毫秒 | 28.3 token/秒 | 26 |
| Qwen2.5-VL-3B-Instruct | 一致 | 660 毫秒 | 21.2 token/秒 | 14 |
测试之外,处理链路中还验证了 VideoLLaMA3(HF 格式)的压缩掩码布局、单请求多视频输入、图视频混合输入的字段隔离,以及处理器缓存的命中行为。
4. 版本时间线:为何视频支持要等 v0.32.0
vLLM 官方博客此前说明项目采用约两周的发布流程,近四个稳定版的发布日期也维持了这一节奏。本次 PR 合并时间为 10 月 5 日 07:51(UTC),而 v0.31.0 稳定版发布于同日 06:44(UTC),前后相差约 1 小时,视频支持未能进入该版本:
| 时间(2026 年,UTC) | 事件 |
|---|---|
| 4 月 8 日 | 音频后端 PR #39330 创建 |
| 7 月 25 日 | 音频支持合并进主干 |
| 8 月 10 日 | v0.27.0 发布,音频支持首次进入稳定版 |
| 8 月 26 日 / 9 月 9 日 / 9 月 22 日 | v0.28.0、v0.29.0、v0.30.0 依次发布 |
| 9 月 17 日 | 视频支持 PR #57441 创建 |
| 10 月 5 日 06:44 | v0.31.0 发布(不含视频支持) |
| 10 月 5 日 07:51 | PR #57441 合并进主干 |
| 预计 10 月中下旬 | v0.32.0 发布,视频支持进入稳定版 |
希望在 v0.32.0 发布前使用视频输入的用户,可从源码安装 vLLM 主干版本;稳定版用户建议等待 v0.32.0(截至发稿官方未公布确切发布日期)。
5. 数据速览
| 项目 | 数据 |
|---|---|
| 本次变更 | PR #57441,9 个文件,+775/-115 行 |
| 合并时间 | 2026 年 10 月 5 日 07:51 UTC |
| 进入稳定版 | v0.32.0(预计 10 月中下旬,官方未公布确切日期) |
| 后端模态演进 | 文本、图像(既有);音频(7 月 25 日合并,v0.27.0 起随稳定版发布);视频(本次合并) |
| 视频输入依赖 | Transformers 不低于 5.18.0;HF Transformers PR #48894 已合入 |
| 适用架构 | encoder-only、decoder-only、MoE;全注意力与滑动窗口注意力 |
| 并行能力 | 数据并行、张量并行、专家并行、流水线并行任意组合 |
| 启用方式 | 在线服务 --model-impl transformers;离线推理 LLM(model=..., model_impl="transformers") |
| 实测模型 | Qwen3-VL-2B、Qwen2.5-VL-3B、LLaVA-OneVision-0.5B、North-Micro-Vision-Instruct |
数据来源:GitHub vllm-project/vllm 仓库 PR #57441、#39330、#59701、#59679 及 Releases 发布记录;vLLM 官方文档 supported_models 页面。
提示:视频输入在 v0.31.0 及更早的稳定版中不可用。文中性能数据为 PR 官方口径(单卡 L4、小参数量模型、短生成场景),实际表现因模型规模、量化方案与硬件配置而异。「无需手写适配代码」适用于 Transformers 库内已支持且符合后端接入规范的模型;开发者自定义模型仍需满足 Transformers 自定义模型结构,并让注意力模块经由标准注意力接口分发。
举手提问