2026 年 10 月 6 日——开源推理引擎 llama.cpp 于 10 月 5 日 16:56(UTC,北京时间 10 月 6 日凌晨)发布 v0.6.0 稳定版:为 Qwen4Exp 架构提供高质量支持并新增基于多 token 预测(MTP)的投机解码,官方称在 DGX Spark 上解码提速约 1.5 倍;完整支持文本与视觉双模态决策模型 Clef;Metal 后端矩阵乘法最高提速约 3 倍;同步引入新批处理 API、重构内置 Web UI,底层 ggml 库升级至 v0.26.0。
v0.6.0 是 llama.cpp 采用语义化版本号后的第二个稳定版本(上一版为 v0.5.0),对应 nightly 构建编号 b11429。此前以每日构建形式合并的多项能力——包括 10 月 2 日合并进主干的决策模型端点 /v1/systemone——在本版首次进入正式标签版本。
1. Qwen4Exp 获高质量支持,MTP 投机解码落地
据官方发布说明,Qwen4Exp 架构在本版获得高质量支持,并新增基于多 token 预测(MTP)的投机解码,官方实测口径为在 NVIDIA DGX Spark 上解码速度提升约 1.5 倍,同时修复多项正确性问题(PR #29761、#29751)。Qwen4Exp 即阿里千问 Qwen3.8-Flash-Next 所采用的下一代 Qwen4 实验架构,本站此前曾以 Strata 引擎完成该模型的本地部署与调优(见本站 184 篇教程);随着上游 llama.cpp 正式收编该架构,该模型的 MTP 加速可在 llama.cpp 稳定版上直接使用。
围绕该架构的配套优化也在本版集中落地:lightning indexer 打分显存占用减半(#29825)、注意力掩码构造优化(#29824),以及新的 llama_prefetch_rows() 接口——基于 MADVISE 预取 PLE n-gram 嵌入张量,适用于 Qwen4Exp 与 Gemma4(#29599)。
2. 决策模型与多模态:Clef 完整支持,System One 端点进入正式版
新模型支持方面,Clef 决策模型获得文本与视觉双模态完整支持(#29831、#29969),决策模型家族另新增 Nimble(#29844);GLM-5.3-Flash(GLM5-Next)为 320B 参数的文本+视觉混合模型,采用 KDA/DSA 混合注意力与 MoE 结构(#27773);蚂蚁 Ling 3.0 VL 并入 BailingMoeV3 架构获得支持(#29151);此外新增 LFM2.5-Encoder-230M/350M 编码器与重排序模型的 classifier_pooling 支持(#29862、#29627)。
服务端方面,决策模型专用端点 /v1/systemone 随本版首次进入正式标签版本(#29818),支持 laya、julia-1、lev、openjev(含视觉)与 kev 五款决策模型,并扩展支持 nimble。该端点于 10 月 2 日合并进主干:模型对一段状态与若干带类型的问题做单次前向传播,直接返回各选项概率、不生成文本,本站此前已对合并进展与五款官方 GGUF 作过报道(见本站 181 篇快讯)。
3. 性能与底层:Metal 最高约 3 倍矩阵提速,会话格式版本升级
Metal 后端新增两项内核:面向 F16 KV 缓存的张量 API FlashAttention 内核(#29570),以及面向投机解码与批量解码场景的 few-row MMA 矩阵乘法内核,官方称后者在 Apple GPU 上矩阵乘法最高提速约 3 倍(#29869)。Vulkan 后端为量化 K/V 缓存引入稀疏 FlashAttention(#29639)。
API 层面,本版引入扩展批处理接口 llama_batch_ext 与 llama_process(),支持 token 与嵌入混合输入、面向 MTP 与 deepstack 模型的逐 token 状态嵌入(#24669)。会话格式版本号升至 LLAMA_SESSION_VERSION 11 与 LLAMA_STATE_SEQ_VERSION 4,旧版本保存的状态文件与新版本不互通,基于 llama.cpp C/C++ API 二次开发的下游应用需注意适配;对通过 llama-server 命令行与 OpenAI 兼容接口使用本地模型的用户,既有用法不受影响。
底层 ggml 库同步升级至 v0.26.0:SYCL、Vulkan 与 Metal 后端获得稀疏 FlashAttention 内核,CPU 后端新增 BF16 算子与分块 k-quant 矩阵乘法,CUDA 新增模型驱动的 W4A4(NVFP4/MXFP4)矩阵乘法路径,模型加载速度提升,并启用 Windows ARM64 MSVC 官方构建。
4. Web UI 重构:内置界面接入 Hugging Face Hub 数据层
本版对内置 Web UI 完成较大范围重构:新增 Hugging Face Hub 数据层(#27947)、模型下载管线(#27959)与模型内存适配估算(#27957),用户可在内置界面内检索、下载模型,并预估模型能否装入本机显存与内存;服务端 /v1/models 等接口开始返回模型的输入输出模态信息(#29987)。
需要说明的是,本次发布说明未包含桌面应用更新:官方生态中的 macOS 桌面应用 Llama-macOS 最新版 0.43.0 发布于 10 月 2 日,Windows 桌面应用 Llama-Windows 最新标签版本 v0.11.0 发布于 8 月 24 日,均非随 v0.6.0 同步发版。
5. 数据速览
| 项目 | 数据 |
|---|---|
| 版本 | v0.6.0(上一稳定版 v0.5.0),对应 nightly 构建 b11429 |
| 发布时间 | 2026 年 10 月 5 日 16:56 UTC(北京时间 10 月 6 日凌晨) |
| Qwen4Exp | MTP 投机解码,DGX Spark 解码提速约 1.5 倍(官方数据) |
| Metal | F16 KV FlashAttention 内核;Apple GPU 矩阵乘法最高提速约 3 倍(官方数据) |
| Vulkan | 量化 K/V 稀疏 FlashAttention |
| 新增模型 | GLM-5.3-Flash(320B,文本+视觉)、Clef(决策模型,文本+视觉)、Nimble(决策模型)、Ling 3.0 VL、LFM2.5-Encoder-230M/350M |
| 服务端新端点 | /v1/systemone(laya、julia-1、lev、openjev、kev,扩展支持 nimble) |
| C API 变更 | llama_batch_ext 批处理接口;会话格式版本升至 11 / 序列状态版本 4 |
| 底层库 | ggml v0.26.0 |
| Web UI | Hugging Face Hub 数据层、模型下载管线、内存适配估算 |
数据来源:GitHub ggml-org/llama.cpp v0.6.0 发布说明。
提示:Qwen4Exp 与 Qwen3.8-Flash-Next 的对应关系来自社区实现与公开讨论,官方发布说明未直接使用 Qwen3.8-Flash-Next 名称;文中性能数据(DGX Spark 约 1.5 倍、Apple GPU 最高约 3 倍)均为官方口径,实际收益因模型规模、量化方案与硬件配置而异。v0.6.0 已可在 GitHub Releases 页面获取源码与各平台预编译包。
举手提问