2026 年 8 月 26 日——阿里云通义千问团队正式开源多模态 MoE 模型 Qwen3.8-Flash-Next,模型权重与 FP8 量化版已同步上架 Hugging Face 与 ModelScope。据官方模型卡,该模型语言模型部分总参数 125B、每 token 激活 6B,原生支持 262,144 token 上下文并可扩展至 100 万 token,是下一代 Qwen4 架构的首个开源权重实验预览版本。

8 月 25 日,千问团队已在 ModelScope 上线该模型的预告页并公布开源时间(详见本栏目此前报道)。随本次权重一同公开的还有官方博客与技术报告(托管于 GitHub 的 QwenLM/Qwen3.8-Flash-Next 仓库),Qwen4 架构的关键设计首次完整对外披露。

1. 模型规格

项目 规格
模型类型 视觉编码器 + 因果语言模型(原生多模态)
语言模型参数 总参 125B,每 token 激活 6B
附加参数 51B N-gram 嵌入 + 4B MTP(多 token 预测)
层数与布局 48 层,12 ×(3 ×(Gated DeltaNet → MoE)→ 1 ×(QSA 稀疏注意力 → MoE))
专家配置 512 个专家,每 token 激活 10 个路由专家 + 1 个共享专家
上下文长度 原生 262,144 token,可扩展至 1,000,000 token
许可证 Qwen 社区协议 1.0(qwen-community-1.0,定制协议)
量化版本 FP8 版同步开源,权重约 168GB

数据口径说明:以上规格来自 Qwen3.8-Flash-Next 官方模型卡。

2. Qwen4 架构的四个新组件

据官方模型卡,相比 Qwen3.8 系列既有架构,Flash-Next 引入了四项新设计。其一,QSA 稀疏注意力:Gated DeltaNet 与 Gated Attention 的原有配对改为 Gated DeltaNet 与 Qwen Sparse Attention(QSA)组合,QSA 以微块为单位选择 token,官方称可显著降低长上下文延迟。其二,Gated Residual:通过逐元素读门与逐分支写门调节加宽的残差流,官方称在保持训练稳定的同时带来更细粒度的跨层表达能力,且推理开销较低。其三,N-gram 嵌入:以短 n-gram 索引引入 51B 参数,官方称其为一种比 MoE 计算量更低、更易卸载的参数扩展轴,适合内存受限的加速器。其四,训练配方:Muon 与 AdamW 优化器按权重类别分配,并依据重拟合的缩放律取消传统的 batch size 预热,直接以目标 batch size 开始训练。

3. 官方评测数据

官方模型卡给出了与 Qwen3.8-27B、Qwen3.7-Plus、DeepSeek-V4-Flash-0731、Claude-Opus-4.6 (Max) 的对比评测,其中 Qwen3.8-Flash-Next 的部分成绩如下:

评测项 指标 Qwen3.8-Flash-Next
Agents' Last Exam(前沿 Agent 任务) Pass@1 / Score 24.3 / 51.2
ClawEval-MM(多模态工具调用) Pass@3 / Average 64.4 / 60.4
OSWorld 2.0(电脑操作) Binary / Partial 19.4 / 52.3
MathVision(视觉数学解题) 无 CI / 有 CI 90.6 / 95.7
CharXiv RQ(科学图表分析) 无 CI / 有 CI 84.6 / 90.6

数据口径说明:表中成绩摘自官方模型卡评测表,各指标含义以官方技术报告为准。

4. 开源与使用

本次开源权重兼容 Hugging Face Transformers、vLLM、SGLang、TokenSpeed 等推理框架。官方同时提供托管 API 版本 Qwen3.8-Flash,基于 Flash-Next 构建,默认开放 100 万 token 上下文并内置官方工具,通过 Qwen Cloud 提供服务。需要注意的是,本次开源采用 Qwen 社区协议 1.0 定制许可证,而非 Qwen3.8-27B 所使用的 Apache 2.0,商用前需查阅许可证条款。