2026 年 8 月 26 日——阿里云通义千问团队正式开源多模态 MoE 模型 Qwen3.8-Flash-Next,模型权重与 FP8 量化版已同步上架 Hugging Face 与 ModelScope。据官方模型卡,该模型语言模型部分总参数 125B、每 token 激活 6B,原生支持 262,144 token 上下文并可扩展至 100 万 token,是下一代 Qwen4 架构的首个开源权重实验预览版本。
8 月 25 日,千问团队已在 ModelScope 上线该模型的预告页并公布开源时间(详见本栏目此前报道)。随本次权重一同公开的还有官方博客与技术报告(托管于 GitHub 的 QwenLM/Qwen3.8-Flash-Next 仓库),Qwen4 架构的关键设计首次完整对外披露。
1. 模型规格
| 项目 | 规格 |
|---|---|
| 模型类型 | 视觉编码器 + 因果语言模型(原生多模态) |
| 语言模型参数 | 总参 125B,每 token 激活 6B |
| 附加参数 | 51B N-gram 嵌入 + 4B MTP(多 token 预测) |
| 层数与布局 | 48 层,12 ×(3 ×(Gated DeltaNet → MoE)→ 1 ×(QSA 稀疏注意力 → MoE)) |
| 专家配置 | 512 个专家,每 token 激活 10 个路由专家 + 1 个共享专家 |
| 上下文长度 | 原生 262,144 token,可扩展至 1,000,000 token |
| 许可证 | Qwen 社区协议 1.0(qwen-community-1.0,定制协议) |
| 量化版本 | FP8 版同步开源,权重约 168GB |
数据口径说明:以上规格来自 Qwen3.8-Flash-Next 官方模型卡。
2. Qwen4 架构的四个新组件
据官方模型卡,相比 Qwen3.8 系列既有架构,Flash-Next 引入了四项新设计。其一,QSA 稀疏注意力:Gated DeltaNet 与 Gated Attention 的原有配对改为 Gated DeltaNet 与 Qwen Sparse Attention(QSA)组合,QSA 以微块为单位选择 token,官方称可显著降低长上下文延迟。其二,Gated Residual:通过逐元素读门与逐分支写门调节加宽的残差流,官方称在保持训练稳定的同时带来更细粒度的跨层表达能力,且推理开销较低。其三,N-gram 嵌入:以短 n-gram 索引引入 51B 参数,官方称其为一种比 MoE 计算量更低、更易卸载的参数扩展轴,适合内存受限的加速器。其四,训练配方:Muon 与 AdamW 优化器按权重类别分配,并依据重拟合的缩放律取消传统的 batch size 预热,直接以目标 batch size 开始训练。
3. 官方评测数据
官方模型卡给出了与 Qwen3.8-27B、Qwen3.7-Plus、DeepSeek-V4-Flash-0731、Claude-Opus-4.6 (Max) 的对比评测,其中 Qwen3.8-Flash-Next 的部分成绩如下:
| 评测项 | 指标 | Qwen3.8-Flash-Next |
|---|---|---|
| Agents' Last Exam(前沿 Agent 任务) | Pass@1 / Score | 24.3 / 51.2 |
| ClawEval-MM(多模态工具调用) | Pass@3 / Average | 64.4 / 60.4 |
| OSWorld 2.0(电脑操作) | Binary / Partial | 19.4 / 52.3 |
| MathVision(视觉数学解题) | 无 CI / 有 CI | 90.6 / 95.7 |
| CharXiv RQ(科学图表分析) | 无 CI / 有 CI | 84.6 / 90.6 |
数据口径说明:表中成绩摘自官方模型卡评测表,各指标含义以官方技术报告为准。
4. 开源与使用
本次开源权重兼容 Hugging Face Transformers、vLLM、SGLang、TokenSpeed 等推理框架。官方同时提供托管 API 版本 Qwen3.8-Flash,基于 Flash-Next 构建,默认开放 100 万 token 上下文并内置官方工具,通过 Qwen Cloud 提供服务。需要注意的是,本次开源采用 Qwen 社区协议 1.0 定制许可证,而非 Qwen3.8-27B 所使用的 Apache 2.0,商用前需查阅许可证条款。
举手提问