2026 年 8 月 13 日——阿里云通义千问团队于 2026 年 8 月 12 日晚至 13 日正式开放旗舰大模型 Qwen3.8-Max 的模型权重(仓库名 Qwen3.8-2.4T-A95B),同步上线 Hugging Face 与 ModelScope 平台。该模型总参数 2.4 万亿(2.4T),单个 Token 激活约 950 亿(95B)参数,是 Qwen 系列首次开源 Max 级旗舰模型权重。

2026 年 8 月 3 日,阿里云通义千问正式发布 Qwen3.8 系列,包括旗舰版 Qwen3.8-Max 与轻量版 Qwen3.8-27B,官方当时承诺两款模型的开放权重将于"约一周内"上线。8 月 12 日至 13 日,Max 级权重如期上架,Qwen3.8-27B 的开源时间则确认延后。

1. 开源详情

据官方发布信息,Qwen3.8-Max 开源权重已上线 ModelScope 与 Hugging Face,提供 BF16 完整权重(Qwen/Qwen3.8-2.4T-A95B)与官方 FP8 量化版(Qwen/Qwen3.8-2.4T-A95B-FP8)两个仓库,仓库体积约 4.89 TB。推理框架 vLLM、SGLang、TokenSpeed、Transformers 均提供支持。Unsloth AI 通过动态 1-bit 分层选择性量化技术将模型压缩至 397 GB,显存加内存合计达到 410 GB 以上即可本地运行。

与云端 API 版不同,开源权重版本为纯文本模型,且思考模式强制开启,多模态(图像、视频)能力仅通过 API 提供服务。

2. 模型规格与许可

项目 数据
模型名称 Qwen3.8-2.4T-A95B
总参数 / 激活参数 2.4 万亿 / 950 亿
架构 稀疏 MoE(Gated DeltaNet + MoE + Gated Attention)
层数与专家配置 92 层,每层 512 个专家,每次路由激活 10 个专家加 1 个共享专家
原生上下文 262,144 Token
扩展上下文 1,010,000 Token(约 100 万)
词表大小 248,320
输入模态 仅文本,思考模式强制开启
多 Token 预测 支持(MTP)

许可证采用定制协议(非 Apache 2.0),据官方发布的许可文件:原则上允许免费使用、复制、修改、再分发与商用,但需保留版权与许可声明;商业产品或服务月活用户超过 1 亿、或月收入超过 2000 万美元时,需在界面显著展示模型名称;MaaS 或 AI 工作助手业务近 12 个月合并营收超过 5000 万美元的厂商需另行获得授权,纯内部使用可豁免。

3. 性能表现

据官方公开的基准测试数据,Qwen3.8-2.4T-A95B 在多项评测中处于领先位置:

基准测试 得分 对比情况
PaperBench 93.0 高于 GPT-5.6 Sol、Fable 5、Claude Opus 4.8
OSWorld-Verified 86.1 参评模型中排名第一
参数化 CAD 基准 91.5 超过 Fable 5、GPT-5.6 Sol、Gemini 3.1 Pro
TerminalBench 2.1 86.6 低于 GPT-5.6 Sol 的 88.8
SWE-bench Pro 67.7 低于 Fable 5 的 80.0、Claude Opus 4.8 的 69.2

此前 8 月 3 日发布时,云端版 Qwen3.8-Max 在 Arena 榜单以 1496 分位列第 5,为排名最高的国产模型。

4. API 价格

Qwen3.8-Max 云端 API 已通过千问 AI 平台、百炼、Qoder 等渠道上线,价格以百万 Token 为单位,据官方公告:

项目 国内价格 海外价格
输入(百万 Token) 12 元 2 美元
输出(百万 Token) 36 元 6 美元
隐式缓存命中(百万 Token) 1.5 元 0.25 美元

5. Qwen3.8-27B 开源进展

Qwen3.8-27B 为系列中可单机部署的轻量版,定位为 Qwen3.6-27B 的直接继任者。据官方确认,27B 模型仍将开放权重,但发布时间已延后,目前没有明确日期。截至 2026 年 8 月 13 日,Hugging Face 官方 Qwen 组织下尚未出现 Qwen3.8-27B 仓库,网络中出现的相关 GGUF、FP8 仓库均为占位卡片,无权重文件,需以官方仓库上线为准。