2026 年 9 月 2 日——科大讯飞全资子公司词元星火推出并开源星火 X2.5-4B 与星火 X2.5-1.7B 两款端侧通用大模型。据官方信息,两款模型为端侧首次原生支持最长 100 万 Token 上下文,采用混合注意力架构,围绕智能体、代码、数学和指令遵循等能力进行优化,模型权重已在 Hugging Face、GitHub 等平台开放。

两款模型基于全国产算力平台完成全流程训练,据官方 GitHub 仓库介绍,训练基于华为昇腾集群完成,使用约 20 万亿 Token 多样化数据预训练,并通过高质量监督微调与强化学习训练。据官方 GitHub 仓库与 Hugging Face 模型卡,两款模型以 Apache 2.0 许可证开源,可免费商用;模型权重已于 2026 年 9 月 1 日(北京时间)在 Hugging Face、GitHub、ModelScope 等平台上线,对应模型 API 已上线讯飞星辰 MaaS 平台,限时免费开放。

词元星火为科大讯飞全资子公司,据公开报道,该公司于 2026 年 6 月 9 日科大讯飞 27 周年司庆现场宣布设立,由科大讯飞董事长刘庆峰对外公布,公司定位面向 Token 经济市场。

1. 百万级上下文与混合注意力架构

星火 X2.5-4B 与 1.7B 原生支持最长 100 万 Token 上下文窗口,训练覆盖长篇文档、技术资料等场景。官方表示,模型可在一次任务中接收并理解整份产品售后手册、会议材料或代码仓库,用于长文档问答、跨章节规则关联等任务。

据官方 GitHub 仓库介绍,实现百万级上下文的关键是混合注意力架构:模型由 1 个全注意力层与 3 个滑窗注意力层组合,在降低长上下文计算开销的同时原生支持最长 1048576(约 100 万)Token 上下文窗口,并支持 200 余种语言。

据官方 Hugging Face 模型配置信息,X2.5-4B 的具体规格如下:

项目 数据
参数量 X2.5-4B 为 4,112,079,360(BF16);X2.5-1.7B 为 1,707,657,216
上下文长度 原生最大 1,048,576 Token
词表大小 131,072
注意力架构 36 层,每 4 层由 1 个全注意力层与 3 个滑窗注意力层组成(滑窗 512),GQA 分组查询注意力,4 个 KV 头,16 个注意力头,hidden size 2560

2. 场景能力与实测数据

场景 能力与数据
个人办公 覆盖数据处理、文档生成与翻译,可实现从销售数据汇总到中英文双语报告交付的完整流程
代码开发 X2.5-4B 在算法实现、代码补全等任务中对标参数规模大 2 至 3 倍的云端模型
智能家居 Domux 测试集上 X2.5-1.7B 控制指令端到端执行正确率 90.3%,平均响应时间 0.85 秒
机器人 支持操作控制、目标追踪、导航决策等连续执行任务,可部署于机器人本体或边缘设备

在代码开发场景中,官方表示开发者可通过 DeepSeek Harness、OpenCode、Codex、Pi 等开源 Harness 将模型接入本地开发与自动化脚本流程。据官方 GitHub 仓库介绍,模型还深度集成了 Codex、Claude Code、OpenClaw、Hermes 等主流 Agent 工具。

2.1 基准评测数据

据官方 GitHub 仓库评测表(thinking 模式,推荐采样温度 1.0、top_p 0.95,* 为官方引用公开模型卡数据),两款模型在多项基准上的得分如下,对比列为官方评测表中得分最高的同级别对手模型:

评测基准 X2.5-4B X2.5-1.7B 官方评测表对比(最高对手)
BFCL-V4(Agent 工具调用) 65.1 46.9 Qwen3.5-9B:66.1
τ²-bench 75.1 65.3 Qwen3.5-4B:79.9
τ³-bench 30.4(第一) 20.1 Qwen3.5-9B:9.3
MCP-Atlas 54.6(第一) 23.4 Qwen3.5-9B:47.4
SWE-Bench Pro 44.4(第一) 10.4 Qwen3.5-9B:33.8
SWE-Bench Verified 41.6 28.3 Qwen3.5-9B:53.1
高考 2026(满分 150) 133.4 114.8 Qwen3.5-9B:135.5
AIME 2026 90.7(第一) 69.4 Qwen3.5-9B:88.2
GPQA 67.4 43.8 Qwen3.5-9B:77.2

官方称 X2.5-4B 在 τ³-bench、MCP-Atlas、MCP-Mark、Workspace Bench、VitaBench2.0、BrowseComp、SWE-Bench Pro、SWE-Bench Multilingual、AIME 2026、HMMT、IMO-AnswerBench、IFBench 共 12 项基准上为官方评测表所列模型中得分最高,部分项目得分超过 Gemma4-12B 等参数规模更大的模型。以上评测数据均为官方自报,截至发稿未经第三方独立复测。

下载量参考(截至 2026 年 9 月 2 日发布次日):Hugging Face 上 X2.5-4B 下载 429 次、X2.5-1.7B 下载 197 次;ModelScope 上 X2.5-4B 下载 79 次;Ollama 上 X2.5-4B 拉取 266 次、X2.5-1.7B 拉取 144 次。

3. 部署支持

两款模型支持英伟达、华为、海光及后摩等硬件平台,兼容 vLLM、SGLang、llama.cpp、MLX 等主流推理框架,可通过 Ollama、LM Studio 等工具快速部署,并支持使用 LLaMA-Factory 开展增量训练。官方另提供 vLLM 适配插件 Spark-plugin 与自有 LLaMA-Factory 分支,均位于 GitHub 的 XHToken 组织下。

4. 开源地址与许可证

平台 地址 说明
GitHub https://github.com/XHToken/Spark-X2.5 官方代码仓库,含模型介绍、部署与微调文档
Hugging Face https://huggingface.co/collections/XHToken/spark-x25 官方模型集合
Hugging Face(4B) https://huggingface.co/XHToken/Spark-X2.5-4B 星火 X2.5-4B 模型权重
Hugging Face(1.7B) https://huggingface.co/XHToken/Spark-X2.5-1.7B 星火 X2.5-1.7B 模型权重
ModelScope https://www.modelscope.cn/collections/XHToken/Spark-X25 国内用户推荐下载渠道
Modelers https://modelers.cn/user/XHToken 昇腾芯片用户推荐渠道
Ollama https://ollama.com/SparkLLM 通过 Ollama 本地运行
SCNet https://www.scnet.cn/ui/aihub/models/XHToken/Spark-X2.5-4B 海光芯片用户推荐渠道

Hugging Face 上另提供 GGUF 量化版与预训练底座版本,分别为 XHToken/Spark-X2.5-4B-GGUF、XHToken/Spark-X2.5-1.7B-GGUF 和 XHToken/Spark-X2.5-4B-Base、XHToken/Spark-X2.5-1.7B-Base。

据官方 GitHub 仓库与 Hugging Face 模型卡,星火 X2.5 模型系列采用 Apache 2.0 许可证开源,可免费商用。

5. 后续安排

据官方信息,科大讯飞将于 2026 年 9 月 7 日正式发布全新一代旗舰通用大模型星火 X2.5,进一步升级代码与智能体等核心能力。