2026 年 9 月 2 日——科大讯飞全资子公司词元星火推出并开源星火 X2.5-4B 与星火 X2.5-1.7B 两款端侧通用大模型。据官方信息,两款模型为端侧首次原生支持最长 100 万 Token 上下文,采用混合注意力架构,围绕智能体、代码、数学和指令遵循等能力进行优化,模型权重已在 Hugging Face、GitHub 等平台开放。
两款模型基于全国产算力平台完成全流程训练,据官方 GitHub 仓库介绍,训练基于华为昇腾集群完成,使用约 20 万亿 Token 多样化数据预训练,并通过高质量监督微调与强化学习训练。据官方 GitHub 仓库与 Hugging Face 模型卡,两款模型以 Apache 2.0 许可证开源,可免费商用;模型权重已于 2026 年 9 月 1 日(北京时间)在 Hugging Face、GitHub、ModelScope 等平台上线,对应模型 API 已上线讯飞星辰 MaaS 平台,限时免费开放。
词元星火为科大讯飞全资子公司,据公开报道,该公司于 2026 年 6 月 9 日科大讯飞 27 周年司庆现场宣布设立,由科大讯飞董事长刘庆峰对外公布,公司定位面向 Token 经济市场。
1. 百万级上下文与混合注意力架构
星火 X2.5-4B 与 1.7B 原生支持最长 100 万 Token 上下文窗口,训练覆盖长篇文档、技术资料等场景。官方表示,模型可在一次任务中接收并理解整份产品售后手册、会议材料或代码仓库,用于长文档问答、跨章节规则关联等任务。
据官方 GitHub 仓库介绍,实现百万级上下文的关键是混合注意力架构:模型由 1 个全注意力层与 3 个滑窗注意力层组合,在降低长上下文计算开销的同时原生支持最长 1048576(约 100 万)Token 上下文窗口,并支持 200 余种语言。
据官方 Hugging Face 模型配置信息,X2.5-4B 的具体规格如下:
| 项目 | 数据 |
|---|---|
| 参数量 | X2.5-4B 为 4,112,079,360(BF16);X2.5-1.7B 为 1,707,657,216 |
| 上下文长度 | 原生最大 1,048,576 Token |
| 词表大小 | 131,072 |
| 注意力架构 | 36 层,每 4 层由 1 个全注意力层与 3 个滑窗注意力层组成(滑窗 512),GQA 分组查询注意力,4 个 KV 头,16 个注意力头,hidden size 2560 |
2. 场景能力与实测数据
| 场景 | 能力与数据 |
|---|---|
| 个人办公 | 覆盖数据处理、文档生成与翻译,可实现从销售数据汇总到中英文双语报告交付的完整流程 |
| 代码开发 | X2.5-4B 在算法实现、代码补全等任务中对标参数规模大 2 至 3 倍的云端模型 |
| 智能家居 | Domux 测试集上 X2.5-1.7B 控制指令端到端执行正确率 90.3%,平均响应时间 0.85 秒 |
| 机器人 | 支持操作控制、目标追踪、导航决策等连续执行任务,可部署于机器人本体或边缘设备 |
在代码开发场景中,官方表示开发者可通过 DeepSeek Harness、OpenCode、Codex、Pi 等开源 Harness 将模型接入本地开发与自动化脚本流程。据官方 GitHub 仓库介绍,模型还深度集成了 Codex、Claude Code、OpenClaw、Hermes 等主流 Agent 工具。
2.1 基准评测数据
据官方 GitHub 仓库评测表(thinking 模式,推荐采样温度 1.0、top_p 0.95,* 为官方引用公开模型卡数据),两款模型在多项基准上的得分如下,对比列为官方评测表中得分最高的同级别对手模型:
| 评测基准 | X2.5-4B | X2.5-1.7B | 官方评测表对比(最高对手) |
|---|---|---|---|
| BFCL-V4(Agent 工具调用) | 65.1 | 46.9 | Qwen3.5-9B:66.1 |
| τ²-bench | 75.1 | 65.3 | Qwen3.5-4B:79.9 |
| τ³-bench | 30.4(第一) | 20.1 | Qwen3.5-9B:9.3 |
| MCP-Atlas | 54.6(第一) | 23.4 | Qwen3.5-9B:47.4 |
| SWE-Bench Pro | 44.4(第一) | 10.4 | Qwen3.5-9B:33.8 |
| SWE-Bench Verified | 41.6 | 28.3 | Qwen3.5-9B:53.1 |
| 高考 2026(满分 150) | 133.4 | 114.8 | Qwen3.5-9B:135.5 |
| AIME 2026 | 90.7(第一) | 69.4 | Qwen3.5-9B:88.2 |
| GPQA | 67.4 | 43.8 | Qwen3.5-9B:77.2 |
官方称 X2.5-4B 在 τ³-bench、MCP-Atlas、MCP-Mark、Workspace Bench、VitaBench2.0、BrowseComp、SWE-Bench Pro、SWE-Bench Multilingual、AIME 2026、HMMT、IMO-AnswerBench、IFBench 共 12 项基准上为官方评测表所列模型中得分最高,部分项目得分超过 Gemma4-12B 等参数规模更大的模型。以上评测数据均为官方自报,截至发稿未经第三方独立复测。
下载量参考(截至 2026 年 9 月 2 日发布次日):Hugging Face 上 X2.5-4B 下载 429 次、X2.5-1.7B 下载 197 次;ModelScope 上 X2.5-4B 下载 79 次;Ollama 上 X2.5-4B 拉取 266 次、X2.5-1.7B 拉取 144 次。
3. 部署支持
两款模型支持英伟达、华为、海光及后摩等硬件平台,兼容 vLLM、SGLang、llama.cpp、MLX 等主流推理框架,可通过 Ollama、LM Studio 等工具快速部署,并支持使用 LLaMA-Factory 开展增量训练。官方另提供 vLLM 适配插件 Spark-plugin 与自有 LLaMA-Factory 分支,均位于 GitHub 的 XHToken 组织下。
4. 开源地址与许可证
| 平台 | 地址 | 说明 |
|---|---|---|
| GitHub | https://github.com/XHToken/Spark-X2.5 | 官方代码仓库,含模型介绍、部署与微调文档 |
| Hugging Face | https://huggingface.co/collections/XHToken/spark-x25 | 官方模型集合 |
| Hugging Face(4B) | https://huggingface.co/XHToken/Spark-X2.5-4B | 星火 X2.5-4B 模型权重 |
| Hugging Face(1.7B) | https://huggingface.co/XHToken/Spark-X2.5-1.7B | 星火 X2.5-1.7B 模型权重 |
| ModelScope | https://www.modelscope.cn/collections/XHToken/Spark-X25 | 国内用户推荐下载渠道 |
| Modelers | https://modelers.cn/user/XHToken | 昇腾芯片用户推荐渠道 |
| Ollama | https://ollama.com/SparkLLM | 通过 Ollama 本地运行 |
| SCNet | https://www.scnet.cn/ui/aihub/models/XHToken/Spark-X2.5-4B | 海光芯片用户推荐渠道 |
Hugging Face 上另提供 GGUF 量化版与预训练底座版本,分别为 XHToken/Spark-X2.5-4B-GGUF、XHToken/Spark-X2.5-1.7B-GGUF 和 XHToken/Spark-X2.5-4B-Base、XHToken/Spark-X2.5-1.7B-Base。
据官方 GitHub 仓库与 Hugging Face 模型卡,星火 X2.5 模型系列采用 Apache 2.0 许可证开源,可免费商用。
5. 后续安排
据官方信息,科大讯飞将于 2026 年 9 月 7 日正式发布全新一代旗舰通用大模型星火 X2.5,进一步升级代码与智能体等核心能力。
举手提问