2026 年 8 月 20 日——2026 年世界人工智能大会(WAIC)上,超节点成为算力展区最核心的关键词。华为首次公开展出昇腾 950 超节点真机,沐曦发布曦景 S600,昆仑芯展出已量产交付的 32/64 卡超节点方案,中兴通讯联合壁仞科技等推出光互连超节点集群。行业共识正在形成:算力竞争已从单卡性能比拼,全面转向系统级综合能力的较量。

2026-08-20 · AI 基础设施 · 国产算力 · 超节点 · 商业化


一、概览

“超节点”并非新鲜概念,但在 2026 年 WAIC 上,产业界给出了更严格的技术定义。根据现场多家企业的共识性表述,真正的超节点必须具备三个核心特征:超大带宽、超低时延、统一内存编址。其中“统一内存编址”被视为灵魂——它意味着不同节点的内存被纳入同一个地址空间,任意处理器可直接通过 Load/Store 指令读写远端内存,无须经过额外的编解码流程。

按照这一标准,可以明确区分“真超节点”与“伪超节点”。后者本质上仍是传统服务器堆叠架构,依赖 PCIe 或 RoCE 协议互联,跨服务器带宽、时延受限,不支持内存语义的直接访问。

行业提问方式的转变,进一步揭示了竞争标准的迁移。多位算力服务商在大会期间表示,客户的问题已从“你们有多少张卡”转向“Token 成本多少,响应速度如何,系统能否稳定运行”。算力基础设施的评价标准,正在从峰值性能转向真实业务环境中的综合效率。

二、技术演进:为什么需要超节点?

2.1 大模型“长胖”,传统架构“撑不住”

大模型参数正从千亿迈向万亿甚至十万亿规模。传统 8 卡 GPU 服务器在处理万亿级 MoE(混合专家)模型时,芯片间的通信开销成为主要瓶颈。沐曦股份联合创始人、CTO 彭莉在 WAIC 期间指出:“GPU 之间的通信效率直接决定了集群的整体算力。当前业界涌现出超节点、光互联、铜线互联等多种技术路线,本质上都在解决同一个问题——让算力、存储和互联三者达到平衡。”

她把这个问题比作造飞机:“纯粹拥有高算力是不平衡的,就像拥有一个很强大的飞机发动机,但把它装到汽车上是没办法正常工作的。”在她看来,今天的 AI 芯片竞争已从纯粹的算力竞争变成系统级竞争,涵盖算力、存储、互联、散热和供电五个层面。

2.2 技术路线分化:GPU、TPU、3D 堆叠并行

本届 WAIC 上,一个明显变化是更多厂商开始从底层架构寻找差异化解法。除 GPU 外,异构众核、近存计算、光计算等方案集中亮相。

华为昇腾 950 超节点代表了国产算力系统的最高水平。它以单柜 64 卡为基本单元,最高可扩展至 8192 张 NPU 卡高速互联,采用全局统一内存编址与“灵衢”总线互联,可实现 256TB 跨物理节点统一内存编址,RTT 时延控制在 3 微秒以内。

东方算芯首次展出的 DF1000 走了一条差异化路线。该芯片采用“软件定义芯片+3D 堆叠近存计算”路线,采用国内 14 纳米成熟工艺,BF16 算力达 520 TFLOPS,访存带宽达 6.4TB/s。通过 3D 混合键合技术将计算层与存储层垂直堆叠集成,把互连间距从数十微米压缩至亚微米级别,在成熟制程上获得了接近先进制程产品的有效性能。

三、数据与市场规模

3.1 市场空间预测

华泰证券研报显示,2028 年国产超节点市场空间有望达到 3414 亿元,2026 年至 2028 年复合年增长率为 194%。超节点核心增量为 Scale-up(纵向扩展)环节,包括交换芯片、交换机和铜连接,整机柜、液冷、光模块等环节也将同步受益。

3.2 主要厂商超节点方案对比

厂商 关键产品 单节点规模 最大扩展规模 关键技术亮点 商业化状态
华为 昇腾 950 SuperPoD 64 卡 8192 卡 灵衢互联,统一内存编址,3μs RTT 2026 年 Q4 批量上市
华为 昇腾 384 超节点 384 卡 已商用 750+套
沐曦 曦景 S600 64 卡 万卡集群 OEX 正交架构,“三 0 设计” 已发布,推进交付
中科曙光 scaleX40 箱式超节点 40 卡 十万卡级 标准 19 英寸箱式设计 2026 年 3 月发布
昆仑芯 天池 32/64 卡超节点 32/64 卡 国内率先量产交付
壁仞科技 NPO 光互连超节点 1024 卡 BLink™2.0,NPO 光互连 千卡集群已落地

数据来源:综合自 WAIC 2026 各厂商公告、华泰证券研报及媒体报道。

四、商业落地:从“造出来”到“跑起来”

4.1 规模化才是真正的“考场”

彭莉在采访中将规模化分解为三个层次:第一是芯片的长期可靠性,“数据中心的产品要保证 5 年、每天 24 小时高强度工作下依然稳定”;第二是线性度,“100 张卡给你,能力是不是 100 张卡的×100?规模越大,能力的斜率能不能保持笔直?”;第三是集群稳定性。

华为在规模化方面走在前列。据华为披露,昇腾 384 超节点自 2025 年发布以来已规模商用 750 多套,覆盖互联网、运营商、金融、医疗、交通、制造等行业,是国内唯一训练出 SOTA(状态最优)模型的超节点。

4.2 两类商业模式并行

模式一:硬件整柜交付。 中科曙光 scaleX40 超节点采用标准 19 英寸箱式设计,单节点集成 40 张 GPU,总算力超过 28 PFLOPS(FP8 精度),HBM 显存容量超过 5TB,能满足万亿参数大模型的训练与推理需求。采购成本降至千万级,与 5 台 8 卡服务器的总成本相当,但训练和推理性能分别最高提升 120% 和 330%。这种“箱式”设计无需改造机房,数小时内即可完成部署。

模式二:Token 服务按需租用。 这一模式正在降低中小企业使用门槛。弘信电子在无锡建设的“Token 工厂”,首期部署 4 台华为昇腾 384 超节点服务器,单节点配备 384 卡算力,四节点联动组成大规模 GPU 算力集群,规模位居国内市场化 Token 工厂前列。

中国联通在湖北发布区域级智算训推一体节点,依托千卡智算中心底座,推出普惠 AI 算力套餐,首发 TokenPlan、CodingPlan 及融合套餐三类产品,免费发放 3000 万 Tokens,套餐首购、续订均享低至 2 折起特惠。

湖北移动也在布局 Token 经济,汇聚 200 余个大模型,推出“首年 Tokens 补贴+数字化转型咨询”服务,预计三年惠及企业超万家。

4.3 产业链订单放量

2026 年被行业认为是国产超节点落地元年,多家公司迎来订单放量。神州数码子公司成为国产智算词元工厂项目第一中标候选人,投标报价 7.17 亿元,将提供神州鲲泰超节点产品;华勤技术超节点产品第二季度启动小批量出货,第三季度将进入大规模交付阶段,预计全年超节点单项收入突破 100 亿元。

五、挑战与展望

5.1 “两三年”与“两三月”的错配

芯片迭代周期与模型迭代周期的错配,是行业面临的深层挑战。彭莉指出,一颗 AI 芯片从设计到生产制造再回片调试,需要两三年的时间;而 GPT、DeepSeek 等大模型的新架构层出不穷,每隔两三个月就有新的突破。

沐曦的解法是“在售一代、在研一代、预研一代”:“预研一定是要紧跟最前端的模型发展趋势,要有一定的技术判断。不然两年后推出一个新的芯片产品,到时候模型已经迭代全变掉了,产品就没有竞争力了。”

5.2 软件生态决定“好用”程度

超节点竞争并不仅仅是硬件规模竞争。随着 AI 基础设施复杂度提升,厂商需要同时解决芯片性能、互联效率、软件适配、集群调度以及实际部署等问题。沐曦自研的 MXMACA 软件栈正试图构建覆盖 GPU 驱动、集群管理、资源调度和 AI 开发环境的软硬协同体系。

浙江大学资深教授方兴东在分析昇腾发展路径时指出,AI 芯片已成为一种通用目的技术,“转化为通用产品后,AI 芯片面对的最大挑战不再是技术性能,而是产业生态的构建。通用根技术的成败不仅仅与技术本身有关,也涉及上下游设施、开发工具、配套软件等整个体系。”