国产AI算力进入“万卡一机”时代,超节点站上C位

赵颖、卜淑情
国产AI算力竞争正从“拼芯片”转向“拼系统”。华为首次展示Atlas 950超节点,支持1024卡互联、最高8192卡扩展,推动市场重估超节点产业链机会。超节点仍处于从技术验证走向大规模产业化的关键阶段,关注四季度产品交付及实际训练效果验证。

国产AI算力的竞争重心正在从单颗芯片性能,转向以互联、内存、调度和可靠性为核心的系统能力。超节点通过将数千颗芯片组织为一台逻辑计算机,成为国产厂商缩小算力差距、承接大模型训练需求的重要路径。

据上海证券报,华为在2026年世界人工智能大会(WAIC)上首次以真机展示Atlas 950 SuperPoD。该产品基于灵衢互联协议和超节点架构,实现业界最大1024卡规模,提供1 EFLOPS FP8 、2 EFLOPS FP4澎湃算力,拥有256TB全局统一内存编址空间,依托TB级NPU互联超大带宽与3μs 超低RTT时延,突破集群内计算、存储等各类资源的通信瓶颈。

这一进展迅速成为资本市场关注点。近期,A股超节点概念龙头走出4天3板行情,反映出市场正在重新评估国产AI硬件从单卡替代向系统级扩张的商业空间。浙商证券在7月21日的最新报告中指出,芯片、先进封装、光互联、交换设备、液冷和整机交付等环节,均可能受益于超节点的规模化建设。

不过,超节点仍处于从技术验证走向大规模产业化的关键阶段。Atlas 950上市后的训练效率、8,192卡规模下的系统线性度、芯片量产及供应链保障能力,将决定“万卡一机”的技术叙事能否转化为可持续的商业需求。

从单芯片追赶转向系统层突围

国产AI算力押注超节点,背后是供给限制与模型需求升级的共同推动。

供给侧,先进制程和高带宽存储等关键环节仍是国产AI芯片发展的约束。不过,需求侧则在加速抬高系统能力门槛。大模型正向万亿参数、MoE稀疏架构、长上下文和多模态方向演进,单机已难以容纳完整模型训练所需的计算和内存资源,多卡并行成为必然选择。

与此同时,计算能力与通信带宽的增长并不同步。素材显示,过去约8年,单节点计算能力增长约40倍,而节点间通信带宽仅增长约4至8倍。传统Scale-out架构面临通信、内存和资源利用率瓶颈,单纯增加服务器数量,未必能有效转化为模型训练效率。

浙商证券分析师刘雯蜀、郑毅指出,有效Token产出并非由单一算力指标决定,而是算力、内存容量与带宽、互联、资源编排及可靠性共同作用的系统工程。对国产厂商而言,超节点的意义正在于以系统级协同,弥补单卡性能上的差距。

Atlas 950瞄准从百卡到万卡的跃迁

华为超节点产品已覆盖不同规模的算力需求,Atlas 950 SuperPoD则是其向万卡级Scale-up域推进的核心产品。

据21世纪经济报道,昇腾950超节点基于灵衢互联协议和超节点架构,实现业界最大1024卡规模,提供1 EFLOPS FP8、2 EFLOPS FP4算力,拥有256TB全局统一内存编址空间,依托TB级NPU互联超大带宽与3μs超低RTT时延,突破集群内计算、存储等各类资源的通信瓶颈。通过系统性架构创新优化,实现全域资源统一高效调度,让整套超节点集群高效运行。

在满配状态下,昇腾950超节点由128个计算柜和32个互联柜组成,共计160个机柜,占地面积约1000平方米,搭载8192颗昇腾950DT芯片,计划于2026年第四季度上市。

商业化验证将决定市场预期

资本市场对超节点的关注,正从概念阶段转向交付、性能和需求的验证阶段。

第一个关键指标是Atlas 950上市后,在国产大模型训练场景中的实际效率。若系统能够在训练吞吐、模型利用率、推理成本和稳定性等方面接近预期,将验证国产AI算力通过系统架构实现突破的可行性。

第二个关键指标是万卡规模下的线性度。UB-Mesh能否在8,192卡规模下持续实现95%以上线性度,将是判断其互联架构是否具备大规模商用能力的重要依据。

此外,芯片良率、软件适配、互联可靠性和供应链稳定性也将影响产品交付节奏。

需求端同样存在变量。超节点建设依赖AI资本开支和政企客户的投资意愿,且对机房空间、供电、液冷等基础设施提出更高要求,项目建设周期可能延长。

国产AI算力能否从“单芯片追赶”走向“系统级突围”,最终仍需Atlas 950的实际交付和运行数据验证。2026年第四季度,将成为超节点路线能否兑现市场预期的重要观察窗口。

风险提示及免责条款
市场有风险,投资需谨慎。本文不构成个人投资建议,也未考虑到个别用户特殊的投资目标、财务状况或需要。用户应考虑本文中的任何意见、观点或结论是否符合其特定状况。据此投资,责任自负。
相关文章