9月17日,华为全联接大会2026期间,华为常务董事、ICT BG CEO杨超斌演讲并发布以灵衢互联为核心的集群与超节点协同计算架构,并推出覆盖柜内、跨柜与集群三级互联的灵衢互联设备,支持从单柜到百万卡集群的弹性扩展。
同日发布的还有基于灵衢的Agentic AI超节点集群,由鲲鹏950、昇腾960超节点、OceanStor M900记忆存储及星河UBG交换机组成。华为称,这套组合实现多样算力协同与分级资源池化。
灵衢是华为的统一互联协议。同日,华为副董事长、轮值董事长汪涛在另一场主题演讲中公布了昇腾960超节点与百万卡集群规划;杨超斌发布的灵衢互联,是这套算力系统的互联底座,解决的是超节点之间、集群内部的通信问题。
集群瓶颈在通信
杨超斌在演讲中给出一组传统计算架构的瓶颈数据:集群规模扩大时,资源利用率反而下降,十万卡集群的实际模型算力利用率仅约20%,大量算力处于等待通信完成的状态;10T参数大模型训练需要的中间数据,单卡内存已难以承载。
Agent让这个问题变得更复杂。Agent与模型每小时交互可达数百次,CPU与NPU需要灵活配比协同,产生的KV Cache远超内存容量。KV Cache是大模型推理时缓存的历史键值,上下文越长,占用内存越大,必须依靠跨系统、跨层级的存储。
华为马尔科夫实验室在同场大会另一场演讲中公布的仿真结果与此对应:由4K超节点组成的10万卡集群,MFU(模型浮点算力利用率)比8卡服务器方案提升2.75倍。两组数据指向同一个判断,集群内不同部件之间的互联与通信能力,已成为决定计算系统性能的关键。
灵衢的三级互联
杨超斌称,灵衢把十余种互联协议统一为灵衢协议,互联带宽从百GB级提升至TB级,RTT通信时延从7微秒压缩至2微秒,支持超节点内全局内存统一编址。
基于灵衢的计算系统有四个特征。协议归一、内存语义。多样算力、异构协同,CPU、NPU、内存、SSD通过灵衢直接互联,去中心化平等访问,CPU与NPU资源可灵活配比。分级存储、全局池化,将DDR作为NPU的第二内存,华为称此举可降低搜推广业务时延,千亿级、数千维向量检索性能翻番,并降低10T大模型训练对单卡HBM的容量需求,助力提升集群MFU。光电互联、灵活组网。
其中,AF分离部署是面向Agent场景的关键设计。华为通过分层分级Transformer硬加速,把Attention与FFN解耦,分别部署到不同算力单元,按业务需求灵活配比CPU与NPU资源,提升推理效率与资源利用率。
会上发布的分层分级灵衢互联设备覆盖三级互联。柜内灵衢互联刀片实现零电缆、零电路损耗,华为称一个4096超节点可节省196公里铜缆。跨柜灵衢互联设备支持176个端口,每端口1.6T,单机280T全光互联,RTT时延低至2微秒,华为称这是业界互联带宽最大、端口数最多的高速总线协议互联设备。星河UBG交换机具备1024的Radix扇出能力,华为称可支撑百万卡超节点集群,满足模型参数向几十万亿演进的需求。
灵衢也向小规模场景延伸。华为基于灵衢架构打造从1卡到8卡的系列化一体机及鲲鹏昇腾模组,其中Atlas 650E风冷服务器通过双机灵衢直连,实现16个NPU免交换互联,两台机器像一台一样运行,支持平滑扩容。华为称,中小企业可借此在本地运行万亿参数大模型。
生态开放与尚待验证
生态方面,昇腾与DeepSeek Harness、OpenCode、openJiuwen等开源框架协同,智能管理、推理加速、安全框架等Agent插件化组件全量开源。华为称,已联合50多家客户、伙伴及高校打造26个行业算子库,并与90多家主流开源社区合作,助力伙伴完成行业Agent开发与IT系统对接。
对行业而言,这场发布把算力竞争的重心上移了一层。单芯片性能之外,互联协议的归一程度、跨节点通信时延和资源池化能力,开始决定集群的有效算力。英伟达GB200 NVL72将72颗GPU接入同一个NVLink算力域、可扩展至576颗,是同一路线的另一种实现;华为的做法是把协议层统一为灵衢并对外开放,设备谱系从8卡一体机延伸到百万卡集群。
“华为将坚持系统级创新,构筑系列化算力底座,开源开放,联合客户、伙伴和开发者共建生态,为世界提供新选择。”杨超斌表示。
灵衢协议归一后,存量系统向灵衢迁移的成本与周期,以及发布产品的价格与上市节奏有待观察;Atlas一体机与26个行业算子库的实际落地效果,需在客户环境中检验;百万卡集群的支撑能力,依赖昇腾960等后续芯片按计划于2027年就绪。



