AI超节点的概念最早由英伟达提出的,旨在解决大模型训练中成千上万张GPU协同工作时的“通信墙”问题。英伟达通过推出GB200 NVL72等超节点方案,将自家芯片、高速互联技术(如NVLink)和软件栈深度绑定,形成了强大的生态壁垒。相比传统算力集群,超节点集群可把大量AI晶片进行紧密连接,形成一个性能更强的计算单元,从而减少晶片之间的数据传输等待,提高大模型训练和推理过程中的有效算力。
7月17日,在上海举办的WAIC上,AI超节点集群成为亮点。华为、百度、阿里云、沐曦、中科曙光等国产厂商在2026年WAIC密集推出AI超节点集群产品和方案,标志着国产算力正式迈入“系统级竞争时代”。
7月17日,ICT巨头华为首次对外展示其迄今为止最强大的人工智能(AI)计算设备昇腾950超节点(Atlas 950 SuperPoD)晶片集群,这款设备的总算力是美国芯片巨头英伟达同级别系统的6.7倍。

从算力和芯片角度对比,华为至少攻克两大难关。一是芯片性能提升,华为推出的昇腾950PR和昇腾950DT这两款芯片,对比英伟达H20,实现芯片性能吊打。单卡FP4算力高达1.56 PFLOPS,单卡算力达到了英伟达H20的2.87倍。它们是华为昇腾系列神经网络处理器(NPU)家族中用于AI计算的最新型号。其中,专注于AI推理的昇腾950PR已于4月实现量产;而专为AI训练工作负载设计的昇腾950DT,则计划在第四季度正式发布。
英伟达网站信息显示,NVIDIA GB200 Grace Blackwell 超级芯片透过 900GB/s 超低功耗 NVLink 芯片到芯片互连技术将两个 NVIDIA B200 Tensor Core GPU 与 NVIDIA Grace CPU 连接起来。
华为徐直军曾经说过:“我们单颗芯片与英伟达是有差距的,但是长期投入连接技术,我们构筑的超节点,可以做到世界上最强,成为支撑中国和世界算力需求的坚实保证。”
华为宣称,其昇腾950PR的推理性能大约是英伟达H20 AI加速器的2.87倍,而成本仅为其四分之一左右。与英伟达的旗舰产品H200相比,华为昇腾950PR芯片在原始性能上仍有差距,但华为指出,通过Atlas 950平台将数千颗昇腾处理器集群互联,可以弥补这一差距。
二是连接技术。华为通过自研的“灵衢”协议和超节点架构,在连接规模、互联介质和系统协同上实现了对英伟达的差异化突破。
灵衢(UnifiedBus)协议的核心价值是“万卡超节点,一台计算机”。Atlas 950超节点最大支持8192张NPU卡的高速全互联,将成千上万张卡整合成一个逻辑上的单一系统。
GB200 NVL72系统通过第五代NVLink技术,主要将72张GPU连接成一个巨大的“超级GPU”。在单节点的连接规模上,华为实现了数量级的超越。灵衢协议还打破了计算(CPU/NPU)与存储(SSD/内存)之间的通信壁垒,实现了内存统一编址和资源全量池化。而英伟达的NVLink虽然提供了极高的带宽(1.8TB/s/GPU),但在超大规模集群的内存统一管理和资源池化方面,仍主要依赖传统的网络通信协议(如InfiniBand或RoCE),在系统级的协同效率上存在优化空间。
WAIC现场真机显示,昇腾950超节点产品基于灵衢互联协议和超节点架构,实现业界最大1024卡规模,提供1 EFLOPS FP8 、2 EFLOPS FP4澎湃算力,拥有256TB全局统一内存编址空间,依托TB级NPU互联超大带宽与3μs 超低RTT时延,突破集群内计算、存储等各类资源的通信瓶颈。通过系统性架构创新优化,实现全域资源统一高效调度,让整套超节点集群高效运行。
相比传统算力集群,超节点集群可把大量AI晶片进行紧密连接,形成一个性能更强的计算单元,从而减少晶片之间的数据传输等待,提高大模型训练和推理过程中的有效算力。
除了950超节点,昇腾还带来了Atlas 850E风冷超节点现场展示。该产品依托自研VCE相变散热技术与灵衢互联协议,无需对现有风冷IDC机房做液冷基建改造,标准机柜可直接上架部署,实现把超节点技术部署到传统机房,支持单个风冷超节点扩展至96卡商用部署,为企业提供高吞吐、低时延、长序列的推理性能体验,支撑Agentic推理业务快速规模化落地。
Atlas 850E原生覆盖FP8、mxFP8、HiF8、INT8、mxFP4全量低精格式,搭配4.0 TB/s高速内存带宽,可稳定实现10ms级时延推理,充分匹配Agent多轮对话、高频KV缓存读写的负载需求,实现多卡高效并行推理和内存资源池化,支持M级超长上下文。
韩国媒体 ETNews 上周报道,华为计划在2026年第四季度,凭借其昇腾950系列处理器和Atlas 950 SuperPod AI计算平台,正式进军韩国AI加速器市场。
7月17日,百度在WAIC上推出天池256超节点,天池256在吞吐性能上较上一代提升25%,同时完成包含文心、DeepSeek、GLM、MiniMax等主流模型的适配,推理效率提升50%,天池512超节点将在此基础上进一步跃升,单个超节点即可支撑万亿参数模型训练。
据悉,构成超节点的芯片层,百度自研昆仑芯P800此前已完成规模化验证,2025年至今已交付多个万卡集群。在昆仑芯全国产集群上,已成功完成对文心5.1重要版本的训练,整个集群的有效训练率达到97%,万卡规模集群线性扩展度超过85%,可以满足前沿大模型大规模训练对计算精度、算子稳定性、框架适配和长周期运行的要求。
7月18日,阿里云发布灵骏真武 M890 超节点实例,以超节点形态,为客户提供高速互联、开箱即用的 64 卡算力单元。

灵骏真武M890超节点实例支持 FP8/FP4 低精度计算,通过 ICN Switch 1.0 芯片Scale-up 互联规模由 16 卡拉升至 64 卡,卡间互联提升至 800GB/s。在智能驾驶、具身智能等训练场景中,相比上一代真武810E,其训练性能提升三倍;同时,凭借超大显存与全对称高速互联,一台超节点实例即可承载十万亿参数级 MoE 大模型的推理。
在本届WAIC上,沐曦股份推出的曦景S系列超节点产品正式亮相,曦景S600实现单机柜64卡高密度部署,通过柜内全互连架构,大幅降低数据交互时延,提升大模型并行计算效率,并灵活支持EP、TP等多维并行策略,全面覆盖大模型训练和推理场景。

在扩展能力方面,曦景S600支持柜内高速互连和柜间横向扩展,集群规模可灵活扩展至万卡级别,满足大型智算中心建设需求。
中科曙光在WAIC上向全球首次展示了中国首个全国产十万卡AI超级群—曙光8000,该设备采用超智融合技术路线,实现科学计算与智能计算原生融合,支持FP64至INT8全精度计算,可以覆盖科学计算、大模型训练与推理、工业仿真等多类场景。系统贯通芯片、计算、存储、网络、散热、应用和服务等关键环节,以全链路协同满足十万卡规模下多类型任务的复合计算需求。
曙光8000系统正式上线首周即实现满载运行,日均处理作业数突破15万个,单日处理作业峰值超过50万个。据介绍,曙光8000已完成近千项超智融合应用适配,可支撑大模型训练、高通量推理、科学计算等多个万卡级应用场景。
免责声明:本文为转载,非本网原创内容,不代表本网观点。其原创性以及文中陈述文字和内容未经本站证实,对本文以及其中全部或者部分内容、文字的真实性、完整性、及时性本站不作任何保证或承诺,请读者仅作参考,并请自行核实相关内容。
如有疑问请发送邮件至:bangqikeconnect@gmail.com