7月22日,AI超节点概念迎来集体走强,板块内个股表现亮眼,其中锐捷网络盘中触及20%涨停,华勤技术顺利封板,紫光股份、星网锐捷分别录得8.30%、9.43%的涨幅。本次行情核心催化来自2026世界人工智能大会,华为新一代Atlas 950 SuperPoD超节点真机首次公开亮相,标志着国内AI算力竞争逻辑正式迎来迭代,行业从过往单颗芯片性能比拼,全面转向大规模集群协同效率的角逐,通过数千张芯片协同调度,降低算力空置等待损耗,整体提升超大模型训练与推理的综合算力效率。
华为超节点商业化落地验证并持续迭代
华为超节点技术路线并非短期概念,已经完成商业化落地验证并持续迭代。上一代Atlas 900 A3机型自2025年3月启动交付,截至2026年二季度已累计部署超750套,服务政企客户超2000家,规模化商用基础扎实。
本次全新亮相的Atlas 950 SuperPoD定位更高端,整机满配可搭载8192颗Ascend 950DT芯片,包含128个计算柜与32个互联柜,整体占地约1000平方米,预计2026年第四季度正式上市。相较于前代产品,新机性能实现跨越式升级,计算卡数量提升21.3倍,片上内存从48TiB扩容至1152TiB,系统互联带宽从0.27PB/s提升至16PB/s,硬件规模实现量级突破。
从产业底层逻辑来看,超节点模式的诞生,核心是为了解决算力增长的结构性错配问题。过往八年,单节点芯片计算性能提升近40倍,但节点间通信带宽仅提升4至8倍,带宽迭代速度远远滞后于算力增速。
当前大模型参数规模持续扩容、上下文长度不断拉长,MoE混合专家模型普及,算力任务需要拆分至数百甚至数千张芯片并行运算,单卡完成计算后,需跨卡同步数据结果,一旦通信延迟高、调度不合理,新增算力资源会长期处于等待空置状态,无法转化为有效算力。而华为Atlas 950的核心价值,就是实现8192张芯片的一体化协同运转,摆脱传统服务器独立运行的割裂状态,让海量芯片如同单台设备的不同部件高效配合,证明系统架构优化能够弥补单纯硬件堆叠的效率短板。
超节点架构成为国产算力实现弯道超车的核心路径
国产AI芯片与海外高端产品存在客观参数差距,超节点架构成为国产算力实现弯道超车的核心路径。受制程工艺、内存技术等多重因素制约,单颗Ascend 950DT芯片的算力、内存、带宽参数不及英伟达同类产品,短期难以通过单芯片迭代实现赶超。
同时大模型运行存在动态资源需求差异,Prefill预处理阶段侧重算力消耗,Decode逐字生成阶段依赖内存与传输带宽,传统固定配比的服务器架构,无法适配动态变化的算力、内存需求,极易出现资源闲置或供给不足的问题。华为超节点通过全域资源统一调度,动态分配算力与内存资源,最大化盘活硬件资源,以集群协同的系统优势,弥补单芯片的性能短板。
超大模型无法在单芯片完整运行,并行计算架构成为刚需,也倒逼算力集群互联模式全面升级。行业主流采用张量并行、序列并行、专家并行三种拆分方式,将模型计算任务分摊至多卡运行,三种模式均需要高频次、大规模的数据交互,华为测试数据显示,模型超96%的通信需求来自各类并行计算任务。
传统数据中心以独立服务器为单元,通过外部网络互联,适配轻量化独立任务,但无法支撑大模型高频跨卡通信需求,服务器边界反而会形成通信瓶颈。华为Atlas 950重构集群架构,以64张卡为一个基础机架单元,16个机架组成1024卡Pod,8个Pod最终构成8192卡超级集群,将高频交互的算力单元集中在同一机架或Pod内,大幅缩短传输路径。
这套分层互联架构实现了效率、成本与稳定性的多重优化,优先将高速短距连接用于高频通信场景,整机约86.7%的数据交互依托低成本短距离电缆完成,仅6%的远距离传输使用高价光纤,大幅降低集群运行成本。同时系统搭载动态路由容错机制,单条线路故障时可自动切换传输路径,避免单点故障导致整体算力任务停滞,大幅提升超大规模集群的运行稳定性。目前相关性能数据均来自实验室测试环境,实际商用落地后的长期稳定性、效率表现,仍需大规模场景验证。
超节点打通了不同硬件的通信壁垒
华为超节点的核心突破不止于硬件堆叠,更依托灵衢UB 2.0统一互联协议,打通了不同硬件的通信壁垒。传统算力集群存在多套通信协议混用问题,CPU与GPU、GPU之间、服务器之间的传输标准各不相同,数据交互需要反复翻译、拷贝,产生大量性能损耗。灵衢UB 2.0协议实现CPU、NPU、内存的全域统一通信,硬件不再固定绑定配比,可根据模型运行阶段的需求动态调配资源,灵活适配算力密集型、带宽密集型不同任务场景。与此同时,超大规模集群对软件调度能力提出极高要求,数千张芯片、海量线路与机柜任意单元出现故障,都可能引发大面积任务停滞,需要智能调度系统实时排查问题、迁移任务,软件调度能力成为决定集群有效算力的核心关键。
前代Atlas 900 A3的规模化商用,已经验证了超节点模式的可行性与落地价值。基于384卡集群架构的老款机型,通过系统架构优化与智能调度,将整体算力利用率从37%提升至56%,模型训练周期大幅压缩,部分任务耗时从三周缩短至一周,同时推理成本下降40%至50%,推理延迟实现减半,充分证明系统级优化可以有效盘活算力资源、降低运营成本。
但Atlas 950硬件规模实现数十倍增长,系统复杂度呈几何级数提升,硬件性能的提升幅度大概率低于硬件规模的增长比例,通信损耗、调度难度、故障处理压力都会同步放大。目前产品尚未正式上市,芯片量产稳定性、内存供应能力、大规模机柜长期运行可靠性、软件调度体系适配性,均有待后续落地验证。
超节点规模化落地将带动算力全产业链增量需求
超节点规模化落地将带动算力全产业链增量需求,但细分环节受益程度存在明显分化,并非所有赛道都会随硬件规模同比增长。Atlas 950迭代升级,将直接带动计算卡、高速内存、PCB、供电模块、液冷系统、机柜等核心硬件的增量需求,但系统分层互联架构会重塑各环节价值占比。短距互联方案的普及,会弱化长距离光模块的增量弹性,而全新的互联架构、封装工艺,也会重构各类器件的供应链地位。
因此赛道投资不能只看技术题材贴合度,需要重点甄别四大核心要素,企业是否进入华为正式供货体系、单套系统内的产品价值占比、自身在供应链中的市占率、Atlas 950后续实际交付规模,是判断标的受益程度的核心标准。
整体来看,华为超节点战略的核心内核,是探索一条国产算力差异化突围路径,在单芯片性能存在短板的阶段,通过系统架构创新、全域互联优化、智能调度升级,以集群协同优势弥补硬件单点不足。前代产品的商用数据已经验证该模式的有效性,能够切实提升算力利用率、降低AI运营成本。但超大规模8192卡集群的落地,仍面临软硬件协同、供应链配套、长期稳定运行等多重挑战,行业后续的核心看点,不再是单纯的硬件规模扩容,而是如何持续降低通信与调度损耗,最大化释放真实有效的可用算力。
相关公司
一、算力芯片
海光信息拥有CPU+DCU双芯片布局,具备系统级协同优化能力,适配超节点大规模集群组网需求,多卡互联带宽优势突出,软件生态兼容性强,可有效支撑大模型分布式并行计算,深度受益国产超节点算力底座建设。
寒武纪依托思元系列云端大算力芯片与自研多芯互联技术,原生适配超节点分布式组网架构,可支撑万亿参数大模型与MoE模型高效运算,通过多级缓存架构优化集群算力效率,持续落地各地智算中心项目。
002***作为国内平台型半导体设备龙头,覆盖刻蚀、薄膜沉积、清洗、热处理等全品类设备,是国产算力芯片量产迭代的核心设备支撑,充分受益超节点带动的高端芯片产能扩张需求。
688***深耕刻蚀设备核心赛道,先进制程设备通过多重验证,覆盖多尺寸、多工艺刻蚀环节,适配高端AI算力芯片制造需求,为超节点核心芯片国产化提供关键设备保障。
300***具备高端电子功能性材料研发生产能力,可提供算力服务器、超节点机柜所需的导热、缓冲、屏蔽等配套材料,适配高密度算力集群散热与稳定运行需求。
二、华为整机及系统相关
软通动力深度参与华为算力生态建设,聚焦AI算力服务、大模型适配与超节点场景化落地,为华为超节点提供软件适配、运维调度与行业解决方案支撑。
超聚变依托华为技术积淀,专注服务器整机与算力基础设施,聚焦高端AI服务器与超节点硬件集成,是华为超节点硬件落地与规模化交付的核心载体。
000***具备完善的算力硬件分销与算力集群集成能力,深度对接华为超节点产品体系,可提供设备交付、集群部署、后期运维一体化服务,助力超节点商业化落地。
603***具备高端AI服务器整机研发制造能力,适配超节点高密度算力集群硬件需求,深度接入华为算力产业链,受益超节点整机规模化出货。
... ...
扫码回复“8-超节点”查看行业公司介绍,并可免费诊股,还可咨询实操指导服务!
作者:于晓明 执业证书编号:A0680622030012
7月22日,AI超节点概念迎来集体走强,板块内个股表现亮眼,其中锐捷网络盘中触及20%涨停,华勤技术顺利封板,紫光股份、星网锐捷分别录得8.30%、9.43%的涨幅。本次行情核心催化来自2026世界人工智能大会,华为新一代Atlas 950 SuperPoD超节点真机首次公开亮相,标志着国内AI算力竞争逻辑正式迎来迭代,行业从过往单颗芯片性能比拼,全面转向大规模集群协同效率的角逐,通过数千张芯片协同调度,降低算力空置等待损耗,整体提升超大模型训练与推理的综合算力效率。
华为超节点商业化落地验证并持续迭代
华为超节点技术路线并非短期概念,已经完成商业化落地验证并持续迭代。上一代Atlas 900 A3机型自2025年3月启动交付,截至2026年二季度已累计部署超750套,服务政企客户超2000家,规模化商用基础扎实。
本次全新亮相的Atlas 950 SuperPoD定位更高端,整机满配可搭载8192颗Ascend 950DT芯片,包含128个计算柜与32个互联柜,整体占地约1000平方米,预计2026年第四季度正式上市。相较于前代产品,新机性能实现跨越式升级,计算卡数量提升21.3倍,片上内存从48TiB扩容至1152TiB,系统互联带宽从0.27PB/s提升至16PB/s,硬件规模实现量级突破。
从产业底层逻辑来看,超节点模式的诞生,核心是为了解决算力增长的结构性错配问题。过往八年,单节点芯片计算性能提升近40倍,但节点间通信带宽仅提升4至8倍,带宽迭代速度远远滞后于算力增速。
当前大模型参数规模持续扩容、上下文长度不断拉长,MoE混合专家模型普及,算力任务需要拆分至数百甚至数千张芯片并行运算,单卡完成计算后,需跨卡同步数据结果,一旦通信延迟高、调度不合理,新增算力资源会长期处于等待空置状态,无法转化为有效算力。而华为Atlas 950的核心价值,就是实现8192张芯片的一体化协同运转,摆脱传统服务器独立运行的割裂状态,让海量芯片如同单台设备的不同部件高效配合,证明系统架构优化能够弥补单纯硬件堆叠的效率短板。
超节点架构成为国产算力实现弯道超车的核心路径
国产AI芯片与海外高端产品存在客观参数差距,超节点架构成为国产算力实现弯道超车的核心路径。受制程工艺、内存技术等多重因素制约,单颗Ascend 950DT芯片的算力、内存、带宽参数不及英伟达同类产品,短期难以通过单芯片迭代实现赶超。
同时大模型运行存在动态资源需求差异,Prefill预处理阶段侧重算力消耗,Decode逐字生成阶段依赖内存与传输带宽,传统固定配比的服务器架构,无法适配动态变化的算力、内存需求,极易出现资源闲置或供给不足的问题。华为超节点通过全域资源统一调度,动态分配算力与内存资源,最大化盘活硬件资源,以集群协同的系统优势,弥补单芯片的性能短板。
超大模型无法在单芯片完整运行,并行计算架构成为刚需,也倒逼算力集群互联模式全面升级。行业主流采用张量并行、序列并行、专家并行三种拆分方式,将模型计算任务分摊至多卡运行,三种模式均需要高频次、大规模的数据交互,华为测试数据显示,模型超96%的通信需求来自各类并行计算任务。
传统数据中心以独立服务器为单元,通过外部网络互联,适配轻量化独立任务,但无法支撑大模型高频跨卡通信需求,服务器边界反而会形成通信瓶颈。华为Atlas 950重构集群架构,以64张卡为一个基础机架单元,16个机架组成1024卡Pod,8个Pod最终构成8192卡超级集群,将高频交互的算力单元集中在同一机架或Pod内,大幅缩短传输路径。
这套分层互联架构实现了效率、成本与稳定性的多重优化,优先将高速短距连接用于高频通信场景,整机约86.7%的数据交互依托低成本短距离电缆完成,仅6%的远距离传输使用高价光纤,大幅降低集群运行成本。同时系统搭载动态路由容错机制,单条线路故障时可自动切换传输路径,避免单点故障导致整体算力任务停滞,大幅提升超大规模集群的运行稳定性。目前相关性能数据均来自实验室测试环境,实际商用落地后的长期稳定性、效率表现,仍需大规模场景验证。
超节点打通了不同硬件的通信壁垒
华为超节点的核心突破不止于硬件堆叠,更依托灵衢UB 2.0统一互联协议,打通了不同硬件的通信壁垒。传统算力集群存在多套通信协议混用问题,CPU与GPU、GPU之间、服务器之间的传输标准各不相同,数据交互需要反复翻译、拷贝,产生大量性能损耗。灵衢UB 2.0协议实现CPU、NPU、内存的全域统一通信,硬件不再固定绑定配比,可根据模型运行阶段的需求动态调配资源,灵活适配算力密集型、带宽密集型不同任务场景。与此同时,超大规模集群对软件调度能力提出极高要求,数千张芯片、海量线路与机柜任意单元出现故障,都可能引发大面积任务停滞,需要智能调度系统实时排查问题、迁移任务,软件调度能力成为决定集群有效算力的核心关键。
前代Atlas 900 A3的规模化商用,已经验证了超节点模式的可行性与落地价值。基于384卡集群架构的老款机型,通过系统架构优化与智能调度,将整体算力利用率从37%提升至56%,模型训练周期大幅压缩,部分任务耗时从三周缩短至一周,同时推理成本下降40%至50%,推理延迟实现减半,充分证明系统级优化可以有效盘活算力资源、降低运营成本。
但Atlas 950硬件规模实现数十倍增长,系统复杂度呈几何级数提升,硬件性能的提升幅度大概率低于硬件规模的增长比例,通信损耗、调度难度、故障处理压力都会同步放大。目前产品尚未正式上市,芯片量产稳定性、内存供应能力、大规模机柜长期运行可靠性、软件调度体系适配性,均有待后续落地验证。
超节点规模化落地将带动算力全产业链增量需求
超节点规模化落地将带动算力全产业链增量需求,但细分环节受益程度存在明显分化,并非所有赛道都会随硬件规模同比增长。Atlas 950迭代升级,将直接带动计算卡、高速内存、PCB、供电模块、液冷系统、机柜等核心硬件的增量需求,但系统分层互联架构会重塑各环节价值占比。短距互联方案的普及,会弱化长距离光模块的增量弹性,而全新的互联架构、封装工艺,也会重构各类器件的供应链地位。
因此赛道投资不能只看技术题材贴合度,需要重点甄别四大核心要素,企业是否进入华为正式供货体系、单套系统内的产品价值占比、自身在供应链中的市占率、Atlas 950后续实际交付规模,是判断标的受益程度的核心标准。
整体来看,华为超节点战略的核心内核,是探索一条国产算力差异化突围路径,在单芯片性能存在短板的阶段,通过系统架构创新、全域互联优化、智能调度升级,以集群协同优势弥补硬件单点不足。前代产品的商用数据已经验证该模式的有效性,能够切实提升算力利用率、降低AI运营成本。但超大规模8192卡集群的落地,仍面临软硬件协同、供应链配套、长期稳定运行等多重挑战,行业后续的核心看点,不再是单纯的硬件规模扩容,而是如何持续降低通信与调度损耗,最大化释放真实有效的可用算力。
相关公司
一、算力芯片
海光信息拥有CPU+DCU双芯片布局,具备系统级协同优化能力,适配超节点大规模集群组网需求,多卡互联带宽优势突出,软件生态兼容性强,可有效支撑大模型分布式并行计算,深度受益国产超节点算力底座建设。
寒武纪依托思元系列云端大算力芯片与自研多芯互联技术,原生适配超节点分布式组网架构,可支撑万亿参数大模型与MoE模型高效运算,通过多级缓存架构优化集群算力效率,持续落地各地智算中心项目。
002***作为国内平台型半导体设备龙头,覆盖刻蚀、薄膜沉积、清洗、热处理等全品类设备,是国产算力芯片量产迭代的核心设备支撑,充分受益超节点带动的高端芯片产能扩张需求。
688***深耕刻蚀设备核心赛道,先进制程设备通过多重验证,覆盖多尺寸、多工艺刻蚀环节,适配高端AI算力芯片制造需求,为超节点核心芯片国产化提供关键设备保障。
300***具备高端电子功能性材料研发生产能力,可提供算力服务器、超节点机柜所需的导热、缓冲、屏蔽等配套材料,适配高密度算力集群散热与稳定运行需求。
二、华为整机及系统相关
软通动力深度参与华为算力生态建设,聚焦AI算力服务、大模型适配与超节点场景化落地,为华为超节点提供软件适配、运维调度与行业解决方案支撑。
超聚变依托华为技术积淀,专注服务器整机与算力基础设施,聚焦高端AI服务器与超节点硬件集成,是华为超节点硬件落地与规模化交付的核心载体。
000***具备完善的算力硬件分销与算力集群集成能力,深度对接华为超节点产品体系,可提供设备交付、集群部署、后期运维一体化服务,助力超节点商业化落地。
603***具备高端AI服务器整机研发制造能力,适配超节点高密度算力集群硬件需求,深度接入华为算力产业链,受益超节点整机规模化出货。
... ...
扫码回复“8-超节点”查看行业公司介绍,并可免费诊股,还可咨询实操指导服务!
作者:于晓明 执业证书编号:A0680622030012