算力集群规模持续大幅扩容
过往AI服务器市场以8卡机型为主流部署形态,当前行业算力集群规模正在快速扩张。英伟达GB200NVL72架构已实现单系统集成72颗GPU的高速互联算力体系,而国产整机产品集群规模进一步突破。中科曙光scaleX640机型可在单机柜部署640张计算卡,华为、阿里、字节等国内头部企业也已陆续推出或规划更大规格的AI超节点产品。根据国海证券研判,伴随国产AI芯片、互联协议、整机解决方案持续成熟,2026年国产超节点将全面进入规模化出货阶段。
大模型MoE架构普及,传统8卡集群遭遇通信瓶颈
当前主流大模型普遍采用MoE混合专家架构,将整体模型拆分为多个独立专家模块。模型每处理一组Token数据时,系统会根据内容特征调度对应专家模块参与运算,而不同专家模块通常分布在不同GPU算力卡上。
批量Token数据输入后,需要完成跨GPU数据分发、分布式计算、结果汇总回传的完整流程,过程中大量GPU会同时产生双向数据交互,形成行业所说的All-to-All全互联通信需求。随着模型参数规模扩容、参与计算的GPU数量增加,高频跨卡通信成为常态。
传统小规模服务器集群卡间网络带宽不足,GPU完成本地计算后,需要长时间等待其他设备的数据传输结果,导致硬件理论算力无法充分释放,大量算力闲置空转。超节点架构的核心价值,就是将高频交互的GPU集中在统一高速互联体系内,最大限度缩短数据传输时延。对比传统互联方案,PCIe7.0单卡双向带宽上限约512GB/s,而新一代NVLink6互联带宽可达3.6TB/s,带宽大幅提升后,跨卡数据传输时间显著缩短,彻底缓解算力等待的通信瓶颈。
大模型推理落地,显存容量与带宽成为核心约束
大模型训练阶段主要受制于卡间通信效率,而推理阶段的核心瓶颈转变为显存资源。大模型推理分为两个核心环节,分别是Prefill预填充阶段与Decode生成阶段。Prefill阶段需要一次性批量处理海量Token,对GPU瞬时计算能力要求较高;Decode阶段需要逐一生成Token,同时反复调用历史计算数据。
为避免重复计算消耗算力与时间,系统会将中间运算结果以KVCache的形式暂存于显存之中。模型上下文长度越长、同时在线推理用户越多,KVCache占用的显存资源就越大。在实际落地场景中,经常出现GPU仍有算力余量,但显存容量、显存带宽耗尽,无法继续承载推理任务的情况。
超节点通过整合数百张GPU的显存资源,依托统一内存寻址技术优化资源调度。传统架构下,GPU访问其他设备数据需要完整复制迁移,统一编址技术将多设备内存纳入同一地址空间,支持GPU直接跨设备寻址调用数据,减少冗余数据搬运。同时依靠底层操作系统与调度软件,精细化区分本地显存与远端内存的数据分配,最大化释放集群显存资源,解决推理场景的显存约束问题。整体来看,超节点需要同步解决跨卡通信、显存调度、网络架构、软件调度等整套系统性难题。
算力集群双层网络架构分工明确
大规模AI算力集群分为Scale-Up与Scale-Out两层网络架构,分别承担不同的算力协同功能。Scale-Up聚焦超节点内部互联,服务机柜内数十至数百张GPU的高频协同计算。训练场景下GPU之间数据交互极其频繁,因此该层级核心追求超高带宽、超低时延,行业技术标准将Scale-Up时延目标锁定在百纳秒至亚微秒级别,保障单超节点内部算力高效协同。
Scale-Out负责多超节点之间的集群互联,将多个独立超节点组网联动,构建万卡、十万卡级别的超大算力集群。该层级数据交互频次远低于节点内部,无需极致低时延,行业普遍采用InfiniBand、RoCE以太网技术方案实现组网。简单来说,Scale-Up优化单超节点内部的算力协同效率,Scale-Out实现海量超节点的集群规模化整合,大模型迭代升级背景下,两层网络架构同步迎来升级迭代。
英伟达新一代架构实现全栈算力系统升级
英伟达最新VeraRubin架构,完整体现了当前AI超节点的系统化发展趋势,不再是单一GPU硬件迭代,而是全套算力体系的整体升级。整套架构涵盖RubinGPU、VeraCPU、NVLink6交换芯片、ConnectX-9网卡、BlueField-4DPU、Spectrum-6交换芯片、Groq3LPU七类核心芯片,并配套搭建多类专用机架,形成完整算力硬件体系。
硬件参数层面,RubinGPU搭载288GBHBM4显存,显存带宽达22TB/s,NVLink6单卡双向互联带宽提升至3.6TB/s。架构新增网络内计算能力,依托SHARP技术,让All-Reduce、Reduce-Scatter等高频集合通信运算可直接在交换设备端完成,大幅减少GPU之间的冗余数据传输,让GPU算力更多聚焦于模型核心计算。
同时系统引入Groq3LPU芯片,依托大容量片上SRAM资源,专门适配高实时性、低时延的推理任务,与GPU的大规模并行计算能力形成互补,实现算力分工优化。现阶段AI超节点已经升级为复杂系统工程,需要统筹芯片布局、显存配置、高速互联、数据交换、散热供电、软件调度等全维度环节,软硬件一体化集成能力成为核心竞争壁垒。
机构测算国产超节点市场规模将超万亿
国海证券对国产超节点市场规模开展测算,整体推算分为四个步骤。
第一步测算芯片出货量。报告预计,2026年至2028年国产AI芯片出货量分别约为380万颗、759万颗、1290万颗。
第二步测算超节点对应的芯片数量。报告假设国产AI芯片通过超节点形式出货的比例,从2026年15%提升至2027年35%,2028年进一步提升至55%。结合芯片出货量推算,2026到2028年进入超节点的国产AI芯片分别约为57万颗、266万颗、710万颗。
第三步折算对应机柜数量。测算统一采用单机柜64张卡的标准,对应超节点机柜数量分别约为0.89万台、4.15万台、11.09万台。
第四步测算市场规模。假设单台64卡超节点机柜平均价格为1000万元。经测算,2026年国产超节点市场规模约889亿元,2027年达到4151亿元,2028年进一步增至11089亿元,2025年至2028年复合增速达341%。
本次测算属于机构预测,各项假设条件变动都会影响最终测算结果。若国产AI芯片出货不及预期,或是2028年超节点渗透率无法达到55%,测算的市场规模将会下调。不同超节点方案搭载芯片数量、实际售价存在较大差异,统一采用64卡、单台1000万元仅为估算简化处理。
超节点相关公司
浪潮信息:国内AI服务器核心厂商,可提供大规模超节点整机产品与算力解决方案。
中科曙光:自研超节点整机方案,单机柜可部署大量计算卡,布局国产高性能算力集群。
603***:服务器ODM厂商,提供AI服务器整机研发制造服务。
002***:主营服务器与网络交换机,面向数据中心提供算力与网络设备。
000***:布局AI服务器与数据中心网络设备,服务大型算力集群建设。
... ...
扫码回复“8-超节点”查看行业公司介绍,并可免费诊股,还可咨询实操指导服务!
作者:于晓明 执业证书编号:A0680622030012
算力集群规模持续大幅扩容
过往AI服务器市场以8卡机型为主流部署形态,当前行业算力集群规模正在快速扩张。英伟达GB200NVL72架构已实现单系统集成72颗GPU的高速互联算力体系,而国产整机产品集群规模进一步突破。中科曙光scaleX640机型可在单机柜部署640张计算卡,华为、阿里、字节等国内头部企业也已陆续推出或规划更大规格的AI超节点产品。根据国海证券研判,伴随国产AI芯片、互联协议、整机解决方案持续成熟,2026年国产超节点将全面进入规模化出货阶段。
大模型MoE架构普及,传统8卡集群遭遇通信瓶颈
当前主流大模型普遍采用MoE混合专家架构,将整体模型拆分为多个独立专家模块。模型每处理一组Token数据时,系统会根据内容特征调度对应专家模块参与运算,而不同专家模块通常分布在不同GPU算力卡上。
批量Token数据输入后,需要完成跨GPU数据分发、分布式计算、结果汇总回传的完整流程,过程中大量GPU会同时产生双向数据交互,形成行业所说的All-to-All全互联通信需求。随着模型参数规模扩容、参与计算的GPU数量增加,高频跨卡通信成为常态。
传统小规模服务器集群卡间网络带宽不足,GPU完成本地计算后,需要长时间等待其他设备的数据传输结果,导致硬件理论算力无法充分释放,大量算力闲置空转。超节点架构的核心价值,就是将高频交互的GPU集中在统一高速互联体系内,最大限度缩短数据传输时延。对比传统互联方案,PCIe7.0单卡双向带宽上限约512GB/s,而新一代NVLink6互联带宽可达3.6TB/s,带宽大幅提升后,跨卡数据传输时间显著缩短,彻底缓解算力等待的通信瓶颈。
大模型推理落地,显存容量与带宽成为核心约束
大模型训练阶段主要受制于卡间通信效率,而推理阶段的核心瓶颈转变为显存资源。大模型推理分为两个核心环节,分别是Prefill预填充阶段与Decode生成阶段。Prefill阶段需要一次性批量处理海量Token,对GPU瞬时计算能力要求较高;Decode阶段需要逐一生成Token,同时反复调用历史计算数据。
为避免重复计算消耗算力与时间,系统会将中间运算结果以KVCache的形式暂存于显存之中。模型上下文长度越长、同时在线推理用户越多,KVCache占用的显存资源就越大。在实际落地场景中,经常出现GPU仍有算力余量,但显存容量、显存带宽耗尽,无法继续承载推理任务的情况。
超节点通过整合数百张GPU的显存资源,依托统一内存寻址技术优化资源调度。传统架构下,GPU访问其他设备数据需要完整复制迁移,统一编址技术将多设备内存纳入同一地址空间,支持GPU直接跨设备寻址调用数据,减少冗余数据搬运。同时依靠底层操作系统与调度软件,精细化区分本地显存与远端内存的数据分配,最大化释放集群显存资源,解决推理场景的显存约束问题。整体来看,超节点需要同步解决跨卡通信、显存调度、网络架构、软件调度等整套系统性难题。
算力集群双层网络架构分工明确
大规模AI算力集群分为Scale-Up与Scale-Out两层网络架构,分别承担不同的算力协同功能。Scale-Up聚焦超节点内部互联,服务机柜内数十至数百张GPU的高频协同计算。训练场景下GPU之间数据交互极其频繁,因此该层级核心追求超高带宽、超低时延,行业技术标准将Scale-Up时延目标锁定在百纳秒至亚微秒级别,保障单超节点内部算力高效协同。
Scale-Out负责多超节点之间的集群互联,将多个独立超节点组网联动,构建万卡、十万卡级别的超大算力集群。该层级数据交互频次远低于节点内部,无需极致低时延,行业普遍采用InfiniBand、RoCE以太网技术方案实现组网。简单来说,Scale-Up优化单超节点内部的算力协同效率,Scale-Out实现海量超节点的集群规模化整合,大模型迭代升级背景下,两层网络架构同步迎来升级迭代。
英伟达新一代架构实现全栈算力系统升级
英伟达最新VeraRubin架构,完整体现了当前AI超节点的系统化发展趋势,不再是单一GPU硬件迭代,而是全套算力体系的整体升级。整套架构涵盖RubinGPU、VeraCPU、NVLink6交换芯片、ConnectX-9网卡、BlueField-4DPU、Spectrum-6交换芯片、Groq3LPU七类核心芯片,并配套搭建多类专用机架,形成完整算力硬件体系。
硬件参数层面,RubinGPU搭载288GBHBM4显存,显存带宽达22TB/s,NVLink6单卡双向互联带宽提升至3.6TB/s。架构新增网络内计算能力,依托SHARP技术,让All-Reduce、Reduce-Scatter等高频集合通信运算可直接在交换设备端完成,大幅减少GPU之间的冗余数据传输,让GPU算力更多聚焦于模型核心计算。
同时系统引入Groq3LPU芯片,依托大容量片上SRAM资源,专门适配高实时性、低时延的推理任务,与GPU的大规模并行计算能力形成互补,实现算力分工优化。现阶段AI超节点已经升级为复杂系统工程,需要统筹芯片布局、显存配置、高速互联、数据交换、散热供电、软件调度等全维度环节,软硬件一体化集成能力成为核心竞争壁垒。
机构测算国产超节点市场规模将超万亿
国海证券对国产超节点市场规模开展测算,整体推算分为四个步骤。
第一步测算芯片出货量。报告预计,2026年至2028年国产AI芯片出货量分别约为380万颗、759万颗、1290万颗。
第二步测算超节点对应的芯片数量。报告假设国产AI芯片通过超节点形式出货的比例,从2026年15%提升至2027年35%,2028年进一步提升至55%。结合芯片出货量推算,2026到2028年进入超节点的国产AI芯片分别约为57万颗、266万颗、710万颗。
第三步折算对应机柜数量。测算统一采用单机柜64张卡的标准,对应超节点机柜数量分别约为0.89万台、4.15万台、11.09万台。
第四步测算市场规模。假设单台64卡超节点机柜平均价格为1000万元。经测算,2026年国产超节点市场规模约889亿元,2027年达到4151亿元,2028年进一步增至11089亿元,2025年至2028年复合增速达341%。
本次测算属于机构预测,各项假设条件变动都会影响最终测算结果。若国产AI芯片出货不及预期,或是2028年超节点渗透率无法达到55%,测算的市场规模将会下调。不同超节点方案搭载芯片数量、实际售价存在较大差异,统一采用64卡、单台1000万元仅为估算简化处理。
超节点相关公司
浪潮信息:国内AI服务器核心厂商,可提供大规模超节点整机产品与算力解决方案。
中科曙光:自研超节点整机方案,单机柜可部署大量计算卡,布局国产高性能算力集群。
603***:服务器ODM厂商,提供AI服务器整机研发制造服务。
002***:主营服务器与网络交换机,面向数据中心提供算力与网络设备。
000***:布局AI服务器与数据中心网络设备,服务大型算力集群建设。
... ...
扫码回复“8-超节点”查看行业公司介绍,并可免费诊股,还可咨询实操指导服务!
作者:于晓明 执业证书编号:A0680622030012