超节点如何打通国产算力“任督二脉”?
大模型参数规模正呈现指数级增长趋势。以DeepSeek为例,其早期模型总参数量仅670亿,而最新DeepSeek-V4-Pro总参数量已达1.6万亿。与此同时,前沿语言模型训练成本平均每年增长约3.5倍,大约每7个月翻一倍,从GPT-3时期的数百万美元提升至GPT-4时期的数千万乃至近2亿美元。
传统计算集群正面临前所未有的物理极限与通信瓶颈。万亿级超大模型无法被装进单一服务器显存,必须进行复杂的模型并行与流水线拆分,导致数以万计的GPU在训练过程中需要进行频繁且海量的数据交换。
在此背景下,将成百上千颗芯片“像一台计算机一样”协同使用的超节点,或成为国产算力突破系统性能瓶颈的重要路径。
超节点是面向大模型训练与推理构建的新型高密度算力系统,其核心是通过高速、低时延的Scale-up互联,将数百颗甚至数千颗GPU、NPU或其他AI加速芯片连接为一个统一的逻辑计算单元。超节点的优势不仅体现在带宽更高和延迟更低,还体现在更大的逻辑显存空间、更强的并行能力,以及对MoE模型、长上下文和强化学习任务的适配能力。
机构认为,超节点是国产算力突破单卡性能瓶颈、实现弯道超车的关键路径。在WAIC 2026大会上,华为昇腾Atlas 950超节点真机首秀,代表了国产算力系统的最高水平;昆仑芯科技推出32/64卡整柜超节点方案;中科曙光(603019)展出面向十万卡级的ScaleX全国产超集群;沐曦股份、摩尔线程、天数智芯等国产GPU/加速卡厂商,以及联想、浪潮等系统厂商亦密集亮相。
超节点的高密度、高功率特征,正将算力瓶颈从GPU推向交换网络与散热环节,进而为产业链升级创造全新机遇。综合机构观点,建议关注以下核心方向:
一是网络端:超节点时代交换芯片需求将实现10-20倍的增长,重要性等同于AI芯片。传统八卡级场景下交换芯片与GPU配比约为1:20,GPU间无需一对一通信;而超节点时代GPU间需频繁互通,交换芯片需求大幅提升;
二是计算端:通过集群效应弥补单卡性能短板,超节点将推动CSP厂商加大对国产AI芯片的采购力度。服务器厂商将逐步摆脱代工组装角色,净利率有望提升;
三是AIDC端:超节点时代国产卡占比提升、整体功耗更高,将推动AIDC需求爆炸式增长。当前能耗管控严格,AIDC建设周期一年以上,扩产缓慢,供需已从紧平衡走向失衡,局部地区零售AIDC已出现涨价;
四是散热端:单柜功率密度快速攀升下,冷板式与浸没式液冷正从“可选”走向“必选”。正交背板以零线缆、低时延、易散热等优势,被视为破解超节点内部带宽瓶颈的潜在方案。
风险提示:AI进展不及预期;宏观经济及汇率波动;半导体周期下行风险。以上内容综合自华泰证券、国联民生(601456)、招商证券、长城证券(002939)等近期已公开的证券研究报告,不构成任何投资建议,敬请投资者注意投资风险。
所有文章未经授权禁止转载、摘编、复制或建立镜像,违规转载法律必究。
举报邮箱:1002263188@qq.com