7月27日,月之暗面正式开源Kimi K3模型权重。这款拥有2.8万亿参数、896个专家的全球首个三万亿级开源模型,在官方部署文档中写下了一行看似不起眼却分量极重的话——推荐配置为"≥64卡超节点"。
值得注意的是,这是超节点第一次被写进大模型的"安装说明书"。
在此之前的4月24日,DeepSeek V4-Pro和V4-Flash同步开源,华为昇腾超节点全系列产品完成适配。DeepSeek官方公众号直言不讳地表示,受限于高端算力,V4-Pro模型的服务吞吐仍然有限,预计下半年昇腾950超节点批量上市后,Pro版本价格将大幅下调。
两份模型文档,指向同一个事实:万亿参数时代的最低入场券,已经不是单张算力卡的峰值算力,而是能否把它们高效地"捆"在一起。
一台"超级计算机"的诞生
7月19日,2026世界人工智能大会(WAIC)期间,鹏城实验室主任高文和全球计算联盟(GCC)理事长金海共同发布了一份文件——《超节点定义与实践白皮书》。三十余家顶尖高校、科研院所和头部企业联合编撰,首次为这个已经热了半年多的概念颁发了"出生证"。
白皮书给出的定义简洁而精确:超节点是一种在物理上由多个计算节点通过高效的互联协议紧密连接组成,具备跨物理节点统一内存编址能力,逻辑上具备"一台计算机"特征的计算系统。
换言之,它的目标只有一个——让数百张算力卡像一台电脑一样工作。
这听上去简单,工程上却极为棘手。传统的数据中心采用Scale-Out(横向扩展)架构,各计算节点运行于相互隔离的独立地址空间,节点间的数据同步依赖软件协议栈和网络报文交换。即便配置高带宽链路,数据在移动过程中仍不可避免地经历地址映射、消息组装、中断处理等多层软件介入。白皮书指出,这种方式在有效带宽、端到端时延及同步效率上存在"数倍乃至一个数量级的结构性劣势"。
然而,超节点走的则是另一条路——Scale-Up(纵向扩展)。它通过系统总线将内存语义操作的可达域从单机扩展到跨物理节点,使任一处理器能够直接对超节点内任意内存地址执行Load/Store操作。跨节点的数据访问不再需要"序列化—网络传输—反序列化"的迂回,而是由硬件直接完成。白皮书将"统一内存编址与内存语义""超低时延""超大带宽"列为超节点的三大技术特征。
在AI大模型的语境里,这个区别至关重要。MoE(混合专家)架构的模型每一层都需要上百次专家路由通信,微秒级的时延差会被数百层网络持续放大。GPU算力每年提升两到三倍,而内存带宽的年增幅仅有15%至30%,两者之间的剪刀差持续拉大。GPT-5级别的大模型训练中,跨节点通信开销已占总训练成本的三成以上。超节点要做的,就是把这部分被浪费掉的算力"抢"回来。
"集团军"的共识
WAIC 2026的算力展区里,一排排黑色机柜构成了一种奇特的视觉景观。华为昇腾950超节点真机首次线下展示,16台计算柜、1024张昇腾950DT芯片,以庞然巨物般的体量充当华为展台的"门面担当"。沐曦股份首发曦景S600超节点,摩尔线程公开展示MTT C256超节点,中科曙光搬出ScaleX640——几乎所有算力厂商都将"超节点"放在了C位。
这是一年前还不存在的竞争格局。
2025年华为全联接大会上,华为轮值董事长徐直军将公司整体战略概括为"超节点+集群"。他的判断直白而坦率:受制于先进制程,国产AI芯片短期内难以完全依靠单颗芯片追赶国际领先水平,因此需要通过系统架构创新,把更多芯片高效率组织起来,以整体系统能力弥补单点差距。
这个逻辑很快从华为一家的战略,演变为整个国产算力行业的集体共识。在先进制程受限的背景下,"单卡追赶"的路径变得日益逼仄,而"系统级互联"则打开了一条可能绕过制程瓶颈的侧翼通道。用一位国产芯片厂商高管的话来说,超节点不是简单"堆卡",而是系统级方案,涉及算力、带宽、互联、管理、软件栈的协同优化。
产业数据印证着这股势头的加速。华为披露,昇腾384超节点已累计商用超过750套,覆盖互联网、运营商、金融等20多个行业、2000余家客户,是国内唯一规模商用的超节点产品。鹏城云脑Ⅲ作为国内首个采用超节点架构的国产智算集群,64颗NPU通过总线互联为一个高度耦合的计算单元,双向通信带宽超过650GB/s,点对点最小通信时延降至1.2微秒以内。在千亿级参数模型的千卡并行训练中,其模型算力利用率(MFU)达43%,从128卡扩展至1024卡的扩展效率达98.4%。
3414亿与"元年"
华泰证券在4月的一份研报中测算,2028年国产超节点市场空间有望达到3414亿元,2026年至2028年复合年均增长率为194%。报告将2026年定义为"国产超节点元年"。
全球市场同样在加速膨胀。据Global Info Research调研,2025年全球超节点方案收入约755亿美元(约合5119亿元人民币),预计2032年将达到2140亿美元。
资本开支的信号更为直接。华勤技术(603296)在投资者电话会议中表示,超节点产品已于第二季度启动小批量出货,第三季度起进入大规模交付阶段,预计全年仅超节点单项产品收入即突破100亿元。这家从智能手机ODM起家的公司,如今是行业内极少数同时拥有计算节点和网络节点全栈设计能力的厂商,客户涵盖阿里、腾讯、字节等头部云服务商。其2026年上半年业绩预告显示,预计归母净利润29亿元至30.5亿元,同比增长53.5%至61.5%。
浪潮信息(000977)的在手算力订单超过350亿元,产能排满至2027年二季度。紫光股份(000938)旗下新华三在WAIC 2026上发布了全系列自研超节点产品UniPoD,覆盖32卡至1024卡全档位,其中32卡和64卡机型已完成头部互联网客户测试验证。
产业链拆解:钱在哪儿
超节点的产业链条比传统AI服务器更长,价值分布也更分散。从整机集成到高速互联,从液冷散热到光模块,每个环节都在经历价值量的跃迁。
整机交付层是订单确定性最强的环节,也是产业竞争最激烈的战场。浪潮信息(000977)凭借元脑SD200全液冷超节点服务器,兼容英伟达与国产GPU双路线,国内80%的互联网智算中心采用其方案。紫光股份(000938)走的是算网一体化路线,自研51.2T CPO交换机与AI整机协同交付,单柜最高128卡。中科曙光(603019)推出国内首个单机柜640卡ScaleX超节点,搭配海光DCU国产芯片,在政务和国家级超算领域壁垒深厚。中兴通讯(000063)以OEX正交无背板架构切入,单机柜128卡,主打运营商算力集采。华勤技术(603296)则以ODM代工模式承接多厂商超节点订单,全年百亿收入指引使其成为交付弹性最大的标的之一。
华为昇腾生态圈中,神州数码(000034)作为昇腾全国总经销商,可完整交付超节点整机集群;拓维信息(002261)的"兆瀚"AI服务器已完成384超节点量产交付,是省级智算中心的主力交付商;工业富联(601138)承担昇腾超节点ODM代工,出货规模可观。
高速互联层是超节点区别于传统服务器的核心增量,也是价值量跃升最显著的环节。华丰科技(688629)是华为昇腾950超节点高速背板连接器的核心一供,112G高速线模组市占率超60%,224G产品已开始批量交付,获华为哈勃战略入股。超节点连接器的单卡价值量是传统服务器的8至10倍——这是一场结构性的价值重估。中航光电(002179)作为连接器二供,份额约30%,全品类高速连接器与液冷连接器覆盖昇腾全产品线。盛科通信(688702)是A股唯一国产商用数据中心交换芯片标的,25.6T芯片已规模商用,51.2T产品送样,在Scale-Up环节的国产替代逻辑最为纯粹。锐捷网络(301165)在2025年展示了51.2T CPO交换机商用互联方案,推出新一代128口800G交换机。
液冷散热层从"选配"变成了"必配"。超节点单柜功耗普遍突破100kW——华为昇腾950超节点整机柜功耗超过50kW,英伟达NVL72达到120kW——传统风冷已完全无法胜任。英维克(002837)是国内全链条液冷龙头,覆盖华为、浪潮、曙光等所有超节点厂商,智算中心液冷领域处于行业领先地位。申菱环境(301018)深度绑定昇腾生态,擅长大型算力园区整体热管理。高澜股份(300499)主攻浸没式液冷方案,适配超高密度万卡集群。
光互联层随着Scale-Up域持续扩张而需求放量。中际旭创(300308)作为全球光模块龙头,1.6T高速光模块供货昇腾超节点及海外云厂商。华工科技(000988)的1.6T液冷光模块在昇腾超节点中份额领先。光迅科技(002281)提供800G/1.6T光模块及全光交换解决方案。在CPO(光电共封装)方向,天孚通信(300394)布局FAU和ELS封装,光库科技(300620)进入英伟达第一代CPO供应链。
范式转移的下半场
超节点的意义远不止于一个新概念。它标志着AI算力竞争从"单芯片跑分"转向"系统级较量",从"谁的芯片更强"转向"谁的系统能把芯片组织得更好"。
这种转移对国产算力而言,既是被逼出来的,也是主动选择的。当先进制程的路径被封锁,当单颗芯片的追赶变得日益艰难,把数十乃至上千颗芯片用自研互联协议"编织"成一个统一计算域,用架构创新弥补制程差距——这条路的可行性,已经被DeepSeek V4和Kimi K3的适配验证所证实。
Kimi K3的技术文档暗示了一个有趣的契合:其KDA注意力机制和Stable Latent MoE架构,恰好适配了国产算力"单卡算力有限、集群能力补位"的特点。华为的"最终一致"协议在Kimi K3这种固定权重、不频繁卡间同步的场景下,反而因"域更大、跨机柜"而成为优势。
但产业远未到可以乐观庆祝的时候。白皮书本身也承认,超节点距离标准化稳定商用仍有较长周期。通信瓶颈、多客户业务隔离与算力平衡、散热基建迭代压力、软硬件协同成熟度不足,都是规模化落地必须攻克的难题。行业在技术路线上仍呈现分化——GPU、NPU、TPU各有其架构基因与适配场景,私有协议与开放标准之间的博弈远未结束。ETH-X开放超节点项目在进度上落后于英伟达NVL72和华为Matrix,开放标准的制定需要时间、协调和妥协。
交付模式的升级也在抬高行业门槛。行业标准正从传统的L10整机交付(标准服务器),升级至L11整机柜交付(柜内布线、交换机装配)乃至L12集群级交付(跨机柜组网、集群配置)。技术壁垒的显著抬高意味着,具备全栈研发能力的厂商将获得更大的份额集中度。
华泰证券建议重点关注超节点核心增量Scale-Up环节——交换芯片、交换机和铜连接——以及整机柜、液冷、光模块等配套受益环节。中信证券则强调,超节点将多张加速卡通过高带宽、低时延的网络紧密连接,并提供内存池化、内存直连等机制,极大提升了AI训推效率,已经成为明确的产业趋势。
当Kimi K3把"≥64卡超节点"写进部署文档的那一刻,超节点就不再只是一个可选方案,而是万亿参数模型的最低门槛。这个门槛,正在重塑整个AI算力产业的价值链。
