社会热点
【行业洞察】K3把"超节点"写进模型说明书——算力竞争从堆卡转向系统级设计
2026-07-26 07:27
【行业洞察】K3把"超节点"写进模型说明书——算力竞争从堆卡转向系统级设计

博士算力猎场 · 2026年7月26日 07:00 · 行业洞察 Dr. Wu | UCLA Ph.D | 国内首个千卡、万卡GPU智算集群缔造者

过去两年,算力圈的叙事是"堆卡":谁的卡多、谁的显存大,谁就强。B300涨到1480万,大家抢的是单台整机;GB300被炒,大家盯的是72卡柜子本身。

但Kimi K3的发布,把这个叙事悄悄改写了。K3把"≥64卡超节点"写进了部署说明书——这不是一个技术参数,是一个行业信号:算力竞争,从堆卡转向系统级设计。


一、模型说明书里的新条款:≥64卡超节点

K3的官方部署门槛,把"超节点"变成了推荐配置:

部署档位

硬件要求

本质

最低入门

8张H100/H200等效GPU

能跑,非生产

高吞吐推荐

≥64卡GPU超节点(GB200/GB300 NVL72级别)

系统级设计

完整训练

数千卡级算力

超大规模系统

注意"超节点(supernode)"这个词。它不是"很多张卡"的口语化说法,而是一个明确的架构概念:一组GPU通过高带宽、低延迟的域内互联(NVLink/NVSwitch或更替方案)组成单一可寻址的算力单元。

K3敢把这条写进说明书,是因为它的架构决定了——稀疏MoE(896专家、每token激活16个)的all-to-all通信,只有在高速互联域内才能跑顺。模型开发者在用说明书告诉部署者:你买的不该是"卡",你买的是"把卡连成一个系统的能力"。

这是算力竞争拐点的一个标志性动作。


二、为什么MoE需要超节点:从all-to-all说起

MoE推理的核心瓶颈,不是算力,是通信。

每个token在K3里都要在896个专家中选16个做计算,专家之间要做all-to-all路由。这个路由对互联带宽和延迟极度敏感。我把实测数据摆出来:

通信场景

实测带宽

说明

NVLink域内(同超节点)

726GB/s

MoE all-to-all的主干道

跨节点RDMA

90GB/s

仅为NVLink域内的约1/8

跨节点RDMA只有NVLink域内的约八分之一。 如果专家被分散在多个节点,all-to-all要走RDMA,带宽瞬间砍到八分之一,延迟翻几倍,吞吐崩塌。

超节点的价值,就是让64张(或更多)卡处在同一个726GB/s的主干道上,把all-to-all留在域内跑。这就是K3"≥64卡超节点"这条门槛的物理基础——它不是一个营销话术,是通信拓扑决定的硬约束。

从这个角度看,堆卡时代"买越多越好"的逻辑失效了。 64张卡散落在8个机柜里,不如64张卡在一个NVSwitch域内。算力的有效产出,不再由卡数线性决定,而由"系统能多高效地把卡连起来"决定。


三、超节点竞赛:英伟达NVL72 vs 华为Atlas 950 SuperPoD

当竞争转向系统级,超节点就成了主战场。两边的代表作摆出来对比:

维度

GB300 NVL72

Atlas 950 SuperPoD(基于950DT)

单柜GPU数

72卡(GB300)

64卡(昇腾950DT)

最大扩展

8192卡

显存

HBM3e 20736GB(288GB×72)

自研HBM

单卡算力

FP16 4500TFlops

FP8 1P / FP4 2P

互联

NVSwitch 4.0全互联1.8TB/s

2TB/s

1024卡配置

1 EFLOPS FP8 / 2 EFLOPS FP4 / 256TB UAM / 3μs RTT

8192卡满配

8 EFLOPS FP8 / 16 EFLOPS FP4 / 2048TB UAM

这里有几个必须澄清的点,避免误读:

第一,256TB UAM和1 EFLOPS FP8,是1024卡配置,不是8192卡。 8192卡满配是8 EFLOPS FP8 / 16 EFLOPS FP4 / 2048TB UAM。把256TB和8192卡配对,是典型的数据乱配。

第二,GB300 NVL72是2025年Q3已上市的成熟产品,全球部署200+台,北美出厂价400万美金(约2800万人民币)。 它已经是系统级竞争的现役主力,不是PPT。

第三,Atlas 950 SuperPoD是华为基于950DT的新一代超节点。 950PR 2026年Q1已量产、卖出超100万片;950DT原计划10月、6月官宣提前至8月。SuperPoD在WAIC 2026拿下SAIL大奖,是国产系统级方案的代表。

两条路线,一个用NVSwitch 1.8TB/s,一个用2TB/s互联,都奔着同一个目标:把更多卡塞进同一个高速域内。


四、算力竞争从堆卡到系统级

系统级竞争的底层逻辑,是"单卡不够、用系统补"。

SemiAnalysis的测算很直白:单颗Ascend约等于英伟达的1/3,但系统级可以弥补。这句话是国产算力换道超车的核心依据——既然单芯片追不上,就用互联、用内存统一编址(UAM)、用系统软件把整体效能拉起来。

证据在落地:

  • 昇腾384超节点商用超750套。
     这不是演示,是规模商用的工程验证。
  • Atlas 950 SuperPoD获WAIC 2026 SAIL大奖。
     1024卡配置=1 EFLOPS FP8 / 2 EFLOPS FP4 / 256TB UAM / 3μs RTT,系统级指标已经能打。
  • CANN开源,3000+伙伴、7000+方案。
     生态是系统级竞争的另一半战场。
  • 国产GPU租赁Q1 +187%,TCO最高降45%。
     系统级方案的成本优势正在变成市场份额。

K3的发布,给这条路线添了一把火。据中金公司研报,K3已在昇腾910B上完成全链路适配;媒体分析Atlas 950 SuperPoD(1024张昇腾950)为官方推荐首选国产算力底座——但需明确,月之暗面官方并未直接披露此推荐,应以"据中金研报/媒体分析"归因,不能说是月之暗面官方指定。

浪潮信息NF5488A6超节点(64张国产加速卡)据产业链消息为K2训练集群核心供应商,中科曙光"曙光8000"十万卡超集群适配超大模型训练——国产超节点的供应链也在成型。


五、Dr.Wu判断

K3把超节点写进说明书,是算力产业分水岭级别的信号。我的判断有三点:

第一,堆卡时代结束,系统级时代开始。 过去比谁卡多、谁显大;现在比谁能把卡连成高效系统。B300涨到1480万是堆卡逻辑的顶峰,K3的说明书是系统级逻辑的起点。

第二,超节点是必答题,不是选答题。 不只是K3,未来大模型都会把"超节点"写进部署门槛。谁能提供高密度、高带宽、低延迟的域内互联,谁就握住了算力的定价权。

第三,国产算力的窗口在系统级。 单卡追英伟达追得辛苦,但系统级——2TB/s互联、UAM统一内存、CANN生态——是换道超车的机会。K3的国产适配(据中金研报/媒体分析)说明,大模型公司已经开始把国产超节点纳入底座选项。

Vera Rubin NVL72(GB300 NVL72的继任者)6月18日CoreWeave首台、7月大面积上市、已量产,英伟达也在把系统级能力推向新高度。但系统级竞争不是英伟达的专利——中国算力正在用超节点,写下另一条路线。

2026年下半年,算力的胜负手不在单卡,在系统。谁先把超节点做成规模、做成生态,谁就赢了下半场。


关注算力产业格局深度分析?加入算力猎场,和洞察全局的人一起看。

加入方式

微信号

二维码

Dr. Wu 微信

michaelwqs

Alan Ng 微信

alanngw

扫码入群

扫描下方二维码,加入算力猎场微信群

群里有算力产业链的决策者、投资人和技术专家,每日独家分析和行业前瞻。


博士算力猎场 | 行业洞察 Dr. Wu | UCLA Ph.D | 国内首个千卡、万卡GPU智算集群缔造者

发表评论
0评