博士算力猎场 · 2026年7月26日 07:00 · 行业洞察 Dr. Wu | UCLA Ph.D | 国内首个千卡、万卡GPU智算集群缔造者

过去两年,算力圈的叙事是"堆卡":谁的卡多、谁的显存大,谁就强。B300涨到1480万,大家抢的是单台整机;GB300被炒,大家盯的是72卡柜子本身。
但Kimi K3的发布,把这个叙事悄悄改写了。K3把"≥64卡超节点"写进了部署说明书——这不是一个技术参数,是一个行业信号:算力竞争,从堆卡转向系统级设计。
一、模型说明书里的新条款:≥64卡超节点
K3的官方部署门槛,把"超节点"变成了推荐配置:
部署档位 | 硬件要求 | 本质 |
最低入门 | 8张H100/H200等效GPU | 能跑,非生产 |
高吞吐推荐 | ≥64卡GPU超节点(GB200/GB300 NVL72级别) | 系统级设计 |
完整训练 | 数千卡级算力 | 超大规模系统 |
注意"超节点(supernode)"这个词。它不是"很多张卡"的口语化说法,而是一个明确的架构概念:一组GPU通过高带宽、低延迟的域内互联(NVLink/NVSwitch或更替方案)组成单一可寻址的算力单元。
K3敢把这条写进说明书,是因为它的架构决定了——稀疏MoE(896专家、每token激活16个)的all-to-all通信,只有在高速互联域内才能跑顺。模型开发者在用说明书告诉部署者:你买的不该是"卡",你买的是"把卡连成一个系统的能力"。
这是算力竞争拐点的一个标志性动作。

二、为什么MoE需要超节点:从all-to-all说起
MoE推理的核心瓶颈,不是算力,是通信。
每个token在K3里都要在896个专家中选16个做计算,专家之间要做all-to-all路由。这个路由对互联带宽和延迟极度敏感。我把实测数据摆出来:
通信场景 | 实测带宽 | 说明 |
NVLink域内(同超节点) | 726GB/s | MoE all-to-all的主干道 |
跨节点RDMA | 90GB/s | 仅为NVLink域内的约1/8 |
跨节点RDMA只有NVLink域内的约八分之一。 如果专家被分散在多个节点,all-to-all要走RDMA,带宽瞬间砍到八分之一,延迟翻几倍,吞吐崩塌。
超节点的价值,就是让64张(或更多)卡处在同一个726GB/s的主干道上,把all-to-all留在域内跑。这就是K3"≥64卡超节点"这条门槛的物理基础——它不是一个营销话术,是通信拓扑决定的硬约束。
从这个角度看,堆卡时代"买越多越好"的逻辑失效了。 64张卡散落在8个机柜里,不如64张卡在一个NVSwitch域内。算力的有效产出,不再由卡数线性决定,而由"系统能多高效地把卡连起来"决定。

三、超节点竞赛:英伟达NVL72 vs 华为Atlas 950 SuperPoD
当竞争转向系统级,超节点就成了主战场。两边的代表作摆出来对比:
维度 | GB300 NVL72 | Atlas 950 SuperPoD(基于950DT) |
单柜GPU数 | 72卡(GB300) | 64卡(昇腾950DT) |
最大扩展 | — | 8192卡 |
显存 | HBM3e 20736GB(288GB×72) | 自研HBM |
单卡算力 | FP16 4500TFlops | FP8 1P / FP4 2P |
互联 | NVSwitch 4.0全互联1.8TB/s | 2TB/s |
1024卡配置 | — | 1 EFLOPS FP8 / 2 EFLOPS FP4 / 256TB UAM / 3μs RTT |
8192卡满配 | — | 8 EFLOPS FP8 / 16 EFLOPS FP4 / 2048TB UAM |
这里有几个必须澄清的点,避免误读:
第一,256TB UAM和1 EFLOPS FP8,是1024卡配置,不是8192卡。 8192卡满配是8 EFLOPS FP8 / 16 EFLOPS FP4 / 2048TB UAM。把256TB和8192卡配对,是典型的数据乱配。
第二,GB300 NVL72是2025年Q3已上市的成熟产品,全球部署200+台,北美出厂价400万美金(约2800万人民币)。 它已经是系统级竞争的现役主力,不是PPT。
第三,Atlas 950 SuperPoD是华为基于950DT的新一代超节点。 950PR 2026年Q1已量产、卖出超100万片;950DT原计划10月、6月官宣提前至8月。SuperPoD在WAIC 2026拿下SAIL大奖,是国产系统级方案的代表。
两条路线,一个用NVSwitch 1.8TB/s,一个用2TB/s互联,都奔着同一个目标:把更多卡塞进同一个高速域内。

四、算力竞争从堆卡到系统级
系统级竞争的底层逻辑,是"单卡不够、用系统补"。
SemiAnalysis的测算很直白:单颗Ascend约等于英伟达的1/3,但系统级可以弥补。这句话是国产算力换道超车的核心依据——既然单芯片追不上,就用互联、用内存统一编址(UAM)、用系统软件把整体效能拉起来。
证据在落地:
- 昇腾384超节点商用超750套。
这不是演示,是规模商用的工程验证。
- Atlas 950 SuperPoD获WAIC 2026 SAIL大奖。
1024卡配置=1 EFLOPS FP8 / 2 EFLOPS FP4 / 256TB UAM / 3μs RTT,系统级指标已经能打。
- CANN开源,3000+伙伴、7000+方案。
生态是系统级竞争的另一半战场。
- 国产GPU租赁Q1 +187%,TCO最高降45%。
系统级方案的成本优势正在变成市场份额。
K3的发布,给这条路线添了一把火。据中金公司研报,K3已在昇腾910B上完成全链路适配;媒体分析Atlas 950 SuperPoD(1024张昇腾950)为官方推荐首选国产算力底座——但需明确,月之暗面官方并未直接披露此推荐,应以"据中金研报/媒体分析"归因,不能说是月之暗面官方指定。
浪潮信息NF5488A6超节点(64张国产加速卡)据产业链消息为K2训练集群核心供应商,中科曙光"曙光8000"十万卡超集群适配超大模型训练——国产超节点的供应链也在成型。

五、Dr.Wu判断
K3把超节点写进说明书,是算力产业分水岭级别的信号。我的判断有三点:
第一,堆卡时代结束,系统级时代开始。 过去比谁卡多、谁显大;现在比谁能把卡连成高效系统。B300涨到1480万是堆卡逻辑的顶峰,K3的说明书是系统级逻辑的起点。
第二,超节点是必答题,不是选答题。 不只是K3,未来大模型都会把"超节点"写进部署门槛。谁能提供高密度、高带宽、低延迟的域内互联,谁就握住了算力的定价权。
第三,国产算力的窗口在系统级。 单卡追英伟达追得辛苦,但系统级——2TB/s互联、UAM统一内存、CANN生态——是换道超车的机会。K3的国产适配(据中金研报/媒体分析)说明,大模型公司已经开始把国产超节点纳入底座选项。
Vera Rubin NVL72(GB300 NVL72的继任者)6月18日CoreWeave首台、7月大面积上市、已量产,英伟达也在把系统级能力推向新高度。但系统级竞争不是英伟达的专利——中国算力正在用超节点,写下另一条路线。
2026年下半年,算力的胜负手不在单卡,在系统。谁先把超节点做成规模、做成生态,谁就赢了下半场。
关注算力产业格局深度分析?加入算力猎场,和洞察全局的人一起看。
加入方式 | 微信号 | 二维码 |
Dr. Wu 微信 | michaelwqs |
|
Alan Ng 微信 | alanngw |
|
扫码入群 | 扫描下方二维码,加入算力猎场微信群 |
|
群里有算力产业链的决策者、投资人和技术专家,每日独家分析和行业前瞻。
博士算力猎场 | 行业洞察 Dr. Wu | UCLA Ph.D | 国内首个千卡、万卡GPU智算集群缔造者





