博士算力猎场 · 2026年7月21日 07:00 · 行业洞察
Dr. Wu | UCLA Ph.D | 国内首个千卡、万卡GPU智算集群缔造者

WAIC 2026落幕,Atlas 950 SuperPoD斩获SAIL大奖。前两篇已经拆解了算力参数和部署实战,所有人都在讨论1024卡配置下2 EFLOPS FP4的算力、最大8192卡的扩展规模。但Dr.Wu在华为展台前反复端详的,是参数表里一行不起眼的文字:256TB UAM。
这可能是整场WAIC最被低估的突破。
一、所有人都盯着算力,但瓶颈早已不在算力
过去五年,算力竞赛的逻辑很简单:谁的卡更猛,谁就赢。FP64、FP16、FP8、FP4……精度一路下降,算力数字一路飙升。
但算力堆到EFLOPS级别后,一个尴尬的事实浮出水面:你加了再多卡,40%的时间还是在等通信。
这不是Dr.Wu拍脑袋的数字。业界研究普遍认为,大模型训练中约40%的时间花在通信等待上——梯度同步、参数广播、激活值交换,每一层并行策略都带来海量通信开销。1000张卡的集群,实际等效算力可能只有标称的60%。
这就是"通信墙":算力是加法增长,通信开销是乘法增长。 卡越多,墙越高。
二、什么是UAM——让通信"消失"的架构
UAM,全称Unified Addressing Memory,统一编址内存。
传统集群中,每张卡只能直接访问自己的本地显存。跨节点读取数据?要走RDMA,要走NCCL,要显式地"搬运"数据——先从源节点发出去,经过网络,再在目标节点接收。每一步都有延迟,每一步都消耗带宽。
UAM打破了这个边界。整个SuperPoD中所有NPU的内存——包括HBM和主机内存——被映射到一个统一的地址空间。任意一张NPU,可以直接读写任意一个内存地址,无论这块内存物理上位于哪个机柜、哪个节点。
数据不需要"搬运",因为从NPU的视角看,所有内存都在"本地"。
这就是UAM的核心:它不是让通信更快,而是让通信消失。
三、3μs RTT——跨节点访问的延迟有多低
传统RDMA的往返延迟通常在10-15μs,这已经是高性能InfiniBand网络的极限。但在UAM架构下,Atlas 950 SuperPoD实现了跨节点内存访问延迟仅3μs RTT。
3μs是什么概念?CPU访问本地DRAM的延迟大约是100ns,RDMA的延迟是10-15μs。UAM的3μs恰好落在两者之间——比RDMA快3-5倍,虽然比本地DRAM慢,但已经到了"可用"的区间。
更重要的是,这个过程不需要应用层感知——不需要调用通信API,不需要管理数据搬运,内存访问就是一条普通的load/store指令。程序员看到的是一个256TB的平坦内存空间,不需要关心数据物理上在哪。
这就是UAM和传统通信协议的本质区别:传统方案是"搬数据",UAM是"共享地址"。

四、256TB vs 20.7TB——12倍的差距是代际差距
来看一张对比表:
维度 | GB300 NVL72 | Atlas 950 SuperPoD (1024卡) |
内存池化规模 | 20.7TB (HBM3e) | 256TB (UAM) |
池化方式 | NVSwitch机柜内池化 | 灵衢(UnifiedBus)跨节点统一编址 |
跨节点访问 | 不支持(仅72卡域内) | 3μs RTT,全SuperPod可达 |
最大扩展 | 72卡 | 8192卡 |
单卡互联带宽 | NVLink 1.8TB/s | 2TB/s |
架构本质 | 机柜级池化 | SuperPod级统一编址 |
NVL72的20.7TB池化已经是当前商用系统的天花板——72张Blackwell GPU的HBM3e(288GB×72≈20.7TB)通过NVSwitch全互联,机柜内任意GPU可以访问任意显存。但出了这72张卡,就回到了传统通信模式。
256TB vs 20.7TB,不只是12倍的容量差距,更是架构代际的差距。
NVL72是"机柜内池化",Atlas 950是"SuperPod级统一编址"。前者出了机柜就要重新面对通信墙,后者把通信墙从架构层面拆掉了。
再换一个参照系。英伟达下一代Vera Rubin NVL72:Vera CPU搭配Rubin GPU,单颗288GB HBM4,NVLink 1.8TB/s,机架功耗172KW。内存架构依然是机柜内池化,没有突破"出了机柜就是通信墙"的范式。6月18日CoreWeave已拿到首台,BOM 780万美金——但它仍然是NVL72的架构逻辑,只是换了一代芯片。
芯片可以换,架构范式不会因为换芯片而改变。
五、对万亿参数模型意味着什么
万亿参数模型的参数本身需要约2TB(FP8)或1TB(FP4)存储,加上优化器状态、梯度和激活值,轻松突破数十TB。
传统方案需要设计复杂的并行策略——张量并行切分注意力头,流水线并行把模型按层切分到不同节点,数据并行复制模型副本,专家并行拆分MoE层。每一层并行都带来通信开销,工程师花在调并行策略上的时间,可能比训练本身还长。
UAM的意义在于:整个模型可以"一口气"装进256TB的统一地址空间。 所有NPU直接访问模型参数,不需要在节点间拆分和搬运。并行策略的复杂度大幅降低,训练框架的工程门槛也随之下降。
打个比方:传统方案像是一个乐队,每个人看着自己的乐谱,靠对讲机协调节奏;UAM像是把所有人的乐谱合并成一本总谱,每个人都看着同一页——不需要对讲机,因为信息本就在眼前。

六、Dr.Wu判断
UAM是超节点从"拼算力"到"拼系统"的关键转折。
过去五年,行业比的是单卡算力——FP4 FLOPS、HBM容量、互联带宽。但算力堆到EFLOPS级别后,瓶颈已经不在单卡,而在系统架构。一张卡再强,如果40%时间在等通信,系统效率就打了六折。
UAM代表了一种新思路:不是把更多的卡连在一起,而是让更多的卡变成一张卡。256TB统一编址空间,本质上是把1024张NPU变成了一个逻辑上的"超级NPU"。
这才是超节点的"灵魂"——不是算力的堆叠,而是系统的统一。
WAIC上同台展出的还有中兴OEX超节点、中科曙光8000"登峰"。加上已商用750+套的昇腾384超节点,国产超节点阵营已经成型。但真正决定胜负的,不是谁的卡更多,而是谁的系统更"统一"。
还记得那组数据吗?Atlas 950 SuperPoD vs 英伟达NVL72,卡规模14.2倍(1024卡 vs 72卡),总算力3.4倍,内存7倍,互联域最大56.8倍(8192卡 vs 144卡)。内存和互联的差距远大于算力的差距——这恰恰说明,Atlas 950的优势不在单卡,而在系统级架构。UAM就是这组数据背后的底层逻辑。
CANN全面开源,1244万行代码,也在传递同一个信号:开放的系统架构,才是超节点的终局。
关注算力产业格局深度分析?加入算力猎场,和洞察全局的人一起看。
加入方式 | 微信号 | 二维码 |
Dr. Wu 微信 | michaelwqs |
|
Alan Ng 微信 | alanngw |
|
扫码入群 | 扫描下方二维码,加入算力猎场微信群 |
|
群里有算力产业链的决策者、投资人和技术专家,每日独家分析和行业前瞻。
博士算力猎场 | 行业洞察 Dr. Wu | UCLA Ph.D | 国内首个千卡、万卡GPU智算集群缔造者





