推广 热搜: 采购方式  滤芯  带式称重给煤机  甲带  气动隔膜泵  减速机型号  无级变速机  链式给煤机  履带  减速机 

【行业洞察】256TB统一编址内存——UAM为什么是超节点的"灵魂"

   日期:2026-07-21 16:52:45     来源:网络整理    作者:本站编辑    评论:0    
【行业洞察】256TB统一编址内存——UAM为什么是超节点的"灵魂"

博士算力猎场 · 2026年7月21日 07:00 · 行业洞察

Dr. Wu | UCLA Ph.D | 国内首个千卡、万卡GPU智算集群缔造者


WAIC 2026落幕,Atlas 950 SuperPoD斩获SAIL大奖。前两篇已经拆解了算力参数和部署实战,所有人都在讨论1024卡配置下2 EFLOPS FP4的算力、最大8192卡的扩展规模。但Dr.Wu在华为展台前反复端详的,是参数表里一行不起眼的文字:256TB UAM

这可能是整场WAIC最被低估的突破。


一、所有人都盯着算力,但瓶颈早已不在算力

过去五年,算力竞赛的逻辑很简单:谁的卡更猛,谁就赢。FP64、FP16、FP8、FP4……精度一路下降,算力数字一路飙升。

但算力堆到EFLOPS级别后,一个尴尬的事实浮出水面:你加了再多卡,40%的时间还是在等通信。

这不是Dr.Wu拍脑袋的数字。业界研究普遍认为,大模型训练中约40%的时间花在通信等待上——梯度同步、参数广播、激活值交换,每一层并行策略都带来海量通信开销。1000张卡的集群,实际等效算力可能只有标称的60%。

这就是"通信墙":算力是加法增长,通信开销是乘法增长。 卡越多,墙越高。


二、什么是UAM——让通信"消失"的架构

UAM,全称Unified Addressing Memory,统一编址内存。

传统集群中,每张卡只能直接访问自己的本地显存。跨节点读取数据?要走RDMA,要走NCCL,要显式地"搬运"数据——先从源节点发出去,经过网络,再在目标节点接收。每一步都有延迟,每一步都消耗带宽。

UAM打破了这个边界。整个SuperPoD中所有NPU的内存——包括HBM和主机内存——被映射到一个统一的地址空间。任意一张NPU,可以直接读写任意一个内存地址,无论这块内存物理上位于哪个机柜、哪个节点。

数据不需要"搬运",因为从NPU的视角看,所有内存都在"本地"。

这就是UAM的核心:它不是让通信更快,而是让通信消失


三、3μs RTT——跨节点访问的延迟有多低

传统RDMA的往返延迟通常在10-15μs,这已经是高性能InfiniBand网络的极限。但在UAM架构下,Atlas 950 SuperPoD实现了跨节点内存访问延迟仅3μs RTT

3μs是什么概念?CPU访问本地DRAM的延迟大约是100ns,RDMA的延迟是10-15μs。UAM的3μs恰好落在两者之间——比RDMA快3-5倍,虽然比本地DRAM慢,但已经到了"可用"的区间。

更重要的是,这个过程不需要应用层感知——不需要调用通信API,不需要管理数据搬运,内存访问就是一条普通的load/store指令。程序员看到的是一个256TB的平坦内存空间,不需要关心数据物理上在哪。

这就是UAM和传统通信协议的本质区别:传统方案是"搬数据",UAM是"共享地址"。


四、256TB vs 20.7TB——12倍的差距是代际差距

来看一张对比表:

维度

GB300 NVL72

Atlas 950 SuperPoD (1024卡)

内存池化规模

20.7TB (HBM3e)

256TB (UAM)

池化方式

NVSwitch机柜内池化

灵衢(UnifiedBus)跨节点统一编址

跨节点访问

不支持(仅72卡域内)

3μs RTT,全SuperPod可达

最大扩展

72卡

8192卡

单卡互联带宽

NVLink 1.8TB/s

2TB/s

架构本质

机柜级池化

SuperPod级统一编址

NVL72的20.7TB池化已经是当前商用系统的天花板——72张Blackwell GPU的HBM3e(288GB×72≈20.7TB)通过NVSwitch全互联,机柜内任意GPU可以访问任意显存。但出了这72张卡,就回到了传统通信模式。

256TB vs 20.7TB,不只是12倍的容量差距,更是架构代际的差距。

NVL72是"机柜内池化",Atlas 950是"SuperPod级统一编址"。前者出了机柜就要重新面对通信墙,后者把通信墙从架构层面拆掉了。

再换一个参照系。英伟达下一代Vera Rubin NVL72:Vera CPU搭配Rubin GPU,单颗288GB HBM4,NVLink 1.8TB/s,机架功耗172KW。内存架构依然是机柜内池化,没有突破"出了机柜就是通信墙"的范式。6月18日CoreWeave已拿到首台,BOM 780万美金——但它仍然是NVL72的架构逻辑,只是换了一代芯片。

芯片可以换,架构范式不会因为换芯片而改变。


五、对万亿参数模型意味着什么

万亿参数模型的参数本身需要约2TB(FP8)或1TB(FP4)存储,加上优化器状态、梯度和激活值,轻松突破数十TB。

传统方案需要设计复杂的并行策略——张量并行切分注意力头,流水线并行把模型按层切分到不同节点,数据并行复制模型副本,专家并行拆分MoE层。每一层并行都带来通信开销,工程师花在调并行策略上的时间,可能比训练本身还长。

UAM的意义在于:整个模型可以"一口气"装进256TB的统一地址空间。 所有NPU直接访问模型参数,不需要在节点间拆分和搬运。并行策略的复杂度大幅降低,训练框架的工程门槛也随之下降。

打个比方:传统方案像是一个乐队,每个人看着自己的乐谱,靠对讲机协调节奏;UAM像是把所有人的乐谱合并成一本总谱,每个人都看着同一页——不需要对讲机,因为信息本就在眼前。


六、Dr.Wu判断

UAM是超节点从"拼算力"到"拼系统"的关键转折。

过去五年,行业比的是单卡算力——FP4 FLOPS、HBM容量、互联带宽。但算力堆到EFLOPS级别后,瓶颈已经不在单卡,而在系统架构。一张卡再强,如果40%时间在等通信,系统效率就打了六折。

UAM代表了一种新思路:不是把更多的卡连在一起,而是让更多的卡变成一张卡。256TB统一编址空间,本质上是把1024张NPU变成了一个逻辑上的"超级NPU"。

这才是超节点的"灵魂"——不是算力的堆叠,而是系统的统一。

WAIC上同台展出的还有中兴OEX超节点、中科曙光8000"登峰"。加上已商用750+套的昇腾384超节点,国产超节点阵营已经成型。但真正决定胜负的,不是谁的卡更多,而是谁的系统更"统一"。

还记得那组数据吗?Atlas 950 SuperPoD vs 英伟达NVL72,卡规模14.2倍(1024卡 vs 72卡),总算力3.4倍,内存7倍,互联域最大56.8倍(8192卡 vs 144卡)。内存和互联的差距远大于算力的差距——这恰恰说明,Atlas 950的优势不在单卡,而在系统级架构。UAM就是这组数据背后的底层逻辑。

CANN全面开源,1244万行代码,也在传递同一个信号:开放的系统架构,才是超节点的终局。


关注算力产业格局深度分析?加入算力猎场,和洞察全局的人一起看。

加入方式

微信号

二维码

Dr. Wu 微信

michaelwqs

Alan Ng 微信

alanngw

扫码入群

扫描下方二维码,加入算力猎场微信群

群里有算力产业链的决策者、投资人和技术专家,每日独家分析和行业前瞻。


博士算力猎场 | 行业洞察 Dr. Wu | UCLA Ph.D | 国内首个千卡、万卡GPU智算集群缔造者

 
打赏
 
更多>同类资讯
0相关评论

推荐图文
推荐资讯
点击排行
网站首页  |  关于我们  |  联系方式  |  使用协议  |  版权隐私  |  网站地图  |  排名推广  |  广告服务  |  积分换礼  |  网站留言  |  RSS订阅  |  违规举报  |  皖ICP备20008326号-18
Powered By DESTOON