导读:7 月 19 日 WAIC 2026 期间,鹏城实验室(PCL)与全球计算联盟(GCC)联合三十余家机构发布了《超节点定义与实践白皮书》。它第一次给"超节点"下了产业级定义——不是堆更多芯片,而是让几百张算力卡像一台计算机那样协同工作。
一、为什么需要一份"超节点定义"
过去十年算力竞争的逻辑是"谁芯片更强谁赢"。但今天单芯片性能提升的边际成本持续走高,大模型参数却从千亿冲向万亿、十万亿。传统服务器堆叠(Scale-Out)架构受限于时延和带宽,已经撑不住超大模型的训练与推理负载。
更本质的矛盾在大模型的并行模式:成百上千颗芯片每一轮计算都要同步数据、统一进度。如果通信开销无法被掩盖,并行的收益会被抵消甚至反噬。所以超节点要解决的不是"造更多芯片",而是让更多芯片像一台计算机协同工作。
但长期以来,全球缺乏统一的超节点定义和架构规范,各厂商技术路线分散、认知莫衷一是——千卡规模的"超节点"一定比 512 卡更强吗?这份白皮书就是要回答"什么是真正的超节点"这个基础问题,为产业划定共同的技术坐标系。
二、白皮书的精确定义与三大技术特征
定义:超节点是一种在物理上由多个计算节点通过高效互联协议紧密连接组成,具备跨物理节点的统一内存编址能力,逻辑上具备"一台计算机"特征的计算系统。
核心在于"跨物理节点的统一内存编址",由此提炼出三大技术特征:
内存语义 + 统一内存编址:处理器的核心指令是 Load/Store。超节点通过系统总线把内存语义的可达域从单机扩展到跨节点,任一处理器可直接对超节点内任意内存地址执行 Load/Store——跨节点访问不再需要"序列化→网络传输→反序列化"的流程,由硬件直接完成。 超低时延:MoE 模型每层需上百次专家路由通信,微秒级时延差会被数百层网络持续放大。 超大带宽:TB/s 级高带宽才能承载海量同步流量,否则跨节点通信开销会严重抵消并行收益。
三、Scale-Up 与 Scale-Out 的本质区别
传统数据中心是 Scale-Out:各节点运行在相互隔离的独立地址空间,数据同步依赖软件协议栈和网络报文交换,路径中不可避免地有地址映射、消息组装、中断处理等软件介入层。白皮书指出,这种方式在有效带宽、端到端时延、同步效率上存在数倍乃至一个数量级的结构性劣势。
超节点走的是 Scale-Up:通过超节点总线把 xPU、CPU、HBM、DDR、存储等算力相关资源互联,构建统一地址空间与内存语义访问机制,任一资源可被超节点内计算单元直接、共享地访问,无需软件地址转换或消息封装。由此实现全局内存池化——任一计算节点用标准 Load/Store 就能直接访问远端内存,延迟与带宽接近本地内存,编程模型与单节点一致。这正是"让几百张卡像一台计算机"的硬件基础。
四、十大核心场景与关键实测数据
白皮书梳理了 10 大核心价值场景,并用海量实测数据验证。几个最具冲击力的数字:
| 维度 | 关键数据 |
|---|---|
| 训练性能(DeepSeek V3) | 性能提升 3 倍以上 |
| 推理单卡性能 | 提升 3 倍以上 |
| 扩展效率(128→1024 卡) | 98.4% |
| All2All 性能(对比 RoCE) | 提升 16 倍 |
| 算力密度(对比传统风冷) | 提升 7.7 倍 |
| 网络建设辅材成本 | 降低 50% |
| 虚拟化内存分配率 | 80% → 95% |
| 大 EP 推理吞吐 | 提升 1.4 倍以上 |
| 热迁移时延 | 低至 50ms |
五大重点场景:
大模型训练:统一内存编址让长序列(128K/256K)训练的全局 BatchSize 大幅提升,无需频繁跨节点 Checkpoint 和参数重分布。 全域训练加速:All2All 性能较 RoCE 提升 16 倍,可实现通信全掩盖,彻底打破"通信墙"。 RL 后训练:以纳秒级延迟"流式"注入 Trainer 的 TransferQueue,实现 Rollout 与 Trainer 完全异步解耦。 低时延推理:单节点加载千亿参数全量权重并驻留超大规模并发 KVCache,Decode 请求节点内直接命中内存,避免 KVCache 跨节点迁移的网络延迟。 大 EP 推理:超大带宽、超低时延天然亲和小包场景,消除"Prefill 卡等 Decode 卡"的算力闲置。
标杆案例:鹏城云脑Ⅲ(国内首个超节点架构国产智算集群)64 颗 NPU 总线互联,双向带宽超 650GB/s,点对点最小时延 <1.2μs,千亿参数千卡训练 MFU 达 43%,128→1024 卡扩展效率 98.4%。华为昇腾 384 卡超节点已商用超 750 套,覆盖 20+ 行业、2000+ 客户;WAIC 亮相的 1024 卡昇腾 950 超节点实现 256TB 全局内存统一编址。
五、四大产业价值与编撰阵容
白皮书从产业标准化、技术创新、生态共建、全球赋能四个维度给出行动指引,目标是补齐行业标准短板、明晰技术演进路径、贯通上下游链条、赋能全球产业升级。
由 PCL 与 GCC 共同牵头,联合京东、百度、B站、小红书、中国电信、中国移动、华为、商汤、科大讯飞、清华、北大、浙大、中科大等三十余家顶尖高校、科研院所与头部企业编撰。
六、意义
超节点本质上更接近一种 AI 数据中心系统架构,而非单一硬件产品。白皮书为这场从"规模堆叠"到"系统级重构"的算力范式变革提供了第一份系统性"说明书"——它的最大价值不是技术细节,而是给全产业提供了一套共同语言和评判标尺。当各方对"什么是超节点、该具备哪些能力"有了统一认知,产业链协同效率才可能真正提升。白皮书判断,未来 2-3 年超节点将成为智算中心标配形态。
白皮书全文下载:
全球计算联盟(GCC)官方发布页(扫码注册后下载):https://www.gccorg.com/article/18/555.html


