导语
WAIC 2026重磅成果出炉!鹏城实验室联合全球计算联盟(GCC),集结华为、百度、科大讯飞、清华、中科大等30余家产学研单位,正式发布国内首部《超节点定义与实践白皮书》,首次为全球算力产业统一超节点标准定义、完整架构与落地路径。 当万亿参数MoE模型、百万字超长上下文、自主AI智能体成为行业主流,传统服务器堆叠集群早已陷入通信、内存、效率三重瓶颈。超节点,正是破解算力困局、重塑AI基础设施的全新范式。
一、算力困局:为什么我们再也“堆不动服务器”?
过去十年,行业比拼算力的逻辑很简单:买更多服务器、插更多加速卡,靠横向Scale-Out堆叠支撑大模型。但现在这条路已经走到天花板。
通信开销吞噬算力大模型每一层神经网络、每一轮MoE专家路由,都需要海量跨卡数据同步。传统以太网RoCE集群依赖软件封装、消息转发,跨节点访问延迟高达数十微秒,大量算力在等待数据中空闲。白皮书测算:同等规模下传统集群通信损耗是超节点的5倍以上,万亿模型训练算力利用率不足40%。 内存孤岛难以打通每台服务器拥有独立内存地址空间,KV Cache、模型参数无法全局共享。长文本推理场景下,单卡显存吃紧,只能压缩并发,TTFT、TPOT延迟居高不下,用户交互卡顿严重。 系统扩展边际收益暴跌单机8卡、十几台服务器组网已是极限;一旦扩容至百卡、千卡规模,网络收敛、拥塞、调度碎片化问题集中爆发,硬件投入翻倍,训练/推理性能仅提升30%-50%。
而DeepSeek V4、Qwen等新一代模型,动辄千万专家、百万token上下文、毫秒级推理要求,对算力系统提出“全局一体、低时延、超大带宽”的硬性需求——超节点架构应运而生,用纵向Scale-Up紧耦合,彻底颠覆传统集群逻辑。
二、白皮书权威定义:到底什么是超节点?
白皮书给出官方标准定义:
超节点是物理上由大量计算单元通过高速互联紧密组网,具备跨节点统一内存编址、原生内存语义访问,逻辑上等同于“一台巨型计算机”的Scale-Up计算系统。
一句话通俗解读:上百张NPU/GPU、CPU、内存、存储不再是分散机器,共享同一份全局内存地址,任意芯片可直接用Load/Store指令读写远端数据,像访问本地显存一样简单。
超节点四大核心标志性特征
1. 统一内存语义(最核心分水岭)
传统集群跨机传输要打包、拆包、协议转发;超节点把内存寻址范围延伸至整个机柜/Pod,硬件原生支持跨节点Load/Store读写,跳过全部软件通信栈。这是区分“普通整机柜”和“真正超节点”的核心标准。
2. 超低微秒级时延
节点内点对点通信时延低至1.2μs以内,相较传统RoCE降低50%~90%。MoE模型每token上百次跨专家通信的延迟累积效应被大幅抹平,推理TPOT轻松控制在10ms内。
3. TB/s级超大互联带宽
超节点内部互联总线(UB)提供TB/s级无收敛带宽,完美承载MoE架构All2All海量数据交互。白皮书实测:DeepSeek V3训练场景,超节点未掩盖通信占比直接下降80%。
4. 全资源池化、多算力协同
CPU、NPU、HBM、DDR、SSU存储统一池化,智算、通算、存储算力平等互通,既能跑大模型训推,也能支撑大数据、数据库、仿真、智能体全场景。
三、四层总线架构:拆解超节点底层硬核技术
白皮书创新性提出超节点总线分层能力框架,从物理硬件到上层应用完整打通,是实现统一内存访问的技术骨架:
物理&数据链路层兼容CPO/LPO/NPO新一代光互联,轻量化FEC、Flit小包转发,硬件层面压减百纳秒级延迟,支持128G/256G高速链路,全链路冗余防丢包。 网络&传输层自研短地址转发、原生多路径均衡,兼容以太网互通,单集群支持万卡级大规模组网,拥塞控制精细化管控不同业务流量。 事务层统一封装内存读写、消息、运维事务,支持可靠保序/乱序多模式,硬件级原子操作保障分布式内存安全。 功能&资源管理层对外提供同步Load/Store、异步DMA、RPC远程调用三套编程模型;全局页表完成跨设备地址映射,实现内存弹性借用、多租户硬件隔离。
整套架构摆脱传统网络协议栈束缚,软硬件深度协同,为万亿参数模型提供原生算力底座。
四、十大落地场景:超节点不止用于大模型训练
白皮书覆盖智算、通算、通智融合全赛道,10大核心场景全部验证性能跃升,覆盖AI全生命周期与传统数字化业务:
1. 大模型预训练(性能提升3倍+)
针对GPT-4、DeepSeek等万亿MoE模型,超节点大带宽UB总线掩盖绝大部分All2All通信。同等硬件规模下,传统RoCE集群单步训练103s,超节点仅49.2s,扩展效率高达98.4%,千卡集群MFU突破43%。

2. 低延迟推理(QPS最高提升37%)
全局KV Cache内存池实现跨Prefill/Decode节点共享,Prefix缓存复用。金融671B大模型对话场景,TTFT从12119ms压缩至7235ms,单卡并发从8扩容至30,MoE专家并行通信耗时下降60%。

3. RLHF强化学习、多模态3D重建、Agent智能体
智能体场景打通训练、推理、RAG检索、沙箱服务全链路,通算+智算资源一体化,支撑OpenClaw自主任务流;3D高斯渲染带宽需求百GB/s,超节点异构GPU/NPU池化将迭代耗时压缩至数十毫秒。

4. 虚拟化、数据库、大数据、分布式存储、工业HPC、行业仿真
云虚拟化:内存利用率从80%升至95%,50ms极速虚拟机热迁移; 数据库:分布式事务线性度≥0.8,SQL长尾时延降低70%; 大数据Spark:Shuffle效率提升10%,集群整体利用率提升30%; 自动驾驶、金融、城市治理行业:百万路视频实时分析、PB级仿真、多智能体并发推理全部落地验证。
五、产业变革:整条算力产业链逻辑彻底改写
白皮书明确:超节点不是单一硬件产品,而是整机柜级系统工程,上下游赛道迎来价值重估。
1. 服务器厂商:从卖单机到交付整机柜系统
竞争核心从主板设计转向整机柜液冷、盲插正交架构、整柜运输运维。代表案例鹏城云脑Ⅲ,国内首个国产超节点智算集群,64卡刀片盲插架构,抛弃繁杂光纤线缆,卡间带宽650GB/s,时延仅1.2μs。

2. 液冷、高压供电成为标配
单机柜功耗迈入兆瓦时代,传统风冷彻底淘汰;800V高压直流HVDC替代48V低压母线,降低传输损耗;全液冷冷板、盲插快接头、泄漏检测标准化。
3. 光互联迎来爆发
CPO、硅光、高速交换芯片成为超节点核心瓶颈,800G/1.6T光模块、高Radix交换机需求翻倍,网络从配套升级为算力核心骨架。
4. 运维、软件栈全新升级
运维从单服务器巡检升级整机柜统一监控;配套集合通信库、UB调度框架、内存管理软件形成完整国产软件生态,PyTorch、vLLM原生适配超节点拓扑。
六、多尺度演进路线:百卡→千卡→万卡超节点
白皮书划分清晰三代演进路径,匹配不同行业需求:
百卡商用级(384卡主流)面向互联网、金融、政企推理/中小模型训练,当前落地最广,平衡成本与性能;华为Atlas A3、云厂商推理集群均采用该规格。 千卡科研级(1024卡单元)面向万亿基础大模型、AI for Science前沿科研,新一代光互联支撑全域统一内存域。 万卡国家级大装置未来国家级算力底座,全光无阻塞交换、全域内存池,承载十万亿参数世界模型、通用人工智能研发,以中国算力网C²NET、鹏城云脑系列为建设标杆。
七、未来五年超节点技术趋势
白皮书第七章预判行业长期演进方向:
多样性算力融合:CPU/NPU/GPU/LPU混合部署,通智一体化超节点成为主流; SSU存储直连普及:存储单元直通算力,以存代算,大幅降低KV Cache硬件成本; 光电融合高速互联:CPO/LPO规模化商用,万卡集群纳秒级跨机柜通信; 兆瓦级全液冷机柜标准化:机房配电、散热基础设施全面重构; 全链路标准统一:硬件接口、总线协议、调度软件、测试规范形成全球通用体系,打破厂商生态壁垒。
结语:算力竞争,从单芯片比拼转向系统能力对决
过去,我们比拼单卡峰值算力;未来,比拼能否用系统架构释放集群全部潜力。 《超节点定义与实践白皮书》的发布,填补了全球超节点标准化空白,为国产自主算力基础设施搭建统一坐标系。从鹏城云脑国产落地,到千行百业推理、仿真、数据库规模化应用,超节点正在重构数据中心底层逻辑。
当AI从大模型走向自主智能体、世界模型,算力不再是简单硬件堆叠。以统一内存、高速互联、算存网协同为核心的超节点,将是支撑人工智能持续突破的核心底座,也是筑牢国家算力主权的关键基石。
引用来源:鹏城实验室、全球计算联盟《超节点定义与实践白皮书(2026年7月)》
附录:全文专业英文缩写术语详解
一、算力与模型并行类
MoE:Mixture of Experts,混合专家模型,稀疏大模型主流架构,通过门控网络动态激活部分专家子网,降低全局计算开销,推理/训练产生大量All2All跨卡通信。 DP:Data Parallelism,数据并行,每张加速卡完整存储模型权重,分批处理不同样本,多用于基础大模型预训练。 TP:Tensor Parallelism,张量并行,将神经网络权重矩阵切分到多卡,层内同步计算,对互联带宽要求极高。 EP:Expert Parallelism,专家并行,MoE专属并行策略,不同专家分布在不同NPU,是超节点核心优化场景。 MFU:Model Flops Utilization,模型算力利用率,衡量集群硬件算力实际有效发挥比例,是智算集群核心性能指标。 RLHF:Reinforcement Learning from Human Feedback,基于人类反馈的强化学习,大模型对齐核心流程,包含SFT、RM、PPO三阶段。 Agentic AI:智能体AI,具备自主规划、工具调用、长期记忆、多轮交互的自主人工智能系统。
二、推理性能指标类
TTFT:Time To First Token,首token生成时延,衡量用户输入后模型返回第一个文字的速度,代表Prefill阶段性能。 TPOT:Time Per Output Token,单token生成时延,衡量模型持续输出速度,代表Decode阶段核心指标。 QPS:Queries Per Second,每秒处理请求数,推理服务吞吐核心指标。 KV Cache:Key-Value Cache,Transformer推理缓存,存储历史注意力向量,避免重复计算,长上下文场景占用大量内存。
三、互联总线与光通信类
UB:超节点互联总线,白皮书定义的底层统一内存互联协议,提供TB/s级带宽、纳秒级内存语义访问。 CPO:Co-Packaged Optics,共封装光学,光引擎与交换芯片封装在同一基板,大幅缩短电信号走线,降低时延与功耗。 LPO:Linear-drive Pluggable Optics,线性驱动可插拔光模块,省去DSP重定时环节,适合大规模机柜互联。 NPO:Near-Packaged Optics,近封装光学,光模块紧邻芯片封装,折中平衡成本与传输性能。 Flit:链路层最小传输单元,超节点总线采用固定长度Flit结构,优化小包转发、降低纠错时延。 FEC:Forward Error Correction,前向纠错编码,物理链路无损传输纠错机制,轻量化FEC可降低通信延迟。 RoCE:RDMA over Converged Ethernet,以太网远程直接内存访问,传统AI集群主流互联方案,软件开销远高于超节点UB总线。 DMA:Direct Memory Access,直接内存访问,硬件批量数据搬运引擎,无需CPU参与,用于大规模集合通信。 RPC:Remote Procedure Call,远程过程调用,分布式系统跨设备函数调用接口。
四、硬件算力/存储单元类
NPU:Neural Processing Unit,神经网络处理器,国产AI专用加速芯片。 GPU:Graphics Processing Unit,图形处理器,通用AI训练推理加速芯片。 LPU:Language Processing Unit,语言处理器,针对长文本、大语言模型序列运算优化的专用芯片。 HBM:High Bandwidth Memory,高带宽堆叠显存,算力芯片配套高速存储,提供超高访存带宽。 SSU:存储服务单元,超节点专用存储加速硬件,可卸载EC编码、垃圾回收、KV Cache缓存等任务。 DPU:Data Processing Unit,数据处理器,卸载网络、存储、安全等基础设施负载。 HVDC:High Voltage Direct Current,高压直流供电,800V/400V高压母线适配兆瓦级算力机柜。
五、集群架构与运维标准类
Scale-Up:纵向扩展,紧耦合架构,通过统一内存把多芯片融合为一台巨型计算机(超节点核心架构)。 Scale-Out:横向扩展,传统服务器集群模式,多台独立机器通过以太网组网,各节点内存地址隔离。 Clos:多级无阻塞交换拓扑,超节点机柜内、机柜间主流组网架构。 RAS:Reliability, Availability, Serviceability,可靠性、可用性、可维护性,大型算力集群核心设计标准。 SLA:Service Level Agreement,服务等级协议,定义时延、吞吐、可用性等业务性能承诺。 TCO:Total Cost of Ownership,全生命周期拥有成本,包含硬件采购、机房、能耗、运维、折旧总成本。 C²NET:中国算力网,鹏城实验室牵头建设的全国一体化算力基础设施网络。
六、计算场景专用缩写
HPC:High Performance Computing,高性能计算,工业仿真、分子动力学、气象科研等传统超算场景。 AI4S:AI for Science,科学智能,AI与传统高性能计算融合的交叉领域。 3DGS:3D Gaussian Splatting,3D高斯溅射,多模态三维重建、数字孪生主流渲染技术。 EC:Erasure Coding,纠删码,分布式存储数据冗余保护机制。 Shuffle:大数据混洗,Spark分布式计算跨节点数据重分发操作,传统集群主要性能瓶颈。





