
1.6万亿参数、384个MoE专家:单卡已装不下下一代模型
鹏城实验室《超节点定义与实践白皮书》给出的系统级答案
DeepSeek V4的模型总规模达到1.6万亿参数,集成384个MoE专家,支持100万超长序列,追求10毫秒级token输出时延。
这样的模型,已经不是单卡甚至单机能够承载的。
鹏城实验室与全球计算联盟联合发布的《超节点定义与实践白皮书》【文末附资源下载地址】,给出了一个系统性答案:超节点架构。



【文末附资源下载地址】
核心洞察
超节点通过高速、低时延、大带宽的互联协议,将数十乃至数百个计算单元紧密连接,逻辑上具备’一台计算机’特征。
《超节点定义与实践白皮书》
01
单芯片性能已经撞上天花板
白皮书指出,制程演进趋缓,单芯片性能提升的边际成本不断上升。
存储容量、访存带宽、互联效率、能源供给、工程交付,正在成为制约智能发展的关键因素。
过去AI基础设施竞争围绕xPU、CPU、HBM、网卡等单点硬件展开。现在,行业重心正转向"整机柜即计算机"的系统级架构。
简单说:未来的算力竞争,不是比谁的芯片更强,而是比谁能把大量芯片高效地组织成一台超级计算机。
02
超节点的核心是"内存语义"互联
超节点最本质的特征,是跨物理节点的统一内存编址能力。
在传统Scale-Out架构中,每个节点有独立地址空间,数据同步依赖软件协议栈和网络报文交换。
在超节点架构中,任一处理器Core可以直接对其他节点的内存地址执行Load/Store操作,访问延迟和带宽接近本地内存。
这带来两个直接好处:一是程序员不需要重写软件模型,二是通信延迟可以被硬件机制大幅隐藏。
白皮书数据显示:超节点RTT通信时延降至微秒级,降低了50%以上。
对于大模型推理来说,这一点至关重要。一次完整的前向计算会经过几十层神经网络,每层多次节点间数据同步。微小的RTT时延增加,会被放大成百上千倍,直接影响端到端推理体验和算力利用率。
03
四个阶段,勾勒超节点演进路线
报告把超节点发展分为四个阶段。
第一阶段是单机多卡,典型形态是8 xPU服务器,重点是服务器内部互联。
第二阶段是整机柜超节点,把部分xPU集群通信前移到rack-scale互联域,提升训练推理效率。
第三阶段是Pod级和多机柜超节点,实现几百个xPU的统一域。
第四阶段是超节点集群化,通过Scale-Out把多个超节点聚合为统一算力资源池。
鹏城实验室已经建设了国内首个采用超节点架构的国产智算集群"鹏城云脑III"。
国产超节点的意义不只是性能。它还为自主可控的算力基础设施提供了工程样本,让国内芯片、互联、软件厂商能够在同一架构下协同迭代。
04
一条超节点,搅动整个产业链
超节点的出现,正在重塑多个产业环节。
对服务器厂商,能力边界从主板设计和整机装配,延伸到整机柜级系统交付。对液冷企业,从散热方案升级为基础设施平台。对电源企业,高压直流和机柜级供电成为新方向。对网络企业,scale-out网络成为下一阶段瓶颈,800G/1.6T、硅光、CPO等技术加速演进。对运维厂商,从单节点维护升级为整机柜级、集群级统一运维。
白皮书判断:未来2-3年,全球AI基础设施竞争的主线,将从单点xPU性能比拼升级为系统级工程能力竞争。
这种竞争对中国产业尤其关键。正视单芯片能力与国际顶尖水平之间的差距固然重要,但通过架构创新释放系统潜力,以系统级扩展弥补单点不足,是构建先进算力基础设施的现实路径。

风险预警:3个检查判断你的算力基建是否跟得上
本季度
评估当前算力架构的扩展瓶颈
本月内
了解液冷和机柜级供电方案
90天内
关注超节点软件栈适配
检查一:本季度评估当前算力架构的扩展瓶颈
如果你的大模型训练或推理受限于跨节点通信延迟、内存容量或批处理规模,超节点架构可能是值得认真考虑的选项。重点看MFU(芯片算力利用率)是否被I/O瓶颈拖累。
检查二:本月内了解液冷和机柜级供电方案
超节点意味着更高的功率密度。传统风冷难以支撑,液冷、高压直流、机柜级供电将成为标配。提前评估数据中心的散热和供电改造空间。
检查三:90天内关注超节点软件栈适配
超节点不是纯硬件游戏。PyTorch、vLLM等框架需要根据超节点的互联拓扑、总线协议和性能规格做针对性优化。软件适配能力,将决定硬件性能能否真正释放。
超节点不是让单卡更快,而是让数百张卡像一张卡一样工作。
在十万亿参数模型和长上下文推理成为常态的未来,这种系统级能力将是AI基础设施的入场券。
你的算力战略,还停留在买更多卡,还是已经在考虑如何把它们连成一台超级计算机?
点击下载PDF版本
更多内容,可访问
往期推荐


