社会热点
摩尔线程 P/D 分离白皮书:AI 网络正在从「搬运梯度」转向「搬运 KV」
2026-08-25 15:21
摩尔线程 P/D 分离白皮书:AI 网络正在从「搬运梯度」转向「搬运 KV」

INDUSTRY INSIGHT

Prefill/Decode 解耦之后,KV Cache 的跨节点迁移成为推理网络的核心流量。

摩尔线程 8 月 24 日发布《MTT S5000 Prefill-as-a-Service 技术白皮书》,核心是异构 Prefill/Decode Disaggregation(P/D 分离):将计算密集的 Prefill 与访存密集的 Decode 解耦至独立资源池。本文聚焦其互联层设计——KV Cache 跨节点直传、RDMA 数据通路与网络平面隔离

本文看点

01

搬运对象从梯度转向 KV Cache

02

国产 GPU 基于标准 RDMA 补齐互联

03

互联芯片厂商的切入点

01

TWO TRAFFIC MODELS

Prefill 与 Decode 的通信模型差异

推理的 Prefill 与 Decode 阶段,通信模型存在本质差异。

Prefill 属吞吐型通信模型:计算密集、单次通信数据块大,瓶颈在有效带宽。Decode 属延迟型通信模型:访存密集、逐 token 生成,单步通信量小但频率高、串行依赖,瓶颈在单步时延与尾延迟。

同构混合部署将两类流量置于同一资源池,迫使单一网络同时兼顾吞吐与时延,导致尾延迟离散化,且随扩容加剧资源错配。

摩尔线程的方案是异构 P/D 分离:以 MTT S5000(高密度 FP8 算力)承载 Prefill,以高显存带宽 GPU 承载 Decode,实现TTFT 与 TPOT 的独立优化

02

GRADIENT TO KV

互联搬运对象:从梯度到 KV Cache

训练场景下,互联主要搬运梯度(AllReduce);传统推理则搬运中间激活(TP 集合通信)。P/D 分离后,互联的核心搬运对象变为 KV Cache:Prefill 侧完成长上下文 Attention 计算后,KV Cache 需跨节点迁移至 Decode 侧。KV 直传因此成为 P/D 分离的关键路径

白皮书为 KV 直传设计了三条路径,按对齐程度排序:

1

页粒度直传:两端均为 FP8、页大小与布局一致,直接迁移,不转换;

2

地址映射加布局重排:dtype 一致但布局不同;

3

转换 Kernel:dtype 不一致,如 FP16 转 FP8。

MTT S5000 原生输出 FP8 KV,与 Decode 池精度对齐,可走页粒度直传路径避免跨节点 dtype 转换开销

03

STANDARD RDMA

跨节点互联:标准 RDMA 数据通路

MTT S5000 通过 mt-peermem 将显存注册为RDMA 可访问的 peer memory,配合 400G RoCE 与 GPUDirect RDMA,构建 S5000 显存 → 网络 → Decode GPU 显存的直传通路。传输层采用开源 Mooncake Transfer Engine,调度采用 SGLang。

该路径未采用英伟达式私有 NVLink,而是基于标准 RoCE + GPUDirect RDMA 生态实现跨节点显存直传。这意味着国产 GPU 的互联能力可由标准网卡与交换机补齐,为互联芯片厂商提供了明确切入点

04

THREE PLANES

三平面隔离的组网

白皮书给出的最小部署为:一台 128 口 400G RoCE 交换机、一台 25G 业务交换机、一台千兆管理交换机,承载 12 台 MTT S5000 服务器与 1 台 Decode 服务器。

网络平面
规格
职责
计算平面
400G RoCE
KV 直传与中间数据
业务平面
25G
对外推理服务
管理平面
千兆
带外管理(BMC)

计算、业务、管理三平面物理隔离:400G RoCE 计算平面承载 KV 直传与中间数据,25G 业务平面承载对外推理流量,千兆管理平面对接 BMC。相比训练网络以吞吐为核心,推理网络更强调流量隔离与确定性

05

MEASURED

性能实测

白皮书的性能实测,验证了 KV 直传与 RDMA 数据通路的带宽能力。

单机 8 卡 MTT S5000,64K 输入 Prefill 吞吐 95920.5 tok/s;300K 长上下文仍有 58412 tok/s;混合 Agent 负载约 83670 tok/s。满载月收入按智谱 API 定价折算约 64.6 万元

上述吞吐的实现,依赖400G RoCE 数据通路完成 KV 自 Prefill 侧向 Decode 侧的跨节点迁移。

06

IMPLICATIONS

对互联芯片的启示

若 P/D 分离如白皮书所述成为推理基础设施的长期演进方向,互联层将随之变化:

1

KV Cache 成为核心流量,将催生 KV 感知的优化——KV 路由、KV 专用传输协议、KV 级拥塞控制

2

P/D 分离对互联提出差异化要求:Prefill 侧重带宽,Decode 侧重低尾延迟,两者之间需一条稳定的 KV 迁移通道

3

国产 GPU 以标准 RoCE/RDMA 补齐互联,而非自建私有链路,对国产网卡构成机会:RDMA 网卡、KV 传输加速、异构算力池互联

THE END

写在最后

摩尔线程这份白皮书,表层是将 Prefill 独立为可计费的算力产品;就互联层面而言,它印证了一个趋势:AI 网络的搬运对象已从梯度、激活转向 KV Cache,KV 迁移能力正成为推理基础设施的关键底座。

白皮书 请点击 阅读原文 

END
往期回顾
SIGCOMM 2026 论文解读:面向 AI 云的解耦式 DPU 架构(DistDPU)
超节点「上云」:从自建机房到云上租赁的算力运营拐点
英伟达 CPO 交换机全面量产:光互连的「电退光进」时刻
智算Scale-Up 标准组织全览:定义「超节点心脏」的开放协议
PCIe 代际演进:从 2.5 GT/s 到 256 GT/s,一条被 AI 撑爆的高速公路
Token 工厂如何计费:从「按 Token」到「智能路由」,大模型定价体系的进化
网卡虚拟化进化论:从 SR-IOV 到 SIOV
「Token 工厂」引爆 AI 算力大变局
智算系统架构联盟成立,《超节点系统架构规范》首发
WAIC 2026 超节点全景
深扒 Google AI NIC:Titanium + Falcon 如何重构数据中心互联
I 关于「智算X互联 AI-X OpenLab」
「智算X互联 AI-X OpenLab」是聚焦于智能计算(智算)基础设施互联技术与产业生态的垂直领域平台。我们深度追踪从芯片、服务器、超节点、网络(RDMA/IB/以太网)、DPU到集群软件栈等的全栈技术演进,解读国家算力政策与市场趋势,剖析头部企业战略与创新产品。我们致力于成为中国智算领域的“连接器”与“加速器”:
-为开发者:提供最前沿的技术解析、开源项目动态与实践指南。
-为企业管理者与投资者:提供深度的产业分析、竞争格局洞察与投资机会研判。
-为数据中心用户与供应商:搭建供需对接、方案选型与经验共享的桥梁。
我们的目标是构建一个中国智算领域专业社群,推动中国智算基础设施的高质量发展与自主创新。
发表评论
0评