INDUSTRY INSIGHT
Prefill/Decode 解耦之后,KV Cache 的跨节点迁移成为推理网络的核心流量。
摩尔线程 8 月 24 日发布《MTT S5000 Prefill-as-a-Service 技术白皮书》,核心是异构 Prefill/Decode Disaggregation(P/D 分离):将计算密集的 Prefill 与访存密集的 Decode 解耦至独立资源池。本文聚焦其互联层设计——KV Cache 跨节点直传、RDMA 数据通路与网络平面隔离。
本文看点
01
搬运对象从梯度转向 KV Cache
02
国产 GPU 基于标准 RDMA 补齐互联
03
互联芯片厂商的切入点
01
TWO TRAFFIC MODELS
Prefill 与 Decode 的通信模型差异
推理的 Prefill 与 Decode 阶段,通信模型存在本质差异。
Prefill 属吞吐型通信模型:计算密集、单次通信数据块大,瓶颈在有效带宽。Decode 属延迟型通信模型:访存密集、逐 token 生成,单步通信量小但频率高、串行依赖,瓶颈在单步时延与尾延迟。
同构混合部署将两类流量置于同一资源池,迫使单一网络同时兼顾吞吐与时延,导致尾延迟离散化,且随扩容加剧资源错配。
摩尔线程的方案是异构 P/D 分离:以 MTT S5000(高密度 FP8 算力)承载 Prefill,以高显存带宽 GPU 承载 Decode,实现TTFT 与 TPOT 的独立优化。
02
GRADIENT TO KV
互联搬运对象:从梯度到 KV Cache
训练场景下,互联主要搬运梯度(AllReduce);传统推理则搬运中间激活(TP 集合通信)。P/D 分离后,互联的核心搬运对象变为 KV Cache:Prefill 侧完成长上下文 Attention 计算后,KV Cache 需跨节点迁移至 Decode 侧。KV 直传因此成为 P/D 分离的关键路径。
白皮书为 KV 直传设计了三条路径,按对齐程度排序:
页粒度直传:两端均为 FP8、页大小与布局一致,直接迁移,不转换;
地址映射加布局重排:dtype 一致但布局不同;
转换 Kernel:dtype 不一致,如 FP16 转 FP8。
MTT S5000 原生输出 FP8 KV,与 Decode 池精度对齐,可走页粒度直传路径,避免跨节点 dtype 转换开销。
03
STANDARD RDMA
跨节点互联:标准 RDMA 数据通路
MTT S5000 通过 mt-peermem 将显存注册为RDMA 可访问的 peer memory,配合 400G RoCE 与 GPUDirect RDMA,构建 S5000 显存 → 网络 → Decode GPU 显存的直传通路。传输层采用开源 Mooncake Transfer Engine,调度采用 SGLang。
该路径未采用英伟达式私有 NVLink,而是基于标准 RoCE + GPUDirect RDMA 生态实现跨节点显存直传。这意味着国产 GPU 的互联能力可由标准网卡与交换机补齐,为互联芯片厂商提供了明确切入点。

04
THREE PLANES
三平面隔离的组网
白皮书给出的最小部署为:一台 128 口 400G RoCE 交换机、一台 25G 业务交换机、一台千兆管理交换机,承载 12 台 MTT S5000 服务器与 1 台 Decode 服务器。
计算、业务、管理三平面物理隔离:400G RoCE 计算平面承载 KV 直传与中间数据,25G 业务平面承载对外推理流量,千兆管理平面对接 BMC。相比训练网络以吞吐为核心,推理网络更强调流量隔离与确定性。

05
MEASURED
性能实测
白皮书的性能实测,验证了 KV 直传与 RDMA 数据通路的带宽能力。
单机 8 卡 MTT S5000,64K 输入 Prefill 吞吐 95920.5 tok/s;300K 长上下文仍有 58412 tok/s;混合 Agent 负载约 83670 tok/s。满载月收入按智谱 API 定价折算约 64.6 万元。
上述吞吐的实现,依赖400G RoCE 数据通路完成 KV 自 Prefill 侧向 Decode 侧的跨节点迁移。
06
IMPLICATIONS
对互联芯片的启示
若 P/D 分离如白皮书所述成为推理基础设施的长期演进方向,互联层将随之变化:
KV Cache 成为核心流量,将催生 KV 感知的优化——KV 路由、KV 专用传输协议、KV 级拥塞控制。
P/D 分离对互联提出差异化要求:Prefill 侧重带宽,Decode 侧重低尾延迟,两者之间需一条稳定的 KV 迁移通道。
国产 GPU 以标准 RoCE/RDMA 补齐互联,而非自建私有链路,对国产网卡构成机会:RDMA 网卡、KV 传输加速、异构算力池互联。
∞
THE END
写在最后
摩尔线程这份白皮书,表层是将 Prefill 独立为可计费的算力产品;就互联层面而言,它印证了一个趋势:AI 网络的搬运对象已从梯度、激活转向 KV Cache,KV 迁移能力正成为推理基础设施的关键底座。
白皮书 请点击 阅读原文
