

Executive Summary
本文建立了一个供应商中立的框架,用于理解和设计AI数据中心基础设施,重点聚焦于大规模AI训练和推理所需的专用网络结构。该框架为“AI组网”(AI Fabrics)引入了标准化的术语和表征方法,实现数千个GPU及加速器以超低延迟和极致带宽连接的专用网络。该框架将基础设施划分为纵向扩展(Scale-Up)、横向扩展(Scale-Out)和跨域扩展(Scale-Across)网络,并集成分布式存储服务。
部署AI基础设施的组织常面临关键挑战:如何从相互竞争的供应商中选择合适的技术,如何优化计算能力与网络能力之间的平衡,以及如何避免浪费昂贵GPU资源的通信瓶颈。本框架通过在投入资本支出之前进行仿真与建模,支持明智的决策。至关重要的是,该框架的适用范围超越了初始架构设计,还支持持续的运维优化,利用实时仿真(数字孪生)来预测性能,并根据不断演变的AI工作负载动态调整资源。InfraGraph建模工具提供了一种标准化方式来描述、比较和优化基础设施设计,从而缩短部署时间,并通过更优的资源利用率提升投资回报率。
本文可为数据中心生态系统中的相关方提供参考和关键见解,包括:设计下一代系统的AI基础设施架构师和数据中心规划者;构建大规模AI训练集群的云服务提供商和企业;开发AI加速器、交换机和互连解决方案的技术供应商;以及探索前沿AI模型开发的研究机构。
本文还指出了若干开放性挑战,包括模型架构与硬件布局的跨层协同优化、共享网络结构上的多租户工作负载调度、面向10K+设备系统的可扩展映射算法,以及可供从业者使用的自动化协同设计工作流。本文全面探讨了AI基础设施的完整谱系,阐明了协同设计原则如何以分形方式应用——从片内“单元内扩展”(Scale-In)级别的互连优化,到机架级“纵向扩展”(Scale-Up)域,再到连接集群的“横向扩展”(Scale-Out)以太网结构,逐层优化。
随着AI模型持续向万亿参数系统演进,工作负载到Fabric网络的智能映射将成为充分释放基础设施潜力的关键。

相关阅读:
P4可编程SDN交换机
P4教程 P4应用 P4论文
Tofino1 | Tifino 2 |国产P4交换机



