High-Performance-Network-Ar.../docs/chapter1.md

1.8 KiB
Executable File
Raw Permalink Blame History

第1章大模型训练推理中的网络需求与挑战

1.1 AI大模型的并行模式

大模型训练和推理依赖多种并行模式,每种模式产生不同的数据通信需求:

并行模式 缩写 通信特点
张量并行 TP 层内切分,高通信量
流水线并行 PP 层间切分,中通信量
数据并行 DP 数据副本,梯度同步
专家并行 EP MoE路由动态通信
序列并行 SP 序列维度切分,长序列场景

1.2 分布式架构

  • 参数服务器PS:中心化参数存储与同步,适合大规模稀疏模型
  • 集合通信CC:去中心化的 AllReduce 等操作,适合密集模型训练

1.3 单数据中心集群的潜在问题

随着指数级算力需求增长,单数据中心训练面临多重挑战:

  • 国产化GPU替代难国产化GPU算力仅为专有GPU的几分之一构建相同算力集群需要数十倍的跨域集群规模
  • 传统基础设施难以为继GPU数据中心单机架功率密度是传统CPU数据中心的510倍对园区供电能力、散热能力带来巨大挑战

1.4 跨域数据中心集群Inter-DC数据通信

跨域数据中心集群数据通信成为不可忽视的热点研究方向其核心基于骨干网WAN实现地理分布式和跨数据中心的AI训练。

1.5 AI大模型网络需求

AI大模型对网络的核心需求高可用、大带宽、低时延

关键数据0.1%的丢包会造成50%的算力损失可见网络质量对AI训练效率的极端重要性。

思考题

  1. 大模型并行模式中,为什么不同并行策略的通信量差异如此之大?
  2. 跨域数据中心训练相比单数据中心训练,面临哪些额外的网络挑战?