1.8 KiB
Executable File
1.8 KiB
Executable File
第1章:大模型训练推理中的网络需求与挑战
1.1 AI大模型的并行模式
大模型训练和推理依赖多种并行模式,每种模式产生不同的数据通信需求:
| 并行模式 | 缩写 | 通信特点 |
|---|---|---|
| 张量并行 | TP | 层内切分,高通信量 |
| 流水线并行 | PP | 层间切分,中通信量 |
| 数据并行 | DP | 数据副本,梯度同步 |
| 专家并行 | EP | MoE路由,动态通信 |
| 序列并行 | SP | 序列维度切分,长序列场景 |
1.2 分布式架构
- 参数服务器(PS):中心化参数存储与同步,适合大规模稀疏模型
- 集合通信(CC):去中心化的 AllReduce 等操作,适合密集模型训练
1.3 单数据中心集群的潜在问题
随着指数级算力需求增长,单数据中心训练面临多重挑战:
- 国产化GPU替代难:国产化GPU算力仅为专有GPU的几分之一,构建相同算力集群需要数十倍的跨域集群规模
- 传统基础设施难以为继:GPU数据中心单机架功率密度是传统CPU数据中心的5~10倍,对园区供电能力、散热能力带来巨大挑战
1.4 跨域数据中心集群(Inter-DC)数据通信
跨域数据中心集群数据通信成为不可忽视的热点研究方向,其核心基于骨干网(WAN)实现地理分布式和跨数据中心的AI训练。
1.5 AI大模型网络需求
AI大模型对网络的核心需求:高可用、大带宽、低时延
关键数据:0.1%的丢包会造成50%的算力损失,可见网络质量对AI训练效率的极端重要性。
思考题
- 大模型并行模式中,为什么不同并行策略的通信量差异如此之大?
- 跨域数据中心训练相比单数据中心训练,面临哪些额外的网络挑战?