
7 月 21 日,2026 夏季 InfiniTensor 训练营通信与并行方向第二课《大模型并行策略与通信优化》开讲。
上一节《互联、集群与通信》完整讲解 AI 集群底层通信,涵盖 PCIe、NVLink、RDMA 跨机通信、服务器架构与数据中心网络拓扑,建立高性能通信硬件认知。
本节课基于 PCIe、NVLink、RDMA、集群网络等底层硬件通信基础,拆解大模型分布式训练各类并行方案、集合通信算子底层原理、通信性能优化核心手段,打通硬件互联到上层模型训练的完整链路。
为什么需要分布式通信
分布式训练两大核心诱因
1. 算力不足:数据并行加速训练
- 小模型单卡即可完成训练,无需通信;
- 大训练集下单卡计算速度慢,采用数据并行:多卡复制完整模型,每张卡加载独立数据分片,反向传播后通过通信完成全局梯度平均同步。

2. 显存不足:模型分片并行
当前大模型参数规模高达 2.8T,单机多卡显存无法容纳完整权重,衍生多种模型分片并行方式:
- 流水线并行:按模型层数切分设备,层间传输中间特征;
- 张量并行:将单层计算中的权重矩阵或张量进行切分,由多个设备协同完成计算;
- MoE 专家并行:路由分发、专家结果聚合,高频 All-to-All 通信;
- 序列并行:超长上下文分片,降低激活显存占用。
集合通信:打破点对点传输的性能天花板
通信基础与痛点

- 初始化过程:创建
Communicator时会隐式完成地址解析、路由建立等操作,开发者仅需获取Rank ID即可发起通信。 - 点对点通信局限:直接使用
Send/Recv操作时,开发者需手动编写同步逻辑,且多卡场景下存在大量冗余传输,无法利用底层网络拓扑特性进行全局优化。
集合通信(以 AllReduce 为例)

- 朴素两两同步:每个节点向其余 N-1 个节点发送全量数据。通信次数随节点数呈平方级增长,带宽浪费极其严重,仅具理论参考价值。

- Parameter Server 模式:选定一个 Server 节点汇聚所有数据并广播结果。传输数据量降为线性,但 Server 节点的网卡带宽会成为单点瓶颈,不适用于大规模训练。

- Ring AllReduce(工业界标准):将数据切片后沿环形拓扑传递,在保证带宽均衡利用的同时,将传输时间复杂度有效降低,是当前集合通信的基石算法。

其他常用集合通信算子
- AllGather:每个节点提供局部数据,最终所有节点均获得完整的数据集合。

- AllToAll:实现类似矩阵转置的数据重排,是 MoE 专家路由的核心通信原语。
- 组合算子:
ReduceScatter与AllGather的组合可等价实现AllReduce,灵活适配不同并行策略。
通信优化
计算通信重叠

串行执行的浪费:传统模式下,计算时通信链路闲置,通信时 GPU 计算单元停滞,资源利用率低下。
并行掩盖延迟:通过异步通信接口和通信计算并行执行,使通信过程与 GPU 计算重叠,从而隐藏部分通信开销。
分布式矩阵乘优化实例
- 串行模式:先完成完整的矩阵乘法计算,再统一执行
ReduceScatter同步,总耗时为两者之和。 - Overlap 模式:将矩阵 A 切分为多个子块,计算完第一个子块后立即发起异步通信,同时在通信过程中继续计算后续子块。由于每次通信数据量减小且与计算并行,整体任务完成时间大幅缩短。
- 串行模式:先完成完整的矩阵乘法计算,再统一执行
拓扑感知

机内总线网络:带宽极高但规模受限,优先承载
AllReduce、AllToAll等大流量集合通信算子。机间 RDMA 网络:带宽相对较低但支持万卡乃至十万卡级组网,承载流水线并行的 P2P 通信及跨机数据并行流量。
网络层级扩展:随着集群规模扩大,交换机层级从 Leaf 逐步扩展至 Spine、Fabric,通信策略需动态适配拓扑变化。
流水线并行 DualPipe
1F1B 基础方案

- 采用前向-后向交替执行的模式。
- 由于反向传播耗时通常约为前向的两倍,会导致前向计算出现大量空跑气泡,资源利用率不高。
ZB1P 细粒度拆分方案

- 将反向计算进一步拆分为输入梯度计算和权重梯度计算等阶段,通过更细粒度调度减少流水线空泡。
- 使各阶段耗时更加均衡,减少了部分气泡,但仍存在少量设备空闲时间。
DualPipe 和 DualPipe-V


加入训练营
📺完整课程内容,请观看直播或查看课程回放:
InfiniTensor 官网: https://www.infinitensor.com
B站直播: InfiniTensor 官方直播间
视频号直播: InfiniTensor 视频号预约
答疑交流: 训练营官方社群⬇️

关注与交流

