跳转至

NLP高频面(15)有哪几种分布式训练方式

NLP高频面(15)有哪几种分布式训练方式

本文讨论了随着深度学习模型规模增长,单个设备无法满足训练需求,分布式训练技术成为热点的背景下,几种常见的分布式训练方法,关键要点包括:

数据并行:将数据集分成多个子集,每个设备用完整模型副本处理部分数据,训练后同步梯度更新模型参数,典型实现为 PyTorch DDP。

模型并行:将模型切分到多个设备,分张量并行和流水线并行。张量并行在模型内部特定操作层面并行,如 Megatron-LM、Colossal-AI;流水线并行按层切分模型,设备顺序传递中间数据,如 GPipe、PipeDream 系列。

优化器状态并行:以 ZeRO 为代表,通过分片优化器状态、梯度和模型权重参数节约显存,适用于超大模型训练,有 ZeRO-1、ZeRO-2、ZeRO-3 三个级别。

异构系统并行:充分利用不同计算资源,如 CPU 内存暂存不活跃数据,可训练超大规模模型。

多维混合并行:组合数据并行、张量并行和流水线并行等技术,提升模型训练效率,适合超大规模模型。

自动并行:自动分析模型并决定如何切分算子或层到不同设备,降低开发者实现难度。

专家并行/MoE并行:将大型模型分解为多个小专家网络,部分激活计算,降低成本,适合有限资源下训练超大规模模型,如DeepSeek、Google的Switch Transformer等。

随着深度学习模型规模的迅速增长,单个设备往往无法满足训练需求,因此分布式训练技术成为了业界的热点和研究前沿。本文将介绍几种常见的分布式训练方法。

一、 数据并行(Data Parallelism)

数据并行是一种简单 $ \underline{\text{高效的}} $并行训练方法。它的核心思想是将数据集分成多个子集,每个设备使用完整的模型副本,但只处理部分数据。训练结束后,各设备的梯度进行同步,从而更新统一的模型参数。

典型实现:

PyTorch DDP (Distributed Data Parallel)

二、 模型并行(Model Parallelism)

模型并行通过将模型切分到多个设备上,来解决单个设备无法容纳整个模型的问题,主要分为张量并行和流水线并行两类。

张量并行(Tensor Parallelism)

张量并行是在模型内部的特定操作层面上实现并行,比如将大规模的矩阵乘法操作拆分到多个设备进行并行计算。这种方式通常需要额外通信来聚合计算结果。


典型实现:

Megatron-LM(1D 张量并行)

Colossal-AI(2D、2.5D、3D 张量并行)

流水线并行(Pipeline Parallelism)

流水线并行将模型按层切分到不同设备上,每个设备负责模型的一部分。当模型进行前向或后向传播时,各设备顺序地传递中间数据。其缺点是设备可能存在等待时间,效率低于数据并行。

典型实现:

GPipe

PipeDream 系列

三、 优化器状态并行(ZeRO Parallelism)

优化器状态并行技术专注于减少训练过程中冗余的数据存储,例如模型参数、梯度和优化器状态。代表性的方案为 ZeRO(Zero Redundancy Optimizer)。ZeRO 的三个级别如下:

ZeRO-1:优化器状态分片

ZeRO-2:优化器状态和梯度分片

ZeRO-3:优化器状态、梯度和模型权重参数全部分片

这种方式极大地节约了显存的使用,适用于超大模型的训练。

四、 异构系统并行(Heterogeneous Parallelism)

异构系统并行强调将不同计算资源(如CPU内存、GPU内存甚至NVMe磁盘)充分利用,尤其是CPU拥有较大的内存空间,可暂存不活跃的数据,从而允许训练远超过GPU显存容量的超大规模模型。

这种方法最近逐渐流行起来,可以更灵活地利用多种硬件资源进行模型训练。

五、 多维混合并行(Hybrid Parallelism)

多维混合并行是将数据并行、张量并行和流水线并行等技术组合在一起,以最大化提升模型训练效率。这种方式在实际应用中尤其适合超大规模模型的训练。

六、 自动并行(Automatic Parallelism)

考虑到手动设置复杂的并行策略可能非常困难,自动并行技术应运而生。这种方法可以自动分析模型并决定如何将模型算子或层切分到不同设备,从而降低开发者的实现难度。

七、 专家并行/MoE并行(Mixture of Experts)

MoE 并行将大型模型分解为多个较小的专家网络,每个样本只激活部分专家参与计算,从而实现计算资源的高效利用。MoE 通过稀疏的计算机制,可以大幅降低计算成本,更适合在有限资源下训练超大规模模型。


典型应用如DeepSeek、Google的Switch Transformer和Meta的Sparsely-Gated Mixture-of-Experts等。