AI in Multiple GPUs: ZeRO & FSDP
of a series about distributed AI across multiple GPUs: ContentsIntroductionThe Memory Problem in DDPZeRO-1: Optimizer State PartitioningZeRO-2: Gradient PartitioningZeRO-3: Parameter PartitioningUsing ZeRO in PyTorchConclusionReferences Introduction In the previous post, we saw how Distributed Data Parallelism (DDP) speeds up training by splitting batches across GPUs. DDP solves the throughput problem, but it introduces a new challenge: memory …










