评价此页

简介 || 什么是 DDP || 单节点多 GPU 训练 || 容错性 || 多节点训练 || minGPT 训练

PyTorch 分布式数据并行 (DDP) - 视频教程#

创建日期:2022年9月27日 | 最后更新:2024年11月15日 | 最后验证:2024年11月5日

作者: Suraj Subramanian

请观看以下视频或访问 YouTube 跟随学习。

本系列视频教程将通过 DDP 指导您完成 PyTorch 中的分布式训练。

本系列从一个简单的非分布式训练任务开始,最终教您如何在集群中的多台机器上部署训练任务。在此过程中,您还将学习如何使用 torchrun 进行具备容错能力的分布式训练。

本教程假设您已具备 PyTorch 模型训练的基础知识。

运行代码#

您需要多个 CUDA GPU 来运行本教程的代码。通常,这可以在具有多个 GPU 的云实例上完成(本教程使用配备 4 个 GPU 的 Amazon EC2 P3 实例)。

教程代码托管在这个 GitHub 仓库中。克隆该仓库并跟随教程练习!

教程章节#

  1. 简介(本页)

  2. 什么是 DDP? 深入浅出地介绍 DDP 的底层工作原理

  3. 单节点多 GPU 训练 在单台机器上使用多个 GPU 进行模型训练

  4. 具备容错能力的分布式训练 使用 torchrun 增强分布式训练任务的鲁棒性

  5. 多节点训练 在多台机器上使用多个 GPU 进行模型训练

  6. 使用 DDP 训练 GPT 模型 使用 DDP 训练 minGPT 模型的“现实世界”示例