简介 || 什么是 DDP || 单节点多 GPU 训练 || 容错性 || 多节点训练 || minGPT 训练
PyTorch 分布式数据并行 (DDP) - 视频教程#
创建日期:2022年9月27日 | 最后更新:2024年11月15日 | 最后验证:2024年11月5日
请观看以下视频或访问 YouTube 跟随学习。
本系列视频教程将通过 DDP 指导您完成 PyTorch 中的分布式训练。
本系列从一个简单的非分布式训练任务开始,最终教您如何在集群中的多台机器上部署训练任务。在此过程中,您还将学习如何使用 torchrun 进行具备容错能力的分布式训练。
本教程假设您已具备 PyTorch 模型训练的基础知识。
运行代码#
您需要多个 CUDA GPU 来运行本教程的代码。通常,这可以在具有多个 GPU 的云实例上完成(本教程使用配备 4 个 GPU 的 Amazon EC2 P3 实例)。
教程代码托管在这个 GitHub 仓库中。克隆该仓库并跟随教程练习!
教程章节#
简介(本页)
什么是 DDP? 深入浅出地介绍 DDP 的底层工作原理
单节点多 GPU 训练 在单台机器上使用多个 GPU 进行模型训练
具备容错能力的分布式训练 使用 torchrun 增强分布式训练任务的鲁棒性
多节点训练 在多台机器上使用多个 GPU 进行模型训练
使用 DDP 训练 GPT 模型 使用 DDP 训练 minGPT 模型的“现实世界”示例