DeepSpeed

DeepSpeed

让大规模深度学习训练更高效、更易用DeepSpeed 汇集 ZeRO、3D 并行、DeepSpeed-MoE、ZeRO-Infinity 等系统优化能力,覆盖训练、推理、压缩和科学计算场景,并提供配置文档、实践教程、性能分析与监控工具。

DeepSpeed 页面快照
4
训练、推理、压缩与科学计算方向
9
页面列出的大规模模型应用示例
4
页面列出的深度学习框架集成
核心能力

覆盖大规模模型训练与部署流程

从显存优化和并行训练,到高效推理、模型压缩、自动调优与性能观测,提供可组合的深度学习系统能力。

大规模分布式训练

通过 ZeRO、3D 并行、流水线并行和 ZeRO-Infinity 等技术支持大规模深度学习模型训练。

高效模型推理

提供推理优化、自动张量并行和混合专家推理等能力,面向大规模 Transformer 模型运行场景。

混合专家训练

借助 DeepSpeed-MoE 支持混合专家模型的训练与推理,并提供对应专题教程。

配置与自动调优

可配置批量大小、优化器、FP16、BFLOAT16 和 ZeRO 策略,并提供自动调优功能。

性能分析与监控

提供 FLOPs Profiler、PyTorch Profiler、监控模块和通信日志,辅助分析计算与通信表现。

模型压缩与数据效率

覆盖模型压缩、量化和高效数据采样与路由等能力,用于改善模型运行效率。

最新动态

项目功能与系统优化进展

了解优化器、ZeRO-3 卸载通信和核心 API 等公开更新。

在 DeepSpeed 中使用 Muon 优化器

公开了 Muon Optimizer 与 DeepSpeed 配合使用的项目资料。

面向 ZeRO-3 的 System DMA

介绍在 AMD GPU 上将卸载集合通信移出计算单元,以改善通信与计算重叠。

DeepSpeed Core API 更新

核心 API 引入 PyTorch 风格的 backward 调用方式与低精度主状态支持。

开发资源

文档、教程与项目源码

通过入门指南、技术文档、专题教程、博客和代码仓库了解配置方法与实现细节。

DeepSpeed

从这里开始使用DeepSpeed。