大规模分布式训练
通过 ZeRO、3D 并行、流水线并行和 ZeRO-Infinity 等技术支持大规模深度学习模型训练。
DeepSpeed
让大规模深度学习训练更高效、更易用DeepSpeed 汇集 ZeRO、3D 并行、DeepSpeed-MoE、ZeRO-Infinity 等系统优化能力,覆盖训练、推理、压缩和科学计算场景,并提供配置文档、实践教程、性能分析与监控工具。
从显存优化和并行训练,到高效推理、模型压缩、自动调优与性能观测,提供可组合的深度学习系统能力。
通过 ZeRO、3D 并行、流水线并行和 ZeRO-Infinity 等技术支持大规模深度学习模型训练。
提供推理优化、自动张量并行和混合专家推理等能力,面向大规模 Transformer 模型运行场景。
借助 DeepSpeed-MoE 支持混合专家模型的训练与推理,并提供对应专题教程。
可配置批量大小、优化器、FP16、BFLOAT16 和 ZeRO 策略,并提供自动调优功能。
提供 FLOPs Profiler、PyTorch Profiler、监控模块和通信日志,辅助分析计算与通信表现。
覆盖模型压缩、量化和高效数据采样与路由等能力,用于改善模型运行效率。
了解优化器、ZeRO-3 卸载通信和核心 API 等公开更新。
公开了 Muon Optimizer 与 DeepSpeed 配合使用的项目资料。
介绍在 AMD GPU 上将卸载集合通信移出计算单元,以改善通信与计算重叠。
核心 API 引入 PyTorch 风格的 backward 调用方式与低精度主状态支持。
通过入门指南、技术文档、专题教程、博客和代码仓库了解配置方法与实现细节。