产品简介
Latest News(原名 DeepSpeed)是微软 AI at Scale 计划的重要组成部分,作为一个开源的深度学习优化库,它致力于使分布式训练变得简单、高效且有效。该库通过一系列系统级创新,重新定义了深度学习训练的规模上限,成功支持了包括 MT-530B 和 BLOOM 在内的多个世界级强大语言模型的训练。
核心功能与技术架构
该产品提供了一套完整的系统优化方案,主要包含以下核心技术:
- ZeRO 系列技术:包括 ZeRO、ZeRO-Offload 和 ZeRO-Infinity,旨在优化内存使用,打破 GPU 内存墙,支持万亿参数模型的训练。
- 3D 并行性:结合数据并行、模型并行和张量并行,实现极致的扩展能力。
- DeepSpeed-MoE:推进混合专家(Mixture-of-Experts)模型的推理与训练,为下一代 AI 规模提供动力。
- 通信优化:如 ZeRO++ 和 1-bit Adam/LAMB,显著降低网络通信开销,提高收敛速度。
最新技术进展
根据官网发布的最新动态,该库持续在以下领域进行迭代:
- SuperOffload:旨在释放超级芯片上大规模大语言模型训练的潜力。
- ZenFlow:一种无停滞卸载引擎,通过异步更新优化 LLM 训练性能。
- Arctic Long Sequence Training (ALST):针对数百万 token 序列的可扩展且高效的训练方案。
- DeepCompile:解锁分布式训练的编译器优化能力。
- AMD GPU 支持:通过 SDMA 技术将集合通信卸载出计算单元,提升重叠效率。
生态集成与兼容性
Latest News 已与多个流行的开源深度学习框架深度集成,方便用户无缝接入:
| 框架名称 | 集成方式 |
|---|---|
| Hugging Face Transformers | 原生支持 DeepSpeed 集成 |
| PyTorch Accelerate | 通过 Accelerate 库调用 |
| PyTorch Lightning | 插件式集成 |
| MosaicML | 支持 MosaicML 平台 |
适用人群与应用场景
该产品主要面向需要处理大规模数据和复杂模型的研发团队:
- 大模型预训练:适用于训练百亿至万亿参数的语言模型,如 GPT-NeoX、Jurassic-1 等。
- 高效推理:通过 DeepSpeed Inference 技术,在前所未有的规模下实现 Transformer 模型的高效推理。
- RLHF 训练:支持类 ChatGPT 模型的快速、低成本强化学习人类反馈训练。
- 科学发现:通过 DeepSpeed4Science 倡议,利用复杂的 AI 系统技术赋能大规模科学发现。
使用建议与贡献指南
用户可通过官方文档了解如何将其与现有 PyTorch 代码结合。对于希望参与社区建设的开发者,项目欢迎贡献代码和建议。大多数贡献需要同意开发者证书起源(DCO),并在提交 commit 时添加 -s 标志或在 PR 中签署 DCO 执行检查。项目遵循微软开源行为准则。
常见问题
Latest News 支持哪些规模的模型训练?
该库设计用于极端规模的深度学习训练。历史上,它已支持包括 MT-530B(5300 亿参数)、BLOOM(1760 亿参数)和 Jurassic-1(1780 亿参数)在内的多个超大规模模型。通过 ZeRO-Infinity 等技术,它能够突破单个 GPU 的内存限制,实现万亿参数级别的模型训练。
如何将该库集成到现有的 PyTorch 项目中?
该库与 PyTorch 高度兼容,并提供了多种集成路径。用户可以直接使用 DeepSpeed Core API,或者通过 Hugging Face Transformers、Accelerate、PyTorch Lightning 等主流框架的内置支持进行调用。官方文档提供了详细的配置指南,帮助用户以最小的代码修改实现分布式训练加速。
该产品是否支持长序列训练?
是的,官网资料显示其具备训练极长序列 Transformer 模型的系统优化能力。最新的 Arctic Long Sequence Training (ALST) 技术专门针对数百万 token 的序列进行了优化,旨在提供可扩展且高效的训练解决方案,满足长上下文窗口模型的需求。
