跳到正文
原文
Hugging Face·· 2022-09-16精选AI 评分62

基于 DeepSpeed 与 Accelerate 实现 BLOOM 高速推理

Incredibly Fast BLOOM Inference with DeepSpeed and Accelerate

AI 导读

Hugging Face 介绍了在 8x80GB A100 等硬件上对 176B 参数 BLOOM 模型进行高速推理的方案与基准测试。结合 DeepSpeed-Inference 的张量并行与融合 CUDA 内核,在批大小为 128 时实现了单 token 低于 1 毫秒的吞吐,并支持 int8 量化使显存需求减半。

推荐理由

文章给出了基于 DeepSpeed 和 Accelerate 部署 176B 模型的实测吞吐数据与多卡并行脚本,读者可直接参考其显存优化方案。

来源:Hugging Face · huggingface.co