跳到正文
原文
Hugging Face·· 2022-08-17精选AI 评分82

Hugging Face Transformers 集成 bitsandbytes 实现大模型 8-bit 推理

A Gentle Introduction to 8-bit Matrix Multiplication for transformers at scale using transformers, accelerate and bitsandbytes

AI 导读

Hugging Face 宣布在 transformers 和 accelerate 库中完整集成 bitsandbytes 的 LLM.int8() 技术,支持在不损失精度的前提下将大模型推理显存降低约 50%。

推荐理由

原文展示了8位量化在不损耗精度下将显存减半的机制与集成细节,为低算力部署大模型提供了实用参考。

来源:Hugging Face · huggingface.co