Hugging Face·· 2023-12-05精选AI 评分67
Hugging Face 推出 Optimum-NVIDIA:仅需修改单行代码即可加速大语言模型推理
Optimum-NVIDIA Unlocking blazingly fast LLM inference in just 1 line of code
AI 导读
Hugging Face 推出大语言模型推理加速库 Optimum-NVIDIA,结合 NVIDIA TensorRT-LLM 与 Ada Lovelace、Hopper 架构的 FP8 格式,开发者仅需修改单行代码即可完成部署。
推荐理由
该库通过接入 TensorRT-LLM 与 FP8 支持,为需要兼顾首字延迟与批处理吞吐的模型部署团队提供了直接迁移方案。
来源:Hugging Face · huggingface.co