跳到正文
原文
Hugging Face·· 2024-11-26精选AI 评分69

Hugging Face 发布小参数量视觉语言模型 SmolVLM

SmolVLM - small yet mighty Vision Language Model

AI 导读

Hugging Face 发布了 2B 参数量的轻量视觉语言模型 SmolVLM,支持在笔记本等消费级端侧设备上高效运行。模型以 SmolLM2 1.7B 为语言基座,采用 SigLIP 视觉编码器并配合 9 倍像素重组压缩策略,单图编码仅需 1.2k tokens,推理最低仅需 5.02GB 显存。

推荐理由

该模型通过激进的视觉压缩将显存门槛降至5GB级别,并开源了完整训练方案,适合资源受限场景做端侧部署与微调。

来源:Hugging Face · huggingface.co