跳到正文
原文
Hugging Face·· 2024-05-14精选AI 评分75

Google 开源视觉语言模型 PaliGemma

PaliGemma – Google's Cutting-Edge Open Vision Language Model

AI 导读

Google 推出开源视觉语言模型 PaliGemma,由 SigLIP-So400m 图像编码器与 Gemma-2B 文本解码器通过线性投影层组合而成。该系列包含预训练、多任务混合与学术微调三种版本,提供 224x224、448x448 及 896x896 三种分辨率,支持图像描述、视觉问答、目标检测及指代分割等任务。

推荐理由

PaliGemma 结合了 SigLIP 图像编码器与 Gemma-2B 语言模型,文章详细拆解了其输入构建机制并提供了基于 Transformers 的全套微调代码。

来源:Hugging Face · huggingface.co