跳到正文
原文
Hugging Face·· 2025-02-21精选AI 评分74

Google 发布多语言视觉语言编码器 SigLIP 2

SigLIP 2: A better multilingual vision language encoder

AI 导读

Google 正式发布多语言视觉语言编码器 SigLIP 2,在零样本分类、图文检索及多模态下游迁移任务中全面超越前代 SigLIP。新模型在原 Sigmoid 损失基础上引入了文本解码器辅助任务、全局-局部自蒸馏与掩码预测,并推出支持原生宽高比的动态分辨率 naflex 变体。开源版本涵盖 86M 至 1B 参数规模,已全面集成到 Hugging Face Transformers 中。

推荐理由

Google 通过引入解码器辅助任务与自蒸馏强化了视觉定位与局部语义,并新增动态分辨率变体,有利于提升下游视觉语言模型的迁移表现。

来源:Hugging Face · huggingface.co