Hugging Face·· 2024-06-24精选AI 评分67
微调微软 Florence-2 视觉语言模型教程
Fine-tuning Florence-2 - Microsoft's Cutting-edge Vision Language Models
AI 导读
Hugging Face 发布在 DocVQA 数据集上微调微软 Florence-2 视觉语言模型的实操指南,将验证集 Levenshtein 相似度从 0 提升至 57.0。教程通过冻结 DaViT 视觉编码器,使 0.2B 与 0.7B 模型能够在单张 A100 或 T4 GPU 等低算力环境下完成训练,并公开了 Colab 代码与在线 Demo。
推荐理由
教程展示了冻结视觉编码器在单卡环境微调小参数多模态模型的可行路径,为低算力条件下的文档问答任务提供了可迁移方案。
来源:Hugging Face · huggingface.co