Kakao Brain 联合 Hugging Face 开源 ALIGN、ViT 模型及 COYO-700M 数据集
Kakao Brain 联合 Hugging Face 开源了包含 7 亿图文对的 COYO 数据集,以及基于该数据集训练的 ViT 和 ALIGN 视觉语言模型。
推荐理由:原文对比了开源模型与原版 Google 实现的指标差异,并配套开源了 7 亿图文对训练集,对复现跨模态预训练具备参考价值。
Hugging Face 开源社区动态:热门模型与数据集、排行榜变化与开源生态的晴雨表。
Kakao Brain 联合 Hugging Face 开源了包含 7 亿图文对的 COYO 数据集,以及基于该数据集训练的 ViT 和 ALIGN 视觉语言模型。
推荐理由:原文对比了开源模型与原版 Google 实现的指标差异,并配套开源了 7 亿图文对训练集,对复现跨模态预训练具备参考价值。
Hugging Face 在 Diffusers 库中集成 ControlNet 并推出 StableDiffusionControlNetPipeline,原生支持基于空间条件的高精度图像生成。
推荐理由:原文梳理了多条件控制的调用接口与显存优化方案,开发者可据此在工程中快速落地可控生图。
Hugging Face 宣布与亚马逊云科技 AWS 达成扩大的长期战略合作,将 AWS 作为首选云服务提供商。开发者可在 Amazon SageMaker 和 EC2 上利用 AWS Trainium 与 AWS Inferentia 等专用芯片,快速完成 Hugging Face 模型的训练、微调与部署。双方旨在降低生成式 AI 的使用与算力成本,加速下一代开源模型的构建与落地。
推荐理由:原文披露了 Hugging Face 与 AWS 在专用芯片及 SageMaker 工具链上的深度整合,开发者可以据此评估在云端部署与微调开源模型的成本及方案。
Hugging Face Transformers 现已支持 Salesforce Research 开发的视觉语言模型 BLIP-2,可实现低成本的零样本图像到文本生成。该模型通过轻量级 Q-Former 连接冻结的预训练图像编码器与大语言模型,无需进行端到端全量预训练。文章详细提供了环境安装代码,并演示了图像描述、提示图像描述、视觉问答及多轮对话的具体调用方法。
推荐理由:文章演示了通过轻量级 Q-Former 桥接冻结视觉编码器与语言模型的调用方式,为低成本实现多模态交互提供了具体代码范式。
Hugging Face 正式推出 PEFT 库,通过冻结预训练模型主体、仅微调少量额外参数来降低计算与存储开销。该库无缝集成 Transformers 与 Accelerate,支持 LoRA、Prefix Tuning、Prompt Tuning 和 P-Tuning 等主流微调方法。
推荐理由:原文展示了如何在消费级显卡上仅训练微小增量权重来微调大模型,为低算力开发者提供了低成本落地方案。
Hugging Face 宣布微软亚洲研究院提出的 SpeechT5 模型正式接入 Transformers 库,支持文本转语音、语音转换和语音识别等任务。SpeechT5 基于统一的 Transformer 编解码器架构,通过共享预训练表征并配合特定任务的预处理和后处理网络实现多任务适配。官方同步在 Hugging Face Hub 提供了模型权重、HiFi-GAN 声码器支持以及调用示例代码。
推荐理由:统一架构的 SpeechT5 接入降低了语音多任务开发成本,开发者可直接复用官方代码实现识别与合成。
Hugging Face 发布视觉语言模型全景指南,系统解析了对比学习、PrefixLM、跨注意力融合以及 MLM 与 ITM 等主流预训练策略与数据集。文章同时介绍了 Transformers 库对 CLIP、ViLT、CLIPSeg 等多模态模型的支持,并演示了视觉问答与零样本图像分割的具体调用代码。
推荐理由:文章系统梳理了视觉语言模型的五种主流预训练范式与数据流,并给出在 Transformers 框架下的调用范例,方便开发者快速理解多模态技术路线。
Hugging Face 官方发文汇总其生态在计算机视觉领域的全套支持能力,目前已覆盖 8 项核心视觉任务、3000 多个模型和 100 多个数据集。平台在 Transformers、Diffusers 与 timm 中提供了统一的推理 Pipelines、Trainer 微调接口及零样本视觉模型,同时兼容卷积与 Transformer 架构。
推荐理由:文章系统梳理了从模型微调到部署的计算机视觉工具链,读者可据此全面了解开源生态对主流视觉任务的接入方式。
Hugging Face 宣布在 Diffusers 库中正式支持 LoRA 训练与推理,可用于 Stable Diffusion 的全微调与 Dreambooth。
推荐理由:Diffusers 官方支持 LoRA 微调与推理,读者可借此将权重文件压缩至约 3MB 并在消费级显卡上完成训练。
Hugging Face Transformers 正式集成 Mask2Former 与 OneFormer 两个通用图像分割模型,统一支持实例分割、语义分割和全景分割任务。
推荐理由:原文梳理了从逐像素分类到掩码分类的统一图像分割架构演进,并给出了使用 Transformers 快速调用的代码示例。
Hugging Face 发布使用 Transformers 库运行零样本图像分割模型 CLIPSeg 的实战指南。CLIPSeg 在冻结的 CLIP 模型上训练基于 Transformer 的解码器,支持通过文本提示词或参考图像(视觉提示)生成粗略的二值分割掩码;文章同时演示了如何将其输出与标注平台 Segments.ai 结合进行粗标注并后续微调精细分割模型。
推荐理由:教程展示了如何结合文本与图像提示词运行零样本分割,并给出了利用粗分割辅助标注的实践流程。
Hugging Face 发文系统拆解了人类反馈强化学习(RLHF)的核心技术流程与实现细节。文章将 RLHF 拆解为预训练语言模型、收集人类偏好数据训练奖励模型,以及使用 PPO 算法结合 KL 散度惩罚进行微调三个阶段。文中还梳理了 TRL、TRLX 和 RL4LMs 等开源工具库,并分析了数据标注成本高与主观评估分歧等落地挑战。
推荐理由:文章系统拆解了语言模型对齐的核心三步流程与开源工具链,帮助读者理解人类偏好如何转化为强化学习奖励信号。
Hugging Face 提供了在 Apple Silicon 上使用 Core ML 运行 Stable Diffusion 的完整实战指南,并将预转换的模型权重托管至 Hugging Face Hub。该方案支持 CPU、GPU 及神经引擎等计算单元,适配 Python 与原生 Swift 推理,并在 M1 Max 设备上实现了 18 秒单张图像的生成速度。
推荐理由:原文提供了将扩散模型适配至苹果硬件的完整步骤,开发者可直接复用代码在本地实现端侧推理加速。
Hugging Face 梳理了文档智能领域的开源技术方案,涵盖 OCR、图像分类、版面分析、文档解析、表格识别和视觉问答六大核心场景。文章系统对比了 LayoutLM 系列流水线方案与 Donut、PaliGemma 等端到端视觉语言模型的性能表现与商用许可差异。团队建议企业从微调开源预训练模型入手,并根据输入分辨率、标注边界框与具体任务指标设计评估流程。
推荐理由:文章系统梳理了文档智能的六大任务分类与代表性开源模型,为企业选择端到端多模态方案或传统流水线提供了实践参考。
Hugging Face 宣布与 arXiv 达成合作,通过 arXivLabs 在 arXiv 论文页面新增 Demo 标签页。用户无需在本地配置环境或运行代码,即可直接在浏览器中试用社区或作者基于 Gradio、Streamlit 构建的开源交互式应用。这一功能提升了学术论文的可复现性与传播度,便于更广泛的人群探索和验证模型效果。
推荐理由:arXiv 论文页面直接集成 Hugging Face Spaces 演示,方便研究者和开发者无需配置环境即可在线验证模型效果。
Hugging Face 针对 Diffusers 库中的 Dreambooth 训练脚本发布了 Stable Diffusion 微调指南,总结了缓解快速过拟合的超参数与实践技巧。
推荐理由:文章通过多组超参数消融实验总结出人脸微调和先验保留等配置经验,为文生图模型的个性化定制提供了可复现的参考方案。
Hugging Face 发布了使用 🤗 Transformers 微调 OpenAI Whisper 模型的完整分步指南,用于低资源语言及多语言自动语音识别(ASR)任务。
推荐理由:教程提供了基于少量音频适配低资源语言的端到端微调范式与代码,可直接迁移至各类小语种语音识别场景。
Hugging Face 推出大规模文本嵌入基准 MTEB,涵盖 8 项任务、56 个数据集以及多达 112 种语言,并同步上线汇总超 2000 项测试结果的公开排行榜。开发者可通过开源库 pip install mteb 评测任意嵌入模型,并将生成的元数据提交至 Hugging Face Hub 排行榜展示。
推荐理由:原文给出了覆盖56个数据集与112种语言的文本嵌入评测方案,读者可以据此选用统一基准评估模型表现并提交结果。
Hugging Face Diffusers 在 0.5.1 版本加入对 JAX 和 Flax 的支持,允许开发者在 Google TPU 设备上高效并行运行 Stable Diffusion 推理。
推荐理由:原文给出了利用 JAX 的 pmap 与 TPU 多核并行加速图像生成的具体范式,读者可直接复用其编译与分发逻辑。
Hugging Face 团队复盘了为 176B 参数 BLOOM 模型构建高效推理服务的全过程,最终将推理延迟降低 5 倍至 71ms/token,并将吞吐量提升了 50 倍。
推荐理由:原文详尽记录了 176B 大模型从流水线并行转向张量并行与算子融合的实战过程,其性能排坑和测量经验对大模型推理工程很有参考价值。