Hugging Face 探索基于 InstructPix2Pix 的 Stable Diffusion 指令微调
Hugging Face 探索了借鉴 FLAN 提示模板对 Stable Diffusion 进行指令微调的方法,通过结合 InstructPix2Pix 训练机制,使扩散模型能够遵循具体文本指令完成图像卡通化及底层图像处理。
推荐理由:文章结合语言模型的多任务指令微调思路与扩散模型架构,给出了构建图像编辑指令数据集与微调落地的具体方法。
拿来就能用的实操内容:提示词技巧、工作流搭建、工具用法与踩坑经验。
Hugging Face 探索了借鉴 FLAN 提示模板对 Stable Diffusion 进行指令微调的方法,通过结合 InstructPix2Pix 训练机制,使扩散模型能够遵循具体文本指令完成图像卡通化及底层图像处理。
推荐理由:文章结合语言模型的多任务指令微调思路与扩散模型架构,给出了构建图像编辑指令数据集与微调落地的具体方法。
Hugging Face 博客系统讲解了 BigScience 与 BigCode 在大语言模型和代码模型训练数据上使用的 MinHash + LSH 文档级近似去重流程,涵盖 shingling 分词、指纹计算、LSH 分桶以及用 union find 或 Spark 做连通分量聚类的实现细节。
推荐理由:原文完整走通 MinHash 与 LSH 的工程细节并给出规模化实测配置,可直接迁移到自有数据集的去重流程。
Hugging Face 官方发布博客全面梳理文本生成视频(Text-to-Video)模型的技术演进、核心瓶颈与工程实践。文章回顾了从早期 GAN 与 VAE、第二代 Transformer 架构到当前扩散模型的三代架构跃迁,剖析了时空一致性计算开销大与高质量配对数据稀缺等挑战。
推荐理由:文章系统梳理了从 GAN、Transformer 到扩散模型的文生视频技术演进与瓶颈,并提供了可直接复用的 Diffusers 代码范例。
Hugging Face 发布实践教程,演示如何利用 diffusers 库在仅配有 15GB T4 GPU 的免费 Google Colab 上运行超 10B 参数的开源文生图模型 DeepFloyd IF。
推荐理由:文章给出了在低显存环境下分步加载超大扩散模型的工程方案,为消费级硬件部署大模型提供了实用参考。
Hugging Face 发布 StackLLaMA 实操教程与模型权重,演示如何结合 TRL 库与 8-bit LoRA 技术对 LLaMA-7B 完成完整的 RLHF 对齐。流程涵盖基于 StackExchange 数据的监督微调、奖励模型训练及 PPO 强化学习全周期,并深入分析了奖励作弊与负 KL 惩罚等训练不稳定性问题及工程应对方案。
推荐理由:原文完整梳理了借助参数高效微调在有限算力下落地人类反馈对齐的工程链路,为开源模型复现相关算法提供了可操作方案。
Hugging Face 官方发布使用 diffusers 库训练自定义 ControlNet 的端到端指南,并以人脸关键点控制模型 Uncanny Faces 为例演示完整流程。
推荐理由:原文提供了从数据预处理到低显存适配的完整脚本与参数,读者可以据此将自定义控制条件迁移至扩散模型。
Hugging Face Transformers 现已支持 Salesforce Research 开发的视觉语言模型 BLIP-2,可实现低成本的零样本图像到文本生成。该模型通过轻量级 Q-Former 连接冻结的预训练图像编码器与大语言模型,无需进行端到端全量预训练。文章详细提供了环境安装代码,并演示了图像描述、提示图像描述、视觉问答及多轮对话的具体调用方法。
推荐理由:文章演示了通过轻量级 Q-Former 桥接冻结视觉编码器与语言模型的调用方式,为低成本实现多模态交互提供了具体代码范式。
Hugging Face 发布视觉语言模型全景指南,系统解析了对比学习、PrefixLM、跨注意力融合以及 MLM 与 ITM 等主流预训练策略与数据集。文章同时介绍了 Transformers 库对 CLIP、ViLT、CLIPSeg 等多模态模型的支持,并演示了视觉问答与零样本图像分割的具体调用代码。
推荐理由:文章系统梳理了视觉语言模型的五种主流预训练范式与数据流,并给出在 Transformers 框架下的调用范例,方便开发者快速理解多模态技术路线。
Hugging Face Transformers 正式集成 Mask2Former 与 OneFormer 两个通用图像分割模型,统一支持实例分割、语义分割和全景分割任务。
推荐理由:原文梳理了从逐像素分类到掩码分类的统一图像分割架构演进,并给出了使用 Transformers 快速调用的代码示例。
Hugging Face 发布使用 Transformers 库运行零样本图像分割模型 CLIPSeg 的实战指南。CLIPSeg 在冻结的 CLIP 模型上训练基于 Transformer 的解码器,支持通过文本提示词或参考图像(视觉提示)生成粗略的二值分割掩码;文章同时演示了如何将其输出与标注平台 Segments.ai 结合进行粗标注并后续微调精细分割模型。
推荐理由:教程展示了如何结合文本与图像提示词运行零样本分割,并给出了利用粗分割辅助标注的实践流程。
Hugging Face 发文系统拆解了人类反馈强化学习(RLHF)的核心技术流程与实现细节。文章将 RLHF 拆解为预训练语言模型、收集人类偏好数据训练奖励模型,以及使用 PPO 算法结合 KL 散度惩罚进行微调三个阶段。文中还梳理了 TRL、TRLX 和 RL4LMs 等开源工具库,并分析了数据标注成本高与主观评估分歧等落地挑战。
推荐理由:文章系统拆解了语言模型对齐的核心三步流程与开源工具链,帮助读者理解人类偏好如何转化为强化学习奖励信号。
Hugging Face 提供了在 Apple Silicon 上使用 Core ML 运行 Stable Diffusion 的完整实战指南,并将预转换的模型权重托管至 Hugging Face Hub。该方案支持 CPU、GPU 及神经引擎等计算单元,适配 Python 与原生 Swift 推理,并在 M1 Max 设备上实现了 18 秒单张图像的生成速度。
推荐理由:原文提供了将扩散模型适配至苹果硬件的完整步骤,开发者可直接复用代码在本地实现端侧推理加速。
Hugging Face 梳理了文档智能领域的开源技术方案,涵盖 OCR、图像分类、版面分析、文档解析、表格识别和视觉问答六大核心场景。文章系统对比了 LayoutLM 系列流水线方案与 Donut、PaliGemma 等端到端视觉语言模型的性能表现与商用许可差异。团队建议企业从微调开源预训练模型入手,并根据输入分辨率、标注边界框与具体任务指标设计评估流程。
推荐理由:文章系统梳理了文档智能的六大任务分类与代表性开源模型,为企业选择端到端多模态方案或传统流水线提供了实践参考。
Hugging Face 针对 Diffusers 库中的 Dreambooth 训练脚本发布了 Stable Diffusion 微调指南,总结了缓解快速过拟合的超参数与实践技巧。
推荐理由:文章通过多组超参数消融实验总结出人脸微调和先验保留等配置经验,为文生图模型的个性化定制提供了可复现的参考方案。
Hugging Face 发布了使用 🤗 Transformers 微调 OpenAI Whisper 模型的完整分步指南,用于低资源语言及多语言自动语音识别(ASR)任务。
推荐理由:教程提供了基于少量音频适配低资源语言的端到端微调范式与代码,可直接迁移至各类小语种语音识别场景。
Hugging Face Diffusers 在 0.5.1 版本加入对 JAX 和 Flax 的支持,允许开发者在 Google TPU 设备上高效并行运行 Stable Diffusion 推理。
推荐理由:原文给出了利用 JAX 的 pmap 与 TPU 多核并行加速图像生成的具体范式,读者可直接复用其编译与分发逻辑。
Hugging Face 团队复盘了为 176B 参数 BLOOM 模型构建高效推理服务的全过程,最终将推理延迟降低 5 倍至 71ms/token,并将吞吐量提升了 50 倍。
推荐理由:原文详尽记录了 176B 大模型从流水线并行转向张量并行与算子融合的实战过程,其性能排坑和测量经验对大模型推理工程很有参考价值。
Hugging Face 介绍了在 8x80GB A100 等硬件上对 176B 参数 BLOOM 模型进行高速推理的方案与基准测试。结合 DeepSpeed-Inference 的张量并行与融合 CUDA 内核,在批大小为 128 时实现了单 token 低于 1 毫秒的吞吐,并支持 int8 量化使显存需求减半。
推荐理由:文章给出了基于 DeepSpeed 和 Accelerate 部署 176B 模型的实测吞吐数据与多卡并行脚本,读者可直接参考其显存优化方案。
Hugging Face 撰文解读 OpenRAIL 许可框架,旨在平衡 AI 模型的开放共享与负责任使用,解决传统开源软件许可证无法约束模型滥用风险的问题。该许可在允许免版税分发和衍生开发的同时嵌入行为限制条款,并要求下游衍生版本继续继承该限制。目前该方案已应用于 BigScience BLOOM 和 Stable Diffusion 等开源发布中,以对接全球 AI 监管与合规要求。
推荐理由:文章解析了模型权重分发与传统开源代码在法律属性上的差异,有助于开发者理解为何需要行为限制条款来约束下游滥用。
Hugging Face 官方发文详解如何通过 Diffusers 库运行和定制文本生成图像模型 Stable Diffusion。模型基于潜在扩散架构,由 VAE、U-Net 与 CLIP 文本编码器组成,通过 64 倍空间压缩大幅降低了显存与计算开销。文章演示了基础推理流程、fp16 显存优化与参数调节,并展示了如何手动编写去噪循环与替换 K-LMS 调度器来实现自定义管线。
推荐理由:文章详细拆解了潜在扩散模型的核心组件与推理流程,展示了如何通过模块化替换调度器实现自定义图像生成流水线。