跳到正文

教程实践

拿来就能用的实操内容:提示词技巧、工作流搭建、工具用法与踩坑经验。

128条精选相关主题AI 编码Agent 智能体产品更新

最新精选

第 101–120 条 · 共 128 条
5月23日周二
  1. Hugging Face60

    Hugging Face 探索基于 InstructPix2Pix 的 Stable Diffusion 指令微调

    Hugging Face 探索了借鉴 FLAN 提示模板对 Stable Diffusion 进行指令微调的方法,通过结合 InstructPix2Pix 训练机制,使扩散模型能够遵循具体文本指令完成图像卡通化及底层图像处理。

    推荐理由:文章结合语言模型的多任务指令微调思路与扩散模型架构,给出了构建图像编辑指令数据集与微调落地的具体方法。

5月16日周二
  1. Hugging Face68

    BigCode 背后的大规模近似去重实践

    Hugging Face 博客系统讲解了 BigScience 与 BigCode 在大语言模型和代码模型训练数据上使用的 MinHash + LSH 文档级近似去重流程,涵盖 shingling 分词、指纹计算、LSH 分桶以及用 union find 或 Spark 做连通分量聚类的实现细节。

    推荐理由:原文完整走通 MinHash 与 LSH 的工程细节并给出规模化实测配置,可直接迁移到自有数据集的去重流程。

5月8日周一
  1. Hugging Face60

    深入解析文本生成视频模型演进与 Hugging Face 实践

    Hugging Face 官方发布博客全面梳理文本生成视频(Text-to-Video)模型的技术演进、核心瓶颈与工程实践。文章回顾了从早期 GAN 与 VAE、第二代 Transformer 架构到当前扩散模型的三代架构跃迁,剖析了时空一致性计算开销大与高质量配对数据稀缺等挑战。

    推荐理由:文章系统梳理了从 GAN、Transformer 到扩散模型的文生视频技术演进与瓶颈,并提供了可直接复用的 Diffusers 代码范例。

4月26日周三
4月5日周三
  1. Hugging Face81

    StackLLaMA:使用 RLHF 训练 LLaMA 的实操指南

    Hugging Face 发布 StackLLaMA 实操教程与模型权重,演示如何结合 TRL 库与 8-bit LoRA 技术对 LLaMA-7B 完成完整的 RLHF 对齐。流程涵盖基于 StackExchange 数据的监督微调、奖励模型训练及 PPO 强化学习全周期,并深入分析了奖励作弊与负 KL 惩罚等训练不稳定性问题及工程应对方案。

    推荐理由:原文完整梳理了借助参数高效微调在有限算力下落地人类反馈对齐的工程链路,为开源模型复现相关算法提供了可操作方案。

3月24日周五
2月15日周三
  1. Hugging Face75

    使用 BLIP-2 实现零样本图像到文本生成指南

    Hugging Face Transformers 现已支持 Salesforce Research 开发的视觉语言模型 BLIP-2,可实现低成本的零样本图像到文本生成。该模型通过轻量级 Q-Former 连接冻结的预训练图像编码器与大语言模型,无需进行端到端全量预训练。文章详细提供了环境安装代码,并演示了图像描述、提示图像描述、视觉问答及多轮对话的具体调用方法。

    推荐理由:文章演示了通过轻量级 Q-Former 桥接冻结视觉编码器与语言模型的调用方式,为低成本实现多模态交互提供了具体代码范式。

2月3日周五
  1. Hugging Face62

    Hugging Face 深入解析视觉语言模型与 Transformers 实践指南

    Hugging Face 发布视觉语言模型全景指南,系统解析了对比学习、PrefixLM、跨注意力融合以及 MLM 与 ITM 等主流预训练策略与数据集。文章同时介绍了 Transformers 库对 CLIP、ViLT、CLIPSeg 等多模态模型的支持,并演示了视觉问答与零样本图像分割的具体调用代码。

    推荐理由:文章系统梳理了视觉语言模型的五种主流预训练范式与数据流,并给出在 Transformers 框架下的调用范例,方便开发者快速理解多模态技术路线。

1月19日周四
12月21日周三
  1. Hugging Face60

    基于 Hugging Face Transformers 的 CLIPSeg 零样本图像分割实战指南

    Hugging Face 发布使用 Transformers 库运行零样本图像分割模型 CLIPSeg 的实战指南。CLIPSeg 在冻结的 CLIP 模型上训练基于 Transformer 的解码器,支持通过文本提示词或参考图像(视觉提示)生成粗略的二值分割掩码;文章同时演示了如何将其输出与标注平台 Segments.ai 结合进行粗标注并后续微调精细分割模型。

    推荐理由:教程展示了如何结合文本与图像提示词运行零样本分割,并给出了利用粗分割辅助标注的实践流程。

12月9日周五
  1. Hugging Face76

    Hugging Face 图解人类反馈强化学习(RLHF)核心流程

    Hugging Face 发文系统拆解了人类反馈强化学习(RLHF)的核心技术流程与实现细节。文章将 RLHF 拆解为预训练语言模型、收集人类偏好数据训练奖励模型,以及使用 PPO 算法结合 KL 散度惩罚进行微调三个阶段。文中还梳理了 TRL、TRLX 和 RL4LMs 等开源工具库,并分析了数据标注成本高与主观评估分歧等落地挑战。

    推荐理由:文章系统拆解了语言模型对齐的核心三步流程与开源工具链,帮助读者理解人类偏好如何转化为强化学习奖励信号。

12月1日周四
  1. Hugging Face80

    在 Apple Silicon 上通过 Core ML 运行 Stable Diffusion 指南

    Hugging Face 提供了在 Apple Silicon 上使用 Core ML 运行 Stable Diffusion 的完整实战指南,并将预转换的模型权重托管至 Hugging Face Hub。该方案支持 CPU、GPU 及神经引擎等计算单元,适配 Python 与原生 Swift 推理,并在 M1 Max 设备上实现了 18 秒单张图像的生成速度。

    推荐理由:原文提供了将扩散模型适配至苹果硬件的完整步骤,开发者可直接复用代码在本地实现端侧推理加速。

11月21日周一
  1. Hugging Face67

    Hugging Face 发布文档智能指南:用开源多模态模型加速企业文档处理

    Hugging Face 梳理了文档智能领域的开源技术方案,涵盖 OCR、图像分类、版面分析、文档解析、表格识别和视觉问答六大核心场景。文章系统对比了 LayoutLM 系列流水线方案与 Donut、PaliGemma 等端到端视觉语言模型的性能表现与商用许可差异。团队建议企业从微调开源预训练模型入手,并根据输入分辨率、标注边界框与具体任务指标设计评估流程。

    推荐理由:文章系统梳理了文档智能的六大任务分类与代表性开源模型,为企业选择端到端多模态方案或传统流水线提供了实践参考。

11月7日周一
11月3日周四
10月13日周四
10月12日周三
  1. Hugging Face64

    Hugging Face 优化 BLOOM 模型推理性能的工程实践复盘

    Hugging Face 团队复盘了为 176B 参数 BLOOM 模型构建高效推理服务的全过程,最终将推理延迟降低 5 倍至 71ms/token,并将吞吐量提升了 50 倍。

    推荐理由:原文详尽记录了 176B 大模型从流水线并行转向张量并行与算子融合的实战过程,其性能排坑和测量经验对大模型推理工程很有参考价值。

9月16日周五
  1. Hugging Face62

    基于 DeepSpeed 与 Accelerate 实现 BLOOM 高速推理

    Hugging Face 介绍了在 8x80GB A100 等硬件上对 176B 参数 BLOOM 模型进行高速推理的方案与基准测试。结合 DeepSpeed-Inference 的张量并行与融合 CUDA 内核,在批大小为 128 时实现了单 token 低于 1 毫秒的吞吐,并支持 int8 量化使显存需求减半。

    推荐理由:文章给出了基于 DeepSpeed 和 Accelerate 部署 176B 模型的实测吞吐数据与多卡并行脚本,读者可直接参考其显存优化方案。

8月31日周三
  1. Hugging Face62

    OpenRAIL:迈向开放且负责任的 AI 许可证框架

    Hugging Face 撰文解读 OpenRAIL 许可框架,旨在平衡 AI 模型的开放共享与负责任使用,解决传统开源软件许可证无法约束模型滥用风险的问题。该许可在允许免版税分发和衍生开发的同时嵌入行为限制条款,并要求下游衍生版本继续继承该限制。目前该方案已应用于 BigScience BLOOM 和 Stable Diffusion 等开源发布中,以对接全球 AI 监管与合规要求。

    推荐理由:文章解析了模型权重分发与传统开源代码在法律属性上的差异,有助于开发者理解为何需要行为限制条款来约束下游滥用。

8月22日周一
  1. Hugging Face88

    使用 Diffusers 运行与定制 Stable Diffusion

    Hugging Face 官方发文详解如何通过 Diffusers 库运行和定制文本生成图像模型 Stable Diffusion。模型基于潜在扩散架构,由 VAE、U-Net 与 CLIP 文本编码器组成,通过 64 倍空间压缩大幅降低了显存与计算开销。文章演示了基础推理流程、fp16 显存优化与参数调节,并展示了如何手动编写去噪循环与替换 K-LMS 调度器来实现自定义管线。

    推荐理由:文章详细拆解了潜在扩散模型的核心组件与推理流程,展示了如何通过模块化替换调度器实现自定义图像生成流水线。