跳到正文

教程实践

拿来就能用的实操内容:提示词技巧、工作流搭建、工具用法与踩坑经验。

最新精选

第 61–80 条 · 共 82 条
1月2日周二
12月20日周三
  1. Hugging Face73

    利用投机解码将 Whisper 推理速度提升 2 倍

    Hugging Face 展示了如何将投机解码应用于 Whisper 语音转录,在保证输出完全一致的前提下将推理速度提升 2 倍。在英语场景中,使用 6 倍速的 distil-large-v2 作为辅助模型仅增加 8% 显存即可实现 2.2 倍加速,多语种搭配 Whisper tiny 也可提速 1.9 倍。该方案最适合较小的 batch size,当批大小超过 4 时加速收益会逐渐消失。

    推荐理由:介绍了用蒸馏或小模型作为辅助草稿模型的投机解码方案,为现有语音转录流水线提供了零精度损失的提速工程参考。

12月11日周一
  1. Hugging Face72

    Hugging Face 详解混合专家模型(MoE)原理与工程实践

    Hugging Face 发布长文系统解析混合专家模型(MoE)的架构机制、发展历史及工程权衡。MoE 通过将 Transformer 的 FFN 层替换为门控网络与多个专家网络,实现条件计算以大幅降低预训练算力开销,并在推理时仅激活部分参数获得更快的计算速度。文章同时指出 MoE 在显存占用、微调泛化稳定性以及跨设备通信负载均衡等方面的核心挑战,并汇总了专家并行、蒸馏、量化等前沿服务化方案。

    推荐理由:原文系统梳理了 MoE 门控路由、负载均衡与微调过拟合等关键技术挑战,读者可据此建立稀疏模型工程部署与训练的完整认知框架。

10月27日周五
  1. Hugging Face75

    Hugging Face 发布专属代码助手训练教程:基于私有代码库微调 StarCoder 并接入 VS Code

    Hugging Face 发布了基于专属代码库训练代码助手 HugCoder 的完整端到端实践教程。内容涵盖从本地仓库提取与过滤代码、基于单张 A100 40GB 运行 QLoRA 与 8 卡 FSDP 全量微调的成本对比,以及利用 PEFT 融合对话与补全两种 LoRA 权重的方法。

    推荐理由:教程给出了从私有代码清洗、QLoRA微调到本地IDE部署的完整实现,开发者可直接参考搭建专属编程助手。

10月24日周二
8月31日周四
  1. OpenAI63

    OpenAI 发布教师使用 ChatGPT 教学指南

    OpenAI 面向在课堂中使用 ChatGPT 的教师发布了一份官方指南。该指南提供了建议提示词、ChatGPT 的工作原理与其局限性说明,并讨论了 AI 检测工具的有效性及模型偏见问题。

    推荐理由:OpenAI 官方为教育工作者梳理了提示词与局限性,教师可以参考其建议规避检测器误判与模型偏见问题。

8月30日周三
  1. Hugging Face61

    AudioLDM 2 推理加速指南:利用 Diffusers 将生成时间缩短至 1 秒内

    Hugging Face 介绍了在 Diffusers 库中加速文本生成音频模型 AudioLDM 2 的多项优化方案,成功将 10 秒音频样本的生成耗时从 14 秒缩短至 1 秒以内。

    推荐理由:文章系统梳理了扩散音频模型从调度器替换、编译到显存卸载的完整提速步骤,方法可直接复用到其他基于 Diffusers 的生成任务。

8月15日周二
  1. OpenAI61

    OpenAI 介绍如何使用 GPT-4 进行内容审核与规则开发

    OpenAI 采用 GPT-4 辅助内容审核决策与审核规则开发。该方案能够实现更一致的内容标注,缩短规则迭代的反馈周期,同时减少人工审核员的直接介入。

    推荐理由:介绍将大语言模型引入内容审核与规则制定的实践路径,为降低人工审核负担和加速规则迭代提供了参考。

8月8日周二
7月17日周一
  1. Hugging Face65

    Hugging Face 详解 AI WebTV 构建:基于开源视频与音乐模型的全自动直播管线

    Hugging Face 推出实验性演示项目 AI WebTV,通过整合开源生成模型展示端到端自动化视频流媒体直播的搭建方案。该方案使用 ChatGPT 扩写分镜提示词,调用 Zeroscope V2 两阶段生成并放大至 1024x576 分辨率视频,经 FILM 算法插帧平滑并混入 MusicGen 生成的配乐,最后通过 FFmpeg 将播放列表推流至 RTMP 服务器。

    推荐理由:原文串联了开源文生视频与音频模型及推流工具,为搭建自动化多媒体管线提供了完整的工程参考。

6月5日周一
4月5日周三
  1. Hugging Face81

    StackLLaMA:使用 RLHF 训练 LLaMA 的实操指南

    Hugging Face 发布 StackLLaMA 实操教程与模型权重,演示如何结合 TRL 库与 8-bit LoRA 技术对 LLaMA-7B 完成完整的 RLHF 对齐。流程涵盖基于 StackExchange 数据的监督微调、奖励模型训练及 PPO 强化学习全周期,并深入分析了奖励作弊与负 KL 惩罚等训练不稳定性问题及工程应对方案。

    推荐理由:原文完整梳理了借助参数高效微调在有限算力下落地人类反馈对齐的工程链路,为开源模型复现相关算法提供了可操作方案。

2月15日周三
  1. Hugging Face75

    使用 BLIP-2 实现零样本图像到文本生成指南

    Hugging Face Transformers 现已支持 Salesforce Research 开发的视觉语言模型 BLIP-2,可实现低成本的零样本图像到文本生成。该模型通过轻量级 Q-Former 连接冻结的预训练图像编码器与大语言模型,无需进行端到端全量预训练。文章详细提供了环境安装代码,并演示了图像描述、提示图像描述、视觉问答及多轮对话的具体调用方法。

    推荐理由:文章演示了通过轻量级 Q-Former 桥接冻结视觉编码器与语言模型的调用方式,为低成本实现多模态交互提供了具体代码范式。

2月3日周五
  1. Hugging Face62

    Hugging Face 深入解析视觉语言模型与 Transformers 实践指南

    Hugging Face 发布视觉语言模型全景指南,系统解析了对比学习、PrefixLM、跨注意力融合以及 MLM 与 ITM 等主流预训练策略与数据集。文章同时介绍了 Transformers 库对 CLIP、ViLT、CLIPSeg 等多模态模型的支持,并演示了视觉问答与零样本图像分割的具体调用代码。

    推荐理由:文章系统梳理了视觉语言模型的五种主流预训练范式与数据流,并给出在 Transformers 框架下的调用范例,方便开发者快速理解多模态技术路线。

12月21日周三
  1. Hugging Face60

    基于 Hugging Face Transformers 的 CLIPSeg 零样本图像分割实战指南

    Hugging Face 发布使用 Transformers 库运行零样本图像分割模型 CLIPSeg 的实战指南。CLIPSeg 在冻结的 CLIP 模型上训练基于 Transformer 的解码器,支持通过文本提示词或参考图像(视觉提示)生成粗略的二值分割掩码;文章同时演示了如何将其输出与标注平台 Segments.ai 结合进行粗标注并后续微调精细分割模型。

    推荐理由:教程展示了如何结合文本与图像提示词运行零样本分割,并给出了利用粗分割辅助标注的实践流程。

12月9日周五
  1. Hugging Face76

    Hugging Face 图解人类反馈强化学习(RLHF)核心流程

    Hugging Face 发文系统拆解了人类反馈强化学习(RLHF)的核心技术流程与实现细节。文章将 RLHF 拆解为预训练语言模型、收集人类偏好数据训练奖励模型,以及使用 PPO 算法结合 KL 散度惩罚进行微调三个阶段。文中还梳理了 TRL、TRLX 和 RL4LMs 等开源工具库,并分析了数据标注成本高与主观评估分歧等落地挑战。

    推荐理由:文章系统拆解了语言模型对齐的核心三步流程与开源工具链,帮助读者理解人类偏好如何转化为强化学习奖励信号。

12月1日周四
  1. Hugging Face80

    在 Apple Silicon 上通过 Core ML 运行 Stable Diffusion 指南

    Hugging Face 提供了在 Apple Silicon 上使用 Core ML 运行 Stable Diffusion 的完整实战指南,并将预转换的模型权重托管至 Hugging Face Hub。该方案支持 CPU、GPU 及神经引擎等计算单元,适配 Python 与原生 Swift 推理,并在 M1 Max 设备上实现了 18 秒单张图像的生成速度。

    推荐理由:原文提供了将扩散模型适配至苹果硬件的完整步骤,开发者可直接复用代码在本地实现端侧推理加速。

10月13日周四
7月14日周四
  1. Hugging Face69

    Hugging Face 详解 176B 大语言模型 BLOOM 训练背后的工程与硬件技术

    Hugging Face 与 BigScience 团队详细公开了 176B 参数大语言模型 BLOOM 训练的技术与工程细节,整个训练在法国国家超算 Jean Zay 上耗时 3.5 个月(约 100 万计算时)完成。

    推荐理由:文章拆解了百亿级多语言模型在数百张 GPU 上的 3D 并行拓扑与数值稳定性方案,适合需要攻克超大规模模型分布式预训练工程细节的团队参考。

10月5日周二
  1. Hugging Face63

    如何使用 Gradio 在 Hugging Face Spaces 中展示机器学习项目

    Hugging Face 介绍了利用 Gradio 在 Hugging Face Spaces 中托管与展示机器学习 Demo 的完整流程,允许开发者通过几行代码调用 Inference API 快速上线交互界面。

    推荐理由:文章给出了通过 Gradio 在 Hugging Face Spaces 部署模型的具体步骤,开发者可直接参考代码模板搭建轻量交互应用。