跳到正文

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

143条精选相关主题开源生态数据与训练端侧 AI

最新精选

第 121–140 条 · 共 143 条
5月11日周四
  1. Hugging Face79

    Hugging Face 推出 Assisted Generation 解码方案以降低文本生成延迟

    Hugging Face 在 Transformers 库中引入 Assisted Generation 解码方法,利用轻量辅助模型生成候选 token 并由主模型单次前向传播并行确认,以此缓解内存带宽瓶颈并降低生成延迟。

    推荐理由:读者可以了解利用小模型生成候选与大模型并行验证的机制,在消费级硬件及显存卸载场景下显著降低推理延迟。

4月26日周三
3月9日周四
  1. Hugging Face76

    Hugging Face 推出 TRL 与 PEFT 集成:支持在 24GB 消费级 GPU 上对 20B 模型进行 RLHF 微调

    Hugging Face 正式发布 TRL 与 PEFT 库的集成,支持在单张 24GB 消费级 GPU(如 RTX 4090)上对 20B 参数大语言模型运行基于人类反馈的强化学习(RLHF)微调。

    推荐理由:通过 8-bit 量化与适配器动态切换避免双模型副本占用,为显存受限环境下跑通 RLHF 提供了具体工程参考。

3月3日周五
2月21日周二
  1. Hugging Face67

    Hugging Face 与 AWS 达成战略合作以降低 AI 使用门槛

    Hugging Face 宣布与亚马逊云科技 AWS 达成扩大的长期战略合作,将 AWS 作为首选云服务提供商。开发者可在 Amazon SageMaker 和 EC2 上利用 AWS Trainium 与 AWS Inferentia 等专用芯片,快速完成 Hugging Face 模型的训练、微调与部署。双方旨在降低生成式 AI 的使用与算力成本,加速下一代开源模型的构建与落地。

    推荐理由:原文披露了 Hugging Face 与 AWS 在专用芯片及 SageMaker 工具链上的深度整合,开发者可以据此评估在云端部署与微调开源模型的成本及方案。

12月1日周四
  1. Hugging Face80

    在 Apple Silicon 上通过 Core ML 运行 Stable Diffusion 指南

    Hugging Face 提供了在 Apple Silicon 上使用 Core ML 运行 Stable Diffusion 的完整实战指南,并将预转换的模型权重托管至 Hugging Face Hub。该方案支持 CPU、GPU 及神经引擎等计算单元,适配 Python 与原生 Swift 推理,并在 M1 Max 设备上实现了 18 秒单张图像的生成速度。

    推荐理由:原文提供了将扩散模型适配至苹果硬件的完整步骤,开发者可直接复用代码在本地实现端侧推理加速。

10月13日周四
10月12日周三
  1. Hugging Face64

    Hugging Face 优化 BLOOM 模型推理性能的工程实践复盘

    Hugging Face 团队复盘了为 176B 参数 BLOOM 模型构建高效推理服务的全过程,最终将推理延迟降低 5 倍至 71ms/token,并将吞吐量提升了 50 倍。

    推荐理由:原文详尽记录了 176B 大模型从流水线并行转向张量并行与算子融合的实战过程,其性能排坑和测量经验对大模型推理工程很有参考价值。

9月16日周五
  1. Hugging Face62

    基于 DeepSpeed 与 Accelerate 实现 BLOOM 高速推理

    Hugging Face 介绍了在 8x80GB A100 等硬件上对 176B 参数 BLOOM 模型进行高速推理的方案与基准测试。结合 DeepSpeed-Inference 的张量并行与融合 CUDA 内核,在批大小为 128 时实现了单 token 低于 1 毫秒的吞吐,并支持 int8 量化使显存需求减半。

    推荐理由:文章给出了基于 DeepSpeed 和 Accelerate 部署 176B 模型的实测吞吐数据与多卡并行脚本,读者可直接参考其显存优化方案。

9月12日周一
  1. Hugging Face84

    Hugging Face 发布 Diffusers 0.3,支持图生图与 Mac 本地推理

    Hugging Face 官方发布扩散模型库 Diffusers 0.3 版本,新增图生图、Textual Inversion、局部重绘流水线以及首版官方文档。新版本通过注意力切片技术将 Stable Diffusion 的显存占用降低至 3.2GB,支持苹果 M1/M2 芯片通过 PyTorch mps 运行,并加入了实验性 ONNX 导出支持。

    推荐理由:Diffusers 0.3 降低了 Stable Diffusion 的显存门槛并扩展到 Mac 平台,为本地部署和二次开发提供了标准化调用范式。

8月22日周一
  1. Hugging Face88

    使用 Diffusers 运行与定制 Stable Diffusion

    Hugging Face 官方发文详解如何通过 Diffusers 库运行和定制文本生成图像模型 Stable Diffusion。模型基于潜在扩散架构,由 VAE、U-Net 与 CLIP 文本编码器组成,通过 64 倍空间压缩大幅降低了显存与计算开销。文章演示了基础推理流程、fp16 显存优化与参数调节,并展示了如何手动编写去噪循环与替换 K-LMS 调度器来实现自定义管线。

    推荐理由:文章详细拆解了潜在扩散模型的核心组件与推理流程,展示了如何通过模块化替换调度器实现自定义图像生成流水线。

8月17日周三
7月14日周四
  1. Hugging Face69

    Hugging Face 详解 176B 大语言模型 BLOOM 训练背后的工程与硬件技术

    Hugging Face 与 BigScience 团队详细公开了 176B 参数大语言模型 BLOOM 训练的技术与工程细节,整个训练在法国国家超算 Jean Zay 上耗时 3.5 个月(约 100 万计算时)完成。

    推荐理由:文章拆解了百亿级多语言模型在数百张 GPU 上的 3D 并行拓扑与数值稳定性方案,适合需要攻克超大规模模型分布式预训练工程细节的团队参考。

5月16日周一
  1. Hugging Face77

    Gradio 3.0 正式发布:推出 Blocks API 并重构前端架构

    Gradio 正式推出 3.0 版本,全面重写前端底层并新增灵活布局的 Blocks API。新版本前端改用 Svelte 构建以减小体积并加快页面加载速度,同时更新了 Dataframe 拖拽交互并新增 Gallery 组件与 TabbedInterface 多标签支持;低阶 Blocks API 允许开发者直接使用 Python 自定义界面布局、实现多模型串联的数据流转与动态组件控制。

    推荐理由:提供了 Blocks 低阶 API 和前端重构细节,开发者可以据此评估如何定制多模型串联与复杂交互界面。

10月5日周二
  1. Hugging Face63

    如何使用 Gradio 在 Hugging Face Spaces 中展示机器学习项目

    Hugging Face 介绍了利用 Gradio 在 Hugging Face Spaces 中托管与展示机器学习 Demo 的完整流程,允许开发者通过几行代码调用 Inference API 快速上线交互界面。

    推荐理由:文章给出了通过 Gradio 在 Hugging Face Spaces 部署模型的具体步骤,开发者可直接参考代码模板搭建轻量交互应用。

  2. Hugging Face61

    使用 Streamlit 在 Hugging Face Spaces 托管模型与数据集教程

    Hugging Face 官方演示了如何利用 Streamlit 在 Hugging Face Spaces 上搭建并托管机器学习模型与数据集的交互应用。教程以复现 Write with Transformer 文本补全为例,展示了通过侧边栏控件调整生成参数以及结合 Datasets 流式加载和可视化库展示数据的方法。

    推荐理由:文章给出了结合 Streamlit 在 Spaces 上搭建模型交互界面与可视化数据集的完整代码,便于快速上手部署应用。

9月14日周二
  1. Hugging Face64

    Hugging Face 推出开源优化工具库 Optimum

    Hugging Face 宣布推出开源工具库 Optimum,旨在为 Transformer 模型在大规模生产部署中提供针对特定硬件的性能优化工具。该库联合硬件厂商封装了底层算子兼容、量化与稀疏化等复杂流程,首期结合 Intel Neural Compressor 简化了针对 Intel Xeon CPU 的模型量化操作。

    推荐理由:Hugging Face 联合硬件厂商推出模型性能优化工具包,旨在降低 Transformer 架构在特定硬件上的量化与部署门槛。

7月28日周三
  1. OpenAI65

    OpenAI 发布 Triton 1.0:面向神经网络的开源 GPU 编程语言

    OpenAI 发布 Triton 1.0,这是一种面向神经网络的开源类 Python 编程语言。该语言允许没有 CUDA 经验的研究人员编写高效的 GPU 代码,多数情况下其运行性能可与专家编写的代码相媲美。

    推荐理由:该开源语言降低了算子开发门槛,让没有相关经验的研究者也能写出性能媲美专家的高效代码。

7月15日周四
  1. Hugging Face64

    基于互联网的深度学习:通过 DeDLOC 协作训练语言模型

    Hugging Face 联合多所机构提出跨互联网协作分布式训练方法 DeDLOC,并联合 40 名志愿者成功预训练出孟加拉语模型 sahajBERT。该方法通过在各节点累加大批次梯度并根据网络条件自适应分配聚合负载,解决了家用宽带带宽受限和节点易掉线的问题。

    推荐理由:原文展示了如何通过去中心化自适应聚合让普通设备协作预训练,为缺乏大算力集群的研究团队提供了低成本替代方案。

7月8日周四
  1. Hugging Face61

    Hugging Face 推出 Amazon SageMaker 推理方案,支持快速部署 Transformer 模型

    Hugging Face 联合亚马逊推出基于 Amazon SageMaker 的全新推理解决方案,上线了专用的 Hugging Face 推理深度学习容器(DLC)与推理工具套件。

    推荐理由:原文给出了基于 DLC 容器在 SageMaker 部署 Transformer 模型的完整代码与参数范式,适合工程团队评估模型云端托管流程。