跳到正文

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

143条精选相关主题开源生态数据与训练端侧 AI

最新精选

第 101–120 条 · 共 143 条
12月11日周一
12月5日周二
  1. Hugging Face63

    Hugging Face 详解 LoRA 动态加载方案:将 Diffusion 推理预热提速 300%

    Hugging Face 在 Hub Inference API 中实现了 Stable Diffusion LoRA 适配器的按需动态切换,通过保持基础模型常驻内存,将服务预热时间从 25 秒缩短至 3 秒,用户端请求响应时间从 35 秒降至 13 秒。

    推荐理由:团队公开了保持基座模型常驻并按请求动态插拔 LoRA 的具体架构,为多微调模型的高并发推理提供了可复用的工程方案。

  2. Hugging Face67

    Hugging Face 推出 Optimum-NVIDIA:仅需修改单行代码即可加速大语言模型推理

    Hugging Face 推出大语言模型推理加速库 Optimum-NVIDIA,结合 NVIDIA TensorRT-LLM 与 Ada Lovelace、Hopper 架构的 FP8 格式,开发者仅需修改单行代码即可完成部署。

    推荐理由:该库通过接入 TensorRT-LLM 与 FP8 支持,为需要兼顾首字延迟与批处理吞吐的模型部署团队提供了直接迁移方案。

10月24日周二
10月19日周四
10月3日周二
9月15日周五
  1. Hugging Face69

    Hugging Face 发布大语言模型生产环境部署优化指南

    Hugging Face 发布生产环境下大语言模型推理与显存优化指南,系统梳理低精度量化、Flash Attention 与架构选型三大方向。文章通过实测展示 8-bit 和 4-bit 量化大幅削减显存需求,利用 Flash Attention 缓解长文本注意力的二次方显存瓶颈。

    推荐理由:文章给出了量化、Flash Attention 与架构演进的实测显存对比,读者可以直接作为大语言模型部署调优的参考框架。

9月12日周二
  1. Hugging Face61

    Transformers 原生量化方案对比:bitsandbytes 与 auto-gptq 性能基准与选型指南

    Hugging Face 对 Transformers 原生支持的 bitsandbytes 与 auto-gptq 进行了全面基准测试与对比。实测表明 bitsandbytes 无需校准数据集且跨模态兼容性好,适配器微调速度更优;auto-gptq 在文本生成推理速度和权重序列化上优势明显。官方建议可在微调阶段采用 bitsandbytes,合并权重后再通过 GPTQ 量化部署。

    推荐理由:文章提供了实测数据对比 bitsandbytes 与 GPTQ 在推理和微调上的表现,方便开发者选型量化方案。

9月6日周三
  1. Hugging Face78

    TII 开源 1800 亿参数大模型 Falcon 180B 并上线 Hugging Face

    TII 正式在 Hugging Face 推出开源大语言模型 Falcon 180B,包含基础版与聊天版,拥有 1800 亿参数。该模型基于 RefinedWeb 等 3.5 万亿 token 预训练,规模达 Llama 2 的 2.5 倍,在 MMLU 等基准测试中超越 Llama 2 70B 与 GPT-3.5。

    推荐理由:文章提供了 180B 超大开源模型的评测基准成绩以及量化部署所需的显存配置细节。

8月30日周三
  1. Hugging Face61

    AudioLDM 2 推理加速指南:利用 Diffusers 将生成时间缩短至 1 秒内

    Hugging Face 介绍了在 Diffusers 库中加速文本生成音频模型 AudioLDM 2 的多项优化方案,成功将 10 秒音频样本的生成耗时从 14 秒缩短至 1 秒以内。

    推荐理由:文章系统梳理了扩散音频模型从调度器替换、编译到显存卸载的完整提速步骤,方法可直接复用到其他基于 Diffusers 的生成任务。

8月23日周三
8月8日周二
  1. Hugging Face69

    Hugging Face 发布 Swift Transformers:支持在苹果设备端侧运行大语言模型

    Hugging Face 发布开源软件包 Swift Transformers,旨在为苹果生态开发者提供类似 Transformers 的 API,以在 Mac 等设备上通过 Core ML 运行端侧大语言模型。

    推荐理由:文章梳理了将大模型转换为 Core ML 的实操流程与工程避坑点,为苹果生态开发者提供了端侧部署语言模型的现成工具链。

7月27日周四
7月18日周二
  1. Hugging Face96

    Meta 开源大语言模型 Llama 2,Hugging Face 提供全面集成支持

    Meta 发布开源大语言模型家族 Llama 2,涵盖 7B、13B 和 70B 参数版本并开放商用许可,Hugging Face 同步提供全生态集成支持。该系列在初代基础上增加了 40% 预训练 token 并将上下文拓展至 4k tokens,经 RLHF 优化的 Llama 2-Chat 在多项基准上接近 ChatGPT 表现。

    推荐理由:材料梳理了新模型相比初代的上下文与训练量升级,并提供了基于开源生态的推理部署与微调路径。

6月15日周四
6月13日周二
6月5日周一
5月31日周三
5月24日周三