Hugging Face 全面集成并支持 Mistral 8x7B 开源 MoE 模型
Hugging Face 宣布全面集成 Mistral 发布的开源 MoE 模型 Mixtral 8x7B,并在 Hub、Transformers 及 TGI 中提供完整支持。
推荐理由:文章系统梳理了该 MoE 模型的显存配置要求与量化部署路径,为开源模型的低成本微调及工程落地提供了参考。
把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。
Hugging Face 宣布全面集成 Mistral 发布的开源 MoE 模型 Mixtral 8x7B,并在 Hub、Transformers 及 TGI 中提供完整支持。
推荐理由:文章系统梳理了该 MoE 模型的显存配置要求与量化部署路径,为开源模型的低成本微调及工程落地提供了参考。
Hugging Face 在 Hub Inference API 中实现了 Stable Diffusion LoRA 适配器的按需动态切换,通过保持基础模型常驻内存,将服务预热时间从 25 秒缩短至 3 秒,用户端请求响应时间从 35 秒降至 13 秒。
推荐理由:团队公开了保持基座模型常驻并按请求动态插拔 LoRA 的具体架构,为多微调模型的高并发推理提供了可复用的工程方案。
Hugging Face 推出大语言模型推理加速库 Optimum-NVIDIA,结合 NVIDIA TensorRT-LLM 与 Ada Lovelace、Hopper 架构的 FP8 格式,开发者仅需修改单行代码即可完成部署。
推荐理由:该库通过接入 TensorRT-LLM 与 FP8 支持,为需要兼顾首字延迟与批处理吞吐的模型部署团队提供了直接迁移方案。
Hugging Face 宣布与 AMD 合作实现大语言模型在 AMD Instinct GPU 上的开箱即用加速,用户无需修改代码即可直接运行 Transformers 模型。
推荐理由:Transformers 和 TGI 实现了无需修改代码适配 AMD 硬件,开发者可以直接参考其针对大显存与 ROCm 算子的部署方案。
Hugging Face 针对 Stable Diffusion XL(SDXL)的显存占用和推理耗时瓶颈,在 🤗 Diffusers 中梳理了一套轻量优化方案。
推荐理由:文章对比了半精度、编译加速与分片卸载对延迟与显存的实测影响,为消费级硬件部署扩散模型提供了具体的调优路径。
Hugging Face 推出 JavaScript 库 Gradio-Lite(`@gradio/lite`),利用 WebAssembly 运行时 Pyodide 让 Gradio 应用直接在浏览器内免服务器运行。
推荐理由:文章展示了通过 WebAssembly 将应用搬进浏览器的具体实现,开发者无需后端服务器即可低成本部署与分发交互原型。
Hugging Face 为 Transformers 中的 tokenizer 引入 chat_template 属性,通过 Jinja 模板将对话历史转换为与模型训练完全一致的输入字符串。
推荐理由:原文解释了格式不匹配导致模型性能严重受损的机制,并给出通过 Jinja 模板标准化对话输入的统一方案。
Hugging Face 发布生产环境下大语言模型推理与显存优化指南,系统梳理低精度量化、Flash Attention 与架构选型三大方向。文章通过实测展示 8-bit 和 4-bit 量化大幅削减显存需求,利用 Flash Attention 缓解长文本注意力的二次方显存瓶颈。
推荐理由:文章给出了量化、Flash Attention 与架构演进的实测显存对比,读者可以直接作为大语言模型部署调优的参考框架。
Hugging Face 对 Transformers 原生支持的 bitsandbytes 与 auto-gptq 进行了全面基准测试与对比。实测表明 bitsandbytes 无需校准数据集且跨模态兼容性好,适配器微调速度更优;auto-gptq 在文本生成推理速度和权重序列化上优势明显。官方建议可在微调阶段采用 bitsandbytes,合并权重后再通过 GPTQ 量化部署。
推荐理由:文章提供了实测数据对比 bitsandbytes 与 GPTQ 在推理和微调上的表现,方便开发者选型量化方案。
TII 正式在 Hugging Face 推出开源大语言模型 Falcon 180B,包含基础版与聊天版,拥有 1800 亿参数。该模型基于 RefinedWeb 等 3.5 万亿 token 预训练,规模达 Llama 2 的 2.5 倍,在 MMLU 等基准测试中超越 Llama 2 70B 与 GPT-3.5。
推荐理由:文章提供了 180B 超大开源模型的评测基准成绩以及量化部署所需的显存配置细节。
Hugging Face 介绍了在 Diffusers 库中加速文本生成音频模型 AudioLDM 2 的多项优化方案,成功将 10 秒音频样本的生成耗时从 14 秒缩短至 1 秒以内。
推荐理由:文章系统梳理了扩散音频模型从调度器替换、编译到显存卸载的完整提速步骤,方法可直接复用到其他基于 Diffusers 的生成任务。
Hugging Face 宣布在 Transformers 库中原生集成 AutoGPTQ,支持使用 GPTQ 算法将大语言模型量化至 8、4、3 甚至 2-bit 精度。
推荐理由:原文给出了量化原理与完整集成调用方式,读者可以据此判断如何在消费级 GPU 上部署和微调大模型。
Hugging Face 发布开源软件包 Swift Transformers,旨在为苹果生态开发者提供类似 Transformers 的 API,以在 Mac 等设备上通过 Core ML 运行端侧大语言模型。
推荐理由:文章梳理了将大模型转换为 Core ML 的实操流程与工程避坑点,为苹果生态开发者提供了端侧部署语言模型的现成工具链。
Hugging Face 联合 Apple 为 Stable Diffusion XL 推出了 Core ML 移植方案,通过混合比特调色板量化技术将模型体积缩减了 71%。
推荐理由:通过按层评估信号损失并分配位宽的混合量化方法,可在大幅缩减端侧模型体积的同时维持图像生成质量。
Meta 发布开源大语言模型家族 Llama 2,涵盖 7B、13B 和 70B 参数版本并开放商用许可,Hugging Face 同步提供全生态集成支持。该系列在初代基础上增加了 40% 预训练 token 并将上下文拓展至 4k tokens,经 RLHF 优化的 Llama 2-Chat 在多项基准上接近 ChatGPT 表现。
推荐理由:材料梳理了新模型相比初代的上下文与训练量升级,并提供了基于开源生态的推理部署与微调路径。
Hugging Face 介绍了利用苹果 Core ML 最新优化与 coremltools 在苹果设备上加速 Stable Diffusion 的实践,并已将 4 款官方模型的 6-bit 量化版本上传至 Hub。
推荐理由:文章详细拆解了通过 Core ML 进行 6-bit 调色板量化与注意机制优化的完整步骤,为端侧文生图推理提供了实操参考。
AMD 正式加入 Hugging Face 硬件合作伙伴计划,双方将针对 AMD 旗下的 CPU、GPU 及 AI 加速芯片深度优化 Transformer 模型的训练与推理性能。
推荐理由:合作打破了深度学习硬件生态的单一依赖,为开发者在训练与推理端提供了基于 AMD 平台的替代方案与成本参考。
Hugging Face 全面支持阿布扎比技术创新研究所(TII)开源的 Falcon 系列大模型(Falcon-7B 与 Falcon-40B),并提供推理、量化与微调工具链。
推荐理由:原文给出了 Falcon 系列模型在消费级与企业级硬件上的量化推理配置,以及结合 QLoRA 单卡微调的完整代码范式。
Hugging Face 推出面向 Amazon SageMaker 的大语言模型推理容器(LLM DLC),基于 Text Generation Inference(TGI)构建,支持在托管环境中高效部署开源模型。
推荐理由:文章介绍了基于 TGI 的 SageMaker 专用推理容器,提供了从环境配置到多卡部署开源大模型的完整调用范式。
Hugging Face 宣布在 Transformers 和 PEFT 中原生集成 bitsandbytes 的 4-bit 量化与 QLoRA 高效微调技术。
推荐理由:文章详解了 4-bit 量化与 QLoRA 在 Transformers 中的具体配置,开发者可据此在消费级显卡上低显存微调大模型。