OpenAI API 上线 Prompt Caching 功能
OpenAI 在 API 中推出 Prompt Caching 功能。该功能将对模型最近见过的输入内容自动提供折扣,降低包含重复上下文的调用成本。
把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。
OpenAI 在 API 中推出 Prompt Caching 功能。该功能将对模型最近见过的输入内容自动提供折扣,降低包含重复上下文的调用成本。
Hugging Face 宣布在其 Inference Endpoints 和 Spaces 中正式上线 Google Cloud TPU v5e 算力支持。服务提供 1 核 16 GB(每小时 $1.375)、4 核 64 GB(每小时 $5.50)以及 8 核 128 GB(每小时 $11.00)三种配置。
推荐理由:该支持降低了在托管环境调用 TPU 的操作门槛,为需要平衡延迟与成本的开源模型部署提供了具体的硬件配置参考。
Hugging Face 宣布 Diffusers 正式集成 Stability AI 的 Stable Diffusion 3 Medium(2B 参数)模型,并上线 Hugging Face Hub。
推荐理由:原文提供了显存卸载、8-bit 量化以及编译加速方案,读者可以据此在不同显存规格的硬件上部署和微调 SD3。
Hugging Face 宣布检测到 Spaces 平台的机密存储遭到未经授权访问,部分存储凭据可能泄露,官方已主动撤回相关 HF token 并向受影响用户发送通知。团队建议用户立即轮换各类密钥并切换至细粒度访问 token,同时平台已全面移除组织 token 并为 Spaces 引入密钥管理服务。目前外部取证专家已介入调查,事件也已通报给执法机构和数据保护监管部门。
推荐理由:官方针对 Spaces 机密受未授权访问采取了吊销凭据与引入 KMS 等处置,有助于在平台托管项目的开发者评估潜在泄露影响并调整权限配置。
Meta 正式发布开源大语言模型 Llama 3,提供 8B 和 70B 两个尺寸的基础版与指令微调版,并同步推出安全模型 Llama Guard 2。模型在超过 15 万亿模型 token 上训练,词表扩展至 128,256,上下文窗口为 8k context,8B 版本增加了分组查询注意力(GQA)。
推荐理由:原文梳理了模型架构参数与词表变化,并给出了在开源框架下进行推理部署和单卡微调的完整代码。
Hugging Face 宣布在 Hub 上推出 Deploy on Cloudflare Workers AI 集成,让开发者能以无服务器 API 形式调用部署在 Cloudflare 边缘数据中心 GPU 上的开源模型。
推荐理由:该功能将边缘无服务器 GPU 与开源模型库结合并按调用量计费,为开发者降低了运行开源大模型的运维门槛与闲置成本。
Hugging Face 博客详解了 Matryoshka 嵌入模型(MRL)的核心原理,并给出了基于 Sentence Transformers 的训练与推理实践指南。
推荐理由:原文给出了在 Sentence Transformers 中使用 MatryoshkaLoss 训练和截断向量的具体代码,读者可以据此在检索场景中权衡存储成本与检索速度。
Google 正式发布开源大语言模型家族 Gemma,Hugging Face 同步宣布全面集成并上线模型 Hub。Gemma 提供 2B 与 7B 两种参数规模,均包含基础模型与指令微调版本,支持 8K 上下文窗口且可在消费级硬件上运行。Transformers 4.38 已支持该系列模型的推理加速与 4-bit 量化,并提供 Google Cloud 一键部署和 TRL 单卡微调方案。
推荐理由:文章梳理了 Gemma 模型的参数规格与基准表现,并给出了在消费级显卡上通过 Transformers 和 TRL 部署微调的实现路径。
Hugging Face 在 Text Generation Inference(TGI 1.4.0 起)及 Inference Endpoints 中推出 Messages API,实现对 OpenAI Chat Completion API 的兼容。
推荐理由:原文展示了如何通过兼容协议将代码平滑切至开源模型,为工程团队降低了模型迁移与自建部署的适配成本。
Hugging Face 宣布与 Google Cloud 达成战略合作,双方将在开放科学、开源软件以及云和硬件基础设施层面展开协作。Google Cloud 客户将能够直接在 GKE 和 Vertex AI 中利用 TPU 及 NVIDIA H100 等硬件训练与部署 Hugging Face 模型。
推荐理由:该合作打通了开源模型与 Google Cloud 基础设施,使开发者能更便捷地利用 TPU 和 Vertex AI 完成模型训练与落地部署。
Hugging Face 发布完整教程,介绍如何将复杂的 ComfyUI 工作流转换为 Gradio Web 应用并免费部署到 Hugging Face Spaces 的 ZeroGPU 无服务器架构上。
推荐理由:教程给出了将节点图转为脚本并适配无服务器 GPU 的完整改造细节,便于开发者将本地工作流封装为低成本在线服务。
Hugging Face 展示了如何将投机解码应用于 Whisper 语音转录,在保证输出完全一致的前提下将推理速度提升 2 倍。在英语场景中,使用 6 倍速的 distil-large-v2 作为辅助模型仅增加 8% 显存即可实现 2.2 倍加速,多语种搭配 Whisper tiny 也可提速 1.9 倍。该方案最适合较小的 batch size,当批大小超过 4 时加速收益会逐渐消失。
推荐理由:介绍了用蒸馏或小模型作为辅助草稿模型的投机解码方案,为现有语音转录流水线提供了零精度损失的提速工程参考。
Hugging Face 宣布全面集成 Mistral 发布的开源 MoE 模型 Mixtral 8x7B,并在 Hub、Transformers 及 TGI 中提供完整支持。
推荐理由:文章系统梳理了该 MoE 模型的显存配置要求与量化部署路径,为开源模型的低成本微调及工程落地提供了参考。
Hugging Face 推出大语言模型推理加速库 Optimum-NVIDIA,结合 NVIDIA TensorRT-LLM 与 Ada Lovelace、Hopper 架构的 FP8 格式,开发者仅需修改单行代码即可完成部署。
推荐理由:该库通过接入 TensorRT-LLM 与 FP8 支持,为需要兼顾首字延迟与批处理吞吐的模型部署团队提供了直接迁移方案。
Hugging Face 宣布与 AMD 合作实现大语言模型在 AMD Instinct GPU 上的开箱即用加速,用户无需修改代码即可直接运行 Transformers 模型。
推荐理由:Transformers 和 TGI 实现了无需修改代码适配 AMD 硬件,开发者可以直接参考其针对大显存与 ROCm 算子的部署方案。
Hugging Face 针对 Stable Diffusion XL(SDXL)的显存占用和推理耗时瓶颈,在 🤗 Diffusers 中梳理了一套轻量优化方案。
推荐理由:文章对比了半精度、编译加速与分片卸载对延迟与显存的实测影响,为消费级硬件部署扩散模型提供了具体的调优路径。
Hugging Face 推出 JavaScript 库 Gradio-Lite(`@gradio/lite`),利用 WebAssembly 运行时 Pyodide 让 Gradio 应用直接在浏览器内免服务器运行。
推荐理由:文章展示了通过 WebAssembly 将应用搬进浏览器的具体实现,开发者无需后端服务器即可低成本部署与分发交互原型。
Hugging Face 为 Transformers 中的 tokenizer 引入 chat_template 属性,通过 Jinja 模板将对话历史转换为与模型训练完全一致的输入字符串。
推荐理由:原文解释了格式不匹配导致模型性能严重受损的机制,并给出通过 Jinja 模板标准化对话输入的统一方案。
Hugging Face 对 Transformers 原生支持的 bitsandbytes 与 auto-gptq 进行了全面基准测试与对比。实测表明 bitsandbytes 无需校准数据集且跨模态兼容性好,适配器微调速度更优;auto-gptq 在文本生成推理速度和权重序列化上优势明显。官方建议可在微调阶段采用 bitsandbytes,合并权重后再通过 GPTQ 量化部署。
推荐理由:文章提供了实测数据对比 bitsandbytes 与 GPTQ 在推理和微调上的表现,方便开发者选型量化方案。
TII 正式在 Hugging Face 推出开源大语言模型 Falcon 180B,包含基础版与聊天版,拥有 1800 亿参数。该模型基于 RefinedWeb 等 3.5 万亿 token 预训练,规模达 Llama 2 的 2.5 倍,在 MMLU 等基准测试中超越 Llama 2 70B 与 GPT-3.5。
推荐理由:文章提供了 180B 超大开源模型的评测基准成绩以及量化部署所需的显存配置细节。