Hugging Face 联合 Cloudflare 推出 Workers AI 无服务器 GPU 推理部署
Hugging Face 宣布在 Hub 上推出 Deploy on Cloudflare Workers AI 集成,让开发者能以无服务器 API 形式调用部署在 Cloudflare 边缘数据中心 GPU 上的开源模型。
推荐理由:该功能将边缘无服务器 GPU 与开源模型库结合并按调用量计费,为开发者降低了运行开源大模型的运维门槛与闲置成本。
开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。
Hugging Face 宣布在 Hub 上推出 Deploy on Cloudflare Workers AI 集成,让开发者能以无服务器 API 形式调用部署在 Cloudflare 边缘数据中心 GPU 上的开源模型。
推荐理由:该功能将边缘无服务器 GPU 与开源模型库结合并按调用量计费,为开发者降低了运行开源大模型的运维门槛与闲置成本。
Hugging Face 详细介绍了大规模合成数据集 Cosmopedia 的构建方案,并同步开源了包含 250 亿 token 的数据集、全套生成管线代码及 1B 验证模型 Cosmo-1B。
推荐理由:文章拆解了利用开源模型生成百亿级预训练合成数据的提示词设计与清洗流程,为探索合成数据训练小模型的团队提供了可落地的工程实践参考。
Hugging Face 介绍了内存高效训练方案 GaLore 的技术原理及其在 Transformers 库中的集成实践。GaLore 利用梯度的内在低秩特性,在优化器处理前将梯度投影到低维子空间,可减少超过 82.5% 的优化器状态显存占用,配合 8-bit 优化器和按层更新机制后,支持在 NVIDIA RTX 4090 等消费级 GPU 上训练 7B 参数模型。
推荐理由:文章给出了 GaLore 结合 8-bit 优化器在消费级显卡上训练大模型的机制与 Transformers 代码实现。
BigCode 联合开源了新一代代码大语言模型 StarCoder2 及代码预训练数据集 The Stack v2,并同步公开所有模型权重、数据集、处理与训练代码。
推荐理由:BigCode开源了代码大语言模型StarCoder2及高质量预训练数据集The Stack v2,覆盖从3B到15B参数规模并公开全部训练细节。
Hugging Face 宣布推出 TTS Arena,通过社区盲测与类 Elo 评分机制对文本转语音模型进行对比排行。用户输入文本后盲测试听两款模型的生成效果并投票,系统在提交后揭示模型名称并更新榜单。首批入选模型包括商业模型 ElevenLabs 以及 MetaVoice、OpenVoice、Pheme、WhisperSpeech 和 XTTS 等开源方案。
推荐理由:平台借鉴盲测竞技场机制解决语音合成主观评估难的问题,为开发者比较开源与闭源语音模型提供了统一参考。
Google 正式发布开源大语言模型家族 Gemma,Hugging Face 同步宣布全面集成并上线模型 Hub。Gemma 提供 2B 与 7B 两种参数规模,均包含基础模型与指令微调版本,支持 8K 上下文窗口且可在消费级硬件上运行。Transformers 4.38 已支持该系列模型的推理加速与 4-bit 量化,并提供 Google Cloud 一键部署和 TRL 单卡微调方案。
推荐理由:文章梳理了 Gemma 模型的参数规格与基准表现,并给出了在消费级显卡上通过 Transformers 和 TRL 部署微调的实现路径。
Hugging Face 宣布在 PEFT 库中支持多种针对 LoRA 适配器的融合新方法,允许开发者在运行时动态合并来自同一基模的多个微调权重。新方法涵盖矩阵拼接(cat)、线性加权(linear)、SVD 分解、TIES、DARE 以及幅度剪枝等机制,可通过 add_weighted_adapter() 直接调用。
推荐理由:文章梳理了六种 LoRA 适配器融合机制与参数调优实践,为多任务微调权重的低成本组合提供了标准参考。
Hugging Face 发布实践方案,演示如何使用开源大模型 Mixtral-8x7B 生成合成标注数据,并通过 AutoTrain 蒸馏微调出约 0.13B 参数的专用 RoBERTa 模型。
推荐理由:文章给出了用开源大模型生成合成数据并训练专用小模型的完整方案,展示了高并发文本任务大幅压降推理成本的可行路径。
Segmind 发布开源框架 SegMoE,支持将多个预训练扩散模型组合为稀疏混合专家(MoE)架构,并同步推出 SegMoE-4x2、2x1 和 SD 4x2 三款模型。
推荐理由:该项目展示了如何通过混合专家架构拼接已有扩散模型,为无需从头训练而扩展图像生成能力提供了落地参考。
Hugging Face 推出基于开源大模型的 Constitutional AI(CAI)端到端对齐方案,并开源了用于 Slurm 集群大规模合成数据生成的工具 llm-swarm。
推荐理由:原文提供了基于开源模型实现宪法级 AI 对齐的完整技术方案与集群生成工具,便于开发者低成本构建自定义安全对齐流程。
Hugging Face 宣布与 Google Cloud 达成战略合作,双方将在开放科学、开源软件以及云和硬件基础设施层面展开协作。Google Cloud 客户将能够直接在 GKE 和 Vertex AI 中利用 TPU 及 NVIDIA H100 等硬件训练与部署 Hugging Face 模型。
推荐理由:该合作打通了开源模型与 Google Cloud 基础设施,使开发者能更便捷地利用 TPU 和 Vertex AI 完成模型训练与落地部署。
Hugging Face 评估了多款开源大语言模型在 LangChain ReAct 架构下担任智能体的表现,结果显示 Mixtral-8x7B 在未经专门微调的情况下超越了 GPT-3.5。测试集整合了 HotpotQA、GSM8K 及 GAIA,重点考察模型在网络搜索与计算器调用上的多步推理能力;而借助工具支持,Mixtral-8x7B 在 GSM8K 零样本测试中的准确率达到了 73%。
推荐理由:文章通过工具调用评测展示了开源模型驱动智能体工作流的可行性,读者可参考其 ReAct 实现与评估方法优化智能体搭建。
Hugging Face 介绍了轻量级微调库 Unsloth 及其与 TRL 工具集的无缝集成,在保证精度零损失的前提下可将大语言模型微调提速最高 2.7 倍并减少最多 74% 显存占用。
推荐理由:文中展示了通过重写反向传播与 Triton 内核加速微调的具体实现,为在有限显存下微调开源模型提供了现成的集成方案。
Hugging Face 开源了非扩散文生图模型 aMUSEd,采用掩码图像建模(MIM)架构并开源了完整代码与权重。该模型总参数量约 800M,推理步骤更少且原生支持零样本图像修复,已完整集成进 diffusers 库。模型在 8-bit Adam 和 float16 下微调显存低于 11GB,采用 LoRA 时可进一步降至 7GB。
推荐理由:原文提供了基于掩码图像建模的非扩散文生图方案与推理代码,便于开发者探索小参数量下的快速图像生成。
Hugging Face 发布 2023 年开源大模型年度回顾,梳理了行业从追求超大参数转向训练更多数据、参数在 3B 至 70B 之间的高效小模型的范式转移。
推荐理由:原文完整复盘了开源大模型从小尺寸高质量数据预训练到对齐、融合与量化落地的全景路径,有助于梳理技术范式演进脉络。
Hugging Face 发布长文系统解析混合专家模型(MoE)的架构机制、发展历史及工程权衡。MoE 通过将 Transformer 的 FFN 层替换为门控网络与多个专家网络,实现条件计算以大幅降低预训练算力开销,并在推理时仅激活部分参数获得更快的计算速度。文章同时指出 MoE 在显存占用、微调泛化稳定性以及跨设备通信负载均衡等方面的核心挑战,并汇总了专家并行、蒸馏、量化等前沿服务化方案。
推荐理由:原文系统梳理了 MoE 门控路由、负载均衡与微调过拟合等关键技术挑战,读者可据此建立稀疏模型工程部署与训练的完整认知框架。
Hugging Face 宣布全面集成 Mistral 发布的开源 MoE 模型 Mixtral 8x7B,并在 Hub、Transformers 及 TGI 中提供完整支持。
推荐理由:文章系统梳理了该 MoE 模型的显存配置要求与量化部署路径,为开源模型的低成本微调及工程落地提供了参考。
Intel Labs 与 Hugging Face 联合推出 SetFitABSA 框架,专门用于少样本场景下的基于方面的情感分析(ABSA)。该方案通过 spaCy 提取候选词并利用两阶段 SetFit 模型依次完成方面识别与情感极性分类,完全摆脱了提示词工程与复杂的标注工具。
推荐理由:该框架无需人工编写提示词且依赖极少标注样本,为低成本构建垂直领域细粒度情感分析提供了实用方案。
Hugging Face 推出大语言模型推理加速库 Optimum-NVIDIA,结合 NVIDIA TensorRT-LLM 与 Ada Lovelace、Hopper 架构的 FP8 格式,开发者仅需修改单行代码即可完成部署。
推荐理由:该库通过接入 TensorRT-LLM 与 FP8 支持,为需要兼顾首字延迟与批处理吞吐的模型部署团队提供了直接迁移方案。
Hugging Face 宣布与 AMD 合作实现大语言模型在 AMD Instinct GPU 上的开箱即用加速,用户无需修改代码即可直接运行 Transformers 模型。
推荐理由:Transformers 和 TGI 实现了无需修改代码适配 AMD 硬件,开发者可以直接参考其针对大显存与 ROCm 算子的部署方案。