Hugging Face 联合 Cloudflare 推出 Workers AI 无服务器 GPU 推理部署
Hugging Face 宣布在 Hub 上推出 Deploy on Cloudflare Workers AI 集成,让开发者能以无服务器 API 形式调用部署在 Cloudflare 边缘数据中心 GPU 上的开源模型。
推荐理由:该功能将边缘无服务器 GPU 与开源模型库结合并按调用量计费,为开发者降低了运行开源大模型的运维门槛与闲置成本。
Hugging Face 宣布在 Hub 上推出 Deploy on Cloudflare Workers AI 集成,让开发者能以无服务器 API 形式调用部署在 Cloudflare 边缘数据中心 GPU 上的开源模型。
推荐理由:该功能将边缘无服务器 GPU 与开源模型库结合并按调用量计费,为开发者降低了运行开源大模型的运维门槛与闲置成本。
开源仿人机器人 Reachy 的开发团队 Pollen Robotics 正式开源 pollen-vision 库,为机器人提供免训练的零样本视觉模型统一接口。该库集成了 OWL-ViT、MobileSAM 与 RAM 等模型,通过模块化流水线结合深度相机参数估算未知物体的空间三维坐标,支持在消费级 GPU 上进行实时物体定位与基础抓取任务。
Lighthouz AI 联合 Hugging Face 推出 Chatbot Guardrails Arena,通过社区对抗性盲测评估大语言模型及其安全护栏防范敏感数据泄露的能力。
Hugging Face 详细介绍了大规模合成数据集 Cosmopedia 的构建方案,并同步开源了包含 250 亿 token 的数据集、全套生成管线代码及 1B 验证模型 Cosmo-1B。
推荐理由:文章拆解了利用开源模型生成百亿级预训练合成数据的提示词设计与清洗流程,为探索合成数据训练小模型的团队提供了可落地的工程实践参考。
Hugging Face 演示了通过 Optimum Intel 与 OpenVINO 对微软 2.7B 参数模型 Phi-2 进行 4-bit 权重量化,并在搭载 Intel Meteor Lake 处理器的笔记本上实现本地推理。该方案结合 Core Ultra 芯片的 CPU、iGPU 与专用 NPU 硬件加速,无需调用云端 API 即可在端侧离线运行低延迟且保护隐私的聊天机器人。
Hugging Face 介绍了内存高效训练方案 GaLore 的技术原理及其在 Transformers 库中的集成实践。GaLore 利用梯度的内在低秩特性,在优化器处理前将梯度投影到低维子空间,可减少超过 82.5% 的优化器状态显存占用,配合 8-bit 优化器和按层更新机制后,支持在 NVIDIA RTX 4090 等消费级 GPU 上训练 7B 参数模型。
推荐理由:文章给出了 GaLore 结合 8-bit 优化器在消费级显卡上训练大模型的机制与 Transformers 代码实现。
Hugging Face 推出针对 Optimum 的 PyTorch 量化后端 Quanto,旨在为各类模态的模型提供多设备通用的轻量量化支持。该库支持 int2、int4、int8 和 float8 权重以及 int8 与 float8 激活量化,兼容 CUDA、MPS 和 CPU 设备,并支持 eager 模式与 torch.compile。
加州大学洛杉矶分校(UCLA)研究人员推出富文本视觉推理评测数据集 ConTextual 及排行榜,涵盖导航、信息图表等 8 类场景共 506 条高难度指令。首期实验测试了 GPT-4V、Gemini-Vision-Pro 和 LLaVA-1.5-13B 等 13 个模型,显示当前多模态模型整体表现明显弱于人类。表现最佳的 GPT-4V 虽在抽象推理上超越人类,但在时间读取等任务上仍显吃力。
Hugging Face 与 Argilla 联合推出“Data is Better Together”计划,通过在 Hugging Face Spaces 上集成支持账号直接登录的 Argilla 实例,降低社区协同标注数据集的门槛。
Hugging Face 展示了如何通过 Optimum Habana 在 Intel Gaudi 2 AI 加速器上部署 Llama 2 系列模型(7b、13b 和 70b)进行端到端文本生成。
BigCode 联合开源了新一代代码大语言模型 StarCoder2 及代码预训练数据集 The Stack v2,并同步公开所有模型权重、数据集、处理与训练代码。
推荐理由:BigCode开源了代码大语言模型StarCoder2及高质量预训练数据集The Stack v2,覆盖从3B到15B参数规模并公开全部训练细节。
Hugging Face 宣布推出 TTS Arena,通过社区盲测与类 Elo 评分机制对文本转语音模型进行对比排行。用户输入文本后盲测试听两款模型的生成效果并投票,系统在提交后揭示模型名称并更新榜单。首批入选模型包括商业模型 ElevenLabs 以及 MetaVoice、OpenVoice、Pheme、WhisperSpeech 和 XTTS 等开源方案。
推荐理由:平台借鉴盲测竞技场机制解决语音合成主观评估难的问题,为开发者比较开源与闭源语音模型提供了统一参考。
Hugging Face 发文梳理 AI 生成内容的水印与溯源技术,系统拆解图像、文本与音频三大模态的加水印机制与检测方案。文章对比了生成阶段直接嵌入与生成后标记两种实现路径,介绍了 Nightshade 数据投毒、Truepic C2PA 凭证、TGI 文本水印以及 AudioSeal 音频水印等工具。
推荐理由:梳理了图像、文本和音频生成内容的水印与检测机制,读者可以据此系统了解不同模态防伪溯源的工程实现方案。
Hugging Face 博客详解了 Matryoshka 嵌入模型(MRL)的核心原理,并给出了基于 Sentence Transformers 的训练与推理实践指南。
推荐理由:原文给出了在 Sentence Transformers 中使用 MatryoshkaLoss 训练和截断向量的具体代码,读者可以据此在检索场景中权衡存储成本与检索速度。
Hugging Face 官方发布了使用 Transformers 和 PEFT 库对 Google Gemma 模型进行高效微调的操作指南。教程演示了如何结合 bitsandbytes 的 QLoRA 4-bit 量化加载 gemma-2b,并使用 TRL 的 SFTTrainer 训练名言格式生成。
推荐理由:原文提供了可直接复用的代码与配置,读者可以据此在消费级 GPU 或 TPU 上以低显存成本微调 Gemma 模型。
Haize Labs 在 Hugging Face 支持下推出红队对抗基准(Red Teaming Resistance Benchmark)及排行榜,系统评估前沿大语言模型抵御高拟真自然语言攻击的鲁棒性。
Google 正式发布开源大语言模型家族 Gemma,Hugging Face 同步宣布全面集成并上线模型 Hub。Gemma 提供 2B 与 7B 两种参数规模,均包含基础模型与指令微调版本,支持 8K 上下文窗口且可在消费级硬件上运行。Transformers 4.38 已支持该系列模型的推理加速与 4-bit 量化,并提供 Google Cloud 一键部署和 TRL 单卡微调方案。
推荐理由:文章梳理了 Gemma 模型的参数规格与基准表现,并给出了在消费级显卡上通过 Transformers 和 TRL 部署微调的实现路径。
Upstage 推出面向韩语大语言模型的公开评测平台 Open Ko-LLM Leaderboard。该平台采用私有测试集以防数据污染,涵盖 Ko-ARC、Ko-HellaSwag、Ko-MMLU、Ko-Truthful QA 和 Ko-CommonGEN V2 共 5 项评测基准。
Hugging Face 宣布在 PEFT 库中支持多种针对 LoRA 适配器的融合新方法,允许开发者在运行时动态合并来自同一基模的多个微调权重。新方法涵盖矩阵拼接(cat)、线性加权(linear)、SVD 分解、TIES、DARE 以及幅度剪枝等机制,可通过 add_weighted_adapter() 直接调用。
推荐理由:文章梳理了六种 LoRA 适配器融合机制与参数调优实践,为多任务微调权重的低成本组合提供了标准参考。
Hugging Face 发布实践方案,演示如何使用开源大模型 Mixtral-8x7B 生成合成标注数据,并通过 AutoTrain 蒸馏微调出约 0.13B 参数的专用 RoBERTa 模型。
推荐理由:文章给出了用开源大模型生成合成数据并训练专用小模型的完整方案,展示了高并发文本任务大幅压降推理成本的可行路径。
AMD 联合 Hugging Face 举办普适 AI 开发者大赛,设立生成式 AI、机器人 AI 和 PC AI 三大赛道,总奖金达 $160,000 USD。赛事向参赛者提供 700 套 AMD 硬件或云端算力支持,同时双方已针对 AMD GPU 实现大语言模型免改代码运行,并提供 ROCm 下 TGI、DeepSpeed 等工具的开箱即用支持。
Hugging Face 在 Text Generation Inference(TGI 1.4.0 起)及 Inference Endpoints 中推出 Messages API,实现对 OpenAI Chat Completion API 的兼容。
推荐理由:原文展示了如何通过兼容协议将代码平滑切至开源模型,为工程团队降低了模型迁移与自建部署的适配成本。
Segmind 发布开源框架 SegMoE,支持将多个预训练扩散模型组合为稀疏混合专家(MoE)架构,并同步推出 SegMoE-4x2、2x1 和 SD 4x2 三款模型。
推荐理由:该项目展示了如何通过混合专家架构拼接已有扩散模型,为无需从头训练而扩展图像生成能力提供了落地参考。
Hugging Face 推出大语言模型推理评估基准及排行榜 NPHardEval,包含覆盖 P 到 NP-hard 复杂度的 900 道算法题。该基准排除数值计算并按月动态更新以防过拟合,采用加权准确率(WA)与失败率(FR)评估纯逻辑推理。测试显示 GPT 4 Turbo 综合表现最佳,开源模型中 Yi-34b、Qwen-14b、Phi-2 和 Mistral-7b 处于领先水平。
Hugging Face 宣布大语言模型部署方案 Text Generation Inference(TGI)正式在 AWS Inferentia2 与 Amazon SageMaker 上线。
Hugging Face 发布了在 Transformers 库中使用时间序列模型 PatchTST 进行预测与迁移学习的完整教程。文章演示了在 Electricity 数据集上的训练流程,并在 ETTh1 数据集上分别测试了零样本预测、线性探测及全量微调效果。
Hugging Face 推出基于开源大模型的 Constitutional AI(CAI)端到端对齐方案,并开源了用于 Slurm 集群大规模合成数据生成的工具 llm-swarm。
推荐理由:原文提供了基于开源模型实现宪法级 AI 对齐的完整技术方案与集群生成工具,便于开发者低成本构建自定义安全对齐流程。
Patronus 联合 Hugging Face 推出企业场景排行榜 Enterprise Scenarios Leaderboard,用于评估大语言模型在真实企业场景的表现。榜单包含 FinanceBench、法律保密性、创意写作、客服对话、毒性及企业 PII 共 6 项任务。为防止测试集污染,除 FinanceBench 和法律保密性开源外,其余 4 个数据集均闭源且仅提供验证集。
通过在第 4 代 Intel Xeon 处理器上整合 8-bit 与 4-bit 量化以及辅助生成技术,StarCoder-15B 模型的推理速度实现了超过 7 倍的加速。
Hugging Face 与爱丁堡大学等合作推出大语言模型幻觉评测排行榜 Hallucinations Leaderboard,通过上下文学习全面评估模型的事实性与忠实度表现。
Secure Learning Lab 联合 Hugging Face 推出大语言模型安全排行榜 LLM Safety Leaderboard,基于 NeurIPS 2023 获奖工作 DecodingTrust 全面评估模型的安全性与可信度。
Hugging Face 宣布与 Google Cloud 达成战略合作,双方将在开放科学、开源软件以及云和硬件基础设施层面展开协作。Google Cloud 客户将能够直接在 GKE 和 Vertex AI 中利用 TPU 及 NVIDIA H100 等硬件训练与部署 Hugging Face 模型。
推荐理由:该合作打通了开源模型与 Google Cloud 基础设施,使开发者能更便捷地利用 TPU 和 Vertex AI 完成模型训练与落地部署。
Hugging Face 评估了多款开源大语言模型在 LangChain ReAct 架构下担任智能体的表现,结果显示 Mixtral-8x7B 在未经专门微调的情况下超越了 GPT-3.5。测试集整合了 HotpotQA、GSM8K 及 GAIA,重点考察模型在网络搜索与计算器调用上的多步推理能力;而借助工具支持,Mixtral-8x7B 在 GSM8K 零样本测试中的准确率达到了 73%。
推荐理由:文章通过工具调用评测展示了开源模型驱动智能体工作流的可行性,读者可参考其 ReAct 实现与评估方法优化智能体搭建。
IBM Research 联合 Hugging Face 在 Transformers 库中上线轻量级时间序列模型 PatchTSMixer。该模型基于 MLP-Mixer 架构,支持跨 patch 与通道的特征混合,适用于时间序列预测、分类和回归等下游任务。其实测预测表现优于现有主流 MLP 与 Transformer 模型 8-60%,且显存占用和运行时间降低 2-3X。
Hugging Face 发布实战指南,详解如何使用 Transformers 库通过 CTC 算法微调 Meta 的 580M 参数模型 Wav2Vec2-BERT,用于低资源语言的自动语音识别。
Hugging Face 对 DPO、IPO 和 KTO 三种免强化学习的大语言模型偏好对齐方法进行了超参数扫描与实测对比。实验在 OpenHermes-2.5-Mistral-7B 和 Zephyr-7b-beta-sft 上展开并通过 MT-Bench 评估,修正 TRL 实现后 IPO 与 DPO 表现相当且优于成对设定的 KTO。
ONNX Runtime 结合 Olive 工具加速了 SD Turbo 与 SDXL Turbo 在 NVIDIA GPU 上的推理,相比 PyTorch 吞吐量提升最高达 229%(SDXL Turbo)和 120%(SD Turbo)。
Hugging Face 发布完整教程,介绍如何将复杂的 ComfyUI 工作流转换为 Gradio Web 应用并免费部署到 Hugging Face Spaces 的 ZeroGPU 无服务器架构上。
推荐理由:教程给出了将节点图转为脚本并适配无服务器 GPU 的完整改造细节,便于开发者将本地工作流封装为低成本在线服务。
Vectara 发布了基于 Hugging Face 开源排行榜模板搭建自定义评测榜单的端到端指南,并以此上线了全新的 HHEM 幻觉评测排行榜。该方案通过 requests 与 results 两个数据集管理评测请求与测试结果,结合自定义的摘要生成和 HHEM 评估模型实现自动化打分。完整实现代码已开源,支持直接部署为 Hugging Face Space。
Hugging Face 介绍了轻量级微调库 Unsloth 及其与 TRL 工具集的无缝集成,在保证精度零损失的前提下可将大语言模型微调提速最高 2.7 倍并减少最多 74% 显存占用。
推荐理由:文中展示了通过重写反向传播与 Triton 内核加速微调的具体实现,为在有限显存下微调开源模型提供了现成的集成方案。