Google 发布开源大模型 Gemma 2,Hugging Face 全面集成
Google 正式发布新一代开源大语言模型 Gemma 2,包含 9B 与 27B 两种尺寸的基础和指令微调版本,Hugging Face 生态同步提供支持。架构上引入了交替滑动窗口注意力、Logit 软截断以及在策略知识蒸馏技术,上下文窗口为 8K tokens。
推荐理由:文章系统梳理了 Gemma 2 的架构改进与蒸馏机制,并提供了在消费级硬件上的完整微调与部署方案。
Google 正式发布新一代开源大语言模型 Gemma 2,包含 9B 与 27B 两种尺寸的基础和指令微调版本,Hugging Face 生态同步提供支持。架构上引入了交替滑动窗口注意力、Logit 软截断以及在策略知识蒸馏技术,上下文窗口为 8K tokens。
推荐理由:文章系统梳理了 Gemma 2 的架构改进与蒸馏机制,并提供了在消费级硬件上的完整微调与部署方案。
XLSCOUT 联合 Hugging Face 专家支持项目推出面向专利与知识产权的专有嵌入模型 ParaEmbed 2.0,相较于 2023 年 10 月发布的 ParaEmbed 1.0 准确率提升 23%。该模型基于专家整理的多领域专利数据微调,并通过 Hugging Face 的 TEI 部署将生产推理吞吐量提升至约每秒 2700 个嵌入向量,全面支持查新、专利无效检索及自动化撰写等工具。
Hugging Face 发布在 DocVQA 数据集上微调微软 Florence-2 视觉语言模型的实操指南,将验证集 Levenshtein 相似度从 0 提升至 57.0。教程通过冻结 DaViT 视觉编码器,使 0.2B 与 0.7B 模型能够在单张 A100 或 T4 GPU 等低算力环境下完成训练,并公开了 Colab 代码与在线 Demo。
推荐理由:教程展示了冻结视觉编码器在单卡环境微调小参数多模态模型的可行路径,为低算力条件下的文档问答任务提供了可迁移方案。
Hugging Face 发布伦理与社会简报指出,构建更优 AI 系统必须优先保障数据质量,强调优质数据不仅取决于规模与准确度,更在于契合具体任务需求。评估数据质量的核心维度涵盖相关性、全面性、时效性以及偏见消除,可有效防止模型过拟合并降低计算资源消耗。实现高质量数据需贯穿去重、内容过滤、领域专家与人工反馈,并建立清晰的数据治理框架。
Hugging Face 与 Argilla 联合发起的 Data Is Better Together(DIBT)倡议发布阶段性回顾,旨在通过开源社区协作构建高价值数据集。
Prezi 借助 Hugging Face 专家支持计划,在其 Prezi AI 演示文稿生成系统中集成了更高效的开源模型。团队在管线中引入开源 re-ranker 模型以替代部分 LLM 检索图文资产,并综合应用视觉、文本与视觉语言模型(VLM)。同时,Prezi 通过 Inference Endpoints 的自动休眠与 A100 实例支持,进一步简化部署并降低了推理成本。
BigCode 项目团队发布代码生成评测基准 BigCodeBench,旨在替代任务过于简单的 HumanEval 并减少数据污染与过拟合影响。该基准包含 1,140 个函数级任务,要求大模型调用 139 个第三方库解决实际问题,平均每个任务包含 5.6 个测试用例且分支覆盖率达 99%。
Hugging Face Accelerate 在 0.30.0 版本中升级了 PyTorch FSDP 的混合精度支持,解决其与 DeepSpeed 在相同学习率下收敛表现不一致的问题。
Hugging Face 宣布 Diffusers 正式集成 Stability AI 的 Stable Diffusion 3 Medium(2B 参数)模型,并上线 Hugging Face Hub。
推荐理由:原文提供了显存卸载、8-bit 量化以及编译加速方案,读者可以据此在不同显存规格的硬件上部署和微调 SD3。
Hugging Face 在 TRL 库中上线 RLOO 训练器,作为 PPO 的在线 RLHF 替代方案,可节省 50% 至 70% 显存并带来 2 至 3 倍训练加速。
Hugging Face 宣布适用于 Amazon SageMaker 的 Hugging Face Embedding Container 正式可用(GA),支持 AWS 用户高效部署嵌入模型以构建 RAG 应用。
Hugging Face 宣布启动 Transformers 库官方文档重构,以解决模型多模态化和 LLM 演进导致的内容杂乱、割裂及难以导航等体验问题。新文档将受众从机器学习研究人员转向基于 AI 构建产品的开发者,采取代码优先和面向解决方案的编写方式。团队将放弃僵化分类,通过有机结构和内容整合替代层层追加修补,提供更连贯的新手入门体验。
Artificial Analysis 在 Hugging Face 上线文生图排行榜与图像竞技场,通过收集超过 4.5 万次人类偏好投票计算 ELO 分数,对比主流开源与闭源图像生成模型。
推荐理由:采用众包盲测机制收集人类偏好并计算 ELO 评分,为文生图模型在画质与提示词遵循上的综合表现提供了量化参考。
Cubzh 与 Gigax 联合在 Hugging Face Spaces 推出 3D 交互演示 NPC-Playground,支持用户在浏览器中直接与大语言模型驱动的 NPC 交流互动。该技术栈结合了开源体素游戏引擎 Cubzh 与 Gigax 智能体平台,利用函数调用机制驱动微调后的 Phi-3 和 Mistral-7B 模型生成动作与对话,开发者可通过少量 Lua 脚本为角色定制新技能。
Hugging Face 在 Optimum Habana 中为 Intel Gaudi 处理器适配并优化了辅助生成(Assisted Generation)技术。该方案结合量化与 KV cache 支持推测采样,在保证与自回归采样相同质量的前提下,在大型 Transformer 模型上通常可实现约 2x 的生成加速,用户配置 assistant_model 参数即可启用。
Hugging Face 宣布检测到 Spaces 平台的机密存储遭到未经授权访问,部分存储凭据可能泄露,官方已主动撤回相关 HF token 并向受影响用户发送通知。团队建议用户立即轮换各类密钥并切换至细粒度访问 token,同时平台已全面移除组织 token 并为 Spaces 引入密钥管理服务。目前外部取证专家已介入调查,事件也已通报给执法机构和数据保护监管部门。
推荐理由:官方针对 Spaces 机密受未授权访问采取了吊销凭据与引入 KMS 等处置,有助于在平台托管项目的开发者评估潜在泄露影响并调整权限配置。
Hugging Face 详解了 Text Generation Inference(TGI)内置的基准测试工具 TGI Benchmarking tool,用于综合评估大语言模型推理中的吞吐量与延迟权衡。该工具支持分析首字延迟(TTFT)以及预填充与解码阶段的性能表现,帮助用户针对不同并发场景优化部署配置。开发者可在 Hugging Face Space 中通过 CLI 快速运行该评测。
Hugging Face 发布了使用 Sentence Transformers 训练与微调嵌入模型的实用指南,系统解析了基于 SentenceTransformerTrainer 的训练架构。文章涵盖数据集列顺序与损失函数匹配、评估器设置以及多数据集混合训练策略,支持对不同业务场景定制语义相似度计算。新版本底层重构后原生支持分布式训练和监控回调,并完全兼容旧版 fit 方法。
推荐理由:教程系统梳理了新版嵌入模型的训练与评估流程,读者可以掌握多数据集混训和损失函数匹配的具体实现规范。
TII 正式推出第二代开源模型 Falcon 2 11B,包括基础大语言模型及集成了图像理解能力的 Falcon 2 11B VLM。该模型基于超过 5000B token 数据完成四阶段训练,上下文窗口扩展至 8192,在多语言与开源基准评测中综合表现比肩前代 Falcon-40B。
推荐理由:该系列以四分之一的参数量达到了前代 40B 的性能水准,同时补充了开源多模态能力以降低推理部署门槛。
Meta 与 Hugging Face 推出开源基准 CyberSecEval 2 及排行榜,用于系统评估大语言模型在网络安全领域的风险与能力。评测覆盖不安全代码生成、提示词注入抵御、协助网络攻击合规率、代码解释器滥用以及自动化攻防渗透等维度。最新评测显示模型协助网络攻击的合规率从 52% 降至 28%,但提示词注入和解释器滥用在面对对抗性输入时仍缺乏可靠防护。
推荐理由:该框架从不安全代码生成与提示词注入等维度评估模型风险,帮助开发者在接入代码助手时量化评估潜在安全隐患。
Hugging Face 宣布 Inference Endpoints 正式支持 AWS Inferentia2 实例,允许用户在 AWS 专用 AI 芯片上一键部署和托管模型。
Hugging Face 推出 Dell Enterprise Hub,支持企业利用 Dell 平台在本地训练与部署开源大语言模型。平台精选 Meta Llama 3、Mistral AI Mixtral 及 Google Gemma 等模型,通过预优化容器将部署工作缩短至数分钟。企业可全程在本地安全微调私有数据,部署后提供兼容 OpenAI Messages API 的端点。
Hugging Face 宣布与 AMD 合作,将 AMD Instinct MI300 系列 GPU 深度集成至其平台,支持在 Azure ND MI300x V5 上生产级运行。
Hugging Face 在 Microsoft Build 大会上宣布深化与微软的战略合作,推出涵盖云端部署、硬件优化与开发工具的多项新特性。
Hugging Face Spaces 推出 Dev Mode 开发模式 Beta 版,支持 PRO 订阅用户通过本地或网页端 VS Code 以及 SSH 直连 Space 容器编辑代码。该功能省去了本地修改后必须执行 git push 并等待容器重新构建的步骤,开发者修改代码后直接在 Space 页面点击刷新即可实时预览效果,确认无误后再提交合并。
Hugging Face 在 Transformers 库中集成了 KV Cache 量化功能,可大幅降低大语言模型长文本生成时的显存占用。该功能基于 quanto 与 HQQ 后端支持 int2、int4 和 int8 精度,其中 int4 精度可节省约 2.5 倍显存且模型困惑度与原版 fp16 相当。
Hugging Face 与 LangChain 联合推出官方维护的 Python 合作包 langchain-huggingface,旨在解决此前社区维护代码容易弃用的问题,加速将 Hugging Face 生态的新功能同步至 LangChain。
Open Arabic LLM Leaderboard(OALL)正式推出,旨在为全球超 3.8 亿阿拉伯语使用者提供专门的大语言模型评测与对比平台。该榜单整合了 AlGhafa、ACVA 和 AceGPT 等基准数据集,主要采用归一化对数似然准确率指标,依托 lighteval 库在 TII 集群上运行评测。
Hugging Face 正式发布 Transformers Agents 2.0,引入支持基于观察结果持续迭代的 ReactCodeAgent 和 ReactJsonAgent,并在 v4.41.0 版本中上线。
推荐理由:框架通过模块化解耦底层模型与工具调用逻辑,读者可以借鉴其代码智能体设计在开源模型上构建多模态工作流。
Intel 展示了基于 Gaudi 2 加速器与 Xeon CPU 构建高性价比企业级 RAG 应用的方案。架构通过支持 AMX-FP16 的 Granite Rapids CPU 运行 BAAI/bge-base-en-v1.5 嵌入模型并搭配 Redis,使混合 AI 工作负载性能提升 2-3x。
针对希伯来语形态复杂的语言特性,全新的希伯来语大语言模型开源排行榜(Open Leaderboard for Hebrew LLMs)正式推出。该榜单采用 few-shot 评测模式,涵盖问答(HeQ)、情感分析、Winograd Schema 代词消歧及英希翻译 4 个核心基准任务。
Hugging Face 引入了 Artificial Analysis 的大语言模型性能排行榜,全面评估超过 100 个无服务器 LLM API 端点的价格、推理速度与质量指标。
推荐理由:提供了覆盖主流模型与端点的质量、延迟与成本指标,便于开发者在应用选型时权衡吞吐量与预算。
Hugging Face 详细介绍了如何在 Inference Endpoints 上通过自定义 handler 部署集成 Whisper 语音识别、Pyannote 说话人日志与投机解码的完整流水线。
Hugging Face 评测团队与 Dottxt 合作研究发现,大语言模型对提示词格式及示例排列顺序高度敏感,而引入结构化生成可显著降低评测方差并稳定模型排名。在 GSM8K 与 GPQA 测试中,使用 Outlines 正则表达式约束输出不仅使 Mistral-7B 和 Zephyr-7B 的平均得分提高,还消除了少样本设置下的模型胜负倒挂现象。
Hugging Face 推出 Open CoT Leaderboard,用于评估大语言模型在复杂推理任务中生成有效思维链(CoT)的能力。与传统基准不同,该榜单以引入 CoT 前后的准确率增益(Δ)作为核心指标,以此检验 CoT 对模型精度的真实影响并降低数据污染干扰。评测基于 LogiQA 与 LSAT 数据集,目前支持 Classic 和 Reflect 两种提示策略。
Hugging Face 与合作团队推出标准化评测平台 Open Medical-LLM Leaderboard,用于系统评估大语言模型在医疗领域的知识与问答表现。
Meta 正式发布开源大语言模型 Llama 3,提供 8B 和 70B 两个尺寸的基础版与指令微调版,并同步推出安全模型 Llama Guard 2。模型在超过 15 万亿模型 token 上训练,词表扩展至 128,256,上下文窗口为 8k context,8B 版本增加了分组查询注意力(GQA)。
推荐理由:原文梳理了模型架构参数与词表变化,并给出了在开源框架下进行推理部署和单卡微调的完整代码。
面向医疗与生命科学领域的企业级生成式 AI 平台 Ryght Preview 正式公开发布。借助 Hugging Face 专家支持计划,Ryght 深度集成了 Text Generation Inference(TGI)与 Text Embeddings Inference(TEI)服务。
Hugging Face 推出基于 LiveCodeBench 的代码大模型评测排行榜,通过持续收集竞赛编程平台题目并标注发布日期,实现按时间窗口评估以防范测试集污染。
推荐理由:基准通过按发布时间切片和多场景评测应对数据污染,为评估代码大模型的真实泛化能力提供了动态参照体系。
Hugging Face 宣布与云安全公司 Wiz 达成合作,全面加强平台及开源 AI 生态的安全防护。Wiz 研究团队此前在其沙箱计算环境中发现了利用 pickle 运行任意代码的漏洞,目前相关漏洞已全部修复。Hugging Face 已接入 Wiz 的漏洞管理与 CSPM 服务来监控多云环境,并呼吁社区逐步淘汰高风险的 pickle 格式并迁移至 Safetensors。