Google 发布视觉语言模型 PaliGemma 2 并上线 Hugging Face
Google 正式发布多模态视觉语言模型 PaliGemma 2,将 SigLIP 视觉编码器与 Gemma 2 解码器结合,并在 Hugging Face 同步上线。
推荐理由:原文梳理了模型升级细节并给出量化实测数据,读者可以据此评估多模态微调与部署方案。
Google 正式发布多模态视觉语言模型 PaliGemma 2,将 SigLIP 视觉编码器与 Gemma 2 解码器结合,并在 Hugging Face 同步上线。
推荐理由:原文梳理了模型升级细节并给出量化实测数据,读者可以据此评估多模态微调与部署方案。
该实验基于 Keras、JAX 与 TPU v5e 构建了 Chatbot Arena 对比环境,测试 10B 参数量以下大语言模型在自然语言提示下修正代码错误的能力。系统利用拥有 8 个核心、共 128GB 内存的 TPU v5e 进行模型分片,以 bfloat16 格式在显存中同时加载多个约 8B 与 2B 参数模型进行即时对话评测。
Hugging Face 发布面向开源开发者的欧盟人工智能法案合规指南,梳理了有限风险系统与通用大模型的合规界限与义务要求。指南指出,非系统性风险开源通用模型需提供训练数据摘要并遵守版权退出机制,交互式或生成式系统则须标注 AI 生成内容。相关通用模型规定将于 2025 年 8 月起执行,开发者可借助模型卡片、Gradio 水印和 Spawning 退出工具提前适配。
推荐理由:文章系统梳理了开源模型与系统在欧盟法规下的分级边界,并指明了训练数据披露与版权退出的具体落地路径。
Hugging Face 的 Xet 团队采用内容定义分块(CDC)技术,将文件切分为数据块进行增量传输与去重,以优化超 30 PB 资产的存储效率。该方案相比传统 Git LFS 可提升约 50% 的存储与传输性能,在微调模型与检查点上的去重率达 30% 至 85%。团队计划于 2025 年初在 Hub 正式推出首批基于 Xet 的存储库。
Hugging Face 介绍了基于 LayerSkip 的自推测解码技术,并在 transformers 库中通过 assistant_early_exit 参数支持单模型早退加速生成。
开源数据标注工具 Argilla 发布 2.4 版本,新增无需编写代码即可在 UI 中直接从 Hugging Face Hub 导入公开数据集的功能。该功能支持用户自定义标注问题与字段,便于构建模型微调与评测数据集并收集人类反馈。工具推荐部署在 Hugging Face Spaces 并默认启用 HF OAuth 进行协作标注,同时保留了 Python SDK 导入方式。
Intel Labs 与 Hugging Face 联合推出通用辅助生成(UAG),突破传统辅助生成对分词器一致的限制,允许任意小模型为不同架构的大模型加速,已在 Transformers 4.46.0 中上线。
Google DeepMind 与 Hugging Face 宣布在 Transformers v4.46.0 中集成 SynthID Text 文本水印技术。
推荐理由:原文给出了在开源框架中配置与检测文本水印的具体参数和调用代码,便于开发者直接评估内容溯源方案的工程落地成本。
Hugging Face 发布在 Inference Endpoints 上部署 Speech-to-Speech(S2S)语音管线的完整指南。
dottxt 与 Hugging Face 联合发布 outlines-core 0.1.0 及其 Python 绑定,这是结构化生成库 outlines 核心算法的 Rust 移植版本。
推荐理由:Rust 重写将结构化生成核心拆解为轻量底座,读者可了解其如何消除初次运行编译延迟并适配跨语言推理引擎。
Keras 与 keras_hub 已支持直接加载 Hugging Face 上的 Llama 3.2 检查点进行推理与训练,遇到格式差异时会自动完成实时转换。框架支持 JAX、PyTorch 与 TensorFlow 多后端运行,并提供内置的分词器与预处理器接口。结合 JAX 与 XLA 编译机制,用户还能在 TPU 或 GPU 上配置模型并行以运行及微调更大参数量的模型。
Hugging Face 修复了 Transformers Trainer 中梯度累加与全 batch 训练不等价的计算偏差。因果语言模型等 token 级任务此前直接对每个 batch 的损失取平均,导致存在 padding 时计算失真,正确方法应将所有累加 batch 的总损失除以非 padding token 总数。
推荐理由:原文拆解了梯度累加与全批次训练结果不一致的数学根源,并给出了针对非填充 token 归一化的具体修复逻辑。
AMD 推出基于 Zen5 架构的第五代 EPYC 处理器(Turin),核心数最高达 192 核 384 线程。在结合 ZenDNN 5.0 与 torch.compile 的 Meta Llama 3.1 8B 推理评测中,128 核 Turin 相比前代 96 核 Genoa 实现了约 2X 的吞吐量提升。Hugging Face 优化的 Dockerfile 和评测代码也将很快向社区公开。
Hugging Face 联合网络安全机构 Trail of Bits 完成了对 Gradio 5 的独立安全审计,并在 Gradio 5.0 正式发布前修复了全部已知漏洞。
推荐理由:团队公开了第三方安全审计发现的四大类漏洞及修复细节,帮助开发者了解 Gradio 5 默认安全机制与生产部署风险。
Hugging Face 正式推出 Gradio 5 稳定版,将该框架升级为支持生产环境的机器学习 Web 应用开发工具。新版本引入服务端渲染(SSR)以实现瞬时首屏加载,并通过 WebSocket 与 WebRTC 优化低延迟音视频及文本流式传输。此外,Gradio 5 刷新了核心 UI 组件与内置主题,通过了第三方安全审计,并上线支持实时预览的实验性 AI Playground。
推荐理由:介绍 Gradio 5 从原型工具走向生产级框架的关键变化,包含 SSR 渲染与低延迟流式传输等工程升级。
Hugging Face 介绍了结合 Dask 在云端多 GPU 集群上扩展 AI 数据处理的实践方案,演示了将文本分类任务从单机 100 行扩增至 2.11 亿行的完整流程。
Open FinLLM 排行榜正式推出,专为评估大语言模型在真实金融垂直场景下的综合能力而设立。该基准采用零样本评测方法,全面涵盖信息抽取、文本分析、问答、文本生成、风险管理、预测和决策七大任务类别。评测体系结合了 Accuracy、F1 Score、ROUGE 与 MCC 等多维指标,用于客观检验模型处理复杂金融数据的泛化水平。
BenCzechMark 推出捷克语大语言模型综合评测基准与排行榜,用于评估模型在捷克语下的复杂推理、生成及文化知识掌握能力。该基准包含 9 个类别的 50 项任务,其中 90% 为原生非翻译内容,首批排行榜涵盖超过 25 款开源模型。评测覆盖阅读理解、语法纠错、数学推理等维度,采用 Acc、EM、AUROC 与词级困惑度(Ppl)等指标进行公平评估。
Hugging Face 发布了一项将顶点着色 3D 网格转换为带 UV 贴图网格的实现方案,并开源了轻量库 InstantTexture。该方法利用 xatlas 生成 UV 展开,通过重心坐标插值填充纹理,并结合修复、中值滤波和高斯模糊填补空洞并平滑纹理。该流程能将 InstantMesh 等 3D 生成模型输出的 .obj 网格直接转为标准 .glb 格式,便于下游图形管线使用。
Hugging Face 官方发布 Daily Papers 功能指南,系统介绍了论文认领、社区提交、与作者直接讨论以及关联模型和数据集等功能。平台目前已收录超 3,700 篇论文并拥有超 1.2 万订阅者,支持在评论区输入 @librarian-bot 推荐相似论文与多语言自动翻译。
Hugging Face 详细公开了开源视频数据集 FineVideo 的构建流程,涵盖从 1.9M 原始视频筛选至 43k 视频(约 3.4k 小时)的多阶段技术细节。
推荐理由:原文完整拆解了从海量视频筛选、多模型标注到结构化解析的管线,对构建多模态视频训练集有直接工程参考价值。
Hugging Face 发布实践指南,介绍如何结合 Optimum-Intel 与 OpenVINO GenAI 将 Transformers 模型优化并部署到 Intel 硬件端侧环境。
Hugging Face 宣布与 Truffle Security 合作,将开源机密扫描工具 TruffleHog 集成至平台自动化扫描流程,并推出原生 Hugging Face 扫描器。
开发者可通过 Hugging Face 专用容器与 TGI,在 Google Cloud Vertex AI 的 A3 节点上编程部署 FP8 量化版 Meta Llama 3.1 405B。
Hugging Face 团队公布了复现 Google Infini-Attention 的实验结果,指出该机制随着内存压缩次数增加,长上下文检索性能会显著下降。
Hugging Face 宣布推出 Falcon Mamba,称其为首个性能强劲且不依赖 Attention 机制的 7B 参数规模模型。当前材料仅有标题信息,具体架构与评测细节未在正文中展开。
Hugging Face 官方宣布 XetHub 加入 Hugging Face。
Google 正式扩展 Gemma 开源生态,发布了 2.6B 参数的端侧轻量模型 Gemma 2 2B、安全审核分类器 ShieldGemma 以及可解释性工具集 Gemma Scope。
推荐理由:原文提供了三款新资产的具体参数规格与部署代码,读者可以据此评估端侧部署与安全审核方案。
Hugging Face 介绍了通过 PyTorch 量化工具 Quanto 优化 Diffusers 中 Diffusion Transformer 模型显存的方法。
Hugging Face 探讨了利用大语言模型辅助评测方法 LAVE 解决传统 VQA 指标因格式差异导致评分失真的问题,并在合成数据集 Docmatix 上开展零样本评测。实验以 MPLUGDocOwl1.5 为基线并使用 Llama-2-Chat-7b 打分,传统指标 ANLS 仅为 0.002、BLEU 为 0.0032,而 LAVE 得分达 0.58,能更准确评估模型的实际语义泛化能力。
Meta 联合 Hugging Face 发布 Llama 3.1 系列模型,涵盖 8B、70B 和 405B 三种规格的 Base 与 Instruct 版本,支持 128K 上下文与 8 种语言。
推荐理由:文章给出了各规格模型在显存占用、量化部署、工具调用及数据合成上的具体配置与代码,便于评估硬件门槛和落地流程。
Numina 与 Hugging Face 合作开发的 NuminaMath 7B TIR 在首届 AI 数学奥林匹克竞赛(AIMO)进展奖中夺冠,并在私有测试集上解出 29/50 道题目。
推荐理由:文章提供了在受限推理算力下结合工具调用与多阶段微调的完整工程方案,适合需要优化推理模型落地表现的团队参考。
Hugging Face 宣布 TRL 库正式支持视觉语言模型(VLM)的直接偏好优化(DPO),用于对齐人类偏好并减少多模态幻觉。教程以 Idefics2-8b 为例,结合 bfloat16 与 LoRA 技术将全量训练所需的 160GB 显存降低至 32.3GB,并在 AMBER 幻觉基准测试中改善了表现。目前该流程还兼容 Llava 1.5 与 PaliGemma 等主流模型。
推荐理由:原文给出了多模态模型进行偏好微调的显存计算与参数配置方案,便于开发者以单卡环境落地对齐训练。
Hugging Face 宣布与 KerasHub 推出深度集成,允许用户通过共享模型保存格式在 KerasHub 中直接加载 Hub 上的 Transformers 检查点。
Hugging Face 宣布在其 Inference Endpoints 和 Spaces 中正式上线 Google Cloud TPU v5e 算力支持。服务提供 1 核 16 GB(每小时 $1.375)、4 核 64 GB(每小时 $5.50)以及 8 核 128 GB(每小时 $11.00)三种配置。
推荐理由:该支持降低了在托管环境调用 TPU 的操作门槛,为需要平衡延迟与成本的开源模型部署提供了具体的硬件配置参考。
Banque des Territoires 联合 Polyconseil 与 Hugging Face 开发了一套保障数据主权的开源 RAG 解决方案,用于支持法国 EduRénov 学校生态改造项目。
Hugging Face 宣布为其 Dataset Hub 推出四项全新搜索过滤功能,以提升平台上超过 18 万个公开数据集的检索效率。新功能支持按数据模态(文本、图像、音频、3D、视频等)、数据规模(指定行数区间)、文件格式(如 Parquet、WebDataset)以及兼容代码库(如 Pandas、Dask、🤗 Datasets 并提供加载代码片段)进行筛选。
推荐理由:原文详细介绍了按模态、数据规模、存储格式和兼容库四类新增过滤维度,方便开发者精准检索和筛选训练数据。
Intel 与 MILA 借助 Optimum 库在 Intel Gaudi 2 上实现了蛋白质语言模型 ProtST 的推理与微调加速。在测试集运行 bfloat16 推理时,单张 Gaudi 2 取得与 NVIDIA A100 相同的 0.44 准确率,速度达 A100 的 1.76x。微调任务中单张 Gaudi 2 速度较 A100 提升 2.92x,且在 4 或 8 卡配置下呈近线性扩展。
Hugging Face 介绍了基于 Transformers Agents 构建的 Code Agent 在 GAIA 智能体基准评测中的方案,在验证集以 44.2% 的成绩位列第一,测试集得分 33.3% 位列第二。团队核心采用由智能体直接编写并执行 Python 代码而非生成 JSON 字典的交互范式,搭配基于 AST 构建的安全 Python 解释器以及轻量级多智能体编排和周期性规划机制。
推荐理由:团队通过实测对比了代码动作与传统 JSON 动作的步骤消耗与性能差异,为构建复杂工具调用智能体提供了安全代码执行与规划架构参考。
Google 正式发布新一代开源大语言模型 Gemma 2,包含 9B 与 27B 两种尺寸的基础和指令微调版本,Hugging Face 生态同步提供支持。架构上引入了交替滑动窗口注意力、Logit 软截断以及在策略知识蒸馏技术,上下文窗口为 8K tokens。
推荐理由:文章系统梳理了 Gemma 2 的架构改进与蒸馏机制,并提供了在消费级硬件上的完整微调与部署方案。