跳到正文

#Hugging Face

今日 0 条
12月5日周四
  1. Hugging Face49

    大语言模型自我纠错能力如何?基于 Keras 与 TPU 的 Chatbot Arena 实验

    该实验基于 Keras、JAX 与 TPU v5e 构建了 Chatbot Arena 对比环境,测试 10B 参数量以下大语言模型在自然语言提示下修正代码错误的能力。系统利用拥有 8 个核心、共 128GB 内存的 TPU v5e 进行模型分片,以 bfloat16 格式在显存中同时加载多个约 8B 与 2B 参数模型进行即时对话评测。

12月2日周一
  1. Hugging Face68

    面向开源开发者的欧盟人工智能法案合规指南

    Hugging Face 发布面向开源开发者的欧盟人工智能法案合规指南,梳理了有限风险系统与通用大模型的合规界限与义务要求。指南指出,非系统性风险开源通用模型需提供训练数据摘要并遵守版权退出机制,交互式或生成式系统则须标注 AI 生成内容。相关通用模型规定将于 2025 年 8 月起执行,开发者可借助模型卡片、Gradio 水印和 Spawning 退出工具提前适配。

    推荐理由:文章系统梳理了开源模型与系统在欧盟法规下的分级边界,并指明了训练数据披露与版权退出的具体落地路径。

11月20日周三
  1. Hugging Face41

    从文件到数据块:提升 Hugging Face 存储效率

    Hugging Face 的 Xet 团队采用内容定义分块(CDC)技术,将文件切分为数据块进行增量传输与去重,以优化超 30 PB 资产的存储效率。该方案相比传统 Git LFS 可提升约 50% 的存储与传输性能,在微调模型与检查点上的去重率达 30% 至 85%。团队计划于 2025 年初在 Hub 正式推出首批基于 Xet 的存储库。

11月4日周一
  1. Hugging Face57

    Argilla 2.4 发布:支持在 UI 中无代码构建 Hub 微调与评测数据集

    开源数据标注工具 Argilla 发布 2.4 版本,新增无需编写代码即可在 UI 中直接从 Hugging Face Hub 导入公开数据集的功能。该功能支持用户自定义标注问题与字段,便于构建模型微调与评测数据集并收集人类反馈。工具推荐部署在 Hugging Face Spaces 并默认启用 HF OAuth 进行协作标注,同时保留了 Python SDK 导入方式。

10月29日周二
10月23日周三
10月22日周二
10月21日周一
  1. Hugging Face51

    Keras 支持运行与微调 Llama 3.2

    Keras 与 keras_hub 已支持直接加载 Hugging Face 上的 Llama 3.2 检查点进行推理与训练,遇到格式差异时会自动完成实时转换。框架支持 JAX、PyTorch 与 TensorFlow 多后端运行,并提供内置的分词器与预处理器接口。结合 JAX 与 XLA 编译机制,用户还能在 TPU 或 GPU 上配置模型并行以运行及微调更大参数量的模型。

10月16日周三
  1. Hugging Face68

    Hugging Face 修复 Transformers 梯度累加计算偏差

    Hugging Face 修复了 Transformers Trainer 中梯度累加与全 batch 训练不等价的计算偏差。因果语言模型等 token 级任务此前直接对每个 batch 的损失取平均,导致存在 padding 时计算失真,正确方法应将所有累加 batch 的总损失除以非 padding token 总数。

    推荐理由:原文拆解了梯度累加与全批次训练结果不一致的数学根源,并给出了针对非填充 token 归一化的具体修复逻辑。

10月10日周四
  1. Hugging Face46

    AMD 发布第五代 EPYC CPU

    AMD 推出基于 Zen5 架构的第五代 EPYC 处理器(Turin),核心数最高达 192 核 384 线程。在结合 ZenDNN 5.0 与 torch.compile 的 Meta Llama 3.1 8B 推理评测中,128 核 Turin 相比前代 96 核 Genoa 实现了约 2X 的吞吐量提升。Hugging Face 优化的 Dockerfile 和评测代码也将很快向社区公开。

  2. Hugging Face74

    Gradio 5 安全审计报告

    Hugging Face 联合网络安全机构 Trail of Bits 完成了对 Gradio 5 的独立安全审计,并在 Gradio 5.0 正式发布前修复了全部已知漏洞。

    推荐理由:团队公开了第三方安全审计发现的四大类漏洞及修复细节,帮助开发者了解 Gradio 5 默认安全机制与生产部署风险。

10月9日周三
  1. Hugging Face76

    Gradio 5 正式发布:支持服务端渲染与低延迟流式传输,定位生产级机器学习应用

    Hugging Face 正式推出 Gradio 5 稳定版,将该框架升级为支持生产环境的机器学习 Web 应用开发工具。新版本引入服务端渲染(SSR)以实现瞬时首屏加载,并通过 WebSocket 与 WebRTC 优化低延迟音视频及文本流式传输。此外,Gradio 5 刷新了核心 UI 组件与内置主题,通过了第三方安全审计,并上线支持实时预览的实验性 AI Playground。

    推荐理由:介绍 Gradio 5 从原型工具走向生产级框架的关键变化,包含 SSR 渲染与低延迟流式传输等工程升级。

10月4日周五
  1. Hugging Face47

    Open FinLLM 排行榜正式发布

    Open FinLLM 排行榜正式推出,专为评估大语言模型在真实金融垂直场景下的综合能力而设立。该基准采用零样本评测方法,全面涵盖信息抽取、文本分析、问答、文本生成、风险管理、预测和决策七大任务类别。评测体系结合了 Accuracy、F1 Score、ROUGE 与 MCC 等多维指标,用于客观检验模型处理复杂金融数据的泛化水平。

10月1日周二
  1. Hugging Face34

    BenCzechMark:你的 LLM 能理解捷克语吗?

    BenCzechMark 推出捷克语大语言模型综合评测基准与排行榜,用于评估模型在捷克语下的复杂推理、生成及文化知识掌握能力。该基准包含 9 个类别的 50 项任务,其中 90% 为原生非翻译内容,首批排行榜涵盖超过 25 款开源模型。评测覆盖阅读理解、语法纠错、数学推理等维度,采用 Acc、EM、AUROC 与词级困惑度(Ppl)等指标进行公平评估。

9月30日周一
  1. Hugging Face58

    如何将顶点着色 3D 网格转换为 UV 贴图纹理网格

    Hugging Face 发布了一项将顶点着色 3D 网格转换为带 UV 贴图网格的实现方案,并开源了轻量库 InstantTexture。该方法利用 xatlas 生成 UV 展开,通过重心坐标插值填充纹理,并结合修复、中值滤波和高斯模糊填补空洞并平滑纹理。该流程能将 InstantMesh 等 3D 生成模型输出的 .obj 网格直接转为标准 .glb 格式,便于下游图形管线使用。

9月23日周一
9月20日周五
9月4日周三
8月19日周一
8月14日周三
8月12日周一
8月8日周四
7月31日周三
7月30日周二
7月25日周四
  1. Hugging Face34

    LAVE:基于大语言模型在 Docmatix 上的零样本 VQA 评测——我们还需要微调吗?

    Hugging Face 探讨了利用大语言模型辅助评测方法 LAVE 解决传统 VQA 指标因格式差异导致评分失真的问题,并在合成数据集 Docmatix 上开展零样本评测。实验以 MPLUGDocOwl1.5 为基线并使用 Llama-2-Chat-7b 打分,传统指标 ANLS 仅为 0.002、BLEU 为 0.0032,而 LAVE 得分达 0.58,能更准确评估模型的实际语义泛化能力。

7月23日周二
7月11日周四
  1. Hugging Face74

    Numina 与 Hugging Face 详解 NuminaMath 赢得首届 AIMO 进展奖的技术方案

    Numina 与 Hugging Face 合作开发的 NuminaMath 7B TIR 在首届 AI 数学奥林匹克竞赛(AIMO)进展奖中夺冠,并在私有测试集上解出 29/50 道题目。

    推荐理由:文章提供了在受限推理算力下结合工具调用与多阶段微调的完整工程方案,适合需要优化推理模型落地表现的团队参考。

7月10日周三
  1. Hugging Face69

    Hugging Face TRL 支持视觉语言模型 DPO 微调实践指南

    Hugging Face 宣布 TRL 库正式支持视觉语言模型(VLM)的直接偏好优化(DPO),用于对齐人类偏好并减少多模态幻觉。教程以 Idefics2-8b 为例,结合 bfloat16 与 LoRA 技术将全量训练所需的 160GB 显存降低至 32.3GB,并在 AMBER 幻觉基准测试中改善了表现。目前该流程还兼容 Llava 1.5 与 PaliGemma 等主流模型。

    推荐理由:原文给出了多模态模型进行偏好微调的显存计算与参数配置方案,便于开发者以单卡环境落地对齐训练。

7月9日周二
  1. Hugging Face67

    Google Cloud TPU 正式面向 Hugging Face 用户开放

    Hugging Face 宣布在其 Inference Endpoints 和 Spaces 中正式上线 Google Cloud TPU v5e 算力支持。服务提供 1 核 16 GB(每小时 $1.375)、4 核 64 GB(每小时 $5.50)以及 8 核 128 GB(每小时 $11.00)三种配置。

    推荐理由:该支持降低了在托管环境调用 TPU 的操作门槛,为需要平衡延迟与成本的开源模型部署提供了具体的硬件配置参考。

7月8日周一
  1. Hugging Face62

    Hugging Face 推出四项全新数据集搜索与过滤功能

    Hugging Face 宣布为其 Dataset Hub 推出四项全新搜索过滤功能,以提升平台上超过 18 万个公开数据集的检索效率。新功能支持按数据模态(文本、图像、音频、3D、视频等)、数据规模(指定行数区间)、文件格式(如 Parquet、WebDataset)以及兼容代码库(如 Pandas、Dask、🤗 Datasets 并提供加载代码片段)进行筛选。

    推荐理由:原文详细介绍了按模态、数据规模、存储格式和兼容库四类新增过滤维度,方便开发者精准检索和筛选训练数据。

7月3日周三
7月1日周一
  1. Hugging Face75

    Transformers Code Agent 取得 GAIA 基准评测验证集第一

    Hugging Face 介绍了基于 Transformers Agents 构建的 Code Agent 在 GAIA 智能体基准评测中的方案,在验证集以 44.2% 的成绩位列第一,测试集得分 33.3% 位列第二。团队核心采用由智能体直接编写并执行 Python 代码而非生成 JSON 字典的交互范式,搭配基于 AST 构建的安全 Python 解释器以及轻量级多智能体编排和周期性规划机制。

    推荐理由:团队通过实测对比了代码动作与传统 JSON 动作的步骤消耗与性能差异,为构建复杂工具调用智能体提供了安全代码执行与规划架构参考。

6月27日周四
  1. Hugging Face83

    Google 发布开源大模型 Gemma 2,Hugging Face 全面集成

    Google 正式发布新一代开源大语言模型 Gemma 2,包含 9B 与 27B 两种尺寸的基础和指令微调版本,Hugging Face 生态同步提供支持。架构上引入了交替滑动窗口注意力、Logit 软截断以及在策略知识蒸馏技术,上下文窗口为 8K tokens。

    推荐理由:文章系统梳理了 Gemma 2 的架构改进与蒸馏机制,并提供了在消费级硬件上的完整微调与部署方案。