跳到正文

#Hugging Face

今日 0 条
5月7日周四
  1. Hugging Face46

    vLLM 从 V0 到 V1 迁移:强化学习中后端正确性优先于目标修正

    PipelineRL 在将推理引擎从 vLLM 0.8.5(V0)迁移至 0.18.1(V1)时,发现训练与推理不一致会导致 KL 散度与奖励等训练动态偏离。团队通过配置采样处理后的 logprobs、关闭前缀缓存与异步调度等运行时默认项、对齐在途权重更新路径以及在最终投影层使用 fp32 lm_head 四项修复,成功使 V1 训练轨迹与 V0 保持一致。

5月6日周三
  1. Hugging Face44

    Open ASR Leaderboard 引入私有评测集防刷榜

    Open ASR Leaderboard 引入由 Appen 与 DataoceanAI 提供的多口音私有英语数据集,以防止针对基准的过度优化(benchmaxxing)与测试集污染。目前榜单默认的 Average WER 仍仅基于公开数据集计算,用户可通过切换开关查看私有数据的评测结果。榜单新增了朗读、对话及美式与非美式口音等宏平均指标,提交模型后由平台统一在私有集上运行验证。

4月29日周三
  1. Hugging Face65

    IBM 开源 Granite 4.1 系列大模型

    IBM 宣布以 Apache 2.0 协议开源 Granite 4.1 系列稠密大语言模型,包含 3B、8B 和 30B 三种尺寸,支持最高 512K 上下文。

    推荐理由:技术报告详述了五阶段退火预训练与四阶段强化学习流程,为端侧与企业级小参数稠密模型的构建提供了完整工程参考。

4月28日周二
  1. Hugging Face77

    NVIDIA 发布 Nemotron 3 Nano Omni:支持文档、音视频与智能体的长上下文多模态全能模型

    NVIDIA 正式推出全模态理解模型 Nemotron 3 Nano Omni,原生支持文本、图像、长音视频理解、复杂文档分析以及 GUI 智能体计算机操作。

    推荐理由:该模型结合 Mamba-Transformer-MoE 混合架构与原生音视频编码,为长上下文多模态处理与 GUI 智能体提供了高吞吐量的开源实现方案。

4月27日周一
4月24日周五
4月23日周四
4月21日周二
  1. Hugging Face36

    QIMMA:质量优先的阿拉伯语大语言模型排行榜

    QIMMA 是一款开源且“质量优先”的阿拉伯语大语言模型排行榜,在评测前引入严格的多阶段质量校验流程,以确保得分真实反映模型的阿拉伯语能力。该平台整合了 14 个基准的超 52,000 个样本,覆盖文化、医疗与代码等 7 大领域,不仅 99% 为原生阿拉伯语内容,还首次集成了 HumanEval+ 与 MBPP+ 代码评测。

  2. Hugging Face50

    Hugging Face 谈 AI 与网络安全的未来:为何开源至关重要

    Hugging Face 针对 Mythos 等漏洞挖掘系统发表分析,指出 AI 网络安全能力取决于模型所嵌入的系统脚手架而非单一模型,开源生态能够有效抹平攻防双方的不对称。文章主张采用人类在环的半自治智能体防御模式,利用开源工具与透明决策日志避免闭源黑盒带来的单点故障。高风险机构可通过在自有基础设施上部署开源安全组件与针对性微调,在敏感数据不外流的前提下抵御自动化攻击。

4月16日周四
  1. Hugging Face72

    Hugging Face 推出 transformers-to-mlx Skill 与测试套件,加速模型移植到 Apple MLX

    Hugging Face 推出基于 Claude Code 的 transformers-to-mlx 技能与独立测试套件,辅助开发者将 transformers 架构模型规范地移植到 Apple MLX 框架的 mlx-lm 库。

    推荐理由:它展示了如何将项目规范与独立验证流程封装为技能,在保证提交质量的同时降低开源模型跨框架迁移门槛。

  2. Hugging Face50

    Ecom-RLVE:面向电商对话智能体的自适应可验证环境

    Ecom-RLVE 框架将可验证强化学习扩展至多轮电商对话,推出包含 8 个工具增强型环境的 EcomRLVE-GYM。该平台具备 12 轴自适应难度体系,完全通过算法代码计算任务收益与幻觉惩罚,无需人工或大模型裁判。团队基于 DAPO 算法训练 Qwen 3 8B 模型 300 步,验证了环境扩展能有效提升电商智能体的真实任务完成能力。

  3. Hugging Face72

    使用 Sentence Transformers 训练与微调多模态嵌入与重排模型指南

    Hugging Face 介绍了使用 Sentence Transformers 训练和微调多模态嵌入与重排模型的完整流程,支持处理文本、图像、音频与视频等多模态数据。

    推荐理由:文章给出了使用 Sentence Transformers 微调多模态检索模型的完整范式,展示了如何通过梯度缓存与俄罗斯套娃损失低成本提升垂直领域表现。

4月15日周三
  1. Hugging Face51

    深入剖析 VAKRA 基准:AI 智能体的推理、工具调用与失效模式

    IBM Research 详解了面向企业级 AI 智能体的可执行评测基准 VAKRA,用于评估智能体跨 API 与文档的多步复合推理能力。该基准覆盖商业智能 API 链式调用、工具选择、多跳推理及策略约束多源推理四大任务,依托 62 个领域的 8,000 多个本地 API。实验显示主流模型在长链调用、参数填充及外部策略约束下表现明显下滑。

  2. Hugging Face75

    HCompany 推出浏览器 AI 扩展 HoloTab

    HCompany 推出基于其 Holo3 模型的 Chrome 扩展 HoloTab,支持在任意网站上通过提示词自动执行界面导航与表单填写等任务。扩展内置 Routines 功能,用户只需录制一次网页操作与语音讲解,即可生成自动化流程并支持随时重跑或定时执行。该扩展已在 Chrome 应用商店免费开放。

    推荐理由:原文展示了如何通过录制屏幕与语音解说生成自动化例程,使普通用户能直接在浏览器中复现复杂的跨网页任务。

4月9日周四
  1. Hugging Face74

    Sentence Transformers v5.4 发布:支持多模态嵌入与重排序模型

    Sentence Transformers 发布 v5.4 版本,正式支持通过统一 API 编码与比对文本、图像、音频和视频等多模态数据。新版本同时涵盖多模态嵌入(SentenceTransformer)与重排序(CrossEncoder)能力,原生适配 Qwen3-VL、Nemotron 等开源模型并支持混合输入。

    推荐理由:该更新统一了文本、图像与音视频的检索与重排序接口,便于开发者直接构建跨模态 RAG 管线。

  2. Hugging Face74

    Overworld 发布 Waypoint-1.5 实时交互世界模型,支持消费级 GPU 本地运行

    Overworld 正式发布实时视频世界模型 Waypoint-1.5,模型权重已在 Hugging Face 开源上线,主打消费级硬件本地实时交互。在 RTX 3090 至 5090 显卡上可实时生成最高 720p 60 FPS 环境,并提供适配游戏本及 Apple Silicon 的 360p 规格。

    推荐理由:原文给出了消费级硬件本地运行世界模型的具体分级与训练细节,读者可以了解端侧实时交互环境生成的落地可能。

4月8日周三
4月2日周四
  1. Hugging Face88

    Google 推出端侧多模态开源模型 Gemma 4,Hugging Face 同步提供全生态部署支持

    Google DeepMind 正式发布开源多模态模型 Gemma 4 家族,采用 Apache 2.0 协议,支持文本、图像与音频输入,并在 Hugging Face 实现生态同步上线。

    推荐理由:Gemma 4 覆盖 2.3B 到 31B 多个尺寸并支持端侧多模态与扩散文本生成,为本地部署提供了开源基座与多推理引擎支持。

4月1日周三
  1. Hugging Face67

    TII 发布早期融合视觉模型 Falcon Perception 与轻量级 Falcon OCR

    阿联酋技术创新研究院(TII)发布 0.6B 参数的早期融合视觉模型 Falcon Perception,以及 0.3B 参数的端到端文档解析模型 Falcon OCR。

    推荐理由:材料验证了单骨干早期融合架构在开放词表分割与超轻量 OCR 中的可行性,为端侧密集视觉任务提供了极具参考价值的极简设计路线。

3月31日周二
  1. Hugging Face76

    Hugging Face 正式发布后训练库 TRL v1.0

    Hugging Face 正式发布大语言模型后训练库 TRL v1.0,标志着该项目从实验性研究代码库正式演进为具备语义化版本稳定承诺的基础设施。该版本现已实现超过 75 种后训练方法,并采用将核心稳定层与实验层明确隔离的设计,以在限制过度抽象的同时应对快速演进的算法生态。后续团队将重点推进异步 GRPO 训练、MoE 分布式扩展以及面向智能体可读的结构化训练诊断信号。

    推荐理由:文章详细阐述了在后训练范式快速迭代下,框架如何通过双层稳定性契约与限制抽象设计平衡维护成本与灵活性。

3月27日周五
  1. Hugging Face69

    Hugging Face 发布 OpenClaw 开源模型迁移指南

    Hugging Face 推出 OpenClaw 等开源智能体的模型迁移指南,帮助受 Anthropic 访问限制影响的用户切换至开源模型。方案提供两条路径,用户可通过 Hugging Face Inference Providers 调用 GLM-5 等云端模型,也可结合 llama.cpp 本地运行 Qwen3.5-35B-A3B 以实现零 API 成本和数据隐私。

    推荐理由:文章给出了将智能体迁移至托管开源接口与本地运行的具体配置,为受闭源限制的用户提供了替代方案。

3月24日周二
  1. Hugging Face61

    ServiceNow 推出端到端语音智能体评测框架 EVA

    ServiceNow AI 团队推出端到端语音智能体评测框架 EVA,联合评估任务准确性与对话交互体验。框架采用端到端音频模拟架构,首发包含 50 个航空业务场景的测试集,覆盖级联与原生音频等 20 款系统。评测结果显示任务完成度高的智能体往往交互体验更差,且专有名词转写是导致交互中断的主要瓶颈。

    推荐理由:该框架将任务准确率与对话交互体验联合度量,为语音智能体的全流程实测提供了可参考的基准方案。

3月21日周六
  1. Hugging Face61

    如何在一天内微调领域专属 Embedding 模型

    NVIDIA 推出一套端到端 Embedding 模型微调方案,利用单张 80GB GPU 和 NeMo 工具链,可在一天内将通用模型适配到垂直领域。该流程使用 LLM 自动生成包含多跳推理的合成数据并挖掘难负例,微调 Llama-Nemotron-Embed-1B-v2 后可直接导出 TensorRT 引擎并接入 NIM 部署。

    推荐理由:教程提供了一套从无标注文档自动生成问答对到难负例挖掘的完整方案,有助于开发者低成本提升垂直领域检索召回率。

3月18日周三
  1. Hugging Face73

    Hugging Face 发布 2026 春季开源 AI 现状报告

    Hugging Face 发布 2026 春季开源 AI 现状报告,指出平台用户已达 1300 万、公开模型超 200 万,开源格局发生显著地理与结构重构。中国模型下载量占比跃升至 41% 并超越美国,阿里千问(Qwen)衍生模型超 11.3 万个,DeepSeek-R1 登顶最受关注模型。

    推荐理由:原文用平台全量数据量化了开源生态在地理格局与具身领域的转向,读者可据此判断模型选型与开源演进趋势。

3月17日周二
  1. Hugging Face61

    H Company 发布高吞吐计算机操作模型 Holotron-12B

    H Company 正式发布多模态计算机操作模型 Holotron-12B,基于 NVIDIA 开源模型后训练构建并已上线 Hugging Face。该模型采用混合 SSM 与注意力架构以减少显存占用,在单张 H100 搭配 vLLM 运行且并发达到 100 时吞吐量达到 8.9k tokens/s,并在 WebVoyager 基准测试中取得 80.5% 的表现。

    推荐理由:该模型结合混合状态空间模型架构优化并发推理,展现了降低显存占用并提升智能体长上下文吞吐量的方法。

3月10日周二
  1. Hugging Face59

    Hugging Face 梳理 16 个开源 RL 库:大模型异步训练架构的经验与设计实践

    Hugging Face 调研了 verl、PipelineRL 等 16 个开源强化学习库,系统梳理了将推理生成与训练解耦的异步强化学习架构设计。文章从编排原语、Rollout 缓存、权重同步、陈旧性管理、局部 Rollout、LoRA 支持及分布式训练后端七个维度进行横向对比,指出 Ray 编排与 NCCL 广播为主流方案,而 MoE 专家并行与适配器同步正成为关键差异点。

3月9日周一
  1. Hugging Face76

    Hugging Face 发布具身智能框架 LeRobot v0.5.0

    Hugging Face 正式发布开源机器人学习框架 LeRobot v0.5.0,新增宇树 Unitree G1 全身人形机器人支持与多款机械臂适配。新版本集成了 Pi0-FAST 自回归 VLA 策略与实时分块推理技术,并推出流式视频实时编码以消除数据采集等待。此外,更新还带来了用于直接从 Hub 加载仿真环境的 EnvHub,并接入了 NVIDIA IsaacLab-Arena。

    推荐理由:该版本将开源机器人框架扩展至人形机器人与自回归模型,大幅降低了硬件适配与仿真训练的接入门槛。

3月5日周四
  1. Hugging Face56

    NXP 详解机器人 VLA 嵌入式端侧部署:涵盖数据采集、微调与芯片优化

    NXP 分享了将视觉语言动作(VLA)模型部署到 i.MX 95 嵌入式 SoC 的全流程实践指南。数据采集阶段强调固定机位、夹爪相机视角以及包含 20% 失败恢复样本的设计,微调方案覆盖了 ACT 与 SmolVLA。在部署优化上,通过将网络拆解为编码器与动作专家、对去噪流保留高精度的混合量化,并引入执行与计算并行的异步推理,使 ACT 模型推理延迟从 2.86 秒降低至 0.32 秒。

  2. Hugging Face74

    Hugging Face 推出 Modular Diffusers 可复用模块化流水线

    Hugging Face 推出 Modular Diffusers,允许开发者通过组装独立且可复用的积木模块构建定制扩散模型流水线。每个模块拥有独立的输入输出与计算逻辑,支持单独运行或动态替换,并通过 ComponentsManager 统一调度显存。该机制还推出了支持跨仓库引用的 Modular Repository,并深度集成了节点式可视化界面 Mellon。

    推荐理由:Diffusers 通过可插拔积木降低了复杂工作流的定制门槛,开发者可以在代码与可视化节点中无缝复用组件。

2月20日周五
  1. Hugging Face81

    GGML 与 llama.cpp 团队加入 Hugging Face

    GGML 与 llama.cpp 团队宣布正式加入 Hugging Face,双方将合作推进本地 AI 与端侧推理技术。Georgi Gerganov 团队将继续全职维护 llama.cpp 并保持技术方向与社区治理的完全自主,项目保持 100% 开源。后续双方将重点实现从 Transformers 库向 llama.cpp 的近乎一键式模型交付,并优化 GGML 生态的打包与部署体验。

    推荐理由:这标志着开源模型生态与端侧推理核心基础设施深度绑定,有助于消除新模型从定义到本地运行的技术断层。

2月18日周三
  1. Hugging Face78

    Gradio 6 增强 gr.HTML 组件:支持单文件一键构建交互式 Web 应用

    Gradio 6 为 gr.HTML 组件引入了自定义模板、作用域 CSS 和 JavaScript 交互支持,允许前沿大语言模型在单个 Python 文件内一次性生成包含前后端和状态管理的完整应用。

    推荐理由:原文展示了基于三模板构建自定义组件与状态同步的机制,开发者可直接参考该模式简化单文件原型构建。

2月6日周五
  1. Hugging Face60

    SyGra 2.0.0 推出可视化合成数据生成环境 SyGra Studio

    ServiceNow 旗下开源工具 SyGra 2.0.0 正式推出可视化环境 SyGra Studio,将合成数据生成转换为交互式画布操作。用户可直接在画布中配置模型与数据源、实时预览样本数据,并借助提示词变量提示、断点调试和 Monaco 编辑器完成端到端流编排。所有画布操作均会自动同步生成 SyGra 图配置与执行脚本,并支持实时监控运行延迟与 token 成本。

    推荐理由:文章展示了如何通过画布拖拽与实时预览替代传统配置,适合需要构建定制合成数据流水线的工程团队参考。

2月3日周二
  1. Hugging Face52

    全球开源 AI 生态的未来:从 DeepSeek 到 AI+

    Hugging Face 发布 DeepSeek 系列回顾的第三篇,分析了中国 AI 组织在 2025 年以开源为默认策略形成自组织生态的演进路径。阿里巴巴 Qwen 在 Hugging Face 上的衍生模型超过 11.3 万个,腾讯、字节跳动、百度及月之暗面等团队也纷纷加速开源核心能力或转变路线,推动 AI 从孤立的单一突破走向深层工业流程和智能体交付。

1月27日周二