Hugging Face 开源机器人库 LeRobot 发布 v0.6.0
Hugging Face 正式发布机器人学习库 LeRobot v0.6.0,重点补齐了从未来预测、效果评估到在线改进的机器人学习闭环。该版本引入 VLA-JEPA 与 FastWAM 等世界模型策略,新增 Robometer 等统一奖励模型 API,并整合了 6 个全新仿真评测基准。
推荐理由:更新补齐了世界模型策略、统一评测与在线纠偏部署工具,为具身智能开发者提供了从数据采集到闭环训练的可行工作流。
Hugging Face 正式发布机器人学习库 LeRobot v0.6.0,重点补齐了从未来预测、效果评估到在线改进的机器人学习闭环。该版本引入 VLA-JEPA 与 FastWAM 等世界模型策略,新增 Robometer 等统一奖励模型 API,并整合了 6 个全新仿真评测基准。
推荐理由:更新补齐了世界模型策略、统一评测与在线纠偏部署工具,为具身智能开发者提供了从数据采集到闭环训练的可行工作流。
SkyPilot 与 Hugging Face 联合推出 Hugging Face Storage 原生后端支持,开发者可通过 hf:// 统一路径将 Hub 上的模型、数据集和 Bucket 挂载到 20 多个云厂商的 GPU 任务中。
推荐理由:该功能让多云 GPU 集群能直接以零出网费读取 Hugging Face 数据,降低了分散调度算力时的跨云存储与传输开销。
Hugging Face 宣布在 Hub 上推出专用的 kernel 仓库类型,并对 🤗 Kernels 项目进行全面重构。新版本引入受信任发布者审核机制与基于 Sigstore cosign 的临时私钥代码签名,新增对 Torch Stable ABI 与 Apache TVM FFI 的跨框架支持。
Hugging Face 联合 Cerebras 推出基于 Gemma 4 的开源实时语音对话架构与演示,通过专用硬件加速解决语言模型的推理延迟瓶颈。该级联系统整合了 Nvidia Parakeet 语音识别、Cerebras 驱动的 Google DeepMind Gemma 4 31B 以及阿里 Qwen3TTS,各层均可自由修改替换。
推荐理由:该方案展示了模块化级联语音架构结合硬件加速降低长尾延迟的设计,为机器人与实时交互系统提供了全开源参考实现。
IBM Research 推出企业级 Java 跨框架迁移评测基准 ScarfBench,用于评估 AI Agent 在 Spring、Jakarta EE 与 Quarkus 之间迁移后是否能成功构建、部署并保持原有行为。
Hugging Face 宣布与 EvalEval 联盟的 Every Eval Ever(EEE)项目实现互通,将结构化评测结果直接展示在 Hub 模型主页及基准排行榜上。
Hugging Face 介绍了通过单条 CLI 命令在 HF Jobs 基础设施上一键启动私有 vLLM 服务的方法。用户使用 `hf jobs run` 搭配官方 Docker 镜像并暴露指定端口,即可获得兼容 OpenAI API 的私有端点并按秒计费,同时支持 SSH 远程调试与多卡张量并行。
推荐理由:通过容器端口代理与按秒计费机制,开发者无需搭建复杂集群即可快速拉起临时大模型端点进行评测与实验。
NVIDIA 推出开源库 NeMo AutoModel,基于 Hugging Face Transformers v5 引入专家并行、DeepEP 通信融合分发与 TransformerEngine 算子。
Treble Technologies 与 Hugging Face 联合推出首个开源远场语音识别评测榜单 FFASR Leaderboard,用于系统评估 ASR 模型在真实远场声学环境下的表现。
Hugging Face 团队公布了核心库 huggingface_hub 的自动化发版流水线,利用 GitHub Actions、OpenCode 与开源权重模型,将发版周期从 4 至 6 周压缩至每周一次。
推荐理由:文章给出了确定性代码校验结合模型初稿的工程范式,开源维护者可以直接迁移该流程来降低发版维护成本。
Google Chrome 团队与 Hugging Face 合作在 Transformers.js 中实验跨源存储 API 提案,通过内容哈希实现跨站点的模型权重与 Wasm 运行时共享。
PaddleOCR 推出新一代通用 OCR 模型家族 PP-OCRv6 并上线 Hugging Face,提供 tiny、small 和 medium 三种规格,参数量涵盖 1.5M 至 34.5M。
推荐理由:新模型将参数量控制在1.5M至34.5M并统一覆盖50种语言,为端侧设备到服务端管道的低成本OCR落地提供了灵活选型参考。
Hugging Face 工程师展示了如何利用本地开源模型自动分流 OpenClaw 仓库的 Issue 和 PR,在单台本地硬件上实现低成本的实时通知。
推荐理由:原文给出了用受限只读命令行配合本地模型做智能体分类的方案,为高吞吐信息分流提供了可落地的工程参考。
ServiceNow 等机构提出 MosaicLeaks 基准与 PA-DR 强化学习方法,评估并解决深度研究智能体在多跳检索中通过外部搜索查询累积泄露本地私有信息的“拼图效应”。
Hugging Face 提出了一套评估软件工具是否易于被编码智能体调用的基准测试方案并开源 agent-eval 工具,以 transformers 库为案例量化模型完成任务的全流程成本。
推荐理由:原文测试了面向 Agent 优化代码库的实际开销,揭示出增加命令行工具和 Skill 会提速大模型但可能使小模型准确率下降。
Hugging Face 在统一基准下对比了 PEFT 库中的多种参数高效微调方法,结果显示 LoRA 并非所有场景下的最优选择。在 Llama-3.2-3B 数学推理任务中,带稳定秩初始化的 LoRA 准确率达到 53.2%,而 Lily 达到 54.9%,LoRA-FA 则更加节省显存;在图像生成测试中,OFT 在相似度得分与显存占用上均优于 LoRA。
推荐理由:实测在统一硬件和基准下对比了多种高效微调技术,揭示了 LoRA 之外的帕累托最优解,为微调权衡提供了可迁移参考。
AWS 工程师在 Hugging Face 博客介绍了开源 SDK Strands Robots 与 LeRobot 的集成方案,实现了从仿真演示记录、策略推理到物理硬件部署的单一智能体工作流。
推荐理由:原文展示了统一数据集格式和智能体接口下的端到端流程,开发者只需切换一行配置即可将仿真策略无缝部署到实体机器人。
智谱推出新一代旗舰开源模型 GLM-5.2,采用 MIT 协议完全开源,原生支持 1M token 上下文,主打面向长流程(long-horizon)的软件工程与智能体任务。
推荐理由:GLM-5.2 将实用工程评测与 1M 上下文推理架构结合,为需要长时间自主运行的编码智能体提供了兼顾开源与高吞吐的落地参考。
Hugging Face 与 Microsoft、Google 等合作推出开放草案规范 Agentic Resource Discovery(ARD),并上线参考实现 Discover Tool,让 AI 智能体能在运行时动态搜索并调用外部工具与技能。
推荐理由:针对现有智能体依赖手动预装工具的痛点,该规范给出了运行时的统一发现层,便于在联邦注册表中动态检索扩展能力。
Hugging Face 深入分析了 PyTorch 中从 nn.Linear 到 MLP 模块的底层 GPU 执行机制。测试表明,nn.Linear 借助 GEMM epilogue 将偏置加法融入 cuBLAS 内核,权重转置仅在 CPU 上修改元数据。由于 eager 模式已默认调用 aten::addmm,torch.compile 对单个线性层几乎没有额外融合空间。
AI 智能体通过串联两个 Hugging Face Spaces 实现了从文本提示词到 3D 巴黎展馆的自动化构建与部署。Gradio Spaces 现均提供 agents.md 说明文件,智能体无需编写集成代码即可直接读取 API 规范并调用图像生成与 TripoSplat 3D 高斯泼溅重建服务。
推荐理由:文章展示了通过 agents.md 规范让智能体串联多个模型空间的方法,为跨模型自动化生成与工程组装提供了可直接复用的工作流。
Hugging Face 发布教程,介绍如何通过开源桥接工具 huggingface/jobs-actions 将 GitHub Actions 工作流接入 Hugging Face Jobs 运行环境。
推荐理由:原文给出了将 CI 任务派发到 HF Jobs 的完整配置链路和性能数据,读者可借此评估按需调用 GPU 跑 CI 的落地方案。
Hugging Face 宣布 OpenEnv 成立多方联合治理委员会,并将其明确为智能体强化学习环境的标准化互操作协议层。OpenEnv 基于客户端与服务端架构提供类 Gymnasium API,通过 HTTP、WebSocket 和 Docker 部署并原生兼容 MCP,不绑定具体的奖励计算逻辑。
推荐理由:原文阐述了 OpenEnv 作为环境互操作协议层的设计与多机构治理路线,为开源智能体训练提供了标准化的环境交互与部署方案。
NVIDIA 正式发布多模态安全模型 Nemotron 3.5 Content Safety 及开源训练数据集,将多模态输入联合评估、自定义策略与审计推理整合至单次推理。
推荐理由:该方案把多模态审查、自定义规则与紧凑推理集成在 4B 模型中,为企业构建低成本且可审计的内容风控提供了实践参考。
Hugging Face 宣布面向 Claude Code、Codex 等编码智能体重构官方命令行工具 hf CLI,新增针对 Agent 的自适应输出模式与配套 Skill。
推荐理由:官方通过环境自适应输出与紧凑指令设计,系统展示了命令行工具如何兼顾人类交互与模型调用的工程方案。
DharmaOCR 团队将 DPO 应用于结构化 OCR 任务,利用模型自身的失败输出构建拒绝偏好对,使测试模型族的文本退化率平均降低 59.4%。该训练阶段在所有测试模型中均有效降低了循环重复,峰值降幅达 87.6%(Nanonets-OCR2–3B 从 1.61% 降至 0.20%),通过整段级别的偏好信号弥补了 SFT 无法显式惩罚退化循环的结构性缺陷。
Reachy Mini 对话应用现支持通过 MCP 调用托管在公共 Hugging Face Spaces 上的工具,无需修改本地代码即可扩展机器人能力。远程工具直接在 Space 中运行且无需下载代码,官方已推出天气查询与网络搜索两款测试工具。用户可通过一条命令一键安装远程 Space,并在配置文件的 tools.txt 中管理启用状态。
H company 发布 Holo3.1 系列电脑操作模型,涵盖 0.8B、4B、9B 及 35B-A3B 四种尺寸,重点提升桌面、网页和移动端的跨环境鲁棒性与本地执行能力。新版本在 AndroidWorld 移动基准上表现提升明显,并新增对函数调用的原生支持;同时官方推出了 FP8、NVFP4 和 Q4 GGUF 等量化权重,支持在消费级硬件或本地网络中纯离线运行。
推荐理由:该系列通过量化权重和轻量尺寸将电脑操作智能体扩展至本地端侧,为注重隐私与低延迟的自动化工作流提供了可落地的开源模型方案。
JetBrains 正式发布开源混合专家模型 Mellum2,总参数量为 12B 且每个 token 仅激活 2.5B 参数,专注于文本与代码任务。该模型基于 Apache 2.0 许可证开源,官方测试称其比同尺寸模型推理速度提升 2 倍以上,适用于路由编排、RAG 流水线、子智能体及私有化部署等高吞吐工作负载。
推荐理由:该模型通过低激活参数量和高推理速度降低部署成本,为复杂系统中高频调用的路由与子智能体任务提供了轻量解法。
Hugging Face 发布 PyTorch 性能分析入门指南第一篇,通过矩阵乘加运算详解 torch.profiler 的用法与 trace 读取技巧。文章拆解了统计表与时序 trace 中的 CPU 与 GPU 耗时、冷启动开销、占用率查询与 cuBLAS 调度链路,并对比了 torch.compile 下的图级融合机制及 CPU 端额外调度开销。
Hugging Face 在 TRL 中推出了基于 Hub Bucket 的增量权重同步功能,解决了异步强化学习训练中每步向推理引擎同步全量模型的带宽与暂停开销。
推荐理由:利用低学习率下大量权重数值不变的特性,通过对象存储同步增量权重,为跨集群异步强化学习训练提供了低成本落地方案。
Hugging Face 推出完全本地化运行的 Reachy Mini 机器人语音交互方案,音频无需上传云端服务器即可完成实时对话。该方案依托 speech-to-speech 级联流水线,默认组合 Silero VAD、Parakeet-TDT 0.6B v3 语音识别、Qwen3-TTS 语音合成,并支持通过 llama.cpp、vLLM 或 MLX 本地驱动 LLM。
推荐理由:提供了基于开源级联流水线搭建低延迟端到端语音交互的完整方案,读者可以据此将本地语音闭环迁移至各类机器人与端侧设备。
Hugging Face 发布 AI 智能体核心术语指南,厘清当前行业中容易混淆的关键概念。文章将智能体系统解构为模型、定义行为的脚手架(Scaffolding)与驱动循环的执行层(Harness),指出智能体即为模型与执行层的结合。文中还系统界定了上下文工程、策略、技能、子智能体以及强化学习训练中的环境、Trainer、Rollout 与奖励机制。
推荐理由:文章厘清了脚手架与执行层等混淆概念,帮助开发者在构建与评测智能体时建立清晰的系统分层认知。
地球观测模型家族 OlmoEarth v1.1 正式推出,通过优化 token 序列长度与预训练方案,在保持与 OlmoEarth v1 相当性能的同时将计算成本最高降低 3 倍。该系列模型能显著加速微调与推理过程,让大范围卫星图像处理更加经济高效。目前官方已公开 Base、Tiny 与 Nano 模型的权重及训练代码。
Hugging Face 发布开源重排序模型家族 Ettin Reranker,覆盖从 17M 到 1B 共 6 种参数规模,并同步开源约 1.43 亿条训练数据与完整训练代码。
推荐理由:该系列展示了点式 MSE 蒸馏与无填充注意力结合的工程收益,为检索排序系统的低延迟选型提供了详实参考。
PaddleOCR 3.5 正式接入 Hugging Face 生态,支持通过指定 engine 为 transformers 直接运行 PP-OCRv5 和 PaddleOCR-VL 1.5 等 OCR 与文档解析模型。
推荐理由:原文给出了在 Transformers 生态集成与原生静态图吞吐之间的选型权衡,有助于开发者按需调整文档预处理技术栈。
IBM 发布采用 Apache 2.0 协议的 Granite Embedding Multilingual R2 多语言嵌入模型,包含 97M 与 311M 两个版本并基于 ModernBERT 架构重构。
推荐理由:模型将上下文扩展至32K并支持代码检索,为多语言长文档检索与低成本向量检索提供了轻量级开源替代方案。
Hugging Face 详细阐述了在连续批处理中实现异步执行的机制,通过解耦 CPU 批次准备与 GPU 计算消除硬件等待间隙。方案基于非默认 CUDA 流、CUDA 事件同步、双槽位交替缓冲与 carry-over 掩码设计,并在共享内存池中复用 CUDA 图以控制显存开销。
Hugging Face 解析了在 AWS 基础设施上运行基础模型全生命周期的分层架构,重点探讨其与开源软件生态的集成。硬件层涵盖配备 NVIDIA H100、H200 的 EC2 P5 实例,以及搭载 Blackwell B200 和 B300 的 P6 实例。系统结合高带宽网络与分布式存储,通过 Slurm、Kubernetes 及 PyTorch、JAX 协同应对扩展瓶颈。
PipelineRL 在将推理引擎从 vLLM 0.8.5(V0)迁移至 0.18.1(V1)时,发现训练与推理不一致会导致 KL 散度与奖励等训练动态偏离。团队通过配置采样处理后的 logprobs、关闭前缀缓存与异步调度等运行时默认项、对齐在途权重更新路径以及在最终投影层使用 fp32 lm_head 四项修复,成功使 V1 训练轨迹与 V0 保持一致。