Hugging Face 升级 datasets 流式加载功能,请求减少 100 倍且吞吐提速 2 倍
Hugging Face 宣布全面优化 datasets 库与 huggingface_hub 的流式读取功能,在大规模训练场景下将启动请求减少 100 倍,数据文件解析速度提升 10 倍,流式吞吐量提升最高 2 倍。
推荐理由:展示了如何通过持久化缓存与预取优化流式数据管道,帮助大规模模型训练摆脱本地磁盘空间与下载时延的瓶颈。
AI 产品与应用的功能上新、改版与商业化动态——谁家的产品变强了、变贵了、能用了。
Hugging Face 宣布全面优化 datasets 库与 huggingface_hub 的流式读取功能,在大规模训练场景下将启动请求减少 100 倍,数据文件解析速度提升 10 倍,流式吞吐量提升最高 2 倍。
推荐理由:展示了如何通过持久化缓存与预取优化流式数据管道,帮助大规模模型训练摆脱本地磁盘空间与下载时延的瓶颈。
Meta 与 Hugging Face 联合发布 OpenEnv Hub 及 OpenEnv 0.1 规范,为 AI 智能体构建标准化、具备沙箱隔离的安全运行环境。
推荐理由:原文明确了智能体沙箱环境的规范标准与共享平台,有助于开发者统一强化学习后训练与推理部署中的工具交互层。
OpenAI 推出 Company knowledge 功能,可将企业应用中的上下文接入 ChatGPT,生成带有清晰来源引用的业务专属回答。该功能提供安全、隐私保护以及管理员控制能力,现已面向 Business、Enterprise 和 Edu 用户正式开放。
推荐理由:官方说明了将外部应用上下文接入 ChatGPT 的新功能与权限控制,适合企业用户评估知识库工作流的集成方案。
Hugging Face 宣布与威胁情报平台 VirusTotal 展开合作,即日起对 Hugging Face Hub 上超过 220 万个公开模型与数据集仓库进行持续安全扫描。
推荐理由:原文展示了开源模型托管平台防范恶意权重的具体方式,读者可以了解开源供应链安全检测与隐私保护的结合方案。
OpenAI Codex 现已正式全面可用(GA),新增面向开发者的 Slack 集成与 Codex SDK。平台同时提供了用量仪表盘和工作区管理等管理员工具,便于团队在更大规模下使用与管理 Codex。
推荐理由:Codex 正式进入全面商用阶段,配套推出的 SDK 与工作区管理工具让团队规模化接入和用量监控变得更为直接。
OpenAI 宣布在 ChatGPT 内推出新一代可直接对话的应用,并同步推出处于预览阶段的全新 Apps SDK。开发者即日起可使用该 SDK 为 ChatGPT 构建应用。
Hugging Face 正式发布 Swift Transformers 1.0,面向苹果平台的端侧模型工具库正式进入稳定阶段。新版本将 Tokenizers 与 Hub 拆分为独立顶级模块,集成全新高速 swift-jinja 模板库,全面支持 Swift 6,并借助现代 Core ML API 优化有状态模型的键值缓存。
推荐理由:该版本将分词与下载模块解耦并支持现代苹果计算框架,便于开发者在端侧快速集成工具调用与本地推理能力。
OpenAI 为 ChatGPT 推出多项团队协作与工具支持功能。本次更新包含新增共享项目、更智能的连接器,以及合规与安全层面的改进,旨在协助团队提升协作效率。
OpenAI 面向移动端 Pro 用户推出 ChatGPT Pulse 预览版。Pulse 是一项主动式体验,能够根据用户的历史聊天、反馈以及日历等关联应用主动进行调研,并交付个性化更新。
推荐理由:该功能展示了 ChatGPT 从被动应答转向结合日历与历史对话主动调研的工作机制,有助于了解主动智能体体验的落地形态。
Hugging Face 正式发布机器人数据集格式 LeRobotDataset v3.0,旨在解决机器人学习扩展至数百万回合(episode)时的文件系统瓶颈。
推荐理由:新格式通过多片段打包合并与原生流式加载化解了百万级数据的单文件存储瓶颈,为具身智能训练提供了低门槛的大规模数据处理方案。
Together AI 与 Hugging Face 联合推出新功能,允许开发者直接利用 Together AI 基础设施微调 Hugging Face Hub 上的兼容大语言模型。用户只需选择官方模板模型作为硬件与配置基准,即可通过 API 对 100B 参数以内的 CausalLM 模型发起微调。该集成支持双向同步,不仅能拉取公开或私有仓库模型,还可在训练完成后自动将结果推回 Hub。
推荐理由:原文给出了利用预设模板微调任意社区模型的操作机制,读者可以据此降低自建训练集群的运维门槛。
Hugging Face 推出开源无代码数据集处理工具 AI Sheets,支持在类似电子表格的界面中直接调用 Hub 上的开源模型或本地模型来构建、清洗、转换和丰富数据集。
推荐理由:该工具通过类似电子表格的交互降低了调用开源模型清洗与丰富数据集的门槛,编辑单元格即可直接转换为少样本提示词。
Hugging Face 宣布 TRL 库全面支持视觉语言模型(VLM)对齐训练,新增对 MPO、GRPO 及 GSPO 算法的直接支持。更新还将 RLOO、Online DPO 与原生 SFT 扩展至多模态架构,并集成 vLLM 支持在线样本生成,配套提供了完整训练脚本与运行示例。
推荐理由:TRL 将 GRPO 与 MPO 等强化学习对齐方法标准化引入多模态模型,降低了多模态推理微调的工程落地门槛。
OpenAI 在 ChatGPT 中推出学习模式(study mode)。该功能通过提问、分步引导和即时反馈协助学生逐步拆解并解决问题,以实现更深层次的学习。
Hugging Face 推出开源免费的轻量机器学习实验追踪 Python 库 Trackio,提供本地 Gradio 可视化看板并支持同步至 Hugging Face Spaces。
推荐理由:它兼容 wandb 语法且能将指标同步至 Spaces,为需要轻量且免云端绑定的训练追踪提供了低迁移成本方案。
Hugging Face 宣布将官方命令行工具从 huggingface-cli 正式更名为 hf,并随 huggingface_hub 0.34.0 发布。新版本采用 hf <resource> <action> 的统一语法结构,并保留 upload 与 download 为常用根命令,旧指令目前仍完全可用并附带迁移警告。
推荐理由:原文给出了命令行语法变动与兼容规则,开发者可以据此更新本地终端习惯和自动化脚本。
NVIDIA NIM 推出统一 Docker 容器方案,支持快速部署与加速 Hugging Face 上的 100,000 多个大语言模型。该容器支持 Hugging Face Safetensors、GGUF 及 TensorRT-LLM 权重格式,可自动识别模型架构与量化方式,并在 TensorRT-LLM、vLLM 和 SGLang 后端间自动匹配最优推理配置。
推荐理由:通过单一容器整合多种推理后端与量化格式自动适配,开发者可大幅降低在私有环境中测试和部署开源大模型的工程门槛。
OpenAI 推出 ChatGPT agent,具备思考与行动能力。该智能体能够在用户指导下使用各类工具,完成研究调研、预订机票酒店以及制作幻灯片等实际任务。
Gradio 在 5.38.0 版本中为 MCP 服务器功能推出五项核心更新,全面提升 AI 智能体与工具调用的交互体验。新版本引入了文件上传辅助服务以支持本地文件直接传入,支持流式传输实时进度通知,并提供 gr.load_openapi 实现一行代码将 OpenAPI 规范转为 MCP 服务器。此外,更新还新增了通过 gr.Header 自动提取请求头鉴权信息的能力,并允许开发者自定义工具描述。
推荐理由:更新简化了开发者将现有 API 和本地文件接入 MCP 生态的工程流程,有助于降低智能体工具调用的构建成本。
Hugging Face 宣布 Hub 底层存储正在从 Git LFS 全面迁移至自研的 Xet 架构,已有 50 万个仓库共 20 PB 数据完成迁移。系统通过 Git LFS Bridge 和全天候后台迁移进程保障向后兼容,用户无需修改现有工作流即可正常读写。官方表示将向所有用户开放 Xet、默认启用新架构并推进协议与全套基础设施的开源。
推荐理由:文章拆解了从 Git LFS 平滑迁移到自研存储架构的技术方案,对海量模型和数据集的存取与迁移实践有直接参考价值。