跳到正文

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

最新精选

第 41–60 条 · 共 97 条
9月23日周二
  1. OpenAI76

    OpenAI、Oracle 与软银新增五个 Stargate AI 数据中心选址

    OpenAI、Oracle 与软银联合宣布新增五个 Stargate AI 数据中心选址,加速推进规模达 $500B、电力容量达 10-gigawatt 的美国基础设施建设计划。该项目旨在为下一代 AI 提供算力支持,并预计将创造数万个就业岗位。

    推荐理由:该项目通过新增五个数据中心推进百吉瓦级基础设施布局,直观反映了前沿大模型对电力与算力基建的极高需求。

8月5日周二
  1. OpenAI76

    OpenAI 发布开源权重模型 gpt-oss-120b 与 gpt-oss-20b

    OpenAI 正式发布开源权重语言模型 gpt-oss-120b 与 gpt-oss-20b,采用 Apache 2.0 许可证。两款模型在同尺寸开源模型的推理任务中表现更优,具备强大的工具调用能力,并针对消费级硬件上的高效部署进行了优化。

    推荐理由:模型采用宽松开源协议并在消费级硬件优化部署,为开发者低成本构建兼具推理与工具调用能力的本地应用提供了参考。

7月25日周五
  1. Hugging Face63

    Hugging Face 官方 CLI 正式更名为 hf 并重构命令结构

    Hugging Face 宣布将官方命令行工具从 huggingface-cli 正式更名为 hf,并随 huggingface_hub 0.34.0 发布。新版本采用 hf <resource> <action> 的统一语法结构,并保留 upload 与 download 为常用根命令,旧指令目前仍完全可用并附带迁移警告。

    推荐理由:原文给出了命令行语法变动与兼容规则,开发者可以据此更新本地终端习惯和自动化脚本。

7月23日周三
7月22日周二
  1. OpenAI70

    OpenAI 联合 Oracle 扩建 4.5 GW Stargate 数据中心算力

    OpenAI 与 Oracle 达成合作协议,将在美国扩建 4.5 GW 的 Stargate 数据中心算力容量。该合作是 OpenAI 推进其 Stargate 人工智能基础设施平台的重要节点,旨在通过大规模基础设施投资创造就业并支持算力建设。

    推荐理由:OpenAI 与 Oracle 达成 4.5 GW 算力合作推进 Stargate 建设,为超大规模 AI 基础设施扩张提供了具体的电力与数据中心落地参考。

  2. Hugging Face62

    NVIDIA NIM 推出单容器部署方案,支持加速 Hugging Face 逾 10 万个大语言模型

    NVIDIA NIM 推出统一 Docker 容器方案,支持快速部署与加速 Hugging Face 上的 100,000 多个大语言模型。该容器支持 Hugging Face Safetensors、GGUF 及 TensorRT-LLM 权重格式,可自动识别模型架构与量化方式,并在 TensorRT-LLM、vLLM 和 SGLang 后端间自动匹配最优推理配置。

    推荐理由:通过单一容器整合多种推理后端与量化格式自动适配,开发者可大幅降低在私有环境中测试和部署开源大模型的工程门槛。

7月15日周二
  1. Hugging Face64

    Hugging Face Hub 将底层存储从 Git LFS 迁移至 Xet

    Hugging Face 宣布 Hub 底层存储正在从 Git LFS 全面迁移至自研的 Xet 架构,已有 50 万个仓库共 20 PB 数据完成迁移。系统通过 Git LFS Bridge 和全天候后台迁移进程保障向后兼容,用户无需修改现有工作流即可正常读写。官方表示将向所有用户开放 Xet、默认启用新架构并推进协议与全套基础设施的开源。

    推荐理由:文章拆解了从 Git LFS 平滑迁移到自研存储架构的技术方案,对海量模型和数据集的存取与迁移实践有直接参考价值。

7月10日周四
6月12日周四
  1. Hugging Face62

    5 分钟上手 Hugging Face Kernel Hub

    Hugging Face 推出 Kernel Hub 及配套 kernels 库,支持开发者通过单行代码直接拉取并加载预编译的硬件优化计算算子。该工具能自动匹配 Python、PyTorch 和 CUDA 版本并下载二进制文件,避免了 FlashAttention 或 Triton 算子本地编译与环境依赖的繁琐流程。

    推荐理由:提供了免去本地复杂编译而直接按需加载预编译算子的完整流程,读者可借此评估如何快速降低大模型底层的部署加速门槛。

5月21日周三
  1. Hugging Face62

    Diffusers 多种量化后端实践与性能对比

    Hugging Face 详细介绍了在 Diffusers 中使用 bitsandbytes、torchao、Quanto、GGUF 以及 FP8 分层类型转换等多种量化后端的方法,并以 FLUX.1-dev 模型实测了显存与速度表现。

    推荐理由:原文横向对比了五种量化后端在 Flux-dev 上的显存占用与推理耗时,读者可以据此为扩散模型选择适合的部署优化方案。

5月15日周四
  1. Hugging Face72

    Transformers 推进模型定义标准化:打造跨框架核心枢纽并打通多引擎生态

    Hugging Face 宣布将 Transformers 库定位为跨框架的核心枢纽,推进模型定义的标准化,使新增架构直接被下游生态通用支持。Transformers 目前已支持 300 多个模型架构,正与 vLLM、SGLang、TGI 等主流推理引擎合作作为后端运行,并深化与 llama.cpp 的 GGUF 格式互通及 MLX 的兼容。

    推荐理由:文章明确了统一模型规范在主流训练与推理引擎中的打通方式,有助于开发者评估跨框架迁移成本并规范新架构的接入路径。

4月9日周三
4月5日周六
3月27日周四
  1. Hugging Face84

    Hugging Face 发布 Open R1 第 4 期更新:详解 DeepSeek-V3 0324 表现与部署

    Hugging Face 梳理了新上架的 DeepSeek-V3 0324 模型,该版本改用 MIT 协议并在数学、代码与指令遵循能力上获得显著提升。基准测试中 AIME 提高至 59.4,LiveCodeBench 提高至 49.2,同时显著改善了前端开发与中文检索表现。

    推荐理由:原文汇总了新版模型在数学与代码上的评测表现,同时梳理了主流推理框架部署方案与开源运行安全规范。

3月7日周五
  1. Hugging Face68

    Hugging Face 发布通过 React Native 在手机端本地运行大模型的实操指南

    Hugging Face 发布了一份使用 React Native 在手机端离线运行大语言模型的实操指南,并开源了配套代码仓库 EdgeLLM。该方案基于 llama.rn 加载 GGUF 量化格式模型,支持在 iOS 和 Android 设备上直接下载并本地运行 DeepSeek-R1-Distill-Qwen-1.5B 等端侧小模型。

    推荐理由:教程给出了利用 React Native 和 llama.rn 在手机本地加载 GGUF 模型的完整工程实现,适合跨平台端侧开发参考。

1月27日周一
  1. Hugging Face77

    Diffusers 开源视频生成模型现状与显存优化指南

    Hugging Face 发布 Diffusers 开源视频生成模型现状综述与技术指南,系统梳理了 CogVideoX、HunyuanVideo 和 LTX-Video 等开源模型的架构设计与资源瓶颈。

    推荐理由:原文对比了主流开源视频模型的显存开销并给出优化方案,开发者可直接参考量化与分组卸载组合将大模型推断压至消费级显卡。

10月22日周二
10月10日周四
  1. Hugging Face74

    Gradio 5 安全审计报告

    Hugging Face 联合网络安全机构 Trail of Bits 完成了对 Gradio 5 的独立安全审计,并在 Gradio 5.0 正式发布前修复了全部已知漏洞。

    推荐理由:团队公开了第三方安全审计发现的四大类漏洞及修复细节,帮助开发者了解 Gradio 5 默认安全机制与生产部署风险。

10月9日周三
  1. Hugging Face76

    Gradio 5 正式发布:支持服务端渲染与低延迟流式传输,定位生产级机器学习应用

    Hugging Face 正式推出 Gradio 5 稳定版,将该框架升级为支持生产环境的机器学习 Web 应用开发工具。新版本引入服务端渲染(SSR)以实现瞬时首屏加载,并通过 WebSocket 与 WebRTC 优化低延迟音视频及文本流式传输。此外,Gradio 5 刷新了核心 UI 组件与内置主题,通过了第三方安全审计,并上线支持实时预览的实验性 AI Playground。

    推荐理由:介绍 Gradio 5 从原型工具走向生产级框架的关键变化,包含 SSR 渲染与低延迟流式传输等工程升级。