跳到正文

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

最新精选

第 21–40 条 · 共 97 条
6月1日周一
  1. OpenAI67

    OpenAI 在密歇根州动工建设 1GW Stargate 数据中心

    OpenAI 宣布在密歇根州动工建设 1GW 数据中心项目,该项目是 Stargate 计划的一部分。该基础设施旨在扩大 AI 算力访问规模,同时为当地创造就业机会并支持社区发展。

    推荐理由:该项目作为 Stargate 计划的一部分推进了吉瓦级算力建设,读者可以借此了解前沿 AI 基础设施的落地规模与选址动向。

  2. OpenAI66

    OpenAI 前沿模型与 Codex 正式上线 AWS

    OpenAI 宣布其前沿模型与 Codex 已在 AWS 全面正式可用。企业客户可直接沿用现有的 AWS 环境、安全管控以及采购工作流程接入 OpenAI 模型,从而加快从模型评估到生产落地的推进速度。

    推荐理由:企业可直接复用现有 AWS 环境与采购流程接入 OpenAI 前沿模型和 Codex,降低了云基础设施集成门槛。

5月27日周三
  1. Hugging Face70

    开源机器人 Reachy Mini 实现全本地语音对话运行

    Hugging Face 推出完全本地化运行的 Reachy Mini 机器人语音交互方案,音频无需上传云端服务器即可完成实时对话。该方案依托 speech-to-speech 级联流水线,默认组合 Silero VAD、Parakeet-TDT 0.6B v3 语音识别、Qwen3-TTS 语音合成,并支持通过 llama.cpp、vLLM 或 MLX 本地驱动 LLM。

    推荐理由:提供了基于开源级联流水线搭建低延迟端到端语音交互的完整方案,读者可以据此将本地语音闭环迁移至各类机器人与端侧设备。

5月19日周二
5月18日周一
4月28日周二
4月23日周四
4月8日周三
3月27日周五
  1. Hugging Face69

    Hugging Face 发布 OpenClaw 开源模型迁移指南

    Hugging Face 推出 OpenClaw 等开源智能体的模型迁移指南,帮助受 Anthropic 访问限制影响的用户切换至开源模型。方案提供两条路径,用户可通过 Hugging Face Inference Providers 调用 GLM-5 等云端模型,也可结合 llama.cpp 本地运行 Qwen3.5-35B-A3B 以实现零 API 成本和数据隐私。

    推荐理由:文章给出了将智能体迁移至托管开源接口与本地运行的具体配置,为受闭源限制的用户提供了替代方案。

3月21日周六
  1. Hugging Face61

    如何在一天内微调领域专属 Embedding 模型

    NVIDIA 推出一套端到端 Embedding 模型微调方案,利用单张 80GB GPU 和 NeMo 工具链,可在一天内将通用模型适配到垂直领域。该流程使用 LLM 自动生成包含多跳推理的合成数据并挖掘难负例,微调 Llama-Nemotron-Embed-1B-v2 后可直接导出 TensorRT 引擎并接入 NIM 部署。

    推荐理由:教程提供了一套从无标注文档自动生成问答对到难负例挖掘的完整方案,有助于开发者低成本提升垂直领域检索召回率。

3月11日周三
  1. OpenAI72

    从模型到智能体:OpenAI 为 Responses API 配备计算机运行环境

    OpenAI 介绍了如何利用 Responses API、shell 工具和托管容器构建智能体运行时。该方案支持智能体在包含文件、工具和状态的环境中安全且可扩展地执行任务。

    推荐理由:原文阐述了结合容器与命令行工具扩展 API 的方案,为开发者构建带状态与文件支持的智能体运行时提供了架构参考。

3月10日周二
1月22日周四
  1. OpenAI61

    OpenAI 扩展 PostgreSQL 支撑 8 亿 ChatGPT 用户

    OpenAI 深入介绍了如何扩展 PostgreSQL 架构以支撑 8 亿 ChatGPT 用户。通过引入数据库副本、缓存、限流以及工作负载隔离等手段,系统成功实现了每秒数百万次查询的处理能力。

    推荐理由:文章公开了支撑 8 亿用户的数据库架构细节,展示了利用副本、缓存与工作负载隔离应对高并发的可迁移工程经验。

1月14日周三
12月11日周四
  1. Hugging Face75

    llama.cpp 新增模型管理功能支持多模型动态切换

    llama.cpp server 正式上线路由模式(router mode),支持在无需重启服务的情况下动态加载、卸载和在多个模型间切换。该功能采用多进程架构隔离运行各个模型,提供自动发现本地 GGUF 缓存、按需加载以及基于 LRU 策略自动卸载超额模型(默认最多常驻 4 个)等特性。

    推荐理由:llama.cpp 通过多进程架构与 LRU 机制实现动态模型管理,为本地部署与多模型切换提供了无需重启服务的轻量化方案。

11月20日周四
  1. OpenAI67

    OpenAI 与富士康达成合作,在美国设计制造下一代 AI 基础设施硬件

    OpenAI 与富士康达成合作,将在美国本土设计并制造下一代 AI 基础设施硬件。双方合作计划涵盖多代数据中心系统的研发,通过在美国本土生产关键组件强化供应链,以加速先进 AI 基础设施的建设部署。

    推荐理由:该合作展示了前沿 AI 机构直接介入底层硬件制造的动向,有助于观察本土算力供应链的落地进展。

10月29日周三
  1. Hugging Face62

    Hugging Face 分析:全球算力格局重塑与中国本土软硬件生态崛起

    受算力获取不确定性与美国出口管制影响,中国 AI 生态正加速转向本土芯片并以算法创新应对算力限制。华为昇腾、寒武纪与百度昆仑等国产硬件在 DeepSeek 等主流开源模型的推理与训练中逐步落地,同时催生了 MLA、GRPO 等架构与算法层面的算力效率突破;配合 FlagGems、TileLang 等软件栈替代方案,正逐步建立独立于英伟达 CUDA 的全栈技术闭环。

    推荐理由:原文系统梳理了外部出口管制如何倒逼算法效率优化与本土算力生态成型,有助于读者理解算力供给对全球开源路线的深层影响。

10月13日周一
  1. OpenAI78

    OpenAI 与博通达成战略合作,计划至 2029 年部署 10 吉瓦自研 AI 加速器

    OpenAI 与博通(Broadcom)达成多年期战略合作,计划到 2029 年部署 10 吉瓦由 OpenAI 设计的 AI 加速器。双方将联合开发下一代系统及以太网解决方案,以支持具备扩展能力的高能效 AI 基础设施。

    推荐理由:双方通过定制芯片与网络方案锁定长期算力规模,读者可据此评估头部机构自研硬件对基础设施格局的影响。

10月6日周一