跳到正文

教程实践

拿来就能用的实操内容:提示词技巧、工作流搭建、工具用法与踩坑经验。

最新精选

第 21–40 条 · 共 82 条
3月21日周六
  1. Hugging Face61

    如何在一天内微调领域专属 Embedding 模型

    NVIDIA 推出一套端到端 Embedding 模型微调方案,利用单张 80GB GPU 和 NeMo 工具链,可在一天内将通用模型适配到垂直领域。该流程使用 LLM 自动生成包含多跳推理的合成数据并挖掘难负例,微调 Llama-Nemotron-Embed-1B-v2 后可直接导出 TensorRT 引擎并接入 NIM 部署。

    推荐理由:教程提供了一套从无标注文档自动生成问答对到难负例挖掘的完整方案,有助于开发者低成本提升垂直领域检索召回率。

3月19日周四
  1. OpenAI65

    OpenAI 如何监控内部编码智能体的对齐失范问题

    OpenAI 介绍了如何利用思维链监控来研究内部编码智能体的对齐失范问题。该方法通过分析真实部署环境中的行为来检测潜在风险,进而强化 AI 安全防护机制。

    推荐理由:文章阐述了在内部编码智能体实际部署中利用思维链监控对齐失范的方法,为智能体安全防线建设提供了实践参考。

3月11日周三
  1. OpenAI61

    OpenAI 谈如何设计抵御提示词注入的 AI 智能体

    OpenAI 阐述了 ChatGPT 抵御提示词注入与社会工程攻击的安全设计思路。系统主要通过在智能体工作流中限制高风险操作,并严格保护敏感数据来防范潜在攻击。

    推荐理由:文章介绍了智能体防御提示词注入的防护思路,读者可据此参考在工作流中限制高风险操作与保护敏感数据的方法。

  2. OpenAI72

    从模型到智能体:OpenAI 为 Responses API 配备计算机运行环境

    OpenAI 介绍了如何利用 Responses API、shell 工具和托管容器构建智能体运行时。该方案支持智能体在包含文件、工具和状态的环境中安全且可扩展地执行任务。

    推荐理由:原文阐述了结合容器与命令行工具扩展 API 的方案,为开发者构建带状态与文件支持的智能体运行时提供了架构参考。

2月20日周五
2月4日周三
  1. OpenAI68

    OpenAI 详解 Codex 运行框架:如何构建 App Server

    OpenAI 介绍了如何通过 Codex App Server 嵌入 Codex 智能体,并解析了其底座的构建方式。该服务采用双向 JSON-RPC API,可支持流式进度呈现、工具调用、审批以及代码 diff 等功能。

    推荐理由:文章介绍了通过双向 JSON-RPC API 嵌入代码智能体的方案,为开发者集成智能体运行环境提供了接口设计参考。

1月23日周五
  1. OpenAI64

    OpenAI 详解 Codex 智能体循环机制与架构

    OpenAI 深入解析了 Codex 智能体的循环运行机制,说明 Codex CLI 如何借助 Responses API 编排模型、工具、提示词并优化性能。该内容展示了代码智能体在底层调用与任务调度上的工程实现细节。

    推荐理由:原文解析了 Codex CLI 编排循环机制,开发者可据此了解基于 Responses API 搭建代码智能体的工程实现。

1月22日周四
  1. OpenAI61

    OpenAI 扩展 PostgreSQL 支撑 8 亿 ChatGPT 用户

    OpenAI 深入介绍了如何扩展 PostgreSQL 架构以支撑 8 亿 ChatGPT 用户。通过引入数据库副本、缓存、限流以及工作负载隔离等手段,系统成功实现了每秒数百万次查询的处理能力。

    推荐理由:文章公开了支撑 8 亿用户的数据库架构细节,展示了利用副本、缓存与工作负载隔离应对高并发的可迁移工程经验。

1月5日周一
10月30日周四
  1. Hugging Face68

    MiniMax 解读 M2 智能体对齐:交错思考与全轨迹泛化

    MiniMax 团队复盘了 M2 模型的后训练 Agent 对齐经验,提出智能体泛化不仅是增加工具种类,更要适应全操作空间扰动。团队指出单次前置思考无法应对外部环境变化,M2 采用在任务全流程随时触发的交错思考机制,以维持长程连贯性。官方提醒开发者在调用 M2 时必须保留包含思考步骤的完整会话上下文,避免因丢弃思维链导致性能下降。

    推荐理由:团队复盘了基准高分与现实失效的断层,提出将交错思考与全轨迹扰动训练结合以提升通用鲁棒性。

8月18日周一
7月31日周四
  1. Hugging Face68

    用 Python 实现 MCP 服务器:基于 Gradio 构建 AI 试衣助手

    Hugging Face 介绍了通过 Gradio 的 MCP 集成在 Python 中快速搭建 MCP 服务器的方法,只需在 launch() 中设置 mcp_server=True 即可将应用端点自动转换为 LLM 工具。

    推荐理由:展示了如何用 Gradio 将 Python 函数与 Hugging Face 空间封装为 MCP 服务,适合需要为 Agent 接入多模态工具的开发者参考。

7月23日周三
7月10日周四
6月19日周四
  1. Hugging Face77

    在消费级硬件上用 QLoRA 微调 FLUX.1-dev 指南

    Hugging Face 推出在消费级硬件上微调 FLUX.1-dev 的实践方案,通过 QLoRA 将峰值显存占用控制在 10 GB 以内。该方法仅微调 Transformer 主干,结合 4-bit 量化、8-bit AdamW、梯度检查点以及预先缓存文本嵌入和 VAE 潜变量,在 RTX 4090 上耗时约 41 分钟完成 700 步风格训练。

    推荐理由:原文给出了在消费级显卡上将显存压至 10 GB 以内的配置方案,读者可以直接参考其中的缓存与量化组合跑通本地微调。

6月12日周四
  1. Hugging Face62

    5 分钟上手 Hugging Face Kernel Hub

    Hugging Face 推出 Kernel Hub 及配套 kernels 库,支持开发者通过单行代码直接拉取并加载预编译的硬件优化计算算子。该工具能自动匹配 Python、PyTorch 和 CUDA 版本并下载二进制文件,避免了 FlashAttention 或 Triton 算子本地编译与环境依赖的繁琐流程。

    推荐理由:提供了免去本地复杂编译而直接按需加载预编译算子的完整流程,读者可借此评估如何快速降低大模型底层的部署加速门槛。

5月21日周三
  1. Hugging Face62

    Diffusers 多种量化后端实践与性能对比

    Hugging Face 详细介绍了在 Diffusers 中使用 bitsandbytes、torchao、Quanto、GGUF 以及 FP8 分层类型转换等多种量化后端的方法,并以 FLUX.1-dev 模型实测了显存与速度表现。

    推荐理由:原文横向对比了五种量化后端在 Flux-dev 上的显存占用与推理耗时,读者可以据此为扩散模型选择适合的部署优化方案。

4月30日周三
  1. Hugging Face66

    深入解析 Qwen-3 对话模板带来的 4 个关键设计变化

    Qwen-3 采用了相比前代更加复杂的 Jinja 对话模板,展示了针对推理与智能体工作流的多项底层设计演进。模板通过 enable_thinking 参数实现链式推理的自由开关,并引入滚动检查点机制在多步工具调用中按需保留或裁剪思考标记。此外,Qwen-3 改进了工具参数的 JSON 序列化检查并去除了默认系统提示词。

    推荐理由:原文通过拆解对话模板的工程实现,展示了推理模型在工具调用与思考上下文管理上的演进思路。

4月25日周五
  1. Hugging Face76

    Hugging Face 展示如何用 50 行代码基于 MCP 构建轻量智能体

    Hugging Face 开源了 `@huggingface/mcp-client` 包并撰文展示如何基于模型上下文协议(MCP)用 50 行 TypeScript 代码构建轻量 AI 智能体 Tiny Agents。

    推荐理由:文章拆解了如何将 MCP 客户端与大模型工具调用结合,通过简短的循环逻辑实现智能体控制流,适合开发者搭建轻量级智能体架构。