跳到正文

图像生成

AI 画图的最前线:文生图模型迭代、图像编辑能力与创作工具生态的全部动态。

54条精选相关主题AI 视频多模态产品更新

最新精选

第 41–54 条 · 共 54 条
1月30日周一
  1. Hugging Face64

    Hugging Face 汇总计算机视觉生态现状与工具链支持

    Hugging Face 官方发文汇总其生态在计算机视觉领域的全套支持能力,目前已覆盖 8 项核心视觉任务、3000 多个模型和 100 多个数据集。平台在 Transformers、Diffusers 与 timm 中提供了统一的推理 Pipelines、Trainer 微调接口及零样本视觉模型,同时兼容卷积与 Transformer 架构。

    推荐理由:文章系统梳理了从模型微调到部署的计算机视觉工具链,读者可据此全面了解开源生态对主流视觉任务的接入方式。

1月26日周四
12月1日周四
  1. Hugging Face80

    在 Apple Silicon 上通过 Core ML 运行 Stable Diffusion 指南

    Hugging Face 提供了在 Apple Silicon 上使用 Core ML 运行 Stable Diffusion 的完整实战指南,并将预转换的模型权重托管至 Hugging Face Hub。该方案支持 CPU、GPU 及神经引擎等计算单元,适配 Python 与原生 Swift 推理,并在 M1 Max 设备上实现了 18 秒单张图像的生成速度。

    推荐理由:原文提供了将扩散模型适配至苹果硬件的完整步骤,开发者可直接复用代码在本地实现端侧推理加速。

11月7日周一
11月3日周四
10月13日周四
10月5日周三
  1. Hugging Face60

    rinna 发布 Japanese Stable Diffusion:面向日语文化的文生图模型

    rinna 正式发布日语文生图模型 Japanese Stable Diffusion,支持直接输入日语提示词生成符合日本文化与表达习惯的图像。该模型在约 1 亿带有日文说明的图文数据上微调,通过引入日语分词器并分阶段联合训练文本编码器与潜在扩散模型,模型与代码已在 Hugging Face 和 GitHub 开源。

    推荐理由:文章详细拆解了如何用两阶段微调将英文扩散模型迁移至小样本小语种,为本土化文生图适配提供了清晰方法。

9月12日周一
  1. Hugging Face84

    Hugging Face 发布 Diffusers 0.3,支持图生图与 Mac 本地推理

    Hugging Face 官方发布扩散模型库 Diffusers 0.3 版本,新增图生图、Textual Inversion、局部重绘流水线以及首版官方文档。新版本通过注意力切片技术将 Stable Diffusion 的显存占用降低至 3.2GB,支持苹果 M1/M2 芯片通过 PyTorch mps 运行,并加入了实验性 ONNX 导出支持。

    推荐理由:Diffusers 0.3 降低了 Stable Diffusion 的显存门槛并扩展到 Mac 平台,为本地部署和二次开发提供了标准化调用范式。

8月31日周三
8月22日周一
  1. Hugging Face88

    使用 Diffusers 运行与定制 Stable Diffusion

    Hugging Face 官方发文详解如何通过 Diffusers 库运行和定制文本生成图像模型 Stable Diffusion。模型基于潜在扩散架构,由 VAE、U-Net 与 CLIP 文本编码器组成,通过 64 倍空间压缩大幅降低了显存与计算开销。文章演示了基础推理流程、fp16 显存优化与参数调节,并展示了如何手动编写去噪循环与替换 K-LMS 调度器来实现自定义管线。

    推荐理由:文章详细拆解了潜在扩散模型的核心组件与推理流程,展示了如何通过模块化替换调度器实现自定义图像生成流水线。

7月20日周三
  1. OpenAI82

    OpenAI 图像生成工具 DALL·E 开启测试版并公布额度方案

    OpenAI 宣布 DALL·E 正式开启测试版,计划在接下来的数周内从候补名单中邀请 100 万名用户体验。用户可以使用每月自动充值的免费额度生成图像,并支持以 15 美元购买额外 115 次生成的点数。

    推荐理由:原文给出了测试资格发放规模和点数定价方案,读者可以据此了解其早期的测试节奏与计费模式。

6月7日周二
  1. Hugging Face75

    带注释的扩散模型:DDPM 核心原理与 PyTorch 逐步实现

    Hugging Face 发布扩散模型代码解析教程,使用 PyTorch 逐步实现经典 DDPM(去噪扩散概率模型)。教程结合数学公式拆解了前向加噪与反向去噪过程,并从零构建包含正弦位置编码、ResNet 块与注意力机制的 U-Net 网络。文中还展示了在 Fashion-MNIST 数据集上的完整训练与采样生成流程,梳理了扩散模型的核心运行逻辑。

    推荐理由:文章带代码拆解了 DDPM 的数学推导与 PyTorch 实现,读者可直接参考其模块构建扩散模型原型。

1月5日周二
7月9日周一
  1. OpenAI71

    OpenAI 推出可逆生成模型 Glow

    OpenAI 推出可逆生成模型 Glow,采用可逆 1x1 卷积简化了此前可逆生成模型的架构。该模型能够生成逼真的高分辨率图像,支持高效采样,并能提取可用于操控数据属性的特征。OpenAI 同步开源了模型代码并提供在线可视化工具。

    推荐理由:原文介绍了基于可逆卷积的生成模型 Glow 及其架构简化,读者可以了解基于流的生成模型与属性操纵方法。