跳到正文

Hugging Face

Hugging Face 开源社区动态:热门模型与数据集、排行榜变化与开源生态的晴雨表。

最新精选

第 261–280 条 · 共 348 条
10月24日周二
  1. Hugging Face62

    Hugging Face 详解基于 PPO 的 RLHF 工程实现细节

    Hugging Face 研究团队复现了 OpenAI 2019 年的 RLHF 代码库,并发布了开源复现代码与工程实现细节清单。文章拆解了奖励模型归一化、拒绝采样、每步 KL 惩罚等机制,重点发现 PyTorch 与 TensorFlow 在 Adam 优化器公式实现上的差异会导致 PyTorch 在训练初期梯度更新过于激进,并在较大模型中引发严重的 KL 散度震荡。

    推荐理由:文章拆解了复现早期RLHF算法的核心工程细节,指出了PyTorch与TensorFlow优化器差异对训练稳定性的影响。

10月19日周四
10月3日周二
9月29日周五
  1. Hugging Face61

    如何通过 TRL 使用 DDPO 微调 Stable Diffusion 模型

    Hugging Face 在 TRL 库中集成了 DDPOTrainer,支持通过去噪扩散策略优化(DDPO)使用强化学习微调 Stable Diffusion 模型。该方法将去噪过程建模为多步马尔可夫决策过程,配合美学评分奖励模型提升生成质量。训练要求至少单张 A100 GPU,官方提供了配套脚本与 LoRA 超参数调优建议。

    推荐理由:文章给出了用强化学习对齐图像扩散模型的工程配置与调优经验,为改善生成画质提供了现成范式。

9月18日周一
  1. Hugging Face64

    3D Gaussian Splatting 入门解析:原理、优缺点与应用前景

    3D Gaussian Splatting 是一种通过离散三维高斯球实现逼真场景实时渲染的光栅化技术。其流程主要包括利用 SfM 提取点云、将点转化为高斯球、借助可微光栅化进行 SGD 优化,并通过自动化密集化与剪枝来细化结构。该方法具备实时渲染与快速训练的优势,但也面临高显存开销、大体积文件以及现有生产渲染管线兼容度低的挑战。

    推荐理由:文章梳理了 3D 高斯泼溅的光栅化原理与训练流程,并对比了它在实时渲染质量与显存开销之间的权衡。

9月15日周五
  1. Hugging Face69

    Hugging Face 发布大语言模型生产环境部署优化指南

    Hugging Face 发布生产环境下大语言模型推理与显存优化指南,系统梳理低精度量化、Flash Attention 与架构选型三大方向。文章通过实测展示 8-bit 和 4-bit 量化大幅削减显存需求,利用 Flash Attention 缓解长文本注意力的二次方显存瓶颈。

    推荐理由:文章给出了量化、Flash Attention 与架构演进的实测显存对比,读者可以直接作为大语言模型部署调优的参考框架。

9月12日周二
  1. Hugging Face61

    Transformers 原生量化方案对比:bitsandbytes 与 auto-gptq 性能基准与选型指南

    Hugging Face 对 Transformers 原生支持的 bitsandbytes 与 auto-gptq 进行了全面基准测试与对比。实测表明 bitsandbytes 无需校准数据集且跨模态兼容性好,适配器微调速度更优;auto-gptq 在文本生成推理速度和权重序列化上优势明显。官方建议可在微调阶段采用 bitsandbytes,合并权重后再通过 GPTQ 量化部署。

    推荐理由:文章提供了实测数据对比 bitsandbytes 与 GPTQ 在推理和微调上的表现,方便开发者选型量化方案。

9月8日周五
9月6日周三
  1. Hugging Face78

    TII 开源 1800 亿参数大模型 Falcon 180B 并上线 Hugging Face

    TII 正式在 Hugging Face 推出开源大语言模型 Falcon 180B,包含基础版与聊天版,拥有 1800 亿参数。该模型基于 RefinedWeb 等 3.5 万亿 token 预训练,规模达 Llama 2 的 2.5 倍,在 MMLU 等基准测试中超越 Llama 2 70B 与 GPT-3.5。

    推荐理由:文章提供了 180B 超大开源模型的评测基准成绩以及量化部署所需的显存配置细节。

8月30日周三
  1. Hugging Face61

    AudioLDM 2 推理加速指南:利用 Diffusers 将生成时间缩短至 1 秒内

    Hugging Face 介绍了在 Diffusers 库中加速文本生成音频模型 AudioLDM 2 的多项优化方案,成功将 10 秒音频样本的生成耗时从 14 秒缩短至 1 秒以内。

    推荐理由:文章系统梳理了扩散音频模型从调度器替换、编译到显存卸载的完整提速步骤,方法可直接复用到其他基于 Diffusers 的生成任务。

8月25日周五
8月23日周三
8月22日周二
  1. Hugging Face74

    Hugging Face 开源视觉语言模型 IDEFICS

    Hugging Face 推出开源视觉语言模型 IDEFICS,该模型是对 DeepMind 闭源 Flamingo 的公开复现,支持图文交错序列输入并输出连贯文本。

    推荐理由:该模型完整复现了闭源 Flamingo 的图文交错输入能力并开源训练数据,为多模态模型研究提供了透明的基础底座。

8月8日周二
  1. Hugging Face69

    Hugging Face 发布 Swift Transformers:支持在苹果设备端侧运行大语言模型

    Hugging Face 发布开源软件包 Swift Transformers,旨在为苹果生态开发者提供类似 Transformers 的 API,以在 Mac 等设备上通过 Core ML 运行端侧大语言模型。

    推荐理由:文章梳理了将大模型转换为 Core ML 的实操流程与工程避坑点,为苹果生态开发者提供了端侧部署语言模型的现成工具链。

7月27日周四
7月24日周一
  1. Hugging Face65

    Hugging Face 推出 Agents.js,支持在 JavaScript 中为大语言模型集成工具

    Hugging Face 推出开源库 Agents.js,允许开发者在浏览器或 Node.js 环境中通过 JavaScript 为大语言模型接入工具。该库开箱即用支持多种多模态工具,允许自由扩展自定义工具和模型,并通过 npm 包 `@huggingface/agents` 分发。官方同时提醒,因运行依赖动态执行模型生成的代码,在不可信环境中建议先通过代码生成接口审查内容后再行评估。

    推荐理由:该库为前端和 Node.js 开发者在 JavaScript 环境中调度多模态工具与大语言模型提供了轻量且可扩展的实现方案。

  2. Hugging Face62

    Hugging Face 联合 GitHub 等就欧盟 AI 法案发布立场文件:提出保护开源的五项建议

    Hugging Face 联合 GitHub、Eleuther AI、Creative Commons、LAION 和 Open Future 发布立场文件,呼吁欧盟《人工智能法案》(EU AI Act)充分考量开源机器学习的协作需求。

    推荐理由:这份联合建议展示了开源社区面对重大AI监管立法时,如何围绕代码托管免责、研发豁免和基础模型相称性争取合规边界。

7月18日周二
  1. Hugging Face96

    Meta 开源大语言模型 Llama 2,Hugging Face 提供全面集成支持

    Meta 发布开源大语言模型家族 Llama 2,涵盖 7B、13B 和 70B 参数版本并开放商用许可,Hugging Face 同步提供全生态集成支持。该系列在初代基础上增加了 40% 预训练 token 并将上下文拓展至 4k tokens,经 RLHF 优化的 Llama 2-Chat 在多项基准上接近 ChatGPT 表现。

    推荐理由:材料梳理了新模型相比初代的上下文与训练量升级,并提供了基于开源生态的推理部署与微调路径。

7月17日周一
  1. Hugging Face65

    Hugging Face 详解 AI WebTV 构建:基于开源视频与音乐模型的全自动直播管线

    Hugging Face 推出实验性演示项目 AI WebTV,通过整合开源生成模型展示端到端自动化视频流媒体直播的搭建方案。该方案使用 ChatGPT 扩写分镜提示词,调用 Zeroscope V2 两阶段生成并放大至 1024x576 分辨率视频,经 FILM 算法插帧平滑并混入 MusicGen 生成的配乐,最后通过 FFmpeg 将播放列表推流至 RTMP 服务器。

    推荐理由:原文串联了开源文生视频与音频模型及推流工具,为搭建自动化多媒体管线提供了完整的工程参考。