Hugging Face 为 HuggingChat 推出社区工具功能
Hugging Face 在 HuggingChat 中上线 Community Tools 功能,允许用户将平台上的任意公开 Space 转化为大语言模型可直接调用的外部工具。
推荐理由:原文展示了如何将公开 Space 转化为模型可调用的外部工具,为在对话界面中低成本集成多模态生成与私有知识检索提供了具体路径。
文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。
Hugging Face 在 HuggingChat 中上线 Community Tools 功能,允许用户将平台上的任意公开 Space 转化为大语言模型可直接调用的外部工具。
推荐理由:原文展示了如何将公开 Space 转化为模型可调用的外部工具,为在对话界面中低成本集成多模态生成与私有知识检索提供了具体路径。
Hugging Face 宣布 TRL 库正式支持视觉语言模型(VLM)的直接偏好优化(DPO),用于对齐人类偏好并减少多模态幻觉。教程以 Idefics2-8b 为例,结合 bfloat16 与 LoRA 技术将全量训练所需的 160GB 显存降低至 32.3GB,并在 AMBER 幻觉基准测试中改善了表现。目前该流程还兼容 Llava 1.5 与 PaliGemma 等主流模型。
推荐理由:原文给出了多模态模型进行偏好微调的显存计算与参数配置方案,便于开发者以单卡环境落地对齐训练。
Hugging Face 发布在 DocVQA 数据集上微调微软 Florence-2 视觉语言模型的实操指南,将验证集 Levenshtein 相似度从 0 提升至 57.0。教程通过冻结 DaViT 视觉编码器,使 0.2B 与 0.7B 模型能够在单张 A100 或 T4 GPU 等低算力环境下完成训练,并公开了 Colab 代码与在线 Demo。
推荐理由:教程展示了冻结视觉编码器在单卡环境微调小参数多模态模型的可行路径,为低算力条件下的文档问答任务提供了可迁移方案。
TII 正式推出第二代开源模型 Falcon 2 11B,包括基础大语言模型及集成了图像理解能力的 Falcon 2 11B VLM。该模型基于超过 5000B token 数据完成四阶段训练,上下文窗口扩展至 8192,在多语言与开源基准评测中综合表现比肩前代 Falcon-40B。
推荐理由:该系列以四分之一的参数量达到了前代 40B 的性能水准,同时补充了开源多模态能力以降低推理部署门槛。
Google 推出开源视觉语言模型 PaliGemma,由 SigLIP-So400m 图像编码器与 Gemma-2B 文本解码器通过线性投影层组合而成。该系列包含预训练、多任务混合与学术微调三种版本,提供 224x224、448x448 及 896x896 三种分辨率,支持图像描述、视觉问答、目标检测及指代分割等任务。
推荐理由:PaliGemma 结合了 SigLIP 图像编码器与 Gemma-2B 语言模型,文章详细拆解了其输入构建机制并提供了基于 Transformers 的全套微调代码。
OpenAI 宣布推出新旗舰模型 GPT-4 Omni(GPT-4o)。该模型具备跨音频、视觉和文本的实时推理能力。
推荐理由:模型将音频、视觉与文本整合进实时推理,读者可以据此了解主流旗舰模型在多模态交互上的演进方向。
Hugging Face 发布开源多模态模型 Idefics2,参数量为 8B 并采用 Apache 2.0 协议开源。该模型在原生分辨率与长宽比下处理图像,增强了 OCR 与图表文档理解能力,在视觉问答基准测试中表现可比拟更大体量的模型。
推荐理由:该模型在保持 8B 轻量参数的同时公开了完整的多模态微调数据集,为社区微调多图与文档理解应用提供了完整可复用的技术路径。
Hugging Face 发布视觉语言模型(VLM)技术指南,解析了主流多模态模型的架构组成与评测基准,并宣布 TRL 库的 SFTTrainer 开始提供 VLM 微调实验性支持。指南详细梳理了图像编码器、多模态投影层与文本解码器的组合原理,并提供了基于 transformers 的 LLaVA 推理以及使用 TRL 对 LLaVA 1.5 进行监督微调(SFT)的完整实现代码。
推荐理由:文章系统梳理了主流视觉语言模型的架构原理与选型指标,并提供了基于 TRL 进行微调的完整工作流代码。
Hugging Face 开源了多模态合成数据集 WebSight-v0.2,包含 200 万对网页截图与 HTML 代码,旨在训练模型将网页设计截图直接转换为可用代码。该版本引入了真实图片并改用 Tailwind CSS,同时展示了据此微调的视觉语言模型 Sightseer 的前端还原能力。目前数据集、技术报告与 Colab 演示均已对外开放。
推荐理由:通过构建结合真实图片与 Tailwind CSS 的两百万对合成数据,为设计稿转网页前端代码提供了标准化的多模态训练基准。
Hugging Face 发文梳理 AI 生成内容的水印与溯源技术,系统拆解图像、文本与音频三大模态的加水印机制与检测方案。文章对比了生成阶段直接嵌入与生成后标记两种实现路径,介绍了 Nightshade 数据投毒、Truepic C2PA 凭证、TGI 文本水印以及 AudioSeal 音频水印等工具。
推荐理由:梳理了图像、文本和音频生成内容的水印与检测机制,读者可以据此系统了解不同模态防伪溯源的工程实现方案。
OpenAI 推出视频生成模型 Sora,能够在不同时长、分辨率和宽高比的视频与图像上联合训练文本条件扩散模型。Sora 采用处理时空 patch 的 Transformer 架构,可生成长达 1 分钟的高保真视频,表明扩展视频生成模型是构建物理世界通用模拟器的可行路径。
推荐理由:文章提出了将时空 patch 与 Transformer 结合的扩散架构,展现了通过规模扩展构建通用物理世界模拟器的技术路径。
OpenAI 在 DevDay 开发者大会上发布 GPT-4 Turbo,支持 128K 上下文窗口且调用价格更低。本次更新还同步推出了 Assistants API、具备视觉理解能力的 GPT-4 Turbo with Vision 以及 DALL·E 3 API 等多项开发者工具。
推荐理由:OpenAI 在 DevDay 发布支持 128K 上下文且价格更低的 GPT-4 Turbo 与 Assistants API,集中更新了模型与开发者工具。
OpenAI 宣布 ChatGPT 推出视觉与语音能力,模型现已能够看、听和说话。
3D Gaussian Splatting 是一种通过离散三维高斯球实现逼真场景实时渲染的光栅化技术。其流程主要包括利用 SfM 提取点云、将点转化为高斯球、借助可微光栅化进行 SGD 优化,并通过自动化密集化与剪枝来细化结构。该方法具备实时渲染与快速训练的优势,但也面临高显存开销、大体积文件以及现有生产渲染管线兼容度低的挑战。
推荐理由:文章梳理了 3D 高斯泼溅的光栅化原理与训练流程,并对比了它在实时渲染质量与显存开销之间的权衡。
Hugging Face 推出开源视觉语言模型 IDEFICS,该模型是对 DeepMind 闭源 Flamingo 的公开复现,支持图文交错序列输入并输出连贯文本。
推荐理由:该模型完整复现了闭源 Flamingo 的图文交错输入能力并开源训练数据,为多模态模型研究提供了透明的基础底座。
Hugging Face 推出开源库 Agents.js,允许开发者在浏览器或 Node.js 环境中通过 JavaScript 为大语言模型接入工具。该库开箱即用支持多种多模态工具,允许自由扩展自定义工具和模型,并通过 npm 包 `@huggingface/agents` 分发。官方同时提醒,因运行依赖动态执行模型生成的代码,在不可信环境中建议先通过代码生成接口审查内容后再行评估。
推荐理由:该库为前端和 Node.js 开发者在 JavaScript 环境中调度多模态工具与大语言模型提供了轻量且可扩展的实现方案。
Hugging Face 推出实验性演示项目 AI WebTV,通过整合开源生成模型展示端到端自动化视频流媒体直播的搭建方案。该方案使用 ChatGPT 扩写分镜提示词,调用 Zeroscope V2 两阶段生成并放大至 1024x576 分辨率视频,经 FILM 算法插帧平滑并混入 MusicGen 生成的配乐,最后通过 FFmpeg 将播放列表推流至 RTMP 服务器。
推荐理由:原文串联了开源文生视频与音频模型及推流工具,为搭建自动化多媒体管线提供了完整的工程参考。
Hugging Face 官方发布博客全面梳理文本生成视频(Text-to-Video)模型的技术演进、核心瓶颈与工程实践。文章回顾了从早期 GAN 与 VAE、第二代 Transformer 架构到当前扩散模型的三代架构跃迁,剖析了时空一致性计算开销大与高质量配对数据稀缺等挑战。
推荐理由:文章系统梳理了从 GAN、Transformer 到扩散模型的文生视频技术演进与瓶颈,并提供了可直接复用的 Diffusers 代码范例。
OpenAI 宣布推出大型多模态模型 GPT-4,支持图像和文本输入并生成文本输出。官方表示该模型是其深度学习扩展工作的最新里程碑,虽然在许多真实世界场景中表现仍不及人类,但在各项专业和学术基准测试中展现出人类水平。
推荐理由:OpenAI 推出支持图文输入的多模态模型 GPT-4,其在专业和学术基准上的表现展示了扩展深度学习的能力边界。
Kakao Brain 联合 Hugging Face 开源了包含 7 亿图文对的 COYO 数据集,以及基于该数据集训练的 ViT 和 ALIGN 视觉语言模型。
推荐理由:原文对比了开源模型与原版 Google 实现的指标差异,并配套开源了 7 亿图文对训练集,对复现跨模态预训练具备参考价值。