Meta 正式发布开源大语言模型 Llama 3,Hugging Face 全面集成上线
Meta 正式发布开源大语言模型 Llama 3,提供 8B 和 70B 两个尺寸的基础版与指令微调版,并同步推出安全模型 Llama Guard 2。模型在超过 15 万亿模型 token 上训练,词表扩展至 128,256,上下文窗口为 8k context,8B 版本增加了分组查询注意力(GQA)。
推荐理由:原文梳理了模型架构参数与词表变化,并给出了在开源框架下进行推理部署和单卡微调的完整代码。
新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。
Meta 正式发布开源大语言模型 Llama 3,提供 8B 和 70B 两个尺寸的基础版与指令微调版,并同步推出安全模型 Llama Guard 2。模型在超过 15 万亿模型 token 上训练,词表扩展至 128,256,上下文窗口为 8k context,8B 版本增加了分组查询注意力(GQA)。
推荐理由:原文梳理了模型架构参数与词表变化,并给出了在开源框架下进行推理部署和单卡微调的完整代码。
Hugging Face 发布开源多模态模型 Idefics2,参数量为 8B 并采用 Apache 2.0 协议开源。该模型在原生分辨率与长宽比下处理图像,增强了 OCR 与图表文档理解能力,在视觉问答基准测试中表现可比拟更大体量的模型。
推荐理由:该模型在保持 8B 轻量参数的同时公开了完整的多模态微调数据集,为社区微调多图与文档理解应用提供了完整可复用的技术路径。
Google 联合 Hugging Face 上线开源代码模型系列 CodeGemma,包含专攻代码填充的 2B 基础模型、7B 基础模型以及 7B 对话微调模型。
推荐理由:原文给出了 2B 与 7B 版本在代码补全与基准测试中的表现,开发者可直接参考其 FIM 提示词格式与消费级显卡部署方案。
OpenAI 分享了用于生成自定义声音的模型 Voice Engine 的小规模预览经验,探讨合成声音带来的挑战与机遇。
BigCode 联合开源了新一代代码大语言模型 StarCoder2 及代码预训练数据集 The Stack v2,并同步公开所有模型权重、数据集、处理与训练代码。
推荐理由:BigCode开源了代码大语言模型StarCoder2及高质量预训练数据集The Stack v2,覆盖从3B到15B参数规模并公开全部训练细节。
Google 正式发布开源大语言模型家族 Gemma,Hugging Face 同步宣布全面集成并上线模型 Hub。Gemma 提供 2B 与 7B 两种参数规模,均包含基础模型与指令微调版本,支持 8K 上下文窗口且可在消费级硬件上运行。Transformers 4.38 已支持该系列模型的推理加速与 4-bit 量化,并提供 Google Cloud 一键部署和 TRL 单卡微调方案。
推荐理由:文章梳理了 Gemma 模型的参数规格与基准表现,并给出了在消费级显卡上通过 Transformers 和 TRL 部署微调的实现路径。
OpenAI 推出视频生成模型 Sora,能够在不同时长、分辨率和宽高比的视频与图像上联合训练文本条件扩散模型。Sora 采用处理时空 patch 的 Transformer 架构,可生成长达 1 分钟的高保真视频,表明扩展视频生成模型是构建物理世界通用模拟器的可行路径。
推荐理由:文章提出了将时空 patch 与 Transformer 结合的扩散架构,展现了通过规模扩展构建通用物理世界模拟器的技术路径。
Segmind 发布开源框架 SegMoE,支持将多个预训练扩散模型组合为稀疏混合专家(MoE)架构,并同步推出 SegMoE-4x2、2x1 和 SD 4x2 三款模型。
推荐理由:该项目展示了如何通过混合专家架构拼接已有扩散模型,为无需从头训练而扩展图像生成能力提供了落地参考。
Hugging Face 开源了非扩散文生图模型 aMUSEd,采用掩码图像建模(MIM)架构并开源了完整代码与权重。该模型总参数量约 800M,推理步骤更少且原生支持零样本图像修复,已完整集成进 diffusers 库。模型在 8-bit Adam 和 float16 下微调显存低于 11GB,采用 LoRA 时可进一步降至 7GB。
推荐理由:原文提供了基于掩码图像建模的非扩散文生图方案与推理代码,便于开发者探索小参数量下的快速图像生成。
Hugging Face 宣布全面集成 Mistral 发布的开源 MoE 模型 Mixtral 8x7B,并在 Hub、Transformers 及 TGI 中提供完整支持。
推荐理由:文章系统梳理了该 MoE 模型的显存配置要求与量化部署路径,为开源模型的低成本微调及工程落地提供了参考。
Hugging Face 联合团队发布 LCM-LoRA 并在 Diffusers 库完成集成,可将 SDXL 与 Stable Diffusion 的生成步数缩减至 4 到 8 步。
推荐理由:通过训练轻量 LoRA 即可将扩散模型步数缩减至 4 步,无需完整蒸馏即可直接套用至各种微调模型。
OpenAI 在 DevDay 开发者大会上发布 GPT-4 Turbo,支持 128K 上下文窗口且调用价格更低。本次更新还同步推出了 Assistants API、具备视觉理解能力的 GPT-4 Turbo with Vision 以及 DALL·E 3 API 等多项开发者工具。
推荐理由:OpenAI 在 DevDay 发布支持 128K 上下文且价格更低的 GPT-4 Turbo 与 Assistants API,集中更新了模型与开发者工具。
Hugging Face 与 T2I-Adapter 作者合作在 diffusers 中正式支持面向 SDXL 的 T2I-Adapter,并开源了线稿、素描、Canny、深度和 OpenPose 等条件控制权重。
推荐理由:原文详细对比了适配器与ControlNet的参数及计算差异,为轻量化图像生成控制提供了具体实现与配置参考。
TII 正式在 Hugging Face 推出开源大语言模型 Falcon 180B,包含基础版与聊天版,拥有 1800 亿参数。该模型基于 RefinedWeb 等 3.5 万亿 token 预训练,规模达 Llama 2 的 2.5 倍,在 MMLU 等基准测试中超越 Llama 2 70B 与 GPT-3.5。
推荐理由:文章提供了 180B 超大开源模型的评测基准成绩以及量化部署所需的显存配置细节。
Hugging Face 宣布在 Hub、Transformers 4.33 和 TGI 等生态组件中全面支持 Meta 发布的代码大模型 Code Llama。
推荐理由:文章梳理了代码大模型 Code Llama 的规格特性与填充机制,并提供了在开源框架下量化部署与调用的具体范式。
Hugging Face 推出开源视觉语言模型 IDEFICS,该模型是对 DeepMind 闭源 Flamingo 的公开复现,支持图文交错序列输入并输出连贯文本。
推荐理由:该模型完整复现了闭源 Flamingo 的图文交错输入能力并开源训练数据,为多模态模型研究提供了透明的基础底座。
Meta 发布开源大语言模型家族 Llama 2,涵盖 7B、13B 和 70B 参数版本并开放商用许可,Hugging Face 同步提供全生态集成支持。该系列在初代基础上增加了 40% 预训练 token 并将上下文拓展至 4k tokens,经 RLHF 优化的 Llama 2-Chat 在多项基准上接近 ChatGPT 表现。
推荐理由:材料梳理了新模型相比初代的上下文与训练量升级,并提供了基于开源生态的推理部署与微调路径。
Hugging Face 与 ServiceNow 联合发起的 BigCode 项目正式发布 15B 参数的代码大语言模型 StarCoderBase 以及面向 Python 微调的 StarCoder。
推荐理由:原文详细披露了 15B 代码模型的训练数据清洗流程与评测对比,为开发者构建开源代码补全与技术助手提供了可迁移基准。
OpenAI 宣布推出大型多模态模型 GPT-4,支持图像和文本输入并生成文本输出。官方表示该模型是其深度学习扩展工作的最新里程碑,虽然在许多真实世界场景中表现仍不及人类,但在各项专业和学术基准测试中展现出人类水平。
推荐理由:OpenAI 推出支持图文输入的多模态模型 GPT-4,其在专业和学术基准上的表现展示了扩展深度学习的能力边界。
OpenAI 推出 GPT-4。该模型支持在创意与技术写作任务中与用户协同生成、编辑和迭代,涵盖创作歌曲、编写剧本以及学习用户的写作风格。