Google 发布 Gemma 2 2B、ShieldGemma 与 Gemma Scope
Google 正式扩展 Gemma 开源生态,发布了 2.6B 参数的端侧轻量模型 Gemma 2 2B、安全审核分类器 ShieldGemma 以及可解释性工具集 Gemma Scope。
推荐理由:原文提供了三款新资产的具体参数规格与部署代码,读者可以据此评估端侧部署与安全审核方案。
新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。
Google 正式扩展 Gemma 开源生态,发布了 2.6B 参数的端侧轻量模型 Gemma 2 2B、安全审核分类器 ShieldGemma 以及可解释性工具集 Gemma Scope。
推荐理由:原文提供了三款新资产的具体参数规格与部署代码,读者可以据此评估端侧部署与安全审核方案。
Meta 联合 Hugging Face 发布 Llama 3.1 系列模型,涵盖 8B、70B 和 405B 三种规格的 Base 与 Instruct 版本,支持 128K 上下文与 8 种语言。
推荐理由:文章给出了各规格模型在显存占用、量化部署、工具调用及数据合成上的具体配置与代码,便于评估硬件门槛和落地流程。
Google 正式发布新一代开源大语言模型 Gemma 2,包含 9B 与 27B 两种尺寸的基础和指令微调版本,Hugging Face 生态同步提供支持。架构上引入了交替滑动窗口注意力、Logit 软截断以及在策略知识蒸馏技术,上下文窗口为 8K tokens。
推荐理由:文章系统梳理了 Gemma 2 的架构改进与蒸馏机制,并提供了在消费级硬件上的完整微调与部署方案。
TII 正式推出第二代开源模型 Falcon 2 11B,包括基础大语言模型及集成了图像理解能力的 Falcon 2 11B VLM。该模型基于超过 5000B token 数据完成四阶段训练,上下文窗口扩展至 8192,在多语言与开源基准评测中综合表现比肩前代 Falcon-40B。
推荐理由:该系列以四分之一的参数量达到了前代 40B 的性能水准,同时补充了开源多模态能力以降低推理部署门槛。
Meta 正式发布开源大语言模型 Llama 3,提供 8B 和 70B 两个尺寸的基础版与指令微调版,并同步推出安全模型 Llama Guard 2。模型在超过 15 万亿模型 token 上训练,词表扩展至 128,256,上下文窗口为 8k context,8B 版本增加了分组查询注意力(GQA)。
推荐理由:原文梳理了模型架构参数与词表变化,并给出了在开源框架下进行推理部署和单卡微调的完整代码。
OpenAI 分享了用于生成自定义声音的模型 Voice Engine 的小规模预览经验,探讨合成声音带来的挑战与机遇。
BigCode 联合开源了新一代代码大语言模型 StarCoder2 及代码预训练数据集 The Stack v2,并同步公开所有模型权重、数据集、处理与训练代码。
推荐理由:BigCode开源了代码大语言模型StarCoder2及高质量预训练数据集The Stack v2,覆盖从3B到15B参数规模并公开全部训练细节。
Google 正式发布开源大语言模型家族 Gemma,Hugging Face 同步宣布全面集成并上线模型 Hub。Gemma 提供 2B 与 7B 两种参数规模,均包含基础模型与指令微调版本,支持 8K 上下文窗口且可在消费级硬件上运行。Transformers 4.38 已支持该系列模型的推理加速与 4-bit 量化,并提供 Google Cloud 一键部署和 TRL 单卡微调方案。
推荐理由:文章梳理了 Gemma 模型的参数规格与基准表现,并给出了在消费级显卡上通过 Transformers 和 TRL 部署微调的实现路径。
Segmind 发布开源框架 SegMoE,支持将多个预训练扩散模型组合为稀疏混合专家(MoE)架构,并同步推出 SegMoE-4x2、2x1 和 SD 4x2 三款模型。
推荐理由:该项目展示了如何通过混合专家架构拼接已有扩散模型,为无需从头训练而扩展图像生成能力提供了落地参考。
Hugging Face 开源了非扩散文生图模型 aMUSEd,采用掩码图像建模(MIM)架构并开源了完整代码与权重。该模型总参数量约 800M,推理步骤更少且原生支持零样本图像修复,已完整集成进 diffusers 库。模型在 8-bit Adam 和 float16 下微调显存低于 11GB,采用 LoRA 时可进一步降至 7GB。
推荐理由:原文提供了基于掩码图像建模的非扩散文生图方案与推理代码,便于开发者探索小参数量下的快速图像生成。
Hugging Face 宣布全面集成 Mistral 发布的开源 MoE 模型 Mixtral 8x7B,并在 Hub、Transformers 及 TGI 中提供完整支持。
推荐理由:文章系统梳理了该 MoE 模型的显存配置要求与量化部署路径,为开源模型的低成本微调及工程落地提供了参考。
Hugging Face 与 T2I-Adapter 作者合作在 diffusers 中正式支持面向 SDXL 的 T2I-Adapter,并开源了线稿、素描、Canny、深度和 OpenPose 等条件控制权重。
推荐理由:原文详细对比了适配器与ControlNet的参数及计算差异,为轻量化图像生成控制提供了具体实现与配置参考。
TII 正式在 Hugging Face 推出开源大语言模型 Falcon 180B,包含基础版与聊天版,拥有 1800 亿参数。该模型基于 RefinedWeb 等 3.5 万亿 token 预训练,规模达 Llama 2 的 2.5 倍,在 MMLU 等基准测试中超越 Llama 2 70B 与 GPT-3.5。
推荐理由:文章提供了 180B 超大开源模型的评测基准成绩以及量化部署所需的显存配置细节。
Meta 发布开源大语言模型家族 Llama 2,涵盖 7B、13B 和 70B 参数版本并开放商用许可,Hugging Face 同步提供全生态集成支持。该系列在初代基础上增加了 40% 预训练 token 并将上下文拓展至 4k tokens,经 RLHF 优化的 Llama 2-Chat 在多项基准上接近 ChatGPT 表现。
推荐理由:材料梳理了新模型相比初代的上下文与训练量升级,并提供了基于开源生态的推理部署与微调路径。
Hugging Face 与 ServiceNow 联合发起的 BigCode 项目正式发布 15B 参数的代码大语言模型 StarCoderBase 以及面向 Python 微调的 StarCoder。
推荐理由:原文详细披露了 15B 代码模型的训练数据清洗流程与评测对比,为开发者构建开源代码补全与技术助手提供了可迁移基准。
OpenAI 宣布推出大型多模态模型 GPT-4,支持图像和文本输入并生成文本输出。官方表示该模型是其深度学习扩展工作的最新里程碑,虽然在许多真实世界场景中表现仍不及人类,但在各项专业和学术基准测试中展现出人类水平。
推荐理由:OpenAI 推出支持图文输入的多模态模型 GPT-4,其在专业和学术基准上的表现展示了扩展深度学习的能力边界。
OpenAI 宣布开源名为 Whisper 的神经网络模型,该模型在英语语音识别上达到了接近人类水平的鲁棒性与准确度。
推荐理由:OpenAI 开源了语音识别模型 Whisper,在英语语音识别任务上达到了接近人类水平的鲁棒性与准确度。
BigScience 联合 Hugging Face 正式开源 1760 亿参数的多语言大语言模型 BLOOM,支持生成 46 种自然语言和 13 种编程语言的文本。
推荐理由:该项目完全公开了百亿级多语言模型的权重、训练检查点与优化器状态,为开源社区研究前沿模型底层机制提供了完整范本。
OpenAI 宣布推出 OpenAI Codex 的改进版本,该 AI 系统能够将自然语言转换为代码。该模型即日起通过 API 开启私测(private beta)。
推荐理由:Codex 将自然语言转化为代码并通过 API 开放私测,为开发者提供了基于自然语言生成代码的直接途径。
OpenAI 正式发布拥有 774M 参数的 GPT-2 语言模型。这是继 2 月发布 124M 小型模型与 5 月分阶段发布 355M 中型模型之后,结合潜在滥用与社会效益研究所推进的新版本;团队还同时开源了一份促进机构间模型共享合作的法律协议,并发布了关于协调 AI 研究社区发布规范的技术报告。
推荐理由:OpenAI 推进其分阶段发布策略并公开 774M 参数模型,同时给出了与科研社区协作探讨发布规范的技术报告。