跳到正文

模型发布

新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。

142条精选相关主题产品更新论文研究开源生态

最新精选

第 121–140 条 · 共 142 条
7月31日周三
7月23日周二
6月27日周四
  1. Hugging Face83

    Google 发布开源大模型 Gemma 2,Hugging Face 全面集成

    Google 正式发布新一代开源大语言模型 Gemma 2,包含 9B 与 27B 两种尺寸的基础和指令微调版本,Hugging Face 生态同步提供支持。架构上引入了交替滑动窗口注意力、Logit 软截断以及在策略知识蒸馏技术,上下文窗口为 8K tokens。

    推荐理由:文章系统梳理了 Gemma 2 的架构改进与蒸馏机制,并提供了在消费级硬件上的完整微调与部署方案。

5月24日周五
  1. Hugging Face65

    TII 发布 Falcon 2 11B 基础大语言模型与多模态 VLM

    TII 正式推出第二代开源模型 Falcon 2 11B,包括基础大语言模型及集成了图像理解能力的 Falcon 2 11B VLM。该模型基于超过 5000B token 数据完成四阶段训练,上下文窗口扩展至 8192,在多语言与开源基准评测中综合表现比肩前代 Falcon-40B。

    推荐理由:该系列以四分之一的参数量达到了前代 40B 的性能水准,同时补充了开源多模态能力以降低推理部署门槛。

4月18日周四
  1. Hugging Face96

    Meta 正式发布开源大语言模型 Llama 3,Hugging Face 全面集成上线

    Meta 正式发布开源大语言模型 Llama 3,提供 8B 和 70B 两个尺寸的基础版与指令微调版,并同步推出安全模型 Llama Guard 2。模型在超过 15 万亿模型 token 上训练,词表扩展至 128,256,上下文窗口为 8k context,8B 版本增加了分组查询注意力(GQA)。

    推荐理由:原文梳理了模型架构参数与词表变化,并给出了在开源框架下进行推理部署和单卡微调的完整代码。

3月29日周五
2月28日周三
2月21日周三
  1. Hugging Face84

    Hugging Face 宣布全面支持 Google 开源大模型 Gemma

    Google 正式发布开源大语言模型家族 Gemma,Hugging Face 同步宣布全面集成并上线模型 Hub。Gemma 提供 2B 与 7B 两种参数规模,均包含基础模型与指令微调版本,支持 8K 上下文窗口且可在消费级硬件上运行。Transformers 4.38 已支持该系列模型的推理加速与 4-bit 量化,并提供 Google Cloud 一键部署和 TRL 单卡微调方案。

    推荐理由:文章梳理了 Gemma 模型的参数规格与基准表现,并给出了在消费级显卡上通过 Transformers 和 TRL 部署微调的实现路径。

2月3日周六
1月4日周四
  1. Hugging Face61

    Hugging Face 开源非扩散文生图模型 aMUSEd

    Hugging Face 开源了非扩散文生图模型 aMUSEd,采用掩码图像建模(MIM)架构并开源了完整代码与权重。该模型总参数量约 800M,推理步骤更少且原生支持零样本图像修复,已完整集成进 diffusers 库。模型在 8-bit Adam 和 float16 下微调显存低于 11GB,采用 LoRA 时可进一步降至 7GB。

    推荐理由:原文提供了基于掩码图像建模的非扩散文生图方案与推理代码,便于开发者探索小参数量下的快速图像生成。

12月11日周一
9月8日周五
9月6日周三
  1. Hugging Face78

    TII 开源 1800 亿参数大模型 Falcon 180B 并上线 Hugging Face

    TII 正式在 Hugging Face 推出开源大语言模型 Falcon 180B,包含基础版与聊天版,拥有 1800 亿参数。该模型基于 RefinedWeb 等 3.5 万亿 token 预训练,规模达 Llama 2 的 2.5 倍,在 MMLU 等基准测试中超越 Llama 2 70B 与 GPT-3.5。

    推荐理由:文章提供了 180B 超大开源模型的评测基准成绩以及量化部署所需的显存配置细节。

7月18日周二
  1. Hugging Face96

    Meta 开源大语言模型 Llama 2,Hugging Face 提供全面集成支持

    Meta 发布开源大语言模型家族 Llama 2,涵盖 7B、13B 和 70B 参数版本并开放商用许可,Hugging Face 同步提供全生态集成支持。该系列在初代基础上增加了 40% 预训练 token 并将上下文拓展至 4k tokens,经 RLHF 优化的 Llama 2-Chat 在多项基准上接近 ChatGPT 表现。

    推荐理由:材料梳理了新模型相比初代的上下文与训练量升级,并提供了基于开源生态的推理部署与微调路径。

5月4日周四
3月14日周二
  1. OpenAI94

    OpenAI 正式发布多模态大语言模型 GPT-4

    OpenAI 宣布推出大型多模态模型 GPT-4,支持图像和文本输入并生成文本输出。官方表示该模型是其深度学习扩展工作的最新里程碑,虽然在许多真实世界场景中表现仍不及人类,但在各项专业和学术基准测试中展现出人类水平。

    推荐理由:OpenAI 推出支持图文输入的多模态模型 GPT-4,其在专业和学术基准上的表现展示了扩展深度学习的能力边界。

9月21日周三
  1. OpenAI83

    OpenAI 开源语音识别模型 Whisper

    OpenAI 宣布开源名为 Whisper 的神经网络模型,该模型在英语语音识别上达到了接近人类水平的鲁棒性与准确度。

    推荐理由:OpenAI 开源了语音识别模型 Whisper,在英语语音识别任务上达到了接近人类水平的鲁棒性与准确度。

7月12日周二
8月10日周二
8月20日周二
  1. OpenAI72

    OpenAI 发布 774M 参数 GPT-2 模型及阶段性进展

    OpenAI 正式发布拥有 774M 参数的 GPT-2 语言模型。这是继 2 月发布 124M 小型模型与 5 月分阶段发布 355M 中型模型之后,结合潜在滥用与社会效益研究所推进的新版本;团队还同时开源了一份促进机构间模型共享合作的法律协议,并发布了关于协调 AI 研究社区发布规范的技术报告。

    推荐理由:OpenAI 推进其分阶段发布策略并公开 774M 参数模型,同时给出了与科研社区协作探讨发布规范的技术报告。