跳到正文

模型发布

新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。

142条精选相关主题产品更新论文研究开源生态

最新精选

第 41–60 条 · 共 142 条
6月2日周二
  1. Hugging Face73

    Holo3.1 系列模型发布:主打本地推理与跨环境电脑操作智能体

    H company 发布 Holo3.1 系列电脑操作模型,涵盖 0.8B、4B、9B 及 35B-A3B 四种尺寸,重点提升桌面、网页和移动端的跨环境鲁棒性与本地执行能力。新版本在 AndroidWorld 移动基准上表现提升明显,并新增对函数调用的原生支持;同时官方推出了 FP8、NVFP4 和 Q4 GGUF 等量化权重,支持在消费级硬件或本地网络中纯离线运行。

    推荐理由:该系列通过量化权重和轻量尺寸将电脑操作智能体扩展至本地端侧,为注重隐私与低延迟的自动化工作流提供了可落地的开源模型方案。

6月1日周一
  1. Hugging Face67

    JetBrains 发布 12B 开源混合专家模型 Mellum2

    JetBrains 正式发布开源混合专家模型 Mellum2,总参数量为 12B 且每个 token 仅激活 2.5B 参数,专注于文本与代码任务。该模型基于 Apache 2.0 许可证开源,官方测试称其比同尺寸模型推理速度提升 2 倍以上,适用于路由编排、RAG 流水线、子智能体及私有化部署等高吞吐工作负载。

    推荐理由:该模型通过低激活参数量和高推理速度降低部署成本,为复杂系统中高频调用的路由与子智能体任务提供了轻量解法。

5月19日周二
5月18日周一
5月16日周六
  1. Google DeepMind88

    Google DeepMind 发布 Gemini 3.5 Flash:主打智能体与编码能力并面向全球上线

    Google DeepMind 正式推出 Gemini 3.5 系列模型并首发 Gemini 3.5 Flash,主打复杂长流程智能体工作流与编码任务。该模型在 Terminal-Bench 2.1 达 76.2%、GDPval-AA 达 1656 Elo、MCP Atlas 达 83.6%,生成速度达其他前沿模型的 4 倍且成本大幅降低。

    推荐理由:该模型在保持高速低成本的同时大幅提升了智能体与编码基准得分,读者可据此评估长流程任务的自动化落地可行性。

5月15日周五
5月7日周四
  1. OpenAI68

    OpenAI 在 API 中推出新实时语音模型

    OpenAI 在 API 中推出全新实时语音模型,具备链式推理、翻译和语音转录能力。该模型旨在帮助开发者构建更自然、更智能的实时语音交互体验。

    推荐理由:新模型将推理能力直接融入实时语音交互,为构建低延迟自然语音应用提供了直接入口。

5月5日周二
4月29日周三
  1. Hugging Face65

    IBM 开源 Granite 4.1 系列大模型

    IBM 宣布以 Apache 2.0 协议开源 Granite 4.1 系列稠密大语言模型,包含 3B、8B 和 30B 三种尺寸,支持最高 512K 上下文。

    推荐理由:技术报告详述了五阶段退火预训练与四阶段强化学习流程,为端侧与企业级小参数稠密模型的构建提供了完整工程参考。

4月28日周二
  1. Hugging Face77

    NVIDIA 发布 Nemotron 3 Nano Omni:支持文档、音视频与智能体的长上下文多模态全能模型

    NVIDIA 正式推出全模态理解模型 Nemotron 3 Nano Omni,原生支持文本、图像、长音视频理解、复杂文档分析以及 GUI 智能体计算机操作。

    推荐理由:该模型结合 Mamba-Transformer-MoE 混合架构与原生音视频编码,为长上下文多模态处理与 GUI 智能体提供了高吞吐量的开源实现方案。

4月24日周五
4月23日周四
4月22日周三
4月16日周四
  1. Google DeepMind74

    Google DeepMind 发布 Gemini 3.1 Flash TTS 语音模型

    Google DeepMind 推出新一代文本转语音模型 Gemini 3.1 Flash TTS,支持通过嵌入自然语言音频标签精细控制语音风格、节奏与表达方式。

    推荐理由:模型引入自然语言音频标签实现句内语调和节奏的细粒度控制,为多角色对话生成提供了更直接的参数调节方式。

4月13日周一
  1. Google DeepMind71

    Google DeepMind 发布 Gemini Robotics-ER 1.6:增强具身空间推理与仪表读取能力

    Google DeepMind 推出专为机器人设计的具身推理模型 Gemini Robotics-ER 1.6,大幅增强了空间推理、多视角理解、任务成功检测与复杂仪器读数能力。

    推荐理由:该模型强化了多视角空间指向与工业仪表识别能力,为实体机器人在复杂工业场景中的自主感知和规划提供了可落地的工具调用方案。

4月9日周四
  1. Hugging Face74

    Overworld 发布 Waypoint-1.5 实时交互世界模型,支持消费级 GPU 本地运行

    Overworld 正式发布实时视频世界模型 Waypoint-1.5,模型权重已在 Hugging Face 开源上线,主打消费级硬件本地实时交互。在 RTX 3090 至 5090 显卡上可实时生成最高 720p 60 FPS 环境,并提供适配游戏本及 Apple Silicon 的 360p 规格。

    推荐理由:原文给出了消费级硬件本地运行世界模型的具体分级与训练细节,读者可以了解端侧实时交互环境生成的落地可能。

4月3日周五
  1. Google DeepMind85

    Google DeepMind 发布开源模型 Gemma 4

    Google DeepMind 正式发布 Gemma 4 开源模型系列,提供 E2B、E4B、26B MoE 和 31B Dense 四种尺寸,并采用 Apache 2.0 许可证。

    推荐理由:原文公开了涵盖端侧到桌面规模的四款模型规格与多模态能力,并且改用商业友好的开源许可,方便开发者评估本地部署与二次开发成本。

4月2日周四
  1. Hugging Face88

    Google 推出端侧多模态开源模型 Gemma 4,Hugging Face 同步提供全生态部署支持

    Google DeepMind 正式发布开源多模态模型 Gemma 4 家族,采用 Apache 2.0 协议,支持文本、图像与音频输入,并在 Hugging Face 实现生态同步上线。

    推荐理由:Gemma 4 覆盖 2.3B 到 31B 多个尺寸并支持端侧多模态与扩散文本生成,为本地部署提供了开源基座与多推理引擎支持。

4月1日周三
  1. Hugging Face67

    TII 发布早期融合视觉模型 Falcon Perception 与轻量级 Falcon OCR

    阿联酋技术创新研究院(TII)发布 0.6B 参数的早期融合视觉模型 Falcon Perception,以及 0.3B 参数的端到端文档解析模型 Falcon OCR。

    推荐理由:材料验证了单骨干早期融合架构在开放词表分割与超轻量 OCR 中的可行性,为端侧密集视觉任务提供了极具参考价值的极简设计路线。

3月31日周二