跳到正文

模型发布

新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。

142条精选相关主题产品更新论文研究开源生态

最新精选

第 61–80 条 · 共 142 条
3月26日周四
  1. Google DeepMind80

    Google DeepMind 发布 Gemini 3.1 Flash Live 实时语音模型

    Google DeepMind 正式推出实时语音模型 Gemini 3.1 Flash Live,提供更高精度、更低延迟以及更自然的语调理解与交互节奏。该模型在 ComplexFuncBench Audio 获得 90.8% 的成绩,开启思考模式后在 Audio MultiChallenge 达到 36.1%,且上下文对话跟踪时长提升至前代两倍。

    推荐理由:新模型在多步函数调用与长程推理上给出具体指标,同时强化了声调理解与多轮跟进能力,有助评估语音智能体的落地可用度。

  2. Google DeepMind74

    Google DeepMind 发布音乐生成模型 Lyria 3 Pro

    Google DeepMind 推出音乐生成模型 Lyria 3 Pro,支持生成最长 3 分钟的音频,并能根据提示词精准编排前奏、主歌、副歌和过门等音乐结构。

    推荐理由:该版本将音乐生成时长扩展至三分针并支持结构化控制,同步落地到了云服务与视频创作工具中。

3月17日周二
  1. Hugging Face61

    H Company 发布高吞吐计算机操作模型 Holotron-12B

    H Company 正式发布多模态计算机操作模型 Holotron-12B,基于 NVIDIA 开源模型后训练构建并已上线 Hugging Face。该模型采用混合 SSM 与注意力架构以减少显存占用,在单张 H100 搭配 vLLM 运行且并发达到 100 时吞吐量达到 8.9k tokens/s,并在 WebVoyager 基准测试中取得 80.5% 的表现。

    推荐理由:该模型结合混合状态空间模型架构优化并发推理,展现了降低显存占用并提升智能体长上下文吞吐量的方法。

3月5日周四
  1. OpenAI88

    OpenAI 发布 GPT-5.4

    OpenAI 发布面向专业工作的前沿模型 GPT-5.4,具备更强的能力与效率表现。该模型支持 1M token 上下文窗口,并在编程、计算机操作以及工具搜索等任务上提供顶尖能力。

    推荐理由:官方公布了该模型在编程、计算机控制与百万上下文等核心升级,读者可据此评估其在专业复杂工作流中的适配度。

3月4日周三
  1. Google DeepMind79

    Google DeepMind 发布 Gemini 3.1 Flash-Lite

    Google DeepMind 推出面向大规模高吞吐工作流的模型 Gemini 3.1 Flash-Lite,已在 Google AI Studio 和 Vertex AI 开启预览。

    推荐理由:原文提供了具体的定价、推理速度提升倍数和基准测试分数,读者可以据此评估高并发任务中的成本与性能权衡。

2月27日周五
2月20日周五
  1. Google DeepMind80

    Google 发布 Gemini 3.1 Pro

    Google 推出新一代核心推理模型 Gemini 3.1 Pro,主打面向复杂任务的高级问题解决能力。在评估新逻辑模式解决能力的 ARC-AGI-2 基准中,该模型取得 77.1% 的验证得分,推理表现达到 3 Pro 的两倍以上。

    推荐理由:该模型在 ARC-AGI-2 基准上实现了相比前代翻倍的推理得分,读者可据此评估其在复杂逻辑与智能体工作流中的落地表现。

2月13日周五
  1. Google DeepMind82

    Google DeepMind 发布 Gemini 3 Deep Think 升级版,面向科学与工程挑战

    Google DeepMind 发布 Gemini 3 Deep Think 深度思考模式的重大升级,强化其在科学研究与工程领域的复杂推理能力。基准测试中,该模式在无工具辅助下取得 Humanity's Last Exam 48.4% 和 ARC-AGI-2 84.6% 的成绩,并在国际数学、物理与化学奥林匹克竞赛中展现出金牌水准。

    推荐理由:该版本公布了在多项学科竞赛与基准测试中的具体得分,同时将高阶推理能力拓展到了工程应用与开发者接口。

2月12日周四
2月5日周四
  1. OpenAI68

    OpenAI 发布 GPT-5.3-Codex 系统卡片

    OpenAI 发布 GPT-5.3-Codex 系统卡片,将其定位为目前能力最强的智能体编码模型。该模型结合了 GPT-5.2-Codex 的前沿编码表现以及 GPT-5.2 的推理与专业知识能力。

    推荐理由:官方阐明了该模型结合编码能力与专业推理的技术定位,可作为评估智能体编程工具演化路径的参考。

1月20日周二
  1. Hugging Face74

    Overworld 发布实时交互视频扩散模型 Waypoint-1

    Overworld 推出实时交互视频扩散模型 Waypoint-1,支持根据文本提示词、键盘和鼠标输入实时生成可交互的游戏世界画面,其 2.3B 参数的 Waypoint-1-Small 模型权重已上线 Hugging Face Hub。

    推荐理由:原文给出了交互式视频扩散模型的训练方法与配套推理库设计,读者可以了解控制信号输入和低延迟流式生成的具体实现路径。

1月14日周三
1月6日周二
12月23日周二
  1. Hugging Face62

    ServiceNow 开源 AprielGuard:面向现代大语言模型与 Agent 系统的 8B 安全护栏模型

    ServiceNow 开源了 8B 参数的安全护栏模型 AprielGuard,用于检测大语言模型及 Agent 系统中的 16 类安全风险和提示词注入等对抗攻击。

    推荐理由:模型将内容安全与智能体对抗防御统一到单模型中,为复杂工作流提供了可解释推理与低延迟双模式落地方案。

12月18日周四
  1. OpenAI76

    OpenAI 推出 GPT-5.2-Codex

    OpenAI 推出专精编码的模型 GPT-5.2-Codex。该模型具备长程推理能力,支持大规模代码重构,并增强了网络安全能力。

    推荐理由:原文明确了模型聚焦长程推理与大规模代码重构,有助于读者快速掌握其在代码智能体场景的演进方向。

12月17日周三
  1. Google DeepMind88

    Google DeepMind 发布 Gemini 3 Flash 模型

    Google DeepMind 正式推出主打速度与效率的 Gemini 3 Flash 模型,API 定价为每 1M 输入 token 0.50 美元、输出 3 美元。

    推荐理由:该模型在保持低延迟与低成本的同时具备较强推理能力,为高频交互和智能体工作流提供了更具性价比的基础模型选型。

12月16日周二
12月13日周六