跳到正文

模型发布

新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。

142条精选相关主题产品更新论文研究开源生态

最新精选

第 21–40 条 · 共 142 条
9月1日周二
  1. OpenAI66

    OpenAI 详解 Astra:关键能力与前沿安全保障

    OpenAI 宣布 Astra 是其首个在准备度框架(Preparedness Framework)下达到关键网络安全能力阈值的模型。针对该模型的能力水平,官方为其设置了更严格的发布安全保障措施。

    推荐理由:内容展示了 OpenAI 准备度框架中关键网络安全阈值的落地情况,读者可据此了解前沿模型在发布前针对高风险能力所设定的防护标准。

8月28日周五
  1. Google DeepMind78

    Google DeepMind 发布 Gemini Omni 1.1 Flash,增强生成式视频控制能力

    Google DeepMind 推出 Gemini Omni 1.1 Flash,为开发者提供更可控的专业级生成式视频能力,已通过 Google AI Studio 中的 Gemini API 正式开放。该版本支持基于前 10 秒上下文将场景单次延伸并累积至最长 40 秒,新增首尾关键帧过渡插值与 3 秒视频参考输入,并提供速度提升达 60% 的 360p 预览以及最高 4K 分辨率生成。

    推荐理由:原文详细说明了视频场景延伸与关键帧插值的控制机制,开发者可以据此评估多模态视频生成在工业化制作管线中的落地可行性。

8月27日周四
  1. Google DeepMind74

    Google 推出语音转文字模型 Gemini 3.5 Transcribe

    Google 推出语音转文字模型 Gemini 3.5 Transcribe,能够直接将原始音频转换为排版工整、去除语气词和自纠错口语的结构化文本。模型提供用于亚秒级双向交互的实时流式接口与用于录音分析的处理接口,在流式与非流式场景下的平均词错误率分别为 4.0% 和 2.6%,支持超 85 种语言、自定义词库以及函数调用。

    推荐理由:该模型相比前代Chirp 3显著降低了词错误率与延迟,并通过实时流式接口与意图理解为语音智能体落地提供了更可用的方案。

8月14日周五
  1. Google DeepMind83

    Google DeepMind 发布 Gemini 3.7 Flash

    Google DeepMind 正式推出 Gemini 3.7 Flash,主打编码与 AI 智能体工作流,在年底前以原版半价即每百万输入 tokens 0.75 美元、输出 tokens 3.75 美元提供服务。

    推荐理由:模型在软件工程和复杂文档基准上较前代有显著提升,且调用价格降低一半,有助于开发者降低高频智能体工作流的运行成本。

8月12日周三
  1. Google DeepMind69

    Google DeepMind 发布手语转文本模型 SL2T

    Google DeepMind 推出多语种手语转文本翻译模型 SL2T,并率先在 Pixel 11 上的 Gboard 和 Live Transcribe 中落地美式手语(ASL)听写功能。

    推荐理由:该模型跳过中间手语标注直接将骨骼位姿映射为文本,并兼顾端侧隐私与流式低延迟,为无障碍交互提供了软硬件结合的落地参考。

8月11日周二
  1. Hugging Face66

    NVIDIA 开源多语言语音合成模型 Magpie TTS

    NVIDIA 开源多语言文本转语音模型 Magpie TTS Multilingual,参数量为 364M 并开放模型权重与生产级 NIM 容器。该模型支持普通话、韩语和阿拉伯语等 12 种语言,在 B200 GPU 上的单流首包音频延迟可达 32ms。技术上采用双帧堆叠与局部 Transformer 架构兼顾吞吐量与音质,旨在帮助开发者在自有基础设施上构建低延迟语音智能体。

    推荐理由:该开源模型通过双帧堆叠与局部注意力降低了首包音频延迟,适合需要自建低延迟多语言语音流水线的团队参考。

8月10日周一
  1. Hugging Face83

    Meta 开源端侧多模态模型 Muse Glimmer-30B,主打本地智能体场景

    Meta 推出专为本地智能体设计的开源多模态模型 Muse Glimmer-30B,采用 Apache 2.0 协议开源并已上线 Hugging Face。该模型由 2B 视觉编码器和 28B 文本解码器构成,支持视频理解、多模态工具调用与 DFlash 投机解码加速。

    推荐理由:该模型展示了 30B 级别端侧多模态模型通过智能体指令实现自我量化、云端部署与推理自优化的工程实践。

7月30日周四
  1. Google DeepMind62

    Google DeepMind 在 Flow Music 中推出音乐生成模型 Lyria 3.5

    Google DeepMind 宣布在 Google Flow Music 中上线最新音乐生成模型 Lyria 3.5,提升了音乐性、歌词质量与人声表现。该模型支持生成更自然复杂的旋律结构,并改善了歌词的提示词遵循度与发音表现力。此外,新版本还增强了创作控制功能,允许用户更便捷地调整生成音轨的节奏与时长。

    推荐理由:新版本在音乐生成中引入了节奏与时长的精细调节能力,有助于评估AI在结构化音乐编排中的实用性。

7月28日周二
  1. Google DeepMind76

    Google DeepMind 推出 Gemini Robotics 2 具身智能模型系列

    Google DeepMind 推出 Gemini Robotics 2 具身智能模型系列,包含视觉语言动作模型 VLA、具身推理模型 ER 2 以及轻量化的 On-Device 2。

    推荐理由:该系列将控制范围从桌面操作扩展至全身协调与多机协作,端侧模型仅需数小时即可适配新硬件,展示了具身模型跨形态落地的实际路径。

7月27日周一
7月17日周五
  1. Google DeepMind63

    Google DeepMind 推出网络安全专用模型 Gemini 3.5 Flash Cyber

    Google DeepMind 推出轻量网络安全模型 Gemini 3.5 Flash Cyber,基于 3.5 Flash 微调,专用于快速发现、验证和修补代码漏洞。模型与安全智能体 CodeMender 结合,通过多次调用扩大代码路径搜索空间,在 V8 引擎测试中捕获 55 个独立确认问题,表现优于通用模型。考虑到双重用途安全风险,该模型初期仅向政府和受信任合作伙伴提供限量试用。

    推荐理由:原文展示了轻量安全模型在多轮并发调用下兼顾代码覆盖面与推理成本的实测数据,为工程团队设计自动化审计流水线提供了参考依据。

7月15日周三
7月9日周四
7月8日周三
7月1日周三
6月22日周一
6月17日周三
  1. Hugging Face84

    智谱开源 GLM-5.2 旗舰模型:支持 1M 上下文与长流程编码任务

    智谱推出新一代旗舰开源模型 GLM-5.2,采用 MIT 协议完全开源,原生支持 1M token 上下文,主打面向长流程(long-horizon)的软件工程与智能体任务。

    推荐理由:GLM-5.2 将实用工程评测与 1M 上下文推理架构结合,为需要长时间自主运行的编码智能体提供了兼顾开源与高吞吐的落地参考。

6月9日周二
  1. Google DeepMind82

    Google DeepMind 发布 Gemini 3.5 Live Translate 音频模型

    Google DeepMind 发布音频模型 Gemini 3.5 Live Translate,支持 70 多种语言的近实时语音到语音互译。该模型通过流式处理连续生成翻译语音并保留原说话人的语调、语速与音高,全程仅滞后说话人数秒。

    推荐理由:模型通过流式生成将双向同传延迟缩短至数秒并保留原声语调,同时打通了开发者接口与办公终端的集成路径。

  2. Google DeepMind83

    Google DeepMind 推出 Gemma 4 12B:采用无编码器统一架构的多模态端侧模型

    Google DeepMind 正式推出多模态模型 Gemma 4 12B,采用无编码器的统一架构,使视觉与原生音频输入直接融入大语言模型主干进行处理。该模型在标准基准上的性能接近 26B MoE 模型,显存占用减半且仅需 16GB 内存即可在笔记本本地流畅运行。

    推荐理由:该模型舍弃了独立多模态编码器并将音频与视觉直接投影至大语言模型主干,为在消费级硬件上低显存部署多模态智能体提供了轻量架构参考。

6月5日周五