跳到正文

#DeepMind

今日 0 条
10月1日周四
9月16日周三
9月3日周四
8月27日周四
  1. Google DeepMind74

    Google 推出语音转文字模型 Gemini 3.5 Transcribe

    Google 推出语音转文字模型 Gemini 3.5 Transcribe,能够直接将原始音频转换为排版工整、去除语气词和自纠错口语的结构化文本。模型提供用于亚秒级双向交互的实时流式接口与用于录音分析的处理接口,在流式与非流式场景下的平均词错误率分别为 4.0% 和 2.6%,支持超 85 种语言、自定义词库以及函数调用。

    推荐理由:该模型相比前代Chirp 3显著降低了词错误率与延迟,并通过实时流式接口与意图理解为语音智能体落地提供了更可用的方案。

8月14日周五
  1. Google DeepMind83

    Google DeepMind 发布 Gemini 3.7 Flash

    Google DeepMind 正式推出 Gemini 3.7 Flash,主打编码与 AI 智能体工作流,在年底前以原版半价即每百万输入 tokens 0.75 美元、输出 tokens 3.75 美元提供服务。

    推荐理由:模型在软件工程和复杂文档基准上较前代有显著提升,且调用价格降低一半,有助于开发者降低高频智能体工作流的运行成本。

8月12日周三
  1. Google DeepMind69

    Google DeepMind 发布手语转文本模型 SL2T

    Google DeepMind 推出多语种手语转文本翻译模型 SL2T,并率先在 Pixel 11 上的 Gboard 和 Live Transcribe 中落地美式手语(ASL)听写功能。

    推荐理由:该模型跳过中间手语标注直接将骨骼位姿映射为文本,并兼顾端侧隐私与流式低延迟,为无障碍交互提供了软硬件结合的落地参考。

7月30日周四
  1. Google DeepMind62

    Google DeepMind 在 Flow Music 中推出音乐生成模型 Lyria 3.5

    Google DeepMind 宣布在 Google Flow Music 中上线最新音乐生成模型 Lyria 3.5,提升了音乐性、歌词质量与人声表现。该模型支持生成更自然复杂的旋律结构,并改善了歌词的提示词遵循度与发音表现力。此外,新版本还增强了创作控制功能,允许用户更便捷地调整生成音轨的节奏与时长。

    推荐理由:新版本在音乐生成中引入了节奏与时长的精细调节能力,有助于评估AI在结构化音乐编排中的实用性。

7月28日周二
  1. Google DeepMind76

    Google DeepMind 推出 Gemini Robotics 2 具身智能模型系列

    Google DeepMind 推出 Gemini Robotics 2 具身智能模型系列,包含视觉语言动作模型 VLA、具身推理模型 ER 2 以及轻量化的 On-Device 2。

    推荐理由:该系列将控制范围从桌面操作扩展至全身协调与多机协作,端侧模型仅需数小时即可适配新硬件,展示了具身模型跨形态落地的实际路径。

7月17日周五
  1. Google DeepMind63

    Google DeepMind 推出网络安全专用模型 Gemini 3.5 Flash Cyber

    Google DeepMind 推出轻量网络安全模型 Gemini 3.5 Flash Cyber,基于 3.5 Flash 微调,专用于快速发现、验证和修补代码漏洞。模型与安全智能体 CodeMender 结合,通过多次调用扩大代码路径搜索空间,在 V8 引擎测试中捕获 55 个独立确认问题,表现优于通用模型。考虑到双重用途安全风险,该模型初期仅向政府和受信任合作伙伴提供限量试用。

    推荐理由:原文展示了轻量安全模型在多轮并发调用下兼顾代码覆盖面与推理成本的实测数据,为工程团队设计自动化审计流水线提供了参考依据。

7月1日周三
6月25日周四
  1. Google DeepMind78

    Google DeepMind 在 Gemini 3.5 Flash 中原生集成计算机使用能力

    Google DeepMind 宣布在 Gemini 3.5 Flash 中原生内置计算机使用能力(Computer use),开发者可借此构建跨浏览器、移动端和桌面环境查看与操作的 AI 智能体。

    推荐理由:计算机操作能力从独立模型原生整合进主力 Flash 模型,开发者可通过 API 直接构建跨平台自动化智能体并调用企业安全防护系统。

6月9日周二
  1. Google DeepMind82

    Google DeepMind 发布 Gemini 3.5 Live Translate 音频模型

    Google DeepMind 发布音频模型 Gemini 3.5 Live Translate,支持 70 多种语言的近实时语音到语音互译。该模型通过流式处理连续生成翻译语音并保留原说话人的语调、语速与音高,全程仅滞后说话人数秒。

    推荐理由:模型通过流式生成将双向同传延迟缩短至数秒并保留原声语调,同时打通了开发者接口与办公终端的集成路径。

  2. Google DeepMind83

    Google DeepMind 推出 Gemma 4 12B:采用无编码器统一架构的多模态端侧模型

    Google DeepMind 正式推出多模态模型 Gemma 4 12B,采用无编码器的统一架构,使视觉与原生音频输入直接融入大语言模型主干进行处理。该模型在标准基准上的性能接近 26B MoE 模型,显存占用减半且仅需 16GB 内存即可在笔记本本地流畅运行。

    推荐理由:该模型舍弃了独立多模态编码器并将音频与视觉直接投影至大语言模型主干,为在消费级硬件上低显存部署多模态智能体提供了轻量架构参考。

5月18日周一
5月16日周六
  1. Google DeepMind67

    WeatherNext 如何协助美国国家飓风中心提前预测飓风梅丽莎登陆牙买加

    Google DeepMind 研发的 AI 气象模型 WeatherNext 协助美国国家飓风中心提前 5 天预测出飓风 Melissa 将快速增强并以 5 级强度登陆牙买加,为当地防灾疏散提供了关键预警窗口。

    推荐理由:展示了气象模型在风暴路径与强度协同预测中的实战表现,读者可了解集合预报机制在防灾减灾决策中的具体落地方式。

  2. Google DeepMind88

    Google DeepMind 发布 Gemini 3.5 Flash:主打智能体与编码能力并面向全球上线

    Google DeepMind 正式推出 Gemini 3.5 系列模型并首发 Gemini 3.5 Flash,主打复杂长流程智能体工作流与编码任务。该模型在 Terminal-Bench 2.1 达 76.2%、GDPval-AA 达 1656 Elo、MCP Atlas 达 83.6%,生成速度达其他前沿模型的 4 倍且成本大幅降低。

    推荐理由:该模型在保持高速低成本的同时大幅提升了智能体与编码基准得分,读者可据此评估长流程任务的自动化落地可行性。

4月16日周四
  1. Google DeepMind74

    Google DeepMind 发布 Gemini 3.1 Flash TTS 语音模型

    Google DeepMind 推出新一代文本转语音模型 Gemini 3.1 Flash TTS,支持通过嵌入自然语言音频标签精细控制语音风格、节奏与表达方式。

    推荐理由:模型引入自然语言音频标签实现句内语调和节奏的细粒度控制,为多角色对话生成提供了更直接的参数调节方式。

3月26日周四
  1. Google DeepMind80

    Google DeepMind 发布 Gemini 3.1 Flash Live 实时语音模型

    Google DeepMind 正式推出实时语音模型 Gemini 3.1 Flash Live,提供更高精度、更低延迟以及更自然的语调理解与交互节奏。该模型在 ComplexFuncBench Audio 获得 90.8% 的成绩,开启思考模式后在 Audio MultiChallenge 达到 36.1%,且上下文对话跟踪时长提升至前代两倍。

    推荐理由:新模型在多步函数调用与长程推理上给出具体指标,同时强化了声调理解与多轮跟进能力,有助评估语音智能体的落地可用度。

  2. Google DeepMind74

    Google DeepMind 发布音乐生成模型 Lyria 3 Pro

    Google DeepMind 推出音乐生成模型 Lyria 3 Pro,支持生成最长 3 分钟的音频,并能根据提示词精准编排前奏、主歌、副歌和过门等音乐结构。

    推荐理由:该版本将音乐生成时长扩展至三分针并支持结构化控制,同步落地到了云服务与视频创作工具中。

3月4日周三
  1. Google DeepMind79

    Google DeepMind 发布 Gemini 3.1 Flash-Lite

    Google DeepMind 推出面向大规模高吞吐工作流的模型 Gemini 3.1 Flash-Lite,已在 Google AI Studio 和 Vertex AI 开启预览。

    推荐理由:原文提供了具体的定价、推理速度提升倍数和基准测试分数,读者可以据此评估高并发任务中的成本与性能权衡。

2月27日周五
2月20日周五
  1. Google DeepMind80

    Google 发布 Gemini 3.1 Pro

    Google 推出新一代核心推理模型 Gemini 3.1 Pro,主打面向复杂任务的高级问题解决能力。在评估新逻辑模式解决能力的 ARC-AGI-2 基准中,该模型取得 77.1% 的验证得分,推理表现达到 3 Pro 的两倍以上。

    推荐理由:该模型在 ARC-AGI-2 基准上实现了相比前代翻倍的推理得分,读者可据此评估其在复杂逻辑与智能体工作流中的落地表现。

2月13日周五
  1. Google DeepMind82

    Google DeepMind 发布 Gemini 3 Deep Think 升级版,面向科学与工程挑战

    Google DeepMind 发布 Gemini 3 Deep Think 深度思考模式的重大升级,强化其在科学研究与工程领域的复杂推理能力。基准测试中,该模式在无工具辅助下取得 Humanity's Last Exam 48.4% 和 ARC-AGI-2 84.6% 的成绩,并在国际数学、物理与化学奥林匹克竞赛中展现出金牌水准。

    推荐理由:该版本公布了在多项学科竞赛与基准测试中的具体得分,同时将高阶推理能力拓展到了工程应用与开发者接口。

12月13日周六
11月20日周四
  1. Google DeepMind82

    Google DeepMind 发布图像生成模型 Nano Banana Pro(Gemini 3 Pro Image)

    Google DeepMind 正式推出基于 Gemini 3 Pro 构建的高保真图像生成与编辑模型 Nano Banana Pro(Gemini 3 Pro Image),目前已在 Google AI Studio 和 Vertex AI 向开发者开启付费预览。

    推荐理由:该模型重点强化了文字渲染与画面物理控制,并支持结合搜索检索生成事实性图表,展示了高保真图像生成的实用落地路径。

11月19日周三
  1. Google DeepMind90

    Google DeepMind 发布 Gemini 3 系列模型与智能体开发平台 Google Antigravity

    Google DeepMind 正式推出 Gemini 3 系列模型,核心模型 Gemini 3 Pro 重点提升了逻辑推理、多模态理解与智能体编程能力。该模型在 Terminal-Bench 2.0 取得 54.2% 得分,并在 WebDev Arena 达到 1487 Elo,同时官方配套推出了跨工作区协作的智能体开发平台 Google Antigravity。

    推荐理由:模型强化了终端控制与长上下文视频理解能力,配套智能体平台展示了从单点代码生成走向多智能体协作的落地路径。

11月13日周四
  1. Google DeepMind71

    Google DeepMind 发布 SIMA 2:整合 Gemini 核心的 3D 虚拟世界具身智能体

    Google DeepMind 发布通用 3D 虚拟世界智能体 SIMA 2,以 Gemini 模型为核心,从简单的指令遵循升级为具备目标推理、语言交流与自我提升能力的交互伙伴。

    推荐理由:SIMA 2 将 Gemini 作为推理核心,展示了智能体在未见过的虚拟 3D 环境中自主试错与自我提升的具身演进路径。

4月15日周一
  1. OpenAI89

    OpenAI Five 战胜 Dota 2 世界冠军战队 OG

    OpenAI Five 在比赛中连赢两局战胜 Dota 2 世界冠军战队 OG,成为首个在电竞比赛中击败世界冠军的 AI。此前 OpenAI Five 与 DeepMind 的 AlphaStar 虽曾在私下击败过顶尖职业选手,但在现场比赛中失利;本次比赛也是 AI 首次在网络直播中击败电竞职业选手。

    推荐理由:原文记录了强化学习系统在公开直播对局中击败人类冠军的里程碑,展现了复杂连续决策环境下的实战表现。