Google DeepMind 推出 Gemini 4 Argon:支持 1M 输出上限,基准对标 GPT-6 Astra
Google DeepMind 推出面向编码、企业知识与网络防御的前沿模型 Gemini 4 Argon,通过 Long Decode Continuation 机制实现最高 1M token 的输出上限,目前优先向政府和网络安全测试者开放预览。
Google DeepMind 推出面向编码、企业知识与网络防御的前沿模型 Gemini 4 Argon,通过 Long Decode Continuation 机制实现最高 1M token 的输出上限,目前优先向政府和网络安全测试者开放预览。
Google DeepMind 正式推出 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时对话模型,主打低延迟语音交互与复杂任务推理。
推荐理由:模型展示了边推理边对话的并行能力与后台工具调用机制,为复杂语音智能体的工程落地提供了参考。
Google DeepMind 与 Google Research 推出全球天气 AI 模型 WeatherNext 3,引入实时静止卫星观测数据并实现每小时高分辨率更新。
推荐理由:原文展示了结合实时卫星数据训练气象模型的具体架构与分辨率指标,读者可以据此了解高分辨率天气预测与新能源规划的落地能力。
Google 推出语音转文字模型 Gemini 3.5 Transcribe,能够直接将原始音频转换为排版工整、去除语气词和自纠错口语的结构化文本。模型提供用于亚秒级双向交互的实时流式接口与用于录音分析的处理接口,在流式与非流式场景下的平均词错误率分别为 4.0% 和 2.6%,支持超 85 种语言、自定义词库以及函数调用。
推荐理由:该模型相比前代Chirp 3显著降低了词错误率与延迟,并通过实时流式接口与意图理解为语音智能体落地提供了更可用的方案。
Google DeepMind 正式推出 Gemini 3.7 Flash,主打编码与 AI 智能体工作流,在年底前以原版半价即每百万输入 tokens 0.75 美元、输出 tokens 3.75 美元提供服务。
推荐理由:模型在软件工程和复杂文档基准上较前代有显著提升,且调用价格降低一半,有助于开发者降低高频智能体工作流的运行成本。
Google DeepMind 推出多语种手语转文本翻译模型 SL2T,并率先在 Pixel 11 上的 Gboard 和 Live Transcribe 中落地美式手语(ASL)听写功能。
推荐理由:该模型跳过中间手语标注直接将骨骼位姿映射为文本,并兼顾端侧隐私与流式低延迟,为无障碍交互提供了软硬件结合的落地参考。
Google DeepMind 宣布在 Google Flow Music 中上线最新音乐生成模型 Lyria 3.5,提升了音乐性、歌词质量与人声表现。该模型支持生成更自然复杂的旋律结构,并改善了歌词的提示词遵循度与发音表现力。此外,新版本还增强了创作控制功能,允许用户更便捷地调整生成音轨的节奏与时长。
推荐理由:新版本在音乐生成中引入了节奏与时长的精细调节能力,有助于评估AI在结构化音乐编排中的实用性。
Google DeepMind 推出 Gemini Robotics 2 具身智能模型系列,包含视觉语言动作模型 VLA、具身推理模型 ER 2 以及轻量化的 On-Device 2。
推荐理由:该系列将控制范围从桌面操作扩展至全身协调与多机协作,端侧模型仅需数小时即可适配新硬件,展示了具身模型跨形态落地的实际路径。
Google DeepMind 推出轻量网络安全模型 Gemini 3.5 Flash Cyber,基于 3.5 Flash 微调,专用于快速发现、验证和修补代码漏洞。模型与安全智能体 CodeMender 结合,通过多次调用扩大代码路径搜索空间,在 V8 引擎测试中捕获 55 个独立确认问题,表现优于通用模型。考虑到双重用途安全风险,该模型初期仅向政府和受信任合作伙伴提供限量试用。
推荐理由:原文展示了轻量安全模型在多轮并发调用下兼顾代码覆盖面与推理成本的实测数据,为工程团队设计自动化审计流水线提供了参考依据。
Google DeepMind 宣布面向开发者开放图像生成模型 Nano Banana 2 Lite 与视频生成编辑模型 Gemini Omni Flash,现已上线 Google AI Studio 与 Gemini API。
推荐理由:Google将轻量图像模型与对话式视频模型串联开放,为开发者以较低成本构建连续图生视工作流提供了完整范式。
Google DeepMind 宣布在 Gemini 3.5 Flash 中原生内置计算机使用能力(Computer use),开发者可借此构建跨浏览器、移动端和桌面环境查看与操作的 AI 智能体。
推荐理由:计算机操作能力从独立模型原生整合进主力 Flash 模型,开发者可通过 API 直接构建跨平台自动化智能体并调用企业安全防护系统。
Google DeepMind 发布音频模型 Gemini 3.5 Live Translate,支持 70 多种语言的近实时语音到语音互译。该模型通过流式处理连续生成翻译语音并保留原说话人的语调、语速与音高,全程仅滞后说话人数秒。
推荐理由:模型通过流式生成将双向同传延迟缩短至数秒并保留原声语调,同时打通了开发者接口与办公终端的集成路径。
Google DeepMind 正式推出多模态模型 Gemma 4 12B,采用无编码器的统一架构,使视觉与原生音频输入直接融入大语言模型主干进行处理。该模型在标准基准上的性能接近 26B MoE 模型,显存占用减半且仅需 16GB 内存即可在笔记本本地流畅运行。
推荐理由:该模型舍弃了独立多模态编码器并将音频与视觉直接投影至大语言模型主干,为在消费级硬件上低显存部署多模态智能体提供了轻量架构参考。
Google DeepMind 正式推出 Gemini Omni 系列及首个模型 Gemini Omni Flash,支持将图像、音频、视频与文本任意组合作为输入并生成高质量视频。
推荐理由:官方展示了将文本、图像、音频与视频任意组合生成高质量视频的能力,多轮自然语言对话即可直接连续编辑视频画面。
Google DeepMind 研发的 AI 气象模型 WeatherNext 协助美国国家飓风中心提前 5 天预测出飓风 Melissa 将快速增强并以 5 级强度登陆牙买加,为当地防灾疏散提供了关键预警窗口。
推荐理由:展示了气象模型在风暴路径与强度协同预测中的实战表现,读者可了解集合预报机制在防灾减灾决策中的具体落地方式。
Google DeepMind 正式推出 Gemini 3.5 系列模型并首发 Gemini 3.5 Flash,主打复杂长流程智能体工作流与编码任务。该模型在 Terminal-Bench 2.1 达 76.2%、GDPval-AA 达 1656 Elo、MCP Atlas 达 83.6%,生成速度达其他前沿模型的 4 倍且成本大幅降低。
推荐理由:该模型在保持高速低成本的同时大幅提升了智能体与编码基准得分,读者可据此评估长流程任务的自动化落地可行性。
Google DeepMind 推出新一代文本转语音模型 Gemini 3.1 Flash TTS,支持通过嵌入自然语言音频标签精细控制语音风格、节奏与表达方式。
推荐理由:模型引入自然语言音频标签实现句内语调和节奏的细粒度控制,为多角色对话生成提供了更直接的参数调节方式。
Google DeepMind 正式推出实时语音模型 Gemini 3.1 Flash Live,提供更高精度、更低延迟以及更自然的语调理解与交互节奏。该模型在 ComplexFuncBench Audio 获得 90.8% 的成绩,开启思考模式后在 Audio MultiChallenge 达到 36.1%,且上下文对话跟踪时长提升至前代两倍。
推荐理由:新模型在多步函数调用与长程推理上给出具体指标,同时强化了声调理解与多轮跟进能力,有助评估语音智能体的落地可用度。
Google DeepMind 推出音乐生成模型 Lyria 3 Pro,支持生成最长 3 分钟的音频,并能根据提示词精准编排前奏、主歌、副歌和过门等音乐结构。
推荐理由:该版本将音乐生成时长扩展至三分针并支持结构化控制,同步落地到了云服务与视频创作工具中。
Google DeepMind 推出面向大规模高吞吐工作流的模型 Gemini 3.1 Flash-Lite,已在 Google AI Studio 和 Vertex AI 开启预览。
推荐理由:原文提供了具体的定价、推理速度提升倍数和基准测试分数,读者可以据此评估高并发任务中的成本与性能权衡。
Google DeepMind 推出最新图像生成模型 Nano Banana 2(Gemini 3.1 Flash Image),在 Flash 级推理速度下提供世界知识与视觉推理能力。
推荐理由:该模型将原本受限于高算力成本的主体一致性与实时检索能力推向轻量快速推理,降低了长流程绘图和营销出图的门槛。
Google 推出新一代核心推理模型 Gemini 3.1 Pro,主打面向复杂任务的高级问题解决能力。在评估新逻辑模式解决能力的 ARC-AGI-2 基准中,该模型取得 77.1% 的验证得分,推理表现达到 3 Pro 的两倍以上。
推荐理由:该模型在 ARC-AGI-2 基准上实现了相比前代翻倍的推理得分,读者可据此评估其在复杂逻辑与智能体工作流中的落地表现。
Google DeepMind 发布 Gemini 3 Deep Think 深度思考模式的重大升级,强化其在科学研究与工程领域的复杂推理能力。基准测试中,该模式在无工具辅助下取得 Humanity's Last Exam 48.4% 和 ARC-AGI-2 84.6% 的成绩,并在国际数学、物理与化学奥林匹克竞赛中展现出金牌水准。
推荐理由:该版本公布了在多项学科竞赛与基准测试中的具体得分,同时将高阶推理能力拓展到了工程应用与开发者接口。
Google DeepMind 推出更新版 Gemini 2.5 Flash 原生音频模型(Gemini 2.5 Flash Native Audio),全面提升了多轮对话、复杂指令遵循以及函数调用能力。
推荐理由:更新侧重于工具调用精度与实时语音同传,为构建低延迟语音智能体和跨语言对话提供了工程参考。
Google DeepMind 正式推出基于 Gemini 3 Pro 构建的高保真图像生成与编辑模型 Nano Banana Pro(Gemini 3 Pro Image),目前已在 Google AI Studio 和 Vertex AI 向开发者开启付费预览。
推荐理由:该模型重点强化了文字渲染与画面物理控制,并支持结合搜索检索生成事实性图表,展示了高保真图像生成的实用落地路径。
Google DeepMind 推出图像生成与编辑模型 Nano Banana Pro(Gemini 3 Pro Image),基于 Gemini 3 Pro 构建并融合推理与实时检索知识。
推荐理由:原文给出了多图角色一致性与多语言文本渲染等具体能力,读者可以据此评估其在设计工作流中的可用度。
Google DeepMind 正式推出 Gemini 3 系列模型,核心模型 Gemini 3 Pro 重点提升了逻辑推理、多模态理解与智能体编程能力。该模型在 Terminal-Bench 2.0 取得 54.2% 得分,并在 WebDev Arena 达到 1487 Elo,同时官方配套推出了跨工作区协作的智能体开发平台 Google Antigravity。
推荐理由:模型强化了终端控制与长上下文视频理解能力,配套智能体平台展示了从单点代码生成走向多智能体协作的落地路径。
Google DeepMind 发布新一代前沿模型 Gemini 3 Pro 预览版,并公布了面向更复杂推理任务的 Gemini 3 Deep Think 模式。
推荐理由:新模型在推理基准与长周期规划上超越前代,开发者可借此评估复杂工具调用与终端编码的落地表现。
Google DeepMind 发布通用 3D 虚拟世界智能体 SIMA 2,以 Gemini 模型为核心,从简单的指令遵循升级为具备目标推理、语言交流与自我提升能力的交互伙伴。
推荐理由:SIMA 2 将 Gemini 作为推理核心,展示了智能体在未见过的虚拟 3D 环境中自主试错与自我提升的具身演进路径。
OpenAI Five 在比赛中连赢两局战胜 Dota 2 世界冠军战队 OG,成为首个在电竞比赛中击败世界冠军的 AI。此前 OpenAI Five 与 DeepMind 的 AlphaStar 虽曾在私下击败过顶尖职业选手,但在现场比赛中失利;本次比赛也是 AI 首次在网络直播中击败电竞职业选手。
推荐理由:原文记录了强化学习系统在公开直播对局中击败人类冠军的里程碑,展现了复杂连续决策环境下的实战表现。