Google DeepMind 在 Gemini 3.5 Flash 中原生集成计算机使用能力
Google DeepMind 宣布在 Gemini 3.5 Flash 中原生内置计算机使用能力(Computer use),开发者可借此构建跨浏览器、移动端和桌面环境查看与操作的 AI 智能体。
推荐理由:计算机操作能力从独立模型原生整合进主力 Flash 模型,开发者可通过 API 直接构建跨平台自动化智能体并调用企业安全防护系统。
Google 与 DeepMind 的 AI 动态:Gemini 系列、Veo 视频模型、研究成果与产品生态的持续追踪。
Google DeepMind 宣布在 Gemini 3.5 Flash 中原生内置计算机使用能力(Computer use),开发者可借此构建跨浏览器、移动端和桌面环境查看与操作的 AI 智能体。
推荐理由:计算机操作能力从独立模型原生整合进主力 Flash 模型,开发者可通过 API 直接构建跨平台自动化智能体并调用企业安全防护系统。
Hugging Face 与 Microsoft、Google 等合作推出开放草案规范 Agentic Resource Discovery(ARD),并上线参考实现 Discover Tool,让 AI 智能体能在运行时动态搜索并调用外部工具与技能。
推荐理由:针对现有智能体依赖手动预装工具的痛点,该规范给出了运行时的统一发现层,便于在联邦注册表中动态检索扩展能力。
Google DeepMind 发布音频模型 Gemini 3.5 Live Translate,支持 70 多种语言的近实时语音到语音互译。该模型通过流式处理连续生成翻译语音并保留原说话人的语调、语速与音高,全程仅滞后说话人数秒。
推荐理由:模型通过流式生成将双向同传延迟缩短至数秒并保留原声语调,同时打通了开发者接口与办公终端的集成路径。
Google DeepMind 正式推出多模态模型 Gemma 4 12B,采用无编码器的统一架构,使视觉与原生音频输入直接融入大语言模型主干进行处理。该模型在标准基准上的性能接近 26B MoE 模型,显存占用减半且仅需 16GB 内存即可在笔记本本地流畅运行。
推荐理由:该模型舍弃了独立多模态编码器并将音频与视觉直接投影至大语言模型主干,为在消费级硬件上低显存部署多模态智能体提供了轻量架构参考。
Google DeepMind 公布了在塞拉利昂开展的预注册对照试验结果,使用基于 LearnLM 定制的 Guided Learning 辅助教学让学生的数学成绩提升 0.258 个标准差,相当于在 8 周内取得了 1.2 至 1.7 年的学习进度。
推荐理由:该研究通过随机对照试验量化了苏格拉底式 AI 辅导对学生数学成绩的促进作用,为教育场景下的模型落地提供了实证数据与操作手册。
Google DeepMind 宣布在世界模型实验原型 Project Genie 中上线 Street View 锚定功能,并逐步向全球 Google AI Ultra 订阅者开放。用户可选择美国境内地点并结合自定义风格与角色,生成基于真实街景图像的可交互虚拟环境。该能力由 Maps Imagery Grounding 技术支持,旨在为 AI 智能体与机器人提供更贴近现实的交互仿真环境。
推荐理由:原文展示了通用世界模型 Genie 结合街景生成可交互真实场景的能力,有助于了解世界模型在环境仿真中的落地进展。
Google DeepMind 正式推出 Gemini Omni 系列及首个模型 Gemini Omni Flash,支持将图像、音频、视频与文本任意组合作为输入并生成高质量视频。
推荐理由:官方展示了将文本、图像、音频与视频任意组合生成高质量视频的能力,多轮自然语言对话即可直接连续编辑视频画面。
Google DeepMind 推出科学工具与实验集合 Gemini for Science,旨在通过通用智能体加速科研探索。套件在 Google Labs 推出三项实验工具,涵盖基于 Co-Scientist 的假设生成、基于 AlphaEvolve 与 ERA 的并行计算发现,以及基于 NotebookLM 的文献结构化洞察。
推荐理由:文章详细梳理了多智能体与算法工具在假说生成、计算实验与文献分析中的具体机制,展现了AI介入科研全流程的工程路径。
Google 宣布扩展内容透明度与验证工具,将 SynthID 数字水印与 C2PA 内容凭证整合进 Search、Gemini、Chrome、Pixel 及 Google Cloud。
推荐理由:Google 将水印和凭据验证从模型生成延伸至系统与应用层,有助于降低跨平台识别生成式内容的门槛。
斯坦福大学医学院团队在《Advanced Science》发表研究,利用 Google DeepMind 的 Co-Scientist 系统从现有药物文献中筛选治疗肝纤维化的老药新用候选药。
推荐理由:该研究给出了 AI 系统筛选老药新用并在活体人类细胞中实验验证的对比数据,为科研智能体在生物医药发现中的实际表现提供了直接参考。
Google DeepMind 研发的 AI 气象模型 WeatherNext 协助美国国家飓风中心提前 5 天预测出飓风 Melissa 将快速增强并以 5 级强度登陆牙买加,为当地防灾疏散提供了关键预警窗口。
推荐理由:展示了气象模型在风暴路径与强度协同预测中的实战表现,读者可了解集合预报机制在防灾减灾决策中的具体落地方式。
Google DeepMind 正式推出 Gemini 3.5 系列模型并首发 Gemini 3.5 Flash,主打复杂长流程智能体工作流与编码任务。该模型在 Terminal-Bench 2.1 达 76.2%、GDPval-AA 达 1656 Elo、MCP Atlas 达 83.6%,生成速度达其他前沿模型的 4 倍且成本大幅降低。
推荐理由:该模型在保持高速低成本的同时大幅提升了智能体与编码基准得分,读者可据此评估长流程任务的自动化落地可行性。
Google DeepMind 推出基于 Gemini 构建的科研多智能体系统 Co-Scientist,用于在生命科学等领域自主生成、论证与迭代科研假说,相关成果已在 Nature 发表。
推荐理由:系统利用多智能体辩论与天梯淘汰机制演进科学假说,读者可以了解大模型如何从文献检索走向严密的端到端科研推导。
Google DeepMind 复盘了基于 Gemini 的算法设计编程智能体 AlphaEvolve 的落地成果,展示其在科学研究、基础设施与商业业务中的多项突破。
推荐理由:原文汇总了编程智能体跨学科落地的具体实测数据,读者可以参考它如何从纯算法探索延展至底层硬件与工业场景。
Google DeepMind 宣布启动 AI 协诊医生研究计划,探索由 AI 智能体在医生监督下协助患者的三方护理模式。该系统基于 Gemini 与 Project Astra 的实时音视频能力构建,在与哈佛及斯坦福合作的远程问诊模拟中,能在实时指导查体的同时通过双智能体架构由规划模块全程监控对话边界。
推荐理由:原文结合双智能体架构与临床模拟实测,展示了多模态交互在远程问诊和查体指导中的实际边界。
Google DeepMind 推出新一代文本转语音模型 Gemini 3.1 Flash TTS,支持通过嵌入自然语言音频标签精细控制语音风格、节奏与表达方式。
推荐理由:模型引入自然语言音频标签实现句内语调和节奏的细粒度控制,为多角色对话生成提供了更直接的参数调节方式。
Google DeepMind 推出专为机器人设计的具身推理模型 Gemini Robotics-ER 1.6,大幅增强了空间推理、多视角理解、任务成功检测与复杂仪器读数能力。
推荐理由:该模型强化了多视角空间指向与工业仪表识别能力,为实体机器人在复杂工业场景中的自主感知和规划提供了可落地的工具调用方案。
Google DeepMind 正式发布 Gemma 4 开源模型系列,提供 E2B、E4B、26B MoE 和 31B Dense 四种尺寸,并采用 Apache 2.0 许可证。
推荐理由:原文公开了涵盖端侧到桌面规模的四款模型规格与多模态能力,并且改用商业友好的开源许可,方便开发者评估本地部署与二次开发成本。
Google DeepMind 正式发布开源多模态模型 Gemma 4 家族,采用 Apache 2.0 协议,支持文本、图像与音频输入,并在 Hugging Face 实现生态同步上线。
推荐理由:Gemma 4 覆盖 2.3B 到 31B 多个尺寸并支持端侧多模态与扩散文本生成,为本地部署提供了开源基座与多推理引擎支持。
Google DeepMind 公布由 Gemini 驱动的 AI 指针(AI-enabled pointer)原型与交互原则,让用户通过直接指向屏幕内容并配合自然口语完成多模态任务。该系统能捕获光标周围的视觉与语义上下文,将屏幕像素转化为可操作实体,减少撰写复杂提示词的负担。相关能力已开始整合进 Chrome 浏览器,并将以 Magic Pointer 形式登陆 Googlebook。
推荐理由:Google 将多模态光标理解引入桌面工作流,让交互从纯文本提示词转向结合手势指引与上下文的自然操作。