Google DeepMind 推出 AI 协诊医生研究计划并探索多模态远程医疗
Google DeepMind 宣布启动 AI 协诊医生研究计划,探索由 AI 智能体在医生监督下协助患者的三方护理模式。该系统基于 Gemini 与 Project Astra 的实时音视频能力构建,在与哈佛及斯坦福合作的远程问诊模拟中,能在实时指导查体的同时通过双智能体架构由规划模块全程监控对话边界。
推荐理由:原文结合双智能体架构与临床模拟实测,展示了多模态交互在远程问诊和查体指导中的实际边界。
文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。
Google DeepMind 宣布启动 AI 协诊医生研究计划,探索由 AI 智能体在医生监督下协助患者的三方护理模式。该系统基于 Gemini 与 Project Astra 的实时音视频能力构建,在与哈佛及斯坦福合作的远程问诊模拟中,能在实时指导查体的同时通过双智能体架构由规划模块全程监控对话边界。
推荐理由:原文结合双智能体架构与临床模拟实测,展示了多模态交互在远程问诊和查体指导中的实际边界。
NVIDIA 正式推出全模态理解模型 Nemotron 3 Nano Omni,原生支持文本、图像、长音视频理解、复杂文档分析以及 GUI 智能体计算机操作。
推荐理由:该模型结合 Mamba-Transformer-MoE 混合架构与原生音视频编码,为长上下文多模态处理与 GUI 智能体提供了高吞吐量的开源实现方案。
Hugging Face 介绍了使用 Sentence Transformers 训练和微调多模态嵌入与重排模型的完整流程,支持处理文本、图像、音频与视频等多模态数据。
推荐理由:文章给出了使用 Sentence Transformers 微调多模态检索模型的完整范式,展示了如何通过梯度缓存与俄罗斯套娃损失低成本提升垂直领域表现。
Google DeepMind 推出专为机器人设计的具身推理模型 Gemini Robotics-ER 1.6,大幅增强了空间推理、多视角理解、任务成功检测与复杂仪器读数能力。
推荐理由:该模型强化了多视角空间指向与工业仪表识别能力,为实体机器人在复杂工业场景中的自主感知和规划提供了可落地的工具调用方案。
Sentence Transformers 发布 v5.4 版本,正式支持通过统一 API 编码与比对文本、图像、音频和视频等多模态数据。新版本同时涵盖多模态嵌入(SentenceTransformer)与重排序(CrossEncoder)能力,原生适配 Qwen3-VL、Nemotron 等开源模型并支持混合输入。
推荐理由:该更新统一了文本、图像与音视频的检索与重排序接口,便于开发者直接构建跨模态 RAG 管线。
Google DeepMind 正式发布 Gemma 4 开源模型系列,提供 E2B、E4B、26B MoE 和 31B Dense 四种尺寸,并采用 Apache 2.0 许可证。
推荐理由:原文公开了涵盖端侧到桌面规模的四款模型规格与多模态能力,并且改用商业友好的开源许可,方便开发者评估本地部署与二次开发成本。
Google DeepMind 正式发布开源多模态模型 Gemma 4 家族,采用 Apache 2.0 协议,支持文本、图像与音频输入,并在 Hugging Face 实现生态同步上线。
推荐理由:Gemma 4 覆盖 2.3B 到 31B 多个尺寸并支持端侧多模态与扩散文本生成,为本地部署提供了开源基座与多推理引擎支持。
阿联酋技术创新研究院(TII)发布 0.6B 参数的早期融合视觉模型 Falcon Perception,以及 0.3B 参数的端到端文档解析模型 Falcon OCR。
推荐理由:材料验证了单骨干早期融合架构在开放词表分割与超轻量 OCR 中的可行性,为端侧密集视觉任务提供了极具参考价值的极简设计路线。
IBM 在 Hugging Face 开源轻量级视觉语言模型 Granite 4.0 3B Vision,采用 Apache 2.0 协议发布,主打企业级复杂文档、表格与图表信息抽取。
推荐理由:该模型采用基于密集语言模型的LoRA外挂架构,让同一套企业部署能按需在纯文本与多模态图表解析间灵活切换。
Google DeepMind 公布由 Gemini 驱动的 AI 指针(AI-enabled pointer)原型与交互原则,让用户通过直接指向屏幕内容并配合自然口语完成多模态任务。该系统能捕获光标周围的视觉与语义上下文,将屏幕像素转化为可操作实体,减少撰写复杂提示词的负担。相关能力已开始整合进 Chrome 浏览器,并将以 Magic Pointer 形式登陆 Googlebook。
推荐理由:Google 将多模态光标理解引入桌面工作流,让交互从纯文本提示词转向结合手势指引与上下文的自然操作。
Google DeepMind 正式推出实时语音模型 Gemini 3.1 Flash Live,提供更高精度、更低延迟以及更自然的语调理解与交互节奏。该模型在 ComplexFuncBench Audio 获得 90.8% 的成绩,开启思考模式后在 Audio MultiChallenge 达到 36.1%,且上下文对话跟踪时长提升至前代两倍。
推荐理由:新模型在多步函数调用与长程推理上给出具体指标,同时强化了声调理解与多轮跟进能力,有助评估语音智能体的落地可用度。
Google DeepMind 推出音乐生成模型 Lyria 3 Pro,支持生成最长 3 分钟的音频,并能根据提示词精准编排前奏、主歌、副歌和过门等音乐结构。
推荐理由:该版本将音乐生成时长扩展至三分针并支持结构化控制,同步落地到了云服务与视频创作工具中。
H Company 正式发布多模态计算机操作模型 Holotron-12B,基于 NVIDIA 开源模型后训练构建并已上线 Hugging Face。该模型采用混合 SSM 与注意力架构以减少显存占用,在单张 H100 搭配 vLLM 运行且并发达到 100 时吞吐量达到 8.9k tokens/s,并在 WebVoyager 基准测试中取得 80.5% 的表现。
推荐理由:该模型结合混合状态空间模型架构优化并发推理,展现了降低显存占用并提升智能体长上下文吞吐量的方法。
OpenAI 推出 GPT-5.4 mini 和 nano,作为 GPT-5.4 的轻量且更快速版本。两款模型针对编码、工具调用、多模态推理以及大吞吐量 API 与子智能体工作负载进行了专门优化。
Google DeepMind 推出面向大规模高吞吐工作流的模型 Gemini 3.1 Flash-Lite,已在 Google AI Studio 和 Vertex AI 开启预览。
推荐理由:原文提供了具体的定价、推理速度提升倍数和基准测试分数,读者可以据此评估高并发任务中的成本与性能权衡。
Google DeepMind 推出最新图像生成模型 Nano Banana 2(Gemini 3.1 Flash Image),在 Flash 级推理速度下提供世界知识与视觉推理能力。
推荐理由:该模型将原本受限于高算力成本的主体一致性与实时检索能力推向轻量快速推理,降低了长流程绘图和营销出图的门槛。
Google DeepMind 宣布在 Gemini 应用中上线音乐生成测试版,接入最新的音乐生成模型 Lyria 3。用户可通过文本、图片或视频提示词在数秒内生成 30 秒带歌词的音乐片段,并附带 Nano Banana 生成的封面图。所有音频均嵌入 SynthID 水印以供溯源验证,该功能正面向多语言 18 岁以上用户逐步推送,并同步接入 YouTube 的 Dream Track。
推荐理由:Gemini 整合 Lyria 3 补齐了音频生成能力,用户可直接通过图文提示词快速生成带有防伪水印的短音乐片段。
Google DeepMind 宣布向美国年满 18 岁的 Google AI Ultra 订阅用户推出实验性原型 Web 应用 Project Genie,支持用户创建、探索和混剪可交互的虚拟世界。
推荐理由:官方开放了基于世界模型生成交互式环境的原型工具,读者可以了解世界模型从离线生成走向实时可控探索的实际落地形态。
Overworld 推出实时交互视频扩散模型 Waypoint-1,支持根据文本提示词、键盘和鼠标输入实时生成可交互的游戏世界画面,其 2.3B 参数的 Waypoint-1-Small 模型权重已上线 Hugging Face Hub。
推荐理由:原文给出了交互式视频扩散模型的训练方法与配套推理库设计,读者可以了解控制信号输入和低延迟流式生成的具体实现路径。
Google DeepMind 宣布升级 Veo 3.1 的 Ingredients to Video(图生视频)功能,支持基于参考图生成更具表现力的视频片段。
推荐理由:该更新通过原生竖屏和跨场景角色一致性强化了短视频叙事能力,创作者可借此降低多镜头内容制作的拼接成本。