跳到正文

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

最新精选

第 21–40 条 · 共 75 条
4月30日周四
  1. Google DeepMind65

    Google DeepMind 推出 AI 协诊医生研究计划并探索多模态远程医疗

    Google DeepMind 宣布启动 AI 协诊医生研究计划,探索由 AI 智能体在医生监督下协助患者的三方护理模式。该系统基于 Gemini 与 Project Astra 的实时音视频能力构建,在与哈佛及斯坦福合作的远程问诊模拟中,能在实时指导查体的同时通过双智能体架构由规划模块全程监控对话边界。

    推荐理由:原文结合双智能体架构与临床模拟实测,展示了多模态交互在远程问诊和查体指导中的实际边界。

4月28日周二
  1. Hugging Face77

    NVIDIA 发布 Nemotron 3 Nano Omni:支持文档、音视频与智能体的长上下文多模态全能模型

    NVIDIA 正式推出全模态理解模型 Nemotron 3 Nano Omni,原生支持文本、图像、长音视频理解、复杂文档分析以及 GUI 智能体计算机操作。

    推荐理由:该模型结合 Mamba-Transformer-MoE 混合架构与原生音视频编码,为长上下文多模态处理与 GUI 智能体提供了高吞吐量的开源实现方案。

4月16日周四
  1. Hugging Face72

    使用 Sentence Transformers 训练与微调多模态嵌入与重排模型指南

    Hugging Face 介绍了使用 Sentence Transformers 训练和微调多模态嵌入与重排模型的完整流程,支持处理文本、图像、音频与视频等多模态数据。

    推荐理由:文章给出了使用 Sentence Transformers 微调多模态检索模型的完整范式,展示了如何通过梯度缓存与俄罗斯套娃损失低成本提升垂直领域表现。

4月13日周一
  1. Google DeepMind71

    Google DeepMind 发布 Gemini Robotics-ER 1.6:增强具身空间推理与仪表读取能力

    Google DeepMind 推出专为机器人设计的具身推理模型 Gemini Robotics-ER 1.6,大幅增强了空间推理、多视角理解、任务成功检测与复杂仪器读数能力。

    推荐理由:该模型强化了多视角空间指向与工业仪表识别能力,为实体机器人在复杂工业场景中的自主感知和规划提供了可落地的工具调用方案。

4月9日周四
  1. Hugging Face74

    Sentence Transformers v5.4 发布:支持多模态嵌入与重排序模型

    Sentence Transformers 发布 v5.4 版本,正式支持通过统一 API 编码与比对文本、图像、音频和视频等多模态数据。新版本同时涵盖多模态嵌入(SentenceTransformer)与重排序(CrossEncoder)能力,原生适配 Qwen3-VL、Nemotron 等开源模型并支持混合输入。

    推荐理由:该更新统一了文本、图像与音视频的检索与重排序接口,便于开发者直接构建跨模态 RAG 管线。

4月3日周五
  1. Google DeepMind85

    Google DeepMind 发布开源模型 Gemma 4

    Google DeepMind 正式发布 Gemma 4 开源模型系列,提供 E2B、E4B、26B MoE 和 31B Dense 四种尺寸,并采用 Apache 2.0 许可证。

    推荐理由:原文公开了涵盖端侧到桌面规模的四款模型规格与多模态能力,并且改用商业友好的开源许可,方便开发者评估本地部署与二次开发成本。

4月2日周四
  1. Hugging Face88

    Google 推出端侧多模态开源模型 Gemma 4,Hugging Face 同步提供全生态部署支持

    Google DeepMind 正式发布开源多模态模型 Gemma 4 家族,采用 Apache 2.0 协议,支持文本、图像与音频输入,并在 Hugging Face 实现生态同步上线。

    推荐理由:Gemma 4 覆盖 2.3B 到 31B 多个尺寸并支持端侧多模态与扩散文本生成,为本地部署提供了开源基座与多推理引擎支持。

4月1日周三
  1. Hugging Face67

    TII 发布早期融合视觉模型 Falcon Perception 与轻量级 Falcon OCR

    阿联酋技术创新研究院(TII)发布 0.6B 参数的早期融合视觉模型 Falcon Perception,以及 0.3B 参数的端到端文档解析模型 Falcon OCR。

    推荐理由:材料验证了单骨干早期融合架构在开放词表分割与超轻量 OCR 中的可行性,为端侧密集视觉任务提供了极具参考价值的极简设计路线。

3月31日周二
3月29日周日
  1. Google DeepMind70

    Google DeepMind 提出 AI 时代鼠标指针交互,将 Gemini 引入 Chrome 与 Googlebook

    Google DeepMind 公布由 Gemini 驱动的 AI 指针(AI-enabled pointer)原型与交互原则,让用户通过直接指向屏幕内容并配合自然口语完成多模态任务。该系统能捕获光标周围的视觉与语义上下文,将屏幕像素转化为可操作实体,减少撰写复杂提示词的负担。相关能力已开始整合进 Chrome 浏览器,并将以 Magic Pointer 形式登陆 Googlebook。

    推荐理由:Google 将多模态光标理解引入桌面工作流,让交互从纯文本提示词转向结合手势指引与上下文的自然操作。

3月26日周四
  1. Google DeepMind80

    Google DeepMind 发布 Gemini 3.1 Flash Live 实时语音模型

    Google DeepMind 正式推出实时语音模型 Gemini 3.1 Flash Live,提供更高精度、更低延迟以及更自然的语调理解与交互节奏。该模型在 ComplexFuncBench Audio 获得 90.8% 的成绩,开启思考模式后在 Audio MultiChallenge 达到 36.1%,且上下文对话跟踪时长提升至前代两倍。

    推荐理由:新模型在多步函数调用与长程推理上给出具体指标,同时强化了声调理解与多轮跟进能力,有助评估语音智能体的落地可用度。

  2. Google DeepMind74

    Google DeepMind 发布音乐生成模型 Lyria 3 Pro

    Google DeepMind 推出音乐生成模型 Lyria 3 Pro,支持生成最长 3 分钟的音频,并能根据提示词精准编排前奏、主歌、副歌和过门等音乐结构。

    推荐理由:该版本将音乐生成时长扩展至三分针并支持结构化控制,同步落地到了云服务与视频创作工具中。

3月17日周二
  1. Hugging Face61

    H Company 发布高吞吐计算机操作模型 Holotron-12B

    H Company 正式发布多模态计算机操作模型 Holotron-12B,基于 NVIDIA 开源模型后训练构建并已上线 Hugging Face。该模型采用混合 SSM 与注意力架构以减少显存占用,在单张 H100 搭配 vLLM 运行且并发达到 100 时吞吐量达到 8.9k tokens/s,并在 WebVoyager 基准测试中取得 80.5% 的表现。

    推荐理由:该模型结合混合状态空间模型架构优化并发推理,展现了降低显存占用并提升智能体长上下文吞吐量的方法。

3月4日周三
  1. Google DeepMind79

    Google DeepMind 发布 Gemini 3.1 Flash-Lite

    Google DeepMind 推出面向大规模高吞吐工作流的模型 Gemini 3.1 Flash-Lite,已在 Google AI Studio 和 Vertex AI 开启预览。

    推荐理由:原文提供了具体的定价、推理速度提升倍数和基准测试分数,读者可以据此评估高并发任务中的成本与性能权衡。

2月27日周五
2月19日周四
  1. Google DeepMind78

    Gemini 上线音乐生成功能,搭载 Lyria 3 模型支持图文创作

    Google DeepMind 宣布在 Gemini 应用中上线音乐生成测试版,接入最新的音乐生成模型 Lyria 3。用户可通过文本、图片或视频提示词在数秒内生成 30 秒带歌词的音乐片段,并附带 Nano Banana 生成的封面图。所有音频均嵌入 SynthID 水印以供溯源验证,该功能正面向多语言 18 岁以上用户逐步推送,并同步接入 YouTube 的 Dream Track。

    推荐理由:Gemini 整合 Lyria 3 补齐了音频生成能力,用户可直接通过图文提示词快速生成带有防伪水印的短音乐片段。

1月30日周五
  1. Google DeepMind73

    Google DeepMind 推出 Project Genie:基于 Genie 3 的交互式虚拟世界创建原型

    Google DeepMind 宣布向美国年满 18 岁的 Google AI Ultra 订阅用户推出实验性原型 Web 应用 Project Genie,支持用户创建、探索和混剪可交互的虚拟世界。

    推荐理由:官方开放了基于世界模型生成交互式环境的原型工具,读者可以了解世界模型从离线生成走向实时可控探索的实际落地形态。

1月20日周二
  1. Hugging Face74

    Overworld 发布实时交互视频扩散模型 Waypoint-1

    Overworld 推出实时交互视频扩散模型 Waypoint-1,支持根据文本提示词、键盘和鼠标输入实时生成可交互的游戏世界画面,其 2.3B 参数的 Waypoint-1-Small 模型权重已上线 Hugging Face Hub。

    推荐理由:原文给出了交互式视频扩散模型的训练方法与配套推理库设计,读者可以了解控制信号输入和低延迟流式生成的具体实现路径。

1月14日周三