跳到正文

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

最新精选

第 41–60 条 · 共 75 条
1月6日周二
1月5日周一
11月20日周四
  1. Google DeepMind82

    Google DeepMind 发布图像生成模型 Nano Banana Pro(Gemini 3 Pro Image)

    Google DeepMind 正式推出基于 Gemini 3 Pro 构建的高保真图像生成与编辑模型 Nano Banana Pro(Gemini 3 Pro Image),目前已在 Google AI Studio 和 Vertex AI 向开发者开启付费预览。

    推荐理由:该模型重点强化了文字渲染与画面物理控制,并支持结合搜索检索生成事实性图表,展示了高保真图像生成的实用落地路径。

11月19日周三
  1. Google DeepMind90

    Google DeepMind 发布 Gemini 3 系列模型与智能体开发平台 Google Antigravity

    Google DeepMind 正式推出 Gemini 3 系列模型,核心模型 Gemini 3 Pro 重点提升了逻辑推理、多模态理解与智能体编程能力。该模型在 Terminal-Bench 2.0 取得 54.2% 得分,并在 WebDev Arena 达到 1487 Elo,同时官方配套推出了跨工作区协作的智能体开发平台 Google Antigravity。

    推荐理由:模型强化了终端控制与长上下文视频理解能力,配套智能体平台展示了从单点代码生成走向多智能体协作的落地路径。

9月30日周二
  1. OpenAI80

    OpenAI 发布 Sora 2 系统卡

    OpenAI 发布 Sora 2 系统卡,推出新一代前沿视频与音频生成模型。在初代 Sora 的基础上,Sora 2 引入了更精确的物理规律、更清晰的真实感、同步音频、更强的可控性以及更广的风格表现范围。

    推荐理由:原文给出了新一代视频与音频生成模型的改进方向,读者可以据此了解其在物理规律与音视频同步上的能力变化。

9月23日周二
  1. Hugging Face69

    Hugging Face 发布 Smol2Operator:轻量级 GUI 操作智能体后训练方案与开源模型

    Hugging Face 开源 Smol2Operator,提出了一套将轻量级视觉语言模型转化为图形界面自动化智能体的完整后训练方案,并开放了训练配方、数据工具与开源模型。

    推荐理由:该方案展示了小体量视觉模型通过两阶段后训练和统一动作空间建立图形界面操作能力的完整流程,便于低成本复现端侧操作智能体。

8月28日周四
8月7日周四
  1. Hugging Face62

    Hugging Face TRL 全面支持视觉语言模型对齐训练

    Hugging Face 宣布 TRL 库全面支持视觉语言模型(VLM)对齐训练,新增对 MPO、GRPO 及 GSPO 算法的直接支持。更新还将 RLOO、Online DPO 与原生 SFT 扩展至多模态架构,并集成 vLLM 支持在线样本生成,配套提供了完整训练脚本与运行示例。

    推荐理由:TRL 将 GRPO 与 MPO 等强化学习对齐方法标准化引入多模态模型,降低了多模态推理微调的工程落地门槛。

  2. OpenAI86

    OpenAI 推出 GPT-5

    OpenAI 正式推出旗舰 AI 系统 GPT-5。官方表示该模型较以往所有模型在智能水平上均有大幅提升,并在编程、数学、写作、健康及视觉感知等多个领域均具备 SOTA 性能。

6月28日周六
  1. Hugging Face66

    NVIDIA 推出 8B 视觉语言模型 Llama Nemotron Nano VL 并上线 Hugging Face

    NVIDIA 推出专为智能文档处理设计的 8B 视觉语言模型 Llama Nemotron Nano VL,并在 Hugging Face Hub 正式上线。该模型基于 Llama-3.1-8B-Instruct 与 C-RADIOv2-VLM-H 视觉主干构建,在 OCRBench v2 等基准中表现优异,擅长提取发票、合同等复杂文档中的文本、表格与图表结构。

    推荐理由:原文给出了模型在复杂文档解析上的架构设计与评测结果,读者可以据此评估单卡部署轻量级文档多模态方案的可行性。

6月3日周二
  1. Hugging Face72

    Hugging Face 发布开源轻量机器人模型 SmolVLA

    Hugging Face 推出 450M 参数的开源机器人视觉-语言-动作模型 SmolVLA,可直接在消费级硬件及 CPU 上运行。该模型完全基于 LeRobot 社区开源数据集预训练,结合 SmolVLM2 与流匹配动作专家架构,并通过视觉 token 压缩和层跳过优化推理延迟。

    推荐理由:该模型展示了基于轻量架构与低成本社区数据训练机器人策略的路径,显著降低了具身智能的硬件门槛。

4月29日周二
4月9日周三
4月5日周六
3月25日周二
  1. OpenAI78

    OpenAI 发布 GPT-4o 图像生成系统卡附录

    OpenAI 发布 GPT-4o 系统卡补充附录,介绍全新的 4o 图像生成能力。相比早期的 DALL·E 3 系列模型,4o 图像生成能力显著增强,支持生成逼真图像,并能够接收图像输入并进行转换。

    推荐理由:原文指出了 4o 图像生成相比 DALL·E 3 的能力跨越与图像变换特性,读者可据此了解其多模态生成的最新演进。

3月12日周三
  1. Hugging Face83

    Google 发布新一代多模态开权重模型 Gemma 3

    Google 正式发布新一代开权重模型 Gemma 3,提供 1B、4B、12B 和 27B 四种尺寸的基础与指令微调版本。除 1B 纯文本模型具备 32k 上下文外,其余尺寸均原生支持图像与文本多模态理解、140 多种语言以及最高 128k token 上下文窗口。

    推荐理由:模型将多模态能力与长上下文下放到较小参数规模,为端侧设备和轻量化本地部署提供了高性价比选择。

3月11日周二