NVIDIA 发布具身智能推理视觉语言模型 Cosmos Reason 2
NVIDIA 发布面向物理 AI 的开源推理视觉语言模型 Cosmos Reason 2,登顶 Physical AI Bench 和 Physical Reasoning 榜单。
推荐理由:原文给出了模型参数规模与上下文窗口升级细节,读者可以据此评估其在机器人规划与端云部署上的适配度。
文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。
NVIDIA 发布面向物理 AI 的开源推理视觉语言模型 Cosmos Reason 2,登顶 Physical AI Bench 和 Physical Reasoning 榜单。
推荐理由:原文给出了模型参数规模与上下文窗口升级细节,读者可以据此评估其在机器人规划与端云部署上的适配度。
Hugging Face 发布了一份实操指南,演示如何利用 NVIDIA DGX Spark 与开源机器人 Reachy Mini 及其仿真器构建桌面多模态 AI 智能体。
推荐理由:文章给出了结合意图路由、多模态流处理与实体硬件仿真的完整搭建步骤,为本地具身智能体开发提供了清晰的模块化参考架构。
Google DeepMind 正式推出基于 Gemini 3 Pro 构建的高保真图像生成与编辑模型 Nano Banana Pro(Gemini 3 Pro Image),目前已在 Google AI Studio 和 Vertex AI 向开发者开启付费预览。
推荐理由:该模型重点强化了文字渲染与画面物理控制,并支持结合搜索检索生成事实性图表,展示了高保真图像生成的实用落地路径。
Google DeepMind 推出图像生成与编辑模型 Nano Banana Pro(Gemini 3 Pro Image),基于 Gemini 3 Pro 构建并融合推理与实时检索知识。
推荐理由:原文给出了多图角色一致性与多语言文本渲染等具体能力,读者可以据此评估其在设计工作流中的可用度。
Google DeepMind 正式推出 Gemini 3 系列模型,核心模型 Gemini 3 Pro 重点提升了逻辑推理、多模态理解与智能体编程能力。该模型在 Terminal-Bench 2.0 取得 54.2% 得分,并在 WebDev Arena 达到 1487 Elo,同时官方配套推出了跨工作区协作的智能体开发平台 Google Antigravity。
推荐理由:模型强化了终端控制与长上下文视频理解能力,配套智能体平台展示了从单点代码生成走向多智能体协作的落地路径。
Google DeepMind 发布新一代前沿模型 Gemini 3 Pro 预览版,并公布了面向更复杂推理任务的 Gemini 3 Deep Think 模式。
推荐理由:新模型在推理基准与长周期规划上超越前代,开发者可借此评估复杂工具调用与终端编码的落地表现。
OpenAI 推出新一代视频生成模型 Sora 2,支持同步对话与音效生成。文内同时注明 Sora 原产品已不再可用。
OpenAI 发布 Sora 2 系统卡,推出新一代前沿视频与音频生成模型。在初代 Sora 的基础上,Sora 2 引入了更精确的物理规律、更清晰的真实感、同步音频、更强的可控性以及更广的风格表现范围。
推荐理由:原文给出了新一代视频与音频生成模型的改进方向,读者可以据此了解其在物理规律与音视频同步上的能力变化。
Hugging Face 开源 Smol2Operator,提出了一套将轻量级视觉语言模型转化为图形界面自动化智能体的完整后训练方案,并开放了训练配方、数据工具与开源模型。
推荐理由:该方案展示了小体量视觉模型通过两阶段后训练和统一动作空间建立图形界面操作能力的完整流程,便于低成本复现端侧操作智能体。
OpenAI 推出更先进的语音到语音模型 gpt-realtime,并为 Realtime API 带来多项功能更新。新 API 支持接入 MCP 服务端、图像输入以及 SIP 电话呼叫功能。
推荐理由:该模型在语音实时交互基础上接入了MCP协议、图像输入和电话呼叫支持,为语音智能体扩展了多模态与工程落地路径。
Hugging Face 宣布 TRL 库全面支持视觉语言模型(VLM)对齐训练,新增对 MPO、GRPO 及 GSPO 算法的直接支持。更新还将 RLOO、Online DPO 与原生 SFT 扩展至多模态架构,并集成 vLLM 支持在线样本生成,配套提供了完整训练脚本与运行示例。
推荐理由:TRL 将 GRPO 与 MPO 等强化学习对齐方法标准化引入多模态模型,降低了多模态推理微调的工程落地门槛。
OpenAI 正式推出旗舰 AI 系统 GPT-5。官方表示该模型较以往所有模型在智能水平上均有大幅提升,并在编程、数学、写作、健康及视觉感知等多个领域均具备 SOTA 性能。
NVIDIA 推出专为智能文档处理设计的 8B 视觉语言模型 Llama Nemotron Nano VL,并在 Hugging Face Hub 正式上线。该模型基于 Llama-3.1-8B-Instruct 与 C-RADIOv2-VLM-H 视觉主干构建,在 OCRBench v2 等基准中表现优异,擅长提取发票、合同等复杂文档中的文本、表格与图表结构。
推荐理由:原文给出了模型在复杂文档解析上的架构设计与评测结果,读者可以据此评估单卡部署轻量级文档多模态方案的可行性。
Hugging Face 推出 450M 参数的开源机器人视觉-语言-动作模型 SmolVLA,可直接在消费级硬件及 CPU 上运行。该模型完全基于 LeRobot 社区开源数据集预训练,结合 SmolVLM2 与流匹配动作专家架构,并通过视觉 token 压缩和层跳过优化推理延迟。
推荐理由:该模型展示了基于轻量架构与低成本社区数据训练机器人策略的路径,显著降低了具身智能的硬件门槛。
Meta 发布 12B 稠密多模态安全模型 Llama Guard 4 及两款 Prompt Guard 2 模型,相关模型权重已上线 Hugging Face Hub。
推荐理由:原文给出了模型剪枝架构、审核基准测试对比以及使用代码,读者可直接参考其多模态审核流水线设计。
Hugging Face 宣布与 Cloudflare 达成合作,为 FastRTC 开发者接入 Cloudflare 覆盖全球 335 多个节点的 WebRTC 与 TURN 基础设施。
推荐理由:这项合作让开发者无需自建维护 TURN 服务器即可通过 Python 构建实时音视频 AI 应用,并获得每月 10GB 免费流量。
Meta 正式推出原生多模态 MoE 架构模型 Llama 4 Maverick(~400B)与 Scout(~109B),Hugging Face 同步在 Hub、transformers 和 TGI 中提供全面集成支持。
推荐理由:文章详细梳理了交替分块注意力等长文本架构细节,并提供了在 transformers 中加载调用的完整代码。
OpenAI 发布 GPT-4o 系统卡补充附录,介绍全新的 4o 图像生成能力。相比早期的 DALL·E 3 系列模型,4o 图像生成能力显著增强,支持生成逼真图像,并能够接收图像输入并进行转换。
推荐理由:原文指出了 4o 图像生成相比 DALL·E 3 的能力跨越与图像变换特性,读者可据此了解其多模态生成的最新演进。
Google 正式发布新一代开权重模型 Gemma 3,提供 1B、4B、12B 和 27B 四种尺寸的基础与指令微调版本。除 1B 纯文本模型具备 32k 上下文外,其余尺寸均原生支持图像与文本多模态理解、140 多种语言以及最高 128k token 上下文窗口。
推荐理由:模型将多模态能力与长上下文下放到较小参数规模,为端侧设备和轻量化本地部署提供了高性价比选择。
Yaak 联合 Hugging Face 的 LeRobot 团队发布开源自动驾驶数据集 Learning to Drive(L2D),专为端到端空间智能与自动驾驶模型训练设计。
推荐理由:数据集结合了驾校教练与学员的双重策略与自然语言指令,为端到端自动驾驶模型提供了大规模真实训练基准。