OpenAI 推出 gpt-realtime 模型并升级 Realtime API
OpenAI 推出更先进的语音到语音模型 gpt-realtime,并为 Realtime API 带来多项功能更新。新 API 支持接入 MCP 服务端、图像输入以及 SIP 电话呼叫功能。
推荐理由:该模型在语音实时交互基础上接入了MCP协议、图像输入和电话呼叫支持,为语音智能体扩展了多模态与工程落地路径。
新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。
OpenAI 推出更先进的语音到语音模型 gpt-realtime,并为 Realtime API 带来多项功能更新。新 API 支持接入 MCP 服务端、图像输入以及 SIP 电话呼叫功能。
推荐理由:该模型在语音实时交互基础上接入了MCP协议、图像输入和电话呼叫支持,为语音智能体扩展了多模态与工程落地路径。
NVIDIA 开源了包含 600 万条样本的 Nemotron 后训练多语言推理数据集,并推出 9B 参数的 Nemotron Nano 2 端侧模型。该数据集将提示词和回答翻译至法、德、意、日、西五种语言并保留英文链式推理,通过逐行翻译与输出格式标记过滤幻觉数据。
推荐理由:原文公开了基于开源大模型构建多语言推理数据的格式约束与过滤方案,为合成数据清洗提供了实用参考。
OpenAI 正式在 API 平台面向开发者推出 GPT-5。该模型具备高推理性能,为开发者提供了新的控制项,并在实际编码任务中表现突出。
推荐理由:官方在 API 平台面向开发者推出 GPT-5,重点突出推理能力、开发者控制项以及真实编程任务表现。
OpenAI 正式推出旗舰 AI 系统 GPT-5。官方表示该模型较以往所有模型在智能水平上均有大幅提升,并在编程、数学、写作、健康及视觉感知等多个领域均具备 SOTA 性能。
OpenAI 正式发布开源开放权重模型家族 GPT OSS,包含 117B 参数的 gpt-oss-120b 和 21B 参数的 gpt-oss-20b 两款 MoE 架构纯文本推理模型,采用 Apache 2.0 许可证。
推荐理由:原文详细梳理了该系列模型的量化方案、显存门槛以及在主流推理框架中的适配方法,适合需要本地部署或微调的开发者参考。
OpenAI 推出 gpt-oss-120b 和 gpt-oss-20b 两款开源权重推理模型。两款模型在 Apache 2.0 许可证和 gpt-oss 使用政策下分发,并公开了对应的模型卡文档。
推荐理由:OpenAI 开放了两款不同参数规模的开源权重推理模型并采用 Apache 2.0 协议,为本地部署与推理研究提供了新选择。
OpenAI 正式发布开源权重语言模型 gpt-oss-120b 与 gpt-oss-20b,采用 Apache 2.0 许可证。两款模型在同尺寸开源模型的推理任务中表现更优,具备强大的工具调用能力,并针对消费级硬件上的高效部署进行了优化。
推荐理由:模型采用宽松开源协议并在消费级硬件优化部署,为开发者低成本构建兼具推理与工具调用能力的本地应用提供了参考。
Hugging Face 推出 Ettin 模型套件,包含 17M 至 1B 参数量的成对 Encoder 与 Decoder 模型,两者均采用完全相同的 2T tokens 开源数据和三阶段训练配方。
推荐理由:该套件在完全相同的开源数据与配放下成对训练编码器和解码器,为严格对比两种架构在判别与生成任务上的本质优劣提供了对齐基准。
Hugging Face 正式发布完全开源的 3B 规模模型 SmolLM3,包含基础模型与支持双模式推理的指令微调版本,并同步公开了完整训练配方。该模型在 11.2T token 上训练完成,支持英法德意西葡 6 种语言,并利用 NoPE 和 YaRN 将推理上下文扩展至最高 128k。
推荐理由:原文完整公开了小模型三阶段预训练与双模式推理的工程配方,为轻量端侧模型的复现与训练优化提供了可迁移参考。
NVIDIA 推出专为智能文档处理设计的 8B 视觉语言模型 Llama Nemotron Nano VL,并在 Hugging Face Hub 正式上线。该模型基于 Llama-3.1-8B-Instruct 与 C-RADIOv2-VLM-H 视觉主干构建,在 OCRBench v2 等基准中表现优异,擅长提取发票、合同等复杂文档中的文本、表格与图表结构。
推荐理由:原文给出了模型在复杂文档解析上的架构设计与评测结果,读者可以据此评估单卡部署轻量级文档多模态方案的可行性。
Hugging Face 推出 450M 参数的开源机器人视觉-语言-动作模型 SmolVLA,可直接在消费级硬件及 CPU 上运行。该模型完全基于 LeRobot 社区开源数据集预训练,结合 SmolVLM2 与流匹配动作专家架构,并通过视觉 token 压缩和层跳过优化推理延迟。
推荐理由:该模型展示了基于轻量架构与低成本社区数据训练机器人策略的路径,显著降低了具身智能的硬件门槛。
Meta 发布 12B 稠密多模态安全模型 Llama Guard 4 及两款 Prompt Guard 2 模型,相关模型权重已上线 Hugging Face Hub。
推荐理由:原文给出了模型剪枝架构、审核基准测试对比以及使用代码,读者可直接参考其多模态审核流水线设计。
OpenAI 宣布其最新图像生成模型已通过 gpt-image-1 正式上线 API。开发者与企业可直接将其集成到自有工具和平台中,用于构建专业级且可自定义的视觉内容。
推荐理由:OpenAI 将最新图像模型 gpt-image-1 接入 API,方便开发者直接在自有产品中集成可定制的专业视觉生成能力。
OpenAI 正式推出 o3 与 o4-mini 模型。官方称其为迄今最智能、能力最强的模型,并具备完整的工具调用支持。
OpenAI 宣布在 API 中正式推出 GPT-4.1 模型系列,即日起面向全球开发者开放。该系列实现全面能力提升,在编码、指令遵循与长上下文理解方面进步显著,同时官方还推出了首款 nano 模型。
推荐理由:原文公布了新模型在代码、指令遵循及长上下文能力上的提升,并带来轻量 nano 版本供开发者选用。
Meta 正式推出原生多模态 MoE 架构模型 Llama 4 Maverick(~400B)与 Scout(~109B),Hugging Face 同步在 Hub、transformers 和 TGI 中提供全面集成支持。
推荐理由:文章详细梳理了交替分块注意力等长文本架构细节,并提供了在 transformers 中加载调用的完整代码。
Google 正式发布新一代开权重模型 Gemma 3,提供 1B、4B、12B 和 27B 四种尺寸的基础与指令微调版本。除 1B 纯文本模型具备 32k 上下文外,其余尺寸均原生支持图像与文本多模态理解、140 多种语言以及最高 128k token 上下文窗口。
推荐理由:模型将多模态能力与长上下文下放到较小参数规模,为端侧设备和轻量化本地部署提供了高性价比选择。
OpenAI 发布 GPT-4.5 研究预览版及系统卡片。该模型被 OpenAI 称为其迄今为止规模最大、知识储备最丰富的模型。
Hugging Face 推出轻量级多模态模型 SmolVLM2 系列,包含 2.2B、500M 和 256M 三种参数规格,旨在让视频理解能力运行在从手机到服务器的各类设备上。
推荐理由:官方将视频理解能力压缩至轻量级模型并适配端侧框架,为移动端本地视频分析与多模态部署提供了低显存方案。
Google 正式发布多模态视觉语言模型 PaliGemma 2,将 SigLIP 视觉编码器与 Gemma 2 解码器结合,并在 Hugging Face 同步上线。
推荐理由:原文梳理了模型升级细节并给出量化实测数据,读者可以据此评估多模态微调与部署方案。