Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS 语音生成模型
Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款语音生成模型,支持通过自然语言提示词定制角色声音并对单行台词进行细节导演。
推荐理由:模型将语音生成拓展为支持自然语言定制与双角色逐行排演的创作工具,有助于降低长音频和多角色配音的制作门槛。
Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款语音生成模型,支持通过自然语言提示词定制角色声音并对单行台词进行细节导演。
推荐理由:模型将语音生成拓展为支持自然语言定制与双角色逐行排演的创作工具,有助于降低长音频和多角色配音的制作门槛。
Google DeepMind 正式推出 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时对话模型,主打低延迟语音交互与复杂任务推理。
推荐理由:模型展示了边推理边对话的并行能力与后台工具调用机制,为复杂语音智能体的工程落地提供了参考。
OpenAI 在 API 中推出 GPT‑Live‑1 模型,为开发者提供自然的全双工语音对话能力。该模型具备更强的指令遵循表现,并支持自定义声音和电话通信集成。
推荐理由:原文给出了全双工语音模型的新功能点,开发者可据此评估其在电话支持与自定义声音场景下的适用度。
NVIDIA 开源多语言文本转语音模型 Magpie TTS Multilingual,参数量为 364M 并开放模型权重与生产级 NIM 容器。该模型支持普通话、韩语和阿拉伯语等 12 种语言,在 B200 GPU 上的单流首包音频延迟可达 32ms。技术上采用双帧堆叠与局部 Transformer 架构兼顾吞吐量与音质,旨在帮助开发者在自有基础设施上构建低延迟语音智能体。
推荐理由:该开源模型通过双帧堆叠与局部注意力降低了首包音频延迟,适合需要自建低延迟多语言语音流水线的团队参考。
Google DeepMind 发布音频模型 Gemini 3.5 Live Translate,支持 70 多种语言的近实时语音到语音互译。该模型通过流式处理连续生成翻译语音并保留原说话人的语调、语速与音高,全程仅滞后说话人数秒。
推荐理由:模型通过流式生成将双向同传延迟缩短至数秒并保留原声语调,同时打通了开发者接口与办公终端的集成路径。
OpenAI 在 API 中推出全新实时语音模型,具备链式推理、翻译和语音转录能力。该模型旨在帮助开发者构建更自然、更智能的实时语音交互体验。
推荐理由:新模型将推理能力直接融入实时语音交互,为构建低延迟自然语音应用提供了直接入口。
OpenAI 宣布开源名为 Whisper 的神经网络模型,该模型在英语语音识别上达到了接近人类水平的鲁棒性与准确度。
推荐理由:OpenAI 开源了语音识别模型 Whisper,在英语语音识别任务上达到了接近人类水平的鲁棒性与准确度。