跳到正文

#语音

今日 0 条
9月23日周三
  1. Google DeepMind78

    Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS 语音生成模型

    Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款语音生成模型,支持通过自然语言提示词定制角色声音并对单行台词进行细节导演。

    推荐理由:模型将语音生成拓展为支持自然语言定制与双角色逐行排演的创作工具,有助于降低长音频和多角色配音的制作门槛。

9月16日周三
9月10日周四
8月11日周二
  1. Hugging Face66

    NVIDIA 开源多语言语音合成模型 Magpie TTS

    NVIDIA 开源多语言文本转语音模型 Magpie TTS Multilingual,参数量为 364M 并开放模型权重与生产级 NIM 容器。该模型支持普通话、韩语和阿拉伯语等 12 种语言,在 B200 GPU 上的单流首包音频延迟可达 32ms。技术上采用双帧堆叠与局部 Transformer 架构兼顾吞吐量与音质,旨在帮助开发者在自有基础设施上构建低延迟语音智能体。

    推荐理由:该开源模型通过双帧堆叠与局部注意力降低了首包音频延迟,适合需要自建低延迟多语言语音流水线的团队参考。

6月9日周二
  1. Google DeepMind82

    Google DeepMind 发布 Gemini 3.5 Live Translate 音频模型

    Google DeepMind 发布音频模型 Gemini 3.5 Live Translate,支持 70 多种语言的近实时语音到语音互译。该模型通过流式处理连续生成翻译语音并保留原说话人的语调、语速与音高,全程仅滞后说话人数秒。

    推荐理由:模型通过流式生成将双向同传延迟缩短至数秒并保留原声语调,同时打通了开发者接口与办公终端的集成路径。

5月7日周四
  1. OpenAI68

    OpenAI 在 API 中推出新实时语音模型

    OpenAI 在 API 中推出全新实时语音模型,具备链式推理、翻译和语音转录能力。该模型旨在帮助开发者构建更自然、更智能的实时语音交互体验。

    推荐理由:新模型将推理能力直接融入实时语音交互,为构建低延迟自然语音应用提供了直接入口。

9月21日周三
  1. OpenAI83

    OpenAI 开源语音识别模型 Whisper

    OpenAI 宣布开源名为 Whisper 的神经网络模型,该模型在英语语音识别上达到了接近人类水平的鲁棒性与准确度。

    推荐理由:OpenAI 开源了语音识别模型 Whisper,在英语语音识别任务上达到了接近人类水平的鲁棒性与准确度。