跳到正文

#语音

今日 0 条
9月30日周三
  1. Hugging Face63

    Hugging Face 推出 Open TTS Leaderboard:多语言与声音克隆评测榜单

    Hugging Face 推出 Open TTS Leaderboard,使用客观量化指标为开源多语言文本转语音与声音克隆模型建立标准化评测体系。该榜单基于 Qwen3 ASR 测定字词错误率以评估可懂度,结合 WavLM 说话人嵌入衡量克隆相似度,并在 H200 GPU 与 CPU 上测试批量推理速度及流式首包音频延迟。

    推荐理由:传统语音评测依赖人工众包打分且耗时数周,该榜单通过多维客观指标将评估压缩至数小时,方便开发者低成本对比开源模型。

9月23日周三
  1. Google DeepMind78

    Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS 语音生成模型

    Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款语音生成模型,支持通过自然语言提示词定制角色声音并对单行台词进行细节导演。

    推荐理由:模型将语音生成拓展为支持自然语言定制与双角色逐行排演的创作工具,有助于降低长音频和多角色配音的制作门槛。

9月16日周三
9月10日周四
8月11日周二
  1. Hugging Face66

    NVIDIA 开源多语言语音合成模型 Magpie TTS

    NVIDIA 开源多语言文本转语音模型 Magpie TTS Multilingual,参数量为 364M 并开放模型权重与生产级 NIM 容器。该模型支持普通话、韩语和阿拉伯语等 12 种语言,在 B200 GPU 上的单流首包音频延迟可达 32ms。技术上采用双帧堆叠与局部 Transformer 架构兼顾吞吐量与音质,旨在帮助开发者在自有基础设施上构建低延迟语音智能体。

    推荐理由:该开源模型通过双帧堆叠与局部注意力降低了首包音频延迟,适合需要自建低延迟多语言语音流水线的团队参考。

7月15日周三
  1. Hugging Face56

    Real World VoiceEQ 评测基准发布,评估语音 AI 的真实人类交互能力

    Real World VoiceEQ 语音评测基准发布,基于超过 100 万次人类独立评分评估 40 多款主流专有和开源语音模型的真实交互水平。该基准涵盖 ASR、TTS、S2S 与语音理解等领域共 15 个维度和 60 多项指标,依托 Kairos 评测平台构建。评测发现语音模型正走向能力专业化,且多数模型在语气、情绪和停顿等副语言感知上仍落后于表达能力。

6月24日周三
6月9日周二
  1. Google DeepMind82

    Google DeepMind 发布 Gemini 3.5 Live Translate 音频模型

    Google DeepMind 发布音频模型 Gemini 3.5 Live Translate,支持 70 多种语言的近实时语音到语音互译。该模型通过流式处理连续生成翻译语音并保留原说话人的语调、语速与音高,全程仅滞后说话人数秒。

    推荐理由:模型通过流式生成将双向同传延迟缩短至数秒并保留原声语调,同时打通了开发者接口与办公终端的集成路径。

5月7日周四
  1. OpenAI68

    OpenAI 在 API 中推出新实时语音模型

    OpenAI 在 API 中推出全新实时语音模型,具备链式推理、翻译和语音转录能力。该模型旨在帮助开发者构建更自然、更智能的实时语音交互体验。

    推荐理由:新模型将推理能力直接融入实时语音交互,为构建低延迟自然语音应用提供了直接入口。

10月22日周二
9月21日周三
  1. OpenAI83

    OpenAI 开源语音识别模型 Whisper

    OpenAI 宣布开源名为 Whisper 的神经网络模型,该模型在英语语音识别上达到了接近人类水平的鲁棒性与准确度。

    推荐理由:OpenAI 开源了语音识别模型 Whisper,在英语语音识别任务上达到了接近人类水平的鲁棒性与准确度。

7月28日周四
11月15日周一