跳到正文

语音与音频

AI 语音与音频的进展:语音合成、实时对话、音乐生成与音频理解的模型与产品。

27条精选相关主题多模态AI 视频产品更新

最新精选

第 21–27 条 · 共 27 条
3月29日周五
2月27日周二
  1. Hugging Face69

    Hugging Face 推出语音模型盲测平台 TTS Arena

    Hugging Face 宣布推出 TTS Arena,通过社区盲测与类 Elo 评分机制对文本转语音模型进行对比排行。用户输入文本后盲测试听两款模型的生成效果并投票,系统在提交后揭示模型名称并更新榜单。首批入选模型包括商业模型 ElevenLabs 以及 MetaVoice、OpenVoice、Pheme、WhisperSpeech 和 XTTS 等开源方案。

    推荐理由:平台借鉴盲测竞技场机制解决语音合成主观评估难的问题,为开发者比较开源与闭源语音模型提供了统一参考。

2月26日周一
  1. Hugging Face60

    Hugging Face 详解 AI 水印技术与工具:覆盖图像、文本与音频全模态

    Hugging Face 发文梳理 AI 生成内容的水印与溯源技术,系统拆解图像、文本与音频三大模态的加水印机制与检测方案。文章对比了生成阶段直接嵌入与生成后标记两种实现路径,介绍了 Nightshade 数据投毒、Truepic C2PA 凭证、TGI 文本水印以及 AudioSeal 音频水印等工具。

    推荐理由:梳理了图像、文本和音频生成内容的水印与检测机制,读者可以据此系统了解不同模态防伪溯源的工程实现方案。

12月20日周三
  1. Hugging Face73

    利用投机解码将 Whisper 推理速度提升 2 倍

    Hugging Face 展示了如何将投机解码应用于 Whisper 语音转录,在保证输出完全一致的前提下将推理速度提升 2 倍。在英语场景中,使用 6 倍速的 distil-large-v2 作为辅助模型仅增加 8% 显存即可实现 2.2 倍加速,多语种搭配 Whisper tiny 也可提速 1.9 倍。该方案最适合较小的 batch size,当批大小超过 4 时加速收益会逐渐消失。

    推荐理由:介绍了用蒸馏或小模型作为辅助草稿模型的投机解码方案,为现有语音转录流水线提供了零精度损失的提速工程参考。

9月25日周一
8月30日周三
  1. Hugging Face61

    AudioLDM 2 推理加速指南:利用 Diffusers 将生成时间缩短至 1 秒内

    Hugging Face 介绍了在 Diffusers 库中加速文本生成音频模型 AudioLDM 2 的多项优化方案,成功将 10 秒音频样本的生成耗时从 14 秒缩短至 1 秒以内。

    推荐理由:文章系统梳理了扩散音频模型从调度器替换、编译到显存卸载的完整提速步骤,方法可直接复用到其他基于 Diffusers 的生成任务。

9月21日周三
  1. OpenAI83

    OpenAI 开源语音识别模型 Whisper

    OpenAI 宣布开源名为 Whisper 的神经网络模型,该模型在英语语音识别上达到了接近人类水平的鲁棒性与准确度。

    推荐理由:OpenAI 开源了语音识别模型 Whisper,在英语语音识别任务上达到了接近人类水平的鲁棒性与准确度。