跳到正文
原文
Hugging Face·· 2021-03-12精选AI 评分62

在 Hugging Face Transformers 中微调 Wav2Vec2 英文语音识别模型教程

Fine-Tune Wav2Vec2 for English ASR in Hugging Face with 🤗 Transformers

AI 导读

Hugging Face 发布了在 Transformers 中微调 Wav2Vec2 预训练模型用于英文语音识别的完整教程。指南以 5 小时训练数据的 Timit 数据集为例,在不接入外部语言模型的情况下结合 CTC 算法训练端到端声学模型,实现了 22.1% 的词错误率。文章涵盖了词表构建、音频特征提取、动态批填充以及将检查点推送到 Hub 的完整代码实现。

推荐理由

教程展示了无需外接语言模型、仅靠CTC微调端到端声学模型的完整流程,提供了可直接复用的数据处理与动态批填充实现方案。

来源:Hugging Face · huggingface.co