跳到正文
原文
Hugging Face Blog·· 2022-02-01AI 评分40

如何在 🤗 Transformers 中用 Wav2Vec2 对超大文件做自动语音识别

Making automatic speech recognition work on large files with Wav2Vec2 in 🤗 Transformers

AI 导读

Hugging Face 博客介绍了利用 Wav2Vec2 的 CTC 架构特性,通过带 stride 的重叠分块推理,让 ASR 在任意长音频上也能保持高质量识别。只需在 pipeline 中设置 chunk_length_s 和 stride_length_s,即可避免直接处理长文件时的显存溢出,该技巧同样适用于 LM 增强的 Wav2Vec2 模型,并可用于实时推理。

来源:Hugging Face Blog · huggingface.co