Hugging Face Blog·· 2022-02-01AI 评分
如何在 🤗 Transformers 中用 Wav2Vec2 对超大文件做自动语音识别
Making automatic speech recognition work on large files with Wav2Vec2 in 🤗 Transformers
Hugging Face 博客介绍了利用 Wav2Vec2 的 CTC 架构特性,通过带 stride 的重叠分块推理,让 ASR 在任意长音频上也能保持高质量识别。只需在 pipeline 中设置 chunk_length_s 和 stride_length_s,即可避免直接处理长文件时的显存溢出,该技巧同样适用于 LM 增强的 Wav2Vec2 模型,并可用于实时推理。
来源:Hugging Face Blog · huggingface.co