Monsoon孟加拉语数据微调使WER降至7.65%
先了解这件事
2026年10月9日,DAIR.AI的Elvis Saravia与Rohan Paul先后在X发文,讨论voicearena_ai的Monsoon语料库在弱语言(低资源语言)ASR上的成果。Saravia指出,仅一次微调就让孟加拉语的词错误率(WER)从约85%降至7.65%,并称这一数字解释了为何一周内有80家实验室申请授权Monsoon;他强调voicearena_ai的规则是只有当数据集能带来显著提升时才构建,称多数数据供应商做不到这一点。Rohan Paul随后发文称,对于弱语言ASR,更多训练数据往往胜过更大的模型,Monsoon即为voicearena_ai的ASS语料库;在Monsoon上微调的Whisper Medium(769M参数)在孟加拉语FLEURS上的LLM词错误率从85.27%降至7.65%。他强调Whisper Medium足够小,可低成本部署,在许多场景下也能靠近用户运行。两篇发文在数字与结论上相互印证,未见矛盾。
报道时间线
- 弱语言ASR:更多数据胜过大模型
对于弱语言的 ASR(自动语音识别),更多训练数据往往胜过更大的模型。 @voicearena_ai 的孟加拉语结果就证明了这一点,Monsoon 是其 ASS 语料库。 在 Monsoon 上微调的 Whisper Medium,在孟加拉语 FLEURS 上的 LLM 词错误率从 85.27% 降至 7.65%。 Medium 是 769M 参数的 Whisper。足够小,可以低成本部署,在许多场景下也足够小,可以靠近用户运行。
- Monsoon微调使孟加拉语WER降至7.65%
一次微调就让孟加拉语的WER从85%降到7.65%。 这样的数字就是为什么一周内有80家实验室申请授权Monsoon。我最尊重的是其背后的规则:@voicearena_ai 只有在数据集能带来显著提升时才会构建。大多数数据供应商做不到这一点。