跳到正文
原文
rohanpaul_ai· @rohanpaul_ai · X·· 11 小时前AI 评分41

smallest AI 在 VoiceArena 语音基准登顶

AI 导读

smallest AI 在 VoiceArena 的说话人分离(diarization)+ ASR 基准上夺得第一。该基准让模型听远场房间音频,但用每位说话人身上单独佩戴的麦克风所建标签来评分,实现"真实输入 + 精确 ground truth"的组合。作者指出许多 diarization 基准要么用干净音频、要么标签粗糙,VoiceArena 两者都避免,因此这个第一含金量高。

正文 · AI 翻译

恭喜 @smallest_AI 在 @voicearena_ai 的说话人分离 + ASR 榜单上夺得第一。

这是一个非常有效的真实场景基准测试:

> 模型听到的是远场房间音频(即麦克风距离说话人有一定距离),但评分依据的是用每个说话人身上佩戴的麦克风构建的标注。

> 真实的输入,准确的真值。这种组合很少见。

许多说话人分离基准测试要么使用干净的音频,要么标注质量参差不齐。

@voicearena_ai 两者都避免了:模型获得的是真实面对面对话的远场录音,而真值来自每个说话人各自的麦克风。第一名确实有分量。

恭喜 @smallest_AI。

来源:rohanpaul_ai · x.com