#语音
#语音
rohanpaul_ai@rohanpaul_aiAI 评分 _akhaliq@_akhaliqAI 评分
Hugging Face BlogAI 评分
Hugging Face 推出 Open TTS Leaderboard:面向多语言 TTS 与声音克隆的可扩展评测
Hugging Face 发布 Open TTS Leaderboard,用客观指标评测开源多语言 TTS 与声音克隆模型,单模型评测耗时从数周投票缩短到数小时。
Hugging Face BlogAI 评分
Hugging Face Open ASR Leaderboard 新增首个全球南方语言:印地语与印度英语评测集 Monsoon
Hugging Face 与 Voice Arena 合作,在 Open ASR Leaderboard 上新增 Monsoon en-IN 和 Monsoon hi-IN 两个评测集,印地语成为该多语言榜单上首个 Indic 语言。四个公开/私有 split 共覆盖 4,888 名说话人,每人记录 12 项属性,且说话人不重叠;印地语集采用 lattice 标注以容纳多种可接受的拼写变体。
Hugging Face Blog精选AI 评分
Hugging Face 研究:语音识别模型存在基准优化问题
Hugging Face 发布研究,用共识分歧、掩蔽实体检索和拼写切换三项探针量化语音识别中的基准优化现象,评测 11 个开源 ASR 模型。结果显示,部分高分模型会在音频与参考文本矛盾时复现基准的错误转写,VoxPopuli 分析样本中约 40% 的片段被标记出参考错误,涉及约 3% 的参考词,这类模型复现错误参考的比例为 18–30%。
推荐理由:通过三项探针量化语音模型对基准的过拟合,并给出可复用的检测脚本与榜单入口。
Hugging Face BlogAI 评分
Hugging Face 推出 Real World VoiceEQ:衡量语音 AI 的人类质感
Hugging Face 发布 Real World VoiceEQ 基准,用于评估语音交互的"人类质感",覆盖 40 多个专有与开源语音模型、15+ 评估维度和 60+ 指标,涵盖 ASR、TTS、S2S 与语音理解。
Hugging Face BlogAI 评分
Hugging Face 与 Treble Technologies 推出 FFASR 远场 ASR 基准榜单
Hugging Face 与 Treble Technologies 上线首个开放、社区驱动的远场 ASR 基准 FFASR Leaderboard,覆盖 14 个模拟房间,并设 Lab Measured 与 Lab Simulated 两列做仿真到实测验证。
Hugging Face BlogAI 评分
Hugging Face 为 Open ASR Leaderboard 引入私有数据集以抵御 benchmaxxing
Hugging Face 与 Appen Inc.、DataoceanAI 合作,为 Open ASR Leaderboard 引入覆盖多口音、朗读与对话语音的高质量英文 ASR 私有数据集,以防 benchmaxxing 和测试集污染。
Google DeepMind精选AI 评分Google DeepMind 发布 AI co-clinician 医疗 AI 研究计划
Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生临床监督下协助患者诊疗。
推荐理由:Google DeepMind 公开了 AI co-clinician 的研究设计与评测结果,读者可了解医疗智能体在证据检索和实时多模态问诊上的能力边界。
Google ResearchAI 评分Google Research 发布 WAXAL:覆盖 27 种非洲语言的大规模开放语音数据集
Google Research 发布 WAXAL,一个覆盖 27 种撒哈拉以南非洲语言、服务超 1 亿使用者的开放语音数据集,采用 CC-BY-4.0 许可。该数据集包含约 1,846 小时 ASR 转写语音和超 565 小时 TTS 高保真录音,由非洲学术与社区机构主导采集,2021 年起历时多年完成。
Google ResearchAI 评分Google 发布 MSEB:面向听觉智能的大规模声音嵌入基准
Google Research 在 NeurIPS 2025 发布 Massive Sound Embedding Benchmark(MSEB),用统一框架评估声音嵌入在检索、推理、分类、转录、分割、聚类、重排、重建八项任务上的表现。
Hugging Face BlogAI 评分
Hugging Face Open ASR Leaderboard 新增多语言与长音频赛道,并发布 ASR 趋势预印本
Hugging Face 的 Open ASR Leaderboard 新增多语言与长音频转录赛道,并发布基于 60+ 模型的 ASR 趋势预印本。
Google Research精选AI 评分Google 发布端到端实时语音到语音翻译模型,延迟降至 2 秒
Google Research 发布端到端语音到语音翻译(S2ST)模型,直接在原说话人音色下生成翻译音频,延迟仅 2 秒,而此前的级联方案延迟为 4–5 秒且会累积误差。
推荐理由:Google 端到端语音翻译把延迟从 4–5 秒压到 2 秒,并已落地 Meet 与 Pixel 10,可据此了解实时同传的技术取舍。