跳到正文

#语音

今日 0 条
10月7日周三
9月30日周三
9月25日周五
  1. Google DeepMind70

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,把近实时视频生成与语音对话结合,为原生实时对话模型加入动态视觉形象,即日起在 Gemini Enterprise 可用。

    推荐理由:官方给出 Live Avatar 的能力边界与开放入口,读者可据此判断实时视频对话在企业场景的可用性。

9月23日周三
  1. Google DeepMind69

    Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS

    Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,前者面向角色语音设计与逐行表演导演,后者面向高并发、低成本的配音与语音智能体场景。

    推荐理由:官方给出两款 TTS 模型的语音设计、逐行导演能力与基准排名,可据此判断语音生成工作流的变化。

9月16日周三
9月10日周四
  1. OpenAI News69

    OpenAI 在 API 中推出 GPT-Live-1 语音模型

    OpenAI 在 API 中推出 GPT-Live-1,支持自然的全双工语音对话。该模型具备更强的指令遵循能力,支持自定义音色和电话通信(telephony)支持。

    推荐理由:OpenAI 在 API 中上线 GPT-Live-1,语音能力从演示走向可调用,开发者可据此评估接入方式。

8月28日周五
  1. Hugging Face Blog36

    Hugging Face Open ASR Leaderboard 新增首个全球南方语言:印地语与印度英语评测集 Monsoon

    Hugging Face 与 Voice Arena 合作,在 Open ASR Leaderboard 上新增 Monsoon en-IN 和 Monsoon hi-IN 两个评测集,印地语成为该多语言榜单上首个 Indic 语言。四个公开/私有 split 共覆盖 4,888 名说话人,每人记录 12 项属性,且说话人不重叠;印地语集采用 lattice 标注以容纳多种可接受的拼写变体。

8月27日周四
  1. Google DeepMind71

    Google DeepMind 发布语音转文本模型 Gemini 3.5 Transcribe

    Google DeepMind 发布语音转文本模型 Gemini 3.5 Transcribe,可通过 Gemini API 在 Google AI Studio 和 Gemini Enterprise Agent Platform 使用,分为实时流式 gemini-3.5-transcribe-live 和预录音频 gemini-3.5-transcribe 两个接口。

    推荐理由:官方给出流式与非流式两套 API 的 WER 数字和延迟对比,可据此判断语音转写能否接入现有产品。

8月21日周五
  1. Hugging Face Blog62

    Hugging Face 研究:语音识别模型存在基准优化问题

    Hugging Face 发布研究,用共识分歧、掩蔽实体检索和拼写切换三项探针量化语音识别中的基准优化现象,评测 11 个开源 ASR 模型。结果显示,部分高分模型会在音频与参考文本矛盾时复现基准的错误转写,VoxPopuli 分析样本中约 40% 的片段被标记出参考错误,涉及约 3% 的参考词,这类模型复现错误参考的比例为 18–30%。

    推荐理由:通过三项探针量化语音模型对基准的过拟合,并给出可复用的检测脚本与榜单入口。

8月11日周二
  1. Hugging Face Blog62

    NVIDIA 发布 Magpie TTS 多语言语音模型,开放权重支持 12 种语言

    NVIDIA 发布 Magpie TTS Multilingual 开放权重模型,参数量 364M,支持英语、西班牙语、法语、德语、意大利语、越南语、普通话、印地语、日语等 12 种语言,新增现代标准阿拉伯语、韩语和巴西葡萄牙语。

    推荐理由:NVIDIA 公开 Magpie TTS 多语言模型的权重与延迟数据,读者可据此评估自建语音链路的可行性与成本。

8月3日周一
7月30日周四
7月22日周三
7月16日周四
7月15日周三
7月8日周三
7月1日周三
6月24日周三
6月9日周二
  1. Google DeepMind80

    Google DeepMind 发布 Gemini 3.5 Live Translate 实时语音翻译模型

    Google DeepMind 发布 Gemini 3.5 Live Translate,这是一款音频模型,可自动检测 70+ 语言并生成保留说话人语调、节奏和音高的近实时语音到语音翻译,且持续输出而非等说话人说完再翻译,全程仅落后几秒。

    推荐理由:Gemini 3.5 Live Translate 支持 70+ 语言连续语音翻译,并同步开放 API 与 Google 产品入口,可据此判断实时翻译的落地方式。

5月27日周三
5月7日周四
5月6日周三
5月4日周一
4月30日周四
4月28日周二
  1. Hugging Face Blog71

    NVIDIA 发布 Nemotron 3 Nano Omni 全模态理解模型

    NVIDIA 发布 Nemotron 3 Nano Omni,一款面向文档分析、多图推理、语音识别、长音视频理解与智能体电脑操作的全模态理解模型,在 MMlongbench-Doc、OCRBenchV2、WorldSense、DailyOmni、VoiceBench 等基准上取得领先成绩。

    推荐理由:原文给出架构、训练配方与多模态基准对比,可据此判断开源全模态模型在文档、音视频与GUI任务上的位置。

4月16日周四
  1. Google DeepMind66

    Google DeepMind 发布 Gemini 3.1 Flash TTS 语音模型

    Google DeepMind 发布 Gemini 3.1 Flash TTS,一款主打可控性与表现力的文本转语音模型,即日起在 Gemini API 和 Google AI Studio 面向开发者预览,企业版在 Vertex AI 预览,Workspace 用户可通过 Google Vids 使用。

    推荐理由:官方给出音频标签控制方式与 70+ 语言支持,读者可据此判断语音生成的可控程度与接入渠道。

3月26日周四
  1. Google DeepMind74

    Google DeepMind 发布 Gemini 3.1 Flash Live 语音模型

    Google DeepMind 发布 Gemini 3.1 Flash Live,称其为目前质量最高的音频与语音模型,具备更高精度和更低延迟。该模型在 ComplexFuncBench Audio 上得分 90.8%,在 Scale AI 的 Audio MultiChallenge 上开启 thinking 后得分 36.1%。

    推荐理由:官方给出语音模型的基准分数与多产品开放入口,可据此判断实时语音交互的可用边界。

3月24日周二
  1. Mistral AI66

    Mistral AI 发布 4B 参数语音模型 Voxtral TTS

    Mistral AI 发布首个文本转语音模型 Voxtral TTS,4B 参数,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语 9 种语言,可做情感表达与零样本跨语言音色适配。

    推荐理由:官方给出 4B 参数、9 种语言、70ms 延迟与每千字符 0.016 美元的定价,读者可据此判断语音智能体的成本与选型空间。

3月7日周六
3月6日周五
2月19日周四
  1. Google DeepMind69

    Gemini 应用上线 Lyria 3 音乐生成,支持文本和图片生成 30 秒曲目

    Google DeepMind 在 Gemini 应用中以 beta 形式上线最新音乐生成模型 Lyria 3,用户用文本或上传图片、视频即可生成带歌词的 30 秒曲目,并配有 Nano Banana 生成的封面图。

    推荐理由:官方披露 Lyria 3 在 Gemini 应用中的生成方式与 SynthID 音频验证能力,可了解音乐生成的产品化路径。

2月5日周四
1月14日周三
1月7日周三
1月5日周一
12月13日周六
  1. Google DeepMind71

    Google DeepMind 发布升级版 Gemini 2.5 Flash Native Audio,并推出实时语音翻译

    Google DeepMind 发布升级版 Gemini 2.5 Flash Native Audio,面向实时语音智能体,在函数调用、指令遵循和多轮对话三方面做了改进。

    推荐理由:官方给出 Gemini 2.5 Flash Native Audio 在函数调用、指令遵循和多轮对话上的具体提升数据,可据此判断语音智能体的可用性变化。

12月4日周四