跳到正文

语音与音频

AI 语音与音频的进展:语音合成、实时对话、音乐生成与音频理解的模型与产品。

31条精选相关主题多模态AI 视频产品更新

最新精选

第 21–31 条 · 共 31 条
12月13日周六
  1. Google DeepMind71

    Google DeepMind 发布升级版 Gemini 2.5 Flash Native Audio,并推出实时语音翻译

    Google DeepMind 发布升级版 Gemini 2.5 Flash Native Audio,面向实时语音智能体,在函数调用、指令遵循和多轮对话三方面做了改进。

    推荐理由:官方给出 Gemini 2.5 Flash Native Audio 在函数调用、指令遵循和多轮对话上的具体提升数据,可据此判断语音智能体的可用性变化。

11月19日周三
  1. Google Research75

    Google 发布端到端实时语音到语音翻译模型,延迟降至 2 秒

    Google Research 发布端到端语音到语音翻译(S2ST)模型,直接在原说话人音色下生成翻译音频,延迟仅 2 秒,而此前的级联方案延迟为 4–5 秒且会累积误差。

    推荐理由:Google 端到端语音翻译把延迟从 4–5 秒压到 2 秒,并已落地 Meet 与 Pixel 10,可据此了解实时同传的技术取舍。

8月28日周四
7月17日周四
  1. Mistral AI62

    Mistral 为 Le Chat 推出 Deep Research、语音模式与 Projects 等新功能

    Mistral 为 Le Chat 上线一批新功能,包括预览版 Deep Research 模式、由新语音模型 Voxtral 驱动的语音模式、由推理模型 Magistral 支持的多语言思考模式、用于整理对话的 Projects,以及与 Black Forest Labs 合作的高级图像编辑。

    推荐理由:官方一次性放出 Deep Research、语音、Projects 等多项功能,读者可据此判断 Le Chat 的定位变化。

7月15日周二
  1. Mistral AI74

    Mistral 发布 Voxtral 语音理解模型,24B 与 3B 双版本 Apache 2.0 开源

    Mistral AI 发布 Voxtral 语音理解模型,提供 24B 和 3B 两个版本,均以 Apache 2.0 协议开源并上线自家 API。模型支持 32k token 上下文,可处理最长 30 分钟音频转写或 40 分钟音频理解,具备内置问答与摘要、多语言自动检测和语音触发函数调用能力,并保留 Mistral Small 3.1 的文本能力。

    推荐理由:官方给出两款语音理解模型的尺寸、开源协议与 API 定价,可对照 Whisper、GPT-4o mini 等基准判断其成本位置。

3月20日周四
  1. OpenAI News60

    OpenAI 在 API 中推出新一代音频模型

    OpenAI 在 API 中推出新一代音频模型,开发者首次可以指示文本转语音模型以特定方式说话,例如“像一位有同理心的客服人员那样说话”,为语音智能体带来新的定制能力。

    推荐理由:OpenAI 在 API 中上线新一代音频模型,开发者可首次用自然语言指令控制语音表达方式。

10月1日周二
5月13日周一
  1. OpenAI News80

    OpenAI 发布新旗舰模型 GPT-4o

    OpenAI 宣布推出新旗舰模型 GPT-4 Omni(GPT-4o),可在音频、视觉和文本之间实时推理。

    推荐理由:OpenAI 公布新旗舰模型 GPT-4o,可在音频、视觉与文本间实时推理,读者可据此了解其多模态能力定位。

9月25日周一
5月18日周四
  1. OpenAI News62

    OpenAI 推出 ChatGPT iOS 应用

    OpenAI 推出 ChatGPT iOS 应用,可同步对话记录、支持语音输入,并带来最新的模型改进。应用将 ChatGPT 的对话与模型能力带到移动端。

    推荐理由:OpenAI 官方公布 ChatGPT iOS 应用的核心能力,读者可据此了解移动端对话同步与语音输入的入口变化。

9月21日周三