跳到正文

#语音

今日 0 条
12月4日周四
11月21日周五
11月19日周三
  1. Google Research75

    Google 发布端到端实时语音到语音翻译模型,延迟降至 2 秒

    Google Research 发布端到端语音到语音翻译(S2ST)模型,直接在原说话人音色下生成翻译音频,延迟仅 2 秒,而此前的级联方案延迟为 4–5 秒且会累积误差。

    推荐理由:Google 端到端语音翻译把延迟从 4–5 秒压到 2 秒,并已落地 Meet 与 Pixel 10,可据此了解实时同传的技术取舍。

10月28日周二
  1. Hugging Face Blog40

    Hugging Face 提出“语音同意门”:让语音克隆必须先获得本人明确同意

    Hugging Face 提出“语音同意门”机制,让语音克隆模型只有在说话人明确说出同意语句后才会启动。该方案由语言模型生成约 20 词的同意句与中性语音多样性句,经 ASR 识别同意内容后,再由 TTS 完成克隆,并建议同意音频直接来自麦克风而非上传文件。团队已提供示例 Space 和配套代码。

9月22日周一
8月28日周四
7月17日周四
  1. Mistral AI62

    Mistral 为 Le Chat 推出 Deep Research、语音模式与 Projects 等新功能

    Mistral 为 Le Chat 上线一批新功能,包括预览版 Deep Research 模式、由新语音模型 Voxtral 驱动的语音模式、由推理模型 Magistral 支持的多语言思考模式、用于整理对话的 Projects,以及与 Black Forest Labs 合作的高级图像编辑。

    推荐理由:官方一次性放出 Deep Research、语音、Projects 等多项功能,读者可据此判断 Le Chat 的定位变化。

7月15日周二
  1. Mistral AI74

    Mistral 发布 Voxtral 语音理解模型,24B 与 3B 双版本 Apache 2.0 开源

    Mistral AI 发布 Voxtral 语音理解模型,提供 24B 和 3B 两个版本,均以 Apache 2.0 协议开源并上线自家 API。模型支持 32k token 上下文,可处理最长 30 分钟音频转写或 40 分钟音频理解,具备内置问答与摘要、多语言自动检测和语音触发函数调用能力,并保留 Mistral Small 3.1 的文本能力。

    推荐理由:官方给出两款语音理解模型的尺寸、开源协议与 API 定价,可对照 Whisper、GPT-4o mini 等基准判断其成本位置。

7月1日周二
6月26日周四
4月22日周二
3月20日周四
  1. OpenAI News60

    OpenAI 在 API 中推出新一代音频模型

    OpenAI 在 API 中推出新一代音频模型,开发者首次可以指示文本转语音模型以特定方式说话,例如“像一位有同理心的客服人员那样说话”,为语音智能体带来新的定制能力。

    推荐理由:OpenAI 在 API 中上线新一代音频模型,开发者可首次用自然语言指令控制语音表达方式。

10月1日周二
6月8日周六
5月20日周一
5月13日周一
  1. OpenAI News80

    OpenAI 发布新旗舰模型 GPT-4o

    OpenAI 宣布推出新旗舰模型 GPT-4 Omni(GPT-4o),可在音频、视觉和文本之间实时推理。

    推荐理由:OpenAI 公布新旗舰模型 GPT-4o,可在音频、视觉与文本间实时推理,读者可据此了解其多模态能力定位。

5月1日周三
3月29日周五
2月27日周二
9月25日周一
5月18日周四
  1. OpenAI News62

    OpenAI 推出 ChatGPT iOS 应用

    OpenAI 推出 ChatGPT iOS 应用,可同步对话记录、支持语音输入,并带来最新的模型改进。应用将 ChatGPT 的对话与模型能力带到移动端。

    推荐理由:OpenAI 官方公布 ChatGPT iOS 应用的核心能力,读者可据此了解移动端对话同步与语音输入的入口变化。

11月3日周四
9月21日周三
2月1日周二
  1. Hugging Face Blog40

    如何在 🤗 Transformers 中用 Wav2Vec2 对超大文件做自动语音识别

    Hugging Face 博客介绍了利用 Wav2Vec2 的 CTC 架构特性,通过带 stride 的重叠分块推理,让 ASR 在任意长音频上也能保持高质量识别。只需在 pipeline 中设置 chunk_length_s 和 stride_length_s,即可避免直接处理长文件时的显存溢出,该技巧同样适用于 LM 增强的 Wav2Vec2 模型,并可用于实时推理。

1月12日周三