跳到正文

#语音

今日 16 条
今天10月3日周六
  1. X:OpenRouter (@OpenRouter)56

    微软 MAI-Voice-2.1 语音模型上线 OpenRouter

    微软 AI 的 MAI-Voice-2.1 已在 OpenRouter 上线,官方称其为 MAI 迄今保真度和表现力最高的文本转语音模型。该模型支持同一音色以 23 种语言说话并保持母语口音,定价为每 100 万字符 22 美元,面向有声书、播客、旁白和品牌音频场景。

10月2日周五
  1. The Verge · AI53

    Suno 上线 Speech 功能,可同时生成语音与背景音乐

    AI 音乐平台 Suno 推出 Speech 功能并进入公开测试,可在网页和移动端根据脚本或提示词生成语音,并同时生成配套背景音乐。该功能提供 Simple 和 Advanced 两种模式,Advanced 可自定义脚本并调整 AI 语音性别、说话风格和生成多样性,语音最长约 8 分钟,背景音乐可用开关关闭。

  2. X:Gemini (@GeminiApp)66

    Gemini Live 在 Android 设备上线 Guided Vision 实时视觉辅助

    Gemini 在兼容的 Android 设备上为 Gemini Live 推出 Guided Vision,提供对话式实时视觉辅助。用户在 Gemini Live 会话中共享摄像头,即可听到对周围环境的清晰描述,例如读取细小文字或寻找附近物品,还能追问细节并获得主动语音提示来对准想探索的目标。该功能与盲人及低视力群体共同打造。

9月30日周三
  1. X:AK (@_akhaliq)40

    Audio8 ASR Infinite 流式语音识别模型发布:原生流式架构每秒解码 12.5 次

    Audio8 ASR Infinite 是一款原生流式语音识别模型,每秒解码 12.5 次,通过滚动 KV Cache 让内存与延迟在 24/7 持续运行下保持恒定。模型每个时钟步输出一个文本 token,支持 12.5 / 8.3 / 6.25 次每秒的决策频率,以平衡感知粒度与资源开销。模型已在 Hugging Face 开源,并提供 Gradio 工作流与 HuggingChat 试用入口。

9月26日周六
9月25日周五
  1. Google DeepMind70

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,把近实时视频生成与语音对话结合,为原生实时对话模型加入动态视觉形象,即日起在 Gemini Enterprise 可用。

    推荐理由:官方给出 Live Avatar 的能力边界与开放入口,读者可据此判断实时视频对话在企业场景的可用性。

9月24日周四
9月23日周三
  1. X:Google DeepMind (@GoogleDeepMind)66

    Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS 语音模型

    Google DeepMind 发布两款文本转语音模型。Gemini 3.8 Flash TTS 可设计具有不同口音和特征的独特声音;Gemini 3.8 Flash-Lite TTS 面向效率与规模化,可从自建风格或官方生产级声音库中选择。

    推荐理由:Google DeepMind 发布两款 TTS 模型,读者可了解语音定制与规模化部署的两种定位差异。

  2. Google DeepMind69

    Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS

    Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,前者面向角色语音设计与逐行表演导演,后者面向高并发、低成本的配音与语音智能体场景。

    推荐理由:官方给出两款 TTS 模型的语音设计、逐行导演能力与基准排名,可据此判断语音生成工作流的变化。

9月21日周一