Fermion AI 发布 Phonon-2 语音识别模型,164MB 体积称平均准确率超过 Whisper large
Fermion AI 发布语音识别模型 Phonon-2,下载体积仅 164MB,官方称其平均准确率超过体积约为其 10 倍的 OpenAI Whisper large。该模型可在 MacBook Air 上 20 秒转写 1 小时音频,权重以 CC-BY-4.0 协议开放。
Fermion AI 发布语音识别模型 Phonon-2,下载体积仅 164MB,官方称其平均准确率超过体积约为其 10 倍的 OpenAI Whisper large。该模型可在 MacBook Air 上 20 秒转写 1 小时音频,权重以 CC-BY-4.0 协议开放。
Suno 宣布 Suno Studio 支持录制人声并将其转换为任意音色,电吉他只是其中一种示例。该功能可将用户嗓音直接变成其他乐器的声音,官方以视频演示了这一能力。
在 ElevenAgents 中,Eleven v4 Turbo 与我们领先的转录和轮次切换模型协同工作。一个协同优化的栈意味着智能体响应更快、优雅地处理打断,并随着新模型的发布而不断改进。
Eleven v4 是我们最具情感表现力的模型。 我们做了一个 demo 来展示它的情感范围,其中 [audio tags] 塑造每个提示词的情感。
致我们最敏锐的听众,如果你注意到我们的声音有了新变化——你没听错。 我们的 AI 主播很想解释一下发生了什么(以及你可以期待什么)!
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,把近实时视频生成与语音对话结合,为原生实时对话模型加入动态视觉形象,即日起在 Gemini Enterprise 可用。
推荐理由:官方给出 Live Avatar 的能力边界与开放入口,读者可据此判断实时视频对话在企业场景的可用性。
Meta 在 Connect 2026 上把个人智能体 Muse 作为硬件加智能体战略的核心,发布语音与实时视频能力、Muse Realtime Avatar 研究模型、Ray-Ban Meta Gen 3 与售价 1299 美元的 Meta VR Glasses,以及 12 月发货的钥匙扣设备 Muse Charm,并预告但未发布新前沿模型。
Suno Studio 现已支持直接录制到时间线:启用音轨后按下录制键即可开始创作音乐。该功能由 Suno 官方在 X 上公布,并附有演示视频。
Simon Willison 发布 Gemini 3.8 TTS Playground,一个自带 API key 的交互界面,可测试 Google 的 Gemini 3.8 文本转语音 API,支持单人或多人对话配音、试听生成音频并查看请求与响应细节,设置可保存为可分享的 URL。
用 @WisprFlow 总结会议、记录语音笔记并提取待办事项。 就像对 Gemini 说:"用 Wispr 查看我最近会议得出了哪些决定。"
所有这些,连同 @GoogleAIStudio 的全新体验,成本低于我们之前的 3.1 Flash TTS 模型! Read more: blog.google/innovation-and-a…
最新文本转语音与语音设计模型现已在 AI Studio 上线,提供数千种新声音可选、30 秒内复制自己的声音、仅用提示词设计声音,以及用表达标签实现完整控制。
Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,前者面向角色语音设计与逐行表演导演,后者面向高并发、低成本的配音与语音智能体场景。
推荐理由:官方给出两款 TTS 模型的语音设计、逐行导演能力与基准排名,可据此判断语音生成工作流的变化。
Ringg 基于 GPT-5.6 构建的多语言 AI 智能体可解决最多 65% 的客户来电,覆盖语音、聊天、WhatsApp 和网页渠道。相比 GPT-4.1,其成本降低 90%。
推荐理由:原文列出五个模型的能力分工和降价幅度,读者可据此评估其音频栈对现有语音工作流的成本影响。
Suno 回应称,过度压缩会把你想保留的音色特征一并挤掉,关键在于找到合适的平衡点。该回复未给出具体参数或功能细节。
Suno Studio 现已内置插件,其中包括压缩器。Suno 同步发布《What Does a Compressor Actually Do?》一文,讲解压缩与动态处理,这是其解释音乐制作工具系列的第一篇。