#语音
#语音
ArtificialAnlys@ArtificialAnlysAI 评分 X:Suno (@suno)AI 评分 Suno 上线 Speech 语音生成功能 Beta 版
Suno 推出 Speech 功能 Beta 版,用户可在 Suno 上生成语音内容。官方提示 Beta 阶段仍有不足,例如英式口音有时会听起来更像澳式口音,戏剧性停顿也可能过于夸张,这些问题将随时间改进。
X:Suno (@suno)AI 评分 Suno 演示用维多利亚英语劝室友洗碗
Suno 分享了一段用维多利亚时代英语劝说室友洗碗的音频演示,并附上 suno.com 的分享链接。该内容以回复 @suno 的形式发布,展示 Suno 在特定风格化人声与台词生成上的效果。
X:Suno (@suno)AI 评分 Suno 推出 Speech Beta,可生成带背景音乐的语音
Suno 宣布 Speech 功能进入 Beta 阶段,称其为首个能生成与背景音乐相匹配的语音音频的模型,用户更新应用即可使用。官方博客链接为 suno.com/blog/introducing-speech-beta。
X:Suno (@suno)AI 评分 Suno 展示语音与背景音乐单次生成:实时音频的新进展
Suno 分享了一段演示,展示语音与背景音乐在一次生成中同步产出。评论者 Gavin Guo 指出,两个生成器争夺同一时间线通常会互相干扰,而这段音乐能随人声自动避让、起伏和强调,而非事后贴附,对实时音频而言是实质性进展。
ElevenLabs@ElevenLabsAI 评分 ElevenLabs@ElevenLabsAI 评分 mati@matiAI 评分 mati@matiAI 评分 X:Jason Liu (@jxnlco)AI 评分 ChatGPT 的 dot 支持举机贴耳语音通话
ChatGPT 的 dot 新增语音通话功能:在 Settings → Voice 中开启后,打开 dot 并把手机举到耳边即可像打电话一样与 dot 对话。该功能需手动在设置里打开,发布者称这是其团队在 dots 中推出的最喜欢的小功能之一。
X:Elvis Saravia (@omarsar0, DAIR.AI)AI 评分 Onepin 推出 AI 语音质检层:逐行检查发音,只修错词不重录
Onepin 发布 AI 语音质检层,在文本转语音之后逐行检查配音,用 400 万词发音词典核对人名与产品名,并提前拼读价格和日期。它按自然度、清晰度和词准确率给每行音频打分,出错时只修复那个词、不重新渲染整段。该工具兼容 ElevenLabs、OpenAI、Google 等 30 多家语音服务,免费起步、无需信用卡。
X:Testing Catalog (@testingcatalog)AI 评分 每日 AI 简报:Grok 4.7 全模式上线,Claude Code 推出 Mods,微软发布三款 MAI 音频模型
Grok 4.7 正在 Grok 网页版和移动端推送,成为 Fast、Expert、Build、Heavy 全部模式的基座模型,并上线 Google 的 Gemini Enterprise Agent Platform;Grok Bot 逐步转向主动建议,Grok Build 新增 /dashboard 智能体面板。
The DecoderAI 评分Tavus 发布 Griffin 人机交互模型,48% 测试者一分钟通话后误认为真人
Tavus 推出 Griffin,公司称其为首个 Human Interaction Model(HIM),可在接收和生成视频的同时处理语音、面部表情、语调、手势和停顿。
keleftheriou@keleftheriouAI 评分 X:OpenRouter (@OpenRouter)AI 评分 微软 MAI-Voice-2.1-Flash 上线 OpenRouter,150ms 生成 45 秒音频
微软 AI 的 MAI-Voice-2.1-Flash 已在 OpenRouter 上线,这是一款面向实时响应的低延迟文本转语音模型。官方称其可在 150ms 内生成 45 秒音频,同一音色可用 23 种语言说话并保持母语口音,定价为每 100 万字符 15 美元,面向语音智能体、助手和呼叫中心等实时场景。
OpenRouter@OpenRouterAI 评分 X:Elvis Saravia (@omarsar0, DAIR.AI)AI 评分 Tavus 预览 Human Interaction Model Griffin:能看、能听、能发声、能像人一样呈现
Tavus 预览了其最新模型 Griffin,一款能看、能听、能发声并像人一样呈现的 Human Interaction Model,目前尚未公开可用,此次仅为有限的研究预览。
romainhuet@romainhuetAI 评分
TechCrunch · AIAI 评分Sean Parker 将 Stability AI 转向音乐方向
Napster 联合创始人 Sean Parker 正把 Stability AI 重塑为面向音乐专业人士的 AI 工具厂商。两年前他参与了对这家图像生成初创公司的 8000 万美元救助,如今与出任 CEO 的 Prem Akkaraju 一起公布新方向。
The DecoderAI 评分Suno 推出 Speech 功能,可生成带配乐的语音音频
AI 音乐生成器 Suno 新增 Speech 功能,可将口述文本与匹配的背景音乐合成为单条音轨,用户输入想法或文字并描述想要的音色与音乐风格,模型即生成人声与音效。
ElevenLabs@ElevenLabsAI 评分 ElevenReader 已在 iOS、Android 和网页端上线。 收听任何你想阅读的内容。 elevenreader.io
ElevenLabs@ElevenLabsAI 评分 ElevenLabs 宣布其最具表现力的语音模型 Eleven v4 已上线 ElevenReader,用户可以用自选语音收听任意文章、电子书或 PDF,支持 90+ 种语言。
milichab@milichabAI 评分 NewsFromGoogle@NewsFromGoogleAI 评分 Gemini官方回顾9月AI发布,包括前沿模型Gemini 4 Argon,具备高级推理能力与1-million-token输出上限,主打网络安全防御场景。
ElevenLabs@ElevenLabsAI 评分
X:Suno (@suno)AI 评分 Suno 语音旁白 Beta 获用户好评:戏剧性停顿表现出色
Suno 推出语音/旁白 Beta 功能,用户反馈首次尝试即效果惊艳,认为其戏剧性停顿处理到位。有用户将原声带重新混音并加入旁白,一次成功。同时有用户抱怨系统故障导致歌曲消失并消耗付费积分,还有人呼吁推出 Opus 5.5 动态图形集成,为语音自动生成动画。
X:Suno (@suno)AI 评分 Suno 巴西葡萄牙语功能 Beta 测试出现异常输出
Suno 的巴西葡萄牙语功能在 Beta 测试中出现大量停顿、句中切换至欧洲葡萄牙语以及难以描述的怪异声音等问题。官方提示 Beta 期间可能出现异常输出,并呼吁用户反馈以帮助改进。
The Verge · AIAI 评分Suno 上线 Speech 功能,可同时生成语音与背景音乐
AI 音乐平台 Suno 推出 Speech 功能并进入公开测试,可在网页和移动端根据脚本或提示词生成语音,并同时生成配套背景音乐。该功能提供 Simple 和 Advanced 两种模式,Advanced 可自定义脚本并调整 AI 语音性别、说话风格和生成多样性,语音最长约 8 分钟,背景音乐可用开关关闭。
The DecoderAI 评分微软 AI 发布面向语音智能体的转录与语音合成模型
微软 AI 发布实时转录模型 MAI-Transcribe-2-Streaming,支持 60 种语言,首个部分结果延迟约 100 毫秒,微软称其在 Artificial Analysis 准确率排名第一,年底前音频价格为每小时 0.54 美元。
X:Ethan Mollick (@emollick)AI 评分 Ethan Mollick:AI 智能体将用语音/聊天替用户谈判,客服系统面临冲击
Ethan Mollick 指出,各公司的客服智能体即将被 Dots & Muses 等 AI 智能体淹没,它们通过语音/聊天为用户争取更优价格。人们把这类工作交给智能体并省下钱的案例正在涌现,并将愈发病毒式传播。这些智能体可使用为人类搭建的渠道,忍受电话树、等待接通或被拒后反复重试。
X:Elvis Saravia (@omarsar0, DAIR.AI)AI 评分 Vivix A1 Playground 发布:可实时打断、全身动作的 AI 角色
Vivix Labs 推出 Vivix A1 Playground + Agent,可构建能说话、全身动作并与用户实时互动的 AI 角色。角色支持在说话或行走中途被打断,无需重置场景即可改变路线,拿起物体也能保持形状。用户可自定义外观、性格与声音,还能与角色玩网页游戏、互动道具。
ElevenLabs@ElevenLabsAI 评分
mati@matiAI 评分 fal@falAI 评分 fal@falAI 评分 VEED Clean Audio 现已在 fal 上线 去除语音中的背景噪音,同时保留安静和远处的词句 最长 30 分钟的任意音频或视频文件输入,输出 48 kHz 响度归一化音频
_akhaliq@_akhaliqAI 评分 ivy432hz@ivy432hzAI 评分 X:Jason Liu (@jxnlco)AI 评分 dots 上线新功能:举起手机贴近耳边即可呼叫你的 dot
dots 推出一项新功能:在应用打开状态下,把手机举到耳边即可呼叫你的 dot。该功能需先在设置的 voice 选项中手动开启。
Hugging Face BlogAI 评分
Hugging Face 推出 Open TTS Leaderboard:面向多语言 TTS 与声音克隆的可扩展评测
Hugging Face 发布 Open TTS Leaderboard,用客观指标评测开源多语言 TTS 与声音克隆模型,单模型评测耗时从数周投票缩短到数小时。
Gemini_Notebook@Gemini_NotebookAI 评分 Gemini Notebook 官方宣布,Live Voice Chat 功能已在移动端 100% 推送给所有 Pro 用户,并邀请用户试用后反馈体验。