每日 AI 简报:OpenAI Voices API、ChatGPT 虚拟试穿、Antigravity 接入 Claude 5.5、Claude Frontier Academy 等
OpenAI Python SDK 3.24.0 新增 Voices API,可从文本提示词或音频样本创建自定义语音;ChatGPT 全球上线虚拟试穿,可在自己的照片上查看购物结果中的服装。
OpenAI Python SDK 3.24.0 新增 Voices API,可从文本提示词或音频样本创建自定义语音;ChatGPT 全球上线虚拟试穿,可在自己的照片上查看购物结果中的服装。
Tavus 发布 Griffin,称其为首个通过视频图灵测试的模型,48% 与其实时对话的人认为它是真人,此前系统的通过率低于 3%。Griffin 在 NVIDIA 全双工 AI 视频基准上排名第一,被定义为首个 Human Interaction Model(HIM),可同时听、看、说,并生成完整画面而非仅面部。
OpenAI 的 Tibo 发布 Dots 演示视频,称这次"WiFi 更好",但评论区大量用户质疑演示翻车并非网络问题。多位用户反馈 Codex 语音功能已异常数周、Dots 可靠性很差,还有人抱怨 ChatGPT iPhone 应用无法登录、Sol 6.1 速度极慢。
Grok 4.7 正在 Grok 网页版和移动端推送,成为 Fast、Expert、Build、Heavy 全部模式的基座模型,并上线 Google 的 Gemini Enterprise Agent Platform;Grok Bot 逐步转向主动建议,Grok Build 新增 /dashboard 智能体面板。
Tavus 推出 Griffin,公司称其为首个 Human Interaction Model(HIM),可在接收和生成视频的同时处理语音、面部表情、语调、手势和停顿。
有开发者因期待 OpenAI DevDay 发布可随身与 Dots 对话的设备未果,便用 M5Stack StopWatch 自行搭建。目前屏幕常亮且连接保持时续航仅两三个小时,作者计划在功能完成后优化续航,并正尝试让其在 Stack-chan 上显示。
微软 AI 的 MAI-Voice-2.1-Flash 已在 OpenRouter 上线,这是一款面向实时响应的低延迟文本转语音模型。官方称其可在 150ms 内生成 45 秒音频,同一音色可用 23 种语言说话并保持母语口音,定价为每 100 万字符 15 美元,面向语音智能体、助手和呼叫中心等实时场景。
微软 AI 的 MAI-Voice-2.1 已在 OpenRouter 上线,官方称其为 MAI 迄今保真度和表现力最高的文本转语音模型。该模型支持同一音色以 23 种语言说话并保持母语口音,定价为每 100 万字符 22 美元,面向有声书、播客、旁白和品牌音频场景。
Tavus 预览了其最新模型 Griffin,一款能看、能听、能发声并像人一样呈现的 Human Interaction Model,目前尚未公开可用,此次仅为有限的研究预览。
Napster 联合创始人 Sean Parker 正把 Stability AI 重塑为面向音乐专业人士的 AI 工具厂商。两年前他参与了对这家图像生成初创公司的 8000 万美元救助,如今与出任 CEO 的 Prem Akkaraju 一起公布新方向。
AI 音乐生成器 Suno 新增 Speech 功能,可将口述文本与匹配的背景音乐合成为单条音轨,用户输入想法或文字并描述想要的音色与音乐风格,模型即生成人声与音效。
ElevenLabs 的 ElevenReader 已在 iOS、Android 和网页端上线,可朗读用户想读的任何内容。该应用支持免费朗读文本、PDF、电子书和 Kindle 内容,并提供免费有声书,主打高质量 TTS 语音 AI。
ElevenLabs 最富表现力的语音模型 Eleven v4 已接入 ElevenReader,用户可用自选声音朗读任意文章、电子书或 PDF,支持 90+ 种语言。ElevenReader 已在 iOS、Android 和网页端上线。
论文 Adaptive Reward Routing 提出通过前向过程 RL 为音视频联合扩散模型做动态多奖励优化,取代单一评分方案。该方法面向生成式媒体,论文已在 HuggingFace 上线(2609.37200)。
Gemini 9 月发布回顾涵盖多项更新:Gemini 4 Argon 作为最新前沿模型,具备高级推理能力和 100 万 token 输出上限,主打网络安全防御等复杂任务。
ElevenLabs 已获得 FedRAMP 20x Class A 认证,覆盖 ElevenAgents 及 Text to Speech、Speech to Text API,需在 Zero Retention Mode 与美国数据驻留条件下运行。
Suno 推出语音/旁白 Beta 功能,用户反馈首次尝试即效果惊艳,认为其戏剧性停顿处理到位。有用户将原声带重新混音并加入旁白,一次成功。同时有用户抱怨系统故障导致歌曲消失并消耗付费积分,还有人呼吁推出 Opus 5.5 动态图形集成,为语音自动生成动画。
Suno 的巴西葡萄牙语功能在 Beta 测试中出现大量停顿、句中切换至欧洲葡萄牙语以及难以描述的怪异声音等问题。官方提示 Beta 期间可能出现异常输出,并呼吁用户反馈以帮助改进。
AI 音乐平台 Suno 推出 Speech 功能并进入公开测试,可在网页和移动端根据脚本或提示词生成语音,并同时生成配套背景音乐。该功能提供 Simple 和 Advanced 两种模式,Advanced 可自定义脚本并调整 AI 语音性别、说话风格和生成多样性,语音最长约 8 分钟,背景音乐可用开关关闭。
微软 AI 发布实时转录模型 MAI-Transcribe-2-Streaming,支持 60 种语言,首个部分结果延迟约 100 毫秒,微软称其在 Artificial Analysis 准确率排名第一,年底前音频价格为每小时 0.54 美元。
Gemini 在兼容的 Android 设备上为 Gemini Live 推出 Guided Vision,提供对话式实时视觉辅助。用户在 Gemini Live 会话中共享摄像头,即可听到对周围环境的清晰描述,例如读取细小文字或寻找附近物品,还能追问细节并获得主动语音提示来对准想探索的目标。该功能与盲人及低视力群体共同打造。
fal 上线 VEED Clean Audio(Audio to Audio)API,可从语音中去除背景噪声,同时保留安静和远处的人声。该模型即 VEED 编辑器内 Clean Audio 功能的同款模型,每天处理数千条录音,现已可在 fal 上直接调用。
VEED Clean Audio 现已在 fal 平台上线,可从语音中去除背景噪声,同时保留安静和远处的人声。该功能支持最长 30 分钟的任意音频或视频文件输入,输出 48 kHz 响度归一化音频。
Audio8 ASR Infinite 是一款原生流式语音识别模型,每秒解码 12.5 次,通过滚动 KV Cache 让内存与延迟在 24/7 持续运行下保持恒定。模型每个时钟步输出一个文本 token,支持 12.5 / 8.3 / 6.25 次每秒的决策频率,以平衡感知粒度与资源开销。模型已在 Hugging Face 开源,并提供 Gradio 工作流与 HuggingChat 试用入口。
Hugging Face 发布 Open TTS Leaderboard,用客观指标评测开源多语言 TTS 与声音克隆模型,单模型评测耗时从数周投票缩短到数小时。
Gemini Notebook 的 Live Voice Chat 已在移动端向所有 Pro 用户 100% 全量开放,Live Chat 也已向所有 Ultra 用户全量开放。该功能由最新音频模型驱动,支持约 100 种语言与笔记本进行实时语音对话,可就来源提问并获得分步指导,基本实现免手操作。
Gemini Notebook 的 AI 主播就节目声音出现的新变化作出回应,确认听众察觉到的变化属实,并表示 AI 主播将亲自解释正在发生的变化以及后续值得期待的内容。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,把近实时视频生成与语音对话结合,为原生实时对话模型加入动态视觉形象,即日起在 Gemini Enterprise 可用。
推荐理由:官方给出 Live Avatar 的能力边界与开放入口,读者可据此判断实时视频对话在企业场景的可用性。
Gemini 3.8 Live 与 Live Avatar 现已在 Gemini Enterprise 正式可用,主要能力包括视频化身、流畅对话和工具调用等。该版本提供美国和欧盟端点,具备预置吞吐量、企业合规与严格数据治理,用户可在 Gemini 中试用该模型及其功能。
Meta 推出 Muse Realtime Avatar,可将 Muse Realtime Voice 转化为富有表现力的交互式虚拟形象。官方研究博客以“Bringing Your Muse to Life”为题介绍了这一能力,更多细节见 research.meta.ai 博客原文。
Meta 在 Meta Connect 上由 @finkd 公布 Muse Realtime Avatar,这项实时具身技术把 Muse Realtime Voice 转化为富有表现力、可交互的虚拟形象。该技术为 Muse 带来全新的交互形式,首批应用场景是实时对话。
Meta 在 Meta Connect 上宣布,个人智能体 Muse 新增语音和实时视频能力,可在对话中后台执行任务,并接入眼镜实现免手操作。
Meta 在 Meta Connect 上宣布 Muse 个人智能体新增语音和实时视频能力,可进行长对话并在后台完成任务,同时上线眼镜端实现免手操作。
Meta 在 Meta Connect 上宣布,个人智能体 Muse 新增语音与实时视频能力,可在对话中后台执行任务,并登陆眼镜实现免手操作。Meta Glasses 新增 FDA 认证助听功能,眼镜端推出隐私处理,使特定 AI 功能下连 Meta 也无法访问用户信息。
Google 发布最新的文本转语音与声音设计模型,已在 AI Studio 上线。该模型提供数千种新声音可选,可在 30 秒内复刻用户自己的声音,仅用提示词即可设计声音,并支持用表现力标签进行控制。
Google DeepMind 发布两款文本转语音模型。Gemini 3.8 Flash TTS 可设计具有不同口音和特征的独特声音;Gemini 3.8 Flash-Lite TTS 面向效率与规模化,可从自建风格或官方生产级声音库中选择。
推荐理由:Google DeepMind 发布两款 TTS 模型,读者可了解语音定制与规模化部署的两种定位差异。
Google DeepMind 发布 Gemini 3.8 Flash-Lite TTS 和 Gemini 3.8 Flash TTS,称其为目前表现力最强的音频模型。用户可逐行微调语速、情绪以及笑声、停顿等提示,所有生成音频都带有 SynthID 水印,可被识别为 AI 生成。开发者可通过 GoogleAIStudio 使用 Gemini API 开始构建。
Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,前者面向角色语音设计与逐行表演导演,后者面向高并发、低成本的配音与语音智能体场景。
推荐理由:官方给出两款 TTS 模型的语音设计、逐行导演能力与基准排名,可据此判断语音生成工作流的变化。
阿里发布 Qwen-Audio-3.1,ASR、TTS 与 Realtime 全面升级,并新增 TTS-Next 和 ASR-Next 两款模型,共五款模型覆盖理解、生成、交互与创作。
推荐理由:官方一次性给出五款音频模型的能力分工与降价幅度,可据此判断语音链路的选型与成本变化。
Gemini Notebook 宣布 Live Chat 已在移动端向所有 Ultra 用户 100% 全量开放,支持与笔记本进行实时语音对话,覆盖约 100 种语言。该功能由最新音频模型驱动,可就来源内容提问并获得分步指导,几乎完全免手操作。