Google DeepMind 发布 Gemini 3.8 Live with Live Avatar
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,把近实时视频生成与语音对话结合,为原生实时对话模型加入动态视觉形象,即日起在 Gemini Enterprise 可用。
推荐理由:官方给出 Live Avatar 的能力边界与开放入口,读者可据此判断实时视频对话在企业场景的可用性。
AI 语音与音频的进展:语音合成、实时对话、音乐生成与音频理解的模型与产品。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,把近实时视频生成与语音对话结合,为原生实时对话模型加入动态视觉形象,即日起在 Gemini Enterprise 可用。
推荐理由:官方给出 Live Avatar 的能力边界与开放入口,读者可据此判断实时视频对话在企业场景的可用性。
Google DeepMind 发布两款文本转语音模型。Gemini 3.8 Flash TTS 可设计具有不同口音和特征的独特声音;Gemini 3.8 Flash-Lite TTS 面向效率与规模化,可从自建风格或官方生产级声音库中选择。
推荐理由:Google DeepMind 发布两款 TTS 模型,读者可了解语音定制与规模化部署的两种定位差异。
Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,前者面向角色语音设计与逐行表演导演,后者面向高并发、低成本的配音与语音智能体场景。
推荐理由:官方给出两款 TTS 模型的语音设计、逐行导演能力与基准排名,可据此判断语音生成工作流的变化。
阿里发布 Qwen-Audio-3.1,ASR、TTS 与 Realtime 全面升级,并新增 TTS-Next 和 ASR-Next 两款模型,共五款模型覆盖理解、生成、交互与创作。
推荐理由:官方一次性给出五款音频模型的能力分工与降价幅度,可据此判断语音链路的选型与成本变化。
Google DeepMind 发布两款实时对话模型 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,前者面向规模化与成本效率,后者面向高复杂度任务与多步推理。
推荐理由:官方给出两款语音模型的基准成绩与开放渠道,可据此判断实时语音智能体的能力水位与成本取舍。
Google DeepMind 推出 Gemini 3.8 Live 和 3.8 Live Extended Thinking 两款对话模型,可在后台处理任务而不打断对话。
推荐理由:官方给出两款对话模型的能力清单和接入入口,可据此判断实时语音与后台工具调用能覆盖哪些场景。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款对话模型,可在对话中说话、思考并在后台处理任务而不打断对话流。
推荐理由:官方给出两款实时对话模型的能力清单与开放入口,可据此判断实时语音加后台工具调用的可用边界。