跳到正文

#Google

今日 7 条
9月25日周五
  1. Google DeepMind70

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,把近实时视频生成与语音对话结合,为原生实时对话模型加入动态视觉形象,即日起在 Gemini Enterprise 可用。

    推荐理由:官方给出 Live Avatar 的能力边界与开放入口,读者可据此判断实时视频对话在企业场景的可用性。

9月24日周四
9月23日周三
  1. X:Google AI (@GoogleAI)66

    Google 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS 语音模型

    Google 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款语音模型,支持 100+ 语言的自定义音色或从 2,000+ 现成音色中挑选,可逐行控制语气并加入 <laughs>、|mhm| 等自然提示,生成数小时稳定无故障音频。

    推荐理由:两款 TTS 模型给出不同定位与适用场景,读者可据此判断语音创作与实时语音智能体的选型。

  2. X:Google DeepMind (@GoogleDeepMind)66

    Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS 语音模型

    Google DeepMind 发布两款文本转语音模型。Gemini 3.8 Flash TTS 可设计具有不同口音和特征的独特声音;Gemini 3.8 Flash-Lite TTS 面向效率与规模化,可从自建风格或官方生产级声音库中选择。

    推荐理由:Google DeepMind 发布两款 TTS 模型,读者可了解语音定制与规模化部署的两种定位差异。

  3. Google DeepMind69

    Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS

    Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,前者面向角色语音设计与逐行表演导演,后者面向高并发、低成本的配音与语音智能体场景。

    推荐理由:官方给出两款 TTS 模型的语音设计、逐行导演能力与基准排名,可据此判断语音生成工作流的变化。

9月22日周二
  1. X:Jeff Dean (@JeffDean)38

    Jeff Dean 谈离开 Google 后的首次公开对话:从 MapReduce 到递归自我改进

    Jeff Dean 在离开 Google 后首次公开对话中,与 Dawn Song 讨论了 AI 未来走向,话题涵盖如何识别基础性想法、如何选择值得投入 5 年的研究问题、编程对构建推理模型的启发、递归自我改进(RSI)的可能形态,以及科学发现循环自动化与 AI 自主性带来的安全挑战。他还谈到自己的新创业公司将如何参与这一领域。

9月21日周一
9月19日周六
9月18日周五
  1. X:Gemini Notebook (@Gemini_Notebook)28

    Gemini Notebook 移动应用相机功能展示:拍照生成博物馆展品详细报告

    Gemini Notebook 移动应用相机功能可将拍摄的照片转化为详细报告。Steven Johnson 在 Sierras 拍摄博物馆展品照片后,请求生成图中所有信息的详细报告,经自行核查准确率达 99%,部分模糊文字也能转录。下一步计划为所有照片生成此类文档,并让 Notebook 标注与已有知识库或最新写作大纲相关的新信息。

  2. X:Josh Woodward (@joshwoodward, Google Labs VP)30

    Google Labs 副总裁 Josh Woodward 推荐手机端 Gemini Notebook 相机功能

    Google Labs 副总裁 Josh Woodward 推荐在手机上使用 Gemini Notebook,并转发 Steven Johnson 的使用体验:他在 Sierras 用 Gemini Notebook 移动端相机拍摄博物馆展板,要求生成图中全部信息的详细报告,自行核查后准确率约 99%,部分模糊文字连他本人都难以辨认。

9月17日周四