Google Research 发布 AI 视频联合导演框架,实现连贯长视频生成
Google Research 发布 AI video co-director 等多智能体框架,用于生成连贯的长篇多镜头视频,相关论文将出现在 COLM 2026 和 EMNLP 2026。
推荐理由:Google 把长视频生成拆成规划、分镜、自回归生成与闭环修正四套框架,并给出多组基准上的连续性提升结果。
Google Research 发布 AI video co-director 等多智能体框架,用于生成连贯的长篇多镜头视频,相关论文将出现在 COLM 2026 和 EMNLP 2026。
推荐理由:Google 把长视频生成拆成规划、分镜、自回归生成与闭环修正四套框架,并给出多组基准上的连续性提升结果。
Google Labs 的新实验项目 Dreambeans 每天早上"冲泡"固定数量的 "beans",把用户指向真实世界中与真人一起做自己在意的事。该项目正在积累一批日益壮大的忠实拥趸,Google Labs VP Josh Woodward 邀请用户试用。
Google Labs 上线 Dreambeans,可在 labs.google/dreambeans 访问,每天主动生成个性化故事合集,覆盖用户最关心的话题。该产品由 Google Labs VP Josh Woodward 在 X 上转发推广。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,把近实时视频生成与语音对话结合,为原生实时对话模型加入动态视觉形象,即日起在 Gemini Enterprise 可用。
推荐理由:官方给出 Live Avatar 的能力边界与开放入口,读者可据此判断实时视频对话在企业场景的可用性。
Gemini 3.8 Live 与 Live Avatar 现已在 Gemini Enterprise 正式可用,主要能力包括视频化身、流畅对话和工具调用等。该版本提供美国和欧盟端点,具备预置吞吐量、企业合规与严格数据治理,用户可在 Gemini 中试用该模型及其功能。
DeepMind Institute 发布 3 篇新文章,分别探讨如何控制智能体集群的失序行为、如何编排 AI 与人类构成的复杂网络,以及让 AGI 收益公平分配的理由。文章可在 institute.deepmind.com 获取。
NVIDIA 联合 Google DeepMind、EMBL-EBI 等机构,通过 AlphaFold Database 开放发布 2800 多种病毒的蛋白质复合物预测 3D 结构,供全球科学家免费使用。
Remedy Entertainment 的 CONTROL Resonant 已在发售当日上线 GeForce NOW,Ultimate 会员可以 GeForce RTX 5080 级性能串流,支持 DLSS 4、光线追踪、NVIDIA Reflex 和最高 5K HDR,无需 100GB 本地安装。
腾讯混元 Hy Image 3.5 preview 已在 GMI Cloud 上线,每张图定价 $0.024,比 GPT Image 2 便宜 8.8 倍、比 Nano Banana Pro 便宜 5.6 倍。用户可通过 GMI Cloud 直接创建图像。
Gemini Notebook 现可在 Google Docs 中作为上下文来源上传和引用,用户能把 Notebook 中的深度研究内容与邮件、聊天、文件等其他来源结合,直接在草稿中个性化写作流程。该功能由 Workspace Intelligence 提供支持。
Simon Willison 发布 Gemini 3.8 TTS Playground,一个自带 API key 的交互界面,可测试 Google 的 Gemini 3.8 文本转语音 API,支持单人或多人对话配音、试听生成音频并查看请求与响应细节,设置可保存为可分享的 URL。
Google Gemini 新增接入 Adobe、Squarespace、Peloton 等 13 款应用,用户可在 Gemini 内直接完成业务运营、素材设计与健身计划,无需在标签页之间切换。Google 同时向用户征集下一批希望接入的应用。
Gemini 应用今日上线 13 个新的 MCP 连接,包括 Adobe、Squarespace、OnePeloton、Experian、Apartments.com、Picsart、SeatGeek、Airtable、monday.com、Webflow、PandaDoc、Linear 和 WisprFlow。
Gemini 现已支持通过 WisprFlow 总结会议、记录语音笔记并提取行动项,用户可直接对 Gemini 说“Check what decisions came out of my most recent meetings with Wispr.”来查询最近会议得出的决策。
Gemini 应用新增 13 个应用连接,包括 Adobe、Squarespace、Peloton、Experian、Apartments.com、Picsart、SeatGeek、Airtable、monday.com、Webflow、PandaDoc、Linear 和 Wispr Flow,用户可在 Gemini 内直接完成修图、查信用分、找房源、管理项目表格等操作。
Google Private AI Compute 团队公布为 Private AI Compute 平台引入私有服务端记忆,让 AI 助手在跨设备场景下保留上下文,同时维持设备端级别的隐私标准。
推荐理由:原文说明了云端持久记忆如何用设备侧密钥与安全隔区实现跨设备连续性,读者可据此理解隐私架构的取舍。
Google DeepMind 的 Logan Kilpatrick 表示,其音频模型套件从 TTS、Live、Lyria 到 Translate、Transcribe 持续进步。该团队将在旧金山举办名为 Gemini Audio | At Night 的音频体验活动,定位为聚焦语音优先 AI 前沿的沉浸式夜晚。
Google 发布 Gemini 3.8 Flash-Lite TTS 和 Gemini 3.8 Flash TTS 两款语音模型,官方称是其目前表现力最强的音频模型。这两款模型同时在 Google AI Studio 提供新的使用体验,成本低于此前的 3.1 Flash TTS 模型。
Google 发布 Gemini 3.8 Flash 和 Flash-Lite TTS 文本转语音模型,官方称其为新的 SOTA 语音模型。该模型提供新的语音设计体验、2000+ 可直接用于生产的音色、声音复刻、支持 100 种语言,语音混音功能即将推出,并在 Hume AI 的语音基准上排名第一。
Google 发布最新的文本转语音与声音设计模型,已在 AI Studio 上线。该模型提供数千种新声音可选,可在 30 秒内复刻用户自己的声音,仅用提示词即可设计声音,并支持用表现力标签进行控制。
Google 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款语音模型,支持 100+ 语言自定义音色和 2000+ 现成音色,可逐行控制语气并加入 <laughs>、|mhm| 等自然提示。
推荐理由:两款语音模型给出不同定位与开放入口,读者可据此判断实时语音智能体与批量配音的成本取舍。
Google 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款语音模型,支持 100+ 语言的自定义音色或从 2,000+ 现成音色中挑选,可逐行控制语气并加入 <laughs>、|mhm| 等自然提示,生成数小时稳定无故障音频。
推荐理由:两款 TTS 模型给出不同定位与适用场景,读者可据此判断语音创作与实时语音智能体的选型。
Google DeepMind 发布两款文本转语音模型。Gemini 3.8 Flash TTS 可设计具有不同口音和特征的独特声音;Gemini 3.8 Flash-Lite TTS 面向效率与规模化,可从自建风格或官方生产级声音库中选择。
推荐理由:Google DeepMind 发布两款 TTS 模型,读者可了解语音定制与规模化部署的两种定位差异。
Google DeepMind 发布 Gemini 3.8 Flash-Lite TTS 和 Gemini 3.8 Flash TTS,称其为目前表现力最强的音频模型。用户可逐行微调语速、情绪以及笑声、停顿等提示,所有生成音频都带有 SynthID 水印,可被识别为 AI 生成。开发者可通过 GoogleAIStudio 使用 Gemini API 开始构建。
Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,前者面向角色语音设计与逐行表演导演,后者面向高并发、低成本的配音与语音智能体场景。
推荐理由:官方给出两款 TTS 模型的语音设计、逐行导演能力与基准排名,可据此判断语音生成工作流的变化。
Google 的 Empirical Research Assistance(ERA)把可写成评分函数的科学问题交给 Gemini 自动求解:它维护一棵实验 notebook 树。
Google Labs 副总裁 Josh Woodward 宣布,Google Flow 每月有超过 2500 万人使用,用于构思创意、创作故事和搭建作品。他表示将继续为所有用户提供每天额外 50 个 credits,并邀请用户继续创作。
Gemini Notebook 的 Interactive Learning Overviews 现已面向所有用户开放,可在 Reports 下把来源摘要与 studio artifacts 整合进一个交互式中心。该功能面向学习备考或对某一新主题做一站式深入探索。
Jeff Dean 在离开 Google 后首次公开对话中,与 Dawn Song 讨论了 AI 未来走向,话题涵盖如何识别基础性想法、如何选择值得投入 5 年的研究问题、编程对构建推理模型的启发、递归自我改进(RSI)的可能形态,以及科学发现循环自动化与 AI 自主性带来的安全挑战。他还谈到自己的新创业公司将如何参与这一领域。
Google 发布 Googlebook 笔记本平台,将 ChromeOS 与 Android 的最佳能力结合,打造面向笔记本的新平台。初期重点是为 Android 手机用户提供体验出色的笔记本。Sundar Pichai 转发了 Sameer Samat 的这条发布推文。
Gemini Notebook 宣布 Live Chat 已在移动端向所有 Ultra 用户 100% 全量开放,支持与笔记本进行实时语音对话,覆盖约 100 种语言。该功能由最新音频模型驱动,可就来源内容提问并获得分步指导,几乎完全免手操作。
Google 推出 Gemini 3.8 Live 和 3.8 Live Extended Thinking,称其为目前最先进的实时对话音频模型。Google Labs 的 Dreambeans 正式 GA,CC 从个人生产力工具扩展为帮助家庭协调日程与日常事务的共享智能体,Google Workspace 的 Google Pics 图像生成与协作工具也已 GA。
Google Research 发布一项研究实验,让教师借助生成式 UI(GenUI)创建贴合自身课程目标的互动教学模拟,并同步开放 30 多个面向中学 STEM 的英文学习互动样例库,均由 AI 生成、教师审核。
Google Labs 宣布推出新的 CC,一款面向家庭的 AI 智能体,目标是减少家庭事务安排时间。
Gemini Notebook 移动应用相机功能可将拍摄的照片转化为详细报告。Steven Johnson 在 Sierras 拍摄博物馆展品照片后,请求生成图中所有信息的详细报告,经自行核查准确率达 99%,部分模糊文字也能转录。下一步计划为所有照片生成此类文档,并让 Notebook 标注与已有知识库或最新写作大纲相关的新信息。
Google Labs 副总裁 Josh Woodward 推荐在手机上使用 Gemini Notebook,并转发 Steven Johnson 的使用体验:他在 Sierras 用 Gemini Notebook 移动端相机拍摄博物馆展板,要求生成图中全部信息的详细报告,自行核查后准确率约 99%,部分模糊文字连他本人都难以辨认。
Google DeepMind 宣布 AlphaGenome Atlas 免费开放,该数据库为人类基因组中 90 亿个单核苷酸变异提供分子效应预测和 AVI 评分,供全球研究人员探索疾病的遗传成因。
Google DeepMind 与 ScienceStowers 合作发布 AlphaGenome Atlas,映射 2500+ 调控模式,覆盖数百种细胞类型中充当基因开关的 DNA 序列。
Google DeepMind 发布 AlphaGenome Atlas,Broad Institute、UniofExeter 等机构的研究人员已用它识别潜在致病 DNA 变异并解读其作用。
Demis Hassabis 与 Rohin Shah 撰文反驳"Chain of Thought 终将消失"的观点,主张模型设计仍有选择空间,应有意保留可监控性。该文随 DeepMind Institute 的成立一同发布,题为《The case for reasoning transparency》,认为当前能窥见最强 AI 模型思维过程的窗口需要被保持开放。