Google Research 发布 AI 视频联合导演框架,实现连贯长视频生成
Google Research 发布 AI video co-director 等多智能体框架,用于生成连贯的长篇多镜头视频,相关论文将出现在 COLM 2026 和 EMNLP 2026。
推荐理由:Google 把长视频生成拆成规划、分镜、自回归生成与闭环修正四套框架,并给出多组基准上的连续性提升结果。
AI 视频生成与理解:文生视频模型、视频编辑工具与影视创作变革的追踪。
Google Research 发布 AI video co-director 等多智能体框架,用于生成连贯的长篇多镜头视频,相关论文将出现在 COLM 2026 和 EMNLP 2026。
推荐理由:Google 把长视频生成拆成规划、分镜、自回归生成与闭环修正四套框架,并给出多组基准上的连续性提升结果。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,把近实时视频生成与语音对话结合,为原生实时对话模型加入动态视觉形象,即日起在 Gemini Enterprise 可用。
推荐理由:官方给出 Live Avatar 的能力边界与开放入口,读者可据此判断实时视频对话在企业场景的可用性。
World Labs 联合创始人 Fei-Fei Li、Justin Johnson、Ben Mildenhall 与 a16z 的 Martin Casado 在对话中介绍 Atlas,称其是首个统一像素生成与像素重建的模型,建立在“新视角预测”之上。
推荐理由:World Labs 团队解释 Atlas 以新视角预测统一生成与重建,并给出 3D 采集成本下降的具体量级。