PixVerse 推出 ChatGPT 插件:一句提示词生成电影级短片
PixVerse 上线 ChatGPT 插件,用户输入 "pixverse cinematic story" 并描述故事、情绪或风格,即可由 PixVerse 自动完成镜头、画面与节奏,生成电影级短片。插件可通过 app.pixverse.ai/cli/marketing 获取。
PixVerse 上线 ChatGPT 插件,用户输入 "pixverse cinematic story" 并描述故事、情绪或风格,即可由 PixVerse 自动完成镜头、画面与节奏,生成电影级短片。插件可通过 app.pixverse.ai/cli/marketing 获取。
PixVerse 上线 ChatGPT 插件,用户添加插件后输入 pixverse cinematic story 并描述故事、情绪或风格,即可生成电影感短片,镜头、画面与节奏由 PixVerse 自动处理。
PixVerse 推出 Marketing Prompts,用户可在 ChatGPT 中安装 PixVerse 插件、选择提示词并直接开始创作。该功能通过 app.pixverse.ai/cli/marketing 提供提示词驱动的 PixVerse 工作流。
PixVerse 推出新插件,用户选择角色后即可让其开口说话,在镜头前自然地表达、反应和做手势,视频片段由 PixVerse 自动生成。
Tavus 发布 Griffin,称其为首个通过视频图灵测试的模型,48% 与其实时对话的人认为它是真人,此前系统的通过率低于 3%。Griffin 在 NVIDIA 全双工 AI 视频基准上排名第一,被定义为首个 Human Interaction Model(HIM),可同时听、看、说,并生成完整画面而非仅面部。
Karpathy 分享理解大语言模型输出的提示词技巧,包括要求模型用 ASD-STE100 受控语言写作,或提出 80% 接近该规范以降低严格程度。他还建议让模型生成图表、HTML 交互网页,以及用 ElevenLabs API key 配音的 3b1b 风格讲解视频。他认为随着模型变强,工作会更多上升到监督与理解层面,可以索取以往不划算的大型定制一次性软件产物。
Tavus 推出视频到视频模型 Griffin 的研究预览版,面向实时面对面对话,可从对话中学习交流行为,在对话中边看边听,能中途插话或在有人进入画面时作出回应。
Tavus 推出视频到视频模型 Griffin 的研究预览,面向实时面对面对话,可在对话中观看和聆听,并能在对方说到一半时打断或对进入画面的人作出回应。
Tavus 推出 Griffin,公司称其为首个 Human Interaction Model(HIM),可在接收和生成视频的同时处理语音、面部表情、语调、手势和停顿。
MiniMax H3 在 MachGen 平台上线 30 秒连续视频生成,突破其原生 15 秒上限,且无需拼接片段,实现 100% 连续运动。该功能已在 UI 和 API 上开放公测,用户可选择 16-30 秒时长。
Runway Labs 发布 Project Continuum,一个围绕实时视频界面构建的操作系统研究应用,并给出四种与电脑交互方式的早期预览:Portals、Visual Thinking、Responsive Video Interfaces 和 Interactive Worlds。
Runway Labs 发布 Project Continuum,一个围绕实时视频界面构建的操作系统研究应用,并首次展示四种与电脑交互的新方式:Portals、Visual Thinking、Responsive Video Interfaces 和 Interactive Worlds。
Runway Labs 发布 Project Continuum,一个围绕实时视频界面构建的操作系统研究应用,并首次展示四种与电脑交互的新方式:Portals、Visual Thinking、Responsive Video Interfaces 和 Interactive Worlds。
Runway Labs 发布 Project Continuum,一个围绕实时视频界面构建的操作系统研究应用。官方同时放出一段简短的演示走查视频。
Tavus 发布 Griffin,称其为首个通过视频图灵测试的模型,48% 的实时对话者认为它是真人,而此前系统的通过率低于 3%。该模型在 NVIDIA 的全双工 AI 视频基准上排名第一,并被称作首个 Human Interaction Model(HIM)。
fal 推出 Recast,可一键替换视频中的角色:上传一段现有视频和一张新角色的参考照片,即可在保留原始运动、镜头运动、剪辑和音频的前提下更换出镜人物。该功能由 H3 Max 驱动,fal 称其在整体质量、提示词理解和美学上优于领先视频模型。用户可在 fal 平台 minimax/h3-max/recast 页面试用,用于生成角色变体或为不同受众改编广告素材,无需重新拍摄。
fal 发布 fal Recast,上传一段现有视频加一张新角色的参考照片,即可一键替换画面中的人物。官方称 Recast 会保留原视频的运动、镜头运动、剪辑和音频,可用于生成角色变体、为不同受众改编广告素材而无需重新拍摄。该功能由 H3 Max 驱动,fal 称其在整体质量、提示词理解和美学上优于主流视频模型。
xAI 的 Grok Imagine Video 1.5 Lite 已在 fal 上线,这是 Grok Imagine 视频家族中的轻量级模型,支持文生视频和图生视频并带原生音频。该模型可生成 1 至 15 秒、480p/720p/1080p 分辨率的视频,覆盖从 16:9 到 9:16 的 7 种宽高比。
Grok Imagine Video 1.5 Lite 已在 fal 上线,是 Grok Imagine 视频家族中的轻量级模型。它支持文生视频与图生视频,可生成 1 至 15 秒、带原生音频的视频,输出 480p、720p 和 1080p,覆盖从 16:9 到 9:16 的 7 种宽高比。
Tavus 预览了其最新模型 Griffin,一款能看、能听、能发声并像人一样呈现的 Human Interaction Model,目前尚未公开可用,此次仅为有限的研究预览。
MiniMax 将于 10 月 5 日至 8 日参展 Advertising Week New York,展位 A16E,全周进行 MiniMax H3 现场演示。
MiniMax H3 Max 的 Reference to Video(图生视频)API 已在 fal 上线,可直接试用。H3 Max 是 MiniMax H3 的后训练变体,针对更强的提示词遵循能力和更优美学效果做了调优,并与 fal 自研推理栈协同优化以提升吞吐。
H3 Max Reference-to-Video 现已支持首帧、中间帧和末帧控制,用户可设定关键帧、选择中间帧出现时机,并添加图像或视频参考来引导场景。该功能让创作者能够掌控镜头的起始、展开与结束。
论文 Adaptive Reward Routing 提出通过前向过程 RL 为音视频联合扩散模型做动态多奖励优化,取代单一评分方案。该方法面向生成式媒体,论文已在 HuggingFace 上线(2609.37200)。
Runway 展示时尚品牌如何用 Runway Dev 完成从草图到广告大片的流程:把草图渲染成真实服装、探索配色与图案、生成电商产品图,并制作棚拍或外景的模特照片与视频。完整演示已上线。
Suno 发布幕后内容,由 Braylon Browner 与艾美奖获奖编舞/导演 Nina McNeely 出镜,展示从舞蹈到歌曲、再到围绕动作构建完整创意世界的过程。
Runway AI Summit 闭幕,联合创始人兼联合 CEO Cristóbal Valenzuela 回顾生成式视频的演进,并发布 Runway Labs 最新项目 Continuum。完整演讲内容将在 summit.runway.com/talks 上线,可注册获取通知。
PixVerse 上线 ChatGPT 插件,用户可免费安装并选用营销提示词,在 ChatGPT 内直接启动 PixVerse 创作工作流。插件入口为 app.pixverse.ai/cli/marketing,官方同时提供 "PixVerse Marketing Prompts" 提示词库供选择。
PixVerse 插件支持将产品创意转化为开箱视频,用户只需描述产品、场景和出镜者的反应,AI 智能体即可调用 PixVerse 生成视频。
商汤发布 SenseNova 6.8 Flash Preview,其 Dynamic Design 功能可将静态图像转为有节奏的动态场景。小红书创作者 @Muzlz8888(Mr.木子李子)用它让沙尘旋起、溪水流动、鸭子活动和雪花飘落,同时保持建筑静止。
Kling 4.0 已进入封闭测试,官方正式版将于今年 10 月发布。该版本在视觉真实感、创作控制力和叙事完整性上把视频创作提升到新水平。
Griffin 发布,被称为首个通过视频图灵测试的模型,48% 与其实时对话的人认为它是真人,此前系统的通过率低于 3%。它还在 NVIDIA 的全双工 AI 视频基准上排名第一,被称为首个 Human Interaction Model(HIM)。
Yuchen Jin 表示目前没有 AI 能直接生成 Andrej Karpathy 风格的视频,并呼吁已停更一年多的 Karpathy 回归 YouTube。他分享用 LLM 理解模型输出的技巧:让 LLM 用 ASD-STE100 受控语言写作、生成图表、输出 HTML 交互网页,以及用 ElevenLabs API key 制作 3b1b 风格讲解视频,后者已开始可行。
商汤发布 SenseNova 6.8 Flash Preview 的"动态设计"(Dynamic Design)功能,可将静态图像转化为动态视频。官方演示包括黄果树瀑布、青海门源金色花海等场景,以及熊猫动画片段。
商汤发布由 SenseNova 6.8 Flash Preview 驱动的 Dynamic Design,可将静态图像转化为动态内容。该功能以预览版形式亮相,官方演示展示了黄果树瀑布、青海门源等静态图片的动态化效果。
PixVerse 将于 10 月 21-22 日在纽约 NAB Show NY 现场演示 AI 视频从概念到成片的制作工作流,认为 AI 视频正从一次性生成走向更快、更灵活的生产流程。10 月 21 日 Day 1 结束后还设有 happy hour 活动。
fal CTO @gorkem 在 GenMedia Conference 上表示,生成式媒体已达到“token market fit”,专业人士如今整日坐在电脑前用 AI 生成视频。他指出,AI 市场中只有编程智能体和视频生成能让单个用户高效消耗如此大量 token,这是过去一年生成式媒体最大的变化。
Runway Research 团队在一场深度问答中讨论了实时模型、生成式界面以及机器人技术的下一步方向。内容以视频形式发布,未披露具体模型版本、参数或性能数据。
LongLive-Plug 提出一种面向视频生成的一次性(one-step)通用蒸馏方法,可让长时长视频生成更易部署,并为需要快速出片的创作者节省算力与时间。该方法无需多次迭代即可完成蒸馏。
HiDream-O1-Video-1.0 以 1456 分进入 Image-to-Video Arena 排名第 7,距 gemini-omni-flash 差 8 分,与 dreamina-seedance-2.0 和 2.5 的差距在 20 分以内。