了解更多关于 Odyssey-3 的信息,请访问他们的技术博客。 odyssey.systems/meet-odyssey…
#视频
#视频
rohanpaul_ai@rohanpaul_aiAI 评分 rohanpaul_ai@rohanpaul_aiAI 评分 omarsar0@omarsar0AI 评分
ArtificialAnlys@ArtificialAnlysAI 评分 ArtificialAnlys@ArtificialAnlysAI 评分
X:可灵 Kling AI (@Kling_ai)AI 评分 可灵 Kling 4.0 与 Kling 4.0 Flash 创作展示
可灵发布 Kling 4.0 和 Kling 4.0 Flash,并展示创作者用其生成的作品。官方称 Kling 4.0 正在推动 AI 创意前进,评论区有用户询问具体发布时间。
X:Elvis Saravia (@omarsar0, DAIR.AI)AI 评分 Tavus 发布视频对话模型 Griffin,称首个通过视频图灵测试
Tavus 发布视频到视频模型 Griffin,作者获得早期体验权限,称其能边看边听用户说话,可打断用户、接受被打断,并对房间内发生的事作出反应。
tavus@tavusAI 评分 X:Testing Catalog (@testingcatalog)AI 评分 Tavus 发布视频对话模型 Griffin 研究预览
Tavus 推出视频到视频模型 Griffin 的研究预览版,面向实时面对面对话,可从对话中学习交流行为,在对话中边看边听,能中途插话或在有人进入画面时作出回应。
X:Testing Catalog (@testingcatalog)AI 评分 Tavus 发布实时视频对话模型 Griffin 研究预览
Tavus 推出视频到视频模型 Griffin 的研究预览,面向实时面对面对话,可在对话中观看和聆听,并能在对方说到一半时打断或对进入画面的人作出回应。
The DecoderAI 评分Tavus 发布 Griffin 人机交互模型,48% 测试者一分钟通话后误认为真人
Tavus 推出 Griffin,公司称其为首个 Human Interaction Model(HIM),可在接收和生成视频的同时处理语音、面部表情、语调、手势和停顿。
ViggleAI@ViggleAIAI 评分 X:Elvis Saravia (@omarsar0, DAIR.AI)AI 评分 Tavus 预览 Human Interaction Model Griffin:能看、能听、能发声、能像人一样呈现
Tavus 预览了其最新模型 Griffin,一款能看、能听、能发声并像人一样呈现的 Human Interaction Model,目前尚未公开可用,此次仅为有限的研究预览。
Kling_ai@Kling_aiAI 评分 Kling 4.0 现已开启封闭测试,正式发布将于今年 10 月到来。 Kling 4.0 将视频创作提升到新的视觉真实感、创意控制和叙事完整度水平,
X:Peter Steinberger (@steipete)AI 评分 Griffin 发布:首个通过视频图灵测试的模型
Griffin 发布,被称为首个通过视频图灵测试的模型,48% 与其实时对话的人认为它是真人,此前系统的通过率低于 3%。它还在 NVIDIA 的全双工 AI 视频基准上排名第一,被称为首个 Human Interaction Model(HIM)。
X:商汤 SenseTime (@SenseTime_AI)AI 评分 商汤 SenseNova 6.8 Flash Preview 驱动 Dynamic Design,让静态图像动起来
商汤发布由 SenseNova 6.8 Flash Preview 驱动的 Dynamic Design,可将静态图像转化为动态内容。该功能以预览版形式亮相,官方演示展示了黄果树瀑布、青海门源等静态图片的动态化效果。
arena@arenaAI 评分 MiniMax_AI@MiniMax_AIAI 评分
ojiji2025@ojiji2025AI 评分 我试用了 Kling 4.0 flash,没有让我失望! 与 Kling 3.0 相比,快速运动有了巨大提升! 干得漂亮 @Kling_ai
Kling_ai@Kling_aiAI 评分 可灵 Kling AI 宣布 Kling 4.0 将于 10 月发布,Kling 4.0 Flash 现已面向 Ultra 年度订阅用户开放。
MiniMax_AI@MiniMax_AIAI 评分
theworldlabs@theworldlabsAI 评分 所有这些都由一个统一架构驱动:一个从零预训练的多模态自回归扩散 Transformer。 这一基础融合了现代 LLM 和视频模型的优势,受益于这两个领域的架构、算法和系统进步。
arena@arenaAI 评分
Google DeepMind精选AI 评分Google DeepMind 发布 Gemini Omni 1.1 Flash,新增场景延长与 4K 放大
Google DeepMind 发布 Gemini Omni 1.1 Flash,通过 Gemini API 在 Google AI Studio 提供面向开发者的生成视频创作控制能力。
推荐理由:官方列出了场景延长、首尾帧插值与 4K 放大等具体能力与开放入口,可据此判断生成视频工作流的改动空间。
Hugging Face BlogAI 评分
NVIDIA Cosmos-H-Dreams:为手术机器人带来实时生成式仿真
NVIDIA 推出 Cosmos-H-Dreams,一个面向手术机器人的实时、动作条件生成式仿真器,由 Cosmos-H-Surgical-Simulator 蒸馏为因果少步学生模型,并通过 FlashDreams 流式推理库部署。
Google DeepMind精选AI 评分Google DeepMind 发布 Nano Banana 2 Lite 与 Gemini Omni Flash
Google DeepMind 发布 Nano Banana 2 Lite(gemini-3.1-flash-lite-image)和 Gemini Omni Flash(gemini-omni-flash-preview)两款模型,前者是 Nano Banana 家族中速度最快、成本最低的图像模型,后者支持高质量视频生成与对话式编辑。
推荐理由:Google DeepMind 同时放出图像与视频两款新模型,并给出延迟、单价和可用入口,便于开发者评估替换与串联方案。
Google DeepMind精选AI 评分Google DeepMind 发布 Gemini Omni Flash,支持多模态输入生成与对话式视频编辑
Google DeepMind 发布 Gemini Omni 家族首个模型 Gemini Omni Flash,可组合图像、音频、视频和文本作为输入生成高质量视频,并通过自然语言多轮编辑视频。
推荐理由:Gemini Omni Flash 把多模态输入与对话式视频编辑结合,读者可据此判断视频创作流程的变化。
Hugging Face Blog精选AI 评分
NVIDIA 发布 Nemotron 3 Nano Omni 全模态理解模型
NVIDIA 发布 Nemotron 3 Nano Omni,一款面向文档分析、多图推理、语音识别、长音视频理解与智能体电脑操作的全模态理解模型,在 MMlongbench-Doc、OCRBenchV2、WorldSense、DailyOmni、VoiceBench 等基准上取得领先成绩。
推荐理由:原文给出架构、训练配方与多模态基准对比,可据此判断开源全模态模型在文档、音视频与GUI任务上的位置。
Hugging Face Blog精选AI 评分
Overworld 发布实时交互视频扩散模型 Waypoint-1
Overworld 发布实时交互式视频扩散模型 Waypoint-1,可通过文本、鼠标和键盘控制,权重已上传 Hugging Face Hub,先开放 Waypoint-1-Small,Medium 版本即将推出。
推荐理由:Waypoint-1 把实时交互式视频扩散模型和推理库一并开源,读者可据此了解世界模型从控制输入到消费级硬件落地的路径。
Google DeepMind精选AI 评分Google DeepMind 发布 D4RT 模型,统一 4D 场景重建与追踪
Google DeepMind 发布 D4RT(Dynamic 4D Reconstruction and Tracking),一个统一 4D 场景重建与追踪的 AI 模型,采用编码器-解码器 Transformer 架构和查询机制,可同时完成点追踪、点云重建和相机位姿估计。
推荐理由:D4RT 把动态场景重建统一进单一查询式框架,读者可了解其速度提升与机器人、AR 等落地方向。
OpenAI News精选AI 评分 OpenAI 发布视频生成模型 Sora 2
OpenAI 发布视频生成模型 Sora 2,支持同步对白与音效。原文同时说明 Sora 产品已不再提供。
推荐理由:原文给出 Sora 2 在视频生成中同步对白与音效的能力方向,可据此了解视频模型的新进展。
OpenAI News精选AI 评分 OpenAI 发布 Sora 2 视频与音频生成模型系统卡
OpenAI 发布新一代视频与音频生成模型 Sora 2,并公布其系统卡。相比此前的 Sora,新模型在物理准确性、真实感、音频同步、可控性和风格范围上有所提升,官方称这些能力是此前视频模型难以实现的。
推荐理由:官方系统卡披露 Sora 2 在物理准确性、同步音频与可控性上的能力变化,可据此了解视频生成的新边界。
OpenAI News精选AI 评分 OpenAI 发布 Sora 系统卡
OpenAI 发布 Sora 系统卡,介绍其视频生成模型 Sora 支持文本、图像和视频输入并生成新视频。Sora 基于 DALL-E 和 GPT 模型的经验构建,旨在为叙事和创意表达提供更丰富的工具。
推荐理由:OpenAI 官方系统卡披露 Sora 的输入输出形式与技术来源,可了解其能力边界与安全评估框架。