跳到正文

#视频

今日 3 条
今天10月9日周五
10月8日周四
10月3日周六
10月2日周五
10月1日周四
9月29日周二
9月28日周一
9月18日周五
9月2日周三
8月28日周五
7月27日周一
7月1日周三
  1. Google DeepMind78

    Google DeepMind 发布 Nano Banana 2 Lite 与 Gemini Omni Flash

    Google DeepMind 发布 Nano Banana 2 Lite(gemini-3.1-flash-lite-image)和 Gemini Omni Flash(gemini-omni-flash-preview)两款模型,前者是 Nano Banana 家族中速度最快、成本最低的图像模型,后者支持高质量视频生成与对话式编辑。

    推荐理由:Google DeepMind 同时放出图像与视频两款新模型,并给出延迟、单价和可用入口,便于开发者评估替换与串联方案。

5月18日周一
4月28日周二
  1. Hugging Face Blog71

    NVIDIA 发布 Nemotron 3 Nano Omni 全模态理解模型

    NVIDIA 发布 Nemotron 3 Nano Omni,一款面向文档分析、多图推理、语音识别、长音视频理解与智能体电脑操作的全模态理解模型,在 MMlongbench-Doc、OCRBenchV2、WorldSense、DailyOmni、VoiceBench 等基准上取得领先成绩。

    推荐理由:原文给出架构、训练配方与多模态基准对比,可据此判断开源全模态模型在文档、音视频与GUI任务上的位置。

1月20日周二
  1. Hugging Face Blog66

    Overworld 发布实时交互视频扩散模型 Waypoint-1

    Overworld 发布实时交互式视频扩散模型 Waypoint-1,可通过文本、鼠标和键盘控制,权重已上传 Hugging Face Hub,先开放 Waypoint-1-Small,Medium 版本即将推出。

    推荐理由:Waypoint-1 把实时交互式视频扩散模型和推理库一并开源,读者可据此了解世界模型从控制输入到消费级硬件落地的路径。

1月16日周五
  1. Google DeepMind62

    Google DeepMind 发布 D4RT 模型,统一 4D 场景重建与追踪

    Google DeepMind 发布 D4RT(Dynamic 4D Reconstruction and Tracking),一个统一 4D 场景重建与追踪的 AI 模型,采用编码器-解码器 Transformer 架构和查询机制,可同时完成点追踪、点云重建和相机位姿估计。

    推荐理由:D4RT 把动态场景重建统一进单一查询式框架,读者可了解其速度提升与机器人、AR 等落地方向。

9月30日周二
  1. OpenAI News65

    OpenAI 发布 Sora 2 视频与音频生成模型系统卡

    OpenAI 发布新一代视频与音频生成模型 Sora 2,并公布其系统卡。相比此前的 Sora,新模型在物理准确性、真实感、音频同步、可控性和风格范围上有所提升,官方称这些能力是此前视频模型难以实现的。

    推荐理由:官方系统卡披露 Sora 2 在物理准确性、同步音频与可控性上的能力变化,可据此了解视频生成的新边界。

12月9日周一
  1. OpenAI News62

    OpenAI 发布 Sora 系统卡

    OpenAI 发布 Sora 系统卡,介绍其视频生成模型 Sora 支持文本、图像和视频输入并生成新视频。Sora 基于 DALL-E 和 GPT 模型的经验构建,旨在为叙事和创意表达提供更丰富的工具。

    推荐理由:OpenAI 官方系统卡披露 Sora 的输入输出形式与技术来源,可了解其能力边界与安全评估框架。