跳到正文

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

115条精选相关主题图像生成AI 视频语音与音频

最新精选

第 101–115 条 · 共 115 条
2月26日周一
2月15日周四
  1. OpenAI News88

    OpenAI 研究:视频生成模型可作为世界模拟器

    OpenAI 探索在视频数据上大规模训练生成模型,将文本条件扩散模型联合训练于不同时长、分辨率和宽高比的视频与图像,并采用在视频和图像潜码时空 patch 上运行的 Transformer 架构。其最大模型 Sora 能生成一分钟高保真视频,结果提示扩展视频生成模型是构建通用物理世界模拟器的一条可行路径。

    推荐理由:OpenAI 公开了视频生成模型的训练思路,读者可了解扩散模型与 Transformer 如何被用于构建物理世界模拟器。

11月6日周一
9月25日周一
8月22日周二
3月14日周二
  1. OpenAI News91

    OpenAI 发布多模态大模型 GPT-4

    OpenAI 发布 GPT-4,称其为扩展深度学习规模的最新里程碑。GPT-4 是一个大型多模态模型,接受图像和文本输入、输出文本,在多项专业和学术基准上达到人类水平表现,但在许多真实场景中仍不及人类。

    推荐理由:OpenAI 官方给出 GPT-4 的多模态输入能力与基准表现,读者可据此了解这一代模型的定位。

  2. OpenAI News86

    OpenAI 发布 GPT-4

    OpenAI 发布 GPT-4,官方称其可在创意与技术写作任务中生成、编辑内容并与用户反复迭代,例如作曲、写剧本或学习用户的写作风格。

    推荐理由:OpenAI 官方公布 GPT-4 的写作能力,读者可据此了解它在创作与技术写作任务上的定位。

12月16日周五
12月15日周三
  1. Hugging Face Blog62

    Hugging Face 将 Perceiver IO 加入 Transformers,统一处理文本图像音频视频

    Hugging Face 宣布在 Transformers 库中加入 Perceiver IO,这是首个基于 Transformer、可处理文本、图像、音频、视频、点云等多种模态及其组合的神经网络。

    推荐理由:Hugging Face 把 Perceiver IO 接入 Transformers,读者可了解这套统一处理文本、图像、音频、视频的架构如何落地调用。

3月4日周四
  1. OpenAI News62

    OpenAI 在 CLIP 中发现多模态神经元

    OpenAI 在 CLIP 中发现了一类多模态神经元,无论概念以字面、符号还是概念化形式呈现,这些神经元都会产生响应。OpenAI 表示,这或许能解释 CLIP 为何能准确分类出人意料的概念视觉呈现,也是理解 CLIP 及类似模型所学关联与偏置的重要一步。

    推荐理由:OpenAI 公开了 CLIP 中多模态神经元的发现,为理解模型如何跨形式关联概念提供了线索。

1月5日周二
  1. OpenAI News80

    OpenAI 发布 CLIP:用自然语言连接文本与图像

    OpenAI 发布名为 CLIP 的神经网络,通过自然语言监督高效学习视觉概念。CLIP 只需提供待识别视觉类别的名称,即可应用于任意视觉分类基准,类似 GPT-2 和 GPT-3 的零样本能力。

    推荐理由:OpenAI 官方介绍 CLIP 如何用自然语言监督学习视觉概念,并说明其零样本迁移到任意分类基准的方式。

4月30日周四
  1. OpenAI News70

    OpenAI 发布音乐生成神经网络 Jukebox 并开源模型权重与代码

    OpenAI 推出 Jukebox,一个能生成音乐的神经网络,可输出多种流派和艺术家风格的原始音频,并包含初步的歌唱。OpenAI 同时发布了模型权重和代码,以及一个用于探索生成样本的工具。

    推荐理由:OpenAI 公开 Jukebox 的模型权重与代码,读者可了解这套音乐生成神经网络的能力边界与开放程度。

4月25日周四
  1. OpenAI News62

    OpenAI 发布 MuseNet 音乐生成神经网络

    OpenAI 发布 MuseNet,一个深度神经网络,可生成 4 分钟、包含 10 种乐器的音乐作品,并能融合从乡村到莫扎特再到披头士的风格。MuseNet 并未被显式编程音乐知识,而是通过预测数十万份 MIDI 文件中的下一个 token 来发现和声、节奏与风格规律。

    推荐理由:OpenAI 公开 MuseNet 的技术路线,读者可了解其如何用 GPT-2 同款无监督方法生成多风格音乐。