Mistral 发布旗舰模型 Mistral Large 与 Mistral Small
Mistral AI 发布新旗舰文本生成模型 Mistral Large,可通过 la Plateforme 和 Azure 使用,Azure 是其首个分发合作伙伴。
推荐理由:Mistral 官方给出新旗舰模型的基准对比与 Azure 分发路径,可据此判断其 API 生态位置。
文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。
Mistral AI 发布新旗舰文本生成模型 Mistral Large,可通过 la Plateforme 和 Azure 使用,Azure 是其首个分发合作伙伴。
推荐理由:Mistral 官方给出新旗舰模型的基准对比与 Azure 分发路径,可据此判断其 API 生态位置。
OpenAI 探索在视频数据上大规模训练生成模型,将文本条件扩散模型联合训练于不同时长、分辨率和宽高比的视频与图像,并采用在视频和图像潜码时空 patch 上运行的 Transformer 架构。其最大模型 Sora 能生成一分钟高保真视频,结果提示扩展视频生成模型是构建通用物理世界模拟器的一条可行路径。
推荐理由:OpenAI 公开了视频生成模型的训练思路,读者可了解扩散模型与 Transformer 如何被用于构建物理世界模拟器。
OpenAI 在 DevDay 上发布新模型与开发者产品,包括支持 128K 上下文的 GPT-4 Turbo 且价格更低,以及新的 Assistants API、GPT-4 Turbo with Vision 和 DALL·E 3 API。
推荐理由:OpenAI 在 DevDay 集中公布模型与开发者产品更新,可据此了解其当时的产品线变化。
OpenAI 宣布 ChatGPT 现在可以看、听和说。
OpenAI 发布 GPT-4V(ision) 系统卡,介绍该多模态模型的相关内容。
Hugging Face 发布 IDEFICS,一个对先进视觉语言模型的开源复现。
OpenAI 发布 GPT-4,称其为扩展深度学习规模的最新里程碑。GPT-4 是一个大型多模态模型,接受图像和文本输入、输出文本,在多项专业和学术基准上达到人类水平表现,但在许多真实场景中仍不及人类。
推荐理由:OpenAI 官方给出 GPT-4 的多模态输入能力与基准表现,读者可据此了解这一代模型的定位。
OpenAI 发布 GPT-4,官方称其可在创意与技术写作任务中生成、编辑内容并与用户反复迭代,例如作曲、写剧本或学习用户的写作风格。
推荐理由:OpenAI 官方公布 GPT-4 的写作能力,读者可据此了解它在创作与技术写作任务上的定位。
OpenAI 发布 Point-E,一个可从复杂提示词生成 3D 点云的系统。
Hugging Face 宣布在 Transformers 库中加入 Perceiver IO,这是首个基于 Transformer、可处理文本、图像、音频、视频、点云等多种模态及其组合的神经网络。
推荐理由:Hugging Face 把 Perceiver IO 接入 Transformers,读者可了解这套统一处理文本、图像、音频、视频的架构如何落地调用。
OpenAI 在 CLIP 中发现了一类多模态神经元,无论概念以字面、符号还是概念化形式呈现,这些神经元都会产生响应。OpenAI 表示,这或许能解释 CLIP 为何能准确分类出人意料的概念视觉呈现,也是理解 CLIP 及类似模型所学关联与偏置的重要一步。
推荐理由:OpenAI 公开了 CLIP 中多模态神经元的发现,为理解模型如何跨形式关联概念提供了线索。
OpenAI 发布名为 CLIP 的神经网络,通过自然语言监督高效学习视觉概念。CLIP 只需提供待识别视觉类别的名称,即可应用于任意视觉分类基准,类似 GPT-2 和 GPT-3 的零样本能力。
推荐理由:OpenAI 官方介绍 CLIP 如何用自然语言监督学习视觉概念,并说明其零样本迁移到任意分类基准的方式。
OpenAI 训练了一个名为 DALL·E 的神经网络,可根据自然语言文本描述生成图像,覆盖自然语言可表达的多种概念。
推荐理由:OpenAI 公开 DALL·E 这一从文本生成图像的神经网络,可了解文生图方向的早期形态。
OpenAI 推出 Jukebox,一个能生成音乐的神经网络,可输出多种流派和艺术家风格的原始音频,并包含初步的歌唱。OpenAI 同时发布了模型权重和代码,以及一个用于探索生成样本的工具。
推荐理由:OpenAI 公开 Jukebox 的模型权重与代码,读者可了解这套音乐生成神经网络的能力边界与开放程度。
OpenAI 发布 MuseNet,一个深度神经网络,可生成 4 分钟、包含 10 种乐器的音乐作品,并能融合从乡村到莫扎特再到披头士的风格。MuseNet 并未被显式编程音乐知识,而是通过预测数十万份 MIDI 文件中的下一个 token 来发现和声、节奏与风格规律。
推荐理由:OpenAI 公开 MuseNet 的技术路线,读者可了解其如何用 GPT-2 同款无监督方法生成多风格音乐。