跳到正文

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

115条精选相关主题图像生成AI 视频语音与音频

最新精选

第 81–100 条 · 共 115 条
3月17日周一
3月12日周三
3月7日周五
  1. Mistral AI76

    Mistral AI 发布文档理解 API Mistral OCR

    Mistral AI 发布光学字符识别 API Mistral OCR,可接收图片和 PDF,按顺序交错输出文本与图像,并已作为 Le Chat 文档理解的默认模型。

    推荐理由:官方给出 Mistral OCR 的定价、基准对比与自托管选项,可据此判断多模态文档解析在 RAG 流程中的落地成本。

2月7日周五
12月9日周一
  1. OpenAI News82

    OpenAI 视频生成模型 Sora 上线 sora.com

    OpenAI 的视频生成模型 Sora 现已上线 sora.com 供用户使用。用户可生成最高 1080p 分辨率、最长 20 秒的视频,支持宽屏、竖屏和方形画幅。用户还能导入自有素材进行扩展、重混和融合,或完全由文本生成新内容。

    推荐理由:OpenAI 公布 Sora 的开放入口与分辨率、时长、画幅等具体规格,读者可据此判断视频生成能力边界。

  2. OpenAI News62

    OpenAI 发布 Sora 系统卡

    OpenAI 发布 Sora 系统卡,介绍其视频生成模型 Sora 支持文本、图像和视频输入并生成新视频。Sora 基于 DALL-E 和 GPT 模型的经验构建,旨在为叙事和创意表达提供更丰富的工具。

    推荐理由:OpenAI 官方系统卡披露 Sora 的输入输出形式与技术来源,可了解其能力边界与安全评估框架。

11月18日周一
10月1日周二
9月25日周三
9月17日周二
  1. Mistral AI69

    Mistral AI 发布 Pixtral 12B 多模态模型

    Mistral AI 发布 Pixtral 12B,一个原生多模态模型,采用新训练的 400M 参数视觉编码器和基于 Mistral Nemo 的 12B 多模态解码器,支持可变图像尺寸与宽高比,可在 128k token 上下文窗口中处理任意数量图片。

    推荐理由:官方给出架构、基准与部署方式,读者可据此判断这个 12B 多模态模型在开源阵营中的位置。

8月8日周四
7月18日周四
5月24日周五
  1. Hugging Face Blog62

    TII 发布 Falcon 2:11B 预训练语言模型与 VLM,训练数据超 5000B tokens、支持 11 种语言

    TII 发布第二代 Falcon 2 模型,包括 11B 基础 LLM 和具备图像理解能力的 11B VLM,LLM 训练数据超过 5000B tokens,覆盖英语及另外十种语言。

    推荐理由:TII 公布 Falcon 2 的 11B LLM 与 VLM 训练细节和评测数据,可对照同尺寸开源模型看性能与许可条件。

5月14日周二
5月13日周一
  1. OpenAI News80

    OpenAI 发布新旗舰模型 GPT-4o

    OpenAI 宣布推出新旗舰模型 GPT-4 Omni(GPT-4o),可在音频、视觉和文本之间实时推理。

    推荐理由:OpenAI 公布新旗舰模型 GPT-4o,可在音频、视觉与文本间实时推理,读者可据此了解其多模态能力定位。

4月15日周一