跳到正文

#多模态

今日 4 条
5月7日周三
4月8日周二
3月25日周二
3月17日周一
3月12日周三
3月7日周五
  1. Mistral AI76

    Mistral AI 发布文档理解 API Mistral OCR

    Mistral AI 发布光学字符识别 API Mistral OCR,可接收图片和 PDF,按顺序交错输出文本与图像,并已作为 Le Chat 文档理解的默认模型。

    推荐理由:官方给出 Mistral OCR 的定价、基准对比与自托管选项,可据此判断多模态文档解析在 RAG 流程中的落地成本。

2月7日周五
12月9日周一
  1. OpenAI News82

    OpenAI 视频生成模型 Sora 上线 sora.com

    OpenAI 的视频生成模型 Sora 现已上线 sora.com 供用户使用。用户可生成最高 1080p 分辨率、最长 20 秒的视频,支持宽屏、竖屏和方形画幅。用户还能导入自有素材进行扩展、重混和融合,或完全由文本生成新内容。

    推荐理由:OpenAI 公布 Sora 的开放入口与分辨率、时长、画幅等具体规格,读者可据此判断视频生成能力边界。

  2. OpenAI News62

    OpenAI 发布 Sora 系统卡

    OpenAI 发布 Sora 系统卡,介绍其视频生成模型 Sora 支持文本、图像和视频输入并生成新视频。Sora 基于 DALL-E 和 GPT 模型的经验构建,旨在为叙事和创意表达提供更丰富的工具。

    推荐理由:OpenAI 官方系统卡披露 Sora 的输入输出形式与技术来源,可了解其能力边界与安全评估框架。

11月21日周四
11月18日周一
10月1日周二
9月26日周四
9月25日周三
9月17日周二
  1. Mistral AI69

    Mistral AI 发布 Pixtral 12B 多模态模型

    Mistral AI 发布 Pixtral 12B,一个原生多模态模型,采用新训练的 400M 参数视觉编码器和基于 Mistral Nemo 的 12B 多模态解码器,支持可变图像尺寸与宽高比,可在 128k token 上下文窗口中处理任意数量图片。

    推荐理由:官方给出架构、基准与部署方式,读者可据此判断这个 12B 多模态模型在开源阵营中的位置。

8月14日周三
8月8日周四
8月6日周二
  1. Hugging Face Blog32

    Hugging Face 联合 Albumentations AI 推出文档图像 TextImage 数据增强

    Hugging Face 与 Albumentations AI 合作推出面向文档图像的 TextImage 数据增强管线,可同时修改图像内容与文本标注。该管线支持随机插入、删除、交换及停用词替换等文本增强,并通过黑化与 inpaint 保持文字质量,用于 VLM 微调。代码已开源,可通过 pip install albumentations 使用。

7月25日周四
7月18日周四
7月10日周三
6月24日周一
6月19日周三
5月24日周五
  1. Hugging Face Blog62

    TII 发布 Falcon 2:11B 预训练语言模型与 VLM,训练数据超 5000B tokens、支持 11 种语言

    TII 发布第二代 Falcon 2 模型,包括 11B 基础 LLM 和具备图像理解能力的 11B VLM,LLM 训练数据超过 5000B tokens,覆盖英语及另外十种语言。

    推荐理由:TII 公布 Falcon 2 的 11B LLM 与 VLM 训练细节和评测数据,可对照同尺寸开源模型看性能与许可条件。

5月14日周二
5月13日周一
  1. OpenAI News80

    OpenAI 发布新旗舰模型 GPT-4o

    OpenAI 宣布推出新旗舰模型 GPT-4 Omni(GPT-4o),可在音频、视觉和文本之间实时推理。

    推荐理由:OpenAI 公布新旗舰模型 GPT-4o,可在音频、视觉与文本间实时推理,读者可据此了解其多模态能力定位。

4月15日周一
4月11日周四
3月25日周一
3月15日周五
  1. Hugging Face Blog41

    Hugging Face 发布 WebSight 数据集,用截图生成 HTML 代码

    Hugging Face 推出 WebSight 数据集,用于训练 AI 将网页截图转换为 HTML 代码。该数据集从 v0.1 的 82.3 万对 HTML 与截图样本扩展至 v0.2 的 200 万例,改用真实图像截图并切换至 Tailwind CSS。基于该数据集微调的视觉语言模型 Sightseer 可将网页截图转为可用的 HTML 代码,并能在生成结果中嵌入与原截图相近的图像。

3月5日周二
2月26日周一
2月15日周四
  1. OpenAI News88

    OpenAI 研究:视频生成模型可作为世界模拟器

    OpenAI 探索在视频数据上大规模训练生成模型,将文本条件扩散模型联合训练于不同时长、分辨率和宽高比的视频与图像,并采用在视频和图像潜码时空 patch 上运行的 Transformer 架构。其最大模型 Sora 能生成一分钟高保真视频,结果提示扩展视频生成模型是构建通用物理世界模拟器的一条可行路径。

    推荐理由:OpenAI 公开了视频生成模型的训练思路,读者可了解扩散模型与 Transformer 如何被用于构建物理世界模拟器。

11月6日周一
9月25日周一