Mistral AI 发布 Mistral Small 3.1,支持多模态与 128k 上下文
Mistral AI 发布 Mistral Small 3.1,在 Mistral Small 3 基础上提升文本性能与多模态理解,上下文窗口扩展至 128k tokens,推理速度达 150 tokens 每秒,以 Apache 2.0 许可开源。
推荐理由:官方给出 Mistral Small 3.1 的基准对比、128k 上下文与单卡部署门槛,可据此判断小模型选型。
文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。
Mistral AI 发布 Mistral Small 3.1,在 Mistral Small 3 基础上提升文本性能与多模态理解,上下文窗口扩展至 128k tokens,推理速度达 150 tokens 每秒,以 Apache 2.0 许可开源。
推荐理由:官方给出 Mistral Small 3.1 的基准对比、128k 上下文与单卡部署门槛,可据此判断小模型选型。
Google 发布 Gemma 3,官方将其定位为多模态、多语言、长上下文的开源大模型。Hugging Face 博客以“Welcome Gemma 3”为题介绍该模型,原文正文未抓取到,具体参数与能力细节暂缺。
Mistral AI 发布光学字符识别 API Mistral OCR,可接收图片和 PDF,按顺序交错输出文本与图像,并已作为 Le Chat 文档理解的默认模型。
推荐理由:官方给出 Mistral OCR 的定价、基准对比与自托管选项,可据此判断多模态文档解析在 RAG 流程中的落地成本。
Mistral 发布全新 le Chat AI 助手,同步上线 iOS 和 Android,并推出 Pro 与 Team 订阅档,Enterprise 档进入私有预览。
推荐理由:官方一次性给出 le Chat 的移动端、Pro/Team 定价与 Flash Answers 等能力清单,可据此判断其与现有助手的差异。
OpenAI 的视频生成模型 Sora 现已上线 sora.com 供用户使用。用户可生成最高 1080p 分辨率、最长 20 秒的视频,支持宽屏、竖屏和方形画幅。用户还能导入自有素材进行扩展、重混和融合,或完全由文本生成新内容。
推荐理由:OpenAI 公布 Sora 的开放入口与分辨率、时长、画幅等具体规格,读者可据此判断视频生成能力边界。
OpenAI 发布 Sora 系统卡,介绍其视频生成模型 Sora 支持文本、图像和视频输入并生成新视频。Sora 基于 DALL-E 和 GPT 模型的经验构建,旨在为叙事和创意表达提供更丰富的工具。
推荐理由:OpenAI 官方系统卡披露 Sora 的输入输出形式与技术来源,可了解其能力边界与安全评估框架。
Mistral AI 为免费生成式 AI 工作助手 le Chat 推出多项 beta 新功能,包括带引用的联网搜索、用于构思与就地编辑和导出的 Canvas、文档与图像理解、图像生成以及可共享的智能体。
推荐理由:官方列出 le Chat 新增能力与免费 beta 范围,读者可据此判断它和现有聊天助手的差异。
Mistral AI 发布 Pixtral Large,一个基于 Mistral Large 2 构建的 124B 开放权重多模态模型,含 1B 参数视觉编码器和 128K 上下文窗口,可容纳至少 30 张高分辨率图像。
推荐理由:原文给出 Pixtral Large 的基准成绩与开放权重入口,读者可据此判断开源多模态模型与闭源前沿的差距。
OpenAI 宣布微调 API 新增视觉能力,开发者现在可以用图像和文本对 GPT-4o 进行微调,以提升其视觉表现。
推荐理由:OpenAI 把图像纳入微调 API,开发者可据此判断视觉任务的定制路径是否可行。
Hugging Face 博客宣布 Llama 3.2 发布,Llama 现在可以看图并能在用户设备上运行。
Mistral 宣布 la Plateforme 推出免费额度,并对全线模型降价,其中 Mistral Small 和 Codestral 输入输出价格均下降 80%,Mistral Large 下降 33%。
推荐理由:Mistral 一次性公布免费额度、全线降价和新版小模型,读者可据此重估自建与调用成本。
Mistral AI 发布 Pixtral 12B,一个原生多模态模型,采用新训练的 400M 参数视觉编码器和基于 Mistral Nemo 的 12B 多模态解码器,支持可变图像尺寸与宽高比,可在 128k token 上下文窗口中处理任意数量图片。
推荐理由:官方给出架构、基准与部署方式,读者可据此判断这个 12B 多模态模型在开源阵营中的位置。
OpenAI 发布 GPT-4o 系统卡,用于说明该模型的能力、限制与安全评估情况。原文正文未能抓取,仅标题可用。
Mistral AI 与 NVIDIA 联合发布 12B 模型 Mistral NeMo,支持最高 128k tokens 上下文窗口,以 Apache 2.0 许可开放预训练基座和指令微调 checkpoint。
推荐理由:Mistral 与 NVIDIA 联合发布的 12B 模型给出 128k 上下文和 Apache 2.0 权重,读者可据此判断它能否直接替换现有 Mistral 7B 部署。
TII 发布第二代 Falcon 2 模型,包括 11B 基础 LLM 和具备图像理解能力的 11B VLM,LLM 训练数据超过 5000B tokens,覆盖英语及另外十种语言。
推荐理由:TII 公布 Falcon 2 的 11B LLM 与 VLM 训练细节和评测数据,可对照同尺寸开源模型看性能与许可条件。
Google 发布视觉语言模型家族 PaliGemma,由 SigLIP-So400m 图像编码器和 Gemma-2B 文本解码器组成,可输入图像和文本并输出文本。
推荐理由:原文给出 PaliGemma 的架构、三种 checkpoint 与微调代码,读者可据此判断它适合哪些视觉语言任务。
OpenAI 宣布推出新旗舰模型 GPT-4 Omni(GPT-4o),可在音频、视觉和文本之间实时推理。
推荐理由:OpenAI 公布新旗舰模型 GPT-4o,可在音频、视觉与文本间实时推理,读者可据此了解其多模态能力定位。
OpenAI 发布最新旗舰模型 GPT-4o,同时为 ChatGPT 免费用户开放更多能力。官方称此次发布包含新模型以及面向免费用户的功能扩展,具体能力细节尚未在摘要中给出。
推荐理由:OpenAI 发布新旗舰模型 GPT-4o,并同步扩大 ChatGPT 免费用户可用能力范围。
OpenAI 发布 GPT-4o,并让 ChatGPT 免费用户获得更多能力。该消息来自 OpenAI 的 Spring Update,具体能力范围与开放细节未在摘要中展开。
推荐理由:OpenAI 发布 GPT-4o,并让 ChatGPT 免费用户获得更多能力,可据此了解模型与免费策略的同步变化。
Hugging Face 发布 Idefics2,一个 8B 参数的通用多模态模型,可接受任意文本与图像序列输入并生成文本回复,采用 Apache 2.0 开源许可。
推荐理由:8B 参数、Apache 2.0 开源,并给出与更大模型的基准对比和微调入口,便于判断多模态选型。