跳到正文

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

124条精选相关主题图像生成AI 视频语音与音频

最新精选

第 21–40 条 · 共 124 条
9月4日周五
  1. X:World Labs (@theworldlabs)69

    World Labs 团队谈 Atlas:以新视角预测统一像素生成与重建

    World Labs 联合创始人 Fei-Fei Li、Justin Johnson、Ben Mildenhall 与 a16z 的 Martin Casado 在对话中介绍 Atlas,称其是首个统一像素生成与像素重建的模型,建立在“新视角预测”之上。

    推荐理由:World Labs 团队解释 Atlas 以新视角预测统一生成与重建,并给出 3D 采集成本下降的具体量级。

9月2日周三
  1. Google DeepMind74

    Google DeepMind 为 Gemini 3.7 Flash 等模型推出智能体视频理解功能

    Google DeepMind 在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 上推出智能体视频理解功能,通过原生视频工具动态搜索、扫描和检查目标片段,替代固定帧率的静态处理。

    推荐理由:官方给出 token 消耗、成本与准确率的具体变化,以及 API 开启方式,便于开发者评估长视频分析的成本结构。

8月28日周五
8月18日周二
  1. Hugging Face Blog62

    Sentence Transformers v6.0 新增 MultiVectorEncoder,支持 ColBERT 式后期交互检索

    Sentence Transformers v6.0 新增第四种模型类型 MultiVectorEncoder,用于 ColBERT 式后期交互检索,PyLate、Stanford-NLP ColBERT 检查点可直接加载,colpali-engine 的视觉文档检索模型也可通过同一 API 使用。

    推荐理由:原文给出多向量编码器的加载、打分与索引接入方式,读者可据此判断现有检索栈的改造量。

8月14日周五
  1. X:Ammaar Reshi (@ammaar)78

    Gemini 3.7 Flash 发布,年内价格比 3.6 Flash 低 50%

    Gemini 3.7 Flash 发布,年内价格比 3.6 Flash 低 50%,在设计遵循、Web 开发和游戏制作方面有明显提升。该模型已在 AI Studio、Antigravity 和 Gemini API 上线,作者附上了若干 one shot 演示。

    推荐理由:Gemini 3.7 Flash 的价格与能力变化,以及它在 AI Studio、Antigravity 和 Gemini API 的上线渠道,可供读者判断迁移成本。

8月12日周三
  1. Google DeepMind71

    Google DeepMind 发布 SL2T 手语转文本模型,率先落地 Gboard 与 Live Transcribe

    Google DeepMind 发布多语言手语转文本模型 SL2T,首次将手语 AI 带入消费级产品,在 Pixel 11 的 Gboard 和 Live Transcribe 中支持美国手语(ASL)转英文听写。

    推荐理由:SL2T 把多语言手语翻译从实验室带进 Gboard 与 Live Transcribe,读者可了解其数据规模与端侧隐私设计。

  2. Google Research67

    Google Research 发布 AMIE(Video):基于 Gemini 与 Project Astra 的实时视频问诊系统

    Google Research 发布 AMIE(Video),一个基于 Gemini 和 Project Astra 的实时视频问诊配置,可感知非语言临床线索、引导患者演员完成虚拟体格检查并实时进行诊断推理。

    推荐理由:原文给出AMIE(Video)的三智能体异步架构与随机对照评测结果,可了解实时视频问诊中视听感知与推理的分工方式。

8月11日周二
  1. Hugging Face Blog62

    NVIDIA 发布 Magpie TTS 多语言语音模型,开放权重支持 12 种语言

    NVIDIA 发布 Magpie TTS Multilingual 开放权重模型,参数量 364M,支持英语、西班牙语、法语、德语、意大利语、越南语、普通话、印地语、日语等 12 种语言,新增现代标准阿拉伯语、韩语和巴西葡萄牙语。

    推荐理由:NVIDIA 公开 Magpie TTS 多语言模型的权重与延迟数据,读者可据此评估自建语音链路的可行性与成本。

8月10日周一
8月4日周二
  1. Mistral AI62

    Mistral AI 发布 Shieldstral:3B 开源多模态安全分类器

    Mistral AI 发布 Shieldstral,一个 3B 开源权重多模态安全分类器,将内容审核建模为策略自适应的二分类问答任务,在推理时接受自然语言策略,无需重新训练即可统一文本与图像安全评估。官方称其在文本安全上可匹敌 3B 的 3B 上下的 7 个……

    推荐理由:3B 开源安全分类器把内容审核改写为策略自适应问答,读者可据此判断小模型在审核场景的可用边界。

7月30日周四
7月28日周二
7月23日周四
7月21日周二
7月15日周三
  1. Hugging Face Blog82

    Thinking Machines 发布 1T 参数多模态开源模型 Inkling 及 Inkling-Small

    Thinking Machines Lab 在 Hugging Face 发布多模态开源模型 Inkling,采用 decoder-only MoE 架构,975B 总参数、41B 激活参数,支持图像、音频、文本输入和 1M 上下文,训练数据为 45 万亿 token。

    推荐理由:Inkling 以约 1T 参数、1M 上下文原生接收图像音频文本,并给出各推理引擎的部署配置与基准对比。

7月1日周三
  1. Google DeepMind78

    Google DeepMind 发布 Nano Banana 2 Lite 与 Gemini Omni Flash

    Google DeepMind 发布 Nano Banana 2 Lite(gemini-3.1-flash-lite-image)和 Gemini Omni Flash(gemini-omni-flash-preview)两款模型,前者是 Nano Banana 家族中速度最快、成本最低的图像模型,后者支持高质量视频生成与对话式编辑。

    推荐理由:Google DeepMind 同时放出图像与视频两款新模型,并给出延迟、单价和可用入口,便于开发者评估替换与串联方案。

6月23日周二
  1. Mistral AI62

    Mistral 发布 OCR 4,支持边界框、块分类与置信度分数

    Mistral 发布 OCR 4,在提取文本之外新增边界框、块类型分类和逐页逐词置信度分数,支持 170 种语言,可单容器自托管部署。该模型在 OlmOCRBench 上取得 85.20 分,OmniDocBench 上为 93.07 分,官方称独立标注者在 600 多份文档的盲评中平均偏好率约 72%。

    推荐理由:OCR 4 把文档解析从纯文本扩展到带边界框和块分类的结构化输出,读者可据此判断它是否适合接入现有 RAG 或智能体流程。

6月22日周一
6月9日周二