跳到正文

#多模态

今日 0 条
10月9日周五
10月8日周四
  1. Hugging Face Blog61

    Liquid AI 开源 d1-3B 与 d1-omni-600M 端侧决策模型

    Liquid AI 发布 d1 决策模型家族的两款开放权重模型 d1-3B 和 d1-omni-600M(实验版),在 Decision Index 0.2.1 上 d1-3B 得分 48.57,为 10B 以下最佳,超过 Decider 35B-A3B(47.11)。

    推荐理由:原文给出决策指数得分与多设备延迟数据,读者可据此判断它在端侧结构化决策场景的可用性。

10月7日周三
  1. Google DeepMind74

    Google DeepMind 发布 EmbeddingGemma 2 开源多模态嵌入模型

    Google DeepMind 发布 EmbeddingGemma 2,一个基于 Gemma 4 架构、采用 Apache 2.0 许可的 740M 参数多模态嵌入模型,将文本、代码、图像、视频和音频统一映射到共享嵌入空间。

    推荐理由:原文给出了参数规模、内存占用和上下文长度等具体指标,读者可据此评估它是否适合自己的端侧检索场景。

10月6日周二
10月5日周一
10月1日周四
  1. Google DeepMind78

    Google DeepMind 发布 Gemini 4 Argon 前沿模型

    Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御者开放,随后将逐步面向开发者、企业和消费者推出,起步价为每百万输入 token 2 美元、每百万输出 token 10 美元。

    推荐理由:Gemini 4 Argon 的 1M 输出 token 与多项基准成绩,展示了长程复杂任务上的能力边界变化。

9月29日周二
  1. AWS Machine Learning Blog29

    Condé Nast 如何用 Amazon Bedrock 构建多模态视频检索

    Condé Nast 联合 AWS 生成式 AI 创新中心,基于 Amazon Bedrock 和 Amazon OpenSearch Service 构建多模态视频检索方案,将单次内容检索耗时从 250 分钟降至 2 分钟以内。该方案采用 TwelveLabs Marengo 嵌入模型,对视频转录文本、画面和音频联合编码,支持自然语言意图搜索、以图搜视频和时间戳定位,覆盖超 14 万条视频库。

  2. Microsoft Research62

    微软研究院推出 Quine:面向生物学复杂性的 AI 研究系统

    微软研究院推出 Quine,一个面向生物学复杂性的 AI 研究系统,由生物学世界模型和连接模型、科学工具、文献与研究者的交互式 harness 两部分组成。该系统与 Broad Institute 合作用于胰腺导管腺癌(PDAC)研究,从数千个化合物中筛选并优先排序可驱动肿瘤细胞状态转变的候选物,最高排名的化合物在湿实验中产生了最大的预期状态转变,整个流程仅用一个周末完成。

    推荐理由:微软研究院公开 Quine 的生物学世界模型与实验编排框架,并给出胰腺癌化合物筛选的湿实验验证结果。

9月25日周五
  1. Google DeepMind70

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,把近实时视频生成与语音对话结合,为原生实时对话模型加入动态视觉形象,即日起在 Gemini Enterprise 可用。

    推荐理由:官方给出 Live Avatar 的能力边界与开放入口,读者可据此判断实时视频对话在企业场景的可用性。

9月24日周四
9月23日周三
  1. Google DeepMind69

    Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS

    Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,前者面向角色语音设计与逐行表演导演,后者面向高并发、低成本的配音与语音智能体场景。

    推荐理由:官方给出两款 TTS 模型的语音设计、逐行导演能力与基准排名,可据此判断语音生成工作流的变化。

9月18日周五
9月3日周四
9月2日周三
  1. Google DeepMind74

    Google DeepMind 为 Gemini 3.7 Flash 等模型推出智能体视频理解功能

    Google DeepMind 在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 上推出智能体视频理解功能,通过原生视频工具动态搜索、扫描和检查目标片段,替代固定帧率的静态处理。

    推荐理由:官方给出 token 消耗、成本与准确率的具体变化,以及 API 开启方式,便于开发者评估长视频分析的成本结构。

8月28日周五
8月26日周三
  1. Google Research28

    Google AgentHands:为 XR 空间智能体对话生成同步手势

    Google 在 CHI 2026 发布研究原型 AgentHands,让 XR 中的 AI 智能体在说话时同步做出与语音对齐的手势,把抽象指令变成空间中的实体演示。系统通过眼动与场景重建注册物体 3D 包围盒,由后端 LLM 在回复中内嵌 GestureEvent,再在头显端用词级时间戳让手势与 TTS 精确同步。12 人被试内研究对比纯语音基线,结果显示空间指代效果显著提升。

8月18日周二
  1. Hugging Face Blog62

    Sentence Transformers v6.0 新增 MultiVectorEncoder,支持 ColBERT 式后期交互检索

    Sentence Transformers v6.0 新增第四种模型类型 MultiVectorEncoder,用于 ColBERT 式后期交互检索,PyLate、Stanford-NLP ColBERT 检查点可直接加载,colpali-engine 的视觉文档检索模型也可通过同一 API 使用。

    推荐理由:原文给出多向量编码器的加载、打分与索引接入方式,读者可据此判断现有检索栈的改造量。

8月17日周一
8月13日周四
  1. Microsoft Research41

    MindTopo 揭示多模态大模型的空间推理能力短板

    微软研究院推出 MindTopo 基准,用于评测多模态大模型在连通性、封闭、顺序、分离与打结五类拓扑关系上的推理与规划能力。测试显示,模型在静态图像识别上表现明显优于交互式规划任务,且两者均远低于人类水平;失败多发生在规划阶段而非感知阶段,模型在场景变化中会丢失结构关系或提出违反物理约束的动作。图像与视频生成仅在单帧关系可见时偶有帮助,序列任务中仍不可靠。

8月12日周三
  1. Google DeepMind71

    Google DeepMind 发布 SL2T 手语转文本模型,率先落地 Gboard 与 Live Transcribe

    Google DeepMind 发布多语言手语转文本模型 SL2T,首次将手语 AI 带入消费级产品,在 Pixel 11 的 Gboard 和 Live Transcribe 中支持美国手语(ASL)转英文听写。

    推荐理由:SL2T 把多语言手语翻译从实验室带进 Gboard 与 Live Transcribe,读者可了解其数据规模与端侧隐私设计。

  2. Google Research67

    Google Research 发布 AMIE(Video):基于 Gemini 与 Project Astra 的实时视频问诊系统

    Google Research 发布 AMIE(Video),一个基于 Gemini 和 Project Astra 的实时视频问诊配置,可感知非语言临床线索、引导患者演员完成虚拟体格检查并实时进行诊断推理。

    推荐理由:原文给出AMIE(Video)的三智能体异步架构与随机对照评测结果,可了解实时视频问诊中视听感知与推理的分工方式。

8月11日周二
  1. Hugging Face Blog62

    NVIDIA 发布 Magpie TTS 多语言语音模型,开放权重支持 12 种语言

    NVIDIA 发布 Magpie TTS Multilingual 开放权重模型,参数量 364M,支持英语、西班牙语、法语、德语、意大利语、越南语、普通话、印地语、日语等 12 种语言,新增现代标准阿拉伯语、韩语和巴西葡萄牙语。

    推荐理由:NVIDIA 公开 Magpie TTS 多语言模型的权重与延迟数据,读者可据此评估自建语音链路的可行性与成本。

8月10日周一
8月4日周二
  1. Mistral AI62

    Mistral AI 发布 Shieldstral:3B 开源多模态安全分类器

    Mistral AI 发布 Shieldstral,一个 3B 开源权重多模态安全分类器,将内容审核建模为策略自适应的二分类问答任务,在推理时接受自然语言策略,无需重新训练即可统一文本与图像安全评估。官方称其在文本安全上可匹敌 3B 的 3B 上下的 7 个……

    推荐理由:3B 开源安全分类器把内容审核改写为策略自适应问答,读者可据此判断小模型在审核场景的可用边界。

7月30日周四
  1. Google DeepMind49

    Google 在 Flow Music 发布 Lyria 3.5,提升音乐性、歌词、人声与创作控制

    Google DeepMind 在 Google Flow Music 中推出新一代音乐生成模型 Lyria 3.5,在音乐性、歌词和人声质量上均有明显提升。新版本可生成更复杂自然的旋律结构、提示词遵循度和结构感知更强的歌词,以及更具情感表现力和发音更准确的人声,并支持更便捷地控制输出节奏与时长。该模型即日起在 Flow Music 上线。

7月28日周二
7月27日周一
7月23日周四
7月21日周二
7月16日周四
  1. Hugging Face Blog22

    新模型来了,优势依旧:DharmaOCR 在巴西葡萄牙语 OCR 上仍领先 Mistral OCR4 与 Unlimited-OCR

    DharmaOCR 在葡萄牙语专项基准上以 0.925 分领先 Mistral OCR4 的 0.798 和 Unlimited-OCR 的 0.7587,后两者分别落后约 13 分和 16 分以上。该模型经葡萄牙语监督微调加 DPO 两阶段训练,把全部参数集中于巴西葡萄牙语,在复杂文档提取质量和生成稳定性上形成结构性优势。文章认为,新架构并未改变这一领域专精带来的差距。