跳到正文

#多模态

今日 0 条
7月15日周三
  1. Hugging Face Blog82

    Thinking Machines 发布 1T 参数多模态开源模型 Inkling 及 Inkling-Small

    Thinking Machines Lab 在 Hugging Face 发布多模态开源模型 Inkling,采用 decoder-only MoE 架构,975B 总参数、41B 激活参数,支持图像、音频、文本输入和 1M 上下文,训练数据为 45 万亿 token。

    推荐理由:Inkling 以约 1T 参数、1M 上下文原生接收图像音频文本,并给出各推理引擎的部署配置与基准对比。

7月13日周一
7月6日周一
  1. Hugging Face Blog22

    PRX Part 4:Hugging Face 的数据策略

    Hugging Face 在 PRX 系列第四篇中披露其数据策略:预训练数据由公开与内部数据集混合组成,用 VLM 重新生成图像长描述,再转为可流式训练的语料。团队将文本编码器从 T5Gemma 换成 Qwen3-VL 并改为训练时实时计算文本 latent,实测吞吐损失约 3–4%(30 天训练约多 1 天)。图像统一以 JPEG quality 92 编码,实测首次重编码几乎不可察觉。

7月1日周三
  1. Berkeley AI Research12

    2026 届 BAIR 博士毕业展示:从机器人到 LLM 推理的 AI 研究全景

    伯克利人工智能研究实验室(BAIR)公布 2026 届博士毕业生名单,研究方向覆盖机器人、具身智能、大语言模型与推理、计算机视觉、生成模型、AI 安全、人机交互及 AI for Science 与医疗。毕业生去向包括 Physical Intelligence、OpenAI、Mistral AI、Amazon 等机构,以及 UCLA、芝加哥大学教职和自主创业。

  2. Google DeepMind78

    Google DeepMind 发布 Nano Banana 2 Lite 与 Gemini Omni Flash

    Google DeepMind 发布 Nano Banana 2 Lite(gemini-3.1-flash-lite-image)和 Gemini Omni Flash(gemini-omni-flash-preview)两款模型,前者是 Nano Banana 家族中速度最快、成本最低的图像模型,后者支持高质量视频生成与对话式编辑。

    推荐理由:Google DeepMind 同时放出图像与视频两款新模型,并给出延迟、单价和可用入口,便于开发者评估替换与串联方案。

6月23日周二
  1. Mistral AI62

    Mistral 发布 OCR 4,支持边界框、块分类与置信度分数

    Mistral 发布 OCR 4,在提取文本之外新增边界框、块类型分类和逐页逐词置信度分数,支持 170 种语言,可单容器自托管部署。该模型在 OlmOCRBench 上取得 85.20 分,OmniDocBench 上为 93.07 分,官方称独立标注者在 600 多份文档的盲评中平均偏好率约 72%。

    推荐理由:OCR 4 把文档解析从纯文本扩展到带边界框和块分类的结构化输出,读者可据此判断它是否适合接入现有 RAG 或智能体流程。

6月22日周一
6月9日周二
  1. Hugging Face Blog60

    智能体如何串联两个 Hugging Face Space 搭建 3D 巴黎画廊

    作者让编码智能体通过调用两个 Hugging Face Space 搭建了一个展示巴黎地标的 3D 高斯泼溅网站,全程未手动使用图像生成或 3D 重建工具。每个 Gradio Space 都暴露一份 agents.md,列出 schema URL、调用与轮询模板、文件上传方式和 HF_TOKEN 鉴权提示,智能体据此即可端到端驱动 Space。

    推荐理由:作者用两个 Space 串起图像生成到 3D 高斯泼溅的完整流程,展示了 agents.md 如何让智能体直接调用模型。

6月5日周五
  1. Google Research67

    Google 研究用手机前置摄像头实现被动心率监测

    Google Research 在 Nature 发表 PHRM 研究系统,利用手机前置摄像头在面部解锁后拍摄 8 秒面部视频,通过深度学习估算心率,与心电图相比 MAPE 低于 10%,覆盖所有肤色。

    推荐理由:Google 用 35 万段手机视频训练 rPPG 模型,并公开迄今最大规模数据集,读者可了解被动心率监测的可行边界。

5月18日周一
  1. Google DeepMind60

    Google DeepMind 为 Project Genie 加入 Street View 实景锚定能力

    Google DeepMind 在实验性原型 Project Genie 中上线 Street View 实景锚定能力,用户可选取美国地点并叠加风格与角色描述,生成起始位置对应真实街景影像的交互世界。

    推荐理由:原文给出 Genie 接入 Street View 实景锚定的能力与开放范围,读者可据此判断世界模型在智能体与机器人训练上的落地路径。

5月17日周日
  1. Google DeepMind66

    Google 将 SynthID 与 C2PA 内容验证扩展到 Search、Gemini 和 Chrome

    Google 宣布把内容透明度与验证工具扩展到 Search、Gemini、Chrome、Pixel 和 Cloud。SynthID 已为超过 1000 亿张图片和视频、6 万年音频打上水印,Gemini 应用中的 SynthID 验证已被使用 5000 万次,该能力今日起进入 Search、未来几周进入 Chrome。

    推荐理由:原文列出 SynthID 与 C2PA 验证在 Search、Gemini、Chrome 的落地范围,可据此判断内容溯源工具的实际可用边界。

5月16日周六
  1. Google DeepMind87

    Google DeepMind 发布 Gemini 3.5 Flash,主打智能体与编码能力

    Google DeepMind 发布 Gemini 3.5 系列首个模型 3.5 Flash,主打智能体与编码能力,即日起在 Gemini app、Google Search 的 AI Mode、Google Antigravity、Gemini API 及 Gemini Enterprise 上线。

    推荐理由:Gemini 3.5 Flash 在编码与智能体基准上的表现和速度数据,可供读者判断前沿模型在长程任务上的取舍。

4月30日周四
4月28日周二
  1. Hugging Face Blog71

    NVIDIA 发布 Nemotron 3 Nano Omni 全模态理解模型

    NVIDIA 发布 Nemotron 3 Nano Omni,一款面向文档分析、多图推理、语音识别、长音视频理解与智能体电脑操作的全模态理解模型,在 MMlongbench-Doc、OCRBenchV2、WorldSense、DailyOmni、VoiceBench 等基准上取得领先成绩。

    推荐理由:原文给出架构、训练配方与多模态基准对比,可据此判断开源全模态模型在文档、音视频与GUI任务上的位置。

4月21日周二
  1. OpenAI News62

    OpenAI 推出 ChatGPT Images 2.0

    OpenAI 发布 ChatGPT Images 2.0,改进了文字渲染、多语言支持和视觉推理能力。官方同时提到 Images 2.5 的新变化。

    推荐理由:官方给出 ChatGPT Images 2.0 在文字渲染、多语言和视觉推理上的改进方向,可据此判断图像生成能力的迭代重点。

4月16日周四
  1. Google DeepMind66

    Google DeepMind 发布 Gemini 3.1 Flash TTS 语音模型

    Google DeepMind 发布 Gemini 3.1 Flash TTS,一款主打可控性与表现力的文本转语音模型,即日起在 Gemini API 和 Google AI Studio 面向开发者预览,企业版在 Vertex AI 预览,Workspace 用户可通过 Google Vids 使用。

    推荐理由:官方给出音频标签控制方式与 70+ 语言支持,读者可据此判断语音生成的可控程度与接入渠道。

4月13日周一
4月9日周四
4月3日周五
4月2日周四
3月29日周日
  1. Google DeepMind62

    Google DeepMind 为 AI 时代重新设计鼠标指针,Gemini 驱动的 AI 指针已进入 Chrome

    Google DeepMind 公布了一套 AI 指针的交互原则,让指针不仅知道指向什么,还能理解它对用户的意义,由 Gemini 驱动。团队提出四条原则:保持工作流不被打断、用指向加语音替代长提示词、支持“这个”“那个”式的自然简写、把像素转化为可操作实体。

    推荐理由:Google DeepMind 公开了 AI 指针的四条交互原则,并说明该能力已进入 Chrome 与 Googlebook,读者可据此判断浏览器内 AI 交互的走向。

3月26日周四
  1. Google DeepMind74

    Google DeepMind 发布 Gemini 3.1 Flash Live 语音模型

    Google DeepMind 发布 Gemini 3.1 Flash Live,称其为目前质量最高的音频与语音模型,具备更高精度和更低延迟。该模型在 ComplexFuncBench Audio 上得分 90.8%,在 Scale AI 的 Audio MultiChallenge 上开启 thinking 后得分 36.1%。

    推荐理由:官方给出语音模型的基准分数与多产品开放入口,可据此判断实时语音交互的可用边界。

3月25日周三
3月24日周二
  1. Mistral AI66

    Mistral AI 发布 4B 参数语音模型 Voxtral TTS

    Mistral AI 发布首个文本转语音模型 Voxtral TTS,4B 参数,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语 9 种语言,可做情感表达与零样本跨语言音色适配。

    推荐理由:官方给出 4B 参数、9 种语言、70ms 延迟与每千字符 0.016 美元的定价,读者可据此判断语音智能体的成本与选型空间。

3月18日周三
3月17日周二
  1. OpenAI News62

    OpenAI 发布 GPT-5.4 mini 和 nano

    OpenAI 发布 GPT-5.4 mini 和 nano,是 GPT-5.4 更小、更快的版本,针对编码、工具调用、多模态推理以及高并发 API 和子智能体负载做了优化。

    推荐理由:OpenAI 公布 GPT-5.4 的小型版本,读者可据此了解其在编码、工具调用与高并发场景中的定位。

  2. Mistral AI77

    Mistral 发布 Mistral Small 4,统一推理、多模态与编码智能体能力

    Mistral AI 发布 Mistral Small 4,这是 Mistral Small 系列的下一个重要版本,也是 Mistral 首个把 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码能力统一到单一模型中的模型,采用 Apache 2.0 许可。

    推荐理由:Mistral Small 4 把推理、多模态与编码智能体能力合并进单一开源模型,读者可据此判断统一模型对部署选型的影响。

3月6日周五
3月4日周三
  1. Google DeepMind66

    Google DeepMind 发布 Gemini 3.1 Flash-Lite

    Google DeepMind 推出 Gemini 3.1 Flash-Lite,定位 Gemini 3 系列中速度最快、成本最低的模型,即日起通过 Gemini API 在 Google AI Studio 和 Vertex AI 面向开发者预览。

    推荐理由:官方给出定价、速度与基准数据,读者可据此判断高并发场景下是否值得替换现有模型。

2月27日周五
2月19日周四
  1. Google DeepMind69

    Gemini 应用上线 Lyria 3 音乐生成,支持文本和图片生成 30 秒曲目

    Google DeepMind 在 Gemini 应用中以 beta 形式上线最新音乐生成模型 Lyria 3,用户用文本或上传图片、视频即可生成带歌词的 30 秒曲目,并配有 Nano Banana 生成的封面图。

    推荐理由:官方披露 Lyria 3 在 Gemini 应用中的生成方式与 SynthID 音频验证能力,可了解音乐生成的产品化路径。

2月18日周三
  1. Google Research37

    Google 用 MapTrace 合成数据教多模态大模型在地图上寻路

    Google Research 提出 MapTrace,用 Gemini 2.5 Pro 与 Imagen-4 构建全自动合成数据管线,生成 200 万条带路径标注的地图问答对并已开源。该管线经地图生成、Mask Critic 筛选可通行区域、构建像素图、Dijkstra 求最短路加 Path Critic 校验四步,在 23,000 条路径上微调多个 MLLM 以提升细粒度空间推理能力。