Google 用 MapTrace 合成数据教多模态大模型在地图上寻路
Google Research 提出 MapTrace,用 Gemini 2.5 Pro 与 Imagen-4 构建全自动合成数据管线,生成 200 万条带路径标注的地图问答对并已开源。该管线经地图生成、Mask Critic 筛选可通行区域、构建像素图、Dijkstra 求最短路加 Path Critic 校验四步,在 23,000 条路径上微调多个 MLLM 以提升细粒度空间推理能力。
Google Research 提出 MapTrace,用 Gemini 2.5 Pro 与 Imagen-4 构建全自动合成数据管线,生成 200 万条带路径标注的地图问答对并已开源。该管线经地图生成、Mask Critic 筛选可通行区域、构建像素图、Dijkstra 求最短路加 Path Critic 校验四步,在 23,000 条路径上微调多个 MLLM 以提升细粒度空间推理能力。
Google Research 在 ACM UIST 2025 发布开源原型框架 DialogLab,用于编写、模拟和测试动态的人-AI 群组对话,将对话的社交设定与时间推进解耦,支持拖拽式场景搭建、实时预览与验证仪表盘。14 名游戏设计、教育和社会科学领域参与者的评测显示,human control 模式在参与度、有效性和真实感上显著优于 autonomous 与 reactive 模式。
Google 提出 Natively Adaptive Interfaces(NAI)框架,用多模态 AI 工具打造更具适应性的无障碍应用,以 agent 驱动的动态模块取代静态导航。原型包括面向盲人与低视力用户的 StreetReaderAI,以及基于 Gemini 模型、可实时语音调整描述细节的 Multimodal Agent Video Player(MAVP)。
Google DeepMind 开始向美国 18 岁以上的 Google AI Ultra 订阅用户开放 Project Genie,这是一个由 Genie 3、Nano Banana Pro 和 Gemini 驱动的实验性研究原型,可创建、探索和 remix 交互式世界。
推荐理由:原文给出 Project Genie 的三项核心能力与已知限制,读者可据此判断世界模型原型当前能做什么、还差什么。
Google Research 在 EMNLP 2025 发表的论文提出一种分解式方法,将用户意图理解拆为两步:先用小型多模态 LLM 逐屏总结交互,再从摘要序列中提取意图。在移动端和网页轨迹上,该方法优于 CoT 提示和端到端微调,Gemini 1.5 Flash 8B 配合该方法的意图提取效果可与 Gemini 1.5 Pro 相当,成本与速度仅为后者一小部分。
Google DeepMind 发布 D4RT(Dynamic 4D Reconstruction and Tracking),一个统一 4D 场景重建与追踪的 AI 模型,采用编码器-解码器 Transformer 架构和查询机制,可同时完成点追踪、点云重建和相机位姿估计。
推荐理由:D4RT 把动态场景重建统一进单一查询式框架,读者可了解其速度提升与机器人、AR 等落地方向。
Google 发布 MedGemma 1.5 4B,新增对 CT、MRI 和全切片病理等高维医学影像的支持,并同步推出医疗听写语音识别模型 MedASR。
推荐理由:原文给出 MedGemma 1.5 与 MedASR 的基准提升和开放下载入口,读者可据此判断医疗多模态模型的可用边界。
Google DeepMind 更新 Veo 3.1 Ingredients to Video,让基于参考图生成的视频更富表现力,并提升角色、背景与物体的一致性。
推荐理由:官方说明了 Ingredients to Video 在角色一致性与竖屏输出上的变化,可据此判断移动端短视频工作流会怎么变。
NVIDIA 发布面向物理 AI 的开源推理视觉语言模型 Cosmos Reason 2,提供 2B 和 8B 两种参数规模,并在 Physical AI Bench 与 Physical Reasoning 榜单上成为排名第一的开源模型。
推荐理由:Cosmos Reason 2 把上下文从 16K 扩到 256K 并新增轨迹与 2D/3D 定位能力,可据此判断物理 AI 智能体的视频理解边界。
NVIDIA 在 CES 2026 发布博客,给出用 DGX Spark 与 Reachy Mini 搭建桌面个人智能体的分步教程,演示代码已开源。
Google DeepMind 回顾 2025 年 8 大研究突破,模型能力从 Gemini 2.5(3 月)推进到 Gemini 3(11 月)与 Gemini 3 Flash(12 月)。
Google Research 回顾 2025 年进展:Gemini 3 成为 Google 事实性最强的 LLM,在 SimpleQA Verified 和 FACTS 基准上达到 SOTA,并在 Gemini 3 中引入生成式 UI,可动态生成网页、游戏、工具等交互界面。
Mistral AI 发布 Mistral OCR 3,在表单、扫描件、复杂表格和手写内容上相对 Mistral OCR 2 的整体胜率为 74%。
推荐理由:官方给出与 Mistral OCR 2 的胜率对比、每千页定价和自托管选项,便于评估文档解析成本与合规。
Google DeepMind 发布 Gemini 3 Flash,将 Gemini 3 的推理能力与 Flash 级延迟、效率和成本结合,定价为 $0.50/1M 输入 tokens、$3/1M 输出 tokens。
推荐理由:官方给出 Gemini 3 Flash 的基准分数、定价与上线渠道,读者可据此判断它在速度与成本上的取舍。
Google 联合 SisonkeBiotik、Ro'ya 和 DS-I Africa 举办非洲健康数据科学 Ideathon,从 30 多份提交中选出六支决赛团队,围绕 MedGemma、TxGemma 和 MedSigLIP 等开放健康 AI 模型开发解决方案。
OpenAI 发布 GPT-5.2,称其为面向日常专业工作最先进的前沿模型,具备最先进的推理、长上下文理解、编码和视觉能力。该模型可在 ChatGPT 和 OpenAI API 中使用,用于支撑更快、更可靠的智能体工作流。
推荐理由:OpenAI 公布 GPT-5.2 在推理、长上下文、编码与视觉上的定位,读者可据此判断日常专业工作与智能体流程的升级方向。
Google DeepMind 联合 Kaggle 发布 FACTS Benchmark Suite,在原有 FACTS Grounding 基础上新增 Parametric、Search、Multimodal 三项基准,并将 Grounding 升级至 v2,共 3,513 个公开样例。
Google Research 在 NeurIPS 2025 发布 Massive Sound Embedding Benchmark(MSEB),用统一框架评估声音嵌入在检索、推理、分类、转录、分割、聚类、重排、重建八项任务上的表现。
Mistral AI 发布 Mistral 3 系列,包括 Mistral Large 3 和 3B、8B、14B 三个尺寸的 Ministral 3,全部以 Apache 2.0 许可开源。
推荐理由:Mistral 3 一次性放出从 3B 到 675B 的 Apache 2.0 模型家族,读者可据此判断开源权重在端侧与前沿两端的覆盖范围。
Google DeepMind 在 Gemini 应用中上线 AI 图片验证功能,用户上传图片并提问“Was this created with Google AI?
推荐理由:原文说明了 Gemini 应用内验证 AI 图片的具体操作方式,以及 SynthID 与 C2PA 两条技术路线的分工。
Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image),这是基于 Gemini 3 Pro 构建的高保真图像生成与编辑模型,已在 Google AI Studio 和 Vertex AI 面向企业以付费预览形式逐步开放。
推荐理由:Google DeepMind 发布 Gemini 3 Pro Image,开发者可据此了解其分辨率、文本渲染与 Google 搜索接地等能力边界。
Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image),基于 Gemini 3 Pro 构建,主打更强推理与世界知识、图像内多语言文字渲染,以及最多融合 14 张图像、保持 5 人一致性的编辑能力,支持 2K 和 4K 分辨率与多种画幅。
推荐理由:官方给出 Nano Banana Pro 的能力边界与各产品上线节奏,读者可据此判断图像生成在自身工作流中的可用性。
Google Research 发布端到端语音到语音翻译(S2ST)模型,直接在原说话人音色下生成翻译音频,延迟仅 2 秒,而此前的级联方案延迟为 4–5 秒且会累积误差。
推荐理由:Google 端到端语音翻译把延迟从 4–5 秒压到 2 秒,并已落地 Meet 与 Pixel 10,可据此了解实时同传的技术取舍。
Google DeepMind 发布 Gemini 3 Pro,称其在各项主要 AI 基准上超过此前版本,编码能力超过 2.5 Pro,可接入现有智能体与编码工作流。
推荐理由:Gemini 3 Pro 的基准成绩、定价与配套工具同时公布,读者可据此判断它能否接入现有编码与智能体工作流。
Google DeepMind 发布 Gemini 3,首发 Gemini 3 Pro 预览版,同步上线 Gemini app、Search 的 AI Mode、AI Studio、Vertex AI、Gemini CLI 及新智能体开发平台 Google Antigravity。
推荐理由:官方给出 Gemini 3 Pro 在推理、多模态与编码基准上的具体分数和上线渠道,可据此判断能力代际变化。
Google 发布生成式 UI 实现,由模型针对任意提示词自动设计并编码出网页、游戏、工具等交互界面,论文题为 Generative UI: LLMs are Effective UI Generators。
推荐理由:Google 官方给出生成式 UI 的实现路径与人类偏好评测结果,可据此判断界面生成这一方向的成熟度。
Google DeepMind 联合 Google Research 发布 Natural Forests of the World 2020,这是首个全球一致、10 米分辨率的天然林地图与数据集,在独立全球数据集上验证准确率达 92.2%。
Google DeepMind 发布 SIMA 2,通过将 Gemini 模型嵌入智能体核心,使其从指令执行者升级为可推理目标、与用户对话并自我改进的交互式游戏伙伴。
推荐理由:SIMA 2 把 Gemini 的推理能力接入 3D 游戏智能体,读者可了解其在泛化与自我改进上的具体进展与当前限制。
Google DeepMind 在 Nature 发表新论文,提出三步对齐方法,将视觉模型的内部表征重组得更接近人类认知。研究基于 THINGS 数据集训练 SigLIP-SO400M 适配器作为教师模型,生成含百万张图像、数百万条类人判断的 AligNet 数据集,再微调学生模型。对齐后模型表征按人类概念层级结构化,鲁棒性与泛化能力提升。
Google 发布三项生物圈研究成果:与 World Resources Institute 合作推出森林砍伐风险预测基准数据集,基于纯卫星输入和 vision transformer 架构,可在 30 米尺度上预测风险。
OpenAI 发布 IndQA,一个用于评估 AI 系统在印度语言中表现的基准,覆盖 12 种语言和 10 个知识领域,由领域专家共同构建,重点考察文化理解与推理能力。
Google Research 在 UIST'25 发布 StreetReaderAI,一个基于 Gemini 的街景无障碍原型,通过 AI Describer 和 AI Chat 两个子系统为盲人及低视力用户实时生成街景语音描述并支持对话式提问。
Hugging Face 发布指南,梳理 Chandra、OlmOCR-2、PaddleOCR-VL、DeepSeek-OCR、dots.ocr、Granite-Docling-258M。
推荐理由:梳理了当前开源 OCR 模型的输出格式、基准与本地部署方式,可据此为具体文档场景选型。
Hugging Face 为开源工具 AI Sheets 发布重大更新,新增视觉支持,可在表格中查看、分析图像并提取信息、生成和编辑图像,无需写代码。图像列支持提取文字、图像问答、目标检测、上色、添加文字等操作,文字列支持摘要、关键词提取和翻译,每个 AI 动作由提示词和模型定义,底层通过 Inference Providers 调用数千个开放模型。
Hugging Face 博客给出用 Optimum Intel 和 OpenVINO 在 Intel CPU 上本地运行 SmolVLM2-256M-Video-Instruct 的三步流程:导出 OpenVINO IR、量化、推理。
Hugging Face 发布三部分系列文章,讲述如何将 RedNote 的 3B 参数 OCR 模型 dots.ocr 转换到端侧运行,该模型在 OmniDocBench 上超过 Gemini 2.5 Pro。
OpenAI 发布视频生成模型 Sora 2,支持同步对白与音效。原文同时说明 Sora 产品已不再提供。
推荐理由:原文给出 Sora 2 在视频生成中同步对白与音效的能力方向,可据此了解视频模型的新进展。
OpenAI 发布新一代视频与音频生成模型 Sora 2,并公布其系统卡。相比此前的 Sora,新模型在物理准确性、真实感、音频同步、可控性和风格范围上有所提升,官方称这些能力是此前视频模型难以实现的。
推荐理由:官方系统卡披露 Sora 2 在物理准确性、同步音频与可控性上的能力变化,可据此了解视频生成的新边界。
Hugging Face 开源 Smol2Operator,以 SmolVLM2-2.2B-Instruct 为基线,通过两阶段训练将无 grounding 能力的视觉语言模型变为可操作 GUI 的智能体。
SchoolAI 基于 GPT-4.1、图像生成和 TTS 构建安全、教师引导的 AI 工具,已服务超过 100 万间教室。该平台提升了课堂参与度、教师监督能力和个性化学习体验。