#多模态
#多模态
_akhaliq@_akhaliqAI 评分 _akhaliq@_akhaliqAI 评分 sundarpichai@sundarpichaiAI 评分
The DecoderAI 评分JEPA-Anything 把 LeCun 的 JEPA 扩展为跨领域通用世界模型
研究团队(由 PhAI Labs 牵头,与 Stanford、Oxford、Princeton 合作)提出 JEPA-Anything,把 JEPA 的预测状态拆成四个正交因子、各由独立预测模块处理后再重组,以避免简单模式淹没困难模式。
_akhaliq@_akhaliqAI 评分 EditHero 一个面向长时程部件级3D编辑与Vibe建模的基准 论文:huggingface.co/papers/2610.0…
The DecoderAI 评分AI 智能体从单张照片生成 Blender 3D 场景,但无法判断自己是否做对
研究提出 Image-to-Code 方法,让编码智能体接收单张图片后编写可执行的 Blender 程序,通过写代码、运行、查看结果并迭代修改来还原场景。团队同时发布 LEGO-Bench 基准,包含 104 个室内外场景的 208 张图像和 443 个注册资产,从有效性、几何精度和外观相似度三个维度评分。
HuggingPapers@HuggingPapersAI 评分 UniEvo-VL 一个自进化框架,单个多模态模型同时充当教师和学生,从自身的建设性反馈中学习,在无外部监督的情况下提升图像生成能力。
_akhaliq@_akhaliqAI 评分 自适应奖励路由 通过前向过程 RL 实现联合音视频扩散的动态多奖励优化 论文:huggingface.co/papers/2609.3…
_akhaliq@_akhaliqAI 评分
Microsoft Research精选AI 评分 微软研究院推出 Quine:面向生物学复杂性的 AI 研究系统
微软研究院推出 Quine,一个面向生物学复杂性的 AI 研究系统,由生物学世界模型和连接模型、科学工具、文献与研究者的交互式 harness 两部分组成。该系统与 Broad Institute 合作用于胰腺导管腺癌(PDAC)研究,从数千个化合物中筛选并优先排序可驱动肿瘤细胞状态转变的候选物,最高排名的化合物在湿实验中产生了最大的预期状态转变,整个流程仅用一个周末完成。
推荐理由:微软研究院公开 Quine 的生物学世界模型与实验编排框架,并给出胰腺癌化合物筛选的湿实验验证结果。
Google Research精选AI 评分Google Research 发布 AI 视频联合导演框架,实现连贯长视频生成
Google Research 发布 AI video co-director 等多智能体框架,用于生成连贯的长篇多镜头视频,相关论文将出现在 COLM 2026 和 EMNLP 2026。
推荐理由:Google 把长视频生成拆成规划、分镜、自回归生成与闭环修正四套框架,并给出多组基准上的连续性提升结果。
Google ResearchAI 评分Google Research 用生成式 UI 让教师创建互动教学模拟
Google Research 发布一项研究实验,让教师借助生成式 UI(GenUI)创建贴合自身课程目标的互动教学模拟,并同步开放 30 多个面向中学 STEM 的英文学习互动样例库,均由 AI 生成、教师审核。
Google ResearchAI 评分Google AgentHands:为 XR 空间智能体对话生成同步手势
Google 在 CHI 2026 发布研究原型 AgentHands,让 XR 中的 AI 智能体在说话时同步做出与语音对齐的手势,把抽象指令变成空间中的实体演示。系统通过眼动与场景重建注册物体 3D 包围盒,由后端 LLM 在回复中内嵌 GestureEvent,再在头显端用词级时间戳让手势与 TTS 精确同步。12 人被试内研究对比纯语音基线,结果显示空间指代效果显著提升。
Google ResearchAI 评分Google PhotoScan:用手机照片估算体脂与胰岛素抵抗风险
Google 推出 PhotoScan,一个可从普通 2D 手机照片估算体脂率(BF%)、Android-to-Gynoid 脂肪比(A/G)和内脏-皮下脂肪面积比(V/S)的深度学习框架。
Microsoft ResearchAI 评分 MindTopo 揭示多模态大模型的空间推理能力短板
微软研究院推出 MindTopo 基准,用于评测多模态大模型在连通性、封闭、顺序、分离与打结五类拓扑关系上的推理与规划能力。测试显示,模型在静态图像识别上表现明显优于交互式规划任务,且两者均远低于人类水平;失败多发生在规划阶段而非感知阶段,模型在场景变化中会丢失结构关系或提出违反物理约束的动作。图像与视频生成仅在单帧关系可见时偶有帮助,序列任务中仍不可靠。
Google Research精选AI 评分Google Research 发布 AMIE(Video):基于 Gemini 与 Project Astra 的实时视频问诊系统
Google Research 发布 AMIE(Video),一个基于 Gemini 和 Project Astra 的实时视频问诊配置,可感知非语言临床线索、引导患者演员完成虚拟体格检查并实时进行诊断推理。
推荐理由:原文给出AMIE(Video)的三智能体异步架构与随机对照评测结果,可了解实时视频问诊中视听感知与推理的分工方式。
Microsoft ResearchAI 评分 微软研究院推出 CARE-X:面向临床可用的放射学 VLM,结合辅助监督、奖励对齐学习与工具增强测量
微软研究院发布研究模型 CARE-X,一个统一胸部 X 光 VLM,可同时完成报告生成、结构化预测与病灶定位等任务,并用强化学习(DAPO)在多任务设置下奖励临床正确性。
Google Research精选AI 评分Google Research 发布 SymptomAI:面向日常症状评估的对话式 AI 智能体
Google Research 发布研究论文 SymptomAI,用五个 Gemini Flash 2.0 智能体开展 n=13,917 的全国随机研究,让参与者描述症状并生成鉴别诊断(DDx)。
推荐理由:Google Research 用近 1.4 万人随机实验对比 SymptomAI 与真实临床医生的鉴别诊断,并接入 Fitbit 生理信号做交叉验证。
Hugging Face BlogAI 评分
新模型来了,优势依旧:DharmaOCR 在巴西葡萄牙语 OCR 上仍领先 Mistral OCR4 与 Unlimited-OCR
DharmaOCR 在葡萄牙语专项基准上以 0.925 分领先 Mistral OCR4 的 0.798 和 Unlimited-OCR 的 0.7587,后两者分别落后约 13 分和 16 分以上。该模型经葡萄牙语监督微调加 DPO 两阶段训练,把全部参数集中于巴西葡萄牙语,在复杂文档提取质量和生成稳定性上形成结构性优势。文章认为,新架构并未改变这一领域专精带来的差距。
Google Research精选AI 评分Google 研究用手机前置摄像头实现被动心率监测
Google Research 在 Nature 发表 PHRM 研究系统,利用手机前置摄像头在面部解锁后拍摄 8 秒面部视频,通过深度学习估算心率,与心电图相比 MAPE 低于 10%,覆盖所有肤色。
推荐理由:Google 用 35 万段手机视频训练 rPPG 模型,并公开迄今最大规模数据集,读者可了解被动心率监测的可行边界。
Google DeepMind精选AI 评分Google DeepMind 发布 AI co-clinician 医疗 AI 研究计划
Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生临床监督下协助患者诊疗。
推荐理由:Google DeepMind 公开了 AI co-clinician 的研究设计与评测结果,读者可了解医疗智能体在证据检索和实时多模态问诊上的能力边界。
Google ResearchAI 评分Google 推出 PaperVizAgent 与 ScholarPeer 两个学术 AI 智能体
Google 发布两个学术智能体框架:PaperVizAgent(原 PaperBanana)从论文方法与图注生成出版级插图,ScholarPeer 则自动评审论文。
Google ResearchAI 评分Google 用 MapTrace 合成数据教多模态大模型在地图上寻路
Google Research 提出 MapTrace,用 Gemini 2.5 Pro 与 Imagen-4 构建全自动合成数据管线,生成 200 万条带路径标注的地图问答对并已开源。该管线经地图生成、Mask Critic 筛选可通行区域、构建像素图、Dijkstra 求最短路加 Path Critic 校验四步,在 23,000 条路径上微调多个 MLLM 以提升细粒度空间推理能力。
Google ResearchAI 评分Google 开源 DialogLab:编写、模拟与测试动态人-AI 群组对话
Google Research 在 ACM UIST 2025 发布开源原型框架 DialogLab,用于编写、模拟和测试动态的人-AI 群组对话,将对话的社交设定与时间推进解耦,支持拖拽式场景搭建、实时预览与验证仪表盘。14 名游戏设计、教育和社会科学领域参与者的评测显示,human control 模式在参与度、有效性和真实感上显著优于 autonomous 与 reactive 模式。
Google ResearchAI 评分Google 研究:小模型通过分解式方法实现更优用户意图提取
Google Research 在 EMNLP 2025 发表的论文提出一种分解式方法,将用户意图理解拆为两步:先用小型多模态 LLM 逐屏总结交互,再从摘要序列中提取意图。在移动端和网页轨迹上,该方法优于 CoT 提示和端到端微调,Gemini 1.5 Flash 8B 配合该方法的意图提取效果可与 Gemini 1.5 Pro 相当,成本与速度仅为后者一小部分。
Google DeepMindAI 评分Google DeepMind 与 Kaggle 推出 FACTS Benchmark Suite,系统评估大语言模型事实性
Google DeepMind 联合 Kaggle 发布 FACTS Benchmark Suite,在原有 FACTS Grounding 基础上新增 Parametric、Search、Multimodal 三项基准,并将 Grounding 升级至 v2,共 3,513 个公开样例。
Google ResearchAI 评分Google 发布 MSEB:面向听觉智能的大规模声音嵌入基准
Google Research 在 NeurIPS 2025 发布 Massive Sound Embedding Benchmark(MSEB),用统一框架评估声音嵌入在检索、推理、分类、转录、分割、聚类、重排、重建八项任务上的表现。
Google Research精选AI 评分Google 发布端到端实时语音到语音翻译模型,延迟降至 2 秒
Google Research 发布端到端语音到语音翻译(S2ST)模型,直接在原说话人音色下生成翻译音频,延迟仅 2 秒,而此前的级联方案延迟为 4–5 秒且会累积误差。
推荐理由:Google 端到端语音翻译把延迟从 4–5 秒压到 2 秒,并已落地 Meet 与 Pixel 10,可据此了解实时同传的技术取舍。
Google ResearchAI 评分Google DeepMind 发布 Natural Forests of the World 2020:用 AI 区分天然林与其他树冠覆盖
Google DeepMind 联合 Google Research 发布 Natural Forests of the World 2020,这是首个全球一致、10 米分辨率的天然林地图与数据集,在独立全球数据集上验证准确率达 92.2%。
Google DeepMind精选AI 评分Google DeepMind 发布 SIMA 2:可推理、对话并在 3D 虚拟世界中自我改进的智能体
Google DeepMind 发布 SIMA 2,通过将 Gemini 模型嵌入智能体核心,使其从指令执行者升级为可推理目标、与用户对话并自我改进的交互式游戏伙伴。
推荐理由:SIMA 2 把 Gemini 的推理能力接入 3D 游戏智能体,读者可了解其在泛化与自我改进上的具体进展与当前限制。
Google DeepMindAI 评分Google DeepMind 研究:让 AI 像人类一样“看”世界
Google DeepMind 在 Nature 发表新论文,提出三步对齐方法,将视觉模型的内部表征重组得更接近人类认知。研究基于 THINGS 数据集训练 SigLIP-SO400M 适配器作为教师模型,生成含百万张图像、数百万条类人判断的 AligNet 数据集,再微调学生模型。对齐后模型表征按人类概念层级结构化,鲁棒性与泛化能力提升。
Google DeepMindAI 评分Google 用 AI 绘制物种分布、预测森林砍伐并升级生物声学模型 Perch
Google 发布三项生物圈研究成果:与 World Resources Institute 合作推出森林砍伐风险预测基准数据集,基于纯卫星输入和 vision transformer 架构,可在 30 米尺度上预测风险。
OpenAI NewsAI 评分 OpenAI 推出 IndQA:面向印度语言的 AI 评测基准
OpenAI 发布 IndQA,一个用于评估 AI 系统在印度语言中表现的基准,覆盖 12 种语言和 10 个知识领域,由领域专家共同构建,重点考察文化理解与推理能力。
Google ResearchAI 评分Google Research 推出 StreetReaderAI:用多模态 AI 让街景对视障用户可访问
Google Research 在 UIST'25 发布 StreetReaderAI,一个基于 Gemini 的街景无障碍原型,通过 AI Describer 和 AI Chat 两个子系统为盲人及低视力用户实时生成街景语音描述并支持对话式提问。