Atlas 是我们可扩展的基础模型,能够感知、生成、推理,并与虚拟和物理世界交互。 我们将在未来几周内开放早期访问。 点击此处了解详情并注册: worldlabs.ai/blog/atlas
#多模态
#多模态
theworldlabs@theworldlabsAI 评分 theworldlabs@theworldlabsAI 评分 theworldlabs@theworldlabsAI 评分 World Labs 表示 Atlas 同时理解世界的空间结构以及它随时间演化的方式。这一能力让团队把少量普通相机变成子弹时间多视角捕捉工作室,捕捉被冻结在时间中的动态瞬间。
Google DeepMind精选AI 评分Google DeepMind 为 Gemini 3.7 Flash 等模型推出智能体视频理解功能
Google DeepMind 在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 上推出智能体视频理解功能,通过原生视频工具动态搜索、扫描和检查目标片段,替代固定帧率的静态处理。
推荐理由:官方给出 token 消耗、成本与准确率的具体变化,以及 API 开启方式,便于开发者评估长视频分析的成本结构。
stevenbjohnson@stevenbjohnsonAI 评分 Gemini Notebook 推出基于 Steven Pinker《The Sense of Style》的专家智能体,用户可将书加入笔记本,让其对草稿给出基于 Pinker 写作理念的个性化反馈。
MSFTResearch@MSFTResearchAI 评分
joshwoodward@joshwoodwardAI 评分 我在 @Gemini_Notebook 的 Expert Intelligence 中最喜欢的部分之一是作者的信,真是个很棒的细节!
SRSchmidgall@SRSchmidgallAI 评分 今天,我们很高兴分享在真实世界中使用 Gemini 加速科学发现的早期进展。我们展示了 Co-Scientist 的一个扩展版本,用它与材料科学、生物学和计算机科学领域的科学家进行协作。
AnnieDuke@AnnieDukeAI 评分
Gemini_Notebook@Gemini_NotebookAI 评分 Gemini_Notebook@Gemini_NotebookAI 评分 arena@arenaAI 评分
Google DeepMind精选AI 评分Google DeepMind 发布 Gemini Omni 1.1 Flash,新增场景延长与 4K 放大
Google DeepMind 发布 Gemini Omni 1.1 Flash,通过 Gemini API 在 Google AI Studio 提供面向开发者的生成视频创作控制能力。
推荐理由:官方列出了场景延长、首尾帧插值与 4K 放大等具体能力与开放入口,可据此判断生成视频工作流的改动空间。
Google ResearchAI 评分Google AgentHands:为 XR 空间智能体对话生成同步手势
Google 在 CHI 2026 发布研究原型 AgentHands,让 XR 中的 AI 智能体在说话时同步做出与语音对齐的手势,把抽象指令变成空间中的实体演示。系统通过眼动与场景重建注册物体 3D 包围盒,由后端 LLM 在回复中内嵌 GestureEvent,再在头显端用词级时间戳让手势与 TTS 精确同步。12 人被试内研究对比纯语音基线,结果显示空间指代效果显著提升。
Hugging Face Blog精选AI 评分
Sentence Transformers v6.0 新增 MultiVectorEncoder,支持 ColBERT 式后期交互检索
Sentence Transformers v6.0 新增第四种模型类型 MultiVectorEncoder,用于 ColBERT 式后期交互检索,PyLate、Stanford-NLP ColBERT 检查点可直接加载,colpali-engine 的视觉文档检索模型也可通过同一 API 使用。
推荐理由:原文给出多向量编码器的加载、打分与索引接入方式,读者可据此判断现有检索栈的改造量。
Google ResearchAI 评分Google PhotoScan:用手机照片估算体脂与胰岛素抵抗风险
Google 推出 PhotoScan,一个可从普通 2D 手机照片估算体脂率(BF%)、Android-to-Gynoid 脂肪比(A/G)和内脏-皮下脂肪面积比(V/S)的深度学习框架。
Gemini_Notebook@Gemini_NotebookAI 评分 Hugging Face BlogAI 评分
Hugging Face 为 OlmoEarth Studio 推出自定义嵌入向量导出功能
Hugging Face 的 OlmoEarth Studio 现已支持计算并导出嵌入向量,用户可通过 UI 或 API 选择区域、时段、编码器变体和影像源,获得 Cloud-Optimized GeoTIFF 格式结果。
Microsoft ResearchAI 评分 MindTopo 揭示多模态大模型的空间推理能力短板
微软研究院推出 MindTopo 基准,用于评测多模态大模型在连通性、封闭、顺序、分离与打结五类拓扑关系上的推理与规划能力。测试显示,模型在静态图像识别上表现明显优于交互式规划任务,且两者均远低于人类水平;失败多发生在规划阶段而非感知阶段,模型在场景变化中会丢失结构关系或提出违反物理约束的动作。图像与视频生成仅在单帧关系可见时偶有帮助,序列任务中仍不可靠。
Google DeepMind精选AI 评分Google DeepMind 发布 SL2T 手语转文本模型,率先落地 Gboard 与 Live Transcribe
Google DeepMind 发布多语言手语转文本模型 SL2T,首次将手语 AI 带入消费级产品,在 Pixel 11 的 Gboard 和 Live Transcribe 中支持美国手语(ASL)转英文听写。
推荐理由:SL2T 把多语言手语翻译从实验室带进 Gboard 与 Live Transcribe,读者可了解其数据规模与端侧隐私设计。
Google Research精选AI 评分Google Research 发布 AMIE(Video):基于 Gemini 与 Project Astra 的实时视频问诊系统
Google Research 发布 AMIE(Video),一个基于 Gemini 和 Project Astra 的实时视频问诊配置,可感知非语言临床线索、引导患者演员完成虚拟体格检查并实时进行诊断推理。
推荐理由:原文给出AMIE(Video)的三智能体异步架构与随机对照评测结果,可了解实时视频问诊中视听感知与推理的分工方式。
Microsoft ResearchAI 评分 微软研究院推出 CARE-X:面向临床可用的放射学 VLM,结合辅助监督、奖励对齐学习与工具增强测量
微软研究院发布研究模型 CARE-X,一个统一胸部 X 光 VLM,可同时完成报告生成、结构化预测与病灶定位等任务,并用强化学习(DAPO)在多任务设置下奖励临床正确性。
Hugging Face Blog精选AI 评分
NVIDIA 发布 Magpie TTS 多语言语音模型,开放权重支持 12 种语言
NVIDIA 发布 Magpie TTS Multilingual 开放权重模型,参数量 364M,支持英语、西班牙语、法语、德语、意大利语、越南语、普通话、印地语、日语等 12 种语言,新增现代标准阿拉伯语、韩语和巴西葡萄牙语。
推荐理由:NVIDIA 公开 Magpie TTS 多语言模型的权重与延迟数据,读者可据此评估自建语音链路的可行性与成本。
Hugging Face Blog精选AI 评分
Meta 发布开源多模态模型 Muse Glimmer 30B,面向本地智能体场景
Meta 发布 Muse Glimmer,一个从 Muse 蒸馏到 30B 参数、采用 Apache 2.0 许可的多模态模型,面向本地智能体用例,适用于编码、文档分析和个人助理等隐私敏感场景。
推荐理由:Meta 开源 30B 多模态模型并给出完整基准对比,读者可据此判断本地智能体部署的选型空间。
Meituan_LongCat@Meituan_LongCatAI 评分 自发布 LongCat-2.0 以来,我们一直在用它持续构建。 以下是五个创意项目,每个都由单个提示词生成: 🧱 体素艺术 🌍 3D 建模 🌊 CG 动画 🎞️ 一个落地页 🎮 一个小游戏 来看看 👇
Mistral AI精选AI 评分
Mistral AI 发布 Shieldstral:3B 开源多模态安全分类器
Mistral AI 发布 Shieldstral,一个 3B 开源权重多模态安全分类器,将内容审核建模为策略自适应的二分类问答任务,在推理时接受自然语言策略,无需重新训练即可统一文本与图像安全评估。官方称其在文本安全上可匹敌 3B 的 3B 上下的 7 个……
推荐理由:3B 开源安全分类器把内容审核改写为策略自适应问答,读者可据此判断小模型在审核场景的可用边界。
Google DeepMind精选AI 评分Google DeepMind 发布 Gemini Robotics ER 2 具身推理模型
Google DeepMind 发布 Gemini Robotics ER 2,作为机器人的高层大脑,支持视频理解、任务编排与多机器人协作,并可将动作执行交给底层 VLA 模型。
推荐理由:官方给出 Gemini Robotics ER 2 在进度分类、时刻定位与多机器人协作上的量化结果,可对照上一代判断具身推理模型的进展。
Google DeepMindAI 评分Google 在 Flow Music 发布 Lyria 3.5,提升音乐性、歌词、人声与创作控制
Google DeepMind 在 Google Flow Music 中推出新一代音乐生成模型 Lyria 3.5,在音乐性、歌词和人声质量上均有明显提升。新版本可生成更复杂自然的旋律结构、提示词遵循度和结构感知更强的歌词,以及更具情感表现力和发音更准确的人声,并支持更便捷地控制输出节奏与时长。该模型即日起在 Flow Music 上线。
Google DeepMind精选AI 评分Google DeepMind 发布 Gemini Robotics 2,为机器人带来全身智能
Google DeepMind 发布 Gemini Robotics 2,作为新一代机器人的智能层,解锁全身控制、灵巧操作和多机器人协作。
推荐理由:三款模型分别覆盖全身控制、具身推理与端侧部署,读者可据此判断机器人智能层的分工方式。
Hugging Face BlogAI 评分
NVIDIA Cosmos-H-Dreams:为手术机器人带来实时生成式仿真
NVIDIA 推出 Cosmos-H-Dreams,一个面向手术机器人的实时、动作条件生成式仿真器,由 Cosmos-H-Surgical-Simulator 蒸馏为因果少步学生模型,并通过 FlashDreams 流式推理库部署。
Google Research精选AI 评分Google Research 发布 SymptomAI:面向日常症状评估的对话式 AI 智能体
Google Research 发布研究论文 SymptomAI,用五个 Gemini Flash 2.0 智能体开展 n=13,917 的全国随机研究,让参与者描述症状并生成鉴别诊断(DDx)。
推荐理由:Google Research 用近 1.4 万人随机实验对比 SymptomAI 与真实临床医生的鉴别诊断,并接入 Fitbit 生理信号做交叉验证。
Google DeepMind精选AI 评分Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 与 3.5 Flash Cyber
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和面向网络安全的 3.5 Flash Cyber 三款新模型。
推荐理由:官方给出三款 Flash 新模型的定价、基准与开放入口,可据此判断智能体工作流的成本与延迟取舍。
Hugging Face BlogAI 评分
新模型来了,优势依旧:DharmaOCR 在巴西葡萄牙语 OCR 上仍领先 Mistral OCR4 与 Unlimited-OCR
DharmaOCR 在葡萄牙语专项基准上以 0.925 分领先 Mistral OCR4 的 0.798 和 Unlimited-OCR 的 0.7587,后两者分别落后约 13 分和 16 分以上。该模型经葡萄牙语监督微调加 DPO 两阶段训练,把全部参数集中于巴西葡萄牙语,在复杂文档提取质量和生成稳定性上形成结构性优势。文章认为,新架构并未改变这一领域专精带来的差距。
Hugging Face Blog精选AI 评分
Thinking Machines 发布 1T 参数多模态开源模型 Inkling 及 Inkling-Small
Thinking Machines Lab 在 Hugging Face 发布多模态开源模型 Inkling,采用 decoder-only MoE 架构,975B 总参数、41B 激活参数,支持图像、音频、文本输入和 1M 上下文,训练数据为 45 万亿 token。
推荐理由:Inkling 以约 1T 参数、1M 上下文原生接收图像音频文本,并给出各推理引擎的部署配置与基准对比。
Google DeepMindAI 评分Google DeepMind 推出 Gemini 驱动的 ATL Saathi,赋能印度下一代创新者
Google DeepMind 面向印度 Atal Tinkering Labs 启动 ATL Saathi 试点,这是一款由 Gemini 驱动的 Web 应用,为每位 Tinkering Lab 教育者提供 24/7 备课与培训助手。
ammaar@ammaarAI 评分 用 @GoogleAIStudio 构建 在这里制作你自己的片段 :) world-cup-hero.ai.studio/