Google 发布 ForestCast:用深度学习预测森林砍伐风险
Google 发布 ForestCast,一个基于纯卫星数据与视觉 Transformer 的深度学习模型,用于预测森林砍伐风险,并同步公开首个面向该任务的基准数据集。
Google 发布 ForestCast,一个基于纯卫星数据与视觉 Transformer 的深度学习模型,用于预测森林砍伐风险,并同步公开首个面向该任务的基准数据集。
Google 公布研究项目 Project Suncatcher,设想由太阳能卫星组成星座、搭载 Google TPU 并通过自由空间光链路互联,以在太空扩展 AI 算力。
推荐理由:Google 公开了太空 AI 基础设施的预印本,给出卫星互联、轨道与 TPU 抗辐射的实测数据,可了解这一设想的技术边界。
Google Research 在 Research@MTV 活动上公布三项最新突破:Google Earth AI、DeepSomatic 与 Quantum Echoes。
Google 发布首个可证明隐私洞察(PPI)系统,结合 LLM、差分隐私(DP)与可信执行环境(TEE),分析非结构化的 GenAI 使用数据,保证个体数据不可被查看、聚合洞察匿名。
Google Research 在 UIST'25 发布 StreetReaderAI,一个基于 Gemini 的街景无障碍原型,通过 AI Describer 和 AI Chat 两个子系统为盲人及低视力用户实时生成街景语音描述并支持对话式提问。
Google 公布基于 Gemini 模型的个人健康教练构建方案,采用多智能体框架协调对话智能体、数据科学智能体和健身等领域的专家子智能体,对睡眠、活动等生理时间序列数据做数值推理并给出个性化建议。
推荐理由:Google 公开了健康教练的多智能体架构与 SHARP 评估框架,可了解 Gemini 在健康场景的落地方式。
Intel 与 Hugging Face 联合测试显示,在搭载 Intel Xeon 6 处理器(Granite Rapids)的 Google Cloud C4 虚拟机上运行 OpenAI GPT OSS 大模型,总拥有成本(TCO)较上一代 C3 实例提升 1.7 倍,即 70%。
Google 发布 EmbeddingGemma,一个 308M 参数、2K 上下文窗口、支持 100 多种语言的多语言嵌入模型,面向端侧场景,量化后内存占用低于 200MB。
推荐理由:原文给出 308M 参数、2K 上下文与量化后 200MB 内存等指标,可据此判断端侧多语言检索的落地空间。
Hugging Face 博客宣布 Gemma 3n 已在开源生态中全面开放。
Google 发布 Gemma 3,官方将其定位为多模态、多语言、长上下文的开源大模型。Hugging Face 博客以“Welcome Gemma 3”为题介绍该模型,原文正文未抓取到,具体参数与能力细节暂缺。
Hugging Face 发布教程,介绍如何用 TGI 和专用深度学习容器(DLC)在 Google Cloud Vertex AI 的 A3 节点(8 张 H100 GPU)上部署 FP8 量化的 Meta Llama 3.1 405B Instruct。
Hugging Face 博客分享了复现 Google Infini-Attention 的失败实验:随着记忆压缩次数增加,模型性能持续下降,团队 90% 时间都在调试收敛问题。
Google 在 Gemma 2 发布一个月后扩充模型家族,新增 2.6B 参数的 Gemma 2 2B(含 base 与指令微调版)、安全分类器系列 ShieldGemma 以及覆盖 Gemma 2 2B 和 9B 每一层的稀疏自编码器套件 Gemma Scope。
推荐理由:Google 一次性放出 Gemma 2 2B、ShieldGemma 与 Gemma Scope,读者可据此了解小模型端侧部署与安全过滤的配套方案。
Hugging Face 与 KerasHub 实现共享模型保存格式,Hub 上 30 万+ Transformers 模型现可直接加载进 KerasHub,首批支持 Gemma 1/2、Llama 3 和 PaliGemma。
Hugging Face 宣布 Google Cloud TPU v5e 正式上线 Inference Endpoints 和 Spaces,提供 v5litepod-1(1 核 16 GB,$1.375/小时)、v5litepod-4(4 核 64 GB,$5.50/小时)和 v5litepod-8(8 核 128 GB,$11.00/小时)三种配置。
Google 发布 Gemma 2 系列开源大模型,包含 9B 和 27B 两个尺寸的基座版与指令微调版共 4 个开放权重模型,上下文长度 8K tokens,采用允许商用和再分发的宽松许可。
推荐理由:梳理 Gemma 2 的滑窗注意力、软截断与蒸馏等训练细节,并给出与 Llama 3、Qwen 1.5 的基准对比。
Google 发布视觉语言模型家族 PaliGemma,由 SigLIP-So400m 图像编码器和 Gemma-2B 文本解码器组成,可输入图像和文本并输出文本。
推荐理由:原文给出 PaliGemma 的架构、三种 checkpoint 与微调代码,读者可据此判断它适合哪些视觉语言任务。
Hugging Face 推出 Open Medical-LLM Leaderboard,用统一平台评测大语言模型在医疗任务上的表现,以准确率为主要指标,覆盖 MedQA、MedMCQA、PubMedQA 及 MMLU 医学与生物学子集。
Hugging Face 推出 Deploy on Google Cloud,可将 Hub 上数千个基础模型一键部署到 Google Cloud 的 Vertex AI 或 GKE,并作为自有账号内的 API Endpoint 运行。
Google 发布 CodeGemma 系列开源代码模型,包含 2B 基础模型、7B 基础模型和 7B Instruct 三个版本,基于预训练的 2B 和 7B Gemma checkpoint 额外训练 5000 亿 token 的英文、数学和代码数据。
推荐理由:Google 与 Hugging Face 联合发布三个开源代码模型,读者可对照 HumanEval 等基准数据判断其与同尺寸模型的差距。
UCLA 研究者推出 ConTextual,一个面向 LMM 的上下文敏感富文本视觉推理数据集,含 506 条指令,覆盖时间阅读、购物、导航、信息图等 8 类真实场景,并同步上线排行榜。
Google 发布新的开源大语言模型 Gemma,Hugging Face 博客以“欢迎 Gemma”为题介绍了该模型。
OpenAI 联合 Anthropic、Google 和 Microsoft 宣布了 Frontier Model Forum 的新任执行董事,并设立 1000 万美元的 AI 安全基金。
OpenAI 参与组建新的行业机构 Frontier Model Forum,旨在推动前沿 AI 系统的安全与负责任开发。该论坛将推进 AI 安全研究、确定最佳实践与标准,并促进政策制定者与行业间的信息共享。
Hugging Face Diffusers 自 0.5.1 版本起支持 Flax,可在 Google TPU 上实现快速推理。
推荐理由:Hugging Face 官方给出在 TPU 上跑 Stable Diffusion 的完整代码路径,可迁移到多设备并行推理。
Hugging Face 展示了如何将 TensorFlow 版 ViT B/16 模型部署到 Google Cloud 的 Vertex AI 平台,用比 Kubernetes 更少的代码实现同等扩展性。
Hugging Face 发布教程,演示如何在 Graphcore IPU 上用 Optimum Graphcore 库微调预训练 ViT 模型,并以 ChestX-ray14 数据集训练胸部 X 光分类器为例提供完整 notebook。
Hugging Face 发布机器学习专家访谈,嘉宾 Margaret Mitchell 讲述其从微软 Seeing AI 到创立 Google 伦理 AI 团队、再到加入 Hugging Face 的经历。
BERT 是 Google AI Language 研究人员于 2018 年开发的 NLP 模型,全称 Bidirectional Encoder Representations from Transformers,可同时解决 11+ 种常见语言任务。
Hugging Face 发布教程,演示如何用 🤗 datasets 加载 beans 图像分类数据集,并借助 🤗 transformers 微调预训练的 google/vit-base-patch16-224-in21k 模型。
Hugging Face 宣布在 Transformers 库中加入 Perceiver IO,这是首个基于 Transformer、可处理文本、图像、音频、视频、点云等多种模态及其组合的神经网络。
推荐理由:Hugging Face 把 Perceiver IO 接入 Transformers,读者可了解这套统一处理文本、图像、音频、视频的架构如何落地调用。
OpenAI 与 AIcrowd、卡内基梅隆大学及 DeepMind 联合举办两场 NeurIPS 2020 竞赛,分别基于 Procgen Benchmark 和 MineRL。
OpenAI 与 Google 研究人员合作推出 Activation Atlases,一种可视化神经元之间交互所代表含义的新技术。随着 AI 系统被部署到日益敏感的场景,更好地理解其内部决策过程将有助于识别弱点和调查失败原因。
OpenAI 与 DeepMind 安全团队合作开发了一种算法,通过让人类判断两种候选行为哪个更好,来推断人类想要的目标。该方法旨在减少人工编写目标函数的需求,因为用简单代理替代复杂目标或目标设定稍有偏差,都可能导致不良甚至危险的行为。
推荐理由:OpenAI 与 DeepMind 安全团队提出用人类偏好比较替代手写目标函数,读者可了解早期对齐研究的一条思路。
OpenAI 与 Berkeley、Stanford 的研究者共同合著了 Google Brain 主导的论文《Concrete Problems in AI Safety》,探讨如何确保现代机器学习系统按预期运行。论文梳理了围绕这一目标的诸多研究问题。