Google发布EmbeddingGemma 2端侧多模态嵌入模型
先了解这件事
2026年10月7日,Google与Google DeepMind先后宣布发布EmbeddingGemma 2,称其为首个专为端侧嵌入打造的原生多模态开放模型,基于Gemma 4架构,参数量740M,可将文本、代码、图像、音频和视频统一到共享嵌入空间。官方称其在同规模下表现最佳,部分基准甚至超过两倍规模的专用模型;上下文窗口较第一代扩大4倍至8K,单次最多处理5.5分钟音频、29张图片或58帧视频,活跃内存占用约191MB至567MB。模型以Apache 2.0许可发布,权重已在Hugging Face和Kaggle开放下载,Gemini Enterprise Agent Platform Model Garden的可用性即将推出。开发者可用其构建多模态搜索(如通过语音备忘录查找视频片段),或与Gemma 4搭配实现私密端侧RAG,支持移动端与桌面端本地运行。第三方Unsloth称该模型可在0.5GB内存本地运行,并指出其由270M文本、170M视觉和300M音频模型组合而成,提供GGUF文件与使用指南。后续报道显示,llama.cpp首日即支持该模型,Testing Catalog也确认其为Apache 2许可的开放权重模型,具备模块化编码器与8K上下文窗口。
事件进展
报道时间线
- Google 发布 Apache 2 许可的 EmbeddingGemma 2 开放权重模型
Google 发布 EmbeddingGemma 2 开放权重模型,采用 Apache 2 许可。该模型为 740M 参数的轻量级多模态嵌入模型,可将文本、代码、图像、视频和音频映射到统一嵌入空间,具备模块化编码器和 8K context window。
- llama.cpp 首日支持 EmbeddingGemma 2
llama.cpp 首日支持 EmbeddingGemma 2 huggingface.co/ggml-org/embe…
- Google 发布 EmbeddingGemma 2,可在 0.5GB 内存本地运行
Google 发布 EmbeddingGemma 2,这是一个可在 0.5GB RAM 本地运行的新开源模型。该模型采用 Apache 2.0 许可,参数量 740M,由 270M 文本模型、170M 视觉模型和 300M 音频模型组合而成,可通过 Unsloth 运行与训练,并提供 GGUF 文件和使用指南。
- EmbeddingGemma 2 开放下载
EmbeddingGemma 2 已可在 @HuggingFace 和 @Kaggle 下载,Gemini Enterprise Agent Platform Model Garden 的可用性即将推出。 了解更多 ↓ goo.gle/474rZXq
- Google 发布 EmbeddingGemma 2 嵌入模型
Google 发布 EmbeddingGemma 2,参数量 740M,官方称同规模下表现最佳,超过部分两倍于其规模的模型,活跃内存占用低至约 191MB 到 567MB。相比第一代,其上下文窗口扩大 4 倍至 8K,单次最多可处理 5.5 分钟音频、29 张图片或 58 帧视频。
- Google 发布 EmbeddingGemma 2 多模态端侧嵌入模型
Google 发布 EmbeddingGemma 2,这是其首个专为端侧嵌入打造的原生多模态开放模型。该模型基于 Gemma 4 架构,采用 Apache 2.0 许可证发布,将图像、视频、音频和代码统一到单一嵌入空间中。
- Google 发布 EmbeddingGemma 2,支持移动端与桌面端本地运行
Google 宣布 EmbeddingGemma 2 针对移动端和桌面端本地运行进行了优化。借助该模型,用户无需联网即可通过语音备忘录找到特定视频片段,或用简单文本查询搜索数小时的音频内容。
- Google DeepMind 发布 EmbeddingGemma 2,740M 参数支持多模态搜索与端侧 RAG
Google DeepMind 发布 EmbeddingGemma 2,称其在 740M 参数量级上各基准表现有竞争力,甚至超过部分规模两倍以上的专用模型。开发者可用它为应用加入多模态搜索,例如通过语音备忘录查找视频片段,或与 Gemma 4 搭配实现私密的端侧 RAG。该模型以 Apache 2.0 许可发布,权重已在 Hugging Face 和 Kaggle 开放。
- Google DeepMind 发布 EmbeddingGemma 2 端侧多模态嵌入模型
Google DeepMind 发布 EmbeddingGemma 2,称这是其首个面向端侧嵌入的原生多模态开放模型。该模型从文本扩展到代码、图像、音频和视频,将这些内容统一到共享空间中。