跳到正文
原文
rohanpaul_ai· @rohanpaul_ai · X·· 2 天前AI 评分74

Google 发布 EmbeddingGemma 2 端侧多模态嵌入模型

AI 导读

Google 发布 EmbeddingGemma 2,一款采用 Apache 2.0 许可、面向端侧多模态 AI 的嵌入模型,可将文本、代码、图像、音频和视频映射到同一可搜索空间。

正文 · AI 翻译

Google 发布了 EmbeddingGemma 2,用于设备端多模态 AI,采用 Apache 2.0 许可证。

> 将文本、代码、图像、音频和视频放入手机上的同一个可搜索空间。

> 为手机补上了缺失的一环:无需将数据发送到服务器,就能理解和搜索你自己的内容。

> 740M 参数,采用 Gemma 4 架构。

> 其各部分是模块化的,因此纯文本应用只需 270M 参数,而 170M 视觉编码器和 300M 音频编码器仅在需要时加载。

> 在 Pixel 11 Pro 上,量化后的文本权重占用约 191MB 活跃内存,完整的多模态模型占用约 567MB。

> 上下文窗口扩大到 4 倍,达到 8K token,足以在 1 次输入中容纳约 5.5 分钟的音频、29 张图片或 58 个视频帧。

> 代码搜索提升最大,MTEB Code 分数从 68.76 升至 78.68,而多语言文本分数保持持平。

> Google 还声称在音频和视觉基准测试中取得了 1B 以下模型的最佳成绩,并击败了一些规模是其两倍的专用模型,

来源:rohanpaul_ai · x.com