跳到正文
原文
Hugging Face Blog·· 2024-05-14精选AI 评分62

Google 发布开源视觉语言模型 PaliGemma

AI 导读

Google 发布视觉语言模型家族 PaliGemma,由 SigLIP-So400m 图像编码器和 Gemma-2B 文本解码器组成,可输入图像和文本并输出文本。

推荐理由

原文给出 PaliGemma 的架构、三种 checkpoint 与微调代码,读者可据此判断它适合哪些视觉语言任务。

当前提供 AI 导读,完整正文请阅读原文。

来源:Hugging Face Blog · huggingface.co