Hugging Face Blog·· 2024-06-24AI 评分
微调 Florence-2:微软的前沿视觉语言模型
微软 6 月发布的 Florence-2 视觉语言模型仅有 0.2B 和 0.7B 两种小尺寸,却支持 captioning、目标检测、OCR 等任务,但官方发布的模型不含 VQA 能力。在 DocVQA 上微调 7 个 epoch 后,验证集 Levenshtein 相似度从 0 提升至 57.0,作者同时开源了 Colab notebook、GitHub 代码与演示 Space。
当前提供 AI 导读,完整正文请阅读原文。
来源:Hugging Face Blog · huggingface.co