Hugging Face Blog·· 2024-07-10AI 评分
TRL 库现已支持视觉语言模型(VLM)的 DPO 偏好优化
Hugging Face 的 TRL 库现已支持视觉语言模型(VLM)的直接偏好优化(DPO),并提供了完整训练教程。示例使用 Idefics2-8b 模型和包含超 83,000 条标注的 openbmb/RLAIF-V-Dataset 数据集,该 DPO 实现同时支持 Llava 1.5 和 PaliGemma。
当前提供 AI 导读,完整正文请阅读原文。
来源:Hugging Face Blog · huggingface.co