跳到正文
原文
Hugging Face Blog·· 2026-06-03AI 评分34

Hugging Face 博客:Direct Preference Optimization 如何超越聊天机器人场景

AI 导读

DharmaOCR 团队用 DPO 作为 SFT 之后的第二阶段训练,在巴西葡萄牙语结构化 OCR 任务上把文本退化率平均降低 59.4%,最佳案例降低 87.6%(Nanonets-OCR2–3B 从 1.61% 降至 0.20%)。

当前提供 AI 导读,完整正文请阅读原文。

来源:Hugging Face Blog · huggingface.co