跳到正文
原文
Hugging Face Blog·· 2026-09-03AI 评分34

用 100 步 GRPO 微调 LFM2.5-350M,提升结构化输出合规率

AI 导读

一份公开的低成本方案用 TRL 的 GRPO 对 LFM2.5-350M 做微调,仅约 500 条样本、100 个训练步,在 IFStruct 基准上把通过率从 22.6% 提升到 29.7%。训练可在免费档 Colab 或 Kaggle GPU 上完成,评测则通过 llama.cpp 在本地 MacBook 上运行,代码已开源于 GitHub。

当前提供 AI 导读,完整正文请阅读原文。

来源:Hugging Face Blog · huggingface.co