Arena提出文生图后训练复合奖励方案,FLUX.2-dev提升69 Elo
先了解这件事
AI 综述
2026年10月2日,Arena在X上发布其图像模型后训练的复合奖励设计方案。该方案以约560万条人类偏好投票训练的Bradley-Terry奖励模型为基础,叠加三项额外奖励:基于自动提示清单的忠实度奖励、覆盖显式与隐式意图的约束奖励,以及针对乱码文字和写实漂移等失败模式的反奖励劫持规则奖励。Arena称该复合奖励设计使FLUX.2-dev模型提升69 Elo。同日,Arena还发布博客,详细介绍文生图模型后训练流程,包括评分标准奖励的构建方式、完整的离线评测设置,以及展示奖励作弊失败模式的视觉前后对比。
报道时间线
10月2日
- Arena 博客详解文生图模型后训练
阅读我们的博客,了解如何对前沿文生图模型进行后训练。你将了解评分标准奖励的构建方式、完整的离线评测设置,以及视觉前后对比,展示我们发现的奖励作弊失败模式:arena.ai/blog/post-training-…
- Arena:图像模型后训练的复合奖励设计使 FLUX.2-dev 提升 69 Elo
Arena 提出图像模型后训练的复合奖励方案:在约 5.6M 人类偏好投票训练的 Bradley-Terry 奖励模型之上,叠加基于自动提示清单的忠实度奖励、覆盖显式与隐式意图的约束奖励,以及针对乱码文字和写实漂移等失败的反奖励劫持规则奖励。