跳到正文
热点事件历史事件

Arena提出文生图后训练复合奖励方案,FLUX.2-dev提升69 Elo

2 篇报道1 个报道来源4 天前更新

先了解这件事

AI 综述

2026年10月2日,Arena在X上发布其图像模型后训练的复合奖励设计方案。该方案以约560万条人类偏好投票训练的Bradley-Terry奖励模型为基础,叠加三项额外奖励:基于自动提示清单的忠实度奖励、覆盖显式与隐式意图的约束奖励,以及针对乱码文字和写实漂移等失败模式的反奖励劫持规则奖励。Arena称该复合奖励设计使FLUX.2-dev模型提升69 Elo。同日,Arena还发布博客,详细介绍文生图模型后训练流程,包括评分标准奖励的构建方式、完整的离线评测设置,以及展示奖励作弊失败模式的视觉前后对比。

AI 根据报道生成 · 20 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月2日
  1. X:Arena (@arena)
    Arena 博客详解文生图模型后训练

    阅读我们的博客,了解如何对前沿文生图模型进行后训练。你将了解评分标准奖励的构建方式、完整的离线评测设置,以及视觉前后对比,展示我们发现的奖励作弊失败模式:arena.ai/blog/post-training-…

  2. X:Arena (@arena)
    Arena:图像模型后训练的复合奖励设计使 FLUX.2-dev 提升 69 Elo

    Arena 提出图像模型后训练的复合奖励方案:在约 5.6M 人类偏好投票训练的 Bradley-Terry 奖励模型之上,叠加基于自动提示清单的忠实度奖励、覆盖显式与隐式意图的约束奖励,以及针对乱码文字和写实漂移等失败的反奖励劫持规则奖励。