OpenAI News·· 2023-05-31精选AI 评分
OpenAI 用过程监督提升数学模型推理能力
OpenAI 训练了一个模型,通过奖励推理的每个正确步骤(过程监督)而非只奖励最终正确答案(结果监督),在数学问题求解上取得新的 SOTA。相比结果监督,过程监督除了提升性能,还带来对齐上的好处,即直接训练模型产出被人类认可的链式推理。
OpenAI 用过程监督替代结果监督训练数学模型,并说明这一方式在链式推理对齐上的作用。
当前提供 AI 导读,完整正文请阅读原文。
来源:OpenAI News · openai.com