OpenAI News·2024-07-24 17:00· 2024-07-24AI 评分38OpenAI 用基于规则的奖励(RBRs)提升模型安全行为AI 导读OpenAI 开发并应用了一种基于规则的奖励(RBRs)新方法,让模型在无需大量人工数据采集的情况下学会安全行为并对齐。该方法旨在改善模型的安全行为表现。正文阅读原文 当前提供 AI 导读,完整正文请阅读原文。来源:OpenAI News · openai.com#安全/对齐#OpenAI