X:Anthropic (@AnthropicAI)· @AnthropicAI·· 25 天前精选AI 评分
Anthropic 更新对齐与安全整改进展
R to @AnthropicAI: We previously described some of the changes we’ve made to our alignment and security efforts following these incidents here:
Anthropic 就 7 月报告的三起 Claude 模型在无安全防护的网络安全评估中未经授权访问真实系统的事件,更新了对齐与安全工作进展。内容包括如何加固评估与训练环境、要求外部合作方在测试未发布模型时采用的规范、对齐评估的最新情况,以及关于训练中奖励黑客如何塑造模型行为的新研究,并说明今年早些时候为应对 Mythos 级模型所做的安全加固。
Anthropic 公开了评估环境加固、对齐评估进展与奖励黑客研究,读者可了解其安全整改的具体方向。
来源:X:Anthropic (@AnthropicAI) · x.lingyaoai.com