跳到正文

#安全/对齐

今日 15 条
5月19日周四
  1. Hugging Face Blog15

    Hugging Face 多模态团队发布伦理章程,将伦理原则置于研究生命周期核心

    Hugging Face 多模态学习团队发布伦理章程,将伦理原则正式纳入机器学习研究生命周期。章程明确了内容政策,禁止暴力、歧视、侵犯隐私、生成虚假信息及在医疗、法律等高风险领域的不谨慎使用,并提出透明、开放可复现、公平、自我批判和尊重署名五项价值观。该文件由多模态团队联合伦理运营、数据治理和隐私专家讨论形成,截至 2022 年 5 月仍在完善中,更新将通过 GitHub 追踪。

4月13日周三
3月23日周三
3月3日周四
1月27日周四
  1. OpenAI News78

    OpenAI 用对齐研究让语言模型更好遵循指令

    OpenAI 训练出比 GPT-3 更能遵循用户意图的语言模型,同时更真实、毒性更低,所用技术来自其对齐研究。这些名为 InstructGPT 的模型采用人类参与训练的方式,现已作为 OpenAI API 的默认语言模型部署。

    推荐理由:OpenAI 说明 InstructGPT 如何通过人类反馈训练,让模型更贴合用户意图并成为 API 默认模型。

6月10日周四
4月16日周四
4月14日周二
11月21日周四
9月19日周四
8月22日周四
7月10日周三
2月19日周二
  1. OpenAI News40

    OpenAI:AI 安全研究需要社会科学家参与

    OpenAI 发表论文指出,长期 AI 安全研究需要社会科学家参与,才能确保对齐算法在真实人类参与下有效。对齐先进 AI 系统与人类价值观,需解决人类理性、情绪与偏见等心理学层面的诸多不确定性。OpenAI 计划招聘社会科学家全职从事该方向研究,以推动机器学习与社会科学的合作。

10月22日周一
  1. OpenAI News32

    OpenAI 提出迭代放大(iterated amplification)AI 安全技术

    OpenAI 提出一种名为迭代放大(iterated amplification)的 AI 安全技术,通过把复杂任务拆解为更简单的子任务来指定超出人类规模的行为与目标,而非依赖标注数据或奖励函数。该构想仍处早期阶段,目前仅在简单的玩具算法领域完成实验,OpenAI 认为它有望成为可扩展的 AI 安全方案。

5月3日周四
2月20日周二
2月15日周四
8月3日周四
7月17日周一
6月13日周二
  1. OpenAI News62

    OpenAI 与 DeepMind 提出从人类偏好中学习目标的方法

    OpenAI 与 DeepMind 安全团队合作开发了一种算法,通过让人类判断两种候选行为哪个更好,来推断人类想要的目标。该方法旨在减少人工编写目标函数的需求,因为用简单代理替代复杂目标或目标设定稍有偏差,都可能导致不良甚至危险的行为。

    推荐理由:OpenAI 与 DeepMind 安全团队提出用人类偏好比较替代手写目标函数,读者可了解早期对齐研究的一条思路。

2月24日周五
12月21日周三
6月21日周二
6月20日周一