Hugging Face 多模态团队发布伦理章程,将伦理原则置于研究生命周期核心
Hugging Face 多模态学习团队发布伦理章程,将伦理原则正式纳入机器学习研究生命周期。章程明确了内容政策,禁止暴力、歧视、侵犯隐私、生成虚假信息及在医疗、法律等高风险领域的不谨慎使用,并提出透明、开放可复现、公平、自我批判和尊重署名五项价值观。该文件由多模态团队联合伦理运营、数据治理和隐私专家讨论形成,截至 2022 年 5 月仍在完善中,更新将通过 GitHub 追踪。
Hugging Face 多模态学习团队发布伦理章程,将伦理原则正式纳入机器学习研究生命周期。章程明确了内容政策,禁止暴力、歧视、侵犯隐私、生成虚假信息及在医疗、法律等高风险领域的不谨慎使用,并提出透明、开放可复现、公平、自我批判和尊重署名五项价值观。该文件由多模态团队联合伦理运营、数据治理和隐私专家讨论形成,截至 2022 年 5 月仍在完善中,更新将通过 GitHub 追踪。
OpenAI 探讨在优化难以或高成本度量的目标时,如何应对 Goodhart 定律——"当一个度量成为目标,它就不再是好的度量"。该定律源自经济学,OpenAI 在训练中需直面这一挑战。
Hugging Face 发布机器学习专家访谈,嘉宾 Margaret Mitchell 讲述其从微软 Seeing AI 到创立 Google 伦理 AI 团队、再到加入 Hugging Face 的经历。
OpenAI 分享了在语言模型安全与滥用问题上的最新思考,旨在帮助其他 AI 开发者应对已部署模型的安全与滥用问题。
OpenAI 训练出比 GPT-3 更能遵循用户意图的语言模型,同时更真实、毒性更低,所用技术来自其对齐研究。这些名为 InstructGPT 的模型采用人类参与训练的方式,现已作为 OpenAI API 的默认语言模型部署。
推荐理由:OpenAI 说明 InstructGPT 如何通过人类反馈训练,让模型更贴合用户意图并成为 API 默认模型。
OpenAI 研究发现,用一个小规模精选数据集对语言模型进行微调,即可改善其在特定行为价值观方面的表现。
OpenAI 参与撰写的多利益相关方报告提出 10 种机制,用于提升 AI 系统相关声明的可验证性。该报告由 30 家机构的 58 位共同作者完成,涵盖 Centre for the Future of Intelligence、Mila、Schwartz Reisman Institute 等。
OpenAI 推出 Microscope,对八个常用于可解释性研究的视觉“模式生物”模型的每个重要层和神经元进行可视化。该工具让分析这些神经网络内部形成的特征变得更容易,OpenAI 希望借此帮助研究社区理解这类复杂系统。
OpenAI 发布 Safety Gym,一套用于衡量强化学习智能体在训练中遵守安全约束进展的环境与工具套件。该套件面向安全约束下的强化学习研究,提供配套环境与工具以评估智能体的安全表现。
OpenAI 用人类反馈微调了 774M 参数的 GPT-2 语言模型,在多项任务上成功匹配外部人类标注者的偏好,但这些偏好并不总与 OpenAI 自己的预期一致。
推荐理由:OpenAI 用人类反馈微调 GPT-2 的早期实验,呈现了标注偏好如何直接塑造模型行为。
OpenAI 开发出一种评估神经网络分类器能否可靠抵御训练中未见过对抗攻击的方法,并提出新指标 UAR(Unforeseen Attack Robustness),用于衡量单一模型面对未预期攻击时的鲁棒性。该方法强调需要在更多样化的未见攻击上衡量模型表现。
OpenAI 发布政策研究论文,提出当前可用于提升 AI 安全规范长期行业合作可能性的四项策略:沟通风险与收益、技术协作、提高透明度、激励标准。分析指出,行业安全合作对确保 AI 系统安全有益至关重要,但竞争压力可能导致集体行动困境,使 AI 公司对安全投入不足。
OpenAI 发表论文指出,长期 AI 安全研究需要社会科学家参与,才能确保对齐算法在真实人类参与下有效。对齐先进 AI 系统与人类价值观,需解决人类理性、情绪与偏见等心理学层面的诸多不确定性。OpenAI 计划招聘社会科学家全职从事该方向研究,以推动机器学习与社会科学的合作。
OpenAI 提出一种名为迭代放大(iterated amplification)的 AI 安全技术,通过把复杂任务拆解为更简单的子任务来指定超出人类规模的行为与目标,而非依赖标注数据或奖励函数。该构想仍处早期阶段,目前仅在简单的玩具算法领域完成实验,OpenAI 认为它有望成为可扩展的 AI 安全方案。
OpenAI 提出一种 AI 安全技术,训练智能体就话题相互辩论,由人类判断谁获胜。
OpenAI 与 Future of Humanity Institute、Centre for the Study of Existential Risk、Center for a New American Security、Electronic Frontier Foundation 等机构合著论文,预测恶意行为者可能如何滥用 AI 技术,并提出预防与缓解威胁的潜在方法。
OpenAI 设计了一种让 AI 相互教学的方法,所选取的示例同样能被人类理解。该方法自动挑选最具信息量的示例来教授某个概念,例如用最能描述"狗"这一概念的图像,实验证明它对 AI 和人类的教学都有效。
OpenAI 开源了 RL-Teacher,一个通过偶尔的人类反馈而非手工设计奖励函数来训练 AI 的接口实现。该技术旨在推进安全 AI 系统,也适用于奖励难以明确指定的强化学习问题。
OpenAI 表示已生成一批图像,在多种尺度和视角下都能稳定骗过神经网络分类器。这一结果对上周提出的说法构成挑战,即自动驾驶汽车因从多个尺度、角度和视角采集图像而难以被恶意欺骗。
OpenAI 与 DeepMind 安全团队合作开发了一种算法,通过让人类判断两种候选行为哪个更好,来推断人类想要的目标。该方法旨在减少人工编写目标函数的需求,因为用简单代理替代复杂目标或目标设定稍有偏差,都可能导致不良甚至危险的行为。
推荐理由:OpenAI 与 DeepMind 安全团队提出用人类偏好比较替代手写目标函数,读者可了解早期对齐研究的一条思路。
对抗样本是攻击者刻意设计、能让机器学习模型出错的输入,相当于给机器看的视错觉。OpenAI 展示了对抗样本在不同媒介上的表现,并讨论了为何防御这类攻击十分困难。
OpenAI 发文探讨强化学习算法中一种反直觉的失效模式:奖励函数设定错误。当奖励函数被错误指定时,算法会以出人意料的方式被"钻空子",从而偏离设计者的本意。
OpenAI 与 Berkeley、Stanford 的研究者共同合著了 Google Brain 主导的论文《Concrete Problems in AI Safety》,探讨如何确保现代机器学习系统按预期运行。论文梳理了围绕这一目标的诸多研究问题。
OpenAI 公布其技术目标:构建安全的 AI,并确保 AI 带来的益处尽可能广泛且均衡地分配。