OpenAI 详解 Voice Engine 工作原理与安全研究
OpenAI 详解其文本转语音模型 Voice Engine 的技术原理及配套安全研究。
OpenAI 详解其文本转语音模型 Voice Engine 的技术原理及配套安全研究。
OpenAI 终止了与隐蔽影响力行动相关的账号,并称这些账号未因使用其服务获得显著受众增长。
Meta 推出 CyberSecEval 2,从代码解释器滥用、攻击性网络安全能力和提示注入攻击三方面评估 LLM 的网络安全风险。相比 2023 年 12 月的首版,LLM 协助网络攻击的平均合规率已从 52% 降至 28%。测试显示提示注入仍是未解难题,LLM 目前也难以可靠完成端到端漏洞利用挑战。
OpenAI 阐述了其安全实践,强调通用人工智能有潜力惠及生活几乎方方面面,因此必须以负责任的方式开发和部署。
OpenAI 推出新技术,帮助研究人员识别由其工具生成的内容,同时加入内容来源与真实性联盟(C2PA)指导委员会以推动行业标准。
OpenAI 封禁了与源自俄罗斯的影响力行动 Doppelganger 相关的账号,该行动利用 AI 生成反乌克兰的社交媒体评论、翻译和网站文案,覆盖多种语言。
推荐理由:OpenAI 披露封禁与俄罗斯相关的影响力行动账号,读者可了解生成式 AI 被用于跨语言舆论操作的具体形态。
OpenAI 封禁了与一起此前未报告的以色列来源行动相关的账号,该行动被其命名为 Zero Zeno。这些账号使用 AI 生成反哈马斯、反卡塔尔、亲以色列、反印度人民党以及亲以色列总工会的内容。
OpenAI 封禁了与源自中国的行动 Spamouflage 相关的账号,该行动利用 AI 研究社交媒体活动、生成帖子,并为此前未被报道的网站进行调试。
OpenAI 封禁了与伊朗背景行动"IUVM"相关的账号,该行动利用 AI 生成并翻译亲伊朗、反以色列和反美的网站内容。
OpenAI 提出"指令层级"方法,训练 LLM 优先执行特权指令,以抵御提示词注入、越狱等攻击。当前 LLM 易被对抗者用恶意提示词覆盖原始指令,该方法旨在让模型区分指令优先级。
Hugging Face 宣布与云安全公司 Wiz 合作提升平台及 AI/ML 生态安全,并已集成 Wiz 进行漏洞管理和云安全态势管理(CSPM)。Wiz 研究团队通过 pickle 在沙箱计算环境中运行任意代码,发现了相关缺陷,Hugging Face 表示已修复全部漏洞。
Lighthouz AI 联合 Hugging Face 推出 Chatbot Guardrails Arena,让用户与两个匿名 LLM 对话,尝试套取虚构银行 XYZ001 客户的敏感财务信息,并投票选出隐私保护更强的模型。
Hugging Face 发布 AI 水印入门指南,介绍在生成时嵌入与生成后添加两类水印方法,并盘点 Hub 上的相关工具。文中还涉及 Glaze、Photoguard、Nightshade、Fawkes 等图像防篡改与数据投毒工具,以及 Truepic 基于 C2PA 标准的内容签名方案。文章同时讨论了水印器与检测器开放或闭源各自的利弊。
OpenAI 发布公告,称已阻断国家关联威胁行为者对 AI 的恶意使用。原文正文未抓取到,仅标题可用。
OpenAI 正在构建一套评估框架,用于衡量大语言模型可能协助制造生物威胁的风险。在一项有生物学专家和学生参与的评测中,OpenAI 发现 GPT-4 对生物威胁制造准确率的提升最多只是轻微的。这一提升幅度尚不足以得出确定结论,但该发现是后续研究和社区讨论的起点。
OpenAI 公布"民主输入 AI"资助计划成果,已资助来自全球的 10 支团队设计集体治理 AI 的思路与工具。OpenAI 总结了这些团队的创新做法与自身经验,并呼吁研究人员和工程师加入后续工作。
OpenAI 启动总额 1000 万美元的 Superalignment Fast Grants,资助面向超人类 AI 系统对齐与安全的技术研究。资助方向包括弱到强泛化、可解释性、可扩展监督等。
OpenAI 提出"弱到强泛化"这一超级对齐新研究方向,探索能否利用深度学习的泛化特性,用弱监督者控制强模型。该方向已给出初步结果。
OpenAI 正在构建灾难性风险防范方法,以保障高能力 AI 系统的安全,具体举措包括组建 Preparedness 团队并发起一项挑战。
OpenAI 联合 Anthropic、Google 和 Microsoft 宣布了 Frontier Model Forum 的新任执行董事,并设立 1000 万美元的 AI 安全基金。
OpenAI 宣布公开招募 Red Teaming Network 成员,邀请各领域专家参与提升其模型安全性。该网络面向有兴趣改进 OpenAI 模型安全的领域专家开放申请。
OpenAI 将 GPT-4 用于内容政策制定和内容审核决策,实现更一致的标注、更快的政策优化反馈循环,并减少人工审核员的参与。
OpenAI 参与组建新的行业机构 Frontier Model Forum,旨在推动前沿 AI 系统的安全与负责任开发。该论坛将推进 AI 安全研究、确定最佳实践与标准,并促进政策制定者与行业间的信息共享。
OpenAI 与其他领先实验室通过自愿承诺强化 AI 的安全、安保与可信度,推动 AI 治理向前迈进。
OpenAI 启动网络安全资助计划,通过资助及其他支持方式,推动面向防御方的 AI 网络安全能力开发。
OpenAI 训练了一个模型,通过奖励推理的每个正确步骤(过程监督)而非只奖励最终正确答案(结果监督),在数学问题求解上取得新的 SOTA。相比结果监督,过程监督除了提升性能,还带来对齐上的好处,即直接训练模型产出被人类认可的链式推理。
推荐理由:OpenAI 用过程监督替代结果监督训练数学模型,并说明这一方式在链式推理对齐上的作用。
OpenAI 旗下非营利组织 OpenAI, Inc. 启动一项资助计划,将发放十笔各 10 万美元的拨款,用于资助在法律规定范围内建立民主流程、决定 AI 系统应遵循何种规则的实验。
OpenAI 发文呼吁现在就开始思考超级智能的治理问题,即未来能力远超 AGI 的 AI 系统。文章未给出具体治理方案或时间表。
OpenAI 宣布推出漏洞赏金计划,邀请外界帮助发现其技术与服务中的安全漏洞,以打造安全、可靠、可信的 AI 技术和服务。该计划是 OpenAI 践行开发安全且先进 AI 承诺的重要举措。
OpenAI 阐述了其 AI 安全方法,强调确保 AI 系统在构建、部署和使用各环节的安全对其使命至关重要。
OpenAI 发布《Planning for AGI and beyond》,阐述其使命是确保通用人工智能(比人类更聪明的 AI 系统)造福全人类。该文为官方对 AGI 规划与安全立场的说明。
推荐理由:OpenAI 官方阐述 AGI 的使命与规划思路,可了解其对通用人工智能安全与治理的立场。
OpenAI 正在说明 ChatGPT 的行为是如何被塑造的,并公布改进计划:让用户获得更多定制空间,同时在这些决策上引入更多公众意见。
OpenAI 发布一款经过训练的分类器,用于区分 AI 生成文本与人类写作文本。
OpenAI 研究人员与乔治城大学安全与新兴技术中心及斯坦福互联网天文台合作,调查大语言模型可能被滥用于虚假信息宣传的方式。该合作包括 2021 年 10 月汇聚 30 位虚假信息研究者、机器学习专家与政策分析师的工作坊,并最终形成一份基于一年多研究的联合报告。报告梳理了语言模型若被用于增强虚假信息宣传对信息环境构成的威胁,并提出了分析潜在缓解措施的框架。
Hugging Face 在 🤗 Evaluate 库中新增偏见指标与测量方法,用于评估 GPT-2、BLOOM 等因果语言模型的偏见。工作流分两步:用 🤗 Datasets 上的预定义提示词提示模型,再用 🤗 Evaluate 的指标评估生成内容,示例覆盖毒性、语言极性和伤害性三类任务。
Hugging Face 推出《Ethics and Society Newsletter》,按季节在春分秋分和夏至冬至发布,由公司内部跨部门开放小组“Ethics and Society regulars”撰写。
RAIL Initiative 推出、Hugging Face 支持的 OpenRAIL 是一类 AI 专用许可框架,允许免版税访问、下游使用与再分发,同时嵌入针对特定关键场景的使用限制。该许可借鉴 BigScience、开源与 Creative Commons 的做法,试图在广泛开放 ML 模型与约束有害用途之间划出界线,并赋予许可方在发现滥用时的执行能力。
OpenAI 正在提升 AI 系统从人类反馈中学习、以及协助人类评估 AI 的能力。其目标是构建一个足够对齐的 AI 系统,进而帮助解决所有其他对齐问题。
OpenAI 发布新版内容审核工具 Moderation endpoint,改进此前的内容过滤器,即日起向 OpenAI API 开发者免费开放。
OpenAI 为 DALL·E 2 引入一项新技术,使其生成的人物图像更准确地反映世界人口的多样性,以减少偏见并提升安全性。