跳到正文

#安全/对齐

今日 1 条
6月8日周六
5月30日周四
5月24日周五
  1. Hugging Face Blog43

    Meta 发布 CyberSecEval 2:大语言模型网络安全风险与能力评估框架

    Meta 推出 CyberSecEval 2,从代码解释器滥用、攻击性网络安全能力和提示注入攻击三方面评估 LLM 的网络安全风险。相比 2023 年 12 月的首版,LLM 协助网络攻击的平均合规率已从 52% 降至 28%。测试显示提示注入仍是未解难题,LLM 目前也难以可靠完成端到端漏洞利用挑战。

5月21日周二
5月7日周二
5月1日周三
4月20日周六
4月4日周四
3月21日周四
2月26日周一
  1. Hugging Face Blog33

    Hugging Face 详解 AI 水印:工具与技术

    Hugging Face 发布 AI 水印入门指南,介绍在生成时嵌入与生成后添加两类水印方法,并盘点 Hub 上的相关工具。文中还涉及 Glaze、Photoguard、Nightshade、Fawkes 等图像防篡改与数据投毒工具,以及 Truepic 基于 C2PA 标准的内容签名方案。文章同时讨论了水印器与检测器开放或闭源各自的利弊。

2月14日周三
1月31日周三
1月16日周二
12月14日周四
10月26日周四
10月25日周三
9月19日周二
8月15日周二
7月26日周三
7月21日周五
6月1日周四
5月31日周三
  1. OpenAI News62

    OpenAI 用过程监督提升数学模型推理能力

    OpenAI 训练了一个模型,通过奖励推理的每个正确步骤(过程监督)而非只奖励最终正确答案(结果监督),在数学问题求解上取得新的 SOTA。相比结果监督,过程监督除了提升性能,还带来对齐上的好处,即直接训练模型产出被人类认可的链式推理。

    推荐理由:OpenAI 用过程监督替代结果监督训练数学模型,并说明这一方式在链式推理对齐上的作用。

5月25日周四
5月22日周一
4月11日周二
4月5日周三
2月24日周五
  1. OpenAI News62

    OpenAI 发布 AGI 及更远未来的规划

    OpenAI 发布《Planning for AGI and beyond》,阐述其使命是确保通用人工智能(比人类更聪明的 AI 系统)造福全人类。该文为官方对 AGI 规划与安全立场的说明。

    推荐理由:OpenAI 官方阐述 AGI 的使命与规划思路,可了解其对通用人工智能安全与治理的立场。

2月16日周四
1月31日周二
1月11日周三
  1. OpenAI News38

    OpenAI 与乔治城大学、斯坦福互联网天文台联合研究:语言模型如何被用于虚假信息宣传及如何降低风险

    OpenAI 研究人员与乔治城大学安全与新兴技术中心及斯坦福互联网天文台合作,调查大语言模型可能被滥用于虚假信息宣传的方式。该合作包括 2021 年 10 月汇聚 30 位虚假信息研究者、机器学习专家与政策分析师的工作坊,并最终形成一份基于一年多研究的联合报告。报告梳理了语言模型若被用于增强虚假信息宣传对信息环境构成的威胁,并提出了分析潜在缓解措施的框架。

10月24日周一
9月22日周四
8月31日周三
  1. Hugging Face Blog40

    Hugging Face 支持的 OpenRAIL:面向开放且负责任的 AI 许可框架

    RAIL Initiative 推出、Hugging Face 支持的 OpenRAIL 是一类 AI 专用许可框架,允许免版税访问、下游使用与再分发,同时嵌入针对特定关键场景的使用限制。该许可借鉴 BigScience、开源与 Creative Commons 的做法,试图在广泛开放 ML 模型与约束有害用途之间划出界线,并赋予许可方在发现滥用时的执行能力。

8月24日周三
8月10日周三
7月18日周一