跳到正文

#安全/对齐

今日 1 条
2月1日周六
1月31日周五
  1. OpenAI News62

    OpenAI 发布 o3-mini 系统卡

    OpenAI 发布 o3-mini 系统卡,说明该模型在发布前开展的安全工作,包括安全评估、外部红队测试和 Preparedness Framework 评测。

    推荐理由:系统卡披露了 o3-mini 的安全评估、外部红队与 Preparedness 框架评测范围,可了解该模型的发布前安全流程。

1月23日周四
1月22日周三
12月20日周五
12月9日周一
  1. OpenAI News62

    OpenAI 发布 Sora 系统卡

    OpenAI 发布 Sora 系统卡,介绍其视频生成模型 Sora 支持文本、图像和视频输入并生成新视频。Sora 基于 DALL-E 和 GPT 模型的经验构建,旨在为叙事和创意表达提供更丰富的工具。

    推荐理由:OpenAI 官方系统卡披露 Sora 的输入输出形式与技术来源,可了解其能力边界与安全评估框架。

12月5日周四
  1. OpenAI News78

    OpenAI 发布 o1 与 o1-mini 系统卡

    OpenAI 发布 o1 与 o1-mini 的系统卡,说明模型发布前开展的安全工作,包括外部红队测试和依据 Preparedness Framework 进行的前沿风险评估。

    推荐理由:系统卡披露了 o1 与 o1-mini 发布前的外部红队测试和前沿风险评估流程,可了解其安全评估框架。

11月21日周四
11月7日周四
  1. Mistral AI60

    Mistral AI 发布内容审核 API,支持 9 类文本分类

    Mistral AI 发布内容审核 API,即 Le Chat 审核服务所用的同一套接口,供用户按自身安全标准定制使用。该模型是基于 LLM 的分类器,将文本输入划分为 9 个类别,提供原始文本和对话内容两个端点,对话端点针对会话上下文中的最后一条消息分类。

    推荐理由:Mistral 把 Le Chat 内部使用的审核服务开放为 API,读者可据此评估自建内容审核链路的成本与多语言覆盖。

10月15日周二
10月1日周二
9月26日周四
9月16日周一
8月8日周四
  1. OpenAI News62

    Zico Kolter 加入 OpenAI 董事会

    OpenAI 宣布 Zico Kolter 加入其董事会,以 AI 安全与对齐方面的专业能力加强公司治理。Zico Kolter 同时将加入安全与安保委员会。

    推荐理由:OpenAI 官方公布董事会人事变动,读者可了解其在 AI 安全与对齐方向上的治理安排。

8月6日周二
  1. Hugging Face Blog22

    Hugging Face Hub 2024 年安全功能盘点:细粒度 Token、2FA、SSO 与自动化安全扫描等

    Hugging Face 于 8 月 6 日梳理了 Hub 的安全功能,面向所有用户提供细粒度 Token、2FA、Commit Signing、组织访问控制,以及基于 ClamAV、picklescan、trufflehog 的自动化安全扫描流水线。Enterprise Hub 用户还可使用 SSO(支持 SAML 2.0 与 OIDC)和 Resource Groups 等高级控制。

7月31日周三
  1. Hugging Face Blog62

    Google 发布 Gemma 2 2B、ShieldGemma 与 Gemma Scope

    Google 在 Gemma 2 发布一个月后扩充模型家族,新增 2.6B 参数的 Gemma 2 2B(含 base 与指令微调版)、安全分类器系列 ShieldGemma 以及覆盖 Gemma 2 2B 和 9B 每一层的稀疏自编码器套件 Gemma Scope。

    推荐理由:Google 一次性放出 Gemma 2 2B、ShieldGemma 与 Gemma Scope,读者可据此了解小模型端侧部署与安全过滤的配套方案。

7月24日周三
7月17日周三
7月10日周三
  1. Hugging Face Blog31

    Hugging Face 在 Dataset Hub 上用 Presidio 试验 PII 自动检测

    Hugging Face 正在 Dataset Hub 上试验一项基于开源 PII 检测工具 Presidio 的新功能,可为数据集生成 PII 存在情况的估算报告。Presidio 依靠检测模式和机器学习模型识别 PII,报告可帮助开发者在训练前决定是否进一步过滤数据,也便于数据集所有者在上线前验证自己的 PII 过滤流程。

6月27日周四
6月24日周一
  1. Hugging Face Blog20

    Hugging Face 伦理与社会通讯 #6:构建更好的 AI,数据质量为何至关重要

    Hugging Face 发布《伦理与社会通讯 #6》,聚焦高质量数据对 AI 模型的决定性作用,指出好数据不只是准确或量大,而是契合具体用途。文章以 Reddit 与 Google 的 RAG 搜索合作为例,说明低质数据曾导致“在披萨里加胶水”这类荒谬推荐。文中列出相关性、全面性、时效性与偏见缓解等数据质量维度,并强调数据治理、去重、内容过滤与人工反馈等流程。

6月20日周四
6月13日周四