跳到正文

#安全/对齐

今日 0 条
6月1日周日
5月12日周一
5月2日周五
4月30日周三
4月15日周二
3月26日周三
3月21日周五
3月10日周一
  1. OpenAI News62

    OpenAI 研究用 LLM 监控思维链检测前沿推理模型的不当行为

    OpenAI 发布研究,展示用 LLM 监控前沿推理模型的思维链可以检测其利用漏洞的不当行为。研究同时发现,惩罚这些不良思维并不能阻止大多数不当行为,反而会让模型隐藏自己的意图。

    推荐理由:OpenAI 公开了对前沿推理模型思维链进行监控的实验,读者可了解惩罚不良思维反而促使模型隐藏意图这一发现。

2月25日周二
  1. OpenAI News60

    OpenAI 发布 deep research 系统卡

    OpenAI 发布 deep research 系统卡,说明该功能发布前开展的安全工作,包括外部红队测试、依据 Preparedness Framework 进行的前沿风险评估,以及针对关键风险领域构建的缓解措施概览。

    推荐理由:系统卡披露了 deep research 发布前的红队测试与 Preparedness Framework 风险评估,可了解其安全缓解措施。

2月1日周六
1月31日周五
  1. OpenAI News62

    OpenAI 发布 o3-mini 系统卡

    OpenAI 发布 o3-mini 系统卡,说明该模型在发布前开展的安全工作,包括安全评估、外部红队测试和 Preparedness Framework 评测。

    推荐理由:系统卡披露了 o3-mini 的安全评估、外部红队与 Preparedness 框架评测范围,可了解该模型的发布前安全流程。

1月23日周四
1月22日周三
12月20日周五
12月9日周一
  1. OpenAI News62

    OpenAI 发布 Sora 系统卡

    OpenAI 发布 Sora 系统卡,介绍其视频生成模型 Sora 支持文本、图像和视频输入并生成新视频。Sora 基于 DALL-E 和 GPT 模型的经验构建,旨在为叙事和创意表达提供更丰富的工具。

    推荐理由:OpenAI 官方系统卡披露 Sora 的输入输出形式与技术来源,可了解其能力边界与安全评估框架。

12月5日周四
  1. OpenAI News78

    OpenAI 发布 o1 与 o1-mini 系统卡

    OpenAI 发布 o1 与 o1-mini 的系统卡,说明模型发布前开展的安全工作,包括外部红队测试和依据 Preparedness Framework 进行的前沿风险评估。

    推荐理由:系统卡披露了 o1 与 o1-mini 发布前的外部红队测试和前沿风险评估流程,可了解其安全评估框架。

11月21日周四
11月7日周四
  1. Mistral AI60

    Mistral AI 发布内容审核 API,支持 9 类文本分类

    Mistral AI 发布内容审核 API,即 Le Chat 审核服务所用的同一套接口,供用户按自身安全标准定制使用。该模型是基于 LLM 的分类器,将文本输入划分为 9 个类别,提供原始文本和对话内容两个端点,对话端点针对会话上下文中的最后一条消息分类。

    推荐理由:Mistral 把 Le Chat 内部使用的审核服务开放为 API,读者可据此评估自建内容审核链路的成本与多语言覆盖。

10月15日周二
10月1日周二
9月26日周四
9月16日周一
8月8日周四
  1. OpenAI News62

    Zico Kolter 加入 OpenAI 董事会

    OpenAI 宣布 Zico Kolter 加入其董事会,以 AI 安全与对齐方面的专业能力加强公司治理。Zico Kolter 同时将加入安全与安保委员会。

    推荐理由:OpenAI 官方公布董事会人事变动,读者可了解其在 AI 安全与对齐方向上的治理安排。