跳到正文

#安全/对齐

今日 1 条
12月22日周一
12月18日周四
12月16日周二
  1. Google DeepMind60

    Google DeepMind 发布 Gemma Scope 2,为 Gemma 3 全系列提供开源可解释性工具

    Google DeepMind 发布 Gemma Scope 2,一套覆盖 Gemma 3 全系列(270M 到 27B 参数)的开源可解释性工具,结合稀疏自编码器(SAEs)和 transcoders 查看模型内部计算。

    推荐理由:Gemma Scope 2 覆盖 Gemma 3 全尺寸并新增跨层工具,读者可了解开源可解释性工具当前能审计哪些模型行为。

12月11日周四
  1. Google DeepMind22

    Google DeepMind 扩大与英国 AI Security Institute 的合作

    Google DeepMind 宣布与英国 AI Security Institute(AISI)签署新谅解备忘录,将合作从模型测试扩展到基础安全与安全研究。双方将共享专有模型、数据与思路,并发布联合报告,重点研究 CoT 监控、社会情感错位及 AI 对经济系统的影响。该合作是 Google DeepMind 与英国政府推进安全 AI 整体协作的一部分。

  2. OpenAI News66

    OpenAI 更新 GPT-5 系统卡,纳入 GPT-5.2

    OpenAI 发布 GPT-5 系统卡更新,将 GPT-5.2 纳入 GPT-5 系列,成为该系列最新模型家族。GPT-5.2 的综合安全缓解方案与 GPT-5 系统卡、GPT-5.1 系统卡中描述的基本一致。与 OpenAI 其他模型一样,GPT-5.2 的训练数据包括互联网公开信息、通过第三方合作获取的信息,以及用户或人类训练师与研究人员提供或生成的信息。

    推荐理由:GPT-5.2 系统卡更新说明其安全缓解方案延续 GPT-5 与 GPT-5.1 的框架,可对照前代了解安全策略的连续性。

  3. Google Research26

    Google 提出 Urania:为 AI 聊天机器人使用洞察提供差分隐私框架

    Google Research 在 COLM 2025 论文中提出 Urania 框架,通过 DP 聚类与 DP 关键词提取,从 LLM 聊天记录中生成带端到端差分隐私保证的使用洞察。该框架让 LLM 只基于匿名关键词生成摘要,不接触原始对话,从而抵御提示注入等泄露风险。评测中 DP 摘要被 LLM 评审偏好的比例最高达 70%,但隐私预算收紧会降低主题覆盖度。

12月10日周三
12月3日周三
12月1日周一
11月27日周四
11月19日周三
11月13日周四
11月12日周三
11月7日周五
11月6日周四
10月30日周四
10月29日周三
10月28日周二
  1. Hugging Face Blog40

    Hugging Face 提出“语音同意门”:让语音克隆必须先获得本人明确同意

    Hugging Face 提出“语音同意门”机制,让语音克隆模型只有在说话人明确说出同意语句后才会启动。该方案由语言模型生成约 20 词的同意句与中性语音多样性句,经 ASR 识别同意内容后,再由 TTS 完成克隆,并建议同意音频直接来自麦克风而非上传文件。团队已提供示例 Space 和配套代码。

10月27日周一
  1. OpenAI News60

    OpenAI 与 170 多位心理健康专家合作,改进 ChatGPT 敏感对话回应

    OpenAI 与 170 多位心理健康专家合作,提升 ChatGPT 识别痛苦情绪、共情回应并引导用户寻求现实支持的能力,不安全回应最多减少 80%。OpenAI 表示此举旨在让 ChatGPT 在敏感时刻更安全、更具支持性。

    推荐理由:OpenAI 与 170 多位心理健康专家合作改进 ChatGPT 在敏感对话中的回应,并给出不安全回应下降幅度。

10月22日周三
  1. Hugging Face Blog47

    Hugging Face 与 VirusTotal 合作加强 AI 安全

    Hugging Face 宣布与威胁情报平台 VirusTotal 合作,即日起对 Hub 上 220 万+ 公开模型和数据集仓库进行持续扫描。用户访问仓库或文件页面时,Hub 会自动将文件哈希与 VirusTotal 威胁情报库比对,返回检测数量、已知恶意关联等元数据,且不共享原始文件内容。组织可将 VirusTotal 检查集成到 CI/CD 或部署流程中,在下载或集成文件前识别恶意资产。

10月14日周二
10月9日周四
10月7日周二
10月1日周三
9月30日周二
  1. OpenAI News75

    OpenAI 发布 Sora 2 与 Sora 应用,强调安全优先

    OpenAI 发布 Sora 2 和 Sora 应用,称两者在构建时以安全为基础,以应对先进视频模型和新型社交创作平台带来的新安全挑战。OpenAI 表示其做法建立在具体防护措施之上。

    推荐理由:OpenAI 说明 Sora 2 与 Sora 应用在安全机制上的设计思路,可了解视频模型与社交创作平台的安全考量。