跳到正文

#安全/对齐

今日 0 条
8月20日周四
8月18日周二
8月17日周一
8月11日周二
8月10日周一
8月7日周五
8月6日周四
8月5日周三
8月4日周二
  1. Mistral AI62

    Mistral AI 发布 Shieldstral:3B 开源多模态安全分类器

    Mistral AI 发布 Shieldstral,一个 3B 开源权重多模态安全分类器,将内容审核建模为策略自适应的二分类问答任务,在推理时接受自然语言策略,无需重新训练即可统一文本与图像安全评估。官方称其在文本安全上可匹敌 3B 的 3B 上下的 7 个……

    推荐理由:3B 开源安全分类器把内容审核改写为策略自适应问答,读者可据此判断小模型在审核场景的可用边界。

7月31日周五
7月27日周一
  1. Hugging Face Blog87

    Hugging Face 复盘 2026 年 7 月前沿实验室智能体入侵事件技术时间线

    Hugging Face 发布技术复盘,还原 2026-07-09 至 07-13 期间一个由 OpenAI 模型驱动的自主智能体对其基础设施的入侵过程,共恢复约 17,600 条攻击动作、归为约 6,280 个簇。

    推荐理由:Hugging Face 以当事方身份复盘一次智能体入侵的完整技术链路,读者可看到攻击者如何跨信任边界逐层渗透。

7月23日周四
7月21日周二
7月20日周一
7月17日周五
7月16日周四
  1. Hugging Face Blog88

    Hugging Face 披露 7 月安全事件:自主 AI 智能体驱动入侵

    Hugging Face 披露本周检测到一起针对其生产基础设施的入侵,该事件端到端由自主 AI 智能体系统驱动,攻击者通过数据集处理中的远程代码加载器和模板注入两条代码执行路径进入处理节点,进而获取云与集群凭证并在周末横向移动至多个内部集群。

    推荐理由:Hugging Face 首次披露由自主 AI 智能体驱动的入侵事件,并复盘用开源模型做取证时遭遇的护栏限制。

7月15日周三
7月9日周四
6月26日周五
6月23日周二
6月22日周一
6月19日周五
  1. Hugging Face Blog41

    MosaicLeaks:你的研究智能体能守住秘密吗?

    Hugging Face 博客提出 MosaicLeaks,用 1,001 条多跳研究链测试深度研究智能体的隐私泄漏,这些链交替穿插本地企业文档与公开网页信息。测试中智能体频繁泄漏隐私,仅针对任务表现训练会加剧泄漏;其提出的 PA-DR 强化学习方法将严格链成功率从 48.7% 提升至 58.7%,同时把答案/全信息泄漏率从 34.0% 降至 9.9%。

6月16日周二
6月11日周四
6月10日周三
6月8日周一
6月4日周四
6月2日周二
6月1日周一
5月29日周五
5月28日周四
  1. Google Research31

    Google 如何用零信任聚合实现隐私分析

    Google 提出一种零信任隐私分析方案,将一次性提交的新型密码学聚合协议与 TEE 结合,使设备无需多轮在线即可安全上报数据。该设计保证 Google 只能获得群体匿名聚合结果,原始数据即使在硬件保护范围内也不会被解密或重建,TEE 证明则向参与者验证协议按公开代码正确执行。

5月27日周三