OpenAI 与 Hugging Face 合作应对模型评测期间的安全事件
OpenAI 与 Hugging Face 合作,公布了一次 AI 模型评测期间安全事件的早期发现。双方指出事件涉及高级网络攻击能力,并总结了可供防御方参考的经验教训。
OpenAI 与 Hugging Face 合作,公布了一次 AI 模型评测期间安全事件的早期发现。双方指出事件涉及高级网络攻击能力,并总结了可供防御方参考的经验教训。
英国 AI Security Institute 分析显示,领先开源权重模型与闭源网络能力前沿的差距正在收窄,GLM-5.2 与 DeepSeek V4-Pro 大致相当于 4 至 7 个月前发布的闭源前沿模型,而 2025 年大部分时间这一差距为 6 至 10 个月。
OpenAI 分享部署长时程运行模型的经验,指出这类模型带来新的安全风险并观察到实际失败案例,同时通过迭代部署改进了防护措施。
Google DeepMind 发布 Gemini 3.5 Flash Cyber,一个基于 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证和修补漏洞。
推荐理由:官方给出 Gemini 3.5 Flash Cyber 在 CyberGym、Chrome 提交扫描等基准上的对比数据,可了解轻量安全模型的定位与访问限制。
OpenAI 正通过适龄保护、学习工具、家长控制和专家合作,让 ChatGPT 对青少年更安全。
Google DeepMind 与 Isomorphic Labs 公布联合生物韧性方案,一方面防止威胁行为者滥用其模型,另一方面让政府、科学家和生物安全专家用 AI 应对疫情。
Hugging Face 披露本周检测到一起针对其生产基础设施的入侵,该事件端到端由自主 AI 智能体系统驱动,攻击者通过数据集处理中的远程代码加载器和模板注入两条代码执行路径进入处理节点,进而获取云与集群凭证并在周末横向移动至多个内部集群。
推荐理由:Hugging Face 首次披露由自主 AI 智能体驱动的入侵事件,并复盘用开源模型做取证时遭遇的护栏限制。
OpenAI 推出自动化红队系统 GPT-Red,通过自博弈提升 AI 安全、对齐与提示词注入鲁棒性。该系统面向红队测试场景,用于自动发现模型弱点并驱动鲁棒性自我改进。
OpenAI 推出 GPT-5.5 Bio Bug Bounty 计划,面向生物领域征集模型漏洞。该计划的具体细节已随公告一并公布。
OpenAI 预告下一代模型 GPT-5.6 Sol,在编码、科学和网络安全方面具备更强能力。该模型同时搭配 OpenAI 目前最先进的安全栈。
OpenAI 通过 Appia Foundation 支持先进 AI 的评估框架、安全实践与全球合作,推动共享标准建设。
牛津大学、英国AI Security Institute、斯坦福大学和伦敦政治经济学院的研究者通过四项实验、18,978场对话、6,923名参与者发现,AI系统在文本说服上稳定超过人类专家,即使专家提前研究、接受数小时结构化训练并获得1,000英镑奖金激励。
OpenAI 推出 Patch the Planet,这是 Daybreak 计划下的一项新举措,帮助开源维护者借助 AI 与专家审核发现、验证并修复漏洞。
Hugging Face 博客提出 MosaicLeaks,用 1,001 条多跳研究链测试深度研究智能体的隐私泄漏,这些链交替穿插本地企业文档与公开网页信息。测试中智能体频繁泄漏隐私,仅针对任务表现训练会加剧泄漏;其提出的 PA-DR 强化学习方法将严格链成功率从 48.7% 提升至 58.7%,同时把答案/全信息泄漏率从 34.0% 降至 9.9%。
Google DeepMind 发布 AI Control Roadmap,一套用于构建和管理 Google 内部部署的高级 AI 的框架,采用纵深防御思路,在模型对齐之外增加系统级安全层。
OpenAI 推出 Deployment Simulation,一种在模型部署前用真实对话数据预测其行为的方法,旨在提升安全性与评估准确性。
英国 AI Security Institute 对齐团队与 Timaeus 联合成立非营利研究机构 Sequent,认为"对齐尚未走上正轨",计划两年内扩至 40-80 名全职员工,初期募资 1 亿至 1.5 亿美元,研究方向涵盖可扩展监督、学习理论、启发式论证、博弈论与 personas。
OpenAI 宣布支持欧盟 AI 内容透明度实践准则,推进内容溯源标准与工具,帮助人们识别 AI 生成内容。该准则旨在确保可信的 AI 生态。
Google Research 在 AISTATS 2026 提出 Regularized f-Divergence Kernel Tests,用相对距离检验判断遗忘后的模型在分布上更接近安全重训模型还是原始受损模型。
Google DeepMind 联合 Schmidt Sciences、Cooperative AI Foundation、ARIA 并获 Google.org 支持,发起最高 1000 万美元的全球技术研究资助,聚焦大规模多智能体 AI 系统的群体行为与安全风险。
OpenAI 公布名为"Built to benefit everyone"的计划,提出以可及性、安全与共享繁荣为核心的 AI 未来愿景,目标是确保 AGI 惠及所有人。
OpenAI 发布《智能时代的生物防御》行动计划,主题为"AI 驱动的生物韧性"。该计划面向智能时代的生物安全挑战提出行动方案,具体措施与细节未在摘要信息中披露。
OpenAI 呼吁就青少年 AI 安全采取全球行动,提议设立一个国际机构,以加强针对青少年的防护措施、标准与机会。
OpenAI 封禁了一个疑似源自中国的账号集群,该集群利用 AI 生成批评美国数据中心和 AI 基础设施的社交媒体内容。这一行动被命名为“Data Center Bandwagon”campaign,针对美国开展影响力活动。
OpenAI 推出 Rosalind Biodefense,扩大 GPT-Rosalind 的可信访问范围,面向经过审核的开发者以及美国政府合作方。该计划用于生物防御、公共卫生和大流行病防范方向的前沿 AI 应用。
OpenAI 分享了一套针对第三方 AI 评估的指南,覆盖如何评估前沿系统的模型能力、防护措施与评估有效性。该指南面向前沿模型的第三方评测场景,强调评估的可信度。
OpenAI 发布 Frontier Governance Framework,说明其 AI 安全、安保与风险管理实践如何对齐欧盟和加州正在成形的法规。该框架聚焦前沿模型的治理与合规衔接。
Google 提出一种零信任隐私分析方案,将一次性提交的新型密码学聚合协议与 TEE 结合,使设备无需多轮在线即可安全上报数据。该设计保证 Google 只能获得群体匿名聚合结果,原始数据即使在硬件保护范围内也不会被解密或重建,TEE 证明则向参与者验证协议按公开代码正确执行。
OpenAI 正通过可靠信息、网络防御、AI 透明度、滥用防护和偏见监测等方式,为 2026 年选举提供支持。
Import AI 458 期由一篇基于演讲的长文和一个虚构故事组成,演讲为作者在牛津大学 HAI Lab 与 Cosmos Institute 合作举办的 2026 Cosmos HAI Lab Lecture。
OpenAI 推进 AI 内容溯源,采用 Content Credentials、SynthID 并推出验证工具,帮助人们识别和信任 AI 生成媒体。
Import AI 457 关注三件事:SentinelOne 拆解出约 20 年前的病毒 fast16.sys,它通过篡改 LS-DYNA 970、PKPM、MOHID 等高精度计算软件的内存结果来破坏工程与物理仿真。
OpenAI 为 ChatGPT 推出安全更新,提升其在敏感对话中的上下文感知能力,可随时间推移识别风险并做出更安全的回应。该更新聚焦于跨多轮对话的风险检测,而非单条消息判断。
OpenAI 就 TanStack“Mini Shai-Hulud”npm 供应链攻击发布回应,说明已采取的系统与签名证书保护措施,并要求 macOS 用户必须在 2026 年 6 月 12 日前更新 OpenAI 应用。文中还介绍了事件经过、受影响范围,以及 OpenAI 如何加强对软件供应链威胁的防御。
Institute for Law & AI 提出"激进可选性"监管思路,主张政府短期避免过度监管,同时建设信息收集、举报人保护、评估与人才等能力,为 AI 剧变保留政策工具。Meta 与 KAIST 的论文提出 Neural Computer,尝试用神经网络在学习到的运行时状态中统一计算、内存与 I/O。
OpenAI 扩展 Trusted Access for Cyber 计划,新增 GPT-5.5 和 GPT-5.5-Cyber,帮助经过验证的防御方加速漏洞研究并保护关键基础设施。
推荐理由:OpenAI 在网络安全场景扩展可信访问计划,读者可了解 GPT-5.5 系列面向防御方的开放范围。
OpenAI 为 ChatGPT 推出可选安全功能 Trusted Contact,当系统检测到严重的自残风险信号时,会通知用户指定的可信任联系人。该功能为可选项,由用户自行设置联系人。
OpenAI 发文说明 ChatGPT 如何在保护隐私的前提下学习世界知识:减少训练数据中的个人信息,并让用户自行控制对话是否用于改进 AI 模型。
OpenAI 发布欧洲青少年安全蓝图(European Youth Safety Blueprint)并设立 EMEA Youth & Wellbeing Grants,面向青少年、家庭与教育工作者推进安全、负责任的 AI 使用。
OpenAI 提出一项五部分行动计划,旨在加强智能时代的网络安全,重点是普及 AI 驱动的网络防御并保护关键系统。