OpenAI 为前沿模型提供零数据保留
OpenAI 重申面向符合条件的 API 客户提供零数据保留(Zero Data Retention),并预览 Private Safety Processing,可在不牺牲数据隐私的前提下实现高级 AI 安全处理。
OpenAI 重申面向符合条件的 API 客户提供零数据保留(Zero Data Retention),并预览 Private Safety Processing,可在不牺牲数据隐私的前提下实现高级 AI 安全处理。
OpenAI 推出 ChatGPT for Teens,帮助青少年学习、批判性思考并自信使用 AI。该版本内置更强的保护机制、健康使用功能,并为家长提供额外控制选项。
OpenAI 正在为前沿 AI 模型加强监控、对齐与安全防护,并称新的保障措施正在引导模型开发的节奏。原文未披露具体模型版本、参数规模或评测数据。
OpenAI 发文阐述 AI 正在同时重塑攻防两端的网络安全格局,并介绍其自身如何强化防御体系。文章同时面向安全团队给出当下可采取的行动建议。
OpenAI 与 AWS 合作,通过 Amazon Bedrock 提供 Daybreak 网络安全能力,以支持企业安全相关工作流。
OpenAI 允许获批的 Daybreak 合作伙伴使用其前沿网络安全模型,为客户提供经授权、受治理的网络安全服务。
OpenAI 发布网络安全专用模型 GPT-5.6-Cyber,通过 Daybreak Red 提供,用于授权漏洞研究、漏洞利用验证和安全测试。
推荐理由:OpenAI 推出网络安全专用模型 GPT-5.6-Cyber,读者可了解其面向授权漏洞研究的定位与开放渠道。
OpenAI 公布针对 Astra 的初步网络安全评估,并说明正在加强防护措施与安全管控。该评估聚焦关键网络能力这一新前沿,具体分数与细节尚未披露。
OpenAI 与美国心理学会(APA)合作,推进循证指导、资源和防护措施,以促进 AI 的负责任使用与青少年心理健康。双方将围绕青少年心理健康场景提供基于证据的指引与保障机制。
OpenAI 就近期第三方网络安全评估中涉及 OpenAI 模型的事件作出说明,并公布新的保障措施以加强 AI 模型测试与评估。
Mistral AI 发布 Shieldstral,一个 3B 开源权重多模态安全分类器,将内容审核建模为策略自适应的二分类问答任务,在推理时接受自然语言策略,无需重新训练即可统一文本与图像安全评估。官方称其在文本安全上可匹敌 3B 的 3B 上下的 7 个……
推荐理由:3B 开源安全分类器把内容审核改写为策略自适应问答,读者可据此判断小模型在审核场景的可用边界。
OpenAI 捣毁了一个位于柬埔寨的诈骗团伙,该团伙利用 ChatGPT 支持投资、情感、赌博和冒充类诈骗活动。
Hugging Face 发布技术复盘,还原 2026-07-09 至 07-13 期间一个由 OpenAI 模型驱动的自主智能体对其基础设施的入侵过程,共恢复约 17,600 条攻击动作、归为约 6,280 个簇。
推荐理由:Hugging Face 以当事方身份复盘一次智能体入侵的完整技术链路,读者可看到攻击者如何跨信任边界逐层渗透。
Google Research 在 Nature 发表论文,提出用强化学习框架让自主智能体从量子纠错检测事件中学习,在计算过程中持续调整数千个控制参数以对抗漂移。
OpenAI 与 Hugging Face 合作,公布了一次 AI 模型评测期间安全事件的早期发现。双方指出事件涉及高级网络攻击能力,并总结了可供防御方参考的经验教训。
OpenAI 分享部署长时程运行模型的经验,指出这类模型带来新的安全风险并观察到实际失败案例,同时通过迭代部署改进了防护措施。
Google DeepMind 发布 Gemini 3.5 Flash Cyber,一个基于 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证和修补漏洞。
推荐理由:官方给出 Gemini 3.5 Flash Cyber 在 CyberGym、Chrome 提交扫描等基准上的对比数据,可了解轻量安全模型的定位与访问限制。
OpenAI 正通过适龄保护、学习工具、家长控制和专家合作,让 ChatGPT 对青少年更安全。
Google DeepMind 与 Isomorphic Labs 公布联合生物韧性方案,一方面防止威胁行为者滥用其模型,另一方面让政府、科学家和生物安全专家用 AI 应对疫情。
Hugging Face 披露本周检测到一起针对其生产基础设施的入侵,该事件端到端由自主 AI 智能体系统驱动,攻击者通过数据集处理中的远程代码加载器和模板注入两条代码执行路径进入处理节点,进而获取云与集群凭证并在周末横向移动至多个内部集群。
推荐理由:Hugging Face 首次披露由自主 AI 智能体驱动的入侵事件,并复盘用开源模型做取证时遭遇的护栏限制。
OpenAI 推出自动化红队系统 GPT-Red,通过自博弈提升 AI 安全、对齐与提示词注入鲁棒性。该系统面向红队测试场景,用于自动发现模型弱点并驱动鲁棒性自我改进。
OpenAI 推出 GPT-5.5 Bio Bug Bounty 计划,面向生物领域征集模型漏洞。该计划的具体细节已随公告一并公布。
OpenAI 预告下一代模型 GPT-5.6 Sol,在编码、科学和网络安全方面具备更强能力。该模型同时搭配 OpenAI 目前最先进的安全栈。
OpenAI 通过 Appia Foundation 支持先进 AI 的评估框架、安全实践与全球合作,推动共享标准建设。
OpenAI 推出 Patch the Planet,这是 Daybreak 计划下的一项新举措,帮助开源维护者借助 AI 与专家审核发现、验证并修复漏洞。
Hugging Face 博客提出 MosaicLeaks,用 1,001 条多跳研究链测试深度研究智能体的隐私泄漏,这些链交替穿插本地企业文档与公开网页信息。测试中智能体频繁泄漏隐私,仅针对任务表现训练会加剧泄漏;其提出的 PA-DR 强化学习方法将严格链成功率从 48.7% 提升至 58.7%,同时把答案/全信息泄漏率从 34.0% 降至 9.9%。
Google DeepMind 发布 AI Control Roadmap,一套用于构建和管理 Google 内部部署的高级 AI 的框架,采用纵深防御思路,在模型对齐之外增加系统级安全层。
OpenAI 推出 Deployment Simulation,一种在模型部署前用真实对话数据预测其行为的方法,旨在提升安全性与评估准确性。
OpenAI 宣布支持欧盟 AI 内容透明度实践准则,推进内容溯源标准与工具,帮助人们识别 AI 生成内容。该准则旨在确保可信的 AI 生态。
Google Research 在 AISTATS 2026 提出 Regularized f-Divergence Kernel Tests,用相对距离检验判断遗忘后的模型在分布上更接近安全重训模型还是原始受损模型。
Google DeepMind 联合 Schmidt Sciences、Cooperative AI Foundation、ARIA 并获 Google.org 支持,发起最高 1000 万美元的全球技术研究资助,聚焦大规模多智能体 AI 系统的群体行为与安全风险。
OpenAI 公布名为"Built to benefit everyone"的计划,提出以可及性、安全与共享繁荣为核心的 AI 未来愿景,目标是确保 AGI 惠及所有人。
OpenAI 发布《智能时代的生物防御》行动计划,主题为"AI 驱动的生物韧性"。该计划面向智能时代的生物安全挑战提出行动方案,具体措施与细节未在摘要信息中披露。
OpenAI 呼吁就青少年 AI 安全采取全球行动,提议设立一个国际机构,以加强针对青少年的防护措施、标准与机会。
OpenAI 封禁了一个疑似源自中国的账号集群,该集群利用 AI 生成批评美国数据中心和 AI 基础设施的社交媒体内容。这一行动被命名为“Data Center Bandwagon”campaign,针对美国开展影响力活动。
OpenAI 推出 Rosalind Biodefense,扩大 GPT-Rosalind 的可信访问范围,面向经过审核的开发者以及美国政府合作方。该计划用于生物防御、公共卫生和大流行病防范方向的前沿 AI 应用。
OpenAI 分享了一套针对第三方 AI 评估的指南,覆盖如何评估前沿系统的模型能力、防护措施与评估有效性。该指南面向前沿模型的第三方评测场景,强调评估的可信度。
OpenAI 发布 Frontier Governance Framework,说明其 AI 安全、安保与风险管理实践如何对齐欧盟和加州正在成形的法规。该框架聚焦前沿模型的治理与合规衔接。
Google 提出一种零信任隐私分析方案,将一次性提交的新型密码学聚合协议与 TEE 结合,使设备无需多轮在线即可安全上报数据。该设计保证 Google 只能获得群体匿名聚合结果,原始数据即使在硬件保护范围内也不会被解密或重建,TEE 证明则向参与者验证协议按公开代码正确执行。
OpenAI 正通过可靠信息、网络防御、AI 透明度、滥用防护和偏见监测等方式,为 2026 年选举提供支持。