OpenAI 用强化学习红队持续加固 ChatGPT Atlas 抵御提示词注入
OpenAI 正在用强化学习训练的自动化红队加固 ChatGPT Atlas,抵御提示词注入攻击。这一发现与修补的循环可提前识别新型攻击手法,在 AI 愈发智能体的趋势下强化浏览器智能体的防御。
OpenAI 正在用强化学习训练的自动化红队加固 ChatGPT Atlas,抵御提示词注入攻击。这一发现与修补的循环可提前识别新型攻击手法,在 AI 愈发智能体的趋势下强化浏览器智能体的防御。
OpenAI 推出针对思维链可监控性的新框架与评测套件,覆盖 24 种环境下的 13 项评估。结果显示,监控模型内部推理远比仅监控输出更有效,为 AI 系统能力提升后的可扩展控制提供了可行路径。
OpenAI 更新 Model Spec,新增 Under-18 Principles,规定 ChatGPT 应基于发展科学为青少年提供安全、适龄的引导。此次更新强化了防护栏,明确了模型在更高风险情境下的预期行为,并延续了 OpenAI 改善 ChatGPT 青少年安全的整体工作。
OpenAI 发布面向青少年与家长的 AI 素养资源,帮助其审慎、安全、自信地使用 ChatGPT。指南包含经专家审核的建议,涵盖负责任使用、批判性思维、健康边界,以及如何支持青少年应对情绪或敏感话题。
Google DeepMind 发布 Gemma Scope 2,一套覆盖 Gemma 3 全系列(270M 到 27B 参数)的开源可解释性工具,结合稀疏自编码器(SAEs)和 transcoders 查看模型内部计算。
推荐理由:Gemma Scope 2 覆盖 Gemma 3 全尺寸并新增跨层工具,读者可了解开源可解释性工具当前能审计哪些模型行为。
OpenAI 提出一套真实世界评估框架,用于衡量 AI 在湿实验室中加速生物学研究的能力,并用 GPT-5 优化分子克隆实验方案。该工作同时探讨了 AI 辅助实验的前景与风险。
Google DeepMind 宣布与英国 AI Security Institute(AISI)签署新谅解备忘录,将合作从模型测试扩展到基础安全与安全研究。双方将共享专有模型、数据与思路,并发布联合报告,重点研究 CoT 监控、社会情感错位及 AI 对经济系统的影响。该合作是 Google DeepMind 与英国政府推进安全 AI 整体协作的一部分。
OpenAI 发布 GPT-5 系统卡更新,将 GPT-5.2 纳入 GPT-5 系列,成为该系列最新模型家族。GPT-5.2 的综合安全缓解方案与 GPT-5 系统卡、GPT-5.1 系统卡中描述的基本一致。与 OpenAI 其他模型一样,GPT-5.2 的训练数据包括互联网公开信息、通过第三方合作获取的信息,以及用户或人类训练师与研究人员提供或生成的信息。
推荐理由:GPT-5.2 系统卡更新说明其安全缓解方案延续 GPT-5 与 GPT-5.1 的框架,可对照前代了解安全策略的连续性。
Google Research 在 COLM 2025 论文中提出 Urania 框架,通过 DP 聚类与 DP 关键词提取,从 LLM 聊天记录中生成带端到端差分隐私保证的使用洞察。该框架让 LLM 只基于匿名关键词生成摘要,不接触原始对话,从而抵御提示注入等泄露风险。评测中 DP 摘要被 LLM 评审偏好的比例最高达 70%,但隐私预算收紧会降低主题覆盖度。
OpenAI 正随着 AI 模型在网络安全领域能力增强而投入更强的防护措施与防御能力。公司说明了其如何评估风险、限制滥用,并与安全社区合作强化网络韧性。
OpenAI 研究人员正在测试一种名为"confessions"的方法,训练模型在犯错或做出不当行为时主动承认,以提升 AI 的诚实性、透明度以及人们对模型输出的信任。
OpenAI 拨款最高 200 万美元,资助 AI 与心理健康交叉领域的研究。该计划支持研究现实世界风险、收益与应用的项目,以提升安全性与福祉。
OpenAI 披露一起 Mixpanel 安全事件,涉及有限的 API 分析数据,但 API 内容、凭证和支付信息均未泄露。OpenAI 同时说明了事件经过及正在采取的用户保护措施。
OpenAI 与独立专家合作评估前沿 AI 系统,借助第三方测试来强化安全性、验证防护措施,并提升模型能力与风险评估的透明度。
OpenAI 发布 GPT-5.1-Codex-Max 系统卡,详述该模型的安全措施。模型层面包括针对有害任务和提示词注入的专项安全训练,产品层面则涵盖智能体沙箱与可配置网络访问。
OpenAI 正在探索机制可解释性,以理解神经网络如何进行推理。其提出的稀疏模型方法有望让 AI 系统更透明,并支持更安全、更可靠的行为。
OpenAI 发布 GPT-5 系统卡附录,给出 GPT-5.1 Instant 和 GPT-5.1 Thinking 的更新安全指标。附录还新增了针对心理健康与情感依赖的评估。
推荐理由:OpenAI 公布 GPT-5.1 Instant 与 Thinking 的安全指标更新,并新增心理健康与情感依赖评估。
OpenAI 将提示词注入定义为 AI 系统的前沿安全挑战,并说明这类攻击的运作方式。OpenAI 正从研究、模型训练和用户防护措施三方面推进应对。
OpenAI 发布青少年安全蓝图,为负责任地构建 AI 提供路线图,涵盖安全防护措施、适龄设计和多方协作,目标是保护并赋能青少年上网。
OpenAI 发文指出 AI 正在快速进步,人类有机会塑造其发展方向,使其走向科学发现、安全与更美好的未来。原文未披露具体模型、版本或技术细节。
OpenAI 推出 Aardvark,一个 AI 驱动的安全研究员,可自主大规模发现、验证并协助修复软件漏洞。该系统目前处于私有测试阶段,可通过报名参与早期测试。
Google 发布首个可证明隐私洞察(PPI)系统,结合 LLM、差分隐私(DP)与可信执行环境(TEE),分析非结构化的 GenAI 使用数据,保证个体数据不可被查看、聚合洞察匿名。
OpenAI 发布 gpt-oss-safeguard 技术报告,介绍 gpt-oss-safeguard-120b 和 gpt-oss-safeguard-20b 两个开放权重推理模型。二者基于 gpt-oss 模型后训练,能依据给定策略进行推理并对内容打标,报告同时给出以原 gpt-oss 模型为基线的安全评估结果。
OpenAI 发布 gpt-oss-safeguard,这是一组用于安全分类的开放权重推理模型。开发者可以应用并迭代自定义策略。
推荐理由:OpenAI 发布开放权重安全分类推理模型,开发者可据此了解自定义策略的应用方式。
Doppel 借助 GPT-5 与强化微调构建 AI 防御系统,用于拦截深度伪造与身份冒充攻击,将分析师工作量削减 80%,响应时间从数小时缩短至数天?不,原文是数分钟。
Hugging Face 提出“语音同意门”机制,让语音克隆模型只有在说话人明确说出同意语句后才会启动。该方案由语言模型生成约 20 词的同意句与中性语音多样性句,经 ASR 识别同意内容后,再由 TTS 完成克隆,并建议同意音频直接来自麦克风而非上传文件。团队已提供示例 Space 和配套代码。
OpenAI 与 170 多位心理健康专家合作,提升 ChatGPT 识别痛苦情绪、共情回应并引导用户寻求现实支持的能力,不安全回应最多减少 80%。OpenAI 表示此举旨在让 ChatGPT 在敏感时刻更安全、更具支持性。
推荐理由:OpenAI 与 170 多位心理健康专家合作改进 ChatGPT 在敏感对话中的回应,并给出不安全回应下降幅度。
OpenAI 发布 GPT-5 系统卡增补,说明 GPT-5 在处理敏感对话方面的改进。增补引入了情绪依赖、心理健康和越狱抵抗方面的新基准。
Hugging Face 宣布与威胁情报平台 VirusTotal 合作,即日起对 Hub 上 220 万+ 公开模型和数据集仓库进行持续扫描。用户访问仓库或文件页面时,Hub 会自动将文件哈希与 VirusTotal 威胁情报库比对,返回检测数量、已知恶意关联等元数据,且不共享原始文件内容。组织可将 VirusTotal 检查集成到 CI/CD 或部署流程中,在下载或集成文件前识别恶意资产。
OpenAI 成立健康与 AI 专家委员会,汇集心理学家、临床医生与研究人员,指导 ChatGPT 如何支持用户情感健康,尤其是青少年群体。该委员会的见解将用于塑造更安全、更有温度的 AI 体验。
OpenAI 发布新方法,用于定义和评估 ChatGPT 等 LLM 中的政治偏见。该方法采用新的真实世界测试手段,旨在提升客观性并减少偏见。
OpenAI 发布 2025 年 10 月报告,披露其如何检测和阻断 AI 的恶意使用。报告介绍了 OpenAI 打击滥用行为、执行政策以及保护用户免受现实世界伤害的做法。
OpenAI 封禁了一批与此前未被报道的、源自中国的行动相关的账号,该行动被其命名为 Nine-emdash Line。该行动利用 AI 生成围绕南海、香港和美国政治的区域影响力内容。
推荐理由:OpenAI 披露了一起此前未被报道的涉华影响力行动,读者可了解其针对议题与处置方式。
OpenAI 封禁了一批与俄罗斯来源行动"Stop News"相关的账号,该行动利用 AI 生成针对非洲和英国的影响力内容。OpenAI 称其为"惯犯"式影响力行动。
OpenAI 封禁了一批与 PRC 关联的账号,这些账号利用 AI 支持监控相关规划、定向画像,以及对批评者等个人的研究。
OpenAI 封禁了一批账号,其活动与公开报道的威胁组织存在重叠,并显示出符合中国情报需求的典型特征,利用 AI 支持网络钓鱼和脚本编写工作流。
OpenAI 封禁了一批可能与俄语犯罪团伙有关的账号,这些账号利用 AI 构建恶意软件加载器、规避层、凭证窃取脚本和 C2 基础设施。
OpenAI 封禁了一批与在线欺诈网络相关的账号,这些账号利用 AI 支持诈骗脚本、身份冒充、翻译和受害者互动。
OpenAI 封禁了一批韩语账户,这些账户利用 AI 进行恶意软件开发支持、调试、钓鱼和凭据窃取工作流。
OpenAI 发布 Sora 2 和 Sora 应用,称两者在构建时以安全为基础,以应对先进视频模型和新型社交创作平台带来的新安全挑战。OpenAI 表示其做法建立在具体防护措施之上。
推荐理由:OpenAI 说明 Sora 2 与 Sora 应用在安全机制上的设计思路,可了解视频模型与社交创作平台的安全考量。