OpenAI 推进内容溯源:Content Credentials、SynthID 与验证工具
OpenAI 推进 AI 内容溯源,采用 Content Credentials、SynthID 并推出验证工具,帮助人们识别和信任 AI 生成媒体。
OpenAI 推进 AI 内容溯源,采用 Content Credentials、SynthID 并推出验证工具,帮助人们识别和信任 AI 生成媒体。
OpenAI 为 ChatGPT 推出安全更新,提升其在敏感对话中的上下文感知能力,可随时间推移识别风险并做出更安全的回应。该更新聚焦于跨多轮对话的风险检测,而非单条消息判断。
OpenAI 就 TanStack“Mini Shai-Hulud”npm 供应链攻击发布回应,说明已采取的系统与签名证书保护措施,并要求 macOS 用户必须在 2026 年 6 月 12 日前更新 OpenAI 应用。文中还介绍了事件经过、受影响范围,以及 OpenAI 如何加强对软件供应链威胁的防御。
OpenAI 扩展 Trusted Access for Cyber 计划,新增 GPT-5.5 和 GPT-5.5-Cyber,帮助经过验证的防御方加速漏洞研究并保护关键基础设施。
推荐理由:OpenAI 在网络安全场景扩展可信访问计划,读者可了解 GPT-5.5 系列面向防御方的开放范围。
OpenAI 为 ChatGPT 推出可选安全功能 Trusted Contact,当系统检测到严重的自残风险信号时,会通知用户指定的可信任联系人。该功能为可选项,由用户自行设置联系人。
OpenAI 发文说明 ChatGPT 如何在保护隐私的前提下学习世界知识:减少训练数据中的个人信息,并让用户自行控制对话是否用于改进 AI 模型。
OpenAI 发布欧洲青少年安全蓝图(European Youth Safety Blueprint)并设立 EMEA Youth & Wellbeing Grants,面向青少年、家庭与教育工作者推进安全、负责任的 AI 使用。
OpenAI 提出一项五部分行动计划,旨在加强智能时代的网络安全,重点是普及 AI 驱动的网络防御并保护关键系统。
OpenAI 发文说明其在 ChatGPT 中保障社区安全的方式,涵盖模型防护、滥用检测、政策执行以及与安全专家的合作。
Hugging Face 发文讨论 Mythos 与 Project Glasswing 发布后 AI 网络安全格局,指出 Mythos 的漏洞发现与修补能力来自模型、算力、安全脚手架与自主性组成的系统配方,而非单一模型。文章认为开源代码与工具能分散检测、验证、协调、补丁传播四个环节,避免闭源单点故障,并主张采用半自主 AI 智能体在人类可控前提下进行防御。
OpenAI 面向安全厂商和企业推出 Trusted Access for Cyber 计划,参与者可使用 GPT-5.4-Cyber 并获得 1000 万美元 API 额度支持,用于强化全球网络防御。
OpenAI 扩展 Trusted Access for Cyber 计划,向经过审核的防御者推出 GPT-5.4-Cyber,并随 AI 网络安全能力提升强化防护措施。
OpenAI 就 Axios 供应链攻击作出回应,已轮换 macOS 代码签名证书并更新应用,同时确认没有用户数据遭到泄露。
OpenAI 发布 AI 负责任与安全使用指南,围绕安全、准确性和透明度给出最佳实践,适用于 ChatGPT 等工具的使用场景。
OpenAI 发布 Child Safety Blueprint,一份为负责任构建 AI 提供路线图的蓝图,涵盖安全防护措施、适龄设计和多方协作,目标是保护并赋能年轻人在线体验。
OpenAI 推出试点项目 OpenAI Safety Fellowship,用于支持独立的安全与对齐研究,并培养下一代人才。该项目为试点性质,具体规模、资助金额与申请细节尚未在公告中披露。
Google Research 提出一套框架,用改编自 IRI、ERQ 等心理学问卷的情境判断测试(SJT)评估 LLM 行为倾向与人类的一致性,覆盖 25 个 LLM。结果显示,模型规模超过 120B 及前沿闭源模型在人类标注者一致时接近完美对齐,但共识低于 90% 时对齐率停滞在 80% 出头;模型还在职场场景中倾向情绪外露、在社交争端中偏好和谐而非坚持立场。
Google Quantum AI 发布白皮书,称未来量子计算机破解加密货币所依赖的 ECDLP-256 所需的物理量子比特比此前估计少约 20 倍。
推荐理由:Google 用量子资源估算与零知识证明披露方式,给出区块链迁移 PQC 的时间压力与路径参考。
Google DeepMind 发布关于 AI 有害操纵的新研究,称其构建了首个经实证验证的工具包,用于在真实场景中测量这类 AI 操纵,并公开了开展同类人类参与者研究所需的全部材料。
OpenAI 阐述 Model Spec 如何作为公开框架规范模型行为,在 AI 系统演进中平衡安全、用户自由与问责。该框架面向公众开放,用于指导模型行为准则。
OpenAI 推出 Safety Bug Bounty 安全漏洞赏金计划,用于识别 AI 滥用与安全风险。该计划覆盖的范围包括智能体漏洞、提示词注入和数据外泄。
推荐理由:OpenAI 把智能体漏洞、提示词注入和数据外泄纳入漏洞赏金范围,读者可了解其安全风险覆盖边界。
OpenAI 面向使用 gpt-oss-safeguard 的开发者发布基于提示词的青少年安全策略,用于审核 AI 系统中与年龄相关的风险。该策略以提示词形式提供,帮助开发者按青少年场景定制内容审核规则。
OpenAI 为 Sora 2 视频模型和 Sora 社交创作应用构建了以安全为基础的设计,以应对二者带来的新型安全挑战。其方法以具体防护措施为支撑。
OpenAI 采用链式思维监控(chain-of-thought monitoring)研究内部编码智能体的失准问题,通过分析真实部署环境来检测风险并强化 AI 安全保障措施。
OpenAI Japan 发布日本青少年安全蓝图,为使用生成式 AI 的青少年引入更严格的年龄保护、家长控制和身心健康保障措施。
Codex Security 不依赖传统 SAST,而是用 AI 驱动的约束推理与验证来发现真实漏洞,减少误报。该文深入解析了这一设计取舍的原因。
伯克利 AI 研究团队提出 SPEX 与 ProxySPEX 算法,可在特征、数据和模型组件归因中大规模识别关键交互。SPEX 利用稀疏性与低阶性将交互搜索转化为稀疏恢复问题,ProxySPEX 进一步借助层级结构,以约少 10 倍的消融次数达到 SPEX 的性能。在情感分析任务上,SPEX 在上下文扩展至数千特征时仍保持高忠实度,优于 LIME、Banzhaf 等边际方法。
Google Research 与 Beth Israel Deaconess Medical Center 合作开展前瞻性单中心可行性研究,让 AMIE 在门诊初诊前与患者进行文本问诊,全程由医生通过视频监督。
推荐理由:Google 与 BIDMC 的这项前瞻性研究给出了 AMIE 在真实门诊中零安全中止、诊断与基层医生相当的具体数据,可了解对话式医疗 AI 落地临床的可行性与边界。
OpenAI 分享了 ChatGPT 抵御提示词注入与社会工程攻击的设计思路:通过约束智能体工作流中的高风险操作、保护敏感数据来降低风险。
OpenAI 推出 IH-Challenge,用于训练模型优先执行可信指令,提升指令层级、安全可控性以及对提示词注入攻击的抵抗力。
OpenAI 宣布收购 AI 安全平台 Promptfoo。该平台帮助企业在开发阶段识别并修复 AI 系统中的漏洞。
推荐理由:OpenAI 收购 AI 安全平台 Promptfoo,读者可了解其在 AI 系统开发环节的安全布局。
OpenAI 发布 AI 应用安全智能体 Codex Security,进入研究预览阶段。该工具通过分析项目上下文来检测、验证并修补复杂漏洞,官方称其置信度更高、噪声更少。
OpenAI 提出 CoT-Control,发现推理模型难以控制自己的思维链,这一结果支持将可监控性作为 AI 安全防护手段。材料仅提供摘要,未给出具体模型、评测指标或实验细节。
推荐理由:OpenAI 提出 CoT-Control 并给出推理模型难以控制思维链的观察,为可监控性作为安全手段提供了依据。
OpenAI 公布其心理健康安全工作的多项更新,包括家长控制、可信联系人、改进的痛苦识别能力,以及近期诉讼方面的进展。
OpenAI 最新威胁报告分析了恶意行为者如何将 AI 模型与网站、社交平台结合使用,以及这对检测与防御意味着什么。报告聚焦于这类组合式滥用手法的识别与应对。
OpenAI 承诺向 The Alignment Project 投入 750 万美元,用于资助独立的 AI 对齐研究。该资金旨在加强全球应对 AGI 安全与安保风险的努力。
OpenAI 与 Paradigm 联合推出 EVMbench,用于评估 AI 智能体检测、修补和利用高危智能合约漏洞的能力。该基准聚焦高严重性漏洞的发现、修复与攻击三类任务。
OpenAI 在 ChatGPT 中推出 Lockdown Mode 和 Elevated Risk 标签,帮助组织防御提示词注入和 AI 驱动的数据外泄。
推荐理由:OpenAI 为 ChatGPT 新增 Lockdown Mode 与 Elevated Risk 标签,面向企业防御提示词注入和数据外泄。
OpenAI 推出 Trusted Access for Cyber,一个基于信任的框架,在扩大前沿网络安全能力访问权限的同时加强对滥用的防护。
Google 宣布与 Included Health 合作,待 IRB 批准后启动一项全国性前瞻性随机对照研究,评估对话式 AI 在真实虚拟诊疗工作流中的表现。
推荐理由:Google 与 Included Health 将开展全国性随机对照研究,读者可了解对话式 AI 进入真实虚拟诊疗的评估路径。