OpenAI 如何通过模型防护与滥用检测保障 ChatGPT 社区安全
OpenAI 发文说明其在 ChatGPT 中保障社区安全的方式,涵盖模型防护、滥用检测、政策执行以及与安全专家的合作。
OpenAI 发文说明其在 ChatGPT 中保障社区安全的方式,涵盖模型防护、滥用检测、政策执行以及与安全专家的合作。
Hugging Face 发文讨论 Mythos 与 Project Glasswing 发布后 AI 网络安全格局,指出 Mythos 的漏洞发现与修补能力来自模型、算力、安全脚手架与自主性组成的系统配方,而非单一模型。文章认为开源代码与工具能分散检测、验证、协调、补丁传播四个环节,避免闭源单点故障,并主张采用半自主 AI 智能体在人类可控前提下进行防御。
OpenAI 面向安全厂商和企业推出 Trusted Access for Cyber 计划,参与者可使用 GPT-5.4-Cyber 并获得 1000 万美元 API 额度支持,用于强化全球网络防御。
OpenAI 扩展 Trusted Access for Cyber 计划,向经过审核的防御者推出 GPT-5.4-Cyber,并随 AI 网络安全能力提升强化防护措施。
OpenAI 就 Axios 供应链攻击作出回应,已轮换 macOS 代码签名证书并更新应用,同时确认没有用户数据遭到泄露。
OpenAI 发布 AI 负责任与安全使用指南,围绕安全、准确性和透明度给出最佳实践,适用于 ChatGPT 等工具的使用场景。
OpenAI 发布 Child Safety Blueprint,一份为负责任构建 AI 提供路线图的蓝图,涵盖安全防护措施、适龄设计和多方协作,目标是保护并赋能年轻人在线体验。
OpenAI 推出试点项目 OpenAI Safety Fellowship,用于支持独立的安全与对齐研究,并培养下一代人才。该项目为试点性质,具体规模、资助金额与申请细节尚未在公告中披露。
Google Research 提出一套框架,用改编自 IRI、ERQ 等心理学问卷的情境判断测试(SJT)评估 LLM 行为倾向与人类的一致性,覆盖 25 个 LLM。结果显示,模型规模超过 120B 及前沿闭源模型在人类标注者一致时接近完美对齐,但共识低于 90% 时对齐率停滞在 80% 出头;模型还在职场场景中倾向情绪外露、在社交争端中偏好和谐而非坚持立场。
Google Quantum AI 发布白皮书,称未来量子计算机破解加密货币所依赖的 ECDLP-256 所需的物理量子比特比此前估计少约 20 倍。
推荐理由:Google 用量子资源估算与零知识证明披露方式,给出区块链迁移 PQC 的时间压力与路径参考。
Google DeepMind 发布关于 AI 有害操纵的新研究,称其构建了首个经实证验证的工具包,用于在真实场景中测量这类 AI 操纵,并公开了开展同类人类参与者研究所需的全部材料。
OpenAI 阐述 Model Spec 如何作为公开框架规范模型行为,在 AI 系统演进中平衡安全、用户自由与问责。该框架面向公众开放,用于指导模型行为准则。
OpenAI 推出 Safety Bug Bounty 安全漏洞赏金计划,用于识别 AI 滥用与安全风险。该计划覆盖的范围包括智能体漏洞、提示词注入和数据外泄。
推荐理由:OpenAI 把智能体漏洞、提示词注入和数据外泄纳入漏洞赏金范围,读者可了解其安全风险覆盖边界。
OpenAI 面向使用 gpt-oss-safeguard 的开发者发布基于提示词的青少年安全策略,用于审核 AI 系统中与年龄相关的风险。该策略以提示词形式提供,帮助开发者按青少年场景定制内容审核规则。
OpenAI 为 Sora 2 视频模型和 Sora 社交创作应用构建了以安全为基础的设计,以应对二者带来的新型安全挑战。其方法以具体防护措施为支撑。
OpenAI 采用链式思维监控(chain-of-thought monitoring)研究内部编码智能体的失准问题,通过分析真实部署环境来检测风险并强化 AI 安全保障措施。
OpenAI Japan 发布日本青少年安全蓝图,为使用生成式 AI 的青少年引入更严格的年龄保护、家长控制和身心健康保障措施。
Codex Security 不依赖传统 SAST,而是用 AI 驱动的约束推理与验证来发现真实漏洞,减少误报。该文深入解析了这一设计取舍的原因。
伯克利 AI 研究团队提出 SPEX 与 ProxySPEX 算法,可在特征、数据和模型组件归因中大规模识别关键交互。SPEX 利用稀疏性与低阶性将交互搜索转化为稀疏恢复问题,ProxySPEX 进一步借助层级结构,以约少 10 倍的消融次数达到 SPEX 的性能。在情感分析任务上,SPEX 在上下文扩展至数千特征时仍保持高忠实度,优于 LIME、Banzhaf 等边际方法。
Google Research 与 Beth Israel Deaconess Medical Center 合作开展前瞻性单中心可行性研究,让 AMIE 在门诊初诊前与患者进行文本问诊,全程由医生通过视频监督。
推荐理由:Google 与 BIDMC 的这项前瞻性研究给出了 AMIE 在真实门诊中零安全中止、诊断与基层医生相当的具体数据,可了解对话式医疗 AI 落地临床的可行性与边界。
OpenAI 分享了 ChatGPT 抵御提示词注入与社会工程攻击的设计思路:通过约束智能体工作流中的高风险操作、保护敏感数据来降低风险。
OpenAI 推出 IH-Challenge,用于训练模型优先执行可信指令,提升指令层级、安全可控性以及对提示词注入攻击的抵抗力。
OpenAI 宣布收购 AI 安全平台 Promptfoo。该平台帮助企业在开发阶段识别并修复 AI 系统中的漏洞。
推荐理由:OpenAI 收购 AI 安全平台 Promptfoo,读者可了解其在 AI 系统开发环节的安全布局。
OpenAI 发布 AI 应用安全智能体 Codex Security,进入研究预览阶段。该工具通过分析项目上下文来检测、验证并修补复杂漏洞,官方称其置信度更高、噪声更少。
OpenAI 提出 CoT-Control,发现推理模型难以控制自己的思维链,这一结果支持将可监控性作为 AI 安全防护手段。材料仅提供摘要,未给出具体模型、评测指标或实验细节。
推荐理由:OpenAI 提出 CoT-Control 并给出推理模型难以控制思维链的观察,为可监控性作为安全手段提供了依据。
OpenAI 公布其心理健康安全工作的多项更新,包括家长控制、可信联系人、改进的痛苦识别能力,以及近期诉讼方面的进展。
OpenAI 最新威胁报告分析了恶意行为者如何将 AI 模型与网站、社交平台结合使用,以及这对检测与防御意味着什么。报告聚焦于这类组合式滥用手法的识别与应对。
OpenAI 承诺向 The Alignment Project 投入 750 万美元,用于资助独立的 AI 对齐研究。该资金旨在加强全球应对 AGI 安全与安保风险的努力。
OpenAI 与 Paradigm 联合推出 EVMbench,用于评估 AI 智能体检测、修补和利用高危智能合约漏洞的能力。该基准聚焦高严重性漏洞的发现、修复与攻击三类任务。
OpenAI 在 ChatGPT 中推出 Lockdown Mode 和 Elevated Risk 标签,帮助组织防御提示词注入和 AI 驱动的数据外泄。
推荐理由:OpenAI 为 ChatGPT 新增 Lockdown Mode 与 Elevated Risk 标签,面向企业防御提示词注入和数据外泄。
OpenAI 推出 Trusted Access for Cyber,一个基于信任的框架,在扩大前沿网络安全能力访问权限的同时加强对滥用的防护。
Google 宣布与 Included Health 合作,待 IRB 批准后启动一项全国性前瞻性随机对照研究,评估对话式 AI 在真实虚拟诊疗工作流中的表现。
推荐理由:Google 与 Included Health 将开展全国性随机对照研究,读者可了解对话式 AI 进入真实虚拟诊疗的评估路径。
OpenAI 封禁了一批疑似中国来源的账号,这些账号利用 AI 研究美国人员、地点及社会工程学手法。
OpenAI 封禁了一批与此前未披露、疑似俄罗斯来源的“No Bell”行动相关的账号,该行动利用 AI 面向非洲受众生成批评美国及其盟友的内容。
OpenAI 封禁了与一项此前未报告的行动相关的账号,该行动被其命名为“Trolling Stone”。该行动利用 AI 生成关于一名据称俄罗斯邪教领袖在阿根廷被捕的评论。
OpenAI 封禁了一批与 Rybar 网络关联的账号,其中部分账号可能源自俄罗斯,它们利用 AI 在网站和社交平台上开展多语言影响活动。
OpenAI 封禁了一个与中国执法部门相关人员关联的账号,该账号利用 AI 策划影响力活动、骚扰和网络行动。
OpenAI 封禁了一批很可能来自柬埔寨的账号,这些账号用 AI 冒充追损服务、律所和执法机构,目标是被诈骗过的人。该行动被命名为 Operation “False Witness”。
OpenAI 封禁了一批很可能源自柬埔寨的账号,这些账号利用 AI 对印尼交友用户实施诈骗,包括翻译和互动。该行动代号 "Date Bait",相关账号借助 AI 完成诈骗触达。
OpenAI 开放 EMEA Youth & Wellbeing Grant 申请,该项目总额 50 万欧元,用于资助非政府组织和研究人员,推进 AI 时代的青年安全与福祉。