OpenAI 封禁疑似中国来源账号:利用 AI 搜集美国人员信息与社工手法
OpenAI 封禁了一批疑似中国来源的账号,这些账号利用 AI 研究美国人员、地点及社会工程学手法。
OpenAI 封禁了一批疑似中国来源的账号,这些账号利用 AI 研究美国人员、地点及社会工程学手法。
OpenAI 封禁了一批与此前未披露、疑似俄罗斯来源的“No Bell”行动相关的账号,该行动利用 AI 面向非洲受众生成批评美国及其盟友的内容。
OpenAI 封禁了与一项此前未报告的行动相关的账号,该行动被其命名为“Trolling Stone”。该行动利用 AI 生成关于一名据称俄罗斯邪教领袖在阿根廷被捕的评论。
OpenAI 封禁了一批与 Rybar 网络关联的账号,其中部分账号可能源自俄罗斯,它们利用 AI 在网站和社交平台上开展多语言影响活动。
OpenAI 封禁了一个与中国执法部门相关人员关联的账号,该账号利用 AI 策划影响力活动、骚扰和网络行动。
OpenAI 封禁了一批很可能来自柬埔寨的账号,这些账号用 AI 冒充追损服务、律所和执法机构,目标是被诈骗过的人。该行动被命名为 Operation “False Witness”。
OpenAI 封禁了一批很可能源自柬埔寨的账号,这些账号利用 AI 对印尼交友用户实施诈骗,包括翻译和互动。该行动代号 "Date Bait",相关账号借助 AI 完成诈骗触达。
OpenAI 开放 EMEA Youth & Wellbeing Grant 申请,该项目总额 50 万欧元,用于资助非政府组织和研究人员,推进 AI 时代的青年安全与福祉。
OpenAI 说明了 AI 智能体打开链接时保护用户数据的机制,通过内置防护防止基于 URL 的数据外泄和提示词注入。
ChatGPT 正在推出年龄预测功能,用于判断账户是否未满 18 岁,并对青少年账户应用相应保护措施,准确率将随时间持续优化。
Hugging Face 发布 8B 参数安全护栏模型 AprielGuard,可检测 16 类安全风险及提示注入、越狱、思维链污染、记忆投毒、多智能体攻击等对抗攻击,并覆盖工具调用与推理轨迹等智能体工作流。模型提供推理与非推理两种模式,兼顾可解释分类与低延迟生产部署。训练数据由 Mixtral-8x7B 等合成生成,并借助 NVIDIA NeMo Curator 构建多轮对话攻击数据集。
OpenAI 正在用强化学习训练的自动化红队加固 ChatGPT Atlas,抵御提示词注入攻击。这一发现与修补的循环可提前识别新型攻击手法,在 AI 愈发智能体的趋势下强化浏览器智能体的防御。
OpenAI 推出针对思维链可监控性的新框架与评测套件,覆盖 24 种环境下的 13 项评估。结果显示,监控模型内部推理远比仅监控输出更有效,为 AI 系统能力提升后的可扩展控制提供了可行路径。
OpenAI 更新 Model Spec,新增 Under-18 Principles,规定 ChatGPT 应基于发展科学为青少年提供安全、适龄的引导。此次更新强化了防护栏,明确了模型在更高风险情境下的预期行为,并延续了 OpenAI 改善 ChatGPT 青少年安全的整体工作。
OpenAI 发布面向青少年与家长的 AI 素养资源,帮助其审慎、安全、自信地使用 ChatGPT。指南包含经专家审核的建议,涵盖负责任使用、批判性思维、健康边界,以及如何支持青少年应对情绪或敏感话题。
Google DeepMind 发布 Gemma Scope 2,一套覆盖 Gemma 3 全系列(270M 到 27B 参数)的开源可解释性工具,结合稀疏自编码器(SAEs)和 transcoders 查看模型内部计算。
推荐理由:Gemma Scope 2 覆盖 Gemma 3 全尺寸并新增跨层工具,读者可了解开源可解释性工具当前能审计哪些模型行为。
OpenAI 提出一套真实世界评估框架,用于衡量 AI 在湿实验室中加速生物学研究的能力,并用 GPT-5 优化分子克隆实验方案。该工作同时探讨了 AI 辅助实验的前景与风险。
Google DeepMind 宣布与英国 AI Security Institute(AISI)签署新谅解备忘录,将合作从模型测试扩展到基础安全与安全研究。双方将共享专有模型、数据与思路,并发布联合报告,重点研究 CoT 监控、社会情感错位及 AI 对经济系统的影响。该合作是 Google DeepMind 与英国政府推进安全 AI 整体协作的一部分。
OpenAI 发布 GPT-5 系统卡更新,将 GPT-5.2 纳入 GPT-5 系列,成为该系列最新模型家族。GPT-5.2 的综合安全缓解方案与 GPT-5 系统卡、GPT-5.1 系统卡中描述的基本一致。与 OpenAI 其他模型一样,GPT-5.2 的训练数据包括互联网公开信息、通过第三方合作获取的信息,以及用户或人类训练师与研究人员提供或生成的信息。
推荐理由:GPT-5.2 系统卡更新说明其安全缓解方案延续 GPT-5 与 GPT-5.1 的框架,可对照前代了解安全策略的连续性。
Google Research 在 COLM 2025 论文中提出 Urania 框架,通过 DP 聚类与 DP 关键词提取,从 LLM 聊天记录中生成带端到端差分隐私保证的使用洞察。该框架让 LLM 只基于匿名关键词生成摘要,不接触原始对话,从而抵御提示注入等泄露风险。评测中 DP 摘要被 LLM 评审偏好的比例最高达 70%,但隐私预算收紧会降低主题覆盖度。
OpenAI 正随着 AI 模型在网络安全领域能力增强而投入更强的防护措施与防御能力。公司说明了其如何评估风险、限制滥用,并与安全社区合作强化网络韧性。
OpenAI 研究人员正在测试一种名为"confessions"的方法,训练模型在犯错或做出不当行为时主动承认,以提升 AI 的诚实性、透明度以及人们对模型输出的信任。
OpenAI 拨款最高 200 万美元,资助 AI 与心理健康交叉领域的研究。该计划支持研究现实世界风险、收益与应用的项目,以提升安全性与福祉。
OpenAI 披露一起 Mixpanel 安全事件,涉及有限的 API 分析数据,但 API 内容、凭证和支付信息均未泄露。OpenAI 同时说明了事件经过及正在采取的用户保护措施。
OpenAI 与独立专家合作评估前沿 AI 系统,借助第三方测试来强化安全性、验证防护措施,并提升模型能力与风险评估的透明度。
OpenAI 发布 GPT-5.1-Codex-Max 系统卡,详述该模型的安全措施。模型层面包括针对有害任务和提示词注入的专项安全训练,产品层面则涵盖智能体沙箱与可配置网络访问。
OpenAI 正在探索机制可解释性,以理解神经网络如何进行推理。其提出的稀疏模型方法有望让 AI 系统更透明,并支持更安全、更可靠的行为。
OpenAI 发布 GPT-5 系统卡附录,给出 GPT-5.1 Instant 和 GPT-5.1 Thinking 的更新安全指标。附录还新增了针对心理健康与情感依赖的评估。
推荐理由:OpenAI 公布 GPT-5.1 Instant 与 Thinking 的安全指标更新,并新增心理健康与情感依赖评估。
OpenAI 将提示词注入定义为 AI 系统的前沿安全挑战,并说明这类攻击的运作方式。OpenAI 正从研究、模型训练和用户防护措施三方面推进应对。
OpenAI 发布青少年安全蓝图,为负责任地构建 AI 提供路线图,涵盖安全防护措施、适龄设计和多方协作,目标是保护并赋能青少年上网。
OpenAI 发文指出 AI 正在快速进步,人类有机会塑造其发展方向,使其走向科学发现、安全与更美好的未来。原文未披露具体模型、版本或技术细节。
OpenAI 推出 Aardvark,一个 AI 驱动的安全研究员,可自主大规模发现、验证并协助修复软件漏洞。该系统目前处于私有测试阶段,可通过报名参与早期测试。
Google 发布首个可证明隐私洞察(PPI)系统,结合 LLM、差分隐私(DP)与可信执行环境(TEE),分析非结构化的 GenAI 使用数据,保证个体数据不可被查看、聚合洞察匿名。
OpenAI 发布 gpt-oss-safeguard 技术报告,介绍 gpt-oss-safeguard-120b 和 gpt-oss-safeguard-20b 两个开放权重推理模型。二者基于 gpt-oss 模型后训练,能依据给定策略进行推理并对内容打标,报告同时给出以原 gpt-oss 模型为基线的安全评估结果。
OpenAI 发布 gpt-oss-safeguard,这是一组用于安全分类的开放权重推理模型。开发者可以应用并迭代自定义策略。
推荐理由:OpenAI 发布开放权重安全分类推理模型,开发者可据此了解自定义策略的应用方式。
Doppel 借助 GPT-5 与强化微调构建 AI 防御系统,用于拦截深度伪造与身份冒充攻击,将分析师工作量削减 80%,响应时间从数小时缩短至数天?不,原文是数分钟。
Hugging Face 提出“语音同意门”机制,让语音克隆模型只有在说话人明确说出同意语句后才会启动。该方案由语言模型生成约 20 词的同意句与中性语音多样性句,经 ASR 识别同意内容后,再由 TTS 完成克隆,并建议同意音频直接来自麦克风而非上传文件。团队已提供示例 Space 和配套代码。
OpenAI 与 170 多位心理健康专家合作,提升 ChatGPT 识别痛苦情绪、共情回应并引导用户寻求现实支持的能力,不安全回应最多减少 80%。OpenAI 表示此举旨在让 ChatGPT 在敏感时刻更安全、更具支持性。
推荐理由:OpenAI 与 170 多位心理健康专家合作改进 ChatGPT 在敏感对话中的回应,并给出不安全回应下降幅度。
OpenAI 发布 GPT-5 系统卡增补,说明 GPT-5 在处理敏感对话方面的改进。增补引入了情绪依赖、心理健康和越狱抵抗方面的新基准。
Hugging Face 宣布与威胁情报平台 VirusTotal 合作,即日起对 Hub 上 220 万+ 公开模型和数据集仓库进行持续扫描。用户访问仓库或文件页面时,Hub 会自动将文件哈希与 VirusTotal 威胁情报库比对,返回检测数量、已知恶意关联等元数据,且不共享原始文件内容。组织可将 VirusTotal 检查集成到 CI/CD 或部署流程中,在下载或集成文件前识别恶意资产。