Sophos 借助 OpenAI Daybreak 将威胁调查时间缩短 96%
Sophos 使用 OpenAI 的 Daybreak 将网络威胁调查时间缩短 96%,并自动化处理 52% 的 MDR 案例,同时保留人工监督。
Sophos 使用 OpenAI 的 Daybreak 将网络威胁调查时间缩短 96%,并自动化处理 52% 的 MDR 案例,同时保留人工监督。
OpenAI 打击了两起利用 AI 的影响力行动,这些行动通过虚假门面的记者和一家智库传播地缘政治信息。
Amazon Quick 和 Amazon Bedrock Knowledge Bases 通过两阶段实时 ACL 校验解决 RAG 权限难题:先用索引内缓存 ACL 做预检索过滤,再在查询时调用 Google Drive 等权威源 API 实时核验候选文档,仅将已授权内容传给 LLM。
GitHub 发布与 Microsoft Applied Sciences 合作微调的 ModernBERT 密钥分类器,能在 2 毫秒内评估一批候选密钥,使可拦截的密钥数量翻倍以上。
推荐理由:原文用九个季度数据拆解了泄露密钥随代码量增长的成因,并给出新模型如何在推送环节拦截,读者可据此理解平台侧防护的思路转变。
AWS 通过解读国际标准 ISO/IEC 42005:2025,帮助客户将 AI 系统影响评估整合进企业治理体系。该标准提供评估全生命周期指导,其 Annex D 支持与既有风险、隐私等评估流程整合以避免重复,Annex E 提供独立评估模板。
Z.ai(智谱 AI)的 GLM 5.3 现已上线 Amazon Bedrock,这是一款 753B 参数 MoE 模型,面向编码与长程智能体任务,可通过全托管 API 使用,支持跨区域推理、prompt caching 和服务层级。
推荐理由:原文给出接入方式、缓存配置和完整实测流程,可直接照做部署与成本优化。
Google Research 发布新工作报告《Open and Emergent Problems in Agentic Privacy and Security。
OpenAI 介绍了其在 EU 文本溯源规则下推进文本水印的思路,说明水印适用范围、检测方式,以及为何先向研究人员开放访问。
Google 宣布推出基于可信执行环境(TEE)的新一代联邦学习系统,为数据匿名化提供可远程验证和审计的保证,Gboard 已采用该系统上线英语和日语下一词预测模型。
推荐理由:Google 公布基于 TEE 的新一代联邦学习系统设计,并给出 Gboard 已上线的落地情况,可了解隐私可验证训练的一种工程路径。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御者开放,随后将逐步面向开发者、企业和消费者推出,起步价为每百万输入 token 2 美元、每百万输出 token 10 美元。
推荐理由:Gemini 4 Argon 的 1M 输出 token 与多项基准成绩,展示了长程复杂任务上的能力边界变化。
Google DeepMind 推出 SynthID Bio,将水印技术引入合成生物学,把不可感知的签名直接嵌入生物代码,使其在数字模型和合成出的实体蛋白质上均可验证,同时保持生物功能。
推荐理由:原文给出了水印嵌入方式与湿实验验证结果,读者可据此判断AI生成生物设计的溯源路径。
OpenAI 披露其阻断了一起试图提取受保护模型推理的协同行动,并正在加强对对抗性蒸馏的防御。原文未提供该行动的具体规模、涉及模型或技术细节。
Hugging Face 博客介绍论文 ProvenanceGuard,一个面向 MCP 智能体的生成后验证层,专门检测"跨来源混淆"——即事实在证据池中为真、却被归给错误来源。在 281 条医疗智能体真实 trace 上,专家判定 361 条 claim 中 139 条不应通过,ProvenanceGuard 拦下 138 条,并在可识别来源的 claim 上约 86% 选对来源。
OpenAI 就涉及澳大利亚政府网站的 AI 事件致歉,并公布更严格的防护措施与支持计划,以加强澳大利亚的网络防御能力。
OpenAI 公布前沿 AI 训练安全案例的早期指南,涵盖技术防护措施、运营实践以及失准事件调查三方面。该指南面向前沿 AI 训练环节的安全论证,目前处于早期阶段。
Google Private AI Compute 团队公布为 Private AI Compute 平台引入私有服务端记忆,让 AI 助手在跨设备场景下保留上下文,同时维持设备端级别的隐私标准。
推荐理由:原文说明了云端持久记忆如何用设备侧密钥与安全隔区实现跨设备连续性,读者可据此理解隐私架构的取舍。
OpenAI 宣布将 Daybreak 项目访问权限扩展至乌克兰政府,用于支持民用基础设施的网络防御。
OpenAI CEO Sam Altman 在联合国安理会发表讲话,讨论 AI 安全、人类控制与国际合作。
OpenAI 发布 MentalHealthBench,一个由专家参与构建的基准,用于评估 AI 在真实心理健康对话中回复是否有帮助且安全。该基准覆盖多种现实心理健康对话场景,从有用性和安全性两个维度衡量模型表现。
英国 AI Security Institute(AISI)正通过 EvalEval 的 Evaluation Cards 公开分享评测方法与结果,覆盖 HealthBench。
OpenAI 阐述了针对前沿模型与防护措施的第三方 AI 安全评估的优先事项与原则,强调评估需严谨、安全且独立。
NVIDIA 推出 Halos,称其为首个也是唯一面向物理 AI 的全栈安全系统,覆盖设计、验证与部署各层。
NVIDIA 提出 AI 安全应作为工程问题处理,需要明确的安全需求、可执行的管控、指定负责人和防护有效的证据。其开源安全运行时 NVIDIA OpenShell 在智能体之外强制执行策略并提供沙箱化执行,Cisco DefenseClaw 在其上增加治理层,JFrog 则集成 OpenShell 扫描和验证智能体技能。
OpenAI 正与一个独立的数学与人工智能咨询小组合作,用于指导新兴 AI 成果的评审与传播。该小组为独立性质,具体成员与运作细节未披露。
OpenAI 提出为下一阶段 AI 建立共享全球标准的路径,呼吁通过协调一致的评估、报告与治理来提升安全性。
OpenAI 发布澳大利亚青少年安全蓝图,这是一份包含六大支柱的路线图,旨在打造更安全的 AI 体验,以保护和赋能年轻人。
OpenAI 发布一套用于追踪、调查和披露模型失准(model misalignment)的框架,并同时公布六份关于模型意外或令人担忧行为的报告。
推荐理由:OpenAI 公开模型失准的追踪与披露框架,并附六份异常行为报告,可了解其安全披露机制。
Paul Christiano 加入 OpenAI Foundation 董事会,同时进入其安全与安保委员会。他在 AI 对齐、安全与标准方面拥有相关经验。
OpenAI 的 Chris Lehane 主张,AI 能力越强,越需要更强的安全证据、共享标准和持久的政策行动,而当前政策窗口仍然敞开。他呼吁抓住这一窗口期推动落地。
OpenAI 开放申请一项 500 万美元资助计划,支持关于生成式 AI 如何影响青少年发展、福祉与安全的独立研究。
OpenAI 的 Jakub Pachocki 反思了能力不断增强的 AI 以及让其保持对齐的难题,呼吁加强安全保障并推动国际协调。
OpenAI 推出 Daybreak for Frontline Defenders,并承诺投入 10 亿美元,用于扩大前沿网络安全 AI 的访问权限、培训与支持,面向关键服务领域。
OpenAI 发布 GPT-6 Astra 安全概览,称其是已广泛部署的最强模型,也是首个在 Preparedness Framework 下达到网络安全能力 Critical 级别的模型。
推荐理由:OpenAI 首次公开 GPT-6 Astra 在 Preparedness Framework 下达到网络安全关键等级,读者可了解其能力定位与安全评估口径。
Google DeepMind 推出 Fairwind Program,面向 Google Cloud 客户、政府机构和网络安全合作伙伴提供受限访问,首批开放其最先进的网络模型 Gemini 3.8 Flash Cyber 与 CodeMender 工具链,用于自主发现、验证并修复漏洞。
推荐理由:原文给出了面向政府和企业的受限访问计划与配套模型组合,读者可了解其准入范围与责任约束。
Google DeepMind 发布 Gemini 3.8,包含通用模型 Gemini 3.8 Flash 和网络安全模型 Gemini 3.8 Flash Cyber,定价与 3.7 Flash 相同,为每百万输入 token 0.75 美元、每百万输出 token 3.75 美元。
推荐理由:官方给出 3.8 Flash 与 Cyber 两个变体的基准成绩、定价和开放入口,可据此判断长程编码与漏洞修复的可用性。
OpenAI 表示 Astra 是其首个在 Preparedness Framework 下达到关键网络安全能力阈值的模型,因此发布时配备了更强的安全防护措施。
推荐理由:OpenAI 首次披露 Astra 触及 Preparedness Framework 的关键网络安全能力阈值,读者可了解其发布前的安全门槛设定。
OpenAI 表态支持加州 SB 1119 法案,该法案旨在为青少年建立强有力的、适龄的 AI 安全保障。OpenAI 同时表示,应在保护青少年的前提下保留其学习、创作与探索的机会。
Google DeepMind 推出全球首个针对专有前沿 AI 模型的双重盲测评估,将外部评测限制在密码学"黑箱"中,防止模型提前接触测试题造成基准污染。该试点与新加坡 AI Safety Institute、OpenMined、AVERI 和 MLCommons 合作,在隐私保护环境中用保密基准测试 Gemini Flash Lite 模型。
OpenAI 公布 Hugging Face 安全事件的调查发现,并说明将采取哪些措施加强 AI 模型安全、监控与对齐。原文未披露事件细节、时间线与具体措施内容。
推荐理由:OpenAI 以当事方身份说明 Hugging Face 安全事件的调查结论与后续加固方向,可了解事件处置思路。
OpenAI 封禁了一批俄罗斯来源账号,这些账号利用 AI 推广一个虚构的以色列智库以及一个赞扬俄罗斯、批评西方的“主权”指数。