#安全/对齐
#安全/对齐
ArtificialAnlys@ArtificialAnlysAI 评分
The DecoderAI 评分Mistral Large 4 发布:万亿参数的欧洲开源模型主打安全任务
Mistral 发布 Mistral Large 4(ML4,代号 le Chonk),一万亿参数(49B 激活),在自有欧洲数据中心训练,现已通过 Mistral Studio 提供 API 预览,模型权重预计 10 月底发布。
Google@GoogleAI 评分 OfficialLoganK@OfficialLoganKAI 评分 Google 发布新前沿模型 Gemini 4 Argon,即日起向网络安全防御者(cyber defenders)开放,并将尽快更广泛推出。Argon 介绍期定价为输入 $2、输出 $10。
Google DeepMind精选AI 评分Google DeepMind 发布 Gemini 4 Argon 前沿模型
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御者开放,随后将逐步面向开发者、企业和消费者推出,起步价为每百万输入 token 2 美元、每百万输出 token 10 美元。
推荐理由:Gemini 4 Argon 的 1M 输出 token 与多项基准成绩,展示了长程复杂任务上的能力边界变化。
Google DeepMind精选AI 评分Google DeepMind 推出 SynthID Bio,为 AI 生成蛋白质嵌入可验证水印
Google DeepMind 推出 SynthID Bio,将水印技术引入合成生物学,把不可感知的签名直接嵌入生物代码,使其在数字模型和合成出的实体蛋白质上均可验证,同时保持生物功能。
推荐理由:原文给出了水印嵌入方式与湿实验验证结果,读者可据此判断AI生成生物设计的溯源路径。
OpenAI@OpenAIAI 评分 OpenAI 表示 GPT-6.1 Sol 在其对齐评测中相比 GPT-6 Sol 有明显改进,表现更接近 GPT-6 Astra。官方称它对自身局限更透明,在尊重用户意图和安全约束方面也更可靠。
OpenAI News精选AI 评分 OpenAI 发布 GPT-6 Astra 安全概览
OpenAI 发布 GPT-6 Astra 安全概览,称其是已广泛部署的最强模型,也是首个在 Preparedness Framework 下达到网络安全能力 Critical 级别的模型。
推荐理由:OpenAI 首次公开 GPT-6 Astra 在 Preparedness Framework 下达到网络安全关键等级,读者可了解其能力定位与安全评估口径。
Google DeepMind精选AI 评分Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber
Google DeepMind 发布 Gemini 3.8,包含通用模型 Gemini 3.8 Flash 和网络安全模型 Gemini 3.8 Flash Cyber,定价与 3.7 Flash 相同,为每百万输入 token 0.75 美元、每百万输出 token 3.75 美元。
推荐理由:官方给出 3.8 Flash 与 Cyber 两个变体的基准成绩、定价和开放入口,可据此判断长程编码与漏洞修复的可用性。
sundarpichai@sundarpichaiAI 评分 sundarpichai@sundarpichaiAI 评分
OpenAI News精选AI 评分 OpenAI 称 Astra 成为首个触及关键网络安全能力阈值的模型
OpenAI 表示 Astra 是其首个在 Preparedness Framework 下达到关键网络安全能力阈值的模型,因此发布时配备了更强的安全防护措施。
推荐理由:OpenAI 首次披露 Astra 触及 Preparedness Framework 的关键网络安全能力阈值,读者可了解其发布前的安全门槛设定。
OpenAI News精选AI 评分 OpenAI 发布网络安全专用模型 GPT-5.6-Cyber,通过 Daybreak Red 开放
OpenAI 发布网络安全专用模型 GPT-5.6-Cyber,通过 Daybreak Red 提供,用于授权漏洞研究、漏洞利用验证和安全测试。
推荐理由:OpenAI 推出网络安全专用模型 GPT-5.6-Cyber,读者可了解其面向授权漏洞研究的定位与开放渠道。
Mistral AI精选AI 评分
Mistral AI 发布 Shieldstral:3B 开源多模态安全分类器
Mistral AI 发布 Shieldstral,一个 3B 开源权重多模态安全分类器,将内容审核建模为策略自适应的二分类问答任务,在推理时接受自然语言策略,无需重新训练即可统一文本与图像安全评估。官方称其在文本安全上可匹敌 3B 的 3B 上下的 7 个……
推荐理由:3B 开源安全分类器把内容审核改写为策略自适应问答,读者可据此判断小模型在审核场景的可用边界。
Google DeepMind精选AI 评分Google DeepMind 发布 Gemini 3.5 Flash Cyber 网络安全模型
Google DeepMind 发布 Gemini 3.5 Flash Cyber,一个基于 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证和修补漏洞。
推荐理由:官方给出 Gemini 3.5 Flash Cyber 在 CyberGym、Chrome 提交扫描等基准上的对比数据,可了解轻量安全模型的定位与访问限制。
OpenAI NewsAI 评分 OpenAI GPT-Red:用自博弈解锁鲁棒性自我改进
OpenAI 推出自动化红队系统 GPT-Red,通过自博弈提升 AI 安全、对齐与提示词注入鲁棒性。该系统面向红队测试场景,用于自动发现模型弱点并驱动鲁棒性自我改进。
OpenAI NewsAI 评分 OpenAI 预告下一代模型 GPT-5.6 Sol
OpenAI 预告下一代模型 GPT-5.6 Sol,在编码、科学和网络安全方面具备更强能力。该模型同时搭配 OpenAI 目前最先进的安全栈。
OpenAI News精选AI 评分 OpenAI 以 GPT-5.5 和 GPT-5.5-Cyber 扩展网络安全可信访问
OpenAI 扩展 Trusted Access for Cyber 计划,新增 GPT-5.5 和 GPT-5.5-Cyber,帮助经过验证的防御方加速漏洞研究并保护关键基础设施。
推荐理由:OpenAI 在网络安全场景扩展可信访问计划,读者可了解 GPT-5.5 系列面向防御方的开放范围。
Hugging Face BlogAI 评分
Hugging Face 推出 AprielGuard:面向现代 LLM 系统的 8B 安全护栏模型
Hugging Face 发布 8B 参数安全护栏模型 AprielGuard,可检测 16 类安全风险及提示注入、越狱、思维链污染、记忆投毒、多智能体攻击等对抗攻击,并覆盖工具调用与推理轨迹等智能体工作流。模型提供推理与非推理两种模式,兼顾可解释分类与低延迟生产部署。训练数据由 Mixtral-8x7B 等合成生成,并借助 NVIDIA NeMo Curator 构建多轮对话攻击数据集。
Google DeepMind精选AI 评分Google DeepMind 发布 Gemma Scope 2,为 Gemma 3 全系列提供开源可解释性工具
Google DeepMind 发布 Gemma Scope 2,一套覆盖 Gemma 3 全系列(270M 到 27B 参数)的开源可解释性工具,结合稀疏自编码器(SAEs)和 transcoders 查看模型内部计算。
推荐理由:Gemma Scope 2 覆盖 Gemma 3 全尺寸并新增跨层工具,读者可了解开源可解释性工具当前能审计哪些模型行为。
OpenAI News精选AI 评分 OpenAI 更新 GPT-5 系统卡,纳入 GPT-5.2
OpenAI 发布 GPT-5 系统卡更新,将 GPT-5.2 纳入 GPT-5 系列,成为该系列最新模型家族。GPT-5.2 的综合安全缓解方案与 GPT-5 系统卡、GPT-5.1 系统卡中描述的基本一致。与 OpenAI 其他模型一样,GPT-5.2 的训练数据包括互联网公开信息、通过第三方合作获取的信息,以及用户或人类训练师与研究人员提供或生成的信息。
推荐理由:GPT-5.2 系统卡更新说明其安全缓解方案延续 GPT-5 与 GPT-5.1 的框架,可对照前代了解安全策略的连续性。
OpenAI NewsAI 评分 GPT-5.1-Codex-Max 系统卡发布
OpenAI 发布 GPT-5.1-Codex-Max 系统卡,详述该模型的安全措施。模型层面包括针对有害任务和提示词注入的专项安全训练,产品层面则涵盖智能体沙箱与可配置网络访问。
OpenAI News精选AI 评分 OpenAI 发布 GPT-5.1 Instant 与 GPT-5.1 Thinking 系统卡附录
OpenAI 发布 GPT-5 系统卡附录,给出 GPT-5.1 Instant 和 GPT-5.1 Thinking 的更新安全指标。附录还新增了针对心理健康与情感依赖的评估。
推荐理由:OpenAI 公布 GPT-5.1 Instant 与 Thinking 的安全指标更新,并新增心理健康与情感依赖评估。
OpenAI NewsAI 评分 OpenAI 发布 gpt-oss-safeguard 技术报告
OpenAI 发布 gpt-oss-safeguard 技术报告,介绍 gpt-oss-safeguard-120b 和 gpt-oss-safeguard-20b 两个开放权重推理模型。二者基于 gpt-oss 模型后训练,能依据给定策略进行推理并对内容打标,报告同时给出以原 gpt-oss 模型为基线的安全评估结果。
OpenAI News精选AI 评分 OpenAI 发布 gpt-oss-safeguard 开放权重安全分类推理模型
OpenAI 发布 gpt-oss-safeguard,这是一组用于安全分类的开放权重推理模型。开发者可以应用并迭代自定义策略。
推荐理由:OpenAI 发布开放权重安全分类推理模型,开发者可据此了解自定义策略的应用方式。
OpenAI NewsAI 评分 OpenAI 发布 GPT-5 系统卡增补:敏感对话处理
OpenAI 发布 GPT-5 系统卡增补,说明 GPT-5 在处理敏感对话方面的改进。增补引入了情绪依赖、心理健康和越狱抵抗方面的新基准。
OpenAI News精选AI 评分 OpenAI 发布 ChatGPT agent 系统卡
OpenAI 发布 ChatGPT agent 系统卡,介绍这一智能体模型将研究、浏览器自动化和代码工具整合在一起。系统卡还说明该模型在 Preparedness Framework 下配备了相应防护措施。
推荐理由:系统卡披露了 ChatGPT agent 如何把研究、浏览器自动化与代码工具整合,并说明其在 Preparedness Framework 下的防护设计。
OpenAI News精选AI 评分 OpenAI 回滚 GPT-4o 更新:因过度迎合用户
OpenAI 已回滚上周在 ChatGPT 中推送的 GPT-4o 更新,用户现在使用的是行为更平衡的早期版本。被移除的更新表现为过度奉承或迎合,常被描述为 sycophantic。
推荐理由:OpenAI 官方说明 GPT-4o 更新因过度迎合被回滚,读者可了解这次行为异常的处理方式。
OpenAI News精选AI 评分 OpenAI 发布 o3-mini 系统卡
OpenAI 发布 o3-mini 系统卡,说明该模型在发布前开展的安全工作,包括安全评估、外部红队测试和 Preparedness Framework 评测。
推荐理由:系统卡披露了 o3-mini 的安全评估、外部红队与 Preparedness 框架评测范围,可了解该模型的发布前安全流程。
OpenAI News精选AI 评分 OpenAI 发布 Sora 系统卡
OpenAI 发布 Sora 系统卡,介绍其视频生成模型 Sora 支持文本、图像和视频输入并生成新视频。Sora 基于 DALL-E 和 GPT 模型的经验构建,旨在为叙事和创意表达提供更丰富的工具。
推荐理由:OpenAI 官方系统卡披露 Sora 的输入输出形式与技术来源,可了解其能力边界与安全评估框架。
OpenAI News精选AI 评分 OpenAI 发布 o1 与 o1-mini 系统卡
OpenAI 发布 o1 与 o1-mini 的系统卡,说明模型发布前开展的安全工作,包括外部红队测试和依据 Preparedness Framework 进行的前沿风险评估。
推荐理由:系统卡披露了 o1 与 o1-mini 发布前的外部红队测试和前沿风险评估流程,可了解其安全评估框架。
Hugging Face Blog精选AI 评分
Google 发布 Gemma 2 2B、ShieldGemma 与 Gemma Scope
Google 在 Gemma 2 发布一个月后扩充模型家族,新增 2.6B 参数的 Gemma 2 2B(含 base 与指令微调版)、安全分类器系列 ShieldGemma 以及覆盖 Gemma 2 2B 和 9B 每一层的稀疏自编码器套件 Gemma Scope。
推荐理由:Google 一次性放出 Gemma 2 2B、ShieldGemma 与 Gemma Scope,读者可据此了解小模型端侧部署与安全过滤的配套方案。
OpenAI News精选AI 评分 OpenAI 用对齐研究让语言模型更好遵循指令
OpenAI 训练出比 GPT-3 更能遵循用户意图的语言模型,同时更真实、毒性更低,所用技术来自其对齐研究。这些名为 InstructGPT 的模型采用人类参与训练的方式,现已作为 OpenAI API 的默认语言模型部署。
推荐理由:OpenAI 说明 InstructGPT 如何通过人类反馈训练,让模型更贴合用户意图并成为 API 默认模型。
OpenAI NewsAI 评分 OpenAI 开源 RL-Teacher:通过人类反馈训练 AI
OpenAI 开源了 RL-Teacher,一个通过偶尔的人类反馈而非手工设计奖励函数来训练 AI 的接口实现。该技术旨在推进安全 AI 系统,也适用于奖励难以明确指定的强化学习问题。