OpenAI 封禁与朝鲜相关威胁行为者账号
OpenAI 封禁了一批可能与公开报道的朝鲜相关威胁行为者有关的账号,这些账号利用 AI 研究入侵工具、钓鱼、恶意软件和加密货币攻击目标。
推荐理由:OpenAI 披露封禁与朝鲜相关威胁行为者账号,可了解 AI 被用于网络攻击研究的具体方向。
OpenAI 封禁了一批可能与公开报道的朝鲜相关威胁行为者有关的账号,这些账号利用 AI 研究入侵工具、钓鱼、恶意软件和加密货币攻击目标。
推荐理由:OpenAI 披露封禁与朝鲜相关威胁行为者账号,可了解 AI 被用于网络攻击研究的具体方向。
OpenAI 封禁了一批可能被用于协助欺诈性就业计划的账号,该计划带有公开报道中朝鲜相关 IT 工作者活动的特征。
OpenAI封禁了一批疑似中国来源的账号,这些账号使用AI起草监控工具推介材料、分析文档并调试代码。该行动被命名为Operation “Peer Review”。
OpenAI 封禁了一批疑似中国来源的账号,这些账号利用 AI 生成英文社交媒体帖子和西班牙语文章,开展代号“Sponsored Discontent”的影响活动。
OpenAI 封禁了一批利用 AI 生成文章、帖子和虚假互动、围绕加纳 2024 年总统选举开展隐蔽影响力行动的账号。
OpenAI 封禁了一批疑似源自柬埔寨的账号,这些账号利用 AI 翻译消息,实施虚假评论招聘诈骗,要求受害者支付费用。
OpenAI 发布 o3-mini 系统卡,说明该模型在发布前开展的安全工作,包括安全评估、外部红队测试和 Preparedness Framework 评测。
推荐理由:系统卡披露了 o3-mini 的安全评估、外部红队与 Preparedness 框架评测范围,可了解该模型的发布前安全流程。
OpenAI 发布 Operator 系统卡,介绍其基于既有安全框架的多层防护方案。文档涵盖针对提示词工程与越狱的模型和产品缓解措施、隐私与安全保护,以及外部红队测试、安全评估和后续改进工作。
OpenAI 研究提出通过增加推理时计算来提升模型的对抗鲁棒性,即以更多推理算力换取对对抗攻击的抵抗能力。该工作探讨了推理时计算与对抗鲁棒性之间的权衡关系。
OpenAI 为 o1 模型提出新的对齐策略“审议式对齐(deliberative alignment)”,直接教模型安全规范以及如何对这些规范进行推理。该策略面向 o1 系列模型,目标是让推理能力服务于更安全的语言模型。
OpenAI 发布 Sora 系统卡,介绍其视频生成模型 Sora 支持文本、图像和视频输入并生成新视频。Sora 基于 DALL-E 和 GPT 模型的经验构建,旨在为叙事和创意表达提供更丰富的工具。
推荐理由:OpenAI 官方系统卡披露 Sora 的输入输出形式与技术来源,可了解其能力边界与安全评估框架。
OpenAI 发布 o1 与 o1-mini 的系统卡,说明模型发布前开展的安全工作,包括外部红队测试和依据 Preparedness Framework 进行的前沿风险评估。
推荐理由:系统卡披露了 o1 与 o1-mini 发布前的外部红队测试和前沿风险评估流程,可了解其安全评估框架。
OpenAI 发布文章阐述如何结合人类与 AI 推进红队测试。原文未披露具体模型版本、参数量或评测分数等细节。
Mistral AI 发布内容审核 API,即 Le Chat 审核服务所用的同一套接口,供用户按自身安全标准定制使用。该模型是基于 LLM 的分类器,将文本输入划分为 9 个类别,提供原始文本和对话内容两个端点,对话端点针对会话上下文中的最后一条消息分类。
推荐理由:Mistral 把 Le Chat 内部使用的审核服务开放为 API,读者可据此评估自建内容审核链路的成本与多语言覆盖。
OpenAI 分析了 ChatGPT 如何根据用户姓名做出不同回应,并借助 AI 研究助手来保护隐私。
OpenAI 封禁了一批疑似属于 CyberAv3ngers 的账号,这些账号利用 AI 研究工业控制系统、默认凭据和攻击目标。该组织被指与伊朗有关联。
OpenAI 封禁了一批与伊朗关联的 STORM-0817 账号,这些账号利用 AI 调试 Android 恶意软件、抓取社交平台内容并翻译工具。
OpenAI 封禁了一批源自卢旺达的账号,这些账号在卢旺达选举前使用 AI 生成党派性评论。该网络被定性为政治评论操作网络。
OpenAI 封禁了一批源自伊朗、代号 STORM-2035 的账号,这些账号利用 AI 生成美国与英国选举相关内容并发布到多个网站。
OpenAI 封禁了一批疑似属于中国关联黑客组织 SweetSpecter 的账号,该组织利用 AI 研究漏洞、编写代码并支持鱼叉式钓鱼攻击。
OpenAI 封禁了一批通过一家以色列初创公司访问其模型、用于生成对话并在 X 上发送赌博网站链接的账号。这些账号被用于运营一个赌博垃圾信息网络。
OpenAI 封禁了一批利用 AI 生成批评俄罗斯反腐基金会及相关人物评论的账号。
OpenAI 封禁了一个很可能来自美国的账号,该账号用 AI 伪造 ChatGPT 报错信息,声称能检测“俄罗斯水军”活动。
OpenAI 封禁了一批利用 AI 起草滥用举报和投诉的账号,这些举报针对越南公众人物和平台。
OpenAI 封禁了名为 A2Z 的账号,这些账号利用 AI 生成涉及选举、乌克兰和政治议题的多语种影响内容,并发布到多个平台。
OpenAI 封禁了一批源自俄罗斯的“Stop News”账号,这些账号利用 AI 生成多语言文章和帖子,针对乌克兰和西方进行影响力活动。
OpenAI 推出基于 GPT-4o 构建的新多模态审核模型,用于升级 Moderation API,可更准确地检测有害文本和图像。该模型面向开发者,帮助其构建更稳健的审核系统。
OpenAI 发布安全与安保实践更新。原文未披露具体措施、时间表或涉及模型版本等细节。
OpenAI 宣布 Zico Kolter 加入其董事会,以 AI 安全与对齐方面的专业能力加强公司治理。Zico Kolter 同时将加入安全与安保委员会。
推荐理由:OpenAI 官方公布董事会人事变动,读者可了解其在 AI 安全与对齐方向上的治理安排。
Hugging Face 于 8 月 6 日梳理了 Hub 的安全功能,面向所有用户提供细粒度 Token、2FA、Commit Signing、组织访问控制,以及基于 ClamAV、picklescan、trufflehog 的自动化安全扫描流水线。Enterprise Hub 用户还可使用 SSO(支持 SAML 2.0 与 OIDC)和 Resource Groups 等高级控制。
Google 在 Gemma 2 发布一个月后扩充模型家族,新增 2.6B 参数的 Gemma 2 2B(含 base 与指令微调版)、安全分类器系列 ShieldGemma 以及覆盖 Gemma 2 2B 和 9B 每一层的稀疏自编码器套件 Gemma Scope。
推荐理由:Google 一次性放出 Gemma 2 2B、ShieldGemma 与 Gemma Scope,读者可据此了解小模型端侧部署与安全过滤的配套方案。
OpenAI 开发并应用了一种基于规则的奖励(RBRs)新方法,让模型在无需大量人工数据采集的情况下学会安全行为并对齐。该方法旨在改善模型的安全行为表现。
OpenAI 提出用证明者-验证者博弈(Prover-Verifier Games)提升语言模型输出的可读性,让 AI 给出的解答更清晰、更易被验证。该方法旨在使模型输出对人类和机器都更可信。
OpenAI 与洛斯阿拉莫斯国家实验室宣布建立研究合作,共同开发安全评估方法,用于评估和衡量前沿模型相关的生物能力与风险。
Hugging Face 正在 Dataset Hub 上试验一项基于开源 PII 检测工具 Presidio 的新功能,可为数据集生成 PII 存在情况的估算报告。Presidio 依靠检测模式和机器学习模型识别 PII,报告可帮助开发者在训练前决定是否进一步过滤数据,也便于数据集所有者在上线前验证自己的 PII 过滤流程。
OpenAI 发布基于 GPT-4 的模型 CriticGPT,用于对 ChatGPT 的回答撰写批评意见,帮助人类训练员在 RLHF 过程中发现错误。
Hugging Face 发布《伦理与社会通讯 #6》,聚焦高质量数据对 AI 模型的决定性作用,指出好数据不只是准确或量大,而是契合具体用途。文章以 Reddit 与 Google 的 RAG 搜索合作为例,说明低质数据曾导致“在披萨里加胶水”这类荒谬推荐。文中列出相关性、全面性、时效性与偏见缓解等数据质量维度,并强调数据治理、去重、内容过滤与人工反馈等流程。
OpenAI 公布网络安全资助计划,聚焦创新研究与 AI 在网络安全领域的整合。该计划旨在赋能防御者,推动 AI 技术在安全防护中的应用。
OpenAI 提出一套构建稳健自然语言分类系统的整体方法,用于真实场景的内容审核。该系统针对不良内容检测,强调在真实世界中兼顾鲁棒性与实用性。
OpenAI 任命退役美国陆军上将 Paul M. Nakasone 加入其董事会,他将同时加入董事会的安全与安保委员会。Nakasone 为这一不断扩大的董事会带来网络安全方面的经验。