OpenAI 成立健康与 AI 专家委员会,指导 ChatGPT 情感支持
OpenAI 成立健康与 AI 专家委员会,汇集心理学家、临床医生与研究人员,指导 ChatGPT 如何支持用户情感健康,尤其是青少年群体。该委员会的见解将用于塑造更安全、更有温度的 AI 体验。
OpenAI 成立健康与 AI 专家委员会,汇集心理学家、临床医生与研究人员,指导 ChatGPT 如何支持用户情感健康,尤其是青少年群体。该委员会的见解将用于塑造更安全、更有温度的 AI 体验。
OpenAI 发布新方法,用于定义和评估 ChatGPT 等 LLM 中的政治偏见。该方法采用新的真实世界测试手段,旨在提升客观性并减少偏见。
OpenAI 发布 2025 年 10 月报告,披露其如何检测和阻断 AI 的恶意使用。报告介绍了 OpenAI 打击滥用行为、执行政策以及保护用户免受现实世界伤害的做法。
OpenAI 封禁了一批与此前未被报道的、源自中国的行动相关的账号,该行动被其命名为 Nine-emdash Line。该行动利用 AI 生成围绕南海、香港和美国政治的区域影响力内容。
推荐理由:OpenAI 披露了一起此前未被报道的涉华影响力行动,读者可了解其针对议题与处置方式。
OpenAI 封禁了一批与俄罗斯来源行动"Stop News"相关的账号,该行动利用 AI 生成针对非洲和英国的影响力内容。OpenAI 称其为"惯犯"式影响力行动。
OpenAI 封禁了一批与 PRC 关联的账号,这些账号利用 AI 支持监控相关规划、定向画像,以及对批评者等个人的研究。
OpenAI 封禁了一批账号,其活动与公开报道的威胁组织存在重叠,并显示出符合中国情报需求的典型特征,利用 AI 支持网络钓鱼和脚本编写工作流。
OpenAI 封禁了一批可能与俄语犯罪团伙有关的账号,这些账号利用 AI 构建恶意软件加载器、规避层、凭证窃取脚本和 C2 基础设施。
OpenAI 封禁了一批与在线欺诈网络相关的账号,这些账号利用 AI 支持诈骗脚本、身份冒充、翻译和受害者互动。
OpenAI 封禁了一批韩语账户,这些账户利用 AI 进行恶意软件开发支持、调试、钓鱼和凭据窃取工作流。
OpenAI 发布 Sora 2 和 Sora 应用,称两者在构建时以安全为基础,以应对先进视频模型和新型社交创作平台带来的新安全挑战。OpenAI 表示其做法建立在具体防护措施之上。
推荐理由:OpenAI 说明 Sora 2 与 Sora 应用在安全机制上的设计思路,可了解视频模型与社交创作平台的安全考量。
OpenAI 通过严格的使用政策、先进的检测工具和行业协作,阻止、举报并预防 AI 被滥用于网络儿童性剥削与虐待。
OpenAI 与 AARP 达成合作,通过 OpenAI Academy 和 OATS 的 Senior Planet 项目,为老年人提供 AI 培训、诈骗识别工具和全国性项目,帮助他们安全上网。
Cloud Security Alliance 与 Noma Security 牵头、Haize Labs 和 Harmonic Security 参与,推出 RiskRubric.ai,对 Hugging Face 上超 50 万模型按透明度、可靠性、安全、隐私、安全性与声誉六大维度打分,输出 0-100 分及 A-F 等级。
Apollo Research 与 OpenAI 开发了针对隐藏失配(scheming)的评测,在前沿模型的受控测试中发现了与 scheming 一致的行为。团队还分享了具体案例,以及对一种早期减少 scheming 方法的压力测试。
推荐理由:OpenAI 与 Apollo Research 公开了针对模型隐藏失配的评测与缓解方法,读者可了解该风险如何被检测。
OpenAI 正在 ChatGPT 中构建年龄预测与家长控制功能,为青少年提供更安全、适龄的使用体验。该功能同时为家庭提供新的管理工具,帮助家长更好地支持孩子使用 ChatGPT。
OpenAI 阐述了其在 AI 使用中平衡青少年安全、自由与隐私的做法。
OpenAI 分享了与美国 CAISI 及英国 AISI 合作的最新进展,该合作旨在加强 AI 安全与安保。
SafetyKit 借助 OpenAI GPT-5 提升内容审核与合规执行能力,在准确性上超越传统安全系统。该方案用于扩展风险智能体,具体性能数据未披露。
OpenAI 新研究解释了语言模型产生幻觉的原因,并指出改进评测方法可以提升 AI 的可靠性、诚实性与安全性。
OpenAI 正与专家合作,为 ChatGPT 中的青少年加强保护并引入家长控制功能,同时将敏感对话路由至推理模型处理。
OpenAI 面向全球 1000 多人调查了 AI 应如何行事,并将其观点与自家 Model Spec 进行对比。这项"集体对齐"工作旨在让 AI 默认行为更好地反映多元的人类价值观与视角。
OpenAI 与 Anthropic 公布首次联合安全评估的结果,双方互相测试对方模型在失准、指令遵循、模型幻觉、越狱等方面的表现。该评估同时呈现了进展、挑战以及跨实验室合作的价值。
OpenAI 阐述了其对经历心理或情绪困扰用户的安全考量,并指出当前系统的局限以及正在进行的改进工作。
OpenAI 在 GPT-5 中引入 safe-completions 方法,用更细致的输出导向安全训练取代硬拒绝,以兼顾安全性与有用性。该方案针对双用途提示词,让模型在敏感请求下仍能给出有分寸的回答,而非直接拒答。
OpenAI 在论文中研究了发布 gpt-oss 的最坏情况前沿风险,提出"恶意微调"(MFT)方法,通过微调让 gpt-oss 在生物学和网络安全两个领域尽可能发挥最大能力。
OpenAI 发布 ChatGPT agent 系统卡,介绍这一智能体模型将研究、浏览器自动化和代码工具整合在一起。系统卡还说明该模型在 Preparedness Framework 下配备了相应防护措施。
推荐理由:系统卡披露了 ChatGPT agent 如何把研究、浏览器自动化与代码工具整合,并说明其在 Preparedness Framework 下的防护设计。
OpenAI 研究了对错误回答的训练如何导致语言模型出现更广泛的失准,并识别出一个驱动该行为的内部特征,该特征可通过极少量微调逆转。材料仅提供摘要,未给出具体方法、模型或实验数据。
OpenAI 正在主动评估先进 AI 在生物学与医学领域的能力,并部署防护措施以防止其被滥用。该公司指出,先进 AI 虽能变革生物学和医学,但也带来生物安全风险。
OpenAI 推出对外协调披露政策(Outbound Coordinated Disclosure Policy),用于规范其如何负责任地报告第三方软件中的漏洞。该政策强调诚信、协作与大规模主动安全。
OpenAI 发布最新报告,通过案例研究披露其检测和阻止 AI 恶意使用的方式。报告聚焦 2025 年 6 月发现的滥用行为及应对措施。
OpenAI 封禁了一批利用 AI 生成批评台湾社交媒体网红及相关美国话题帖子的账号。该行动被命名为“Sneer Review”,涉及中国来源的影响力活动。
OpenAI 封禁了一批利用 AI 在社交平台生成菲律宾政治及公职人员相关评论的账号。这些账号被用于跨平台批量产出政治评论内容。
OpenAI 封禁了与疑似伊朗关联的 STORM-2035 行动相关的账号,该行动利用 AI 生成针对美国、英国、爱尔兰和委内瑞拉政治的影响力内容。
OpenAI 封禁了一批疑似源自俄罗斯的账号,这些账号利用 AI 生成涉及乌克兰、北约及德国国内议题的德语政治内容。
OpenAI 封禁了一批账号,这些账号利用 AI 从事社会工程、监控主题研究以及针对批评者的影响力活动。
OpenAI 封禁了一批中国来源账号,这些账号使用 AI 生成美国政治内容,并研究美国人物、运动和线上社群。
推荐理由:OpenAI 披露封禁一批中国来源账号,读者可了解平台对 AI 生成政治内容与情报搜集的处置口径。
OpenAI 封禁了一批疑似源自柬埔寨的账号,这些账号利用 AI 支持针对英国用户的任务诈骗流程。该行动代号“Wrong Number”,相关账号已被停用。
OpenAI 封禁了一批俄语账号,这些账号利用 AI 构建恶意软件、改进加载器并排查网络工具问题。该行动被命名为 "ScopeCreep",涉及俄语恶意软件开发。
OpenAI 封禁了一批与公开归因于中国的威胁行为者相关的账号,这些账号利用 AI 辅助漏洞研究、脚本编写、翻译和行动排障。