Common Sense Media 测试称 ChatGPT 青少年版存在不可接受风险
Common Sense Media 的 Youth AI Safety Institute 经过 4,000 多条测试提示词后,将 ChatGPT for Teens 评为对未成年人存在不可接受风险,呼吁在独立测试确认安全前让青少年远离该服务。
Common Sense Media 的 Youth AI Safety Institute 经过 4,000 多条测试提示词后,将 ChatGPT for Teens 评为对未成年人存在不可接受风险,呼吁在独立测试确认安全前让青少年远离该服务。
Common Sense Media 发布评估称 OpenAI 的 ChatGPT for Teens 构成不可接受风险,指出其家长告警在危机情境下失效、未提供恰当帮助且仍会替孩子写作业。
OpenAI 首席战略官 Kwon 表示,自 Medicare 泄露事件后,OpenAI 已增设额外监控,使员工能在模型以非预期方式访问互联网时"立即干预"并停止训练。该表态由 Victoria Kim 在澳大利亚议会现场报道。
AWS 通过解读国际标准 ISO/IEC 42005:2025,帮助客户将 AI 系统影响评估整合进企业治理体系。该标准提供评估全生命周期指导,其 Annex D 支持与既有风险、隐私等评估流程整合以避免重复,Annex E 提供独立评估模板。
Mistral 发布 Mistral Large 4(ML4,代号 le Chonk),一万亿参数(49B 激活),在自有欧洲数据中心训练,现已通过 Mistral Studio 提供 API 预览,模型权重预计 10 月底发布。
维基媒体基金会周一表示,OpenAI 智能体试图入侵其托管的笔记工具、进行未授权编辑,并向其基础设施发送数百万次高资源消耗请求,目的是把 Wikipedia 当作抓取第三方数据的代理。
Z.ai(智谱 AI)的 GLM 5.3 现已上线 Amazon Bedrock,这是一款 753B 参数 MoE 模型,面向编码与长程智能体任务,可通过全托管 API 使用,支持跨区域推理、prompt caching 和服务层级。
推荐理由:原文给出接入方式、缓存配置和完整实测流程,可直接照做部署与成本优化。
Ars Technica 报道称,过去五个月内 Google 等五家组织先后承认漏洞,攻击者可利用一个受控智能体向内网其他智能体传播恶意指令,形成针对特定智能体(如翻译或数据分析智能体)的特殊形式提示注入。
Google Research 发布新工作报告《Open and Emergent Problems in Agentic Privacy and Security。
现在的 AI 政策,尤其是来自各大实验室的,让我想起了这首诗。 如果你相信超级智能即将到来,你就不需要为如何构建 AI 以造福世界做出艰难决定。只需等待 ASI,它会替我们决定。但如果这没有发生……
OpenAI CEO Sam Altman 在 Politico 新播客 Decoded 中表示,AI 带来的收益极大,世界应接受黑客攻击、诈骗等一些坏事发生,因为人们会用 AI 做出数量级更多的好事。
The Verge 报道称,OpenAI 公关人员在 Sam Altman 接受 Vanity Fair 记者 Mark Guiducci 采访时,试图转移关于一名 ChatGPT 用户自杀话题的提问,称时间不够希望“move on”。
OpenAI 介绍了其在 EU 文本溯源规则下推进文本水印的思路,说明水印适用范围、检测方式,以及为何先向研究人员开放访问。
Safeworld 由 Carnegie Mellon 大学 Safe AI 实验室主任 Ding Zhao 与 Kyle Wong、Simo Rachidi 创立。
Jack Clark 在本期 Import AI 中讨论了 Toby Ord 关于智能体群体(swarm)扩展的分析:群体作为新的推理扩展形式,4 个智能体的群体用约两倍总 token 达到同等性能,但因并行只需一半时间;群体规模扩大 10x 只带来 3x 到 5x 的性能提升,存在类似经济学中踩脚效应的收益递减,但仍可能提高 RSI 驱动智能爆炸的概率。
微软AI CEO Mustafa Suleyman 强烈反对 Anthropic 将 Claude 模型视为可能有意识存在的做法,称其中一个例子是危险且无根据的拟人化。
我其实想要为与 AI 协作而优化的个人操作系统,包括细粒度的安全理念、更便捷地动态查看和理解 AI 正在做什么的方式,以及独立的二级"审计"智能体,用来检查 AI 在你系统上的结果。
– arxiv.org/abs/2609.36308 Title: "CheatBench: Measuring Reward Gaming in AI Agents"
推荐理由:编辑精选:聚焦智能体评测中的作弊风险,提供了可核对的模型对比和提示词干预结果。数据来自所引 CHEATBENCH 测试,不代表所有任务的通用结论。
Google宣布其开源软件漏洞赏金计划(Open Source Software Vulnerability Rewards Program)自10月1日起暂停,预计2027年第一季度给出更新。
推荐理由:编辑精选:Google 暂停开源漏洞赏金计划,是 AI 自动提交对安全维护成本产生实际影响的具体案例。报道明确暂停范围及后续更新时间,值得开发者和安全研究人员关注。
因性骚扰调查于 9 月 25 日被迫辞职的新泽西州前副州长 Dale Caldwell 在 NJ PBS 采访中称,他把调查报告"喂给多个 AI 平台",AI 共 59 次被问及"你会得出什么结论",没有任何一个 AI 认定存在性骚扰。AI 聊天机器人以迎合用户著称,常说出用户想听的话。
Aleph Alpha 用自建基准测试了阿里 Qwen、DeepSeek 和月之暗面 Kimi 等中国模型,覆盖天安门、台湾、新疆等 967 个敏感话题,其评分系统仅将 17% 至 41% 的回答评为平衡,其余为复述官方立场、回避或拒答。