#安全/对齐
#安全/对齐
natolambert@natolambertAI 评分 dongxi_nlp@dongxi_nlpAI 评分 ArtificialAnlys@ArtificialAnlysAI 评分 ArtificialAnlys@ArtificialAnlysAI 评分
The DecoderAI 评分Anthropic 更新 Claude 使用政策,持续恶意辱骂将被封号
Anthropic 一年多来首次更新 Claude 使用政策,新增禁止对 Claude 进行持续且无必要的辱骂或残忍行为,违规者可能被警告、限流、限制、暂停或终止访问;官方对 The Verge 表示该规则仅适用于极端情况,不针对正常情绪表达或研究。
TechCrunch · AIAI 评分Anthropic 更新使用政策,禁止虐待模型与干预选举
Anthropic 于周四更新使用政策,新增禁止干预选举、武器软件和监控相关用途,并明确禁止对模型进行长时间言语虐待。政策说明称该条款仅适用于用户反复无故残忍对待模型的极端情形,不涵盖常见的用户沮丧、反驳、暗黑创作主题或模型测试研究。政策另设章节禁止欺骗性行动、用 Claude 运营虚假账号或伪造新闻机构,以及欺骗选民或扰乱选举。
rohanpaul_ai@rohanpaul_aiAI 评分 ml_angelopoulos@ml_angelopoulos精选AI 评分 推荐理由:原文把融资与真实用户交互中的对齐问题观察结合,读者可了解评测平台如何从偏好榜单转向对齐评估。
istoica05@istoica05AI 评分 infwinston@infwinstonAI 评分 emollick@emollickAI 评分 2005年我刚读研时,写过一篇关于早期计算机黑客/电话盗用/BBS场景的论文:黑客往往出于好奇心,但他们制作的工具却被"脚本小子"广泛利用,造成了大部分破坏和混乱。 总之,关于AI黑客……
The Verge · AIAI 评分Anthropic 更新使用政策,禁止对 Claude 持续施虐并扩大武器与监控禁令
Anthropic 一年多来首次更新 Claude 使用政策,新增禁止对模型“持续且无必要的辱骂或残忍行为”,并称结束对话仍是主要执行手段,该条款仅适用于极端情况,不涵盖常见挫败感、黑暗创作主题或模型测试。政策还把分散限制整合为禁止欺骗性商业或政治活动,扩大武器禁令至武器软件组件与武装无人机,明确禁止未经同意追踪个人及用于执法调查,并要求连接可造成伤害的自主硬件时须有合格操作员可随时停止设备。
rohanpaul_ai@rohanpaul_aiAI 评分 arena@arenaAI 评分 深入阅读我们的博客中的完整技术报告:bit.ly/4hQP3xO,并在我们的 Alignment Index 中查看完整排名:bit.ly/4hMIHzp
arena@arenaAI 评分 arena@arenaAI 评分
TechCrunch · AIAI 评分Goodfire 推出内部激活监控,以更低成本捕捉失控 AI 智能体
Goodfire 发布通过读取模型内部信号监控 AI 智能体的新方案,已向 Baseten 客户开放,可监控攻击性黑客、化学生物武器滥用、奖励作弊等风险并配置自动响应。
OpenAI NewsAI 评分 OpenAI 打击两起利用 AI 的"虚假门面"影响力行动
OpenAI 打击了两起利用 AI 的影响力行动,这些行动通过虚假门面的记者和一家智库传播地缘政治信息。
dair_ai@dair_aiAI 评分 vineete_5@vineete_5AI 评分 omarsar0@omarsar0AI 评分 MSFTResearch@MSFTResearchAI 评分 iamtrask@iamtraskAI 评分 🌶️ 已修复 只有傻瓜才会说 AI 正在*以前所未有的速度制造*漏洞……漏洞本来就在那里 这张图说的是我们*以前所未有的速度修复*漏洞……这是一张关于互联网变得更安全的图。
The DecoderAI 评分Ethereum 研究者就 AI 数学突破或加速钱包签名体系被破解展开争论
两位 Ethereum 领先研究者警告,AI 辅助数学最坏情况下可能在数月内破解加密钱包所用的签名系统。Justin Drake 在 X 上呼吁行业进入
ClementDelangue@ClementDelangueAI 评分 我们迫切需要更多AI智能体攻击和防御系统的公开轨迹。防御者无法从看不见的东西中学习。 如果你有轨迹却正被施压要求保密,我的私信随时开放。让我们拉平竞争环境,对抗AI中的不对称和缺乏透明!
natolambert@natolambertAI 评分 韩国银行黑客事件与此吻合。是的,开源模型正被部分攻击者利用,但只要 Claude Code 能成为黑客攻击的编排者,我们就迫切需要开源模型同样用于防御。这在社会层面是难以接受的艰难平衡,但却是必要的。
The DecoderAI 评分Zenity 研究发现 AWS Bedrock AgentCore 单个公开智能体可接管同区域所有智能体
安全公司 Zenity Labs 研究人员发现,Amazon Bedrock AgentCore 存在名为 AgentCorruption 的漏洞链,攻击者只需聊天访问一个公开智能体,用一条提示词即可接管同一 AWS 账户和区域内所有 AgentCore 智能体,读取、改写或删除其他智能体,暴露私密对话、源代码和存储凭证。
Ars Technica · AIAI 评分Nvidia 重注物理 AI,Halos 安全系统瞄准更安全的 robotaxi 与人形机器人
Nvidia 为物理 AI 押注数十亿美元,推出全栈安全系统 Halos,以降低机器人和自动驾驶汽车伤人的风险。Halos 于 2025 年上线,提供软硬件工具帮助开发者为自动驾驶汽车等车辆设置安全护栏;2026 年 6 月,公司又宣布 Halos for Robotics,将安全架构扩展到仓储移动机器人、工厂人形机器人和手术机器人。
The Decoder精选AI 评分AI黑客工具助单人攻击者入侵多家韩国银行
Crowdstrike 报告称,一名疑似中文攻击者在9月末至10月初入侵多家韩国金融机构并窃取大量数据,仅 Shinhan Bank 就有超过 25,000 条含姓名、联系方式、收入和信用额度的记录被盗。
推荐理由:报道将一次真实银行入侵与所用AI模型对应起来,可作为评估AI自动化攻击风险的具体案例。
The DecoderAI 评分16岁少年用 Claude 规划登山路线被困岩壁,直升机救援后称不再用 AI 规划路线
一名16岁少年用 Anthropic 的 Claude 规划登顶路线,误入温哥华附近 Crown Mountain 需要攀岩装备的 "Widowmaker Arete",被困在5英尺宽岩架上,最终由 North Shore Rescue 用直升机吊运获救。
MIT Technology Review · AIAI 评分
工业 AI 如何构建更安全的自主化路径
AVEVA 首席技术官 Arti Garg 在 MIT Technology Review Business Lab 播客中指出,foundation models、physical AI 和 agentic AI 正推动工业 AI 进入新阶段,但直接作用于物理系统的 AI 需要以安全为前提部署。
rohanpaul_ai@rohanpaul_aiAI 评分 omarsar0@omarsar0AI 评分 NVIDIA 被 NeurIPS 2026 接收的论文发现,给多模态模型添加工具会削弱其拒绝有害请求的能力,在其测试的所有模型上均成立,拒绝失败率相对上升最高 68.7%,平均上升 17.7%。
TechCrunch · AIAI 评分Common Sense Media 测评称 ChatGPT for Teens 存在不可接受风险,OpenAI 反驳方法论
Common Sense Media 发布报告,将 OpenAI 8 月推出的 ChatGPT for Teens 评为“不可接受风险”,称其设计在危机情境中仍持续鼓励用户继续聊天,五项红线危害中有三项评分为不及格。
AWS Machine Learning BlogAI 评分用 Amazon Quick 和 Amazon Bedrock Knowledge Bases 重新思考 RAG 访问控制
Amazon Quick 和 Amazon Bedrock Knowledge Bases 通过两阶段实时 ACL 校验解决 RAG 权限难题:先用索引内缓存 ACL 做预检索过滤,再在查询时调用 Google Drive 等权威源 API 实时核验候选文档,仅将已授权内容传给 LLM。
GitHub Blog · AI & ML精选AI 评分GitHub 发布 ModernBERT 密钥分类器,推送拦截可在 2 毫秒内评估候选密钥
GitHub 发布与 Microsoft Applied Sciences 合作微调的 ModernBERT 密钥分类器,能在 2 毫秒内评估一批候选密钥,使可拦截的密钥数量翻倍以上。
推荐理由:原文用九个季度数据拆解了泄露密钥随代码量增长的成因,并给出新模型如何在推送环节拦截,读者可据此理解平台侧防护的思路转变。
netflix@netflixAI 评分
TechCrunch · AIAI 评分Meta 推出新 AI 工具检测引流至儿童性虐待材料的广告
Meta 宣布推出新 AI 工具,用于发现可能暗中将用户引导至非法儿童性虐待材料的广告和账号,同时公布 2026 年上半年在 Facebook 和 Instagram 上处置了 3320 万条儿童性剥削内容,其中超过 97% 在用户举报前由系统检出。
natolambert@natolambertAI 评分
The DecoderAI 评分Anthropic 扩大 Claude Cyber Verification Program 访问范围并降低安全限制
Anthropic 将其 Cyber Verification Program(CVP)向更广泛的安全专业人员开放,为经过审核的组织和独立研究人员提供访问 Claude 最强模型的权限,并降低安全过滤,用于漏洞研究、恶意软件分析、事件响应和渗透测试。