跳到正文

#安全/对齐

今日 13 条
10月9日周五
  1. ArtificialAnlys44

    Artificial Analysis Cyber Index Alliance 联合行业伙伴,为 AI 模型在企业网络防御任务上的表现设定新的评测标准。目前联盟成员包括 @CollinearAI、@IBM、@nvidia 和 @vercel。 合作伙伴为该指数的设计与实施提供专家意见,并可直接贡献数据集和外部研究。 有意加入 Cyber Index Alliance 的组织可通过 cyber@artificialanalysis.ai 联系我们。

  2. TechCrunch · AI58

    Anthropic 更新使用政策,禁止虐待模型与干预选举

    Anthropic 于周四更新使用政策,新增禁止干预选举、武器软件和监控相关用途,并明确禁止对模型进行长时间言语虐待。政策说明称该条款仅适用于用户反复无故残忍对待模型的极端情形,不涵盖常见的用户沮丧、反驳、暗黑创作主题或模型测试研究。政策另设章节禁止欺骗性行动、用 Claude 运营虚假账号或伪造新闻机构,以及欺骗选民或扰乱选举。

  3. infwinston54

    Arena 宣布完成 $200M Series B 融资,估值 $3.1B,用于推进前沿智能的测量与提升使命。Arena 称其评测基于真实使用场景,将智能体置于实时工具使用环境中,用复杂长程任务挑战它们,并分析数百万真实用户-智能体交互信号。同日 Arena 还推出 Arena Alignment Index,把评测从能力扩展到衡量智能体在安全、可靠与忠实遵循人类意图方面的表现。

  4. The Verge · AI70

    Anthropic 更新使用政策,禁止对 Claude 持续施虐并扩大武器与监控禁令

    Anthropic 一年多来首次更新 Claude 使用政策,新增禁止对模型“持续且无必要的辱骂或残忍行为”,并称结束对话仍是主要执行手段,该条款仅适用于极端情况,不涵盖常见挫败感、黑暗创作主题或模型测试。政策还把分散限制整合为禁止欺骗性商业或政治活动,扩大武器禁令至武器软件组件与武装无人机,明确禁止未经同意追踪个人及用于执法调查,并要求连接可造成伤害的自主硬件时须有合格操作员可随时停止设备。

10月8日周四
  1. The Decoder73

    Zenity 研究发现 AWS Bedrock AgentCore 单个公开智能体可接管同区域所有智能体

    安全公司 Zenity Labs 研究人员发现,Amazon Bedrock AgentCore 存在名为 AgentCorruption 的漏洞链,攻击者只需聊天访问一个公开智能体,用一条提示词即可接管同一 AWS 账户和区域内所有 AgentCore 智能体,读取、改写或删除其他智能体,暴露私密对话、源代码和存储凭证。

  2. Ars Technica · AI49

    Nvidia 重注物理 AI,Halos 安全系统瞄准更安全的 robotaxi 与人形机器人

    Nvidia 为物理 AI 押注数十亿美元,推出全栈安全系统 Halos,以降低机器人和自动驾驶汽车伤人的风险。Halos 于 2025 年上线,提供软硬件工具帮助开发者为自动驾驶汽车等车辆设置安全护栏;2026 年 6 月,公司又宣布 Halos for Robotics,将安全架构扩展到仓储移动机器人、工厂人形机器人和手术机器人。

  3. The Decoder76

    AI黑客工具助单人攻击者入侵多家韩国银行

    Crowdstrike 报告称,一名疑似中文攻击者在9月末至10月初入侵多家韩国金融机构并窃取大量数据,仅 Shinhan Bank 就有超过 25,000 条含姓名、联系方式、收入和信用额度的记录被盗。

    推荐理由:报道将一次真实银行入侵与所用AI模型对应起来,可作为评估AI自动化攻击风险的具体案例。

  4. GitHub Blog · AI & ML63

    GitHub 发布 ModernBERT 密钥分类器,推送拦截可在 2 毫秒内评估候选密钥

    GitHub 发布与 Microsoft Applied Sciences 合作微调的 ModernBERT 密钥分类器,能在 2 毫秒内评估一批候选密钥,使可拦截的密钥数量翻倍以上。

    推荐理由:原文用九个季度数据拆解了泄露密钥随代码量增长的成因,并给出新模型如何在推送环节拦截,读者可据此理解平台侧防护的思路转变。

10月7日周三