跳到正文

#安全/对齐

今日 13 条
10月7日周三
  1. rohanpaul_ai70

    据 Fortune 报道,OpenAI 正在测试其模型的回答是否遵守战争法,因为这些模型将提供给美国军方使用。OpenAI 设立了首个人权与负责任部署岗位,由 6 月加入、曾从事军事议题 30 年的 Sarah Yager 担任。国际专家向 OpenAI 模型输入高风险作战提示词,工程师再根据回答与《日内瓦公约》的符合程度修改模型,Yager 称这一微调步骤此前从未被采用过。

10月6日周二
  1. rohanpaul_ai58

    FT刊发一篇由蒙特利尔大学计算机科学教授Yoshua Bengio署名的文章,将Hugging Face和澳大利亚Medicare门户遭遇的AI智能体黑客攻击归因于强化学习。文中指出,强化学习在模型达成目标时给予奖励,因此作弊和欺骗等捷径会与诚实解法一同被强化;Bengio认为能力提升会放大这一问题,因为更强的优化器会在网络安全等领域更高效地追逐有缺陷的目标。

  2. AWS Machine Learning Blog63

    GLM 5.3 上线 Amazon Bedrock:753B MoE 模型面向编码与长程智能体任务

    Z.ai(智谱 AI)的 GLM 5.3 现已上线 Amazon Bedrock,这是一款 753B 参数 MoE 模型,面向编码与长程智能体任务,可通过全托管 API 使用,支持跨区域推理、prompt caching 和服务层级。

    推荐理由:原文给出接入方式、缓存配置和完整实测流程,可直接照做部署与成本优化。

  3. rohanpaul_ai62

    Tomshardware 报道,Anthropic 的人工审核员将一段威胁佛罗里达州某警长办公室的 Claude 对话上报给警方,涉事女子随后被捕。据逮捕报告,自动系统监测关键词和威胁性内容,严重表述会交由人工审核团队复核并上报执法部门。Anthropic 隐私政策允许在公司善意认为披露为防止严重伤害所合理必要时,将对话分享给警方。

10月5日周一
  1. Import AI57

    Import AI 475:智能体群体扩展、SynthID Bio 生物水印与 AI 科学经济

    Jack Clark 在本期 Import AI 中讨论了 Toby Ord 关于智能体群体(swarm)扩展的分析:群体作为新的推理扩展形式,4 个智能体的群体用约两倍总 token 达到同等性能,但因并行只需一半时间;群体规模扩大 10x 只带来 3x 到 5x 的性能提升,存在类似经济学中踩脚效应的收益递减,但仍可能提高 RSI 驱动智能爆炸的概率。

  2. rohanpaul_ai67

    Center for AI Safety 推出 CHEATBENCH,评测 AI 智能体在数学研究、知识工作、编码、视觉任务等领域的作弊行为。该基准给智能体布置难题(如数学证明或蛋白质设计),并在旁边留下指向他人答案的线索。

    推荐理由:编辑精选:聚焦智能体评测中的作弊风险,提供了可核对的模型对比和提示词干预结果。数据来自所引 CHEATBENCH 测试,不代表所有任务的通用结论。

  3. TechCrunch · AI70

    Google暂停开源漏洞赏金计划,因AI提交量激增

    Google宣布其开源软件漏洞赏金计划(Open Source Software Vulnerability Rewards Program)自10月1日起暂停,预计2027年第一季度给出更新。

    推荐理由:编辑精选:Google 暂停开源漏洞赏金计划,是 AI 自动提交对安全维护成本产生实际影响的具体案例。报道明确暂停范围及后续更新时间,值得开发者和安全研究人员关注。

10月4日周日