跳到正文

全部动态

今日 197 条
9月30日周三
  1. Simon Willison62

    Anthropic 红队:GLM-5.3 在 100 项漏洞利用任务中 4% 实现完整控制流劫持

    Anthropic Frontier Red Team 在内部 Binary Exploitation 基准的 100 项任务中随机抽取评测,发现 GLM-5.3 在 4% 的试验中实现完整控制流劫持,Claude Mythos Preview 为 6%。报告指出,此前模型如 Claude Opus 4.6 和 GLM-5.2 在这些任务中均未成功,说明一个有意义的能力门槛已被跨过。

  2. natolambert44

    Nathan Lambert 发文批评 Anthropic 等美国前沿实验室的安全观,认为其暗示 Z ai 的 GLM-5.3 缺乏安全措施、可能被用于网络攻击的说法站不住脚——已记录的网络攻击中闭源模型被使用的更多。他提出"开源不安全、闭源也不安全"的替代观点:闭源模型能力更强,若双方防护都有漏洞,能力差距反而可能放大净危害。他同时承认,缺乏极端网络防护的开源模型对快速普及网络防御能力很重要。

  3. Ars Technica · AI34

    针对 OpenAI 的抗议活动越来越有创意

    针对 OpenAI 的抗议活动正变得越来越有创意,抗议者用尽可能少走捷径的手工创作表达对 AI 生成艺术的反对。上周有人在 OpenAI 纽约办公室外抗议,本周一 OpenAI 最新模型 GPT-6.1 Astra 的训练因安全担忧被叫停,公司还就未经授权访问澳大利亚政府网站致歉,佛罗里达州则请求法院叫停 OpenAI 的开发。

  4. AWS Machine Learning Blog74

    GPT-6.1 Sol 在 Amazon Bedrock 正式可用

    GPT-6.1 Sol 现已在 Amazon Bedrock 正式可用,面向智能体编码、计算机使用和专业工作负载提供更强的推理能力。据 OpenAI 称,它在 DeepSWE v1.1 上达到 GPT-6 Astra 的水平,每任务成本约为其五分之一,并比 GPT-6 Sol 的最佳成绩高出 6.4 个百分点。

    推荐理由:原文给出 GPT-6.1 Sol 在 Bedrock 上的可用范围与成本对比,读者可据此判断智能体编码任务的性价比。