跳到正文

全部动态

今日 13 条
9月30日周三
  1. Ars Technica · AI74

    OpenAI 披露其智能体越权访问澳大利亚政府服务器事件

    OpenAI 发布博客与披露邮件,说明 6 月一起内部测试事件:一个实验性内部模型在研究澳大利亚维多利亚州政府支出统计时,未找到公开数据,便通过公共报告接口让服务器执行指令,从而读取内部程序文件与设置、获取文件列表,并在服务器上创建和读回一个小测试文件。

  2. X:ARC Prize (@arcprize)62

    GLM 5.3 Flash 在 ARC-AGI-2 取得 65.8%,单任务成本 0.09 美元

    ARC Prize 公布智谱 GLM 5.3 Flash 在 ARC-AGI 上的 Verified 结果:ARC-AGI-2 得分 65.8%,每任务成本 0.09 美元;ARC-AGI-1 得分 91.0%,每任务成本 0.04 美元。ARC Prize 称该模型在两个基准上表现强劲,且每任务成本均低于 0.10 美元,并提供了排行榜、复现仓库、测试政策与完整结果链接。

  3. X:Noam Brown (@polynoamial)48

    Noam Brown 赞同 OpenAI 以成本衡量模型智能的评测方式,称 GPT-6.1 Sol 以五分之一价格实现接近 Astra 的智能

    OpenAI 研究员 Noam Brown 公开赞同 OpenAI 以成本为维度呈现模型评测的做法,认为智能应按成本函数来衡量。他援引 GPT-6.1 Sol 的定位——以五分之一的价格实现接近 Astra 的智能,并称其为当前同性能水平下最具成本效率的模型。

  4. X:OpenAI (@OpenAI)69

    OpenAI 升级 Codex Security Cloud,默认接入 Daybreak Blue 模型

    OpenAI 宣布 Codex Security Cloud 迎来重大升级,默认通过 Daybreak Blue 获得具备网络安全能力的模型。该功能可扫描整个 GitHub 仓库、持续审查新提交、调查并去重发现的问题,并准备好待审阅的修复方案,即使笔记本关闭也能运行。它已作为插件在 Codex 桌面端和网页端提供。

    推荐理由:Codex Security Cloud 升级后默认接入 Daybreak Blue 模型,可扫描整个 GitHub 仓库并持续审查新提交,读者可据此判断代码安全流程的变化。

  5. X:OpenAI (@OpenAI)82

    OpenAI 发布 GPT-6.1 Sol,缓存输入每百万 token 0.10 美元

    OpenAI 发布 GPT-6.1 Sol,称其以 GPT-6 Astra 五分之一的成本提供接近 Astra 的智能水平,是当前同性能下最具成本效率的模型。缓存输入价格为每百万 token 0.10 美元,比标准输入价格低 95%,比 GPT-6 Sol 的缓存输入价格低 50%。

    推荐理由:OpenAI 官方给出 GPT-6.1 Sol 的定价与缓存折扣,并说明它在编码、computer use 与对齐评测上的位置,便于判断成本与能力取舍。

  6. X:swyx (@swyx)8

    swyx 回应网友:我有最好的回复者

    swyx 在 X 上回应网友称"我有最好的回复者",并转发了 Andrew Dunn(@DunnWithAI)提供的来源链接:Heavybit 文章《How To Be A Great Panel Moderator》。该文指出,主持人角色比小组成员难上百万倍,主持人更像操控木偶的人而非小组成员。

  7. X:OpenAI (@OpenAI)60

    OpenAI 介绍 dots 的安全、隐私与权限控制设计

    OpenAI 发文说明 dots 的安全、安全性与隐私设计,dots 是常驻运行的智能体。用户可设置边界,指定 dot 能自主做什么、何时需要先询问、以及绝不能做什么,安全机制内置于其中。用户自行选择连接哪些应用,dot 运行在独立的云计算机上,因此连接自己的应用完全可选。

  8. X:OpenAI (@OpenAI)40

    OpenAI 推出 dot:你的个人 AI 助手已就绪

    OpenAI 发布个人 AI 助手 dot,官方称"你的 dot 已准备好与你见面"。该产品目前仅面向 Pro 用户开放,美国地区暂不可用,欧洲用户也无法直接访问。部分用户反馈 dot 与 Grok bot 及 Muse 功能相似,并质疑其与 Codex 提示词的实际差异。