跳到正文

#OpenAI

今日 57 条
今天10月3日周六
  1. X:Karina Nguyen(@karinanguyen)41

    Repovive 数学竞赛 AI 判卷评测:GPT 与 Claude 模型评判数学证明的能力对比

    Repovive 联合 IOI、IMO、ICPC 决赛选手评测 AI 判卷能力,从数学竞赛中选出 534 份可疑或边缘提交,建立统一评分标准与专家参考判断。模型整体偏严,更常拒绝有效提交;清晰指令让 GPT 模型平均提升约 2 个百分点,加入评分示例后 Claude 平均提升约 10 个百分点、GPT 约 5 个百分点。Grok 几乎拒绝一切,仅接受 1–5% 提交,而金标准接受 64.4%。

  2. X:Arena (@arena)66

    GPT-6.1 Sol 进入 Agent Arena 第 5 名,重塑帕累托前沿

    Arena 宣布 OpenAI 的 GPT-6.1 Sol (Max) 进入 Agent Arena 第 5 名,提升 11.23%,并重塑帕累托前沿。其单任务中位成本为 $0.56,比 GPT-6 Sol 低 39% 且得分高 1.52 分,比 GPT-6 Astra 低 81% 且得分差距 1.04 分。

    推荐理由:Agent Arena 榜单显示 GPT-6.1 Sol 以更低单任务成本进入前五,读者可据此比较它与 GPT-6 Sol、Claude 系列的性价比差距。

  3. TechCrunch · AI28

    TechCrunch Equity 播客:只有 2% 消费者在为 AI 买单

    TechCrunch Equity 播客本期讨论白宫 AI 安全承诺与"超级智能"行政令,以及消费级 AI 的经济账:只有 2% 消费者真正买单,AI 最大的钱仍来自企业市场。节目还谈及 Oura 撤回 IPO、Anthropic 泄露的 S-1、OpenAI 回归私募融资,以及 Quartermaster 1.4 亿美元融资、Atomic 已承接 DoorDash 90% 采购等交易。

10月2日周五
  1. The Verge · AI30

    ChatGPT 模型幻觉正让顾客变得更难缠

    餐厅、零售等一线服务人员反映,越来越多顾客拿 ChatGPT 的说法反驳专业建议,甚至无视过敏原警告。纽约服务员 Madison 称有客人坚持点含贝类的高汤鱼菜,理由是 ChatGPT 说没有贝类;酒侍也常被顾客用 ChatGPT 取代。Meta 新 AI 智能体 Muse 的推出可能加剧这一问题。

10月1日周四
  1. Latent Space78

    Google DeepMind 发布 Gemini 4 Argon,支持 1M token 输出

    Google DeepMind 推出 Gemini 4 Argon,面向编码、企业知识工作与网络防御,首批开放给 Fairwind 计划的政府用户与可信网络安全人员,后续再向开发者、企业和消费者开放。

    推荐理由:汇总了 Gemini 4 Argon 的基准、定价与可用范围,并列出同期多家模型与工具的动态,便于横向比较。

  2. X:Tibo (@thsottiaux)71

    ChatGPT Sites 支持托管 MCP 服务器并一键安装插件

    ChatGPT 现在可以直接构建和部署 MCP 服务器,并限制访问范围或公开分享。ChatGPT Sites 新增托管 MCP 服务器能力,支持插件扩展,用户通过 @sites 指令即可创建带扩展的 MCP 服务器、部署到 Sites、转为插件并自动安装到网页、移动端和桌面端。作者称 ChatGPT 正在成为任何人都能按需定制的可塑软件。

  3. X:ARC Prize (@arcprize)50

    ARC Prize:GPT-6.1 Sol 在 ARC-AGI-3 上更高推理档位决策更优、推理成本更低

    ARC Prize 称 GPT-6.1 Sol 在 ARC-AGI-3 上提高推理档位后决策更优,完成关卡所需动作更少,从而降低了总推理成本。在 sk48 上,使用 provider adapter(保留跨轮不透明推理状态并支持自动压缩)时,max reasoning 的 GPT-6.1 Sol 以 463 个动作完成游戏,而 low reasoning 用了 1,078 个。