跳到正文

#Agent

今日 4 条
9月29日周二
  1. X:Yuchen Jin (@Yuchenj_UW)62

    Databricks 用 GPT-6 Astra 与 Opus 5 智能体登顶 NVIDIA SOL-ExecBench 内核榜四赛道

    Databricks 在 NVIDIA 的 SOL-ExecBench 内核排行榜上排名第一,覆盖全部 4 个赛道。团队把 GPT-6 Astra 和 Opus 5 放进自我爬坡循环,智能体表现超过顶尖 GPU 内核工程师,总 token 花费约 7 万美元,远低于内核工程师的薪酬。作者提到一个发现,GPT-6 Astra 和 Opus 5 在编写 GPU 内核上仍明显优于开源模型。

  2. X:Andrew Milich (@milichab)60

    Grok Bot 推出 Team Bots,可在 Slack 中共享上下文

    Grok Bot 推出 Team Bots,机器人会监听 Slack 中的消息并静默收集上下文,而不是对每条消息都作出回应。作者称团队已把更多 grok.com 开发工作转移到 Slack,机器人写代码和给出新洞察时都会把结果回流到项目共享上下文,团队成员无需在各自机器上重建上下文。

  3. OpenAI News62

    OpenAI 推出主动式助手 dots

    OpenAI 发布 dots,将其定义为可跨复杂项目和日常任务持续推进的主动式助手。官方说明 dots 让用户在任务推进过程中保持控制权,具体能力与开放方式尚未在摘要中给出。

    推荐理由:OpenAI 官方给出 dots 的定位与可控性说明,读者可据此判断这类主动式助手与现有工具的分工。

  4. X:Claude Devs (@ClaudeDevs)58

    Claude 支持构建评测并对其做 hillclimb

    Claude 现在可以帮助用户构建评测(eval)并对其做 hillclimb。官方文章分享了评测设计的原则,以及 Claude Code 中 claude-api 技能的 build-eval 和 hillclimb 命令如何把这些原则落地,用于改进应用。原文链接:https://claude.dev/blog/automating-eval-design-and-hillclimbing/

  5. X:Cognition (@cognition)66

    Devin Desktop 与 Devin CLI 上线 Claude Sonnet 5.5

    Claude Sonnet 5.5 现已在 Devin Desktop 和 Devin CLI 中可用,在 FrontierCode 1.1 Main 上得分 64.4%,高于 Sonnet 5 的 56.2%,并超过 Fable 5.1 的 extra high reasoning effort 表现。

    推荐理由:Devin 上线 Claude Sonnet 5.5,并给出 FrontierCode 1.1 分数与成本变化,可据此判断编码智能体的性价比。

  6. X:Cognition (@cognition)65

    Claude Sonnet 5.5 上线 Devin Desktop 与 Devin CLI

    Cognition 宣布 Claude Sonnet 5.5 已在 Devin Desktop 和 Devin CLI 中可用,在 FrontierCode 1.1 Main 上得分 64.4%,高于 Sonnet 5 的 56.2%,并在 extra high reasoning effort 下超过 Fable 5.1。

    推荐理由:Devin 上线 Claude Sonnet 5.5 并给出 FrontierCode 1.1 分数与 Sonnet 5 的对比,可据此判断编码智能体的模型选择。

  7. X:Grok Bot (@bot)62

    xAI 推出 Team Bots,面向 Teams 和 Enterprise 开放公开测试

    xAI 宣布 Team Bots 进入公开测试,面向 Teams 和 Enterprise 用户开放。据其介绍,Team Bots 在 xAI 内部用于每天为客户团队做准备、协调工程工作、回答数据问题、分类客户反馈以及运行招聘流程。用户可向 Grok Bot 提供文件、应用和专业知识,再分享给团队,让成员基于同一上下文协作,详情见 x.ai/news/team-bots。

  8. X:Claude Devs (@ClaudeDevs)78

    Anthropic 发布 Claude Sonnet 5.5,比 Sonnet 5 快 30% 且成本最多降 30%

    Anthropic 发布 Claude 5.5 家族的第二款模型 Claude Sonnet 5.5,官方称其比 Sonnet 5 更聪明、更高效,运行速度提升超过 30%,大多数工作的成本最多降低 30%。该模型适合修复 bug、快速迭代功能等范围明确的日常任务,成本下降也让 Claude Code 的用量更耐用。

    推荐理由:Claude Sonnet 5.5 给出速度与成本的具体变化,读者可据此判断日常编码任务的开销与效率。

9月28日周一
  1. X:DAIR.AI (@dair_ai)71

    新研究:个人智能体推断用户富有后推荐更贵选项,13 个模型跑 32.5 万次实验

    一项新研究测试个人智能体在航班、健康保险和研究生项目上的推荐行为,在 13 个模型上运行了 32.5 万次实验。当请求完全相同时,8 个模型为被推断为富有的用户选择了更贵的选项,Claude Opus 4.8 的差距达到每张机票 198 美元、每月保险 284 美元;富有的用户要求最便宜航班时,Gemini 2.5 Flash 仍选了高出 208 美元的选项。