跳到正文

Anthropic / Claude

Anthropic 的全部动态:Claude 系列模型、Claude Code、安全研究路线与公司进展的持续追踪。

最新精选

第 1–6 条 · 共 6 条
今天10月3日周六
  1. X:Rohan Paul (@rohanpaul_ai)78

    研究显示 Claude Opus 5 在会计任务上 20 题全对,12 名注册会计师正确率 0% 至约 90%

    一项针对中等长度、定义明确的会计任务的研究发现,前沿 AI 模型比初级会计师更快更准确,甚至优于研究中表现最好的会计师。Claude Opus 5 在 20 道题中取得 20 题全对、正确率 100%,每题几分钟内完成;12 名持证注册会计师的正确率从 0% 到约 90% 不等,其中数人用完了 3 小时时限。研究还提到,18 个月前这些模型在同类任务上的得分远低于人类会计师。

9月30日周三
9月29日周二
  1. X:Cognition (@cognition)66

    Devin Desktop 与 Devin CLI 上线 Claude Sonnet 5.5

    Claude Sonnet 5.5 现已在 Devin Desktop 和 Devin CLI 中可用,在 FrontierCode 1.1 Main 上得分 64.4%,高于 Sonnet 5 的 56.2%,并超过 Fable 5.1 的 extra high reasoning effort 表现。

    推荐理由:Devin 上线 Claude Sonnet 5.5,并给出 FrontierCode 1.1 分数与成本变化,可据此判断编码智能体的性价比。

  2. X:Cognition (@cognition)65

    Claude Sonnet 5.5 上线 Devin Desktop 与 Devin CLI

    Cognition 宣布 Claude Sonnet 5.5 已在 Devin Desktop 和 Devin CLI 中可用,在 FrontierCode 1.1 Main 上得分 64.4%,高于 Sonnet 5 的 56.2%,并在 extra high reasoning effort 下超过 Fable 5.1。

    推荐理由:Devin 上线 Claude Sonnet 5.5 并给出 FrontierCode 1.1 分数与 Sonnet 5 的对比,可据此判断编码智能体的模型选择。