跳到正文
2026 年第 40 周 · 09.28 — 10.04每周一出刊

AI 周报 · 2026 年第 40 周 · 09.28 — 10.04

灵耀AI热点

第 1 期402026 年第 40 周09.28 — 10.04
6件大事5条精选1期日报约 3 分钟读完
本期导读

Claude Opus 5 会计全对,Sonnet 5.5 霸榜

本期覆盖 2026-09-28 至 2026-10-04。Anthropic 成为本期焦点:Claude Opus 5 在会计任务研究中 20 题全对,远超 12 名注册会计师;Claude Sonnet 5.5 (Max) 在 Agent Arena 首发升至第 3,Anthropic 包揽前三;Sonnet 5.5 亦与 GPT-6.1 Sol、Gemini 4 Argon 在 Artificial Analysis 编码智能体指数登顶,但成本差异显著。评测方法也在演进,微软与 Hugging Face 发布 ThinkingBox,按数据库终态而非生成文本给智能体打分。图像生成方面,Black Forest Labs 的 FLUX 3 Image 在 fal 上线,主打精准编辑与 2K/4K 生成。

01

Anthropic 模型全面领跑

本版导读Anthropic 本期多线开花:Claude Opus 5 在中等长度、定义明确的会计任务研究中 20 题全对、正确率 100%,每题几分钟内完成,优于研究中表现最好的会计师,而 12 名注册会计师正确率从 0% 到约 90% 不等;Claude Sonnet 5.5 (Max) 在 Agent Arena 首发排名第三、净提升 +12.5%,较 Claude Sonnet 5 (High)(第 13 名,+4.4%)高出 8.1 个百分点,Anthropic 包揽前三;Sonnet 5.5 亦在编码智能体指数登顶。

Rohan Paul10.02

研究显示 Claude Opus 5 在会计任务上 20 题全对,12 名注册会计师正确率 0% 至约 90%

一项针对中等长度、定义明确的会计任务的研究发现,前沿 AI 模型比初级会计师更快更准确,甚至优于研究中表现最好的会计师。Claude Opus 5 在 20 道题中取得 20 题全对、正确率 100%,每题几分钟内完成;12 名持证注册会计师的正确率从 0% 到约 90% 不等,其中数人用完了 3 小时时限。研究还提到,18 个月前这些模型在同类任务上的得分远低于人类会计师。

02

智能体评测转向终态

本版导读微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,通过隔离的 MCP 工具会话运行智能体,按终端后端状态和副作用而非生成文本打分,覆盖 507 个有状态业务流程、每个任务重复运行 20 次。这一方法把评测焦点从模型说了什么转向实际做成了什么,为智能体能力评估提供了更贴近真实业务的基准。

03

图像生成主打精准编辑

本版导读Black Forest Labs 的 FLUX 3 Image 在 fal 平台上线,主打精准图像编辑,保留未修改部分。该模型支持原生 2K 和 4K 图像生成,最多可组合 10 张参考图,能在一次生成中完成多处定向编辑,并对布局和构图提供细致控制,面向需要精细操控的专业创作场景。

fal10.02

Black Forest Labs 的 FLUX 3 Image 在 fal 上线

Black Forest Labs 的 FLUX 3 Image 已在 fal 平台上线,主打精准图像编辑,保留未修改部分。该模型支持原生 2K 和 4K 图像生成,最多可组合 10 张参考图,能在一次生成中完成多处定向编辑,并对布局和构图提供细致控制。

(本期完)

灵耀AI热点 周报由编辑系统根据公开来源自动综合,每条均附原文 · 往期周报