AI 周报 · 2026 年第 40 周 · 09.28 — 10.04
Claude Opus 5 会计全对,Sonnet 5.5 霸榜
本期覆盖 2026-09-28 至 2026-10-04。Anthropic 成为本期焦点:Claude Opus 5 在会计任务研究中 20 题全对,远超 12 名注册会计师;Claude Sonnet 5.5 (Max) 在 Agent Arena 首发升至第 3,Anthropic 包揽前三;Sonnet 5.5 亦与 GPT-6.1 Sol、Gemini 4 Argon 在 Artificial Analysis 编码智能体指数登顶,但成本差异显著。评测方法也在演进,微软与 Hugging Face 发布 ThinkingBox,按数据库终态而非生成文本给智能体打分。图像生成方面,Black Forest Labs 的 FLUX 3 Image 在 fal 上线,主打精准编辑与 2K/4K 生成。
Anthropic 模型全面领跑
本版导读Anthropic 本期多线开花:Claude Opus 5 在中等长度、定义明确的会计任务研究中 20 题全对、正确率 100%,每题几分钟内完成,优于研究中表现最好的会计师,而 12 名注册会计师正确率从 0% 到约 90% 不等;Claude Sonnet 5.5 (Max) 在 Agent Arena 首发排名第三、净提升 +12.5%,较 Claude Sonnet 5 (High)(第 13 名,+4.4%)高出 8.1 个百分点,Anthropic 包揽前三;Sonnet 5.5 亦在编码智能体指数登顶。
研究显示 Claude Opus 5 在会计任务上 20 题全对,12 名注册会计师正确率 0% 至约 90%
一项针对中等长度、定义明确的会计任务的研究发现,前沿 AI 模型比初级会计师更快更准确,甚至优于研究中表现最好的会计师。Claude Opus 5 在 20 道题中取得 20 题全对、正确率 100%,每题几分钟内完成;12 名持证注册会计师的正确率从 0% 到约 90% 不等,其中数人用完了 3 小时时限。研究还提到,18 个月前这些模型在同类任务上的得分远低于人类会计师。
Claude Sonnet 5.5 (Max) 在 Agent Arena 首发排名第三,Anthropic 包揽前三
Claude Sonnet 5.5 (Max) 在 Agent Arena 首发升至第 3 名,净提升 +12.5%,较 Claude Sonnet 5 (High)(第 13 名,+4.4%)高出 8.1 个百分点。
Artificial Analysis 编码智能体指数:Claude Sonnet 5.5、GPT-6.1 Sol 与 Gemini 4 Argon 登顶但成本差异显著
Artificial Analysis 的 Coding Agent Index 显示,本周发布的 Claude Sonnet 5.5、GPT-6.1 Sol 和 Gemini 4 Argon 均接近榜单前列,但性能与成本平衡各不相同。
智能体评测转向终态
本版导读微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,通过隔离的 MCP 工具会话运行智能体,按终端后端状态和副作用而非生成文本打分,覆盖 507 个有状态业务流程、每个任务重复运行 20 次。这一方法把评测焦点从模型说了什么转向实际做成了什么,为智能体能力评估提供了更贴近真实业务的基准。
微软与 Hugging Face 发布 ThinkingBox:按数据库终态而非生成文本给 AI 智能体打分
微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,通过隔离的 MCP 工具会话运行智能体,按终端后端状态和副作用而非生成文本打分,覆盖 507 个有状态业务流程、每个任务重复运行 20 次。
图像生成主打精准编辑
本版导读Black Forest Labs 的 FLUX 3 Image 在 fal 平台上线,主打精准图像编辑,保留未修改部分。该模型支持原生 2K 和 4K 图像生成,最多可组合 10 张参考图,能在一次生成中完成多处定向编辑,并对布局和构图提供细致控制,面向需要精细操控的专业创作场景。
Black Forest Labs 的 FLUX 3 Image 在 fal 上线
Black Forest Labs 的 FLUX 3 Image 已在 fal 平台上线,主打精准图像编辑,保留未修改部分。该模型支持原生 2K 和 4K 图像生成,最多可组合 10 张参考图,能在一次生成中完成多处定向编辑,并对布局和构图提供细致控制。