智能体写应用代码,但出问题时你凌晨 2 点还是得被叫醒。 我们想知道 AI 能否也处理这部分工作。 推出 Incident Arena:一个让编码智能体值班的基准! 查看下方论文与完整数据集发布!
#评测/基准
#评测/基准
andrezfu@andrezfuAI 评分 thoughtfullab@thoughtfullabAI 评分 arena@arenaAI 评分 karinanguyen@karinanguyenAI 评分 Gemini 4 在 PostTrainBench 上达到 45.3%,是 Gemini 3.1 Pro 21.99% 的两倍多,并超过 GPT-6 Astra 🔥
ml_angelopoulos@ml_angelopoulosAI 评分 Arena 发文称 Google 已在 Text Arena 升至第 1 名,并成为 Code Arena 的前三供应商之一。
arena@arenaAI 评分 Gemini 4 Argon (High) 在 Text Arena 以 1525 分排名第一,在 Code Arena: WebDev 以 1679 分排名第八。
aipulseda1ly@aipulseda1lyAI 评分 Yuchenj_UW@Yuchenj_UWAI 评分 Google 回来了??? 全面超越 Astra 和 Opus 5.5。 如果这不只是刷榜,我很乐意看到他们重新加入竞争。
ArtificialAnlys@ArtificialAnlys精选AI 评分 推荐理由:原文给出智能指数、成本和幻觉率的横向对比,读者可据此判断新模型相对竞品的性价比位置。
arcprize@arcprizeAI 评分 arcprize@arcprizeAI 评分 arcprize@arcprizeAI 评分 ARC Prize 指出 GPT-6.1 Sol 与 GPT-6 Astra 类似,在 ARC-AGI-3 上推理等级越高决策越好,完成关卡所需动作越少,从而降低总推理成本。
andonlabs@andonlabsAI 评分 ValsAI@ValsAIAI 评分 Gemini 首次登上 Vals Index 榜首。 Gemini 4 Argon 以 68.9% 占据 Vals Index 第 1 名。
turbopuffer@turbopufferAI 评分 perplexity_ai@perplexity_aiAI 评分 perplexity_ai@perplexity_aiAI 评分 MTSlive@MTSliveAI 评分
TencentHunyuan@TencentHunyuanAI 评分 cohere@cohereAI 评分 Hugging Face BlogAI 评分
Hugging Face 推出 Open TTS Leaderboard:面向多语言 TTS 与声音克隆的可扩展评测
Hugging Face 发布 Open TTS Leaderboard,用客观指标评测开源多语言 TTS 与声音克隆模型,单模型评测耗时从数周投票缩短到数小时。
gen_obligation@gen_obligationAI 评分 在 max 模式下结果更令人印象深刻!6.1 sol 的表现超过了 Opus 5.5,同时使用的 token 少了 4 倍。
arcprize@arcprizeAI 评分 arcprize@arcprizeAI 评分 arcprize@arcprizeAI 评分 arcprize@arcprizeAI 评分 polynoamial@polynoamialAI 评分 X:Francois Chollet (@fchollet)AI 评分 如何测试 AI 的人类级通用性?Francois Chollet 提出 ARC-AGI-(n+1) 元基准
Francois Chollet 提出以"发布即通过 ARC-AGI-(n+1)"作为测试 AI 人类级通用性的元基准,该观点引自 Dylan T. Moore 的表述。Moore 同时指出,这一标准大概不会永远成立。
CompleteSkeptic@CompleteSkepticAI 评分 AndrewYNg@AndrewYNgAI 评分
arcprize@arcprizeAI 评分 ARC Prize 公布 ARC-AGI-3 新的高分纪录为 45.33%,此前纪录为 27.29%,由 @tufalabs 创造并重新夺回第一名。
Thom_Wolf@Thom_WolfAI 评分 Simon Willison精选AI 评分 Anthropic 发布 Claude Sonnet 5.5,速度提升 30% 以上
Anthropic 发布新 Sonnet 模型 Claude Sonnet 5.5,官方称其运行速度快 30% 以上,多数工作成本最多降低 30%,定价与 Sonnet 5 相同但在各项基准上均优于后者。
推荐理由:作者实测了 Sonnet 5.5 的思考预算与免费层表现,可据此了解它在编码任务上的定位与成本取舍。
ClaudeDevs@ClaudeDevsAI 评分 claudeai@claudeaiAI 评分 arcprize@arcprizeAI 评分 arcprize@arcprizeAI 评分 arcprize@arcprizeAI 评分 Yuchenj_UW@Yuchenj_UWAI 评分 pwendell@pwendellAI 评分