#评测/基准
#评测/基准
ArtificialAnlys@ArtificialAnlysAI 评分 arena@arenaAI 评分 深入阅读我们的博客中的完整技术报告:bit.ly/4hQP3xO,并在我们的 Alignment Index 中查看完整排名:bit.ly/4hMIHzp
arena@arenaAI 评分 arena@arenaAI 评分
arcprize@arcprizeAI 评分 OpenRouter@OpenRouterAI 评分 GPT-6 Luna 是目前最快的 Decisions 模型,全球请求延迟 180ms 🏁 其次是 Jev 和 Perplexity Decider:
The Verge · AIAI 评分The Verge 影评:讽刺片《Artificial》如何贴近 OpenAI 真实事件
The Verge 发布影评,评述 Luca Guadagnino 执导、Andrew Garfield 主演的 Sam Altman 传记讽刺片《Artificial》在纽约电影节的首映。
siddsax@siddsaxAI 评分 OpenRouter@OpenRouterAI 评分 SPAC89@SPAC89AI 评分 perplexity_ai@perplexity_aiAI 评分 在智能体搜索中,一个使用9B模型的GPT-OSS-120B智能体正确回答了64.0%的BrowseComp+问题,比下一个ColBERT模型高出4.9分,且搜索次数少于任何基线。
perplexity_ai@perplexity_aiAI 评分 emollick@emollickAI 评分 少数尝试测量类似能力的基准(METR Long Tasks、GDPval)今年初都已饱和,因为 AI 开始能高质量完成数天的工作。
rohanpaul_ai@rohanpaul_aiAI 评分 dair_ai@dair_aiAI 评分 ArtificialAnlys@ArtificialAnlysAI 评分 在 artificialanalysis.ai/models… 对比 Claude Haiku 5.5 与其他领先模型。
ArtificialAnlys@ArtificialAnlysAI 评分 Artificial Analysis Intelligence Index 中 Claude Haiku 5.5 各 effort 档位单项评测的完整拆解
ArtificialAnlys@ArtificialAnlys精选AI 评分 推荐理由:原文给出了智能体指数、token 消耗和分层定价的对比数据,便于判断它在小模型档位中的性价比位置。
ArtificialAnlys@ArtificialAnlysAI 评分 ArtificialAnlys@ArtificialAnlysAI 评分 ArtificialAnlys@ArtificialAnlysAI 评分 ArtificialAnlys@ArtificialAnlysAI 评分 ArtificialAnlys@ArtificialAnlysAI 评分 ArtificialAnlys@ArtificialAnlysAI 评分 ArtificialAnlys@ArtificialAnlysAI 评分 arena@arenaAI 评分 arena@arenaAI 评分 arena@arenaAI 评分 arena@arenaAI 评分 arena@arena精选AI 评分 推荐理由:原文列出了与多家领先闭源和开源模型的对比对象,读者可据此了解该模型当前所处的竞争位置。
perplexity_ai@perplexity_aiAI 评分 omarsar0@omarsar0AI 评分
OpenRouter@OpenRouterAI 评分 OpenRouter@OpenRouterAI 评分 全新推出:决策模型排行榜! 查看不同决策模型和任务类型的支出占比与 token 占比,包括相关性、正确性、指令遵循等。 @typesafeai 目前在所有类别中领先。
omarsar0@omarsar0AI 评分 hq4ai@hq4aiAI 评分 arena@arenaAI 评分 arena@arenaAI 评分 rohanpaul_ai@rohanpaul_aiAI 评分 rohanpaul_ai@rohanpaul_aiAI 评分