Hugging Face Blog·· 2026-06-18精选AI 评分
Hugging Face 发布 agent-eval:用自有工具链评测开源模型的智能体能力
Is it agentic enough? Benchmarking open models on your own tooling
Hugging Face 发布 agent-eval 评测工具,以 transformers 为案例,在模型 × 版本 × 任务三个维度上测量智能体完成任务所需的轮次、token 和错误率,而非只看最终答案。
原文给出了一套可复用的智能体工具评测方法,并展示同一改动如何在大模型与小模型上产生相反效果。
来源:Hugging Face Blog · huggingface.co