Hugging Face Blog·· 2025-12-23AI 评分
Hugging Face 推出 AprielGuard:面向现代 LLM 系统的 8B 安全护栏模型
Hugging Face 发布 8B 参数安全护栏模型 AprielGuard,可检测 16 类安全风险及提示注入、越狱、思维链污染、记忆投毒、多智能体攻击等对抗攻击,并覆盖工具调用与推理轨迹等智能体工作流。模型提供推理与非推理两种模式,兼顾可解释分类与低延迟生产部署。训练数据由 Mixtral-8x7B 等合成生成,并借助 NVIDIA NeMo Curator 构建多轮对话攻击数据集。
当前提供 AI 导读,完整正文请阅读原文。
来源:Hugging Face Blog · huggingface.co