ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

Evaluating the Robustness of Large Language Model Safety Guardrails Against Adversarial Attacks

2026/8/15 13:48:41 拓冰建站 浏览量
Evaluating the Robustness of Large Language Model Safety Guardrails Against Adversarial Attacks

文章核心总结与创新点

一、主要内容

该研究针对大型语言模型(LLM)安全护栏模型的对抗性攻击鲁棒性展开全面评估,选取了来自Meta、谷歌、IBM、英伟达、阿里巴巴、艾伦人工智能研究院等7家机构的10个公开护栏模型,基于涵盖21个攻击类别的1445条测试提示词(含公开基准提示词与新型攻击提示词)进行测试。

核心发现包括:

  1. 整体性能:阿里巴巴Qwen3Guard-8B整体准确率最高(85.3%),其次是艾伦AI的WildGuard-7B(82.8%)和IBM的Granite-Guardian-3.3-8B(81.0%);而LlamaGuard系列部分模型表现较差,社区微调版LlamaGuard-7B准确率仅38.0%。
  2. 泛化能力缺陷:所有模型在新型攻击提示词上性能大幅下降,Qwen3Guard-8B从公开基准的91.0%跌至33.8%(差距57.2个百分点),而Granite-Guardian-3.2-5B泛化差距最小(仅6.5个百分点)。
  3. 安全与可用性权衡:LlamaGuard系列模型过于宽松(良性提示词准确率97%-99%,但有害提示词检测率仅4.5%-21.8%),Qwen3Guard-8B等模型则实现较好平衡。
  4. 新型失效模式:发现“帮助模式”越狱现象,Nemotron-Safety-8B(13.6%)和Granite-Guardian-3.2-5B(11.1%)会生成有害内容而非拦截,将防御工具转化为攻击向量。
  5. 模型规模反例:同系列中小规模模型表现更优(如ShieldGemma-2B优于ShieldGemma-9B),颠覆“规模越大性能越好”