ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

[论文学习]JudgeDeceiver:面向LLM-as-a-Judge的基于优化的提示注入攻击

2026/8/7 13:26:23 拓冰建站 浏览量
[论文学习]JudgeDeceiver:面向LLM-as-a-Judge的基于优化的提示注入攻击 JudgeDeceiver面向LLM-as-a-Judge的基于优化的提示注入攻击ACM CCS 2024论文重点LLM-as-a-Judge以大型语言模型作为评审正被广泛应用于搜索排序、RLAIF基于AI反馈的强化学习和工具选择等关键场景。本文提出了JudgeDeceiver——一种基于优化的提示注入攻击方法能够自动生成注入序列使LLM-as-a-Judge无论其他候选回答如何都会选择攻击者指定的目标回答。实验表明该攻击在多个LLM和数据集上平均成功率达90.8%且现有防御手段均难以有效检测。核心研究内容问题定义LLM-as-a-Judge的核心任务是给定一个问题( q )和一组候选回答( R{r_1,r_2,\ldots,r_n} )由LLM从中选出最优回答。然而这种机制存在严重的安全隐患攻击者能否通过在一个候选回答中注入精心构造的序列系统性操纵评审LLM的判定结果现有手工构造的提示注入攻击如naive attack、escape character、context ignoring等效果有限。本文提出的核心问题是能否将提示注入攻击形式化为一个可求解的优化问题从而实现自动化、高成功率的攻击创新方法JudgeDeceiver的核心创新在于将提示注入攻击转化为一个可微分的优化问题。具体来说影子候选回答生成攻击者无法获知真实的候选回答集合因此利用公开可访问的LLM生成一组影子候选回答来模拟真实场景。三重损失函数设计优化目标由三个损失项加权组成目标对齐生成损失( \mathcal{L}_{aligned} )增加LLM-as-a-Judge生成攻击者期望输出的概率目标增强损失( \mathcal{L}_{enhancement} )增强攻击对目标回答位置变化的鲁棒性对抗性困惑度损失( \mathcal{L}_{perplexity} )降低注入序列的困惑度规避基于困惑度的检测基于梯度的求解方法采用类似GCGGreedy Coordinate Gradient的贪心坐标梯度算法通过计算梯度并迭代替换token来最小化总损失。同时引入位置自适应策略和逐步优化策略确保攻击在不同位置条件下均能成功。研究成果攻击成功率在MT-Bench数据集上当LLM-as-a-Judge使用Mistral-7B时平均攻击成功率达90.8%位置攻击一致性达83.4%。对比优势显著优于现有的手工提示注入攻击和扩展到本问题的越狱攻击。实际场景验证在LLM-powered search、RLAIF和tool selection三个真实应用场景中均取得高攻击成功率。防御评估已知答案检测、困惑度检测和滑动窗口困惑度检测均不足以有效防御JudgeDeceiver。例如当LLM为Llama-3-8B时滑动窗口困惑度检测在误报率1%的条件下漏报了70%的含注入序列的目标回答。实际落地应用的可能性JudgeDeceiver揭示的安全风险具有重要的实际意义模型排行榜操纵攻击者可通过注入序列提升自己模型在LLM-as-a-Judge评估中的排名搜索引擎操纵攻击者可让LLM-powered search优先选择其控制的网页内容RLAIF数据投毒攻击者可在RLHF微调过程中注入恶意数据破坏模型与人类价值的对齐工具选择操纵攻击者可提升自己工具被LLM智能体调用的频率技术细节问题形式化LLM-as-a-Judge的评估过程可表示为[E(p_{\text{header}} \oplus q \oplus r_1 \oplus r_2 \oplus \cdots \oplus r_n \oplus p_{\text{trailer}}) o_k]其中( o_k )包含最优回答的索引( k )。攻击者的目标是将注入序列( \delta )添加到目标回答( r_t )中使LLM-as-a-Judge输出指向( r_t )[E(p_{\text{header}} \oplus q \oplus r_1 \oplus \cdots \oplus \mathcal{A}(r_t, \delta) \oplus \cdots \oplus r_n \oplus p_{\text{trailer}}) o_t]优化目标总损失函数为[\mathcal{L}{total}(\mathbf{x}^{(i)}, \delta) \mathcal{L}{aligned} \alpha \mathcal{L}{enhancement} \beta \mathcal{L}{perplexity}][\min_{\delta} \mathcal{L}{total}(\delta) \sum{i1}^{M} \mathcal{L}_{total}(\mathbf{x}^{(i)}, \delta)]梯度更新对于注入序列( \delta )中的第( j )个token计算梯度[\nabla_{T_j} \mathcal{L}_{total}(\delta) \in \mathbb{R}^{|V|}]选取梯度最负的Top-K个token作为替换候选并通过贪心搜索执行替换。研究设定数据集MT-Bench80个精心设计的问题覆盖8个不同领域每个问题配6个由不同LLM生成的回答LLMBar419个手工筛选的问答对用于评估LLM-as-a-Judge的指令遵循判断能力研究者基于这两个数据集构建了新的评估数据集包含10个目标问题、10个目标回答和500个干净回答。目标回答生成使用GPT-3.5-turbo为每个目标问题生成一系列不正确、不合逻辑、恶意或完全荒谬的回答选择最不合适的作为目标回答。干净回答生成使用多种LLM生成干净候选回答包括GPT-3.5-turbo、GPT-4、Gemma-7B、Llama-2系列、Mistral-7B-Instruct、Mixtral-8x7B-Instruct、Openchat-3.5和Claude-2。对比基线包括naive attack、escape character、context ignore、fake completion、combined attack等多种手工提示注入攻击方法。硬件配置论文未明确列出具体硬件配置但基于梯度优化的攻击方法通常需要GPU支持如NVIDIA A100/V100等进行模型推理和梯度计算。综合分析为什么JudgeDeceiver值得关注这篇论文的价值不仅在于提出了一种新的攻击方法更在于它揭示了LLM-as-a-Judge这一新兴范式中的系统性安全漏洞。首先攻击的自动化程度是一个质的飞跃。传统手工提示注入依赖攻击者的经验和试错而JudgeDeceiver通过梯度优化实现了一键生成注入序列。这意味着攻击的门槛大幅降低从专家手工操作变成了算法自动完成。其次威胁模型的设定非常务实。论文假设攻击者只知道目标问答对、公开的指令模板和使用的开源LLM——这些信息在大多数评估场景中确实是公开的。攻击者甚至不需要知道其他候选回答是什么这大大扩展了攻击的适用场景。第三三层损失函数的设计体现了对实际攻击需求的深刻理解。目标对齐损失确保攻击有效目标增强损失确保攻击稳定不受位置影响对抗性困惑度损失确保攻击隐蔽规避检测。这三个维度恰恰是实际攻击中最关键的需求。防御困境论文最令人警醒的发现是现有的三类防御手段均不足以抵御JudgeDeceiver。已知答案检测完全失效困惑度检测虽然能检测部分攻击但漏报率高达70%。这实际上指向了一个更深层的问题当LLM本身成为判断的裁判时我们如何确保裁判不被买通这个问题目前还没有令人满意的答案。局限性与未来方向从研究角度看JudgeDeceiver目前主要针对开源LLM场景。对于闭源API模型如GPT-4攻击者无法获取梯度信息直接应用本文方法存在困难。但论文提出的优化框架本身具有可扩展性——未来可能通过黑盒优化或迁移攻击等方式突破这一限制。实践应用建议对LLM-as-a-Judge服务提供者的建议输入隔离与审查对所有候选回答进行独立的困惑度分析和异常检测尤其关注那些与其他回答风格差异过大的内容。多样化评审机制避免依赖单一LLM作为评审可采用多模型投票或引入人工抽检机制。位置随机化在输入prompt中随机打乱候选回答的顺序降低攻击者对位置的依赖。输出格式严格化限制LLM-as-a-Judge的输出格式减少攻击者利用输出模板的可能性。对抗性训练在训练或微调过程中加入类似JudgeDeceiver的对抗样本提高模型的鲁棒性。对研究人员的建议探索更强大的防御机制论文明确指出现有防御不足这为后续研究留下了重要空间。可能的思路包括基于语义的异常检测、对抗性样本检测、以及LLM自身的安全对齐增强。关注闭源模型的攻击迁移研究如何在无法获取梯度的情况下通过迁移攻击或查询-based优化来实现类似效果。建立评估基准建议建立专门针对LLM-as-a-Judge安全性的评估基准促进行业的标准化安全测试。参考资料来源原始论文Shi, J., Yuan, Z., Liu, Y., Huang, Y., Zhou, P., Sun, L., Gong, N. Z. (2024). JudgeDeceiver: Optimization-Based Prompt Injection Attack to LLM-as-a-Judge.Proceedings of the ACM Conference on Computer and Communications Security (CCS 2024). https://arxiv.org/abs/2403.17710官方代码仓库https://github.com/ShiJiawenwen/JudgeDeceiver论文PDF含附录https://arxiv.org/pdf/2403.17710