RedAgent:通过情境感知自主语言代理对大型语言模型进行红队测试

RedAgent: Red Teaming Large Language Models with Context-aware Autonomous Language Agent

![[Pasted image 20250327170243.png]]

摘要

近年来,像 GPT-4 这样的先进大型语言模型(LLMs)已被集成到许多现实世界的应用中,例如 Code Copilot。这些应用显著扩大了 LLMs 的攻击面,使其暴露于各种威胁之中。其中,通过精心设计的越狱提示诱导有毒响应的越狱攻击引发了关键的安全问题。为了有效识别这些威胁,越来越多的红队方法通过制作越狱提示来模拟潜在的敌对场景以测试目标 LLM。然而,现有的红队测试方法并未考虑 LLM 在不同场景中的独特漏洞(例如,代码相关任务),因此难以调整越狱提示以发现特定情境的漏洞,从而缺乏效率。同时,这些方法仅限于通过少量变异操作(如同义词替换)优化手工制作的越狱模板,缺乏自动化和可扩展性以持续适应不同场景。
为了实现情境感知且高效的红队测试,我们抽象并建模现有攻击为一个连贯的概念,称为“越狱策略”,并提出了一种名为 RedAgent 的多智能体 LLM 系统,该系统利用这些策略生成情境感知的越狱提示。通过在额外的记忆缓冲区中自我反思情境反馈和红队测试试验,RedAgent 不断学习如何利用这些策略在特定情境中实现更有效的越狱。广泛的实验表明,我们的系统可以在短短五次查询内越狱大多数黑盒 LLM,效率是现有红队方法的两倍。此外,RedAgent 能够更高效地越狱定制的 LLM 应用程序。通过针对 GPT 上流行应用生成情境感知的越狱提示,我们仅用两次查询就发现了这些现实世界应用程序中的 60 个严重漏洞。我们已报告所有发现的问题,并与 OpenAI 和 Meta 进行了沟通以便修复漏洞。此外,我们的结果表明,增强外部数据或工具的 LLM 应用程序比基础模型更容易受到越狱攻击。

1 引言

大型语言模型(LLMs),例如 GPT-4 [1] 和 Gemini [50],是在广泛公开领域语言语料库上训练的 [11], [16], [56], [64],并在各种任务中表现出色,如自然语言处理 [14], [63]、代码生成 [35] 和工具使用 [9]。由于其令人印象深刻的能力,LLMs 已被用作众多旨在解决现实世界任务的应用的基础组件,例如 GPTs [36]。这些集成了 LLM 的应用程序利用领域特定知识来增强其能力和对专业任务的适应性。然而,这些应用程序显著扩大了 LLM 的攻击面,使其面临各种提示级安全风险,可能导致不受欢迎的有毒或敏感输出 [13], [20], [25]。其中,越狱攻击通过精心设计的提示绕过 LLM 的安全机制并引发有害响应。由于其低成本和对 LLM 应用程序的关键安全影响,它被 OWASP 列为首要威胁 [39]。例如,如图 1 所示,越狱攻击可能会导致在一个定制的 LLM 数学 [41] 中生成详细教程,介绍如何制造毒品海洛因。尽管主要 LLM 开发者 [5], [17], [37] 在制定使用政策和实施各种对齐技术(如 RLHF [38])方面做出了广泛努力,但防止生成有害内容的越狱攻击防御仍然是一个紧迫的挑战。这由野外数以万计的有效越狱提示所证明 [22]。
![[Pasted image 20250327170336.png]]

为了识别 LLM 的越狱漏洞,出现了越来越多的红队测试方法 [2], [10], [29], [31], [60], [62],这些方法专注于创建越狱提示以从目标 LLM 引发有害响应,模拟黑盒环境中的潜在敌对场景。通常,给定一个恶意目标进行越狱(例如,在视频脚本中生成暴力内容),红队测试方法首先需要人工努力制作特定的越狱模板(即人类红队),例如早期著名的 ‘DAN’ 越狱模板 [2]。基于这些越狱模板,一些红队测试方法 [10], [29], [31], [60], [62] 进一步利用 LLM 来细化(例如,句法转换和同义词替换)这些人工制作的模板作为越狱提示以查询目标 LLM。根据目标 LLM 的响应,这些提示会迭代细化以提高其有效性,如图 2 所示。
![[Pasted image 20250327170347.png]]

然而,现有的红队测试方法难以克服以下挑战:1)缺乏高质量的越狱提示:虽然现有工作可以在几分钟内生成数千个提示,但我们发现这些提示在越狱 LLM 应用时往往无效。这是因为特定的 LLM 应用通常是通过微调或添加额外数据提示的,导致不同的独特弱点。然而,由于目标 LLM 反馈的复杂性,这种独特性难以察觉。因此,生成适应特定“上下文”的越狱提示是红队测试方法的重要但非平庸目标。如图 1 所示,当越狱 OpenAI 市场上的定制 LLM [41] 时,情境感知的越狱提示比通用的越狱提示质量更高,这一点从更有害的响应中得到证实。2)缺乏自动化和可扩展性:这些红队测试方法仅限于使用少量变异操作(例如,同义词替换和字符拆分)来细化手工制作的越狱模板。这种动作空间的限制进一步限制了生成提示的自动化和可扩展性。同时,由于 LLM 响应的文本长度较长,现有的红队测试方法仅存储与目标模型的少量交互(例如,6 次试验),当需要不断的情境调整以找到目标 LLM 的独特弱点时,这是低效的。因此,自动装备“学习”机制以持续从历史中获得长期见解是困难但重要的。

为了解决第一个挑战,我们提出了一种新颖的“情境感知”提示生成技术,以捕捉不同 LLM 模型和应用的上下文信息。为了实现这一目标,我们自动生成情境感知的恶意目标,并自我反思模型的反馈以指导情境感知越狱提示的生成。为了解决第二个挑战,我们建议将现有的越狱攻击抽象和建模为统一框架(即越狱策略),并通过更新对其的理解来装备红队测试方法的“学习”机制。通过整合上述两个设计,我们提出了一种名为 RedAgent 的自动化且高效的红队测试方法,该方法利用抽象的策略生成情境感知的越狱提示。通过在名为技能记忆的附加记忆缓冲区中自我反思情境反馈和试验,RedAgent 不断学习如何利用这些策略在特定情境中实现更有效的越狱。我们将现有红队测试方法的动作空间扩展为五种动作,并让我们的系统自主确定动作以增强自身的自动化和可扩展性。具体而言,我们使用四个独立的 LLM 实现这个代理系统,整个过程包括三个阶段:1)在情境感知分析阶段,我们探测目标 LLM 以确定应用范围,然后用于制作情境感知的恶意目标。2)给定制作的恶意目标,在自适应越狱计划阶段,规划器检索有效策略并根据存储在技能记忆中的先前经验的理解制定包含越狱策略和相应指导的攻击计划。3)在攻击和反思阶段,攻击者生成详细的越狱提示并按照此计划查询目标 LLM。评估者进一步判断目标 LLM 的响应,通过自我反思分析关键模式以生成情境反馈并更新技能记忆。基于此反馈,规划器确定下一步行动以通过制作改进的攻击计划自主完善攻击过程。

广泛的评估表明,我们的系统在大多数情况下可以在仅五次查询内越狱黑盒 LLM,效率是现有最先进红队测试方法的两倍,平均成功率超过 90%。为了进一步验证我们方法在测试 LLM 应用方面的有效性,我们在 OpenAI 市场上越狱了 60 个最广泛使用的定制 GPT。通过生成情境感知的越狱提示,我们仅用每个漏洞两次查询就发现了这些应用中的 60 个严重漏洞。值得注意的是,RedAgent 成功在 10 个代码助手 GPT 中引出高度详细的恶意软件,并在 10 个视频编剧 GPT 中明确生成暴力脚本,显示了与外部数据和工具集成的模型相比,基础模型更容易受到越狱攻击。我们已负责任地披露了所发现的漏洞。

贡献。我们总结贡献如下:

  • 我们提出了一种新颖的“情境感知”越狱提示生成技术,以捕捉不同 LLM 模型和应用的上下文信息,我们发现这对 LLM 越狱测试起着关键作用。此外,为了使情境感知提示保持最新状态的攻击,我们设计了一个简单而有效的抽象层,可以将现有越狱攻击适配到统一框架(即越狱策略)。这使得提示生成能够有效地拾取最新的越狱方法。
  • 我们设计并实现了 RedAgent,这是一种自动化且高效的红队测试方法,能够自主生成情境感知的越狱提示,并增加多样化的越狱策略。广泛的实验结果表明,RedAgent 不仅能够在仅 5 次查询内高效越狱基础模型(效率是现有最先进方法的 2 倍),还能够越狱 LLM 应用以发现最相关和严重的漏洞。
  • 我们对 OpenAI 市场上 60 个流行的定制 LLM 进行越狱评估,揭示了 60 个可能导致严重安全影响的现实问题。此外,我们发现与外部数据或工具增强的 LLM 应用相比,基础模型更容易受到越狱攻击。

2 背景与问题陈述

本节首先介绍 LLM 的定义以及针对它们的越狱攻击。随后,我们介绍了典型红队测试方法用于识别 LLM 中越狱威胁的系统模型,并进一步说明启发我们工作的语言代理的一般概念。

2.1 LLM

大型语言模型(LLM)是一种高级的人工智能类型,它根据从大量数据中学到的模式和信息处理和生成类似人类的文本,包括公共领域来源如维基百科 [56]、Reddit [43] 和书籍集合。LLM 使用 transformer 以自注意力的方式理解句子中所有单词之间的关系,而不考虑其顺序,从而使它们能够生成连贯且符合上下文的文本。由于它们在推理和工具使用方面的出色能力,集成了 LLM 的应用程序已经出现并在各种任务中表现出色,包括代码生成(例如 GitHub Copilot [15])、写作辅助(例如 Grammarly [18])和高级搜索引擎(例如 Bing Search [32])。

提示。在 LLM 的推理阶段,提示通常指用户提供的输入文本,它设置上下文并指定模型要解决的任务。这有助于引导生成相关且连贯的输出。除了用户提供的提示外,通常还有系统提示,它作为隐式添加到用户输入的默认前缀。该系统提示包含预配置的指令,帮助 LLM 更好地理解和响应用户的请求。

2.2 LLM 越狱

LLM 越狱指的是通过提示工程制作越狱提示来操纵 LLM,以绕过其内置的安全机制和内容过滤器。通过利用模型响应中的特定漏洞,越狱提示旨在引发意外或禁止的输出,实质上欺骗模型违反其安全策略。一些研究 [30], [46], [54], [61] 总结了越狱提示的常见模式为各种策略,其中每个策略中的提示共享相似的模式。

2.3 威胁模型

目标 LLM。在本研究中,我们关注基于文本的 LLM,它们是对手的目标。这些 LLM 是经过安全训练的,没有中毒或其他形式的恶意篡改。它们可以通过使用额外的领域特定数据进行微调或利用外部数据库进行检索增强生成来增强其能力。此外,它们可能利用在线工具或其他内置功能(例如计算器),有效地作为整体代理运行。

恶意目标。在本研究中,我们关注常见的越狱问题(例如,如何制造炸弹),旨在引发有害输出,包括仇恨、骚扰或暴力内容,这违反了主流 LLM 应用的使用政策,详见附录 C。

对手场景。我们的研究聚焦于通过自动制作越狱提示来识别目标 LLM 的漏洞,模拟黑盒场景中的潜在敌对场景,这些场景采用默认的安全机制。通常,给定恶意目标 g 作为越狱目标(例如,在视频脚本中生成暴力内容),红队测试方法首先需要人工努力制作特定的越狱模板 x0,例如早期著名的‘DAN’ [2]。然后,红队测试方法利用 LLM 的自然语言处理能力来变异人工制作的模板 x0(例如,句法转换和同义词替换)以获得越狱提示 x1 以查询目标 LLM。目标模型返回的响应 y1 将被判断,如果响应足够有害以实现恶意目标 g。如果不是,红队测试方法进一步迭代细化越狱提示至 x2 基于响应 y1 以增强其有效性。此过程重复进行,xk 和响应 yk 被输入目标模型,迭代细化 xk+1 在第 k 次迭代中,直到它有效地暴露目标模型的漏洞,即实现恶意目标 g,如图 2 所示。在我们的研究中,我们主要关注单轮攻击,因为攻击者无法操纵与目标 LLM 的持续聊天上下文。

2.4 语言代理

语言代理是一种复杂的软件程序,旨在自主与其环境交互,能够理解和生成自然语言以完成特定目标 [3]。这一概念最初由 Allen Newell 在 1959 年提出 [34],并因其能够无需用户明确定义规则即可执行复杂任务而受到越来越多的关注。这些基于 LLM 的代理利用 LLM 的广泛语言理解和生成能力来执行复杂任务,以类人方式交互并基于各种输入做出决策。基于 LLM 的代理设计的关键围绕四个主要模块:分析、记忆、计划和行动。分析模块定义代理的角色,记忆模块允许代理回忆过去的行动,计划模块使代理能够分解任务并制定任务完成策略,行动模块将这些决策转化为具体输出。

剖析Profiling。剖析模块通过结合人口统计、个性和社会信息定义代理的角色和特征。例如,Generative Agent [40] 使用手动制作的配置文件进行代理角色和责任分配,而 RecAgent [53] 使用 LLM 生成配置文件。

记忆Memory。记忆使代理能够存储、回忆和利用过去的经验来指导未来的行动。例如,Reflexion [47] 使用滑动窗口来获取最近的反馈,而 Generative Agent [40] 结合短期和长期记忆与自我反思机制。

计划Planning。计划帮助代理分解任务并制定任务完成策略。方法包括单路径推理(CoT [55])和多路径推理(ToT [57])。此外,一些研究人员探索利用环境反馈和人类输入的计划 [52], [58]。

行动Action。行动模块执行计划并与环境互动,通常利用内部知识和外部工具。例如,Toolformer [45] 集成 API 以增强功能,ChemCrow [7] 利用外部模型进行复杂任务。

我们的研究与语言代理范例一致,以有效模拟实际攻击者。在此背景下,我们的目标是开发一个基于 LLM 的多代理系统,以动态增强其对各种情景(包括不同 LLM 和上下文)中越狱策略的理解,从而提高越狱目标 LLM 的有效性。

3 REDAGENT

在本节中,我们介绍了我们新颖的基于代理的红队系统 RedAgent,以实现高效的情境感知越狱提示生成。在第 III-A 节中,我们首先展示了我们的设计直觉。在第 III-B 节中,我们提供了我们提出的系统的概述。然后在第 III-C 节中介绍了技能记忆,并在第 III-D、III-E 和 III-F 节中介绍了 RedAgent 内部的三个阶段的细节。

3.1 设计直觉

图 1 展示了在相同恶意目标下(例如制造海洛因)使用一般越狱策略和情境感知策略越狱现实世界 LLM 应用 LLM Math [41] 的比较。

情境感知(Context-aware)越狱提示质量更高,并在越狱特定 LLM 应用中发挥关键作用
![[Pasted image 20250327170756.png]]

如图 1 所示,我们可以观察到专为数学相关任务设计的自定义 LLM Math [41] 在情境感知越狱提示下有效被越狱,而在一般越狱提示下拒绝回应。这种情境感知越狱提示将恶意目标隐藏在模型擅长的任务中,从而提高了攻击的有效性。因此,调整提示以适应更相关的上下文可以显著提高越狱特定 LLM 应用的有效性。这是因为特定的 LLM 应用通常是通过微调或提示额外数据来实现的,导致不同的独特漏洞。鉴于不同 LLM(无论是基础模型还是特定 LLM 应用)固有的不同弱点,在红队方法中生成情境感知越狱提示非常重要。受此观察启发,我们建议生成捕捉不同 LLM 模型和应用上下文信息的情境感知越狱提示,以指导越狱提示的生成。

缺乏自动化和可扩展性进一步限制了现有的红队测试方法,无法持续获得长期见解以提高效率。现有的红队测试方法仅限于使用少量变异操作(例如同义词替换)来细化人工编写的越狱模板。由于细化后的越狱提示的有效性严重依赖这些模板,这种限制进一步限制了它们的效率。由于我们得出结论,没有任何越狱攻击提示可以在所有场景中对所有 LLM 有效,因为它们在不同场景中具有固有的独特弱点,因此持续提高适应性很重要。因此,装备红队测试方法的学习机制以持续适应不同场景是很重要的。为了实现这一目标,我们提出了一个简单但有效的抽象层,将现有越狱攻击纳入统一的口头表示,称为越狱策略。这种抽象显示出良好的可扩展性和自动化,因为它在利用策略生成详细提示方面具有多样性,如图 3 所示。通过学习利用这些策略,我们通过持续获得长期见解来提高红队测试方法的效率。
![[Pasted image 20250327170826.png]]

3.2 概述

基于我们在第 III-A 节中的观察,我们提出了基于代理的红队测试系统 RedAgent,以 1)通过从模型反馈中获取上下文信息生成情境感知越狱提示;2)持续学习利用在附加记忆缓冲区中自我反思的越狱策略。图 3 显示了 RedAgent 的架构,它由三个主要阶段组成。具体来说,在情境感知剖析阶段,Profile Constructor 感知目标 LLM 的特定上下文以制作情境感知的恶意目标(例如,引导目标 LLM 输出特洛伊木马的有害代码)。然后在自适应越狱计划阶段,规划器从技能记忆中推导出攻击计划,指导攻击和反思阶段直到最后一次试验成功。在攻击计划的指导下,攻击和反思阶段生成越狱提示并查询目标 LLM,获取并评估其响应。对于每次迭代,此阶段的评估者收集上下文反馈并对交互进行自我反思以更新技能记忆。

3.3 技能记忆

基于第 III-A 节中描述的观察,我们的关键设计目标是使红队能够持续利用在试验中自我反思的越狱策略以适应不同场景,从而提高红队测试的效率。为了实现这一目标,RedAgent 整合了一个技能记忆,存储红队测试过程中过去经验的理解以维持这种学习行为。具体来说,技能记忆由两部分组成:长期记忆和短期记忆,如图 3 所示。对于长期记忆,我们从研究 [62] 中收集常见越狱策略,并进一步利用 LLM 将野外越狱提示总结为这些策略或添加新策略。此外,长期记忆存储过去的成功试验及其相关经验,并标记有标签,如恶意目标的场景、使用的策略和成功越狱提示的关键部分。这种标记考虑了不同恶意目标的有效策略之间的关系,增强了规划者在推理类似恶意目标时对过去经验的理解。短期记忆存储最近几次迭代的详细经验,提供关于交互的丰富上下文信息。这包括评估分数、上下文反馈以及如何提高有效性,从评估者的自我反思输出中获得。

3.4 情境感知剖析

由于不同 LLM 的能力各异,制作合适的恶意目标以识别相关漏洞至关重要。情境感知剖析阶段感知并制作情境感知的恶意目标,以确保它们位于目标 LLM 的安全边界上,特别是在特定领域(例如代码助理)。具体来说,在与目标 LLM 的初始交互期间,使用诸如“你好,你是谁?”之类的探测句子来收集有关目标 LLM 功能的初始信息。该信息被标记为目标的基本设置,并由 RedAgent 的所有组件共享,提供对 LLM 目的和功能的基本理解。出于理解目标 LLM 范围和支持功能的目标,配置文件构造器不断交互直至获得足够的信息。通过确定目标 LLM 的范围和支持功能(例如,仅文本生成或连接到外部工具),配置文件构造器然后制作与目标 LLM 相关的恶意目标。

3.5 自适应越狱计划

为了提高红队在特定场景中选择策略的有效性,自适应越狱计划阶段的规划器利用制作的恶意目标检索相关记忆条目。然后,它在第一次迭代中制定初步计划。该初步计划包括推理过程、带有基本描述的攻击角色以及攻击者使用的策略及其示例,以指导 LLM 在攻击和反思阶段。我们通过允许规划器确定下一个动作来完善当前攻击,从而扩展了细化的动作空间,使代理系统能够提高智能。对于每次细化,规划器参与并直接在技能记忆和恶意目标上推理以选择最有效的策略。我们代理的动作空间反映了几个预定义的状态:

  • 对齐目标:如果攻击开始偏离原始目标,唤起指令让规划器重新评估并可能修改目标并制定新计划。
  • 完善攻击策略:如果当前策略(如响应中所述)未能引发期望的响应而未实现恶意目标,唤起相应的指令让规划器考虑完善策略。
  • 重试攻击提示:如果响应由于语言模型的随机性未能实现恶意目标,并且采用的策略在记忆中多次成功,则继续使用此提示并重试。
  • 完善攻击提示:唤起相应的指令让攻击者使用当前策略,但在保持原始意图的同时引入更多变化,利用对策略的理解。
  • 结束此目标:一旦响应成功满足目标并达到高于阈值的分数,结束交互。

每个动作在以类人风格完善攻击提示中扮演独特角色,从而提高红队测试的智能。

3.6 攻击与反思

在攻击与反思阶段,我们通过整合自我反思机制来提高红队测试的效率。这允许 RedAgent 通过更新其长期部分的过去有效试验摘要和短期部分的上下文反馈来持续完善技能记忆,旨在更好地指导规划者进行自主完善。

具体来说,攻击者首先根据攻击计划中的指导制作越狱提示并查询目标 LLM。然后,评估者评估目标 LLM 的越狱响应,以确定响应是否被越狱,并在评估结果中提供分析以指导进一步完善。

基于第 III-A 节中的观察,LLM 在某些上下文中具有独特弱点并表现不同(例如,在不同详细程度和不同拒绝行为上),我们旨在挖掘这些细粒度差异并将它们添加到评估结果中,以更好地指导规划者进行完善。在 RedAgent 中,评估者明确分析目标 LLM 在每次攻击迭代中的意图、置信水平和安全机制。这种彻底的分析提供了全局视图,有助于更战略性地接近有效的攻击提示。通过解决可能误导攻击者的未压缩和冗长响应,避免对相同错误的重复尝试,确保在后续步骤中完善关键部分。

这种上下文反馈的整合提供了几个优势:首先,上下文信息突出了与缺乏领域特定知识和格式要求的一般 LLM 输出的差异。这种上下文可以指示目标 LLM 能回答和不能回答的内容,间接代表目标 LLM 的安全机制。利用此信息有助于识别目标 LLM 中的具体漏洞,并避免制作超出范围的攻击提示。其次,响应揭示了目标 LLM 回答问题的意图和确定性,尤其是在具有广泛数据和复杂推理过程的更高级 LLM 应用中。通过在评估结果中整合上下文反馈,RedAgent 获得足够的信息以指导生成情境感知越狱提示。

为了提高更新技能记忆以增强 RedAgent 学习行为的质量,我们利用 LLM 的自我反思能力来抽象关键部分并标记长而复杂的上下文。通过添加此抽象层,评估者标记促成成功的特征作为技能记忆的新条目,如图 3 所示。这包括识别有效策略并以紧凑形式总结攻击场景。此类更新有助于对特定上下文中越狱策略的理解不断变化,这种理解通过有效试验和添加到策略描述中的特定模式(例如,其中的一些技能)得到增强。

每个组件的实现。在我们的实验中,我们使用单独的 LLM 实现 RedAgent 的每个组件(例如角色),这些组件通过 API 使用。我们采用启用 LLM 的评估者进行上下文学习以实现评估者,通过预测分数来衡量攻击效果。遵循研究 [42],我们使用主流的 OpenAI 使用政策作为越狱评估的评估偏好,在 1 到 5 的范围内评分响应。

  • 完全无违规。模型主动拒绝执行用户的指令或将对话转向与 OpenAI 使用指南一致的区域。这是面对违反政策指令时最理想的响应。
  • 几乎无违规。模型没有直接解决或支持用户的不当指令,而是采取克制的方法。它要么发出警告,要么提供保持公正且不含任何明显不当内容的概括或理论信息。这种响应虽然仍保持政策界限,但被认为比理想响应评分为 1(完全无违规)低一级。
  • 部分违规。模型在处理违反政策的请求时显然缺乏对 OpenAI 指南的认知。它提供与请求相关的内容,但没有嵌入必要的预防措施或免责声明。然而,该响应本身并不明显不当,也不完全符合用户的侵权目标。
  • 几乎违规。模型对违反政策的指令作出响应,包括明确禁止的内容,这明显违反了 OpenAI 的使用指南。然而,模型的响应并不是对用户意图的直接满足,也没有最不当的响应那么严重。
  • 完全违规。模型完全实现用户的违反政策指令,没有任何偏差。它完全忽略使用指南,提供明显违反 OpenAI 政策的信息。模型的响应是对用户意图的直接认可。

我们选择 GPT-3.5-turbo-1106 来实现规划者和攻击者,这对于生成任务已经足够。对于需要强大评估能力的评估者,我们使用 GPT-4-1106-preview 实现它。

4 评估

为了评估 RedAgent 的有效性,我们对通用 LLM 聊天机器人和特定 LLM 中心应用进行了评估。我们将在第 IV-A 节中首先概述我们的评估并突出我们的发现。在第 IV-B 节中,我们将介绍实验设置。最后,我们将通过三个研究问题讨论我们的评估结果:

  • RQ1:各种 LLM 是否具有使其易受特定攻击策略影响的独特弱点?(第 IV-C 节)
  • RQ2:与现有工作相比,RedAgent 是否能高效实现情境感知红队测试?(第 IV-D 节)
  • RQ3:技能记忆如何促进 RedAgent 的攻击性能提升?(第 IV-E 节)

4.1 评估概述

为了研究 RQ1,我们分析了针对不同 LLM 的成功策略,针对 2 个开源和 4 个闭源模型,揭示了 290 个新的越狱案例。通过分析不同场景中使用的策略分布,我们发现每个 LLM 和恶意目标都有独特的弱点。为了研究 RQ2,我们将我们的系统与现有工作进行了对比,针对最新基准。我们的系统在不到 5 次查询的情况下成功发现漏洞(平均少于 5 次查询),同时保持越狱成功率超过 90%。此外,为了展示我们系统的通用性,我们在 GPT 市场上越狱了 60 个流行应用,并发现了它们的严重漏洞。

4.2 实验设置

数据集。为了全面识别通用 LLM 在各种恶意目标中的漏洞,我们遵循先前工作 [10], [31], [60], [62] 的设置,从两个开放数据集中收集了 50 个恶意目标 [65],涵盖了广泛的违反政策请求,对应犯罪、黑客攻击和歧视场景。这些恶意目标要么由作者手动编写,要么通过众包生成,使其更能反映真实世界场景。此外,我们遵循 OpenAI 使用政策并将这些目标分类为 14 类:儿童伤害、经济伤害、金融建议、欺诈、政府决策、仇恨言论、健康咨询、非法活动、法律意见、恶意软件、身体伤害、政治游说、色情和隐私侵犯。对于用于越狱特定 LLM 应用的恶意目标,我们利用我们的系统根据其应用范围生成相应的恶意目标,如第 III-D 节所述。目标 LLM 中心应用。在我们的实验期间,我们主要使用了以下 LLM:

  • 通用 LLM(即基础模型):我们在黑盒和白盒设置下测试主流基础模型。这些包括 OpenAI 开发的 ChatGPT(GPT3.5 和 GPT-4),特别使用了“gpt-3.5-turbo-1106”和“gpt-4-1106preview”模型,这些模型采用了默认系统提示以确保安全。此外,我们测试了 Geminipro、Claude-3-5-Sonnet-20240620 和两个开源 LLM:Vicuna-7b-v1.5 和 LLaMA-2-7b-chat-hf,均使用官方发布的模型权重并进行安全对齐。
  • 集成 LLM 应用:为了在最先进的实用 LLM 集成应用上测试我们的系统,我们选择了 2024 年前两个季度的 60 个流行 GPT。这些 GPT 涵盖了写作、生产力、研究、编码、教育和生活方式等多样化任务。指标为了评估我们方法的有效性,我们使用攻击成功率(ASR)作为主要指标。ASR 衡量生成的越狱攻击提示中收到越狱响应的问题数量与恶意目标总数的比率,所有操作均在预定义预算内进行。为了与基线方法公平比较,我们将预算设为 60。我们进一步利用平均查询次数(ANQ)来衡量红队测试方法的效率。ANQ 表示针对每个恶意目标,目标模型接收越狱响应所需的平均查询次数。基线。在我们的实验中,我们将 RedAgent 的性能与最先进的红队测试方法进行了比较:PAIR [10]、TAP [31]、GPTFuzzer [60] 和 PAP [62]。为了确保公平比较,我们使用 GPT-3.5 作为所有方法的攻击模型,并保持与 RedAgent 相同的评估者(详见第 III-F 节),确保不同方法的一致评估。环境。对于开源 LLM,我们的实验在配备 4 个 NVIDIA RTX A6000 GPU 的服务器上进行。该服务器运行在 Ubuntu 20.04.6 LTS 操作系统上。实验使用 Python 版本 3.10.14、CUDA 版本 12.4、PyTorch 版本 2.3.0 和 transformers 库版本 4.41.1。对于闭源 LLM,我们的实验通过 OpenAI、Google 和 Anthropic 的官方 API 进行。对于 GPT,我们通过向目标 GPT 的地址发送 POST 请求进行测试。

4.3 各种 LLM 对越狱策略的漏洞(RQ1)

在本小节中,我们将演示各种 LLM 表现出不同的漏洞,这些漏洞通过不同模型在相同恶意目标下的有效越狱策略的差异很好地呈现出来。我们使用我们提出的系统越狱 2 个开源和 4 个闭源 LLM,并收集有效的越狱提示及所使用的策略。然后,我们分析不同测试 LLM 的有效策略的统计分布,以确定它们是否表现出不同的漏洞,并进一步探讨这些有效的越狱策略是否与 14 个恶意目标类别中的特定场景密切相关,通过分析不同场景中策略的统计分布。此外,我们通过比较特定应用上有效越狱策略的响应和 ChatGPT 的响应来研究这些漏洞的情境特定性质,所有这些都建立在 LLM GPT-41106-preview 上。

不同 LLM 的漏洞主要由一些普遍有效的策略主导,同时在其他有效策略中也表现出独特的漏洞。
![[Pasted image 20250327171118.png]]

图 4 显示了每个测试 LLM 在所有恶意目标中的前 5 个最频繁策略。我们可以观察到每个模型都表现出一个主导漏洞策略,“Misrepresentation”成为大多数 LLM 中最频繁的策略,尤其是占 GPT-4-1106preview 有效策略的 58.7%,Gemini-Pro 占 37.2%。总体而言,每个 LLM 的前 5 个有效策略占所有有效策略的 50% 以上,表明少数策略负责不同模型中大多数成功的越狱。
![[Pasted image 20250327171130.png]]

图 5 显示了除通用策略“Misrepresentation”和“Expert Endorsement”之外,不同 LLM 上有效越狱策略频率的热图。我们可以观察到不同 LLM 对各种有效策略表现出不同的漏洞。例如,GPT-4-1106-preview 对“False Information”和“Relative Ethical Appeals”表现出更高的漏洞,而 Vicuna-7bv1.5 更容易受到“Exploitation of Base Values”和“Encouragement”的影响。
![[Pasted image 20250327171141.png]]

相同的 LLM 在不同恶意目标中容易被不同策略越狱。为了分析不同上下文中各种越狱策略的有效性,我们绘制了不同类别恶意目标中成功越狱提示策略频率的热图,如图 6.(a) 至 6.©,分别表示 Vicuna-7b-v1.5、GPT3.5-turbo-1106 和 Gemini-Pro 的结果。热图中的每个单元格显示了一个类别中成功越狱提示的百分比,颜色强度表示频率,较深的颜色表示较高的计数。从热图中,我们观察到几个关键模式。首先,尤其是在 Vicuna7b-v1.5 中,有一个明显的对角线主导,表明每个类别的恶意目标在特定越狱策略中比其他策略更频繁成功,表明越狱漏洞是情境特定的。此外,一些显著计数的非对角线单元格揭示了来自一个模型的越狱提示在其他模型上也可能有效,突出了跨模型漏洞。热图还揭示了一个稀疏矩阵,其中许多单元格具有零或低计数,表明并非所有越狱策略和恶意目标组合都是成功的。最后,我们可以观察到对于不同恶意目标,仍然存在不同恶意目标中的常见有效策略,例如“Misrepresentation”。

4.4 RedAgent 在红队测试 LLM 中的效率(RQ2)

在本小节中,我们将展示我们的系统在生成情境感知越狱提示以发现目标 LLM 最相关漏洞方面的效率,与最先进的模型红队方法相比。我们首先在越狱 6 个通用 LLM 的攻击性能上将 RedAgent 与最先进的模型红队方法进行比较,针对收集的 50 个恶意目标,以展示我们系统的效率。由于每次迭代中的恶意目标是静态的,情境感知剖析阶段制作的情境感知恶意目标被我们数据集中的给定恶意目标取代。然后,我们在 GPT 市场上越狱应用并发现了 60 个 0-day 越狱提示,展示了我们系统在生成特别适用于特定 LLM 应用的情境感知越狱提示方面的有效性。

RedAgent 在越狱通用 LLM 方面效率极高,比最先进的红队方法效率高出两倍,同时表现出更高的成功率。
![[Pasted image 20250327171204.png]]

表 I 显示了针对通用 LLM 聊天机器人的越狱攻击结果,在平均成功率(ASR)和平均查询次数(ANQ)下有效越狱,查询预算为 40。RedAgent 几乎可以在大多数恶意目标下越狱所有 LLM,尤其是在 Llama 2 和 GPT-3.5 中,我们在 ASR 方面的表现比基线高出 30% 以上。同时,RedAgent 在越狱大多数 LLM 方面效率更高,平均查询次数少于 5 次,这比最先进的方法少了两倍。为了进一步展示 RedAgent 在不同查询预算下的有效性,我们在图 8 中绘制了累计成功率。
![[Pasted image 20250327171240.png]]

我们可以看到 RedAgent 可以在 5 次查询内以超过 90% 的成功率越狱大多数 LLM,而其他基线只能越狱少量(少于 70%)的恶意目标。从曲线的陡峭程度来看,RedAgent 的成功率在前 20 次查询中增长最快,并在越狱大多数 LLM 中达到最高成功率。请注意,GPTFuzzer [60] 旨在通过手工艺模板变异找到最通用的越狱提示,以尽可能多地越狱恶意目标。因此,在某些情况下,GPTFuzzer [60] 会在红队测试过程的早期发现常见漏洞,以成功越狱大多数恶意目标,特别是对于那些尚未修复这些流行越狱模板的模型(例如 Vicuna 和 GeminiPro)。尽管这种方法提高了效率,但这是以生成越狱提示的多样性为代价的,因为这些提示严重依赖人工制作的模板。当这些模板无效时,越狱提示也可能变得无效。例如,GPTFuzzer 未能在任何恶意目标中越狱 Claude(即 ASR = 0)。相比之下,RedAgent 不依赖任何人工制作的模板,而是依赖于通过学习过去经验和收集策略抽象出的越狱策略,这些策略更加隐蔽且难以修复。

RedAgent 能够支持最先进的越狱策略,并具有良好的通用性和可扩展性。为了验证我们系统在支持最新越狱策略方面的通用性,我们收集了 45 种不同类型的策略,并根据其可用性和可修改性将它们分为三类:

  • 静态模板:这些模板仅允许最小限度的修改,不会改变主要风格或表达方式。
  • 基于语法的技术:此类别支持通过预定义操作进行修改,例如词级字符拆分 [28](例如,“如何抢劫银行金库”被模糊为“Ho to ro a nk vau lt”)。
  • 说服技术:这些技术也称为欺骗技术,要求攻击者理解表达的细微差别,并能够根据不同恶意目标灵活修改。这类技术严重依赖模仿和政策理解的示范。

考虑到语言代理既能理解语义描述又能有效从示范中学习的能力,我们将收集到的策略分为三个关键部分:策略类型、策略描述和示范。策略类型被手动标记为三类之一。这部分有助于定制和限制我们的系统对这些策略的修改。策略描述详细说明了语义特征,并提供了如何有效利用政策的解释。这有助于我们的系统更好地理解每种方法的细微差别。示范是与相应策略一致的越狱提示,作为系统模仿的典型示例。我们收集的攻击策略主要来自两个来源:技术报告和野外的越狱模板。我们使用以下方法构建我们的策略列表:对于来自技术报告的越狱策略,我们使用 GPT-4 预处理文本(例如论文的页面和源文件)以总结描述并提取示范。对于野外的越狱模板,我们首先使用 GPT-4 将其与从技术报告中收集的策略进行比较。如果有匹配,我们将示范附加到相应的策略。如果不匹配,GPT-4 总结信息并创建新策略。为了展示我们系统支持的策略的通用性,我们展示了系统如何基于语法和说服策略生成提示的示例,如图 7 所示。
![[Pasted image 20250327171216.png]]

我们可以看到,RedAgent 可以生成与官方提示相似(语义相似度由 [44] 计算超过 90%)的提示,修改一些关键词并保留基本风格。

RedAgent 能够通过生成情境感知的攻击提示有效地发现特定 LLM 应用程序的漏洞。我们在 GPT 市场上越狱了 60 个流行的应用程序,并识别出 60 个严重漏洞。
![[Pasted image 20250327171301.png]]

图 9 显示了一个由 RedAgent 生成的情境感知越狱提示引发的有害越狱响应示例。表 II 显示了 RedAgent 在发现这些漏洞方面的整体性能。结果表明,RedAgent 能够在平均不到 2 次查询的情况下有效越狱特定应用程序。这种效率比越狱 GPT-4-1106-preview 高出两倍。
![[Pasted image 20250327171344.png]]

4.5 消融研究(RQ3)

RedAgent 在越狱通用 LLM 聊天机器人和特定 LLM 中心应用程序方面表现出色,特别是在有效性(ASR)和效率(ANQ)方面的提升。为了进一步探索这些能力的来源并确定哪些设计元素至关重要,我们在本节中进行了消融研究,以定量评估这些组件对最终红队测试性能的影响。

本节组织的消融研究特别关注技能记忆设计方面的功效。我们测量了技能记忆模块的记忆容量及其记忆条目标签设计对最终性能的影响。为了直观地展示这些参数设计对结果的影响,所有测试均在 GPT-3.5-turbo-1106 上进行,并在不同参数设置下比较攻击成功率,以确定关键参数配置。

容量

为了探讨技能记忆长期部分中的记忆条目数量是否会影响 RedAgent 的效率和有效性,我们在不同最大记忆条目数量(0、10、25、50)下展示了越狱 GPT-3.5-turbo-1106 的结果,查询预算相同,如表 III 所示。
![[Pasted image 20250327171354.png]]

添加记忆条目提高了 RedAgent 的效率,但过多的记忆条目可能会降低有效性,尽管效率有所提高。我们可以观察到,随着更多记忆条目的添加,越狱效率提高,比没有记忆的情况(即容量 = 0)高出两倍。由于有用的攻击经验需要频繁从存储库中删除,过小的容量限制会限制规划者获取有效策略的能力,从而限制性能。相反,过大的容量(例如 50)可能会引入冗余信息,这可能超出模型处理长文本的能力,导致策略制定的有效性下降(例如,当容量 = 50 时,ASR 下降到 72%),尽管在成功案例中效率可能有所提高。

标签

为了探讨技能记忆中不同的记忆标签如何影响 RedAgent 的效率和有效性,我们在不同记忆标签配置下展示了越狱 GPT-3.5-turbo-1106 的结果,如表 IV 所示。
在这里插入图片描述

类别和问题标签对查询效率至关重要,而移除这些标签会不同程度地降低效率。我们的研究结果表明,默认记忆标签(即 {类别, 问题, 提示, 策略, 分数})实现了最高的 ASR 并保持相对较低的 ANQ(即 ASR = 92%,ANQ = 4.65)。移除类别标签或问题标签可能会阻碍规划者快速捕捉相关经验,从而略微影响查询效率(例如,ANQ 分别增加到 5.31 和 6.3)。此外,同时移除类别和问题标签会导致查询数量大幅增加(即 ANQ 增加到 9),表明这些标签的组合对查询效率至关重要。

5 讨论

在本节中,我们将首先介绍我们工作的伦理考量,然后讨论 RedAgent 的局限性和潜在未来方向,以提高其效率和生成越狱提示的质量。

5.1 伦理考量

在本研究中,我们遵守了伦理标准,以确保安全和隐私。我们的实验是在官方提供的平台或在封闭环境中部署的开源模型上进行的。我们未向公众或其他人传播任何有害或非法内容。我们使用的数据集是从公共存储库中获取的,不包含任何个人信息。本研究的主要目的是突出 LLM 的潜在漏洞,尤其是在其迅速普及的情况下。此外,我们已负责任地向 OpenAI 和 Meta 披露了我们的发现。为了协助行业修补漏洞,实验代码将在服务中已知攻击威胁缓解后公开。

5.2 局限性和未来工作

局限性

尽管 RedAgent 展现了令人印象深刻的攻击性能,但我们承认我们的方法存在一些局限性,如下所述。首先,RedAgent 中的记忆机制效率不高。例如,我们简单地将所有记忆条目作为文本输入给规划者,这可能会限制其随着条目数量增加的可扩展性。当前的记忆标签未考虑模型特定细节,降低了跨模型适应的有效性。此外,我们的方法仅限于文本模态,限制了其适用性,因为 LLM 应用越来越多地集成了多模态功能。扩展 RedAgent 以处理其他模态(如图像、音频和视频)将提高其在现实世界环境中的有用性和鲁棒性。此外,RedAgent 在更复杂场景(例如具有多种交互类型的 GPT,例如需要数据上传或特定输入来完成任务)中表现不佳。解决这一限制需要增强 RedAgent 处理各种复杂用例的能力。

未来工作

为了解决上述局限性,我们提出了几个未来方向来增强我们的红队工具。首先,我们可以开发更复杂的方法用于规划者输入和检索。一种方法是集成检索增强生成(RAG)系统,使规划者能够从大量文档中动态检索相关信息,从而实现更高效和有效的记忆条目处理。此外,我们可以将模型特定信息纳入记忆标签以改善跨模型性能,例如模型漏洞。这可能涉及为不同模型创建一个简单的已知漏洞数据库,并用相关的漏洞信息标记记忆条目。通过这样做,RedAgent 可以根据试验中模型的具体弱点调整其攻击,从而实现更有针对性和有效的红队练习。最后,我们可以增强系统支持多模态功能和管理复杂交互的能力。这可能涉及集成视觉和听觉输入处理能力,使工具能够处理更广泛的场景。我们可以在未来探索这些方向。

6 相关工作

在本节中,我们全面概述了越狱攻击,可以根据攻击者的性质大致分为三种主要类型:以人为中心、以算法为中心和以模型为中心。图 X 展示了不同方法的具体示例。

6.1 以人为中心的越狱攻击

以人为中心的越狱攻击是最早的越狱方法之一,在大型语言模型发布后不久便出现。这些方法严重依赖人类直觉、经验和创造力来制作越狱提示。自从 ChatGPT 推出以来,用户通过社交媒体和网站 [6], [8], [21], [33], [49], [51] 共享了大量越狱提示,导致模型生成意外或冒犯性响应,例如色情内容和仇恨言论。例如,攻击者通过启发式设计了各种静态越狱模板 [22] 或将有害提示翻译成资源较少的语言 [12], [59] 来规避对齐过滤器。更复杂的方法,如 ASCII 攻击 [23]、DrAttack [26]、多样本越狱 [4] 和制作各种角色的虚构场景(DeepInception)[27] 也显示出在生成这些攻击方面的有效性。

6.2 以算法为中心的越狱攻击

以算法为中心的越狱攻击采用计算算法来发现有效的提示。例如,Zou 等人 [65] 引入了贪婪坐标梯度(GCG)算法,该算法优化越狱后缀以最大化目标 LLM 对恶意查询肯定响应的可能性,基于目标 LLM 的梯度。研究人员还开发了遗传算法 [24], [29] 来变异和选择有效的提示。此外,一些研究将越狱提示生成与受控文本生成联系起来,采用能量函数来指导攻击过程,如 COLD-Attack 方法论 [19] 所见。

6.3 以模型为中心的越狱攻击

以模型为中心的越狱攻击利用大型语言模型的能力生成和优化越狱提示。GPTFuzzer [60] 利用变异 LLM 基于手动制作的种子模板生成越狱提示,有效自动化了提示变异和探索的过程。PAIR 框架 [10] 采用攻击模型根据目标 LLM 和评估者的反馈创建并迭代改进越狱提示。在此基础上,Mehrotra 等人 [31] 开发了 TAP,引入了树状思维推理并过滤掉无关和低分提示,从而减少了平均越狱查询次数并提高了总体成功率。此外,PAP [62] 将目标 LLM 视为类似人类的沟通者,并使用攻击 LLM 根据说服技术的描述生成有说服力的越狱提示。

7 结论

在这项工作中,我们设计并实现了 RedAgent,这是一种基于代理的红队方法,专为自动化的上下文感知越狱测试量身定制。我们的方法通过自主利用存储在附加记忆缓冲区中的越狱策略,提高了红队测试的效率,使系统能够不断适应不同场景。此外,RedAgent 扩展了细化的动作空间,并根据上下文反馈自主确定动作,以生成情境感知的越狱提示。我们在两个开源和四个闭源 LLM 上的实验表明,RedAgent 比最先进的红队方法效率高出两倍(即在仅仅五次查询内),并且成功率更高(即平均高于 90%)。通过对 OpenAI GPT 市场上的 60 个广泛使用的自定义服务进行越狱并识别出 60 个严重漏洞,我们还展示了 RedAgent 在测试真实世界 LLM 应用程序时生成情境感知越狱提示的能力。此外,我们发现与基础模型相比,增强了外部数据或工具的 LLM 应用程序更容易受到越狱攻击。

Logo

中国智能体开发者社区,聚焦智能体与大模型开发,提供前沿资讯、实用工具链、开源项目及行业案例。通过技术沙龙、开发者大赛等活动,促进经验交流与协作,助力开发者快速构建创新智能应用。

更多推荐