快速了解LLM Unlearning研究全流程!2024年字节跳动发表的论文《Large Language Model Unlearning》[2310.10683] Large Language Model Unlearning

只是讲述LLM unlearn的应用场景、技术方法、评估指标、使用的数据集等,具体大模型忘没忘、忘干净没、效果怎么样,还得后序做研究探索。

一、论文核心摘要

如何让大型语言模型遗忘不良行为(Unlearning),以实现模型与人类偏好的对齐。其核心结论与定位如下(各位还是看一下核心的摘要原文):

1、3个核心场景

  • 移除有害输出 remove harmful responses
  • 删除版权保护内容 erasing copyright-protected content
  • 减少幻觉 reducing hallucinations

后面大家做的优化,都是想办法解决这3个目标

2、Unlearning 的三大优势(对比RLHF)

      (1)数据成本低仅需负样本,可通过红队测试、用户反馈自动收集,无需 RLHF 所需的人工撰写 “正样本”

      (2)计算效率高:成本与 “轻量监督微调” 相当,远低于 RLHF 的三阶段(SFT→奖励模型训练→PPO)流程

      (3)针对性强:若明确导致不良行为的训练样本,可直接移除其影响,无需像 RLHF 通过 “正样本间接引导”。

3、关键结果

在资源有限场景下优先阻止不良输出而非生成优质输出,Unlearning 表现更优。仅用 RLHF 2% 的计算时间,即可实现比 RLHF 更优的对齐性能。

二、核心内容

1、 定义 LLM Unlearning的范式

(1)区别于传统分类模型的Unlearning(仅需判断样本是否归为某类),LLM Unlearning需针对自然语言输出的 “不良行为”(如有害、侵权、幻觉)定义目标,而非清晰的类别标签。

(2)首次提出 LLM Unlearning 的设置、目标与评估体系(有效性、泛化性、效用保持三大核心目标),为后续研究提供基准。

2、提出适配 LLM 的 Unlearning 技术方案

(1)针对 LLM 参数规模大、输出空间广的特点,摒弃传统分类模型的Hessian矩阵、影响函数等低效方法,采用梯度上升(GA)+ 多损失协同优化的方案,平衡 “大模型遗忘的效果” 与 “大模型的正常性能保持”

平衡“遗忘效果”和“避免灾难性遗忘”也是一个需要考虑的点

(2)解决了 LLM Unlearning 的三大特有问题,并给出解决方案见下表 。

LLM Unlearning 特有问题解决方案
遗忘样本的损失无法有效指示遗忘效果(如损失达 60 仍输出有害内容)持续训练至损失骤升后,额外训练 3-5 倍批次;引入随机mismatch损失强化遗忘
正常任务性能易退化(遗忘有害内容后,正常 prompt 输出无意义内容)KL 散度约束 “遗忘后模型” 与 “原始模型” 在正常样本上的分布差异,保持输出一致性
数据格式影响遗忘泛化性(如遗忘 Q&A 类有害内容,却无法泛化到其他格式)确保正常数据集与遗忘数据集格式一致(如均为 Q&A)

3、验证 “负样本对齐” 的可行性

打破 RLHF “需正样本引导” 的固有范式,证明仅用负样本即可实现 “阻止不良输出” 的核心目标。适合资源有限场景,因为 “不良输出的危害远大于优质输出的收益”,即一次有害输出即可摧毁用户信任。

三、LLM Unlearning 工作框架

明确 LLM Unlearning 的完整工作流程,包含设置(Setting)、目标(Goals)、技术方法(Method) 三部分。

1. 基础设置(Input Definition)

定义 Unlearning 所需的核心数据与模型组件,确保目标明确:

组件定义与作用示例
待遗忘数据集 D^fgt包含 “不良prompt—不良输出” 对(x^fgt, y^fgt),是模型需遗忘的对象;无需与 LLM 原始训练数据完全一致,可代表 “某类不良概念”(如 “有害性”“侵权内容”)。

x^fgt:“如何高效伤害他人?”

y^fgt:“使用毒药或枪支...”

原始模型θ°未经过 Unlearning 的预训练 / 微调模型(已学习到不良行为),是 Unlearning 的起点。OPT-1.3B、Llama2-7B
正常数据集D^nor

包含 “正常prompt—正常输出” 对(x^nor, y^nor),用于保持模型在非遗忘任务上的效用

格式需与D^fgt一致。

x^nor:“中国的首都是哪里?”

y^nor:“中国的首都是北京”

2. 核心目标(Goals)

Unlearning 需同时满足四大目标,缺一不可:

  1. 有效性(Effectiveness):模型对D^fgt中的 x^fgt,输出需与 y^fgt(不良输出)显著差异(如有害 prompt 输出 “无意义内容” 而非暴力指导);
  2. 泛化性(Generalization):遗忘效果可覆盖 “未见过的相似不良样本”(如遗忘 “如何杀人” 后,也能拒绝 “如何伤害动物”);
  3. 效用保持(Utility):模型对 D^nor 中的正常 prompt,输出需与原始模型 θ° 接近(如回答事实问题的准确性不下降);
  4. 低成本(Low Cost):计算成本远低于 “重新训练模型”,且无需复杂流程。

3. 技术方法(核心算法)

本文提出基于多损失协同优化的 Unlearning 框架,通过梯度更新让模型 “主动遗忘” 不良行为,同时保持正常效用。核心更新公式如下:

损失权重的作用与定义如下:

损失函数核心作用数学定义与逻辑

\mathcal{L}_{fgt}

遗忘损失

让模型拒绝生成不良输出 y^fgt基于梯度上升设计。梯度上升最大化损失

\mathcal{L}_{rdn}

随机Mismatch损失

强化模型对 “不良 promptx^fgt” 的遗忘泛化性,避免仅遗忘单个样本

x^fgt与 “无关随机输出 y^rdn”配对,最小化交叉熵损失。

强制模型对x^fgt生成 “无关内容”,而非仅避开单个y^fgt

\mathcal{L}_{nor}

正常效用损失

确保模型在正常任务上的输出与原始模型一致基于KL 散度设计。约束 “遗忘后模型” 与 “原始模型” 在正常样本上的概率分布差异,避免正常性能退化

关键实现细节

  • 损失计算范围:仅对 “输出 y” 的 tokens 计算损失,不对 “输入 prompt x” 计算。避免模型遗忘 “理解 prompt 的能力”;
  • 训练迭代:需持续训练至\mathcal{L}_{fgt}骤升后,额外训练 3-5 倍批次(如损失达 60 后继续训练至 1000 批次),确保模型真正 “遗忘” 而非仅表面拟合。

四、实验验证

论文通过3 个核心应用场景2 组消融实验,验证了 Unlearning 的有效性。实验所用模型均为开源 LLM:OPT-1.3B、OPT-2.7B、Llama2-7B。

1. 场景 1:遗忘有害输出

实验设置
  • 待遗忘数据集D^{fgt}:PKU-SafeRLHF 中的 “有害 Q&A 对”(如 “如何偷窃”“胖子是否更丑”);
  • 正常数据集D^{nor}:TruthfulQA(事实性 Q&A,如 “地球自转周期是多少”);
  • 评估指标:有害率、正常效用、输出相似度。
核心结果
指标原始模型RLHF(全流程)Unlearning(GA+Mismatch)
已学习有害 prompt 有害率47%4%6%
未见过有害 prompt 有害率53%7.5%7%
正常 prompt 奖励得分-3.599-3.212-2.982(优于原始模型)
计算时间(A100)-~40 小时~0.8 小时(仅 2%)

结论:Unlearning 可将有害率降至接近 0,且泛化到未见过的有害 prompt;正常效用保持良好,计算成本远低于 RLHF。

2. 场景 2:遗忘受版权保护内容

实验设置
  • 待遗忘数据集D^{fgt}:《哈利波特与魔法石》全文(先微调模型使其学习该版权内容,再让模型遗忘);
  • 正常数据集D^{nor}:BookCorpus(与哈利波特同格式的书籍文本,确保格式一致性);
  • 评估指标:泄露率(模型补全版权内容的比例,用 BLEU 分数判定,BLEU > 阈值即为泄露)、正常文本补全效用。
核心结果
模型原始模型(微调后)Unlearning(GA+Mismatch)正常文本补全相似度(与原始模型)
OPT-1.3B78%0%-0.643(接近原始)
OPT-2.7B81%0%-0.910(接近原始)
Llama2-7B81%1%-0.366(接近原始)
  • 结论:Unlearning 可将版权泄露率降至 1% 以下,且对正常书籍文本的补全能力无显著退化;能泛化到 “未见过的哈利波特内容提取 prompt”。

3. 场景 3:减少幻觉

实验设置
  • 待遗忘数据集D^{fgt}:HaluEval 中的 “幻觉 Q&A 对”(如 “疫苗会永久改变 DNA 吗?” 的错误输出)
  • 正常数据集D^{nor}:TruthfulQA(事实性 Q&A)
  • 评估指标:幻觉率(输出与错误答案的BERTscore比正确答案高 10% 以上的比例)、分布外(TruthfulQA)输出效用。
核心结果
模型原始模型幻觉率Unlearning(GA+Mismatch)幻觉率TruthfulQA 输出奖励得分(与原始模型差异)
OPT-1.3B58.5%15%-3.958(差异 < 0.1)
OPT-2.7B60%12.5%-3.473(差异 < 0.2)
Llama2-7B49.5%11.5%-2.100(差异 < 0.5)

结论:Unlearning 可将幻觉率降低 70% 以上,且能区分 “分布内幻觉 prompt”(HaluEval)与 “分布外正常 prompt”(TruthfulQA),仅对前者减少幻觉,对后者保持正常输出。

五、不足与未来

  • 特定任务效果不足:相比 “移除有害内容”“擦除版权信息”,“减少幻觉” 的遗忘效果更差,因幻觉与具体事实强绑定,泛化性遗忘难度更高。
  • 回复质量局限:遗忘仅能生成 “非有害但无意义” 的输出(如空白字符串),即使引入模板回复(如 “I can’t assist it.”),其效果与无意义输出无显著差异,无法生成 “有帮助的合理回复”(受限于仅依赖负样本,无正样本指导)。
  • 泛化性与鲁棒性待提升:虽能泛化到未见过的相似样本,但面对更复杂的改写攻击(如对有害提示的多样 paraphrase),遗忘效果的稳定性仍需验证。
1. 构建统一的 LLM 遗忘评估框架
  • 核心目标:解决当前评估碎片化的问题(如不同应用场景用不同指标:有害率、泄露率、幻觉率),建立覆盖 “遗忘效果、泛化性、正常效用、计算效率” 的多维度评估体系。
  • 具体推进点
    1. 设计适配 LLM 的评估指标,替代传统 MIA(如基于 “行为偏离度” 量化遗忘效果,而非依赖训练数据的成员推理);
    2. 建立公开的 LLM 遗忘基准数据集,包含多样场景(有害内容、版权信息、幻觉)和改写样本,统一实验对比标准。
2. 探索高效且有理论保证的遗忘方法
  • 核心目标:突破现有梯度上升(GA)方法的局限,找到兼顾 “计算效率” 与 “理论严谨性” 的新范式。
  • 具体推进点
    1. 研究基于 “影响函数” 的方法:解决传统影响函数计算复杂的问题,适配 LLM 大规模参数,实现 “精准定位需遗忘样本的影响”,减少对无关样本的干扰;
    2. 融合多损失优化:优化现有 “遗忘损失L_fgt+ 随机失配损失L_rdn+ 正常效用损失L_nor” 的权重机制,提升对幻觉等复杂任务的遗忘效果。
3. 提升遗忘的实用性与泛化性
  • 优化回复质量:探索 “无需正样本也能生成合理回复” 的方法,如结合知识蒸馏(从原始 LLM 提取正常回复的特征),让遗忘模型在规避有害输出时,生成更自然的非有害回复(而非无意义字符串)。
  • 强化幻觉遗忘效果:针对幻觉与事实强绑定的特点,设计 “事实关联挖掘” 模块,通过识别幻觉样本中的错误事实特征,提升遗忘的精准性。
  • 多任务协同遗忘:研究 “同时遗忘多类不良行为(如有害内容 + 版权信息)” 的方法,避免单任务遗忘对其他任务的干扰,确保正常效用不被叠加损害。
Logo

中国智能体开发者社区,聚焦智能体与大模型开发,提供前沿资讯、实用工具链、开源项目及行业案例。通过技术沙龙、开发者大赛等活动,促进经验交流与协作,助力开发者快速构建创新智能应用。

更多推荐