快速入门LLM Unlearning: Large Language Model Unlearning明确设置、目标与评估体系 这篇文章就够了
快速了解LLM Unlearning研究全流程!2024年字节跳动发表的论文《Large Language Model Unlearning》[2310.10683] Large Language Model Unlearning
只是讲述LLM unlearn的应用场景、技术方法、评估指标、使用的数据集等,具体大模型忘没忘、忘干净没、效果怎么样,还得后序做研究探索。
一、论文核心摘要
如何让大型语言模型遗忘不良行为(Unlearning),以实现模型与人类偏好的对齐。其核心结论与定位如下(各位还是看一下核心的摘要原文):

1、3个核心场景
- 移除有害输出 remove harmful responses
- 删除版权保护内容 erasing copyright-protected content
- 减少幻觉 reducing hallucinations
后面大家做的优化,都是想办法解决这3个目标
2、Unlearning 的三大优势(对比RLHF)
(1)数据成本低:仅需负样本,可通过红队测试、用户反馈自动收集,无需 RLHF 所需的人工撰写 “正样本”
(2)计算效率高:成本与 “轻量监督微调” 相当,远低于 RLHF 的三阶段(SFT→奖励模型训练→PPO)流程
(3)针对性强:若明确导致不良行为的训练样本,可直接移除其影响,无需像 RLHF 通过 “正样本间接引导”。
3、关键结果
在资源有限场景下优先阻止不良输出而非生成优质输出,Unlearning 表现更优。仅用 RLHF 2% 的计算时间,即可实现比 RLHF 更优的对齐性能。
二、核心内容
1、 定义 LLM Unlearning的范式
(1)区别于传统分类模型的Unlearning(仅需判断样本是否归为某类),LLM Unlearning需针对自然语言输出的 “不良行为”(如有害、侵权、幻觉)定义目标,而非清晰的类别标签。
(2)首次提出 LLM Unlearning 的设置、目标与评估体系(有效性、泛化性、效用保持三大核心目标),为后续研究提供基准。
2、提出适配 LLM 的 Unlearning 技术方案
(1)针对 LLM 参数规模大、输出空间广的特点,摒弃传统分类模型的Hessian矩阵、影响函数等低效方法,采用梯度上升(GA)+ 多损失协同优化的方案,平衡 “大模型遗忘的效果” 与 “大模型的正常性能保持”
平衡“遗忘效果”和“避免灾难性遗忘”也是一个需要考虑的点
(2)解决了 LLM Unlearning 的三大特有问题,并给出解决方案见下表 。
| LLM Unlearning 特有问题 | 解决方案 |
|---|---|
| 遗忘样本的损失无法有效指示遗忘效果(如损失达 60 仍输出有害内容) | 持续训练至损失骤升后,额外训练 3-5 倍批次;引入随机mismatch损失强化遗忘 |
| 正常任务性能易退化(遗忘有害内容后,正常 prompt 输出无意义内容) | 用 KL 散度约束 “遗忘后模型” 与 “原始模型” 在正常样本上的分布差异,保持输出一致性 |
| 数据格式影响遗忘泛化性(如遗忘 Q&A 类有害内容,却无法泛化到其他格式) | 确保正常数据集与遗忘数据集格式一致(如均为 Q&A) |
3、验证 “负样本对齐” 的可行性
打破 RLHF “需正样本引导” 的固有范式,证明仅用负样本即可实现 “阻止不良输出” 的核心目标。适合资源有限场景,因为 “不良输出的危害远大于优质输出的收益”,即一次有害输出即可摧毁用户信任。
三、LLM Unlearning 工作框架
明确 LLM Unlearning 的完整工作流程,包含设置(Setting)、目标(Goals)、技术方法(Method) 三部分。
1. 基础设置(Input Definition)
定义 Unlearning 所需的核心数据与模型组件,确保目标明确:
| 组件 | 定义与作用 | 示例 |
|---|---|---|
| 待遗忘数据集 | 包含 “不良prompt—不良输出” 对 |
|
| 原始模型θ° | 未经过 Unlearning 的预训练 / 微调模型(已学习到不良行为),是 Unlearning 的起点。 | OPT-1.3B、Llama2-7B |
| 正常数据集 | 包含 “正常prompt—正常输出” 对 格式需与 |
|
2. 核心目标(Goals)
Unlearning 需同时满足四大目标,缺一不可:
- 有效性(Effectiveness):模型对
中的
,输出需与
(不良输出)显著差异(如有害 prompt 输出 “无意义内容” 而非暴力指导);
- 泛化性(Generalization):遗忘效果可覆盖 “未见过的相似不良样本”(如遗忘 “如何杀人” 后,也能拒绝 “如何伤害动物”);
- 效用保持(Utility):模型对 D^nor 中的正常 prompt,输出需与原始模型 θ° 接近(如回答事实问题的准确性不下降);
- 低成本(Low Cost):计算成本远低于 “重新训练模型”,且无需复杂流程。
3. 技术方法(核心算法)
本文提出基于多损失协同优化的 Unlearning 框架,通过梯度更新让模型 “主动遗忘” 不良行为,同时保持正常效用。核心更新公式如下:

损失权重的作用与定义如下:
| 损失函数 | 核心作用 | 数学定义与逻辑 |
|---|---|---|
| 遗忘损失 | 让模型拒绝生成不良输出 | 基于梯度上升设计。梯度上升最大化损失 |
| 随机Mismatch损失 | 强化模型对 “不良 prompt | 让 强制模型对 |
| 正常效用损失 | 确保模型在正常任务上的输出与原始模型一致 | 基于KL 散度设计。约束 “遗忘后模型” 与 “原始模型” 在正常样本上的概率分布差异,避免正常性能退化 |
关键实现细节:
- 损失计算范围:仅对 “输出 y” 的 tokens 计算损失,不对 “输入 prompt x” 计算。避免模型遗忘 “理解 prompt 的能力”;
- 训练迭代:需持续训练至
骤升后,额外训练 3-5 倍批次(如损失达 60 后继续训练至 1000 批次),确保模型真正 “遗忘” 而非仅表面拟合。

四、实验验证
论文通过3 个核心应用场景与2 组消融实验,验证了 Unlearning 的有效性。实验所用模型均为开源 LLM:OPT-1.3B、OPT-2.7B、Llama2-7B。
1. 场景 1:遗忘有害输出
实验设置
- 待遗忘数据集
:PKU-SafeRLHF 中的 “有害 Q&A 对”(如 “如何偷窃”“胖子是否更丑”);
- 正常数据集
:TruthfulQA(事实性 Q&A,如 “地球自转周期是多少”);
- 评估指标:有害率、正常效用、输出相似度。
核心结果
| 指标 | 原始模型 | RLHF(全流程) | Unlearning(GA+Mismatch) |
|---|---|---|---|
| 已学习有害 prompt 有害率 | 47% | 4% | 6% |
| 未见过有害 prompt 有害率 | 53% | 7.5% | 7% |
| 正常 prompt 奖励得分 | -3.599 | -3.212 | -2.982(优于原始模型) |
| 计算时间(A100) | - | ~40 小时 | ~0.8 小时(仅 2%) |
结论:Unlearning 可将有害率降至接近 0,且泛化到未见过的有害 prompt;正常效用保持良好,计算成本远低于 RLHF。
2. 场景 2:遗忘受版权保护内容
实验设置
- 待遗忘数据集
:《哈利波特与魔法石》全文(先微调模型使其学习该版权内容,再让模型遗忘);
- 正常数据集
:BookCorpus(与哈利波特同格式的书籍文本,确保格式一致性);
- 评估指标:泄露率(模型补全版权内容的比例,用 BLEU 分数判定,BLEU > 阈值即为泄露)、正常文本补全效用。
核心结果
| 模型 | 原始模型(微调后) | Unlearning(GA+Mismatch) | 正常文本补全相似度(与原始模型) |
|---|---|---|---|
| OPT-1.3B | 78% | 0% | -0.643(接近原始) |
| OPT-2.7B | 81% | 0% | -0.910(接近原始) |
| Llama2-7B | 81% | 1% | -0.366(接近原始) |
- 结论:Unlearning 可将版权泄露率降至 1% 以下,且对正常书籍文本的补全能力无显著退化;能泛化到 “未见过的哈利波特内容提取 prompt”。
3. 场景 3:减少幻觉
实验设置
- 待遗忘数据集
:HaluEval 中的 “幻觉 Q&A 对”(如 “疫苗会永久改变 DNA 吗?” 的错误输出)
- 正常数据集
:TruthfulQA(事实性 Q&A)
- 评估指标:幻觉率(输出与错误答案的BERTscore比正确答案高 10% 以上的比例)、分布外(TruthfulQA)输出效用。
核心结果
| 模型 | 原始模型幻觉率 | Unlearning(GA+Mismatch)幻觉率 | TruthfulQA 输出奖励得分(与原始模型差异) |
|---|---|---|---|
| OPT-1.3B | 58.5% | 15% | -3.958(差异 < 0.1) |
| OPT-2.7B | 60% | 12.5% | -3.473(差异 < 0.2) |
| Llama2-7B | 49.5% | 11.5% | -2.100(差异 < 0.5) |
结论:Unlearning 可将幻觉率降低 70% 以上,且能区分 “分布内幻觉 prompt”(HaluEval)与 “分布外正常 prompt”(TruthfulQA),仅对前者减少幻觉,对后者保持正常输出。
五、不足与未来
- 特定任务效果不足:相比 “移除有害内容”“擦除版权信息”,“减少幻觉” 的遗忘效果更差,因幻觉与具体事实强绑定,泛化性遗忘难度更高。
- 回复质量局限:遗忘仅能生成 “非有害但无意义” 的输出(如空白字符串),即使引入模板回复(如 “I can’t assist it.”),其效果与无意义输出无显著差异,无法生成 “有帮助的合理回复”(受限于仅依赖负样本,无正样本指导)。
- 泛化性与鲁棒性待提升:虽能泛化到未见过的相似样本,但面对更复杂的改写攻击(如对有害提示的多样 paraphrase),遗忘效果的稳定性仍需验证。
1. 构建统一的 LLM 遗忘评估框架
- 核心目标:解决当前评估碎片化的问题(如不同应用场景用不同指标:有害率、泄露率、幻觉率),建立覆盖 “遗忘效果、泛化性、正常效用、计算效率” 的多维度评估体系。
- 具体推进点:
- 设计适配 LLM 的评估指标,替代传统 MIA(如基于 “行为偏离度” 量化遗忘效果,而非依赖训练数据的成员推理);
- 建立公开的 LLM 遗忘基准数据集,包含多样场景(有害内容、版权信息、幻觉)和改写样本,统一实验对比标准。
2. 探索高效且有理论保证的遗忘方法
- 核心目标:突破现有梯度上升(GA)方法的局限,找到兼顾 “计算效率” 与 “理论严谨性” 的新范式。
- 具体推进点:
- 研究基于 “影响函数” 的方法:解决传统影响函数计算复杂的问题,适配 LLM 大规模参数,实现 “精准定位需遗忘样本的影响”,减少对无关样本的干扰;
- 融合多损失优化:优化现有 “遗忘损失
+ 随机失配损失
+ 正常效用损失
” 的权重机制,提升对幻觉等复杂任务的遗忘效果。
3. 提升遗忘的实用性与泛化性
- 优化回复质量:探索 “无需正样本也能生成合理回复” 的方法,如结合知识蒸馏(从原始 LLM 提取正常回复的特征),让遗忘模型在规避有害输出时,生成更自然的非有害回复(而非无意义字符串)。
- 强化幻觉遗忘效果:针对幻觉与事实强绑定的特点,设计 “事实关联挖掘” 模块,通过识别幻觉样本中的错误事实特征,提升遗忘的精准性。
- 多任务协同遗忘:研究 “同时遗忘多类不良行为(如有害内容 + 版权信息)” 的方法,避免单任务遗忘对其他任务的干扰,确保正常效用不被叠加损害。
更多推荐



所有评论(0)