A Closer Look at Machine Unlearning for Large Language Models 提出新的评估体系+抗幻觉、防过度无知的遗忘策略
《A Closer Look at Machine Unlearning for Large Language Models》(ICLR 2025)
论文:A Closer Look at Machine Unlearning for Large Language Models | OpenReview
一、核心创新点
1. 完善 LLM 遗忘评估体系:新增三维度指标与聚合指标
现有研究仅依赖 ROUGE评估遗忘效果,无法捕捉模型输出的多样性、语义一致性与事实正确性。论文提出3 个新增指标与2 个聚合指标,实现全面评估:
新增基础指标:
- Token Entropy(TE,token 多样性):量化输出中 token 的重复程度,避免模型生成无意义重复内容(如 “work work work...”)。公式通过归一化熵值计算,值越低表示重复率越高、可读性越差。
- Cosine Similarity(CS,语义相似度):用 SentenceBERT 计算遗忘前后模型输出的语义向量相似度,避免模型在保留集上添加无关内容。
- Entailment Score(ES,事实正确性):基于预训练 NLI 模型判断输出与真实答案的蕴含关系(蕴含 / 矛盾 / 中立),量化事实偏差。如将 “Basil Mahfouz Al-Kuwaiti” 错写为 “Fatima Al-Sabah” 会被判定为 “矛盾”。
聚合指标:
- Model Utility(MU,模型效用):保留集上所有指标(ROUGE、Probability、TR、TE、CS、ES)的调和平均,确保模型无单一指标趋近于 0(避免效用崩溃)。
- Forget Efficacy(FE,遗忘效果):遗忘集上除 TE 外所有指标的 “1 - 算术平均”,确保模型对遗忘集的记忆程度低。
2. 首次将 LLM 遗忘方法分类为 “无目标” 与 “有目标”,精准定位两类方法的核心缺陷
论文根据 “是否明确遗忘集的输出模板”,将现有遗忘方法分为两类,并指出其未被解决的问题。 untargeted and targeted

(1)无目标遗忘(Untargeted Unlearning)
仅要求模型不泄露遗忘集信息,不指定输出内容(如 GA、NPO)。
核心缺陷:理想 “保留模型”(仅用保留集训练的模型)行为不可预测。LLM 训练成本极高,无法获取真实保留模型;即使使用替代保留模型(如 TOFU 基准的虚构模型),也会产生 74% 的幻觉输出,存在法律风险。
(2)有目标遗忘(Targeted Unlearning)
要求模型对遗忘集输出指定模板(如 “Sorry, I don’t know”,如 IDK、DPO)。
遗忘集与保留集的分布相似,即
。因此在无目标遗忘过程中,降低遗忘集中答案的概率即
,也容易导致保留集中答案的概率
降低。以往的正则化方法主要致力于在遗忘过程中维持
的数值。
核心缺陷:现有正则(如 GD、KL)不足,导致模型 “过度无知”—— 因遗忘集与保留集分布相似,模型会对保留集也输出拒绝模板(如无法回答 “某作者出版数量” 这类保留集问题)。
3. 针对两类遗忘缺陷,提出针对性解决方案
- 对无目标遗忘:提出最大化熵(ME)目标,让模型在遗忘集上的行为接近随机初始化模型(无记忆、无幻觉)。
- 对有目标遗忘:提出答案保留(AP)损失,作为正则约束模型 “少拒绝、多正确回答保留集问题”。
| 分类 | Untargeted 无目标遗忘 | Targeted 有目标遗忘 |
| 解决问题 | 传统无目标遗忘(如 GA、NPO)行为不可预测,易产生幻觉的问题 | 有目标遗忘(如 IDK、DPO)易导致模型 “过度无知”的问题。 |
| 解决方法 | 采用最大化熵(ME)目标 ME+GD | 引入答案保留(AP)损失作为正则化项 IDK+AP |
| 解释 | ME(最大化熵):通过最小化模型对每个下一个 token 的预测分布与均匀分布的 KL 散度,等价于最大化预测分布的熵。此目标使模型在遗忘集上的行为趋近于 “随机初始化模型”。 GD(梯度下降):在保留集上采用训练阶段的预测损失进行梯度下降 | IDK(I Don’t Know)微调:将遗忘集问题重新标记为 “拒绝模板”,将遗忘任务转化为指令微调任务。 AP(答案保留)损失:降低模型在保留集上输出拒绝模板的概率;维持模型对保留集原始正确答案的预测概率,避免 “过度无知”。 |
二、提出的模型:ME+GD 与 IDK+AP
论文针对两类遗忘方法的缺陷,分别设计了抗幻觉、防过度无知的遗忘框架,核心思路是 “精准调整模型参数,平衡遗忘效果与效用保留”。
1. 无目标遗忘框架:ME+GD(Maximizing Entropy + Gradient Descent)
解决无目标遗忘中 “保留模型不可预测” 与 “幻觉风险”,让模型在遗忘集上的预测分布接近均匀分布(类似随机初始化模型,无特定知识记忆)。
关键设计
- 遗忘损失(ME 损失):最小化模型对遗忘集每个 token 的预测分布与 “词汇表均匀分布” 的 KL 散度,等价于最大化预测熵。
![]()
其中,为第 t 个 token 的预测分布;
为大小为 K 的词汇表均匀分布,每个 token 概率为 1/K。计算 ME 损失时包含 “问题 + 答案” 全序列(而非仅答案),避免模型通过问题关联记忆(如 “Where is the Eiffel Tower?” 这类问题本身触发记忆)。
- 正则损失(GD 损失):在保留集上施加梯度下降,维持模型对保留集的效用。
- 最终目标函数:
其中为超参数,控制遗忘强度(实验中取 0.1~1.0)。
2. 有目标遗忘框架:IDK+AP(IDK Fine-tune + Answer Preservation Loss)
解决有目标遗忘中 “过度无知”,确保模型对保留集输出正确答案,仅对遗忘集输出拒绝模板。
关键设计
- 基础遗忘损失(IDK 损失):将遗忘集问题的标签替换为随机拒绝模板(如 “I don’t know”),通过指令微调让模型学习对遗忘集输出拒绝内容。
- 正则损失(AP 损失):针对保留集,同时实现 “降低拒绝模板概率” 与 “维持原始答案概率”,通过自适应权重动态调整正则强度。
y为保留集真实答案,y'为拒绝模板,为 sigmoid 函数,
。
AP 损失的梯度包含两部分:对拒绝模板的梯度上升、对原始答案的梯度下降(维持其概率),且权重会随模型 “过度无知” 程度动态增大(当p(y)下降或p(y')上升时,权重变大,正则更强)。
- 最终目标函数:

三、实验设计与关键结果
论文在三个典型场景(虚构遗忘、持续遗忘、真实世界遗忘)中验证方法有效性,覆盖理想、动态、真实三类应用场景。
1. 实验基础设置
- 模型:无目标遗忘用 Llama2-chat-7B(TOFU 基准预训练模型),真实世界遗忘用 Llama3-8B-Instruct。
- 数据集:
- 虚构场景:TOFU 基准(200 个虚构作者,每个 20 个 QA 对,分 forget01/05/10 任务,分别遗忘 1%/5%/10% 数据);
- 持续场景:扩展 TOFU,多次遗忘(如 continual forget01 为 10 次遗忘 1%,累计遗忘 10%);
- 真实场景:20 个真实人物的遗忘集(每个 20 个 QA)、40 个真实人物的邻居集(20 个用于正则,20 个用于评估),下游任务含 MMLU(通用能力)、ARC-c(推理)、GSM8K(算术)、TriviaQA(事实)、TruthfulQA(真实性)。
- 基线方法:无目标(GA+GD、GA+KL、NPO+GD、NPO+KL),有目标(DPO+GD、DPO+KL、IDK+GD)。
2. 场景 1:虚构遗忘(TOFU 基准)—— 验证方法的基础有效性


- 无目标遗忘:ME+GD 实现 MU 与 FE 的最优平衡:
forget05 任务中,ME+GD 的 MU=0.7472,即使增加到 10 个遗忘 epoch,ME+GD 仍能持续提升 FE 且不降低 MU,而 NPO 类方法 FE 会提前饱和。
- 有目标遗忘:IDK+AP 避免过度无知:
forget10 任务中,IDK+AP 的 MU=0.7471,IDK+AP 在保留集上的 ROUGE=0.7141 ES=0.8878,远高于 IDK+GD,证明其能正确回答保留集问题。
3. 场景 2:持续遗忘(扩展 TOFU)—— 验证方法的动态适应性
多次处理不同遗忘请求(如 continual forget01:10 次遗忘 1% 数据,累计遗忘 10%;continual forget10:9 次遗忘 10% 数据,累计遗忘 90%),保留集随遗忘次数增加而减少。
结果见论文图 6、图 7
- ME+GD 表现最优:在所有持续任务中维持高 MU。continual forget01 中,ME+GD 的 MU 始终 > 0.5,而 GA+GD、NPO+GD 在第 5 次遗忘后 MU 降至 0;continual forget10 中,ME+GD 在累计遗忘 90% 数据时仍保持 MU=0.5+。
- IDK+AP 的局限性与改进:累计遗忘 50% 后 MU 开始下降,原因是保留集过小导致 AP 损失的自适应权重不足;补充无关数据集(Alpaca)到保留集后,IDK+AP 的 MU 下降趋势被缓解,证明保留集规模是关键。
- NPO 类方法的缺陷:持续遗忘中参考模型变为 “前一次遗忘后的模型”(而非初始模型),导致 MU 快速降至 0;若固定参考模型为初始模型,虽能稳定 MU,但违反 “被遗忘权”(保留初始模型参数存在隐私风险)。
4. 场景 3:真实世界遗忘(Llama3 + 真实人物数据)—— 验证方法的实用性
核心结果见表 2、表 8

- 无目标遗忘:ME+GD 是唯一同时保持高 MU 和 FE 的方法
- 有目标遗忘:IDK+AP 在保留集上效用最优(表8)
四、总结
- 新增的 TE、CS、ES 指标与 MU/FE 聚合指标,为 LLM 遗忘评估提供了全面标准;
- 无目标遗忘的 ME+GD 框架通过最大化熵避免幻觉,有目标遗忘的 IDK+AP 框架通过 AP 损失防过度无知;
- 三个场景的实验证明,两种方法在效用保留、遗忘效果、动态适应性上均优于现有基线,为 LLM “被遗忘权” 的实际落地提供了可行方案。
更多推荐



所有评论(0)