论文略读: CATASTROPHIC FAILURE OF LLM UNLEARNING VIA QUANTIZATION
·
ICLR 2025
- 大型语言模型(LLMs)在生成文本方面表现出卓越的能力,这得益于它们在大规模文本语料上的广泛训练。
- 然而,正因其训练数据来源广泛且复杂,LLMs 也可能继承训练数据中的不良行为或敏感内容,包括受版权保护的信息或用户隐私数据。
- 为了解决这一问题,研究者提出了 机器遗忘(Machine Unlearning) 作为一种可行方案,目标是在无需从头重新训练的前提下,有效清除模型中的特定知识,同时尽量保留模型原有能力(utility)。
- 尽管当前已有多种 LLM 遗忘技术取得了不错的结果,但一个关键问题被忽视了:
- 这些方法是否真正实现了“遗忘”,还是仅仅将敏感知识“隐藏”了起来?
-
现有的遗忘评估基准难以检测出这一问题,可能误判模型已遗忘。
-
论文发现:模型中被“遗忘”的信息,在量化后竟然可以被部分恢复!
-
这说明很多遗忘方法并非真正删除了目标知识,而是以高精度格式“藏”在了参数中。
-
-
为了系统研究这一现象,本文在多个量化维度下进行了广泛实验:
-
应用了多种主流模型量化技术(如逐层量化、对称/非对称量化);
-
使用不同的精度等级(如 16-bit、8-bit、4-bit)进行对比;
-
覆盖多种典型的 LLM 遗忘方法,并对比不同任务。
-
-
实验结果:
-
在原始全精度模型中,平均仍保留了约 21% 的目标遗忘信息;
-
一旦模型被量化到 4-bit,可恢复的“被遗忘”信息激增至 83%;
-
说明模型并未真正遗忘这些知识,而只是以高维形式暂时“压制”了它们。
-

更多推荐


所有评论(0)