ICLR 2025

  • 大型语言模型(LLMs)在生成文本方面表现出卓越的能力,这得益于它们在大规模文本语料上的广泛训练。
    • 然而,正因其训练数据来源广泛且复杂,LLMs 也可能继承训练数据中的不良行为或敏感内容,包括受版权保护的信息或用户隐私数据
    • 为了解决这一问题,研究者提出了 机器遗忘(Machine Unlearning) 作为一种可行方案,目标是在无需从头重新训练的前提下,有效清除模型中的特定知识,同时尽量保留模型原有能力(utility)
  • 尽管当前已有多种 LLM 遗忘技术取得了不错的结果,但一个关键问题被忽视了
    • 这些方法是否真正实现了“遗忘”,还是仅仅将敏感知识“隐藏”了起来?
    • 现有的遗忘评估基准难以检测出这一问题,可能误判模型已遗忘。

  • 论文发现:模型中被“遗忘”的信息,在量化后竟然可以被部分恢复!

    • 这说明很多遗忘方法并非真正删除了目标知识,而是以高精度格式“藏”在了参数中

  • 为了系统研究这一现象,本文在多个量化维度下进行了广泛实验:

    • 应用了多种主流模型量化技术(如逐层量化、对称/非对称量化);

    • 使用不同的精度等级(如 16-bit、8-bit、4-bit)进行对比;

    • 覆盖多种典型的 LLM 遗忘方法,并对比不同任务。

  • 实验结果:

    • 在原始全精度模型中,平均仍保留了约 21% 的目标遗忘信息

    • 一旦模型被量化到 4-bit,可恢复的“被遗忘”信息激增至 83%

    • 说明模型并未真正遗忘这些知识,而只是以高维形式暂时“压制”了它们

Logo

开源鸿蒙跨平台开发社区汇聚开发者与厂商,共建“一次开发,多端部署”的开源生态,致力于降低跨端开发门槛,推动万物智联创新。

更多推荐