[2502.01083] Tool Unlearning for Tool-Augmented LLMs (ICML2025)

  • 核心定位:LLM Unlearning 的细分场景(工具遗忘),首次将 MIA 直接集成到 Unlearning 的评估流程中。工具增强型 LLM(如能调用 API 的模型)需遗忘特定工具(如不安全的医疗数据 API、过时的代码工具),论文提出 TOOLDELETE 方法实现工具遗忘,并设计了专属 MIA 模型来验证 “遗忘效果”。例如,用 MIA 判断模型是否仍记忆 “调用某废弃 API 的训练样本”,若 MIA 准确率显著下降,则工具遗忘成功。
  • 与 MIA 的关联:首次在 LLM Unlearning 场景中提出 “定制化 MIA 评估方案”,而非直接复用通用 MIA,为后续研究提供了 “场景化 MIA 设计” 的范式。
  • 学习重点:掌握 “Unlearning 场景如何定制 MIA”(如工具遗忘需关注 “工具调用样本” 的成员身份,而非普通文本)
  • 可惜没开源

一些快速概念:

论文的工具遗忘(tool unlearning)是工具学习(tool learning)的反向操作,必须先明确工具增强 LLM 是怎么 “学会用工具” 的。

1. 工具学习的输入

  • 数据集 D:包含 3 部分,D=\{T, Q, Y\}
    • T:N 个工具的集合(如 API、计算器),每个工具t_i \in T
    • Q:用户查询集合(如 “用 API 查苹果用户邮箱”)
    • Y:对应查询的正确工具调用响应(如 “<Make HTTP GET Request> list_users(...)”)
    • 每个工具t_i有至少 1 组演示数据\{Q_i, Y_i\}(怎么用t_i的例子)。
  • 初始模型f_0:未学过工具的 “指令微调 LLM”,可能有基础能力,但不会调用特定工具。

2. 工具学习的过程

用数据集D微调初始模型f_0,得到工具增强模型f。模型 f 能自主调用 T 中的 N 个工具解决任务(比如用户问 “算 1+2+3”,f会调用计算器工具输出结果)。→ 核心:工具使用能力被 “嵌入”f的参数中,而非简单存于输入层。

3、MIA成员推理攻击:https://zhuanlan.zhihu.com/p/561980835

一、论文综述

本文聚焦工具增强大型语言模型(Tool-Augmented LLMs)的 “工具遗忘” 问题,是首个系统性定义该任务、提出解决方案并设计评估方法的研究。

1. 研究背景

Tool-Augmented LLMs(如调用计算器、API、Python 解释器的模型)通过在 “查询 - 响应对” 数据集上训练,将工具使用能力嵌入模型参数,已广泛应用于医疗、代码生成等领域。但现实场景中,需让模型遗忘特定工具

  • 安全风险:工具存在漏洞(如医疗 API 泄露患者数据,违反 HIPAA);
  • 合规需求:工具涉及隐私或版权问题(如未授权下载书籍的 API);
  • 工具迭代:旧工具废弃(如 Python Transformers v3 升级至 v4,旧调用方式失效)。

传统 “样本级遗忘”(删除单个训练样本的记忆)无法解决该问题;工具遗忘需移除功能知识(技能) ,而非孤立数据点,且需避免影响其他工具能力和模型通用性能。

2. 核心问题

工具遗忘面临三大挑战:

  1. 目标差异:需移除 “工具使用能力”(如调用某 API 的逻辑),而非单个样本记忆;
  2. 成本控制:LLM 参数规模大,全量重训成本极高;
  3. 评估缺失:传统成员推理攻击(MIA)聚焦样本级,无法衡量 “工具知识是否被移除”。

3. 核心方法

提出两大创新组件:

  • TOOLDELETE 框架:首个专为工具遗忘设计的算法,通过三大核心属性实现高效遗忘;
  • LiRA-Tool 评估方法:首个针对工具遗忘的成员推理攻击(MIA),解决传统评估的局限性。

4. 实验结果

在 3 个数据集(ToolAlpaca、ToolBench、API-Bench)和 3 个工具增强 LLM(ToolAlpaca 7B、ToolLLaMA、Gorilla)上验证:

  • 性能优势:比传统遗忘方法(如 GA、ICUL)在 “遗忘工具准确率” 高 12.5 个点,“保留工具准确率” 高 9.1 个点;
  • 效率优势:比全量重训节省 74.8% 训练时间,LoRA 版本进一步节省 81.1% 计算成本;
  • 鲁棒性:支持 “顺序遗忘”(分批遗忘工具),低资源场景下仍保留 95% 通用性能;
  • 灵活性:无训练数据时,通过 “阴影样本” 仍可有效遗忘。

5. 研究结论

TOOLDELETE 可高效、精准地让工具增强 LLM 遗忘特定工具,同时保留其他工具能力和通用任务性能;LiRA-Tool 为工具遗忘提供了可靠的评估手段。

二、论文核心创新点

本文的核心突破在于定义工具遗忘(tool unlearning)新任务,并厘清其与传统 “样本级遗忘” 的本质差异,具体如下:

1. 首次形式化tool unlearning任务

  • 任务定义:给定工具增强模型f(已学会N个工具),需移除k<N个目标工具T_f的使用能力,同时保留剩余工具T_r的能力和模型通用性能(如文本生成、推理);
  • 理想目标:遗忘后的模型f'T_f的知识 “等价于从未学过”,对T_r和通用任务的性能 “不低于原模型f”。

2. 工具遗忘与传统样本级遗忘的三大差异

维度样本级遗忘(传统)工具遗忘(本文)
目标减少单个样本(q_i,y_i)的记忆移除 工具使用技能(如 API 调用逻辑)
评估指标样本提取概率、困惑度工具使用准确率(T_f↓, T_r↑)
数据需求需访问所有待遗忘样本无需访问原训练样本(可生成阴影样本)
关键风险样本泄露“涟漪效应”(改T_f影响T_r

例如:样本级遗忘只需让f'(q_i)y_i表面不同(语义可保留);而工具遗忘需让f'完全无法正确调用T_f(即使语义一致,功能错误也视为成功)。

3. 强调 “参数级遗忘” 的必要性

传统的Prompt 级工具屏蔽存在致命缺陷:

  • 模型参数中仍保留T_f的知识,攻击者可通过诱导绕过屏蔽(如伪装查询)
  • 模型参数知识与 Prompt 上下文冲突,易导致幻觉或错误输出
  • 实验验证(Table 1 中 ICLU 模型):Prompt 级方法无法有效降低T_f的使用准确率

三、核心模型:TOOLDELETE 框架

TOOLDELETE 是首个实现 “工具遗忘三大核心属性” 的算法,其设计目标是精准遗忘目标工具、完整保留有用知识、高效控制优化成本

1. 三大核心属性

TOOLDELETE 的核心是通过三个约束确保遗忘效果,每个属性均有严格数学定义和工程实现方案:

(1)工具知识删除(Tool Knowledge Deletion, TKD)

  • 目标:让f'T_f的知识不超过工具无关模型f_0。其中f_0是未经过工具训练的指令微调 LLM
  • 数学定义:设g(\cdot,\cdot)为模型对工具的知识量化函数,则需满足:

\underset{t_{i} \in \mathcal{T}_{f}}{\mathbb{E}}\left[g\left(f_{0}, t_{i}\right)-g\left(f', t_{i}\right)\right] \geq 0

极端场景(恶意工具)可要求g(f',t_i)=0;一般场景可要求g(f',t_i)=g(f_0,t_i)(重置为学工具前的水平);

  • 实现方案

        (1)用f_0T_f的所有查询Q_f生成 “工具无关响应”Y_f' = f_0(Q_f)(如无法调用 API 时的自然语言回复);

        (2)约束f'生成的响应与Y_f'尽可能相似,避免保留T_f的使用逻辑。

(2)工具知识保留(Tool Knowledge Retention, TKR)
  • 目标f'T_r的知识 “与原模型f一致”,避免遗忘目标工具时影响其他工具;
  • 数学定义

\underset{t_{m} \in \mathcal{T}_{r}}{\mathbb{E}}\left[g\left(f, t_{m}\right)-g\left(f', t_{m}\right)\right]=\epsilon

其中\epsilon是极小值。

  • 实现方案:对T_r的 “查询 - 响应对”(Q_r,Y_r)进行微调(或采样部分T_r数据以提升效率),确保f'仍能正确调用T_r
(3)通用能力保留(General Capability Retention, GCR)
  • 目标f'在通用任务(文本生成、推理、STEM 知识)上的性能不低于f_0,避免工具遗忘导致模型退化;
  • 数学定义:设T_G为通用任务集合,则

\underset{t_{g} \in \mathcal{T}_{G}}{\mathbb{E}}\left[g\left(f_{0}, t_{g}\right)-g\left(f', t_{g}\right)\right]=\epsilon

  • 实现方案:任务算术(Task Arithmetic)核心思想是 “提取通用知识的参数方向,补偿f'的通用能力损失”:

       (1)设\theta_0f_0的参数,\theta_R为随机初始化模型f_R的参数;

       (2)\theta_0 - \theta_R表示 “通用知识的参数增量”(从随机初始化到指令微调的知识方向);

       (3)对f'的参数\theta'进行调整:

\theta^{\prime *} \leftarrow \theta' + \alpha \cdot (\theta_0 - \theta_R)

                ,其中\alpha是超参数(用来控制通用知识的补偿强度)。

        方案的优势:无需重训通用任务数据,仅需向量运算,效率极高;避免通用知识与工具知识的冲突。

2. 训练目标与变体

(1)整体优化目标

TOOLDELETE 的训练分为两步:

论文中的公式

  1. 最小化 “TKD 损失” 和 “TKR 损失”,得到初步优化的参数\theta'
  2. 应用 “任务算术” 调整\theta',得到最终参数\theta'^*(满足 GCR)
(2)两大实现变体

根据优化范式不同,TOOLDELETE 提供两种变体,适配不同场景:

变体优化方式核心操作适用场景
TOOLDELETE-SFT

监督微调

(Supervised Fine-Tuning)

T_f:用Y_f'替换原Y_f

T_r:保留原Y_r

用语言建模损失(LM Loss)训练

数据充足、追求稳定收敛的场景
TOOLDELETE-DPO

直接偏好优化

(Direct Preference Optimization)

T_f:偏好Y_f'(赢样本)而非Y_f(输样本)

T_r:偏好Y_r而非Y_f'

用 DPO 损失优化

数据有限、需快速对齐偏好的场景

实验表明(论文Table 1):DPO 变体在T_t(测试集)、T_r(保留工具)、T_r(遗忘工具)上的性能略优于 SFT,但训练时间稍长。

3. 评估方法:LiRA-Tool

传统 MIA(如 LiRA)聚焦 “样本是否被训练过”,无法评估 “工具知识是否被移除”(因工具功能远超有限训练样本)。本文提出LiRA-Tool,通过 “阴影样本” 覆盖工具全功能,实现知识级评估。

(1)核心痛点:传统 MIA 的局限性
  • 依赖原训练样本(Q_f,Y_f),无法覆盖工具的所有使用场景(如未见过的 API 参数组合);
  • 易 “过拟合” 到训练样本,误判 “模型遗忘了样本但未遗忘工具功能”。
(2)LiRA-Tool 的设计
  • 核心创新:阴影样本(Shadow Samples)用 GPT-4 生成多样化的 “工具查询 - 响应对” ,覆盖工具的不同使用场景(如不同参数、不同用户意图、不同格式),确保评估能反映 “工具整体功能是否被遗忘”;
  • 评估逻辑: likelihood 比率测试比较 “遗忘模型f'T_f阴影样本的损失分布” 与 “原模型f对T_r阴影样本的损失分布”,计算比率:

\Lambda=\frac{\Pi_{t_{i} \in \mathcal{T}_{f}} \Pi_{(x, y) \in \mathbb{P}_{t_{i}}} P_{U}\left(l\left(f'(x), y\right)\right)}{\Pi_{t_{j} \in T_{r}} \Pi_{(x, y) \in \mathbb{P}_{t_{j}}} P_{\mathcal{T}_{r}}(l(f(x), y))}

      其中\mathbb{P}_{t_i}是工具t_i的阴影样本分布,P_Uf'T_f的损失分布,P_{T_r}是f对T_r的损失分布;

  • 评估指标:TPR@FPR=0.01(FPR=1% 时的真阳性率),值越低表示 “工具知识被移除得越彻底”(攻击者越难检测到模型曾学过T_f)。
(3)实验验证

LiRA-Tool 显示:TOOLDELETE-DPO 的 TPR@FPR=0.01 仅为 0.14,优于传统方法(GRADASCENT 为 0.21,ICUL 为 0.18),证明其能有效移除工具知识。

四、实验部分

1. 实验设置

(1)数据集与模型
数据集工具数量训练样本数对应工具增强 LLM核心任务
ToolAlpaca4953975ToolAlpaca 7B(基于 Vicuna-v1.3)通用工具调用
ToolBench16k+16k+ToolLLaMA(基于 LLaMA-2 7B)真实世界 API 调用
API-Bench--Gorilla(基于 LLaMA 7B)机器学习模型 API 调用
(2)评估指标
  • 工具遗忘效果T_f准确率(↓,越低越好)、T_r准确率(↑,越高越好)、T_t(测试集)准确率(↑,越高越好);
  • 通用能力:MMLU(STEM 知识)、BBH-Hard(推理)、IFEval(指令跟随)、Factual Knowledge(事实知识)的平均得分(↑,越高越好);
  • 隐私与效率:LiRA-Tool 的 TPR@FPR=0.01(↓)、训练时间(↓)、计算成本(↓)。
(3)基线方法
  • 通用遗忘方法:GRADASCENT(梯度上升)、RANDLABEL(随机标签)、SALUN(显著性参数微调)、RETRAIN(全量重训,上限基线);
  • LLM 特定遗忘方法:ICUL(上下文污染)、SGA(选择性梯度上升)、TAU(SGA + 任务算术)、CUT(激活控制)、NPO(负偏好优化)、SOUL-GRADDIFF(二阶优化)。

2. 关键实验结果

(1)性能对比:TOOLDELETE 优于所有基线

以 ToolAlpaca(遗忘 20% 工具)为例(Table 1):

  • T_t(测试集):TOOLDELETE-DPO 达 53.4,比 RETRAIN(52.1)高 1.3 个点;
  • T_r(保留工具):TOOLDELETE-DPO 达 75.1,比 RETRAIN(71.8)高 3.3 个点;
  • T_f(遗忘工具):TOOLDELETE-DPO 达 28.7,比 RETRAIN(38.5)低 9.8 个点;
  • 通用能力:TOOLDELETE-DPO 的 TG 平均得分为 23.1,比 RETRAIN(21.3)高 1.8 个点。
(2)效率与灵活性
  • 效率:TOOLDELETE 平均节省 74.8% 训练时间,LoRA 版本(TOOLDELETE-LoRA)节省 81.1% 计算成本,且性能保留率超 84%(Table 3);
  • 顺序遗忘:分批遗忘 2%→5%→10%→20% 工具时,性能与 “一次性遗忘 20%” 差异小于 2%(Figure 3);
  • 无训练数据:用阴影样本替代原训练数据时,性能仅下降 0.5-1.0 个点(Table 4)。
(4)LiRA-Tool 评估:隐私保护更好

Figure 2 显示,TOOLDELETE-DPO 的 TPR@FPR=0.01 仅为 0.14,低于 GRADASCENT(0.21)和 ICUL(0.18),说明其能更彻底地移除工具知识,降低隐私泄露风险。

3. 其他验证

  • 模型适配性:在 ToolLLaMA 和 Gorilla 上的结果与 ToolAlpaca 一致(Table 5-6);
  • 工具无关响应灵活性:用随机初始化模型f_R替代f_0生成响应时,性能仅下降 0.7-2.0 个点(Table 7),证明无需依赖f_0也可工作。

五、总结

本文的核心贡献的在于:

  1. 任务创新首次定义 “工具遗忘” 任务,厘清其与传统遗忘的本质差异
  2. 方法创新:提出 TOOLDELETE 框架,通过 TKD、TKR、GCR 三大属性实现精准、高效的工具遗忘;
  3. 评估创新:设计 LiRA-Tool,解决工具遗忘的评估难题;

关注专栏,了解一手有关LLM Unlearning信息!

感谢您的点赞、阅读、评论和收藏!

Logo

开源鸿蒙跨平台开发社区汇聚开发者与厂商,共建“一次开发,多端部署”的开源生态,致力于降低跨端开发门槛,推动万物智联创新。

更多推荐