Tool Unlearning for Tool-Augmented LLMs 提出工具遗忘概念,LLM Unlearning 的细分场景,大模型遗忘下的MIA优化
[2502.01083] Tool Unlearning for Tool-Augmented LLMs (ICML2025)
- 核心定位:LLM Unlearning 的细分场景(工具遗忘),首次将 MIA 直接集成到 Unlearning 的评估流程中。工具增强型 LLM(如能调用 API 的模型)需遗忘特定工具(如不安全的医疗数据 API、过时的代码工具),论文提出 TOOLDELETE 方法实现工具遗忘,并设计了专属 MIA 模型来验证 “遗忘效果”。例如,用 MIA 判断模型是否仍记忆 “调用某废弃 API 的训练样本”,若 MIA 准确率显著下降,则工具遗忘成功。
- 与 MIA 的关联:首次在 LLM Unlearning 场景中提出 “定制化 MIA 评估方案”,而非直接复用通用 MIA,为后续研究提供了 “场景化 MIA 设计” 的范式。
- 学习重点:掌握 “Unlearning 场景如何定制 MIA”(如工具遗忘需关注 “工具调用样本” 的成员身份,而非普通文本)
- 可惜没开源
一些快速概念:
论文的工具遗忘(tool unlearning)是工具学习(tool learning)的反向操作,必须先明确工具增强 LLM 是怎么 “学会用工具” 的。
1. 工具学习的输入
- 数据集 D:包含 3 部分,
![]()
- T:N 个工具的集合(如 API、计算器),每个工具
- Q:用户查询集合(如 “用 API 查苹果用户邮箱”)
- Y:对应查询的正确工具调用响应(如 “<Make HTTP GET Request> list_users(...)”)
- 每个工具
有至少 1 组演示数据
(怎么用
的例子)。
- 初始模型
:未学过工具的 “指令微调 LLM”,可能有基础能力,但不会调用特定工具。
2. 工具学习的过程
用数据集D微调初始模型
,得到工具增强模型f。模型 f 能自主调用 T 中的 N 个工具解决任务(比如用户问 “算 1+2+3”,f会调用计算器工具输出结果)。→ 核心:工具使用能力被 “嵌入”f的参数中,而非简单存于输入层。
3、MIA成员推理攻击:https://zhuanlan.zhihu.com/p/561980835

一、论文综述
本文聚焦工具增强大型语言模型(Tool-Augmented LLMs)的 “工具遗忘” 问题,是首个系统性定义该任务、提出解决方案并设计评估方法的研究。
1. 研究背景
Tool-Augmented LLMs(如调用计算器、API、Python 解释器的模型)通过在 “查询 - 响应对” 数据集上训练,将工具使用能力嵌入模型参数,已广泛应用于医疗、代码生成等领域。但现实场景中,需让模型遗忘特定工具:
- 安全风险:工具存在漏洞(如医疗 API 泄露患者数据,违反 HIPAA);
- 合规需求:工具涉及隐私或版权问题(如未授权下载书籍的 API);
- 工具迭代:旧工具废弃(如 Python Transformers v3 升级至 v4,旧调用方式失效)。
传统 “样本级遗忘”(删除单个训练样本的记忆)无法解决该问题;工具遗忘需移除功能知识(技能) ,而非孤立数据点,且需避免影响其他工具能力和模型通用性能。
2. 核心问题
工具遗忘面临三大挑战:
- 目标差异:需移除 “工具使用能力”(如调用某 API 的逻辑),而非单个样本记忆;
- 成本控制:LLM 参数规模大,全量重训成本极高;
- 评估缺失:传统成员推理攻击(MIA)聚焦样本级,无法衡量 “工具知识是否被移除”。
3. 核心方法
提出两大创新组件:
- TOOLDELETE 框架:首个专为工具遗忘设计的算法,通过三大核心属性实现高效遗忘;
- LiRA-Tool 评估方法:首个针对工具遗忘的成员推理攻击(MIA),解决传统评估的局限性。

4. 实验结果
在 3 个数据集(ToolAlpaca、ToolBench、API-Bench)和 3 个工具增强 LLM(ToolAlpaca 7B、ToolLLaMA、Gorilla)上验证:
- 性能优势:比传统遗忘方法(如 GA、ICUL)在 “遗忘工具准确率” 高 12.5 个点,“保留工具准确率” 高 9.1 个点;
- 效率优势:比全量重训节省 74.8% 训练时间,LoRA 版本进一步节省 81.1% 计算成本;
- 鲁棒性:支持 “顺序遗忘”(分批遗忘工具),低资源场景下仍保留 95% 通用性能;
- 灵活性:无训练数据时,通过 “阴影样本” 仍可有效遗忘。
5. 研究结论
TOOLDELETE 可高效、精准地让工具增强 LLM 遗忘特定工具,同时保留其他工具能力和通用任务性能;LiRA-Tool 为工具遗忘提供了可靠的评估手段。
二、论文核心创新点
本文的核心突破在于定义工具遗忘(tool unlearning)新任务,并厘清其与传统 “样本级遗忘” 的本质差异,具体如下:
1. 首次形式化tool unlearning任务
- 任务定义:给定工具增强模型f(已学会N个工具),需移除
个目标工具
的使用能力,同时保留剩余工具
的能力和模型通用性能(如文本生成、推理);
- 理想目标:遗忘后的模型
对
的知识 “等价于从未学过”,对
和通用任务的性能 “不低于原模型f”。
2. 工具遗忘与传统样本级遗忘的三大差异
| 维度 | 样本级遗忘(传统) | 工具遗忘(本文) |
|---|---|---|
| 目标 | 减少单个样本 | 移除 工具使用技能(如 API 调用逻辑) |
| 评估指标 | 样本提取概率、困惑度 | 工具使用准确率( |
| 数据需求 | 需访问所有待遗忘样本 | 无需访问原训练样本(可生成阴影样本) |
| 关键风险 | 样本泄露 | “涟漪效应”(改 |
例如:样本级遗忘只需让与
表面不同(语义可保留);而工具遗忘需让
完全无法正确调用
(即使语义一致,功能错误也视为成功)。
3. 强调 “参数级遗忘” 的必要性
传统的Prompt 级工具屏蔽存在致命缺陷:
- 模型参数中仍保留
的知识,攻击者可通过诱导绕过屏蔽(如伪装查询)
- 模型参数知识与 Prompt 上下文冲突,易导致幻觉或错误输出
- 实验验证(Table 1 中 ICLU 模型):Prompt 级方法无法有效降低
的使用准确率
三、核心模型:TOOLDELETE 框架
TOOLDELETE 是首个实现 “工具遗忘三大核心属性” 的算法,其设计目标是精准遗忘目标工具、完整保留有用知识、高效控制优化成本。
1. 三大核心属性
TOOLDELETE 的核心是通过三个约束确保遗忘效果,每个属性均有严格数学定义和工程实现方案:
(1)工具知识删除(Tool Knowledge Deletion, TKD)

- 目标:让
对
的知识不超过工具无关模型
。其中
是未经过工具训练的指令微调 LLM
- 数学定义:设
为模型对工具的知识量化函数,则需满足:
极端场景(恶意工具)可要求;一般场景可要求
(重置为学工具前的水平);
- 实现方案:
(1)用对
的所有查询
生成 “工具无关响应”
(如无法调用 API 时的自然语言回复);
(2)约束生成的响应与
尽可能相似,避免保留
的使用逻辑。
(2)工具知识保留(Tool Knowledge Retention, TKR)
- 目标:
对
的知识 “与原模型f一致”,避免遗忘目标工具时影响其他工具;
- 数学定义:
其中是极小值。
- 实现方案:对
的 “查询 - 响应对”
进行微调(或采样部分
数据以提升效率),确保
仍能正确调用
。
(3)通用能力保留(General Capability Retention, GCR)
- 目标:
在通用任务(文本生成、推理、STEM 知识)上的性能不低于
,避免工具遗忘导致模型退化;
- 数学定义:设
为通用任务集合,则
- 实现方案:任务算术(Task Arithmetic)核心思想是 “提取通用知识的参数方向,补偿
的通用能力损失”:
(1)设为
的参数,
为随机初始化模型
的参数;
(2)表示 “通用知识的参数增量”(从随机初始化到指令微调的知识方向);
(3)对的参数
进行调整:
,其中是超参数(用来控制通用知识的补偿强度)。
方案的优势:无需重训通用任务数据,仅需向量运算,效率极高;避免通用知识与工具知识的冲突。
2. 训练目标与变体
(1)整体优化目标
TOOLDELETE 的训练分为两步:

论文中的公式
- 最小化 “TKD 损失” 和 “TKR 损失”,得到初步优化的参数
:

- 应用 “任务算术” 调整
,得到最终参数
(满足 GCR)
(2)两大实现变体
根据优化范式不同,TOOLDELETE 提供两种变体,适配不同场景:
| 变体 | 优化方式 | 核心操作 | 适用场景 |
|---|---|---|---|
| TOOLDELETE-SFT | 监督微调 (Supervised Fine-Tuning) | 对 对 用语言建模损失(LM Loss)训练 | 数据充足、追求稳定收敛的场景 |
| TOOLDELETE-DPO | 直接偏好优化 (Direct Preference Optimization) | 对 对 用 DPO 损失优化 | 数据有限、需快速对齐偏好的场景 |
实验表明(论文Table 1):DPO 变体在(测试集)、
(保留工具)、
(遗忘工具)上的性能略优于 SFT,但训练时间稍长。
3. 评估方法:LiRA-Tool
传统 MIA(如 LiRA)聚焦 “样本是否被训练过”,无法评估 “工具知识是否被移除”(因工具功能远超有限训练样本)。本文提出LiRA-Tool,通过 “阴影样本” 覆盖工具全功能,实现知识级评估。
(1)核心痛点:传统 MIA 的局限性
- 依赖原训练样本
,无法覆盖工具的所有使用场景(如未见过的 API 参数组合);
- 易 “过拟合” 到训练样本,误判 “模型遗忘了样本但未遗忘工具功能”。
(2)LiRA-Tool 的设计
- 核心创新:阴影样本(Shadow Samples)用 GPT-4 生成多样化的 “工具查询 - 响应对” ,覆盖工具的不同使用场景(如不同参数、不同用户意图、不同格式),确保评估能反映 “工具整体功能是否被遗忘”;
- 评估逻辑: likelihood 比率测试比较 “遗忘模型
对
阴影样本的损失分布” 与 “原模型f对
阴影样本的损失分布”,计算比率:
其中是工具
的阴影样本分布,
是
对
的损失分布,
是f对
的损失分布;
- 评估指标:TPR@FPR=0.01(FPR=1% 时的真阳性率),值越低表示 “工具知识被移除得越彻底”(攻击者越难检测到模型曾学过
)。
(3)实验验证
LiRA-Tool 显示:TOOLDELETE-DPO 的 TPR@FPR=0.01 仅为 0.14,优于传统方法(GRADASCENT 为 0.21,ICUL 为 0.18),证明其能有效移除工具知识。
四、实验部分
1. 实验设置
(1)数据集与模型
| 数据集 | 工具数量 | 训练样本数 | 对应工具增强 LLM | 核心任务 |
|---|---|---|---|---|
| ToolAlpaca | 495 | 3975 | ToolAlpaca 7B(基于 Vicuna-v1.3) | 通用工具调用 |
| ToolBench | 16k+ | 16k+ | ToolLLaMA(基于 LLaMA-2 7B) | 真实世界 API 调用 |
| API-Bench | - | - | Gorilla(基于 LLaMA 7B) | 机器学习模型 API 调用 |
(2)评估指标
- 工具遗忘效果:
准确率(↓,越低越好)、
准确率(↑,越高越好)、
(测试集)准确率(↑,越高越好);
- 通用能力:MMLU(STEM 知识)、BBH-Hard(推理)、IFEval(指令跟随)、Factual Knowledge(事实知识)的平均得分(↑,越高越好);
- 隐私与效率:LiRA-Tool 的 TPR@FPR=0.01(↓)、训练时间(↓)、计算成本(↓)。
(3)基线方法
- 通用遗忘方法:GRADASCENT(梯度上升)、RANDLABEL(随机标签)、SALUN(显著性参数微调)、RETRAIN(全量重训,上限基线);
- LLM 特定遗忘方法:ICUL(上下文污染)、SGA(选择性梯度上升)、TAU(SGA + 任务算术)、CUT(激活控制)、NPO(负偏好优化)、SOUL-GRADDIFF(二阶优化)。
2. 关键实验结果
(1)性能对比:TOOLDELETE 优于所有基线
以 ToolAlpaca(遗忘 20% 工具)为例(Table 1):
(测试集):TOOLDELETE-DPO 达 53.4,比 RETRAIN(52.1)高 1.3 个点;
(保留工具):TOOLDELETE-DPO 达 75.1,比 RETRAIN(71.8)高 3.3 个点;
(遗忘工具):TOOLDELETE-DPO 达 28.7,比 RETRAIN(38.5)低 9.8 个点;
- 通用能力:TOOLDELETE-DPO 的 TG 平均得分为 23.1,比 RETRAIN(21.3)高 1.8 个点。
(2)效率与灵活性
- 效率:TOOLDELETE 平均节省 74.8% 训练时间,LoRA 版本(TOOLDELETE-LoRA)节省 81.1% 计算成本,且性能保留率超 84%(Table 3);
- 顺序遗忘:分批遗忘 2%→5%→10%→20% 工具时,性能与 “一次性遗忘 20%” 差异小于 2%(Figure 3);
- 无训练数据:用阴影样本替代原训练数据时,性能仅下降 0.5-1.0 个点(Table 4)。
(4)LiRA-Tool 评估:隐私保护更好
Figure 2 显示,TOOLDELETE-DPO 的 TPR@FPR=0.01 仅为 0.14,低于 GRADASCENT(0.21)和 ICUL(0.18),说明其能更彻底地移除工具知识,降低隐私泄露风险。
3. 其他验证
- 模型适配性:在 ToolLLaMA 和 Gorilla 上的结果与 ToolAlpaca 一致(Table 5-6);
- 工具无关响应灵活性:用随机初始化模型
替代
生成响应时,性能仅下降 0.7-2.0 个点(Table 7),证明无需依赖
也可工作。
五、总结
本文的核心贡献的在于:
- 任务创新:首次定义 “工具遗忘” 任务,厘清其与传统遗忘的本质差异;
- 方法创新:提出 TOOLDELETE 框架,通过 TKD、TKR、GCR 三大属性实现精准、高效的工具遗忘;
- 评估创新:设计 LiRA-Tool,解决工具遗忘的评估难题;
关注专栏,了解一手有关LLM Unlearning信息!
感谢您的点赞、阅读、评论和收藏!
更多推荐


所有评论(0)