Towards Lifelong Learning of Large Language Models: A Survey翻译
摘要
随着大语言模型 (LLM) 的应用扩展到各个领域,它们对适应数据、任务和用户偏好的持续变化的能力变得至关重要。使用静态数据集的传统训练方法不足以应对现实世界信息的动态特性。终身学习或持续学习通过使 LLM 在其运行生命周期内不断学习和适应,整合新知识同时保留以前学到的信息并防止灾难性遗忘来解决这一问题。我们的调查探索了终身学习的前景,根据新知识的整合方式将策略分为两类:内部知识,其中 LLM 通过全部或部分训练将新知识吸收到其参数中,以及外部知识,它将新知识作为外部资源(如维基百科或 API)纳入其中而无需更新模型参数。我们调查的主要贡献包括:(1)引入一种新的分类法,将终身学习的大量文献分为 12 种场景;(2)识别所有终身学习场景中的常用技术并将现有文献分为各种技术组; (3) 重点介绍模型扩展和数据选择等新兴技术,这些技术在 LLM 时代之前较少被探索。资源可在 https://github.com/qianlima-lab/awesome-lifelong-learningmethods-for-llm 获取。
1.介绍

随着大语言模型 (LLM) 的应用扩展到各个领域,这些模型适应数据、任务和用户偏好的持续变化的能力变得至关重要。传统的训练方法依赖于静态数据集来训练 LLM,但越来越不足以应对现实世界信息的动态特性。终身学习(又称持续学习、增量学习),或 LLM 在其运行寿命内持续自适应学习的能力,通过整合新知识同时保留先前学习的信息来解决这一挑战,从而防止灾难性遗忘的问题。图 1 提供了终身学习的图示。
本调查深入研究了终身学习的复杂情况,根据新知识的整合方式将策略分为两大类:内部知识和外部知识。每个类别都包含不同的方法,这些方法共同旨在提高 LLM 在各种情况下的适应性和有效性。我们在图 2 中提供了 LLM 终身学习方法的分类。
内部知识组包括持续预训练和持续微调等策略,其中 LLM 通过全部或部分训练将新知识吸收到其参数中。例如,在行业应用中,通常采用持续预训练垂直领域数据,公司经常使用来自金融等行业的特定领域数据重新训练其 LLM。虽然这可以提高专业领域的表现,但它可能会削弱模型更广泛的知识库,这说明了在专业适应和通用知识保留之间保持平衡的挑战。持续微调涵盖针对特定场景的方法(例如文本分类、命名实体识别、关系提取和机器翻译)以及与任务无关的方法(例如指令微调、对齐和知识编辑)。此外,在持续对齐中采用带有人工反馈的强化学习,以确保 LLM 遵守安全和礼貌等人类价值观,突出了被称为“对齐税”的权衡,过于狭隘地关注特定价值观可能会导致模型的通用能力下降。
外部知识将新知识作为外部资源(如维基百科或 API)纳入其中,而无需更新模型参数,包括基于检索和基于工具的终身学习,它们利用外部数据源和计算工具来扩展模型的功能。基于检索的策略(例如检索增强生成)通过从外部数据库(如维基百科)提供上下文相关、准确和最新的信息来增强文本生成,确保模型的输出随着时间的推移保持相关性。同时,基于工具的学习与人类使用工具相似,模型学习利用外部计算工具,从而拓宽其解决问题的能力,而无需直接修改其核心知识库。
通过详细研究这些群体及其各自的类别,本文旨在强调将终身学习能力融入 LLM,从而提高其在实际应用中的适应性、可靠性和整体表现。通过解决与终身学习相关的挑战并探索该领域的创新,本研究旨在为不断发展更强大、更通用的 LLM 做出贡献,使其能够在不断发展的数字环境中蓬勃发展。

Differences between this survey and existing ones。近年来,终身学习已成为一个越来越受欢迎的研究课题。大量的调查研究了神经网络的终身学习。现有的大多数调查主要关注卷积神经网络(CNN)的终身学习。他们研究了 CNN 终身学习的各种场景,包括图像分类、分割、目标检测、自主系统、机器人和智慧城市。此外,还有一些调查探讨了图神经网络的终身学习。然而,只有少量文献关注语言模型的终身学习。Biesialska et al. [10] 是关于自然语言处理(NLP)中终身学习的早期调查。然而,他们只关注单词和句子表征、语言建模、问答、文本分类和机器翻译的终身学习。Ke et al. [82] 关注终身学习场景,包括情绪分类、命名实体识别和摘要。他们还讨论了终身学习的知识迁移和任务间类别分离技术。 [79, 176, 222, 259] 是与本研究密切相关的四项近期调查。Zhang et al. [259] 全面回顾了使 LLM 与不断变化的世界知识保持一致的技术,包括持续预训练、知识编辑和检索增强生成。Wu et al. [222] 从三个方面重新审视了终身学习,包括持续预训练、持续指令调整和持续对齐。Shi et al. [176] 从两个方向研究 LLM 的终身学习,包括垂直方向(或垂直持续学习),即从通用能力到特定能力的持续适应,以及水平方向(或水平持续学习),即跨时间和领域的持续适应。Jovanovic et al. [79] 回顾了几种实时学习范式,包括持续学习、元学习、参数高效学习和混合专家学习。虽然最近的调查收集了有关终身学习的最新文献,但没有一篇涵盖持续文本分类、持续命名实体识别、持续关系提取和持续机器翻译等场景,并且很少讨论持续对齐、持续知识编辑、基于工具的终身学习和基于检索的终身学习。据我们所知,我们是第一个从 12 个场景对 LLM 终身学习方法进行全面而系统的考察的调查。
Contributions of this survey。我们的调查的主要贡献是:
- Novel Taxonomy。我们引入了一个详细而结构化的框架,将大量有关终身学习的文献分为 12 个场景(如图 2 所示)。
- Common Techniques。我们在第 2.3 节中确定了所有终身学习场景中的通用技术,并将现有文献分为每个场景内的各种技术组(例如表 1、2、3)。
- Future Directions。我们重点介绍了几种新兴技术,例如模型扩展(第 3.1.2 节)和数据选择(第 3.1.4 节),这些技术在 LLM 时代之前较少被探索。
Organization of this survey。本文的其余部分组织如下。第 2 节介绍了终身学习的问题表述、评估指标、常用技术、基准和数据集。第 3 节、第 4 节和第 5 节探讨了现有的持续预训练、持续微调和基于外部知识的终身学习技术。第 6 节讨论了 LLM 终身学习的现有挑战、当前趋势和未来方向,并总结了本调查。
2.OVERVIEW OF LIFELONG LEARNING
2.1 Problem Formulation
正式来说,终身学习旨在从任务序列 {D(1),D(2),⋅⋅⋅,D(T)}\{\mathcal D^{(1)}, \mathcal D^{(2)}, · · · ,\mathcal D^{(T)}\}{D(1),D(2),⋅⋅⋅,D(T)} 中学习语言模型 fθ:x→yf_{\theta}: x → yfθ:x→y,其中第 ttt 个任务 D(t)={(x(t),y(t))}\mathcal D(t) = \{(\textbf x^{(t)}, \textbf y^{(t)})\}D(t)={(x(t),y(t))} 包含输入 x(t)\textbf x^{(t)}x(t) 和目标输出 y(t)\textbf y^{(t)}y(t)。输入 x\textbf xx 和 y\textbf yy 都是自然语言。对于问答等生成任务,x\textbf xx 和 y\textbf yy 代表问题和答案。在机器翻译中,x\textbf xx 和 y\textbf yy 代表源语言和目标语言。在文本分类中,x\textbf xx 和 y\textbf yy 代表输入文本和类标签名称。在自回归语言模型的预训练任务中,x\textbf xx 表示一个 token 序列 [x1,x2,⋅⋅⋅,xn−1][x_1, x_2, ··· , x_{n−1}][x1,x2,⋅⋅⋅,xn−1],y\textbf yy 表示相应的序列,其中每个 token 都是原始输入中的下一个 token,[x2,x3,⋅⋅⋅,xn][x_2, x_3, · · · , x_n][x2,x3,⋅⋅⋅,xn]。
2.2 Evaluation Metrics
持续学习的有效性评估可以从三个角度来衡量:迄今为止所学任务的总体表现、先前所学任务的稳定性以及对新任务的可塑性。
- Overall Measurement。(1)平均准确率(AA,越高越好)计算为迄今为止学习的所有任务的平均表现。正式地,当模型学习了 ttt 个任务时,平均准确率定义如下:
AAt=1t∑i=1tat,i,(1)AA_t=\frac{1}{t}\sum^t_{i=1}a_{t,i},\tag{1}AAt=t1i=1∑tat,i,(1)
其中 at,ia_{t,i}at,i 是模型学习了 ttt 项任务后在任务 iii 上的表现得分。我们假设,表现越好,表现得分就越高。(2)平均增量准确率(AIA,越高越好)计算为学习每项任务后平均准确率的平均值。假设总共有 TTT 项任务,我们有
AIA=1T∑t=1TAAt.(2)AIA=\frac{1}{T}\sum^T_{t=1}AA_t.\tag{2}AIA=T1t=1∑TAAt.(2)
与 AA 相比,AIA 捕捉了学习每个任务时的历史变化。 - Stability Measurement。(1)遗忘度量(FGT,越低越好)评估每个旧任务的平均性能下降。性能下降定义为其之前获得的最大性能与当前性能之间的差异。正式地,学习 ttt 任务后的遗忘度量定义如下:
FGTt=1t−1∑i=1t−1[maxj∈{i,i+1,...,t}({aj,i}j)−at,i],(3)FGT_t=\frac{1}{t-1}\sum^{t-1}_{i=1}[max_{j\in\{i,i+1,...,t\}}(\{a_{j,i}\}_j)-a_{t,i}],\tag{3}FGTt=t−11i=1∑t−1[maxj∈{i,i+1,...,t}({aj,i}j)−at,i],(3)
其中 maxj∈{i,i+1,⋅⋅⋅,t}({aj,i}j)max_{j ∈ \{i,i+1,··· ,t \}}(\{a_{j,i}\}_j)maxj∈{i,i+1,⋅⋅⋅,t}({aj,i}j) 表示学习了任务 iii 之后任务 iii 的最大性能,at,ia_{t,i}at,i 表示学习了 ttt 个任务之后任务 iii 的性能。 (2) 后向迁移 (BWT,值越高越好) 评估每个旧任务的平均性能变化。性能变化定义为其当前性能与最初学习任务时的性能之间的差异。正式地,学习 ttt 个任务后的后向迁移定义如下:
BWTt=1t−1∑i=1t−1(at,i−ai,i).(4)BWT_t=\frac{1}{t-1}\sum^{t-1}_{i=1}(a_{t,i}-a_{i,i}).\tag{4}BWTt=t−11i=1∑t−1(at,i−ai,i).(4) - Plasticity Measurement。前向迁移 (FWD,值越高越好) 评估每个新习得任务的平均性能提升。该指标将改进计算为首次学习任务时的初始性能与从没有先验知识开始且仅在此任务中训练的模型的性能之间的差异。正式地,学习 ttt 任务后的前向迁移定义如下:
FWDt=1t−1∑i=2t(ai,i−a~i),(5)FWD_t=\frac{1}{t-1}\sum^t_{i=2}(a_{i,i}-\tilde a_i),\tag{5}FWDt=t−11i=2∑t(ai,i−a~i),(5)
其中 a~i\tilde a_ia~i 是仅在 D(i)\mathcal D^{(i)}D(i) 上训练的随机初始化模型的性能。
2.3 Common Techniques

现有的终身学习技术大致可以分为四类:基于回放的方法、基于正则化的方法、基于架构的方法和基于蒸馏的方法。图 3 给出了四类终身学习方法的图示。
2.3.1 Replay-based methods
根据回放数据的获取方式,基于回放的方法主要分为经验回放和生成回放。
- Experience Replay。这种方法涉及保留以前遇到的数据子集或该数据的更简单表示,在训练新任务时会定期重新整合这些数据。这种技术有助于通过重新接触旧数据来维持模型在先前任务上的表现,从而强化现有知识。例如,在持续预训练的背景下,[47, 78, 117, 158] 在训练阶段系统地重新引入特定领域的数据集,以刷新模型的记忆并稳定其在各个领域的学习。
- Generative Replay。该方法不存储实际数据,而是使用模型本身或单独的生成模型生成模拟旧数据的新数据样本。这种方法有助于持续学习,而无需保留大量实际数据,从而优化内存使用并可能保护隐私。在持续指令微调的范围内,几种创新方法体现了生成回放:LAMOL、LFPT5、PCLL 和 SSR 生成以自然语言提示为条件的伪实例。
2.3.2 Regularization-Based Methods
根据正则化所作用的组成部分,基于正则化的方法大致可以分为权重正则化和特征正则化:
- Weight Regularization。这种技术会惩罚对之前任务很重要的权重变化,从而保留这些任务的性能。常见的策略包括 L2 正则化,它对权重的平方施加惩罚以阻止大的变化;弹性权重合并 (EWC),根据计算的重要性有选择地惩罚对过去任务至关重要的权重变化;记忆感知突触 (MAS),它根据参数对任务性能变化的敏感度动态调整惩罚。此外,RecAdam 还结合了 EWC 的思想,使用退火系数对预训练权重进行正则化,以逐步整合过去知识的重要性。
- Feature Regularization。该方法涉及约束模型提取的特征,以便新的学习不会显著干扰从先前任务中学习到的特征。IDBR 和 CPFD 等技术直接对特征施加约束,以确保激活模式在各个任务之间保持稳定,从而保持一致的表征空间。
2.3.3 Architecture-Based Methods

终身学习中基于架构的方法侧重于调整模型结构以无缝集成新任务,同时最大限度地减少对先前获得的知识的干扰。这些技术对于现有的大语言模型(例如 LLaMA-65B、GLM-130B、PaLM540B 和 GPT-4)尤其重要,因为完全微调此类大型模型需要大量计算资源。鉴于这些限制,追求高效且具有成本效益的终身学习策略既实用又必要。下面简要概述了六种基于架构的终身学习方法,图 4 提供了说明:
- Prompt Tuning。在 Prompt Tuning 中,可训练的任务特定提示被插入到模型的输入层,以引导其响应达到预期结果。此方法通过将这些提示直接嵌入到输入序列中来运行,仅影响输入数据的初始处理。示例包括 L2P、CODA-Prompt、SAPT、ConvPrompt、Q-Tuning 和 Fwd-Prompt。
- Prefix Tuning。该方法涉及在 Transformer 模型的每一层前添加一组可训练参数(称为前缀)。这些前缀充当上下文修改,可调整模型针对特定任务的行为。与 Prompt Tuning 相比,Prefix Tuning 会影响模型的多个层。值得注意的实现包括 EPI 和 MoCL。
- LoRA (Low-Rank Adaptation)。LoRA 将低秩矩阵集成到预训练模型的某些层中,以调整其功能而无需进行全面再训练。它允许对特定模型组件进行有针对性的调整。利用 LoRA 的方法包括 Lee et al. [96]、C-LoRA、ConPET、GLRL、O-LoRA、CoLoR、InfLoRA、SAPT、MoRAL、EKFAC 和 I-LoRA。
- Adapters。这些是小型的两层前馈神经网络,具有瓶颈结构,插入现有模型架构的各层之间。它们允许模型获得新功能,同时保留原始预训练参数。示例包括 CPT、LAFT-URIEL、DMEA、TSS、HOP 和 SEMA。
- Mixture of Experts (MoE)。MoE 方法利用门控机制,根据当前的任务,在推理过程中从一组专家前馈神经网络中动态选择。这允许模型将其架构的某些部分专门用于特定类型的任务,从而提高性能和可扩展性。示例包括 DEMix 和 ModuleFormer。
- Model Expansion。此类别包括重用现有模型组件或扩展模型架构以适应新信息和任务的技术。这可能涉及添加新层或模块,或扩展现有层或模块以增加模型的容量和灵活性。值得注意的方法包括 bert2BERT、Wang et al. [203]、LLaMA Pro 和 SOLAR。
2.3.4 Distillation-Based Methods
根据蒸馏目标的来源,基于蒸馏的方法可以分为三类:新数据,旧数据和伪旧数据:
- Distillation from New Data。这些技术涉及 student 模型在 teacher 模型的指导下使用新数据直接从新任务中学习。代表性方法包括“不遗忘学习”(LwF),其中模型适应新类别而不会忘记旧类别。在持续命名实体识别中,新旧实体之间的重叠通过 ExtendNER 和 CFNER 等方法解决,这些方法使用旧模型为 “Other” token生成伪软标签,帮助学习新实体同时保留旧知识。此外,在持续机器翻译中,Cao
et al. [14]、COKD、LFR 和 CKD 采用了专注于新数据的蒸馏策略。 - Distillation from Old Data。此类别使用旧数据(通常存储在内存中)通过 teacher 模型的输出来指导 student 模型。示例包括 CRN、CRL、SCKD 和 CEAR。
- Distillation from Pseudo Old Data。当保留旧训练数据不切实际时,L&R、Wang et al. [206]、DnR、PCLL 和 LFPT5 会生成合成旧数据。这些方法会创建模拟旧数据分布的伪样本。此类别通常用于生成任务和命名实体识别。
2.4 Benchmarks and Datasets
3.METHODOLOGY: CONTINUAL PRETRAINING
持续预训练可增强 LLM 的内部知识,鉴于完全预训练的高成本,持续预训练尤其有价值。尽管与持续微调相比,持续预训练的研究不太成熟,但它对于增强现有 LLM 的通用能力至关重要。持续预训练有三种类型:(1)持续垂直领域预训练,针对特定领域的持续学习,同时不忘记以前获得的专业知识;(2)持续语言领域预训练,专注于适应不断变化的语言使用;(3)持续时间领域预训练,使用时间敏感数据更新模型,使模型能够掌握最新知识
3.1 Continual Vertical Domain Pretraining
持续垂直领域预训练涉及在一系列特定领域的数据集上持续训练语言模型。此方法可确保模型在多个垂直领域或任务中高效执行,同时保留先前获得的知识。例如,对金融领域数据进行持续预训练使 LLM 能够更好地分析金融文本和数据。
持续垂直领域预训练的实验研究主要集中于解决灾难性遗忘问题。作为一项开创性的工作,Jin et al. [78] 发现基于蒸馏的方法在保留早期领域的下游性能方面最有效。在此基础上,Mehta et al. [131] 发现,与从头开始训练的模型相比,在多样化任务上进行预训练的模型往往更少出现遗忘,这凸显了任务多样性的好处。同样,Cossu et al. [31] 证明持续预训练有助于减轻遗忘,支持了持续接触各种任务可以增强模型鲁棒性的观点。然而,Li et al. [102] 强调,灾难性遗忘仍然是一个重大挑战,不能通过冻结层、模块、LoRA 和 (IA)3 等简单方法完全解决。这些发现共同强调了解决灾难性遗忘问题的复杂性以及持续垂直领域预训练对创新方法的必要性。持续垂直领域预训练的研究一直在不断发展,包括各种技术,包括但不限于经验回放、参数高效微调、混合专家模型、知识蒸馏、模型扩展、重新预热和数据选择。
3.1.1 Parameter-Efficient Fine-Tuning
参数高效微调是一种无需大量计算资源即可针对特定任务优化模型的技术。CorpusBrain++ 通过采用 backbone-adapter 架构和经验回放策略来解决现实世界知识密集型语言任务的动态性质。类似地,Med-PaLM 使用一些示例将指令提示微调引入医学领域。这些方法强调了高效微调策略在将 LLM 适应专业领域方面的重要性,同时解决了在不同任务中保持性能的挑战。
3.1.2 Model Expansion
模型扩展涉及通过增加宽度和深度来增强预训练语言模型的架构,以提高从多个领域的连续数据流中获取和集成知识的效率。ELLE 采用功能保留的模型扩展策略来实现这一目标,灵活地扩展现有预训练语言模型的宽度和深度。同样,bert2BERT 通过扩展架构来增强基础 BERT 模型,使其能够更好地处理新的、更复杂的数据,同时保留早期训练阶段的知识。按照这些方法,LLaMA Pro 扩展了 Transformer 块并使用新语料库对其进行微调,在与通用、编程和数学相关的任务中取得了卓越的性能。此外,SOLAR 利用深度扩展(包括深度扩展和持续预训练)来有效提升各种 NLP 任务中的 LLM 性能,而无需对训练和推理进行复杂的更改。
3.1.3 Re-warming
重新预热是指在引入新数据集进行持续训练时向上调整学习率。Gupta et al. [49] 提出这一策略是为了防止在延长的训练 epoch 学习率下降过多,否则在引入新数据时学习过程会停滞。实验结果表明,重新预热模型不仅有助于更有效地适应新数据集,而且还能提高整体下游任务的性能。
3.1.4 Data Selection
数据选择在预训练中起着至关重要的作用,其中采用各种轻量级过滤器来确保数据质量。这些过滤器包括基于启发式的方法(例如语言和项目计数过滤)、基于分类器的方法和基于困惑度的技术。例如,RedPajama-Data-v2 数据集采用 40 多个质量指标进行数据过滤和重新加权以增强数据选择。
最近,Lin et al. [112] 推出了使用选择性语言模型 (SLM) 进行训练的 RHO-1。SLM 通过评估每个 token 的梯度影响来识别并优先处理训练过程中影响最大的 token,从而优先考虑那些导致损失函数发生更大变化的 token。在另一种方法中,LESS 提出了一种低秩梯度相似性搜索算法,可以有效地选择最相关的数据进行有针对性的指令微调,通过在精心选择的数据子集上进行训练,显著提高模型性能。此外,Ma et al. [127] 提出了 EcomGPT-CT,它利用半结构化的电子商务数据来增强模型在特定领域任务上的性能。EcomGPT-CT 采用数据混合策略,将通用预训练数据与特定领域的半结构化数据相结合,从而提高其在特定领域中的有效性。
3.2 Continual Language Domain Pretraining
持续语言领域预训练扩展了预训练语言模型的概念,以持续集成新数据并适应不断发展的语言领域,而不会忘记先前的知识。持续语言领域预训练的研究主要集中在自然语言和代码语言上。持续语言领域预训练的研究主要集中在经验回放、基于架构的方法和重新预热等技术上。
3.2.1 Architecture-Based Methods
基于架构的方法为增强 LLM 在持续语言领域预训练中的适应性和效率提供了创新的解决方案。Yadav et al. [229] 通过结合 teacher forcing 机制改进了提示微调,创建了一个提示池来指导模型在新任务上的微调,并强制模型在训练期间遵循特定的路径。Yang et al. [230] 提出了 CLL-CLIP 模型,该模型扩展了 CLIP 的语言理解,以持续学习新语言。他们采用 token 嵌入初始化和正则化来缓解灾难性遗忘。CLL-CLIP 包含一个可扩展的 token 嵌入层,可动态调整以适应语言差异,从而实现新 token 的无缝集成。ModuleFormer 和 Lifelong-MoE 都是基于架构的方法,它们利用 MoE 来增强 LLM 的效率和适应性。ModuleFormer 通过根据输入 token 激活特定模块来利用模块化,确保有针对性的处理。 Lifelong-MoE 通过结合新专家和正则化预训练来动态增加模型容量,在少样本和多任务学习场景中实现卓越性能。这些方法共同展示了架构创新在应对持续学习挑战方面的潜力。
3.2.2 Re-warming
重新预热是一种在开始使用新数据进行训练时暂时增加学习率的策略,它可以让模型更快地适应新语言。Ibrahim et al. [71] 提出了一种结合学习率 (LR) 重新预热、LR 重新衰减和数据回放的持续预训练方法。在他们的方法中,LR 重新预热之后是 LR 重新衰减,即根据特定的时间表系统地降低学习率。这个重新衰减阶段有助于模型在学习新语言后保持稳定,防止其过度拟合最近的数据。这种方法与该领域的其他方法一致,例如 Gupta et al. [49] 提出的方法,他们强调在持续垂直领域预训练期间调整学习率以保持模型有效性的重要性。
3.3 Continual Temporal Domain Pretraining
持续时间领域预训练涉及使用时间相关数据不断更新语言模型,以便在新信息可用时保持其准确性和相关性。现有研究强调,LLM 的性能会随着时间的推移而下降,因为它们无法学习对时间变化敏感的新知识。例如,使用 2023 年数据进行预训练的 LLM 无法回答有关 2024 年发生的事件的问题。
实证研究结果凸显了语言模型在时间自适应领域面临的若干挑战。Lazaridou et al. [95] 证明,当使用过去数据训练的模型在未来数据上进行测试时,性能会显著下降,这凸显了 LLM 在时间泛化方面的困难。同样,Röttger et al. [166] 表明,虽然时间自适应在屏蔽语言模型任务中略有改进,但与单独的领域自适应相比,它并没有显著提高下游任务的性能。此外,Luu et al. [124] 发现,虽然持续的预训练有助于时间自适应,但它不如针对时间相关数据进行任务特定的微调有效,性能会随着时间的推移而大幅下降。这些研究共同强调了实现稳健的时间泛化所面临的持续挑战以及对更复杂的自适应技术的需求。
现有的大多数方法都利用经验回放来缓解遗忘。除了经验回放之外,Han et al. [52] 还提出了事件时间推理的有效持续预训练框架 (ECONET),该框架整合了有针对性的屏蔽和对比损失,以在训练期间强调事件和时间指标。具体来说,ECONET 采用屏蔽预测策略,其中与事件和时间相关的特定 token 被屏蔽,并使用判别器模型区分正确和错误的句子,从而增强时间推理。Zhao et al. [260] 引入了时间自适应微调,它将模型的内部知识与目标时间同步,而不会改变提供给模型的显式上下文信息。作为这些方法的补充,TimeLMs 是在历时 Twitter 数据上训练的持续更新的语言模型,以捕捉语言的时间变化并保持随时间变化的相关性。这些方法共同展示了解决语言模型中持续学习和时间自适应挑战的创新策略。
3.4 Summary
持续预训练通过更新内部知识来增强 LLM,而无需承担完全预训练的高成本。当前的研究涵盖垂直、语言和时间领域,解决灾难性遗忘和时间适应等挑战。经验回放、知识蒸馏、参数高效微调、模型扩展和重新预热等技术已显示出良好的前景。尽管取得了这些进展,但仍存在重大挑战,特别是在保持一段时间内和跨不同任务的性能方面。未来的研究应侧重于创新方法来减轻遗忘、改善时间泛化,并开发高效、自适应的架构以持续保持模型性能。
4.METHODOLOGY: CONTINUAL FINETUNING

持续微调可增强 LLM 的内部知识,并使 LLM 适应特定任务,例如文本分类、命名实体识别、关系提取、机器翻译或通用生成任务,例如指令微调、知识编辑和与人类偏好保持一致。我们在图 5 中提供了 7 个持续微调场景的说明。
5.METHODOLOGY: EXTERNAL KNOWLEDGE
更多推荐



所有评论(0)