📚 概要

这篇文章主要面向对人工智能和大型语言模型(LLM)感兴趣的初学者。

我们将探讨为什么让模型持续学习是必要的,并了解在这一过程中会遇到的核心挑战,比如灾难性遗忘。

我们还会一起看看学术界提出的一些主流解决方案,了解它们是如何帮助模型在学习新知识的同时,尽可能地保留旧有的能力。

目录

  • 📚 概要
  • 🌏 前言
  • 🏗️ 持续学习的三个核心阶段
  • ⚠️ 持续学习中的核心挑战:遗忘
  • 🛠️ 应对遗忘的主流方法
  • 📝 总结
  • 📄 参考论文
  • 📚 往期精选

🌏 前言

我们常常会思考,为什么要让一个已经训练好的模型继续学习呢?

核心原因在于,我们所处的世界是不断变化的,而一次性训练出的模型,其知识会被永远定格在训练数据截止的那一刻。

知识本身在快速演变。每天都有新的新闻事件、科学发现和文化潮流涌现。如果模型不持续学习,它的知识库很快就会变得陈旧,无法为我们提供最新的信息。

语言和沟通方式也在悄然变化。语言并非一成不变,新的词汇、网络用语甚至是全新的编程语言和代码库都在不断出现。为了让模型能够跟上时代,并与不同背景的用户进行有效沟通,它必须不断学习和理解这些新兴的语言模式。

同时,新的任务和工具也层出不穷。我们希望模型能掌握新的技能来解决新的问题。例如,当出现一个新的软件库或API时,我们希望模型能学会如何调用它来完成更复杂的指令。

更重要的是,人类的价值观、社会规范和个人偏好也是动态变化的。为了确保模型的输出能够持续符合当前的道德伦理标准,就需要对它进行持续的对齐(Continual Alignment)。

因此,让模型具备持续学习的能力,是使其能够长期保持有效性和实用性的关键。

🏗️ 持续学习的三个核心阶段

从我阅读的几篇论文来看,研究者们通常将大型语言模型的持续学习过程与模型本身的训练周期对应起来,提出了一个包含三个主要阶段的框架。

这个框架帮助我们更好地理解在模型的不同生命周期中,持续学习具体在做什么。

  1. 持续预训练,Continual Pre-training, CPT
    这个阶段是模型知识体系的基础。它的目标是让模型在已有的通用知识之上,继续学习新的、更深层次的领域知识。这个过程通常是在海量的、无标签的特定领域语料上进行的,比如大量的医学文献、法律文档或者金融报告。通过这种自监督学习,模型可以丰富自己的知识库,从而更好地适应特定领域的任务需求。
  2. 持续指令微调,Continual Instruction Tuning, CIT
    当模型具备了足够的基础知识后,我们就需要教它如何运用这些知识去完成具体的任务。持续指令微调阶段的核心就是提升模型遵循指令和解决问题的能力。我们会用一系列有监督的指令-回答数据对来训练模型,教会它掌握新的技能,比如学会使用一个新的外部工具,或者解决一种全新的任务类型。
  3. 持续对齐,Continual Alignment, CA
    这个阶段关注的是模型的价值观。目标是确保模型的输出能够持续符合人类的价值观、偏好和道德规范。随着社会文化的发展,人们的准则和偏好也在不断变化。因此,这个阶段需要通过人类反馈等方式,不断地更新和校准模型,使其能够生成更有帮助、更负责任的回答。

⚠️ 持续学习中的核心挑战:遗忘

在模型持续学习的理想道路上,有一个核心的障碍始终存在,那就是遗忘。

我们可以把持续学习看作是我们的目标,而遗忘,尤其是灾难性遗忘,则是实现这个目标时遇到的核心挑战。

这个挑战会以不同的形式出现在我们前面提到的每一个学习阶段中。

  1. 灾难性遗忘,Catastrophic Forgetting
    这是持续学习领域最核心、也最普遍的一个问题。简单来说,就是模型在学习新任务或新数据时,会显著降低在旧任务上的性能表现,也就是我们常说的“学了新的,忘了旧的”。
  2. 跨阶段遗忘,Cross-stage Forgetting
    这是在大型语言模型的多阶段训练流程中,出现的一种比较特殊的遗忘问题。它发生在模型从一个训练阶段转换到另一个完全不同的阶段时。比如,一个已经经过指令微调(学会了遵循指令)的模型,如果为了更新知识而回头进行持续预训练,那么在这个过程中,它遵循指令的能力就可能会被削弱。这种在前一阶段学习到的能力在后一阶段被遗忘的现象,就是跨阶段遗忘。
  3. 无意识遗忘,Unconscious Forgetting
    我从论文中看到,这个概念被用来更具体地描述一种跨阶段遗忘的现象。它指的是,在进行持续的指令微调时,模型为了更好地完成特定任务,可能会无意识地侵蚀和削弱它在预训练阶段学到的广泛通用知识。

总的来说,为了实现持续学习这个目标,我们就必须在持续预训练、持续指令微调和持续对齐这三个实践阶段中,设法克服各种形式的遗忘问题。

🛠️ 应对遗忘的主流方法

为了解决训练过程中的遗忘问题,我从阅读的论文中看到了几种主流的思路。如果按照更容易理解和实现的顺序来看,我们可以这样来认识它们。

最直观、也最容易理解的方法是经验回放(Experience Replay),它的核心思想就是“温故而知新”。在《Fine-tuned Language Models are Continual Learners》这篇论文中,我看到研究者提出的 Continual-T0 模型就采用了这种策略。它在学习新任务时,会从旧任务的数据中取出一小部分(比如 1%)混合到新的训练数据中一起学习。这种做法就像我们在学习新章节时,偶尔翻翻前面的旧知识点,以防忘记。对于已经经过充分预训练的大模型来说,这种简单的策略出乎意料地有效。

经验回放的损失函数可以形式化为:

在过去任务的缓存数据上的损失在当前任务数据上的损失

其中:

  • 代表正在训练的模型。
  • 是经验回放方法的总体经验损失。
  • 代表当前的训练阶段或任务序号。
  • 是模型在第 个过去任务的缓存数据 上的损失。
  • 是模型在当前新任务数据集 上的损失。
  • 公式来源:[11]

在经验回放的基础上,一些方法尝试让“复习”变得更智能、更高效。例如,DYNAINST 方法就设计了一套动态选择机制。它首先会计算模型对每个训练样本的预测熵,这个熵值可以理解为模型对这个样本有多“不确定”或“困惑”。然后,它会策略性地挑选出一半熵值最高(模型最困惑的、最难的)和一半熵值最低(模型最确定的、最简单的)的样本存入一个记忆库中。在学习新知识时,它会优先从记忆库中挑选出那些模型学得最差的旧任务来进行回放,从而把宝贵的计算资源用在最需要巩固的地方。

除了回放数据,还有一类方法选择在学习算法本身上做文章,也就是正则化(Regularization)。它们不对数据进行操作,而是通过在模型的优化目标中增加一些约束,来保护旧知识。我看到的 O-LoRA 方法就是一个非常巧妙的例子。它强制要求每个新任务的参数更新,都必须在一个与所有旧任务相互正交的数学子空间里进行。我们可以把它想象成,每个任务都在一个专属且互不干扰的维度上进行学习,这样就从根本上避免了新旧任务之间的直接冲突。同样,专门用于人类偏好对齐的 CPPO 方法,则通过一个加权策略,动态地平衡学习新知识和巩固旧知识在同一样本上的权重,也是一种正则化的体现。

O-LoRA 的正交约束可以用如下公式表示:

有正交约束时:,无约束时:

在实际训练中,O-LoRA 通过保持新任务的 LoRA 参数与历史任务参数正交,有效缓解灾难性遗忘。

  • 公式来源:[6]

图2:O-LoRA用于语言模型持续学习的框架。首先,通过指令微调融合人类专家知识并提升泛化能力。接着,利用LoRA分别近似每个任务的梯度子空间。对于每个依次到来的新任务,增量式地学习新的LoRA参数,同时强制当前任务的LoRA与以往任务的LoRA保持正交。

  • 图片来源:[6]

比正则化更进一步的,是基于检索(Retrieval-based)的方法。这种方法不再回放原始数据,而是尝试去检索和复用已经学到的知识本身。SLM(Scalable Language Model)就是这样一个例子。它将每个旧任务学到的知识(具体来说是 LoRA 权重)进行保存。当遇到新任务时,它会先判断新任务与哪些旧任务最相似,然后把那些最相关的旧知识(LoRA 权重)检索出来,进行融合后动态地应用到模型上,让模型临时“变身”成一个适合解决当前任务的专家。这种方法的优势在于不存储原始数据,更加灵活且保护隐私。

最后,还有一类方法,也是对模型改动最大的,就是直接调整模型自身的架构(Architecture-based)。这类方法通过为新任务分配专属的参数空间,来做到新旧知识的物理隔离。

图:Progressive Prompts 方法与传统方法对比,展示如何通过串联软提示实现知识转移与遗忘缓解。

  • 图片来源:[8]

其中,一种相对轻量级的做法是 Progressive Prompts。它选择完全冻结大模型的主体,只为每个新任务学习一个微小的、可插拔的软提示。在学习新任务时,它会将新提示拼接到旧提示的前面,形成一个提示链,而旧提示本身则保持不变并被冻结。这样,旧任务的知识就被完整地封存在了旧的提示中,从而完全避免了遗忘。

而一种更直接的架构方法是 LLaMA Pro 采用的块扩展(Block Expansion)。它在原始的 LLaMA2 模型中,交错地插入了一些新的 Transformer 块。在学习新领域的知识时,它会冻结所有原始的 LLaMA2 块,只训练这些新加入的块。这种方法的好处是,模型的通用能力被完好地保留在旧模块中,而新领域的知识则被注入到了新模块里,实现了能力的扩展而非简单的覆盖。

📝 总结

通过这篇文章,我们了解了让模型持续学习的必要性,以及在过程中面临的遗忘这一核心挑战。

在探索的众多解决方案中,我们更倾向于那些借鉴“温故而知新”思想的方法,例如经验回放。这类方法思路直观,在不改变模型本身复杂结构的前提下,通过智能地复习旧知识来巩固记忆。对于已经经过大量数据预训练的大模型而言,哪怕只是回放少量数据,也往往能取得很好的效果。

相比之下,那些需要直接改变模型架构的方法,比如为模型增加新的模块,虽然也能有效隔离新旧知识,但可能会增加系统的复杂度和维护成本。

当然,每种方法都有其适用的场景和权衡。无论是哪种思路,都为我们构建更具适应性、能够与时俱进的智能模型提供了有价值的参考。

欢迎在留言区分享你的想法,每条留言我都会认真阅读!你的反馈是我创作的最大动力 ❤️💗 立即行动1. 点赞、收藏、关注,分享给朋友。2. 为账号加星标,获取更多内容。3. 以本文为灵感,整理一份属于自己的笔记。🚗 行动召唤"与其等着 AI 改变世界,不如自己参与变革!在这里,让 AI 成为你弯道超车的秘密武器。"

想入门 AI 大模型却找不到清晰方向?备考大厂 AI 岗还在四处搜集零散资料?别再浪费时间啦!2025 年 AI 大模型全套学习资料已整理完毕,从学习路线到面试真题,从工具教程到行业报告,一站式覆盖你的所有需求,现在全部免费分享

👇👇扫码免费领取全部内容👇👇

一、学习必备:100+本大模型电子书+26 份行业报告 + 600+ 套技术PPT,帮你看透 AI 趋势

想了解大模型的行业动态、商业落地案例?大模型电子书?这份资料帮你站在 “行业高度” 学 AI

1. 100+本大模型方向电子书

在这里插入图片描述

2. 26 份行业研究报告:覆盖多领域实践与趋势

报告包含阿里、DeepSeek 等权威机构发布的核心内容,涵盖:

  • 职业趋势:《AI + 职业趋势报告》《中国 AI 人才粮仓模型解析》;
  • 商业落地:《生成式 AI 商业落地白皮书》《AI Agent 应用落地技术白皮书》;
  • 领域细分:《AGI 在金融领域的应用报告》《AI GC 实践案例集》;
  • 行业监测:《2024 年中国大模型季度监测报告》《2025 年中国技术市场发展趋势》。

3. 600+套技术大会 PPT:听行业大咖讲实战

PPT 整理自 2024-2025 年热门技术大会,包含百度、腾讯、字节等企业的一线实践:

在这里插入图片描述

  • 安全方向:《端侧大模型的安全建设》《大模型驱动安全升级(腾讯代码安全实践)》;
  • 产品与创新:《大模型产品如何创新与创收》《AI 时代的新范式:构建 AI 产品》;
  • 多模态与 Agent:《Step-Video 开源模型(视频生成进展)》《Agentic RAG 的现在与未来》;
  • 工程落地:《从原型到生产:AgentOps 加速字节 AI 应用落地》《智能代码助手 CodeFuse 的架构设计》。

二、求职必看:大厂 AI 岗面试 “弹药库”,300 + 真题 + 107 道面经直接抱走

想冲字节、腾讯、阿里、蔚来等大厂 AI 岗?这份面试资料帮你提前 “押题”,拒绝临场慌!

1. 107 道大厂面经:覆盖 Prompt、RAG、大模型应用工程师等热门岗位

面经整理自 2021-2025 年真实面试场景,包含 TPlink、字节、腾讯、蔚来、虾皮、中兴、科大讯飞、京东等企业的高频考题,每道题都附带思路解析

2. 102 道 AI 大模型真题:直击大模型核心考点

针对大模型专属考题,从概念到实践全面覆盖,帮你理清底层逻辑:

3. 97 道 LLMs 真题:聚焦大型语言模型高频问题

专门拆解 LLMs 的核心痛点与解决方案,比如让很多人头疼的 “复读机问题”:


三、路线必明: AI 大模型学习路线图,1 张图理清核心内容

刚接触 AI 大模型,不知道该从哪学起?这份「AI大模型 学习路线图」直接帮你划重点,不用再盲目摸索!

在这里插入图片描述

路线图涵盖 5 大核心板块,从基础到进阶层层递进:一步步带你从入门到进阶,从理论到实战。

img

L1阶段:启航篇丨极速破界AI新时代

L1阶段:了解大模型的基础知识,以及大模型在各个行业的应用和分析,学习理解大模型的核心原理、关键技术以及大模型应用场景。

img

L2阶段:攻坚篇丨RAG开发实战工坊

L2阶段:AI大模型RAG应用开发工程,主要学习RAG检索增强生成:包括Naive RAG、Advanced-RAG以及RAG性能评估,还有GraphRAG在内的多个RAG热门项目的分析。

img

L3阶段:跃迁篇丨Agent智能体架构设计

L3阶段:大模型Agent应用架构进阶实现,主要学习LangChain、 LIamaIndex框架,也会学习到AutoGPT、 MetaGPT等多Agent系统,打造Agent智能体。

img

L4阶段:精进篇丨模型微调与私有化部署

L4阶段:大模型的微调和私有化部署,更加深入的探讨Transformer架构,学习大模型的微调技术,利用DeepSpeed、Lamam Factory等工具快速进行模型微调,并通过Ollama、vLLM等推理部署框架,实现模型的快速部署。

img

L5阶段:专题集丨特训篇 【录播课】

img
四、资料领取:全套内容免费抱走,学 AI 不用再找第二份

不管你是 0 基础想入门 AI 大模型,还是有基础想冲刺大厂、了解行业趋势,这份资料都能满足你!
现在只需按照提示操作,就能免费领取:

👇👇扫码免费领取全部内容👇👇

2025 年想抓住 AI 大模型的风口?别犹豫,这份免费资料就是你的 “起跑线”!

Logo

中国智能体开发者社区,聚焦智能体与大模型开发,提供前沿资讯、实用工具链、开源项目及行业案例。通过技术沙龙、开发者大赛等活动,促进经验交流与协作,助力开发者快速构建创新智能应用。

更多推荐