首页 > 人工智能 >谷歌康奈尔大学为AI大模型设计睡眠机制巩固记忆

谷歌康奈尔大学为AI大模型设计睡眠机制巩固记忆

来源:互联网 2026-06-09 06:11:13

谷歌与康奈尔大学为AI大模型设计“Sleep”框架,模拟人脑睡眠阶段。通过记忆巩固和做梦两阶段,将高频模块新知识迁移至低频稳定模块,并生成合成数据自我提升,解决了知识冻结与灾难性遗忘问题,在持续学习、长文本理解等任务上显著优于现有方法。

# 谷歌与康奈尔大学联手:给AI大模型设计“睡眠机制”,让它学会像人脑一样巩固记忆

你有没有注意到一个有点奇怪的现象?你在跟ChatGPT对话的时候,它虽然能给出让人眼前一亮的回答,可一旦问到去年发生的新闻,或者某个上个月才公布的科学发现,它就开始答非所问了——更离谱的是,它有时候还会自信满满地给出一个早就过时的答案。这可不是因为这些大模型不够聪明,真正的原因是:它们被“冻住”了。

说白了,一个大型语言模型一旦完成训练,它的知识就永远停留在那个时间点上,就像被拍到琥珀里的照片一样。时间还在往前走,新的新闻、新的技术、新的发现层出不穷,但模型的“大脑”一动不动。如果非要强行给它灌输新知识,它又容易把之前学过的东西忘得干干净净——这就是学术界说的“灾难性遗忘”。你还真别说,这感觉就像你正背单词的时候,脑子里原来记得滚瓜烂熟的数学公式突然全没影了。

长期稳定更新的攒劲资源: >>>点此立即查看<<<

谷歌研究院和康奈尔大学的研究团队,就想解决这个问题。他们的突破口,来自人类大脑最古老、也最神秘的一种行为——睡觉。

人类为什么要睡觉

在聊正题之前,有必要先看看人脑是怎么处理记忆的,因为这个研究的整个思路都建立在这个基础上。

神经科学家早就发现,人类巩固记忆其实有两种方式。第一种是清醒状态下的“在线巩固”——白天学到一个新知识,大脑会立刻开始整理和稳定它,好比你在笔记本上随手写了个备忘。第二种更有意思,叫“离线巩固”,这发生在你睡着之后。

睡觉可不是让大脑“关机”,恰恰相反,睡着的大脑忙得很。科学家发现,睡眠分成两个关键阶段,它们来回交替。第一个是慢波睡眠,这个阶段大脑会把白天接收到的零散信息,从海马体这个临时存储区慢慢转移到大脑皮层这个更稳定、更长期的内存里。这个过程不是简单复制粘贴,更像是把杂乱的素材重新编辑、提炼,扔到多余的细节,只留下最有用的模式和规律。第二个是快速眼动睡眠,这时候大脑活跃得跟醒着差不多,也是做梦的时候。REM睡眠主要负责把新知识和脑子里已有的知识网络编织在一起,探索新的连接,强化那些重要的神经通路。

研究团队从这个过程里得到了启发:如果AI模型也能来一套类似的“睡眠机制”,是不是就有可能解决知识冻结和灾难性遗忘这两块硬骨头?

今天的AI,像得了“顺行性失忆症”

研究团队在论文里用了一个特别形象的比喻来描述眼下AI的困境——顺行性失忆症。这是一种真实存在的神经疾病,得了这个病的人没法形成新的长期记忆,但过去的记忆还好好的。最有名的案例是一个叫H.M.的患者,他因为手术失去了海马体,结果每天早上一觉醒来都不记得昨天发生过什么,但对二三十年前的事记得一清二楚。

现有的通用大模型,恰好也是类似的状况。这些模型的内存基本只有两种:一种是“当前对话的上下文”,也就是你和它这次聊天说的内容,对话一结束这些内容就没了;另一种是固化在参数里的“预训练知识”,从训练完成的那一刻就定下来了,之后再也不更新。前者像短期记忆,后者像长期记忆,但两者之间根本没有桥接机制——没有一种方法能让短期的新知识流入长期的稳定存储中。

研究团队用一个叫“连续记忆系统”的分析框架把这个问题讲清楚了。这个框架把模型内部的不同组件,按照它们“更新频率”的高低排成一列:更新最频繁的部分(比如处理当前输入的注意力机制)相当于短期记忆,更新最慢的部分(比如深层的全连接网络)相当于长期记忆。从这个角度看,灾难性遗忘的根本原因就很清楚了:所有模块同步更新的时候,新知识一定会把旧知识挤掉,因为整个系统的容量是有限的。

“Sleep”框架

研究团队提出的解决方案叫“Sleep”框架,核心思路就是模仿人脑的睡眠机制,给AI设计一套分阶段的离线处理流程。学术界的共识是,一个真正能持续学习的AI,不应该被分成“训练期”和“测试期”这种人为划分——这种划分本身就不符合真实世界的学习逻辑。更合理的做法是:AI有两种状态,一个是“清醒活跃”状态,负责接收和处理外部输入;另一个是“睡眠”状态,不接收新信息,专心整理、巩固和提升自己的知识。

Sleep框架有两个依次进行的阶段,正好对应人类睡眠中的慢波睡眠和快速眼动睡眠。

第一个阶段叫“记忆巩固”,对应慢波睡眠。这个阶段的核心任务,是把存储在高频率、不稳定模块里的知识,迁移并巩固到低频率、稳定的模块里。为了实现这个目标,研究团队设计了两个互相配合的机制:参数扩展和知识播种。

先说说参数扩展。你可以这样理解:模型的容量是有限的,你不断往一个固定大小的盒子里塞东西,新东西当然会把旧东西挤出去。大脑解决这个问题靠的是神经可塑性——需要的时候可以长出新的神经连接,扩大存储空间。研究团队模仿这个机制,设计了一套“渐进式参数激活”方案:每次睡眠周期到来时,系统会在更稳定的记忆模块里激活一批之前一直“休眠”的新参数(用轻量级的低秩矩阵形式实现),专门用来存放即将迁移过来的新知识。这样一来,新知识有了专属的存储空间,不会干扰已有的旧知识。到了下一次睡眠周期,当这波知识已经成功迁移到更稳定的模块后,之前高频模块里临时存储这些知识的参数就会被“清空重置”,腾出空间迎接下一轮新知识——这个清空过程跟人脑里的“突触修剪”差不多,把用不上的冗余连接删掉以提升效率。

有意思的是,论文里还提到一个细节:这些“休眠”参数其实一开始就存在于模型内部,只是被屏蔽了,不参与前向计算和反向传播。这跟我们对人脑的理解高度吻合——人脑的总容量大致固定,并不会在成年后不断生长出全新的神经元,但神经元之间的连接可以在一生中不断形成、强化或修剪。

知识播种

有了新的存储空间,接下来的问题就是:怎么把知识从高频模块迁移到低频模块?研究团队为此设计了一套叫“知识播种”的方法,这算是整个框架里技术上最精妙的部分。

知识播种本质上是一种“知识蒸馏”,但方向刚好相反——正常情况下,知识蒸馏是大模型教小模型,好比有经验的老师把知识传授给年轻学生。但知识播种做的正好相反:让小模型(高频率、参数较少的旧版模型)把知识蒸馏给大模型(加入了新参数之后容量更大的新版模型)。这就像一个知识丰富但脑容量有限的旧版自己,把积累下来的精华教给了一个刚获得更多脑细胞、潜力更大的新版自己。

这个过程面临两个挑战。第一,学生(新版大模型)比老师(旧版小模型)拥有更强的表达能力和潜力,如果只是让学生死记硬背老师说的话,那相当于浪费了新增的容量。第二,因为模型处于睡眠状态,没有外部数据,所有的学习材料只能靠自己生成。

为了解决这两个问题,研究团队借鉴了一个叫“广义知识蒸馏”的方法,并在此基础上加入了强化学习思路。具体流程是这样的:先用旧版小模型(老师)生成一批合成数据,相当于老师出了一套题目和答案。接着,新版大模型(学生)不仅要学习老师的答案,还要生成自己的答案,然后跟老师的答案对比,获得实时反馈。这种混合了老师数据和学生自产数据的训练方式,就像既让学生抄习题册又让他自己做练习,两者结合起来效果更好。

研究团队还加了一个叫“模仿学习”的环节,这是整个知识播种框架里的强化学习部分。具体做法是:从老师生成的数据中随机截取一段前缀,然后要求学生续写后半段,学生的奖励根据两个维度来打分——语义上是否跟老师的原版一致(意思是不是一回事),以及字面上的相似程度(用一种叫“编辑距离”的指标来衡量,也就是需要改动多少个字才能让学生的答案变成老师的答案)。这个机制迫使学生不仅要理解老师的知识内容,还得学会像老师一样去表达和运用这些知识。整个知识播种的训练目标把蒸馏部分和模仿学习部分加权结合,通过一个控制参数来灵活调整侧重点。关键是,在整个知识播种过程中,模型原有的参数全部冻结,只有新扩展的参数会更新,这从根本上杜绝了旧知识被覆盖的风险。

做梦

完成记忆巩固之后,Sleep框架进入第二阶段:做梦。这对应人类睡眠中的REM快速眼动阶段。

如果说记忆巩固的任务是“稳定已有知识、防止遗忘”,那么做梦的任务就是“主动探索,进一步提升能力”。在这个阶段,模型不接收任何外部输入,完全靠自己生成“梦境”——也就是人工合成的训练数据——然后用这些数据训练自己,进行自我提升。

这个思路并不新鲜,AI领域已经有了一些类似的“自我改进”方法,其中SEAL系统是研究团队直接参考的对象。但直接沿用SEAL存在三个问题:第一,SEAL每次自我编辑都需要完整的监督微调,计算代价很高,能生成的“梦”的数量有限。第二,在持续学习的场景下反复进行自我改进,可能导致灾难性遗忘。第三,SEAL只会在模型已有的知识空间里采样,而做梦的一个重要功能恰恰是探索新颖的、超出常规思维的组合——毕竟,很多灵感就是在梦里出来的。

研究团队的做梦流程是这样设计的:给定一个具体任务(包括任务相关的背景信息和评估标准),模型先自己生成一批合成的“梦境”数据。为了引入多样性和新颖性,在采样过程中,模型内部的混合专家路由器(可以理解为模型内部的一个“分工调度员”)除了会选择跟任务最相关的专家模块,还会额外随机激活一个不相关的专家模块,把看似不相关的知识也引入梦境生成中,从而产生意想不到的新联系。

生成了一批梦境之后,并不是所有梦都有用。研究团队设计了一套基于梯度的筛选机制来判断哪些梦境最有潜力——简单来说,就是看看“如果用这条梦境数据来训练自己,模型的参数会发生多大变化”,变化越大说明这条数据信息量越丰富,越值得学习。系统选取变化最大的若干条梦境,再额外随机抽取几条以保持多样性,形成最终用于自我训练的数据集。对于每一条被选中的梦境,系统用高效的低秩适配技术(LoRA)对模型进行微调,然后测试微调后的模型在任务上的表现是否有所提升,以此作为奖励信号,通过强化学习来优化整个“产梦-筛梦-自学”的流程。

实验结果

研究团队在四类不同的任务上对Sleep框架进行了全面测试。

先说持续学习任务。团队测试了一项叫“类增量学习”的能力,简单说就是让模型按顺序学习不同的新类别,考验它能不能同时记住旧类别又学会新类别。在CLINC、Banking和DBpedia三个标准数据集上,使用了Llama-3B和Llama3-8B作为底层模型,结果一致显示,配备Sleep框架的Hope架构在准确率上显著优于传统的上下文学习方法、弹性权重巩固等既有技术。

在语言翻译的持续学习测试中,实验设计更有挑战性:让模型顺序学习满语和卡拉芒语两种在预训练中从未见过的语言,然后评估它对两者的翻译能力。普通的上下文学习方法在学了第二种语言后,第一种语言的翻译成绩急剧下滑,几乎退回到原始状态。而配备了Sleep框架的版本随着巩固阶段数的增加(Hope-1、Hope-2、Hope-3),表现稳步提升,Hope-3几乎能在持续学习条件下恢复到单独学习每种语言时的成绩。作为对比,Cartridges和监督微调两种方法在这个任务上都出现了至少一种语言的灾难性遗忘,表现甚至比普通的上下文学习还差。

在超长文本理解方面,研究团队在BABILong这个极端测试集上做了评估,该测试集要求模型处理最长达到一千万个词符的超长文本——相当于几十本长篇小说的体量。GPT-4这样的大模型在文本超过二三十万词符之后性能就开始急剧下滑,到百万词符级别基本失效。带检索增强的Llama-8B也没法稳定处理超过几十万词符的情况。但在加入Sleep框架后,模型在一千万词符级别依然保持近乎完美的准确率,远超所有对比系统。

在长文本理解的细粒度评估中,实验通过改变巩固阶段的数量和最慢记忆模块的更新频率来考察框架各部分的贡献。结果表明,随着巩固阶段数量的增加,在三个不同的长文本理解基准上性能持续提升,说明睡眠机制确实在帮助模型把信息更好地抽象和压缩进更稳定的参数里。

在数学推理任务上,研究团队将Sleep框架与监督微调、GRPO强化学习方法进行对比,在AIME-24、AIME-25和HMMT-25三个高难度数学竞赛测试集上,使用了Qwen3-1.7B和Qwen3-8B两种规模的模型。以Qwen3-8B为例,基础指令微调版本在AIME-24上得分73.8,监督微调提升到75.5,GRPO再提升到76.4,而Sleep框架达到了79.2,领先优势相当明显。

在知识整合任务上,模型需要学习SQuAD阅读理解数据集里的新事实,然后在没有原文背景的情况下回答相关问题。单次学习一篇文章的场景下,Sleep框架(使用四层记忆系统的版本)达到48.9的准确率,而基础模型是31.9,SEAL是46.7。在持续学习200篇文章的场景下,Sleep框架达到46.2,SEAL是43.2,优势进一步扩大。

在少样本抽象推理任务上,以Llama-3.2-1B为底层,Sleep框架实现了80%的成功率,而普通上下文学习是0%,测试时训练是10%,SEAL是72.5%。

消融实验的结果也很能说明问题:去掉模仿学习环节、去掉语义奖励、去掉参数扩展,都会造成不同程度的性能下降;而去掉做梦阶段的影响最为显著,知识整合准确率从48.9直接下降到35.7,说明做梦阶段是整个框架里不可或缺的组成部分。

在计算效率方面,对比训练到相同性能水平所需的时间,监督微调需要4.3倍到4.8倍的实际计算时间才能追上Sleep框架的成绩,说明Sleep框架在达到同等性能的前提下反而更加高效。

与现有技术的本质区别

研究团队在论文里专门花了很大篇幅来讲Sleep框架跟最近涌现的“在策略自蒸馏”系列方法之间的本质区别。这两者表面上都涉及“用自己训练自己”,但内核完全不同。

在策略自蒸馏的核心逻辑是:给同一个模型一个“有特权信息”的版本当老师,给一个“普通信息”的版本当学生,让学生模仿老师。这类方法在数学推理、代码生成、多语言对齐等具体任务上都取得了不错的成绩,也产生了大量后续研究。但这类方法有一个共同的局限:老师和学生共享同一套参数,模型的总容量不变。

Sleep框架的不同体现在四个维度。第一,Sleep的知识播种是一种“向上蒸馏”——容量更小的旧版模型当老师,容量更大(经过扩展)的新版模型当学生,这从根本上把灾难性遗忘重新定义为一个“容量不足”问题而非“采样分布”问题,并通过渐进式参数增长来解决问题。第二,Sleep维护了一条由不同更新频率的记忆模块构成的连续谱,在每一对相邻频率的模块之间都进行知识巩固,而不是在一对固定的老师-学生之间只做一次蒸馏。第三,Sleep不仅有类似慢波睡眠的巩固阶段,还有类似REM睡眠的做梦阶段,后者通过梯度导向的数据选择和混合专家路由器的随机激活,主动探索新颖知识组合并抵抗迭代自我改进过程中的遗忘风险,而这正是近期多篇OPSD研究揭示的失效模式所在。第四,Sleep的知识播种在在策略蒸馏的基础上额外引入了基于强化学习的模仿学习目标,让更大的学生不仅继承老师的知识内容,还学会了老师运用知识的方式。

说到底,这项研究做的事情,是在回答一个听起来简单却极为深刻的问题:一个真正能持续学习的AI,应该是什么样的?研究团队的答案是:它应该像人一样,不仅在醒着的时候积极学习,还需要定期“睡一觉”,让大脑把白天接收的零散信息整理成稳固的长期知识,同时还要会“做梦”,在梦中把不同的记忆碎片重新组合,探索新的可能。

归根结底,当前的AI模型之所以会陷入知识过时和灾难性遗忘的两难困境,根本原因在于它们的架构从一开始就没有为持续学习做好设计。Sleep框架提供的不是一个修修补补的方案,而是一套从架构层面重新定义AI学习周期的思路——把“清醒-睡眠”这个生物学意义上最基本的节律,变成AI系统能够落地实现的工程机制。

当然,这项研究也有其局限性。论文中的实验主要基于几个具体的模型和基准数据集,Sleep框架在更大规模模型上的表现、在更广泛任务类型上的适用性,以及长期运行多个睡眠周期后参数规模不断膨胀带来的工程挑战,都还需要未来研究进一步探索。不过,从已有的实验结果来看,这个方向的价值是切实存在的。

如果你对这项研究的技术细节感兴趣,可以通过arXiv编号2606.03979找到完整论文,亲自体验一下那些更深入的数学公式和实验设定。


Q&A

Q1:大型语言模型的“灾难性遗忘”是什么意思?

A:灾难性遗忘是指AI模型在学习新知识的过程中,把之前已经学好的旧知识覆盖掉的现象。就像你强行背了一堆新单词,结果把原本滚瓜烂熟的数学公式全忘了。这是目前让AI持续学习新知识面临的最大技术障碍之一,因为模型的参数容量有限,新内容进来就会把旧内容挤出去。

Q2:Sleep框架的“做梦”阶段具体是怎么让模型提升自己的?

A:Sleep框架的做梦阶段是让模型在不接收外部数据的情况下,完全靠自己生成合成训练数据(即“梦境”),再用这些数据训练自己。为了让梦境更有用,系统会通过梯度打分筛选出最有信息量的样本,同时随机激活不相关的知识模块来产生新颖组合。用这批精选梦境对模型进行微调后,以任务表现是否提升作为强化学习的奖励信号,循环优化整个“产梦-筛梦-自学”流程,实现无需人工干预的自我提升。

Q3:知识播种为什么要让小模型教大模型,而不是反过来?

A:这是Sleep框架最反直觉的设计之一。传统知识蒸馏是大模型教小模型,把知识压缩下去。但Sleep框架在记忆巩固阶段需要把已有知识迁移到新扩展的更大容量模块里,所以方向反过来了——原有的小版本模型作为老师,把它积累的知识“播种”给刚获得新参数、容量更大的版本。这样做的好处是新增的参数有了专属的学习目标,不会干扰旧参数里已有的知识,从根本上避免了灾难性遗忘。

侠游戏发布此文仅为了传递信息,不代表侠游戏网站认同其观点或证实其描述

热游推荐

更多
湘ICP备14008430号-1 湘公网安备 43070302000280号
All Rights Reserved
本站为非盈利网站,不接受任何广告。本站所有软件,都由网友
上传,如有侵犯你的版权,请发邮件给xiayx666@163.com
抵制不良色情、反动、暴力游戏。注意自我保护,谨防受骗上当。
适度游戏益脑,沉迷游戏伤身。合理安排时间,享受健康生活。