行业资讯
ETH苏黎世揭秘:当AI的“记忆“变得更聪明
这项由ETH苏黎世计算机科学系与ETH AI中心联合开展的研究于2026年7月发表论文编号为arXiv:2607.07953。有兴趣深入了解的读者可以通过该编号在arXiv平台上查阅完整论文。**每一次阅读都是一场记忆的挑战**每当你打开一本厚厚的书试图记住前面章节的细节同时还要理解当前页的内容你的大脑就在同时处理记忆与理解两件事。现代AI语言模型——那些能写文章、回答问题、辅助编程的智能助手——面临的正是同样的挑战只不过规模要大得多而且它们的记忆方式直接决定了速度与质量之间的权衡。这篇研究的核心问题用最简单的话来说就是AI应该怎样记东西才能既快又准研究团队从ETH苏黎世出发对目前几种主流的AI记忆机制做了一次全面的横向比较并提出了一种让不同层次的记忆之间互通消息的新思路。---一、AI的记忆困境为什么看全文会把电脑累垮要理解这项研究先得明白AI是怎么读文章的。当前最主流的AI语言模型依赖一种叫做自注意力机制的技术。用一个生活化的比喻来理解你正在读一篇关于厨师张三的长篇小说。读到第200页时你需要回忆第5页张三用的是什么锅。为了找到这个信息你必须把书翻回去逐字逐句对比——不是只查一个地方而是把第200页的每一个字都和前面199页的每一个字做一次对比才能判断哪句话最相关。这就是自注意力机制的工作方式它让文章中的每一个词都和其他所有词做配对比较从而找出最关联的信息。这个机制极其强大也极其消耗资源。文章越长比较的次数就以平方的速度暴增——文章长度翻倍计算量变成四倍文章长度翻四倍计算量变成十六倍。对于需要处理超长文档或超长对话的场景这种二次方代价很快就会把计算机的时间和内存耗尽。正是为了解决这个问题一批研究者开始探索线性注意力机制。线性注意力的核心思路是与其每次都把当前词和所有历史词做比较不如维护一个固定大小的记忆矩阵把历史信息压缩进去每次只需要查这个矩阵就够了。这样一来无论文章有多长查询的代价始终是固定的整体计算量只和文章长度成正比——也就是线性代价。这个矩阵就像一个笔记本你边读书边往里面写关键信息每次需要回忆时只需要翻这本笔记而不是把整本小说从头翻一遍。效率大幅提升代价是笔记本的大小是固定的写满了就需要决定哪些内容要保留、哪些要覆盖。---二、从粗心的笔记员到精细的记忆管理者四种架构的演进ETH团队这次重点比较了四种线性注意力架构它们都围绕同一个核心思路展开但在如何管理笔记本这件事上一代比一代精细。**DeltaNet只记补丁的聪明笔记员**最早的线性注意力有一个严重问题每次读到新信息就直接往笔记本里叠加久而久之新旧内容混在一起互相干扰想查某条信息时总会带出一堆无关内容。DeltaNet提出了一个聪明的解法研究者们称之为Delta规则。它的做法是在往笔记本写新内容之前先查一下笔记本对这条信息已经知道多少。如果笔记本已经记了张三用铁锅而新读到的信息是张三用铁锅确认那就不需要重复写一遍只记录一个零差值就好如果新读到张三其实用铜锅那就只写下把铁锅改成铜锅这个修正量。这种只写修正量的方式让记忆更新变得精准大大减少了信息叠加造成的混乱。DeltaNet的局限在于它没有办法主动清空笔记本上已经过时的内容。一旦某条信息在很久之前写入即便它已经不再重要也还是会一直待在那里影响后续的查询。**Gated DeltaNet加了橡皮擦的改进版**Gated DeltaNet在DeltaNet的基础上加入了一个遗忘旋钮。每次写入新信息之前先把整个笔记本的内容按照一个可学习的比例淡化——就像把铅笔字用橡皮轻轻擦淡再在上面覆盖新内容。这个比例由当前读到的词动态决定读到一段全新的话题时遗忘率自动调高读到与之前高度相关的内容时遗忘率自动调低。这样一来笔记本就有了主动遗忘的能力不再是无限堆积。代价是这种遗忘是对整个笔记本一刀切的——无论哪部分内容都按同一个比例淡化精细控制能力还不够强。**Kimi Delta Attention用分区橡皮擦精细管理**Kimi Delta Attention把这个淡化比例从一个数字升级成了一个向量——也就是说笔记本的不同区域可以按不同的速率淡化。某些记录地点信息的区域可以保留得久一些而记录临时状态的区域则可以很快被清空。这种分区域、分速率的遗忘机制让记忆管理变得更加灵活精细。研究团队在实验中发现在350亿参数、150亿词训练量的标准测试下使用Muon优化器的Kimi Delta Attention混合架构达到了本次实验中最低的最终验证损失2.273是所有架构中表现最好的。当然精细的管理也带来了更高的计算开销它在所有架构中训练速度相对较慢相对速度约为70.9%。**Gated DeltaNet-2把写入和擦除彻底分开**Gated DeltaNet-2是这个系列目前最精细的版本。它的核心创新是把擦除旧内容和写入新内容这两件事彻底解耦分别由两个独立的门控机制来控制。一个擦除门专门决定从笔记本的哪些区域移除旧内容另一个写入门专门决定把新内容写进哪些区域。这两个门各自根据当前读到的词独立计算互不干扰。如果把Gated DeltaNet比作用一把刀又切又抹那Gated DeltaNet-2就是用两把专业工具一把专门刮旧内容一把专门涂新内容。当这两个门的参数设置成相同值时整个机制就退化回Kimi Delta Attention再进一步退化就成了Gated DeltaNet体现了清晰的包含关系。---三、大型实验场在同一个擂台上谁赢了为了做公平比较ETH团队搭建了一个统一的实验平台。所有模型都采用3.5亿参数规模在同一个高质量网页文本数据集上训练150亿个词使用相同的序列长度、批大小、精度和硬件配置。这就像让不同品牌的汽车在同一条赛道上跑同样的圈数只比较最终成绩。实验区分了两种架构模式。混合栈是指把线性注意力层和传统的软最大值注意力层交替排列每三层里有一层是传统注意力纯栈则是全部使用线性注意力层不混入传统注意力。这两种模式代表了两种不同的设计哲学混合栈试图兼顾质量和效率纯栈则追求最极致的速度优势。从验证损失这个衡量模型质量的核心指标来看Kimi Delta Attention配合Muon优化器的混合架构以2.273的最终损失拔得头筹。DeltaNet配合Muon的混合架构紧随其后达到2.299。即便是传统的软最大值注意力在换用Muon优化器后也达到了2.349优于多个线性注意力的AdamW版本。从训练速度来看纯栈Gated DeltaNet配合AdamW优化器以100%的相对速度排名第一是整个实验中最快的设置但其最终损失为2.433比最佳质量的结果差了不少。Kimi Delta Attention由于计算机制更复杂速度只有68.5%到70.9%左右。这两项结果合在一起清晰地揭示了一个根本性的权衡你想要最好的质量就要付出速度的代价你想要最快的速度就要接受质量上的妥协。没有哪个单一设置能同时在两个维度上称王。---四、优化器的选择比你想象的重要得多这项研究揭示了一个很多人可能忽视的细节选择哪种优化器对最终结果的影响巨大而且必须和学习率一起考虑。优化器可以理解为AI学习时的调参策略——它决定了每次根据错误信号调整模型参数的方式。实验比较了两种主流优化器AdamW和Muon。表面上看从AdamW换成Muon只是换了一个工具但实验数据显示在所有测试的架构和栈结构组合中Muon都稳定地带来了更低的最终验证损失。更有趣的是不同的架构对学习率这个参数的最优值需求截然不同。学习率就像调味料的用量——太少了菜没味道太多了则会咸苦难以入口。研究团队在2000步的短期训练实验中发现使用Muon的模型普遍偏爱较低的学习率约在3×10??附近而使用AdamW的线性注意力模型则偏爱较高的学习率约在10??附近。唯一的例外是传统软最大值注意力它在两种优化器下的最优学习率都落在3×10??附近。这个发现有重要的实践意义如果你想比较两种架构的好坏必须分别为它们各自调到最优的学习率否则得出的结论很可能是因为调参失误导致的而不是架构本身的差异。用一个烹饪类比来说同样是比较铁锅和不粘锅哪个煎蛋更好如果铁锅用了适合不粘锅的火候最后铁锅煎出焦糊的蛋你不能就此得出铁锅更差的结论。---五、长文本的速度测试线性优势在这里最明显研究团队还专门测试了当文本序列变长时不同架构的表现如何变化这是线性注意力架构存在意义最直接的体现。测试在4096个词、16384个词和32768个词三种长度下分别测量了每次训练迭代需要的时间。结果非常直观在32768个词的长度下传统软最大值注意力每次迭代需要3.37秒Gated DeltaNet的混合栈需要1.56秒而纯栈Gated DeltaNet只需要0.96秒。更能说明问题的是增长幅度从4096词增长到32768词传统注意力的时间增加了约192%接近三倍混合栈Gated DeltaNet增加了约65%纯栈Gated DeltaNet仅增加了约8%几乎没有变化。这正是线性与二次方在实际中的差距——序列越长线性架构的优势越明显到了足够长的序列差距可以是数倍乃至数十倍。混合栈的增长幅度65%非常接近纯软最大值注意力192%的三分之一这个比例并非巧合——混合栈中恰好有三分之一的层是传统注意力层它们贡献了几乎全部的序列长度相关开销。这个细节说明混合架构的速度特性几乎可以线性地由有多少比例的层是传统注意力来预测。---六、规模扩展的验证更大的模型说了什么研究团队还把DeltaNet扩展到了更大的规模以验证在3.5亿参数之外的表现是否一致。在13亿参数、训练400亿词的规模上实验发现学习率的选择对结果依然至关重要。使用3.6×10??学习率的混合架构DeltaNet最终损失为2.066对应的纯栈版本为2.085但同样是纯栈版本把学习率降到1.5×10??后最终损失反而更低达到2.063——差距虽然不大但方向相反说明最优学习率因栈结构不同而不同。在30亿参数、训练600亿词的更大规模上同样的规律再次出现学习率为5×10??的混合架构DeltaNet最终损失高达2.332而把学习率降到3×10??或1.5×10??损失都降到了1.955差距显著。这再次证明在任何规模的实验中学习率调参都不能省略。研究团队还在多个下游任务上做了评测包括HellaSwag常识推理、PIQA物理常识问答和WinoGrande指代消解。这些任务的结果显示各架构之间的差异不大没有任何一个架构在所有任务上明显占优也没有明显的退化。这意味着验证损失所反映的质量差异并没有在这几个基准任务上造成明显的功能差距至少在这个规模和任务集合上如此。---七、跨层传话让深层网络不再遗忘浅层的发现解决了如何管理单个层的记忆之后研究团队把目光转向了一个更深层的问题当模型有很多层堆叠在一起时浅层提取的有用信息会不会被深层网络淡忘或覆盖这个问题的背景是深度神经网络由许多层组成每一层都对输入做一定的变换输出传给下一层。理论上浅层发现的某个关键模式应该能通过层层传递影响到最终输出。但实践中随着层数增加早期信息确实可能被稀释。一些研究者包括Kimi团队提出了用注意力残差或深度混合注意力等方案专门在层与层之间建立额外的信息通道。ETH团队的思路是既然DeltaNet风格的架构在每一层都会产生一个写入残差也就是前面说的修正量这个信息不用了就被丢掉了。那能不能把它传递给更深的层让更深的层也能利用这个信息而且这种传递方式必须不破坏线性注意力的速度优势。**第一次尝试传递写错了多少CLER**最直觉的想法是把浅层的修正量直接传递给下一个线性注意力层让接收层把它加入自己的写入目标中——相当于告诉下一层上一层觉得自己对这条信息的记录还差这么多你帮忙补上。这个方案被命名为跨层错误残差CLER。然而实验结果令人失望。使用Muon优化器时CLER版本的Gated DeltaNet比原始版本损失反而略高了0.0013CLER版本的DeltaNet虽然有-0.0004的微弱改善但这个差距小到可以忽略不计不具统计意义。使用AdamW优化器时CLER对两个架构都没有改善DeltaNet版本甚至损失大幅上升了0.019。研究团队并没有因此放弃而是仔细分析了原因。他们认为问题在于空间错位浅层的修正量是在浅层自己的值空间中定义的这个空间和深层的值空间之间没有天然的对齐关系——就像一个厨师用法语写的菜谱传给一个只懂中文的厨师对方根本无法直接利用。**第二次尝试传入公共频道CLER-H**意识到问题所在后团队做了第一个改进不把信息传入接收层的私有值空间而是传入所有层共享的残差流——也就是整个网络中各层之间传递信息的公共通道。这个方案叫做CLER-H传递的信号仍然是写入错误量。结果有了明显改善。在350亿参数、10亿词训练的实验中CLER-H使Gated DeltaNet的损失降低了0.0073使DeltaNet降低了0.0047。在更长的150亿词训练中改善依然存在但幅度缩小分别为-0.0042和-0.0002。**第三次尝试传递写了什么而不是差了多少CLVR**团队进一步思考既然写入错误量能有所帮助那写入量本身会不会更有用毕竟写入错误量只是写入值减去已有记忆对该位置的预测而完整的写入值包含了更多信息。这个方案被命名为跨层值路由CLVR。结果证实了这个判断。在350亿参数、10亿词的实验中CLVR使Gated DeltaNet损失降低了0.0103使DeltaNet降低了0.0119均优于CLER-H。在150亿词的训练中改善持续存在分别为-0.0059和-0.0016。在13亿参数、400亿词的更大规模实验中仅有Gated DeltaNet的数据CLVR使损失降低了0.0019。关键的一点是CLVR使用了零初始化的投影矩阵——一开始这个跨层传递通道完全不起作用模型和没有CLVR时完全一样。随着训练进行模型自己学会了是否以及如何利用这个通道。训练结束后检查这个投影矩阵发现它在所有路由层上都有了非零但可控的参数值说明模型确实主动使用了这个通道而不是把它置之不理。研究团队还做了几个控制实验来确认改善来自路由本身而非额外参数。把路由的信号从写入值换成该层的隐藏状态效果几乎持平改善仅-0.0014把Gated DeltaNet的参数量直接增加到和CLVR版本相同不引入路由机制损失反而上升了0.0021。两个控制实验都说明改善来自传递了什么信息而不是增加了多少参数。---八、研究的边界什么结论是稳健的什么还是初步的ETH团队在论文中对研究局限性的描述相当坦诚这也是值得称道的学术态度。整个实验中每种配置只跑了一次没有多次随机种子的重复实验因此所有结果都不附带误差范围。对于损失差距小于约0.001到0.01的比较研究者明确表示不做强结论——这个量级的差异可能只是随机波动在单次实验中无法区分。下游任务评测的覆盖面也相对有限仅测试了HellaSwag、PIQA和WinoGrande三个标准基准而且这三个任务对于长上下文记忆能力的要求不高。研究者明确指出这些评测的主要用途是检查有无明显退化而不是作为改善的独立证据。CLVR目前只在DeltaNet和Gated DeltaNet两种宿主架构上做了验证Kimi Delta Attention和Gated DeltaNet-2上还没有对应的实验数据。Gated DeltaNet-2特别值得关注——它把写入值和擦除操作分开了路由写入值这个逻辑在这种架构上意味着什么还是一个开放的问题。此外随着模型规模增大或训练时间增长CLVR的改善幅度有所收窄。在13亿参数级别改善已经缩小到0.0019这是否意味着在更大规模或更充分训练的情况下收益会消失目前还不清楚。研究者猜测这可能是因为更大、训练更充分的模型自己已经能够学会浅层的有用信息不再那么需要显式的跨层传递。---九、对工程实践者的启示速度还是质量你只能先选一个从这项研究的全部实验结果中可以提炼出几个对实际应用直接有用的认识。关于架构选择没有一个在所有维度都最优的选项。如果部署场景对推理延迟极其敏感、需要处理很长的上下文纯线性注意力栈在序列长度增加时几乎不增加时间成本是值得认真考虑的方向。如果对质量的要求高于速度混合架构通常能在不大幅牺牲速度的前提下让验证损失接近更大计算量的纯软最大值注意力。关于优化器不能只试AdamW就做定论。研究显示Muon在所有测试架构上都能改善质量而且它们偏爱的学习率范围不同——用AdamW的最优学习率来跑Muon或者反过来都会得到远未达到潜力的结果。关于跨层路由CLVR在小规模和中等规模上有一定的改善而且不增加推理成本工程代价很低可以作为一个值得尝试的技巧。但目前的实验仅限于两种宿主架构和有限的规模不宜过度推广。---说到底这项研究做的事情就是把几个AI记忆笔记本的不同管理方式放在同一张桌子上认真地量了量各自的重量和容量。结论不是这个笔记本最好其他都可以扔掉而是每本笔记本适合不同的场合而且你选的笔还会影响写出来的字好不好看——这里的笔就是优化器。研究团队还发现让不同层的笔记本互相传阅是有价值的但传阅方式很关键。把我哪里记错了传给别人没有把我原本打算写什么传给别人更有用。这个发现打破了最初的直觉——毕竟记录我的错误才是DeltaNet这个系列的核心设计哲学。这项工作的价值一方面在于对已有架构的系统梳理让不同机制的异同在数学上变得透明另一方面在于CLVR这个轻量级的新机制它在保留线性注意力全部速度优势的前提下提供了一个让深层网络不遗忘浅层智慧的方式。它的改善目前还比较小在更大规模上是否依然有效还是未解之谜但作为一个几乎没有工程成本的改进已经值得关注。有兴趣深入了解全部细节的读者可以通过arXiv编号2607.07953找到这篇论文同时研究团队也在GitHub上开放了完整的实现代码可以直接复现实验。---**QA**Q1线性注意力和传统软最大值注意力相比质量真的能差不多吗A根据ETH苏黎世的实验在3.5亿参数、150亿词训练的标准设置下Kimi Delta Attention配合Muon优化器的混合架构最终验证损失为2.273而传统软最大值注意力配合Muon达到2.349线性注意力反而更优。但这个结论的前提是架构、优化器和学习率都经过合理匹配不是随便换一个就能得到这个结果。Q2CLVR跨层值路由对推理速度有没有影响ACLVR通过一个零初始化的投影矩阵把浅层的写入值加入残差流这个操作在推理时也同样存在理论上会增加一点点计算量但由于投影矩阵的维度相对较小且不改变任何一层的主体计算逻辑研究团队描述其为保留宿主架构线性时间结构的轻量方案。论文中没有单独列出CLVR对推理速度的具体影响数字。Q3混合栈和纯栈Gated DeltaNet的训练速度差距有多大A根据论文中的实验数据在32768词的长序列下纯栈Gated DeltaNet每次训练迭代约需0.96秒混合栈需要1.56秒传统软最大值注意力需要3.37秒。从4096词增长到32768词纯栈时间只增加了约8%混合栈增加了约65%而传统注意力增加了约192%。在相对吞吐量上纯栈AdamW版本被定为100%基准混合栈AdamW版本约为90.5%。
郑州网站建设
网页设计
企业官网