线性数学革新:英伟达简化AI模型切换
多模型协作中的性能瓶颈
当一个智能体AI系统将任务从小模型转移到较大模型,或者反向操作时,它需要付出高昂的代价:接收模型必须从头重新计算整个对话,这大幅增加了计算成本和延迟。对于构建长期、多大型语言模型(LLM)工作流程的企业而言,这是一个主要的瓶颈。

为解决这一挑战,英伟达的研究人员引入了一种跨模型KV缓存传输技术,直接将源模型的预填充KV缓存映射到目标模型中。这项技术符合现实世界中智能体应用的特点,即在多次交互中积累大量上下文。
对于现实世界的AI应用,跨模型KV缓存传输能够减少长期、多LLM工作流程的计算成本和延迟,并且是通过简单的线性数学运算实现的,而非依赖昂贵深度学习模型。
实验表明,在兼容的模型对上,这种线性映射过程比重新计算整个对话快2.7至25倍,同时保留了目标模型高达98%的独立准确率。
为何会话中途切换模型如此昂贵
研究LLM如何处理内存有助于理解为什么多模型工作流程在生产环境中会遇到性能瓶颈。当LLM接收提示时,它首先必须执行”预填充”阶段,即前向传播的初始阶段,计算所有输入token的键和值,并填充键值(KV)缓存。
之后,它进入”解码”阶段,计算并生成序列中的下一个token。在此阶段,模型从KV缓存中读取内容,以逐个预测新token,而无需为每个新token重新评估整个对话历史。
在多轮对话或长期智能体会话中,上下文会逐渐变长。由于预填充阶段的计算成本与模型大小和输入长度直接相关,处理这些长会话会变得越来越昂贵,并且在KV缓存失效时引入显著延迟。
每当AI系统尝试在会话中途切换模型时,就会发生这种缓存失效,例如将复杂推理步骤路由到较大模型,或切换到较小模型以节省成本。由于不同LLM具有不同架构,它们期望的缓存输入格式也不同。
因此,任何模型切换都会迫使接收模型从头重新支付整个预填充成本,以重新计算累积上下文的KV缓存。
不重新开始即可映射模型间内存
英伟达的研究人员研究了跨模型KV缓存传输,以探索开发者如何将一个模型的KV缓存转换为另一个模型的预期格式,而无需再次运行预填充阶段。
如果解决这一问题,跨模型KV缓存传输在两个方向上都有益处。从小模型到大模型的传输提升了输出质量。例如,一个廉价的小模型处理智能体工作流程的常规部分,但在复杂推理问题上遇到困难,此时可以将KV缓存映射到较大模型并无缝继续处理过程。
另一方面,从大模型到小模型的传输则降低了计算成本。一个功能强大的大模型可能在会话开始时用于解析大量复杂系统提示或合成密集的PDF文档。一旦繁重工作完成,会话的KV缓存将映射到更小、更经济的模型,以处理后续的快速对话交互。
之前已有解决KV缓存传输问题的尝试,但它们存在几个关键限制,包括需要昂贵的基于梯度的训练或非常严格的架构约束。
在这项初步研究中,作者将研究范围限制在家族内部传输,如在Qwen、Llama或Ministral家族的不同大小模型之间转换。这些模型共享分词器、训练数据DNA和核心架构风格,但在大小和深度上有所不同。然而,该框架为未来实验留下了充足空间。研究人员指出,这项技术最终可能扩展到跨家族传输、不匹配的KV头数量或结合标准注意力与其他内存机制的混合架构。
英伟达研究的关键发现是,跨模型KV缓存具有显著的线性结构。这意味着可以通过简单的代数技巧进行映射,而无需重型神经网络训练。例如,在从140亿参数的Qwen3模型向320亿参数版本传输KV缓存的实验中,作者发现从源层到目标层的简单线性回归映射可以恢复目标模型键方差的56%和值方差的32%。当结合多个源层时,这些数字分别上升到79%和65%。
为了将这种线性关系转化为实用系统,研究人员设计了一个包含三个关键组件的闭式每头岭映射器:
-
每头岭回归:他们不使用复杂的深度学习来训练系统,而是使用几百个文本序列的小型校准集拟合简单的线性回归。该技术为每个注意力头独立解决一个经典的最佳拟合线问题。
-
跨层源选择:由于源模型和目标模型的层数不同,映射器评估并选择最具预测性的源层,输入到每个特定的目标层。这样,系统只从旧模型中选择最有用的内存片段来构建新模型的内存。
-
内容空间映射:在翻译数据前,映射器剥离RoPE编码。RoPE(旋转位置嵌入)是一种标准机制,对数据应用数学上与位置相关的旋转,使模型能够理解序列中token的顺序。剥离RoPE值使映射器能够泛化到比训练数据更长的序列。
测试线性映射器
为验证该技术是否有效,研究人员在六个”匹配KV”模型家族中评估了传输管道。匹配KV意味着源模型和目标模型共享相同的KV头数和每头维度,这在同一家族的不同大小模型中很常见。
这些模型家族包括Qwen3、Llama 3.1和Ministral 3,测试范围涵盖从30亿到700亿参数的不同大小模型间的KV缓存传输。他们的实验包括从Llama 3.1 8B到70B的惊人8.8倍参数跳跃。
为覆盖广泛任务,他们在五个核心准确率基准(ARC-Challenge、HellaSwag、WinoGrande、MMLU和GSM8K)以及WikiText-2上的语言模型困惑度和名为CoQA的多轮对话任务上评估了模型。为适配线性翻译映射器,他们仅使用了500个各含1024个token的文本序列组成的小型校准数据集。
研究人员将他们的框架与目标模型执行完整传统预填充时的基线上限准确率进行了比较。他们还将完整系统与消融配置进行了对比,例如减少所选层数或停用不同组件。此外,他们还将简单方法与使用反向传播训练的深度神经网络进行了比较,以查看在线性方法表现不佳的模型对上,更重的深度学习是否能恢复准确率。
对于六个测试对中的四个,快速闭式线性岭映射器保留了目标模型73%至98%的独立预填充准确率——包括从Llama 3.1 8B到70B的巨大跳跃。
关注微信号:智享开源,及时了解更新信息。


公众号:智享开源
还没有任何评论,你来说两句吧!