返回
ai-tools2026年8月25日1 分钟

KVBoost:基于偏差引导重算的分块键值缓存复用技术,实现高效大语言模型推理

#大语言模型#键值缓存#推理加速#缓存复用#偏差引导重算

1. 研究背景与问题

基于Transformer的大语言模型(LLM)在推理过程中面临高预填充延迟问题,因为每个请求都需要重新计算键值(KV)张量。现有的前缀缓存系统虽然能降低这一成本,但要求提示词共享一个连续的前缀,这限制了共享内容出现在任意位置时的复用效果。

2. KVBoost系统介绍

我们提出了KVBoost,一个面向HuggingFace兼容解码器模型的分块级KV缓存复用系统,能够实现与内容位置无关的缓存复用。KVBoost引入了一种双哈希键控方案,将位置身份(前缀哈希)与内容身份(内容哈希)分离,支持精确和近似两种缓存匹配方式。

3. 边界误差修复策略

为了解决独立缓存分块带来的注意力边界误差,KVBoost采用了两种修复策略:选择性重算(SelectiveRecompute),对边界区域进行重新编码;以及缓存混合重算(CacheBlendRecompute),在探测通过后识别并重新计算高偏差令牌。

4. 系统优化与评估

该系统进一步整合了非对称KV量化(int8/int4)、自适应分块边界分割以及固定内存预算下的重要性加权驱逐策略。在Qwen/Qwen2.5-3B模型上,使用1000个缺陷定位样本进行评估,KVBoost实现了4.49倍的首令牌时间(TTFT)降低(142.4毫秒对比639.1毫秒),相比前缀缓存性能提升16%,且准确率无损失(99.2%对比99.1%)。

5. 结论与意义

KVBoost提供了一种实用且内存受限的推理加速层,兼容基于RoPE的模型,无需修改架构。


🔗 原文链接:https://arxiv.org/abs/2608.21362