摘要:记忆增强型大语言模型(LLM)智能体通过主动整理检索内容并附上由 LLM 生成的元数据(如摘要、关键词和标签)的智能记忆系统,在数百次交互中维持上下文。从推理成本的角度看,每次检索都会触发对这些结构化记忆单元进行完整的重新编码,生成键值(KV)状态,这主导了预填充延迟。现有的免训练 KV 重用方法通过选择性重新计算一小部分 token 来缓解这一问题,但这些方法是为 RAG 风格的原始段落设计的,在处理结构化智能体记忆时性能会下降。我们提出 AgentKVShift,一种免训练的、基于探针引导的 KV 残差校正方法,该方法针对每个检索到的记忆单元独立运行。我们展示的一个关键洞察是:每个记忆单元的 KV 重用残差可分解为一个共享的记忆级偏移量加上微小的逐 token 波动。通过从一个小型探针集中估计这个偏移量,我们能够用一个加权校正来修正每个被重用的 token。与之前决定哪些 token 需要重新计算、其余缓存保持陈旧的重用方法不同,AgentKVShift 还会修正它不重新计算的 token,从而将刷新预算转化为对整个数据块有用的信号。在四个参数规模从 3B 到 32B 的开源 LLM 以及两个长周期智能体记忆基准测试(长期对话和智能体应用)上,AgentKVShift 在仅刷新 10-30% 缓存的情况下实现了接近完全重新计算的性能,在相同重新计算比例下优于基线方法。要达到这种接近完全的性能,它所需的重新计算量最多可降低 5 倍,而之前的重用方法只有在 45-55% 的刷新率下才能达到。在此情况下,AgentKVShift 在单个 A100 上相比无 KV 重用实现了 2-3.5 倍的预填充加速。AgentKVShift 可与 KV 缓存量化正交组合,在激进的 2 位和 4 位设置下,其 F1 值仍比之前的重用方法高出 2 倍以上。