摘要:记忆增强型大语言模型(LLM)智能体通过主动整理检索内容并附加 LLM 生成的元数据(如摘要、关键词和标签)的智能记忆系统,在数百次交互中维持上下文。从推理成本角度看,每次检索都会触发对这些结构化记忆单元进行完整的键值(KV)状态重新编码,这主导了预填充延迟。现有的免训练 KV 复用方法通过选择性重新计算少量 token 来缓解这一问题,但这些方法是为 RAG 风格的原始段落设计的,在处理结构化智能体记忆时性能下降。我们提出 AgentKVShift,一种免训练、基于探针引导的 KV 残差校正方法,该方法针对每个检索到的记忆单元独立运行。我们展示的关键洞察之一是:每个记忆的 KV 复用残差可分解为一个共享的记忆级偏移加上微小的 token 级波动。通过从一个小型探针集中估计这个偏移,我们可以用单一的加权校正来修正每个被复用的 token。与先前决定哪些 token 需要重新计算、其余缓存保持过时的复用方法不同,AgentKVShift 还会校正它不重新计算的 token,从而将刷新预算转化为整个数据块中的有效信号。在四个参数规模从 3B 到 32B 的开源 LLM 以及两个长周期智能体记忆基准测试(长期对话和智能体应用)上,AgentKVShift 在仅刷新 10-30% 缓存的情况下实现了接近完全重新计算的性能,在相同重新计算比例下优于基线方法。要达到这种接近完整的性能,它所需的重新计算量最多可降低 5 倍,而先前的复用方法只有在 45-55% 的刷新比例下才能达到。在此条件下,AgentKVShift 在单块 A100 上相比无 KV 复用的方法实现了 2-3.5 倍的预填充加速。AgentKVShift 与 KV 缓存量化正交组合,在激进的 2 位和 4 位设置下,其 F1 值仍比先前的复用方法高出 2 倍以上。