摘要: 自我改进的LLM智能体越来越多地通过经验学习,而无需更新任何权重。每个回合都被存储在外部记忆中,进行评分,并在未来相似任务中检索,以塑造后续行为。从奖励的角度来看,存储的分数是隐式非参数策略的代理奖励。每个检索到的回合随后成为策略改进步骤,其可靠性取决于该分数是如何产生的。在部署中,真实标签不可用,因此存储的奖励最多只是LLM的评估。这种替代产生了一种失败模式,即*回声差距*,在基于记忆的自我改进智能体和所研究的模型家族中普遍存在。不正确的回合获得了膨胀的奖励;因此,智能体倾向于优先重用那些它最有信心的错误。由于错误通过记忆累积而非平均化,且确认性评判者的错误与原始自我评分的偏差保持相关,因此无法识别哪些记忆被高估。缺失的属性被形式化为*错误独立性假设*(EIA),我们证明这是纠正膨胀的*必要条件*,而不仅仅是对良好验证器的描述:可用信号必须追踪真相*并*将其错误与记忆偏差去相关,且可恢复的收益是这两个量的闭式函数。我们进一步表明,膨胀不仅会在检索按存储分数排序时累积,也会在纯相似性检索下累积,而后者正是部署智能体所使用的机制。最后,无答案去膨胀算法LUCID在BIRD文本到SQL基准上带来了一致的端到端收益。它将执行准确率提升至$56.9\%$,高于Memento式自我评分智能体($54.0\%$,跨种子平均提升$+2.9$个百分点)和相同架构的无记忆智能体($52.4\%$)。