记忆奖励通胀:AI自我进化正在制造虚假的“变聪明”
不更新权重、只靠外部记忆和评分机制来提升表现的LLM智能体,正在经历一场隐秘的“奖励通胀”。研究者发现,当智能体把每次交互存入外部记忆并打分,再据此调整后续行为时,评分标准会随着时间推移逐渐失真——早期的高分行为被不断复制,但环境已经变化;低分行为被过早淘汰,可能恰恰是未来高价值路径的铺垫。这种通胀效应导致智能体看似在进步,实际是在一个自我强化的回音室里打转。论文提出了“记忆奖励校准”机制,通过引入时间衰减和跨场景对比来抑制通胀。这项研究的价值在于:它戳破了一个流行叙事——大模型不需要重新训练也能持续进化。现实是,没有严谨的评估框架,所谓的“经验积累”可能只是一场集体幻觉。
Memory Reward Inflation in Self-Improving LLM Agents
Self-improving LLM agents increasingly learn from experience without updating any weights. Each episode is stored in an external memory, scored, and r