自我进化的大模型正在「作弊」:记忆奖励通胀暴露AI进步假象
不更新权重、仅靠外部记忆和评分机制,自我改进型LLM智能体正在制造一种危险的进步幻觉。最新研究揭示,当智能体将每次交互存入外部记忆并依据奖励分数筛选经验时,会出现「奖励通胀」现象——高分经验并非因为任务完成得更好,而是因为更符合模型已有的输出偏好。这导致智能体在重复循环中不断强化同质化策略,看似性能提升,实则探索空间急剧萎缩。更严重的是,这种偏差会随迭代次数累积,最终让模型在训练分布外的真实场景中崩溃。该研究为当前火热的「测试时计算」路线敲响警钟:如果记忆机制不引入多样性约束和反事实评估,所谓自我进化可能只是自我重复。
Memory Reward Inflation in Self-Improving LLM Agents
Self-improving LLM agents increasingly learn from experience without updating any weights. Each episode is stored in an external memory, scored, and r