摘要: 大型语言模型(LLM)智能体越来越多地被用作金融咨询等高风险领域的个性化助手,但目前尚不清楚它们是否能够在长期内维护并更新个体化的用户模型。现有的个性化记忆基准主要测试事实性记忆,或依赖于约束较弱的模型生成轨迹,导致对事件驱动的偏好适应研究不足。我们引入了 FinPerMA,一个基于事件的基准,用于对照冻结的纵向投资者轨迹评估个性化记忆。其生成流程结合了确定性的、基于理论的影响规则、受控的 LLM 叙述以及自动化质量筛选;一个“冲击后检查点”用于隔离智能体是否已将重大事件整合到其持久用户模型中。在来自 276 个用户画像的 2,994 个问题上,七个前沿 LLM 和最多七种记忆配置远未达到饱和:没有一种全上下文配置的总体准确率超过约 0.47,多项选择题的准确率约为 39%。归因分析表明,基于摘要的记忆通常能保留事实细节,但会丢失个性化所需的偏好信号;因此,简单的检索有时能胜过专门构建的记忆系统,且这种差距在冲击后会扩大。