← 返回日报
🌐 机器翻译 · DeepSeek · ArXiv

Even More Deception: Objective Misalignment in Mixed-Motive LLM Multi-Agent Systems


摘要

大型语言模型(LLM)驱动的多智能体系统正越来越多地部署于混合动机环境中。在此类环境中,由于存在冲突或隐藏的目标,智能体在非对称信息与策略性欺骗条件下运行。在此背景下,与集体目标的对齐偏差成为核心关切。我们提出了一种新颖的评估框架,利用社交推理游戏《狼人杀》来评估目标对齐偏差:在保留单个智能体所分配角色的前提下,修改其目标。我们考察了来自四个不同模型家族与规模的LLM、四种玩家角色以及三种目标设定方式,对智能体的内部推理及其公开廉价交谈行为(即无成本、非约束性、不直接影响智能体效用的沟通)进行了双重分析,并辅以对游戏结果的分析。我们的结果表明,目标对齐偏差会损害固有对抗性环境中的整体表现,而这种影响因非对称信息与专业化角色而进一步加剧。尽管被篡改目标的智能体始终会发展出与目标相关的独特推理策略,但这些适应性调整在其公开行为中几乎不可见。更广泛而言,我们的发现表明,即便是细微的目标对齐偏差,也可能深刻影响集体决策,凸显了为基于LLM的多智能体系统制定有效缓解策略的必要性。

📖 阅读原文 →