← 返回日报
🌐 机器翻译 · DeepSeek · ArXiv

Even More Deception: Objective Misalignment in Mixed-Motive LLM Multi-Agent Systems


摘要: 由大型语言模型(LLM)驱动的多智能体系统日益部署于混合动机环境中,在此类环境中,由于目标冲突或隐藏目标,智能体在信息不对称和策略性欺骗的条件下运作。在这些情境下,与集体目标的错位成为一个核心关切。我们提出了一种新颖的评估框架,利用社交推理游戏《狼人杀》来评估目标错位,即在保持单个智能体所分配角色不变的情况下,修改其目标。我们跨越四个不同模型家族和规模的LLM、四种玩家角色以及三种目标设定,对智能体的内部推理及其公开的廉价交谈行为(即无成本、非约束性且不直接影响智能体效用的沟通)进行了双重分析,并辅以对游戏结果的分析。我们的结果表明,目标错位会损害固有对抗性环境中的整体结果,而这种影响因信息不对称和专业化角色而加剧。尽管被损害的智能体始终会发展出独特的、依赖于目标的推理策略,但这些适应在其公开行为中基本不可见。更广泛地说,我们的研究结果表明,即使是微妙的目标错位也能深刻影响集体决策,凸显了为基于LLM的多智能体系统制定有效缓解策略的必要性。

📖 阅读原文 →