← 返回日报
🌐 机器翻译 · DeepSeek · ArXiv

When to Communicate: Belief Distributions and KL Divergence for Principled Gating in Multi-Agent RL


标题: 何时通信:多智能体强化学习中基于信念分布与KL散度的原则性门控机制

摘要: 在多智能体强化学习中,有效的通信要求智能体不仅决定*通信内容*,还要决定*何时通信*。现有方法要么在每个时间步都进行通信,要么通过REINFORCE策略梯度学习一个二元门控,这是一种高方差的信号,会导致不稳定且不可解释的门控行为。我提出了一种原则性的替代方案:仅当智能体学习到的信念分布之间的KL散度超过固定阈值时,智能体才进行通信。每个智能体维护一个关于潜在世界状态的信念分布,该分布是其LSTM隐藏状态的softmax函数,并且仅在信念分歧足够大以保证信息交换的合理性时才进行通信。我在IC3Net的Predator-Prey基准测试中,跨两种环境规模(每种规模5个种子)以及MPE simple\_spread上评估了此方法,并与IC3Net、CommNet和独立控制器进行了比较。在PP 10×10环境中,IC3Net在所有阈值下均优于KL信念方法。在更具挑战性的PP 20×20环境中,对ε ∈ {0.1, 0.3, 0.5, 1.0}的阈值消融实验揭示了倒U型关系:ε=0.5实现了73.84的平均步数和42%的成功率,而IC3Net为75.31步和31%,差距为1.47步和11个百分点,且种子方差更小。在MPE环境中,即使门控机制未激活,信念头也将平均奖励提高了12点,并将方差降低了26倍,这表明存在两个正交的贡献:当信念能够收敛时,提供原则性的门控;以及无论门控如何,都能改善潜在表征,从而有益于协调。

📖 阅读原文 →