多智能体沟通的「黄金时刻」:KL散度如何破解何时开口的终极难题
在多智能体强化学习领域,沟通策略长期聚焦于「说什么」而忽视了「何时说」,这一盲区导致大量无效信息在智能体间流转,不仅浪费带宽资源,更严重干扰了协作效率。本文提出了一种基于信念分布与KL散度的门控机制,让每个智能体在决定是否发送消息前,先量化自身观测与全局信念之间的信息增益——只有当KL散度超过动态阈值时,才触发通信。这一设计将沟通从「广播模式」升级为「按需模式」,实验表明在仓储机器人调度、自动驾驶汇流等场景中,通信量平均降低62%的同时,任务成功率反而提升18%。核心洞见在于:真正的智能协作不是信息越多越好,而是信息差越精准越好。该框架为多智能体系统的可扩展性提供了理论基石,尤其对通信受限的真实物理世界部署具有里程碑意义。
When to Communicate: Belief Distributions and KL Divergence for Principled Gating in Multi-Agent RL
Effective communication in multi-agent reinforcement learning requires agents to decide not only \textit{what} to communicate, but when? Existing appr