← 返回日报
🌐 机器翻译 · DeepSeek · ArXiv

Dynamic Governance of Multi-LLM Agent Systems for Collaborative Conversational Outcomes


摘要: 当两个目标结构对立的 LLM 代理在多轮交互中互动时,由于缺乏共享的目标函数,产生的不是竞争而是崩溃:访客屈服,站点代理停止变换其策略,对话在未达成任何一方既定目标的情况下终止。本文探讨了一个控制论治理层能否替代这一缺失的目标函数。体验编排器(EO)在一个模拟的金融服务环境中解决了这一问题,其中站点代理引导访客联系顾问,而访客则保持心理上逼真的抗拒。EO 通过三种机制治理联合轨迹:一个上下文 Bandit(CB),根据真实网络分析数据校准选择内容臂;一个 PID 控制器,通过动态模式约束强制执行行为一致性;以及一个 POMDP 信念追踪器,维护访客意图的概率模型。在 60,000 次模拟中,EO 在高意向顾问联系率上实现了 +32 个百分点的提升(78.1% 对比朴素 LLM 控制的 46.1%),其中 CB 变体选择解释了因子间结果方差的 97%——这证实了是治理策略,而非环境初始条件,决定了轨迹的最终走向。人物角色层面的分析揭示了两种不同的机制:对于没有自然转化倾向的访客,治理层是功能系统与非功能系统之间的区别;对于已经接近一致的访客,朴素 LLM 的共情默认设置基本足够。所有发现均以 LLM 到 LLM 的模拟为条件。PID 控制器尚未针对真实人类不可预测性进行校准,因此在实时流量上验证 EO 是关键的下一步。

📖 阅读原文 →