摘要: 当两个目标结构对立的 LLM 代理在多轮交互中互动时,由于缺乏共享的目标函数,产生的不是竞争而是崩溃:访客屈服,站点代理停止变换其方法,对话在未达成任一代理既定目标的情况下终止。本文探讨一个控制理论的治理层能否替代这一缺失的目标函数。体验编排器(EO)在一个模拟的金融服务环境中解决了此问题,其中站点代理引导访客联系顾问,而访客则保持心理上逼真的抗拒。EO 通过三种机制治理联合轨迹:一个上下文老虎机(CB),根据真实网络分析数据校准选择内容臂;一个 PID 控制器,通过动态模式约束强制执行行为一致性;以及一个 POMDP 信念追踪器,维护访客意图的概率模型。在 60,000 次模拟中,EO 在高意向顾问联系率上实现了 +32 个百分点的提升(78.1% 对比朴素 LLM 控制的 46.1%),其中 CB 变体选择占因素间结果方差的 97%——这证实了决定轨迹终点的是治理策略,而非环境初始条件。人物角色层面分析揭示了两种不同的机制:对于没有自然转化倾向的访客,治理层是功能系统与非功能系统之间的区别;对于已经接近一致的访客,朴素 LLM 的共情默认设置基本足够。所有发现均以 LLM 到 LLM 的模拟为条件。PID 控制器尚未针对真实人类不可预测性进行校准,而在实时流量上验证 EO 是关键的下一步。