← 返回日报
🌐 机器翻译 · DeepSeek · ArXiv

Measuring Cross-Task Behavioral Consistency in Language Model Agents


摘要: 智能体评估几乎完全依赖于结果指标,例如成功率,这些指标捕捉的是智能体是否成功,而非其行为的一致性。我们认为,跨任务的行为一致性是一个独立的、可度量的属性,并为此引入了行为一致性指标(BCM)来对其进行量化。BCM 训练一个模型,从智能体执行轨迹的行为特征中预测任务成功与否,推导出每条轨迹的特征归因向量,并衡量一个智能体系统内这些向量的平均成对相似度。在对软件工程任务上六个语言模型智能体的大约 9000 条轨迹进行分析后,我们的核心发现是:跨任务一致性与任务内一致性是可能相互背离的不同维度:一些系统在局部是可复现的,即在重复尝试同一任务时行为相似,但在全局上却是碎片化的,在不同任务间没有稳定的策略;而另一些系统则在两个尺度上都表现出一致性。先前的工作仅衡量同任务的可复现性,因此无法观察到这种分离。我们进一步发现,一致性并不能简化为成功率,因为成功率相当的系统在一致性上可能差异显著;并且,在控制任务难度恒定的任务内对照实验中,前沿模型与开源模型之间的一致性差距依然存在。我们将 BCM 定位为一种过程层面的可靠性信号,用以补充结果指标,并明确阐述了其有效性的条件。

📖 阅读原文 →