标题:SAAG:结构化智能体评估与基础验证(Structured Agent Assessment and Grounding)
摘要: 对智能体调用(agent-calling)的精确匹配评估掩盖了性质不同的失败模式:模型可能选择了正确的函数却幻觉出参数值,或者满足了模式(schema)却基于错误理由选择了智能体。现有基准将这些差异压缩为单一的二元分数,导致从业者无法诊断智能体调用在何处失败。我们提出 SAAG,一个级联诊断框架,将智能体调用评估分解为三个连续阶段:注册表合规性(registry conformance)、结构完整性(structural completeness)和参数基础验证(argument grounding),每个阶段都会产生可解释的阶段特定诊断信息。这些诊断信息还能支持迭代式自我修复:当预测失败时,阶段特定的信号会引导有针对性的修正,而不会泄露真实值。我们在一个基于 Glaive 函数调用数据集(function-calling dataset)的受控基准上评估该框架,该基准涵盖 5、10 和 15 个智能体的注册表规模,并使用三个本地 sub-4B 参数模型。与单次推理和无信息二元反馈相比,结构化反馈持续提高了参数精度并减少了值幻觉,而端到端 F1 分数的提升幅度适中且依赖于模型。这些结果表明,阶段分解的诊断评估是理解和提升跨模型家族及注册表规模的智能体调用可靠性的必要视角。