摘要: 深度搜索代理通过长周期网页交互来应对具有挑战性的问题,这一过程既复杂又脆弱:微小的推理错误可能会在漫长而嘈杂的轨迹中传播,最终导致流畅但错误的答案。诊断此类故障十分困难,通常需要人工检查极其冗长的执行轨迹,这可能超出人类的能力范围。为此,我们引入了 SearchAuditBench,一个用于评估 LLM 审计器能否定位、归因并修复这些故障的基准,从而减轻人工负担。SearchAuditBench 包含 1,243 条失败的轨迹,平均每条包含 73.1 条消息和 65.1K 个令牌,这些轨迹来自五个深度搜索基准上的八个开源权重模型,每条轨迹都经过专家标注,包含关键错误步骤、搜索特定的根本原因以及带有评分标准的参考修复方案。我们进一步提出了 SearchAuditor,一个多视角审计框架,通过基于证据的裁决来有效地定位、归因和修复搜索代理的故障。实验结果表明,即使是最强的基线方法,在 GPT-5.5 等前沿模型的支持下,其端到端通过率也仅为 26.6%。相比之下,我们的 SearchAuditor 在不同前沿模型上均持续优于所有基线,实现了 32.3% 的端到端通过率,并且利用其修复方案恢复失败的运行,能使代理更好地从错误中恢复。