摘要
大规模评估语言模型智能体时,越来越依赖于使用第二个语言模型作为自动评判者,因为黄金信号——即可执行的环境奖励——在部署时往往代价高昂、速度缓慢或不可用。这样的评判者是一种无奖励代理,其价值取决于它是否值得信赖,然而现有的评判者要么像 G-Eval 那样手写评分标准,要么对评判者的权重进行微调,而这两种方法都倾向于将流畅但未成功的轨迹视为成功。我们转而从一小部分带有真实标签的轨迹中归纳出智能体评判标准的文本,将其锚定在真实结果上。我们提出了 RubricForge,它通过针对带标签轨迹的反思性演化来优化评判标准,以最大化与环境奖励的一致性,然后将其冻结,并在一次模型调用中应用于保留轨迹,无需访问环境。优化后的产物是可读的文本,因此每个评判结果都可归因于具体的标准。使用同一个冻结的 7B 模型同时作为智能体和评判者,在 tau-bench(从 220 次轨迹中抽取的 173 条带标签轨迹)和 WebShop(160 条)上,主要提升在于忠实度而非原始一致性。与通用 G-Eval 评判者相比,优势在统计上并不显著(McNemar p = 0.248),而绝对分数校准略微偏向通用评判者(|误差| 差异 -0.048,p = 2x10^-4)。然而,RubricForge 对失败轨迹的过度信任率大约降低了一半(在 tau-bench 上,虚假通过率为 0.115 对比 0.173,捕捉到三次过度信任并零次逆转),并且对 WebShop 评分结果的排序更为忠实(Spearman 相关系数 0.410 对比 0.370)。对于无奖励评估器而言,虚假通过率而非总体一致性才是与部署相关的关键指标,因为虚假通过会发布一个有缺陷的智能体,而虚假失败仅仅意味着一次重试的成本。