← 返回日报
🌐 机器翻译 · DeepSeek · ArXiv

FinProBench: Evaluating Financial AI Agents with Role-Grounded Rubrics Derived from Professional Deliverables


摘要

评估金融AI智能体需要与真实专业工作相符的标准。现有的评分标准(rubric)方法通常从任务提示或模型输出中推导标准,忽略了仅在从业者交付物中可见的隐性标准。我们引入了 FinProBench——一个面向专业金融任务的基准测试,以及 角色锚定评分标准构建(Role-Grounded Rubric Construction, RGRC)——一个可复用的流水线,从同一角色的从业者所产出的交付物中推导评分标准。RGRC 包含四个阶段:交付物收集、能力提取、评分标准综合与验证。其评分标准能够捕捉隐性标准、区分质量层级,并在同一角色内的任务间迁移。在分析之前,我们根据交付物类型将 57 个职业划分为 30 个先验丰富的常规角色和 27 个先验稀疏的专业化角色。在所有角色中,仅使用提示(Prompt-only)在常规角色上几乎与 RGRC 持平(89.2% 对比 90.7%),但在专业化角色上,RGRC 显著优于仅提示方法(99.1% 对比 78.0%)。这一差异表明,当惯例在模型先验中得到充分体现时,提示工程可以近似评分标准;而对于超出这些先验的标准,专业锚定则至关重要。FinProBench 由覆盖 57 个职业、8 个金融子行业和 161 种交付物类型的 1,723 份精选交付物构建而成,并发布了包含 20 个完整任务的初始评估集,涵盖 7 个子行业的 20 个角色。在使用异构 LLM 评审者和角色级评分标准的情况下,人类交付物平均排名第一(73.7 对比 70.3、70.2 和 69.6,满分 100),而所有四个系统均显示出重叠的 95% 置信区间和互补优势。在角色级别复用评分标准,相较于从头编写每个评分标准,估计可将每项任务的构建工作量减少 6.7 倍。

📖 阅读原文 →